# Modelos de lenguaje grandes
## Large Language Models (LLM)

Este documento describe los LLMs soportados por la plataforma IAE de Induxsoft, se mantiene continuamente actualizado.

---
## Listado de modelos por precio

Ordenado de los más económicos a los más avanzados y costosos. Use esta lista para encontrar el modelo ideal costo-beneficio para su caso de uso en particular.

### 🟢 Económico
- Mistral Nemo-Instruct-2407
- Google gemma-3-12b-it
- Mistral Small-24B-Instruct-2501
- NVIDIA Nemotron-3-Nano-30B-A3B
- Microsoft phi-4
- Google gemma-3-27b-it
- Google gemma-4-26B-A4B-it
- Meta Llama-4-Scout-17B-16E-Instruct
- Qwen3-14B
- Google gemma-4-31B-it-turbo
- Google gemma-4-31B-it
- NVIDIA Nemotron-3-Super-120B-A12B
- Mistral Small-3.2-24B-Instruct-2506
- Meta Llama-4-Maverick-17B-128E-Instruct-FP8
- Qwen3.6-35B-A3B

### 🟡 Intermedio
- DeepSeek Chat 4
- DeepSeek Pro 4
- OpenAI GPT 5.4 Nano
- NVIDIA Nemotron-3-Nano-Omni-30B-A3B-Reasoning
- Google Gemini 3.1 Flash Lite
- Google Gemini Flash 2.5
- Qwen2.5-72B-Instruct
- OpenAI GPT 5 Mini
- OpenAI GPT 5.2 Mini
- OpenAI GPT 4.1 Mini
- Google Gemini Flash 3
- Xiaomi MiMo-V2.5
- Moonshot AI Kimi-K2.5
- Qwen3.5-397B-A17B
- NVIDIA Nemotron-3-Ultra-550B-A55B
- OpenAI GPT 5.4 Mini
- Moonshot AI Kimi-K2.6
- Anthropic Claude Haiku 4.5

### 🔴 Premium
- Xiaomi MiMo-V2.5-Pro
- NVIDIA Nemotron-3-Ultra-550B-A55B-BF16
- OpenAI GPT 5
- OpenAI GPT 4.1
- OpenAI GPT 5.2
- Google Gemini Pro 2.5
- OpenAI GPT 5.4
- Google Gemini Pro 3
- Anthropic Claude Sonnet 4.6
- Anthropic Claude Opus 4.6

---

## Descripción por familias

Use esta guía rápida para conocer un poco más acerca de cada modelo y determinar su idoneidad para su propósito específico.

### Familia Anthropic Claude

#### Anthropic Claude Haiku 4.5
Es el modelo más compacto, rápido y eficiente de la serie Claude 4.5. Está diseñado específicamente para tareas que requieren respuestas inmediatas con un consumo mínimo de recursos computacionales, manteniendo una comprensión contextual sorprendentemente robusta para su escala.
* **Ventajas:** Velocidad de procesamiento ultrarrápida, latencia mínima y excelente manejo de instrucciones directas. Ventana de contexto amplia heredada de la arquitectura Claude 4, adecuada para tareas conversacionales y de extracción.
* **Desventajas:** Capacidades limitadas en razonamiento matemático complejo, lógica de programación avanzada o análisis profundo de documentos extensos.
* **Usos recomendados:** Automatización de flujos de trabajo de alta frecuencia, atención al cliente en tiempo real (chatbots), clasificación masiva de datos y tareas simples de extracción de texto.

#### Anthropic Claude Sonnet 4.6
El balance definitivo entre inteligencia computacional y eficiencia operativa. Esta versión refina el procesamiento de lenguaje natural y el uso de herramientas externas (Tool Use / Agentic AI), convirtiéndose en el motor preferido para la integración de agentes automatizados en entornos corporativos.
* **Ventajas:** Extraordinario rendimiento en generación de código, comprensión y síntesis de contextos masivos. Habilidad superior para ejecutar flujos de trabajo semánticos, encadenar llamadas a herramientas y seguir instrucciones complejas paso a paso.
* **Desventajas:** Mayor demanda de infraestructura en comparación con las variantes "Flash" o "Mini" de competidores directos; no es la opción más eficiente para tareas triviales de alto volumen.
* **Usos recomendados:** Desarrollo de software guiado por IA, sistemas RAG (Retrieval-Augmented Generation) de nivel empresarial, análisis de contratos legales y orquestación de agentes autónomos de negocio.

#### Anthropic Claude Opus 4.6
El modelo de frontera de Anthropic diseñado para la excelencia cognitiva. Destaca en la resolución de problemas multidimensionales, análisis de datos de alta complejidad y razonamiento conceptual abstracto que desborda las capacidades de los modelos estándar.
* **Ventajas:** Máxima precisión intelectual, reducción drástica de alucinaciones en conjuntos de datos estructurados y una comprensión profunda de matices lingüísticos técnicos.
* **Desventajas:** Latencia de respuesta considerablemente más alta, lo que limita su viabilidad para automatizaciones masivas en tiempo real.
* **Usos recomendados:** Investigación científica avanzada, análisis predictivo financiero de alta complejidad, consultoría estratégica y auditoría profunda de arquitecturas de software.

---

### Familia OpenAI GPT

#### OpenAI GPT 5.4
El modelo insignia de la generación actual de OpenAI, caracterizado por capacidades de razonamiento nativo multimodal y una integración fluida de entornos de ejecución de código integrados. Incorpora una sólida optimización para interactuar de forma predictiva con aplicaciones y APIs de terceros.
* **Ventajas:** Excelente versatilidad multimodal (texto, audio, visión), velocidad competitiva para su escala y un ecosistema maduro de herramientas integradas para la ejecución segura de scripts en entornos de pruebas (sandboxing).
* **Desventajas:** Políticas restrictivas de seguridad que en ocasiones generan falsos positivos en la denegación de tareas legítimas.
* **Usos recomendados:** Creación de soluciones empresariales omnicanal, asistentes analíticos interactivos y automatización de procesos de ingeniería compleja.

#### OpenAI GPT 5.4 Mini
La versión compacta optimizada para eficiencia de la serie 5.4. Ofrece un rendimiento equilibrado que retiene gran parte de la agilidad conversacional e inteligencia lógica de su hermano mayor, reduciendo significativamente el costo de cómputo por inferencia.
* **Ventajas:** Latencia reducida, alta disponibilidad y retención sobresaliente de la lógica multimodal básica.
* **Desventajas:** Menor capacidad para concatenar múltiples llamadas a herramientas complejas sin perder la coherencia del estado del agente.
* **Usos recomendados:** Aplicaciones móviles impulsadas por IA, filtrado preliminar de leads, traducción semántica automatizada y soporte operativo diario.

#### OpenAI GPT 5.4 Nano
Diseñado para la ejecución en el borde (edge computing) y arquitecturas que requieren procesamiento masivo con presupuestos de cómputo reducidos. Es la iteración más ligera de OpenAI, priorizando la velocidad pura sobre el razonamiento abstracto.
* **Ventajas:** Velocidad de generación instantánea, huella computacional mínima y adaptabilidad para despliegues ligeros o embebidos.
* **Desventajas:** Ventana de contexto real reducida y propensión a simplificar en exceso problemas que requieran matices lógicos.
* **Usos recomendados:** Autocompletado de texto en tiempo real, micro-clasificadores de correo electrónico y validación rápida de entradas sintácticas.

#### OpenAI GPT 5.2
Un modelo de transición consolidado que destaca por su estabilidad operativa y previsibilidad de comportamiento. Habiendo recibido múltiples capas de optimización post-lanzamiento, ofrece una ejecución confiable libre de las fluctuaciones de comportamiento comunes en versiones más recientes.
* **Ventajas:** Altamente confiable, comportamiento documentado y consistente, ideal para despliegues a largo plazo donde la estabilidad prima sobre la novedad.
* **Desventajas:** No cuenta con las últimas optimizaciones en el procesamiento de tokens multimodales concurrentes presentes en la serie 5.4.
* **Usos recomendados:** Automatización de flujos de facturación, sincronización e interpretación de documentos fiscales (CFDIs) y sistemas CRM legados.

#### OpenAI GPT 5
El modelo fundacional de la arquitectura GPT-5. Representó el salto cuántico en capacidades de auto-corrección y planificación de tareas lógicas a largo plazo, sirviendo como la infraestructura base para los desarrollos iterativos posteriores.
* **Ventajas:** Capacidad nativa de razonamiento inductivo y deductivo superior a la serie GPT-4, con excelente desempeño en pruebas de lógica estándar.
* **Desventajas:** Consumo energético y de infraestructura elevado comparado con las optimizaciones de sub-versiones posteriores.
* **Usos recomendados:** Planificación estratégica de sistemas lógicos, generación de contenidos extensos complejos y modelado de datos inicial.

#### OpenAI GPT 5 Mini
La optimización de eficiencia correspondiente al modelo base de quinta generación. Introdujo por primera vez en su categoría métricas de rendimiento ágiles sin comprometer la capacidad de procesamiento de código.
* **Ventajas:** Excelente velocidad de respuesta y huella de cómputo reducida frente al modelo base GPT-5.
* **Desventajas:** Su rendimiento lógico ha sido superado por la línea 5.4 Mini.
* **Usos recomendados:** Generación automatizada de respuestas en CRM, micro-scripts de integración y soporte técnico básico.

#### OpenAI GPT 4.1
Una de las iteraciones más estables del ecosistema de OpenAI. Este modelo perfeccionó las deficiencias lógicas originales de GPT-4, consolidándose como un estándar de la industria gracias a su predictibilidad extrema.
* **Ventajas:** Sólida consistencia sintáctica, comportamiento predecible y compatibilidad perfecta con librerías heredadas de agentes.
* **Desventajas:** Velocidad inferior a los estándares actuales y limitaciones en el tamaño efectivo de la ventana de contexto si se compara con las soluciones modernas.
* **Usos recomendados:** Mantenimiento de software existente, procesamiento estructurado de logs y flujos de trabajo tradicionales que requieren nula variación en los outputs.

#### OpenAI GPT 4.1 Mini
La variante optimizada de la clásica arquitectura 4.1. Fue diseñada para permitir la migración masiva de flujos basados en texto sencillo hacia entornos de producción viables a gran escala.
* **Ventajas:** Estabilidad operativa y robustez comprobada para procesamiento puramente textual.
* **Desventajas:** Carece de habilidades multimodales avanzadas y sufre en tareas que involucran lógica condicional compleja anidada.
* **Usos recomendados:** Tareas parametrizadas, resúmenes de interacciones de texto cortas y generación de borradores sencillos.

---

### Familia Google Gemini

#### Google Gemini Pro 2.5
Un modelo de alto rendimiento diseñado para el análisis multimodal avanzado y el manejo de grandes volúmenes de información corporativa. Destaca por su agilidad estructural en tareas lógicas híbridas que combinan visión de computadora y análisis de texto estructurado.
* **Ventajas:** Excelente integración con entornos Cloud, manejo fluido de variables multimodales complejas y una ventana de contexto amplia con recuperación precisa de datos.
* **Desventajas:** Requiere una gestión cuidadosa del tamaño del contexto en ejecuciones de bucle continuo para evitar degradación de rendimiento.
* **Usos recomendados:** Análisis de tableros de control complejos, procesamiento de bases de datos enriquecidas con imágenes y automatización de marketing digital multicanal.

#### Google Gemini Flash 2.5
La propuesta de Google orientada a velocidad extrema y alta disponibilidad. Su arquitectura ligera permite procesar millones de peticiones diarias con tiempos de respuesta reducidos a milisegundos, convirtiéndolo en un rival directo para las variantes eficientes del mercado.
* **Ventajas:** Rendimiento sobresaliente, latencia óptima para interacciones en directo y procesamiento multimodal ágil.
* **Desventajas:** Puede presentar ligeras inconsistencias lógicas en tareas de razonamiento deductivo complejo.
* **Usos recomendados:** Análisis en tiempo real de transmisiones de video, moderación automatizada de contenido a gran escala y asistentes de chat interactivos de respuesta rápida.

#### Google Gemini Pro 3
La evolución masiva en la frontera de Google DeepMind. Este modelo redefine la escala del contexto operativo con una ventana nativa masiva que permite cargar bibliotecas completas de código o documentación corporativa sin perder precisión analítica.
* **Ventajas:** Ventana de contexto líder en la industria, recuperación semántica casi perfecta a lo largo de todo el espectro de datos introducidos y robustas capacidades en el desarrollo de herramientas para investigación autónoma web.
* **Desventajas:** Requiere una infraestructura API robusta para gestionar adecuadamente los tiempos de carga asociados a contextos de gran tamaño.
* **Usos recomendados:** Auditoría integral de plataformas ERP/CRM de miles de líneas de código, minería de datos en repositorios históricos masivos y desarrollo de agentes avanzados de investigación semántica.

#### Google Gemini Flash 3
La generación de modelos eficientes de Google, beneficiada directamente de las mejoras arquitectónicas de la serie 3. Mantiene la velocidad característica de la línea Flash pero elevando sustancialmente el techo lógico y la precisión semántica.
* **Ventajas:** Combinación inigualable de velocidad y una ventana de contexto de alta precisión ideal para flujos de trabajo continuos.
* **Desventajas:** Aunque mejorado, sigue estando optimizado para velocidad, por lo que tareas de razonamiento puro super-crítico deben delegarse a la versión Pro.
* **Usos recomendados:** Orquestación masiva de micro-agentes de respuesta, análisis de logs de servidores en tiempo real y procesamiento de flujos informativos continuos.

#### Google gemma-4-31B-it (incluyendo sub-versiones Turbo y 26B-A4B-it)
Esta subfamilia de modelos abiertos de Google representa un hito en la eficiencia open-source. La versión Turbo agiliza los tiempos de inferencia mediante cuantizaciones optimizadas de fábrica, mientras que la 26B-A4B utiliza destilación de conocimiento para operar en hardware comercial con ventanas masivas de 256k tokens.
* **Ventajas:** Acceso abierto y despliegue local muy potente, ventana de contexto sobresaliente (256k) para su tamaño de parámetros y posibilidad de fine-tuning sobre infraestructura propia.
* **Desventajas:** Menor consistencia conversacional en idiomas secundarios en comparación con los servicios API cerrados de escala comercial completa.
* **Usos recomendados:** Despliegue de LLMs locales en servidores privados empresariales, procesamiento masivo de datos confidenciales y automatización de procesos internos.

#### Google gemma-3-12b-it (incluyendo versión 27b-it)
Modelos abiertos altamente compactos e instruidos de la generación intermedia de Google. El modelo de 12B es un prodigio de la relación rendimiento/tamaño, ideal para arquitecturas de hardware restringidas o desarrollo periférico.
* **Ventajas:** Extremadamente ligeros, consumo de VRAM minúsculo, baja latencia y ventana de contexto de 128k muy competitiva.
* **Desventajas:** Su ventana y capacidad matemática se ven reducidas ante las capacidades avanzadas de la arquitectura gemma-4.
* **Usos recomendados:** Ejecución de IA local en estaciones de trabajo de desarrolladores, asistentes integrados en aplicaciones de escritorio y micro-agentes especializados.

---

### Familia DeepSeek

#### DeepSeek Chat 4
El modelo conversacional avanzado de DeepSeek, construido sobre una arquitectura de Mezcla de Expertos (MoE) altamente eficiente. Ofrece una destreza lingüística y de programación sobresaliente, compitiendo directamente con modelos de referencia de la industria.
* **Ventajas:** Capacidades avanzadas de codificación en múltiples lenguajes de programación, excelente comprensión semántica y arquitectura MoE que activa solo un subconjunto de parámetros por inferencia.
* **Desventajas:** Infraestructura de servidores que en momentos de alta demanda global puede experimentar variaciones menores en la disponibilidad o latencia de la API.
* **Usos recomendados:** Asistencia en la programación diaria de software, generación de documentación técnica, traducción compleja y desarrollo de chatbots inteligentes.

#### DeepSeek Pro 4
La versión orientada al sector profesional y despliegues empresariales de DeepSeek. Este modelo maximiza el razonamiento analítico, la coherencia lógica en la resolución de problemas duros y está optimizado para responder con precisión quirúrgica en entornos de desarrollo y analítica de datos.
* **Ventajas:** Máxima precisión en tareas estructuradas, razonamiento lógico de nivel matemático superior y baja tasa de alucinación en entornos estructurados.
* **Desventajas:** Requiere una configuración fina y estructuración de prompts precisa para extraer su máximo potencial en flujos autónomos de trabajo.
* **Usos recomendados:** Motores internos de RAG financiero y legal, arquitecturas complejas de toma de decisiones empresariales, automatización avanzada de bases de datos y herramientas de desarrollo backend sofisticadas.

---

### Familia Microsoft

#### Microsoft phi-4
El modelo ultra-compacto de Microsoft enfocado en la excelencia lógica y razonamiento de alta densidad en parámetros pequeños. Con una ventana de contexto optimizada de 16k tokens, procesa instrucciones con un consumo mínimo de recursos computacionales.
* **Ventajas:** Rendimiento en razonamiento matemático que rivaliza con modelos que lo triplican en tamaño de parámetros, ideal para despliegues con restricciones de hardware.
* **Desventajas:** Ventana de contexto muy limitada (16k) para análisis de documentos de gran volumen.
* **Usos recomendados:** Lógica matemática integrada, evaluación sintáctica de código, y tareas autónomas en dispositivos locales o IoT.

---

### Familia Meta

#### Meta Llama-4-Maverick-17B-128E-Instruct-FP8
Variante avanzada de la arquitectura de código abierto Llama-4 optimizada para su ejecución ágil en formatos FP8 y arquitecturas MoE (Mezcla de Expertos), contando con 128 expertos.
* **Ventajas:** Ventana de contexto masiva de hasta 1M de tokens (1024k), permitiendo un procesamiento integral de archivos históricos enteros con una huella de memoria reducida gracias a la cuantización FP8.
* **Desventajas:** La cuantización FP8 puede inducir ligeras imprecisiones semánticas en la generación de textos sumamente formales o creativos.
* **Usos recomendados:** Procesamiento masivo de repositorios de código abiertos, análisis de logs de red masivos e indexación RAG de baja latencia.

#### Meta Llama-4-Scout-17B-16E-Instruct
Una iteración optimizada para tareas de exploración de datos y directrices secuenciales rápidas dentro de la familia Llama-4, balanceando velocidad de inferencia y tamaño contextual mediante una configuración de 16 expertos.
* **Ventajas:** Ventana de contexto de 320k muy versátil y velocidad de respuesta incrementada mediante su configuración MoE de 16 expertos.
* **Desventajas:** Menor capacidad de retención de contexto ultra-profundo comparado con la variante Maverick.
* **Usos recomendados:** Micro-agentes de ruteo de información, extracción de entidades en documentos de tamaño mediano y asistentes de programación locales.

---

### Familia Mistral AI

#### Mistral AI Mistral-Nemo-Instruct-2407
Modelo de escala pequeña desarrollado en colaboración entre Mistral AI y NVIDIA, enfocado en optimizar el rendimiento conversacional y el multilingüismo con un tamaño muy contenido (12B de parámetros).
* **Ventajas:** Excelente manejo del español y otros idiomas europeos, y ventana de contexto de 128k.
* **Desventajas:** Puede sufrir de alucinaciones menores en lógica matemática compleja o condicionales anidados masivos.
* **Usos recomendados:** Tareas de traducción ágil, estructuración básica de texto y soporte conversacional parametrizado de alta frecuencia.

#### Mistral AI Mistral-Small-24B-Instruct-2501
El modelo intermedio para empresas de Mistral lanzado a inicios de 2025, refinado para seguir instrucciones complejas y estructurar datos nativamente.
* **Ventajas:** Gran balance en el procesamiento de formatos JSON nativos y alta fidelidad al prompt del sistema, adecuado para function calling.
* **Desventajas:** Ventana de contexto reducida a solo 32k en esta versión inicial.
* **Usos recomendados:** Motores de automatización de APIs de backend, parseo de logs estructurados y agentes de validación sintáctica.

#### Mistral AI Mistral-Small-3.2-24B-Instruct-2506
La actualización de mediados de año de la arquitectura de 24B, diseñada para subsanar los límites contextuales y lógicos de su predecesor inmediato.
* **Ventajas:** Ventana de contexto expandida drásticamente a 125k y una mejora sustancial en capacidades de razonamiento deductivo y seguimiento de instrucciones.
* **Desventajas:** Requiere mayor cómputo en la generación secuencial frente a la versión 2501.
* **Usos recomendados:** Flujos RAG empresariales multilingües, procesamiento de contratos medianos y orquestación de agentes corporativos.

---

### Familia Xiaomi

#### Xiaomi MiMo-V2.5
La incursión base de Xiaomi en modelos comerciales basados en Mezcla de Expertos, orientada al procesamiento concurrente con un esquema de optimización de caché de contexto.
* **Ventajas:** Ventana de contexto de 256k con un mecanismo de almacenamiento en caché de prefijos (cached input) que acelera solicitudes repetidas con prompts del sistema fijos.
* **Desventajas:** Menor adaptabilidad en prompts sin estructura recurrente, donde el beneficio del caché no se aprovecha.
* **Usos recomendados:** Aplicaciones conversacionales continuas con prompts del sistema idénticos y fijos de gran tamaño.

#### Xiaomi MiMo-V2.5-Pro
La versión de nivel empresarial y alta fidelidad contextual de la arquitectura MiMo, escalando parámetros e inteligencia lógica respecto a la versión base.
* **Ventajas:** Ventana de contexto masiva de 1M de tokens (1024k) y un sistema de indexación por caché persistente para sesiones extensas.
* **Desventajas:** Elevada huella computacional en solicitudes independientes y dinámicas que no se benefician del caché.
* **Usos recomendados:** Análisis de código persistente en repositorios integrales corporativos y asistentes ejecutivos que retienen historiales de chat masivos.

---

### Familia Moonshot AI

#### Moonshot AI Kimi-K2.5
Modelo enfocado en la persistencia conversacional prolongada y la optimización de lectura de documentos masivos a través del tiempo, mediante un sistema de indexación contextual de 256k tokens.
* **Ventajas:** Excelente sistema de indexación contextual y ventana de 256k estructurada para prompts estáticos de gran tamaño.
* **Desventajas:** Mayor latencia en la generación de textos extensos frente a su ventana de entrada.
* **Usos recomendados:** Lectura recurrente de bases de datos estáticas, asistentes de investigación y sistemas de minería de texto.

#### Moonshot AI Kimi-K2.6
La iteración más avanzada de la serie Kimi, mejorando sustancialmente el procesamiento lógico de código informático y la robustez analítica general respecto a K2.5.
* **Ventajas:** Razonamiento secuencial mejorado y retención de información consistente en cualquier punto de su ventana de 256k.
* **Desventajas:** Requiere mayor tiempo de procesamiento inicial en contextos limpios (sin caché previo).
* **Usos recomendados:** Auditoría técnica de arquitecturas de software, análisis financiero automatizado y soporte técnico de segundo nivel.

---

### Familia NVIDIA Nemotron

#### NVIDIA Nemotron-3-Super-120B-A12B
Modelo denso de escala intermedia optimizado para maximizar el paralelismo y la velocidad de ejecución en centros de datos equipados con hardware Tensor Core, con 120B de parámetros totales y 12B activos.
* **Ventajas:** Latencia de procesamiento excepcionalmente baja para un modelo de su escala de parámetros y una ventana de contexto de 256k.
* **Desventajas:** Consume una cantidad sustancial de VRAM para despliegues locales o privados.
* **Usos recomendados:** Pipelines de procesamiento masivo en tiempo real y entornos de analítica predictiva de datos masivos.

#### NVIDIA Nemotron-3-Ultra-550B-A55B
El modelo de mayor escala de la suite de NVIDIA, configurado como uno de los modelos abiertos más masivos del mercado (550B de parámetros totales, 55B activos) para un razonamiento hiper-complejo.
* **Ventajas:** Capacidad de inferencia lógica profunda a nivel científico y matemático de frontera, con ventana de contexto de 256k.
* **Desventajas:** Infraestructura requerida sumamente compleja si se desea correr localmente, dado el volumen total de parámetros.
* **Usos recomendados:** Modelado predictivo avanzado, traducción técnica de grado industrial y resolución de problemas algorítmicos complejos.

#### NVIDIA Nemotron-3-Ultra-550B-A55B-BF16
La versión sin compresión ni cuantización (precisión nativa bfloat16) del modelo insignia de NVIDIA, diseñada para escenarios donde el error analítico debe minimizarse al máximo.
* **Ventajas:** Fidelidad intelectual máxima, reducción significativa de alucinaciones y precisión matemática quirúrgica en su ventana de 256k.
* **Desventajas:** Altas demandas estructurales y energéticas por el tamaño bruto de la arquitectura sin cuantizar.
* **Usos recomendados:** Sistemas de misión crítica, validación aeroespacial, automatización de código crítico y finanzas corporativas reguladas.

#### NVIDIA Nemotron-3-Nano-Omni-30B-A3B-Reasoning
Modelo compacto especializado en la ejecución de pasos de pensamiento lógico interno (reasoning / chain-of-thought) antes de emitir una respuesta textual final.
* **Ventajas:** Habilidades de auto-corrección integradas en un tamaño de solo 30B de parámetros totales (3B activos), operando con una ventana ágil de 256k.
* **Desventajas:** Velocidad de respuesta sutilmente menor debido al tiempo requerido para procesar el "pensamiento interno" antes de la respuesta final.
* **Usos recomendados:** Agentes autónomos de toma de decisiones complejas, depuración paso a paso de código de software y asistentes de investigación semántica.

#### NVIDIA Nemotron-3-Nano-30B-A3B
La variante estándar de la serie de 30B (3B activos), optimizada para tareas generales directas sin la sobrecarga del proceso extendido de razonamiento.
* **Ventajas:** Velocidad de inferencia instantánea y ventana de contexto de 256k.
* **Desventajas:** Limitado en tareas que requieran una concatenación lógica abstracta de alta complejidad.
* **Usos recomendados:** Clasificación masiva de correos, micro-servicios de integración web y bots conversacionales de primera línea.

---

### Familia Qwen (Alibaba)

#### Qwen Qwen3.6-35B-A3B
Modelo abierto de última generación optimizado con la arquitectura MoE de Alibaba (35B totales, 3B activos), balanceando velocidad operativa con precisión matemática.
* **Ventajas:** Rendimiento sobresaliente en la generación de código backend y lógica de consultas estructuradas a bases de datos, con ventana de contexto de 256k.
* **Desventajas:** Mayor consumo de cómputo en la capa de salida de tokens frente a modelos densos equivalentes.
* **Usos recomendados:** Automatización de consultas e integraciones de bases de datos relacionales, y asistentes de codificación de nivel intermedio.

#### Qwen Qwen3.5-397B-A17B
Uno de los modelos de mezcla de expertos abiertos más masivos e inteligentes del mundo (397B totales, 17B activos), diseñado por Alibaba para competir directamente con arquitecturas propietarias cerradas.
* **Ventajas:** Inteligencia general de nivel superior, soporte multilingüe internacional avanzado y ventana de contexto de 256k.
* **Desventajas:** Los requisitos de hardware para su despliegue local privado son prohibitivos para infraestructuras convencionales.
* **Usos recomendados:** Enterprise RAG global, traducción técnica avanzada multipropósito y orquestación centralizada de agentes complejos de negocio.

#### Qwen Qwen2.5-72B-Instruct
Modelo heredado altamente estable y maduro, consolidado en la industria por su consistencia operativa estructural y exactitud en el seguimiento de formatos rígidos.
* **Ventajas:** Comportamiento predecible y excelente manejo sintáctico de instrucciones en español.
* **Desventajas:** Ventana de contexto limitada a solo 32k frente a las nuevas generaciones que estandarizan 256k o más.
* **Usos recomendados:** Generación parametrizada de contratos, pipelines tradicionales de procesamiento de texto y mantenimiento de agentes legados.

#### Qwen Qwen3-14B
El modelo compacto instruido de la serie base, diseñado para integraciones ligeras que requieran un procesamiento contextual acotado pero preciso.
* **Ventajas:** Agilidad de respuesta en servidores de baja especificación y bajo consumo de recursos.
* **Desventajas:** Ventana de contexto reducida a 40k, lo que limita su uso con archivos extensos.
* **Usos recomendados:** Tareas escolares, validación rápida de entradas de formularios, micro-bots de chat y soporte operativo de baja complejidad.