Alibaba Cloud Model Studio · API · 1.000.000 tokens de contexto · 2026-09-20
Fuente oficial y disponibilidad ↗LLM & SLM
Cómo elegir un modelo de lenguaje grande o pequeño
Compara modelos, software de inferencia y requisitos de memoria según tu tarea, con resultados publicados y guías prácticas.
Un modelo de lenguaje en una computadora o servidor propio puede servir para conversar, programar, traducir o responder a partir de documentos. La confidencialidad de los datos, el control de las dependencias externas y los costos son motivos habituales para considerar un despliegue local. La variedad de modelos y métodos de ejecución complica la elección: ¿qué modelo basta para la tarea, qué se puede ejecutar con el hardware disponible y cuándo aporta una mejora útil ampliar la infraestructura?
Esta guía reúne esas decisiones. Sus tablas interactivas comparan modelos de lenguaje pequeños y grandes, modelos especializados, requisitos de hardware y software de ejecución, con enlaces a las fuentes. Los artículos explican las ventajas y limitaciones prácticas de cada enfoque y relacionan la tarea y la calidad necesaria con los recursos y el presupuesto para prestarla.

¿Por dónde empezar?
Abre una tabla para comparar opciones; lee los artículos de cada ruta para entender los conceptos y las decisiones.
Guía interactiva
Empiece con las preguntas principales; añada después detalles para afinar el plan.
Una vez definidos el modelo y la memoria necesaria, compare las GPU y los servidores adecuados.
Fuentes y alcance
Las especificaciones proceden de fichas y configuraciones de modelos y de documentación de versiones de software. Los resultados de calidad y velocidad conservan su autor y las condiciones de la fuente; este sitio no ha ejecutado pruebas independientes de los modelos.
Los candidatos cubren funciones distintas: generación de texto, programación, imágenes y documentos, embeddings y reranking. El tamaño y la etiqueta multilingüe no sustituyen la evidencia de la tarea y el idioma elegidos.
La tabla de hardware y la mayoría de los informes de velocidad actuales se centran en NVIDIA. La ejecución en CPU, Apple Silicon y AMD depende del software y del backend; faltan resultados en condiciones equivalentes para clasificar todas estas plataformas por velocidad. Opciones de software y hardware compatible
Las estimaciones de memoria suman los bytes del archivo de pesos, la caché KV y una reserva por dispositivo. La fórmula convencional de KV no se aplica a arquitecturas híbridas, MLA o desconocidas. Los supuestos figuran en la sección de memoria.
Revisión de datos: · Comunicar una corrección mediante los enlaces de contacto del currículum
Catálogo de modelos
Modelos con pesos descargables: tamaño, arquitectura, contexto y licencia. No se incluyen servicios exclusivamente API.
Prueba de la columna de resultados: MIRACL · nDCG@10 · es
Esta selección se aplica a las columnas de resultados. Las condiciones figuran en los detalles de cada modelo.
Resultados agrupados por prueba ←Filtros avanzados 17 controles
Comparación de filas y condiciones
Regla de comparación: Se pueden mostrar datos juntos; los cálculos requieren unidades compatibles y atribución a versiones concretas.
Modelos disponibles por API · 4
No se verificaron pesos instalables en esta revisión; estas versiones no se recomiendan para instalación local.
Alibaba Cloud Model Studio · API · 1.000.000 tokens de contexto · 2026-09-20
Fuente oficial y disponibilidad ↗Alibaba Cloud Model Studio · API · 8192 tokens de entrada · 2026-09-20
Fuente oficial y disponibilidad ↗Alibaba Cloud Model Studio · API · 8192 tokens de entrada · 2026-09-20
Fuente oficial y disponibilidad ↗| Comparar | Detalles | Entrada → salida | Usos principales | Licencia | Descargar y ejecutar | ||||
|---|---|---|---|---|---|---|---|---|---|
| BGE · BAAI | aproximadamente 0,569 mil millones · Denso | Texto ← Vector | 8192 tokens | Recuperación híbrida de documentos en RAG | MIT ↗ | ||||
| BGE · BAAI | aproximadamente 0,568 mil millones · Denso | Texto ← Datos estructurados | 8192 tokens | Reordenar documentos recuperados | Apache-2.0 ↗ | ||||
| Aya / Cohere · Cohere Labs | aproximadamente 32 mil millones · Denso | Texto ← Texto | 131.072 tokens | Redacción y chat multilingües con documentos largos | CC-BY-NC-4.0 + Cohere Acceptable Use Policy ↗ Uso comercial sujeto a licencia | ||||
| Aya / Cohere · Cohere Labs | aproximadamente 8 mil millones · Denso | Texto ← Texto | 8192 tokens | Asistente de redacción y reescritura multilingüe | CC-BY-NC-4.0 + Cohere Acceptable Use Policy ↗ Uso comercial sujeto a licencia | ||||
| Aya / Cohere · Cohere Labs | aproximadamente 3,35 mil millones · Denso | Texto ← Texto | 8192 tokens | Chat local en varios idiomas | CC-BY-NC-4.0 + Cohere Acceptable Use Policy ↗ Uso comercial sujeto a licencia | ||||
| SmolLM · Hugging Face | aproximadamente 1,7 mil millones · Denso | Texto ← Texto | 8192 tokens | Crear un prototipo de asistente pequeño con llamadas a funciones | Apache-2.0 ↗ | ||||
| SmolLM · Hugging Face | aproximadamente 0,135 mil millones · Denso | Texto ← Texto | 8192 tokens | Explorar el seguimiento de instrucciones con un modelo muy pequeño | Apache-2.0 ↗ | ||||
| SmolLM · Hugging Face | aproximadamente 0,36 mil millones · Denso | Texto ← Texto | 8192 tokens | Reescritura y resumen de textos cortos | Apache-2.0 ↗ | ||||
| SmolLM · Hugging Face | aproximadamente 3 mil millones · Denso | Texto ← Texto | 65.536 tokens Hasta 131.072 tokens con Configurar YaRN y aumentar max_position_embeddings | Asistente pequeño con modo de razonamiento seleccionable | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 0,6 mil millones · Denso | Texto ← Texto | 32.768 tokens | Crear un prototipo de chat con el menor Qwen3 | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 1,7 mil millones · Denso | Texto ← Texto | 32.768 tokens | Asistente de texto pequeño con control del razonamiento | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 14,8 mil millones · Denso | Texto ← Texto | 32.768 tokens Hasta 131.072 tokens con Configuración de YaRN | Generación y análisis de texto con Qwen3 denso | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 30,5 mil millones · 3,3 mil millones activos · Mezcla de expertos (MoE) | Texto ← Texto | 32.768 tokens Hasta 131.072 tokens con Configuración de YaRN | Asistente con herramientas y arquitectura MoE | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 32,8 mil millones · Denso | Texto ← Texto | 32.768 tokens Hasta 131.072 tokens con Configuración de YaRN | Análisis por etapas con un Qwen3 denso mayor | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 4 mil millones · Denso | Texto ← Texto | 32.768 tokens Hasta 131.072 tokens con Configuración de YaRN | Asistente general de cuatro mil millones de parámetros | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 8,2 mil millones · Denso | Texto ← Texto | 32.768 tokens Hasta 131.072 tokens con Configuración de YaRN | Chat y tareas de texto con control del razonamiento | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 30,5 mil millones · 3,3 mil millones activos · Mezcla de expertos (MoE) | Texto ← Texto | 262.144 tokens Hasta 1.048.576 tokens con Configuración de YaRN | Edición de repositorios con un asistente que usa herramientas | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 0,6 mil millones · Denso | Texto ← Vector | 32.768 tokens | Recuperación vectorial con el menor Qwen3 Embedding | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 4 mil millones · Denso | Texto ← Vector | 32.768 tokens | Indexación multilingüe con vectores ajustables | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 8 mil millones · Denso | Texto ← Vector | 32.768 tokens | Recuperación de documentos con el mayor Qwen3 Embedding de la lista | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 0,6 mil millones · Denso | Texto ← Datos estructurados | 32.768 tokens | Reclasificación ligera en la familia Qwen3 | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 4 mil millones · Denso | Texto ← Datos estructurados | 32.768 tokens | Reclasificación de documentos candidatos con instrucciones | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 8 mil millones · Denso | Texto ← Datos estructurados | 32.768 tokens | Reclasificación con la variante Qwen3 de 8B | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 8 mil millones nominales · Denso Recuento total de parámetros sin verificar | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Leer imágenes y documentos con Qwen3-VL | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 2 mil millones · aproximadamente 2 mil millones Componente lingüístico · Denso · atención híbrida | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Prototipos multimodales con Qwen3.5 pequeño | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 35 mil millones · 3 mil millones activos · aproximadamente 35 mil millones Componente lingüístico · Mezcla de expertos (MoE) · atención híbrida | Texto, Imagen, Vídeo ← Texto | 262.144 tokens Hasta 1.010.000 tokens con Ampliación de contexto con YaRN | Agente multimodal con Qwen3.5 MoE | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 4 mil millones · aproximadamente 4 mil millones Componente lingüístico · Denso · atención híbrida | Texto, Imagen, Vídeo ← Texto | 262.144 tokens Hasta 1.010.000 tokens con Ampliación de contexto con YaRN | Procesamiento de texto e imagen con cuatro mil millones de parámetros | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 9 mil millones · aproximadamente 9 mil millones Componente lingüístico · Denso · atención híbrida | Texto, Imagen, Vídeo ← Texto | 262.144 tokens Hasta 1.010.000 tokens con Ampliación de contexto con YaRN | Asistente de documentos e imágenes con Qwen3.5 denso | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 27 mil millones · aproximadamente 27 mil millones Componente lingüístico · Híbrido · atención híbrida | Texto, Imagen, Vídeo ← Texto | 262.144 tokens Hasta 1.000.000 tokens con Ampliación de contexto con YaRN | Flujos de trabajo largos con un agente de texto e imagen | Apache-2.0 ↗ | ||||
| OLMo · Allen Institute for AI | aproximadamente 7 mil millones · Denso | Texto ← Texto | 65.536 tokens | Investigación de seguimiento de instrucciones con entrenamiento examinable | Apache-2.0 ↗ | ||||
| DeepSeek · DeepSeek | aproximadamente 8 mil millones · Denso | Texto ← Texto | 131.072 tokens | Explorar razonamiento destilado de R1-0528 | MIT ↗ | ||||
| DeepSeek · DeepSeek | aproximadamente 70 mil millones · Denso | Texto ← Texto | 131.072 tokens | Razonamiento destilado sobre Llama 70B | MIT + underlying Llama 3.3 terms ↗ | ||||
| DeepSeek · DeepSeek | aproximadamente 1,5 mil millones · Denso | Texto ← Texto | 131.072 tokens | Explorar los límites del razonamiento en un modelo destilado muy pequeño | MIT ↗ | ||||
| DeepSeek · DeepSeek | aproximadamente 14 mil millones · Denso | Texto ← Texto | 131.072 tokens | Resolución de problemas con una destilación R1 intermedia | MIT ↗ | ||||
| DeepSeek · DeepSeek | aproximadamente 32 mil millones · Denso | Texto ← Texto | 131.072 tokens | Análisis y programación con una destilación densa de 32B | MIT ↗ | ||||
| DeepSeek · DeepSeek | aproximadamente 7 mil millones · Denso | Texto ← Texto | 131.072 tokens | Resolución de problemas con la destilación R1 de 7B | MIT ↗ | ||||
| DeepSeek · DeepSeek | 685,397 mil millones de elementos almacenados · Mezcla de expertos (MoE) Recuento almacenado en el checkpoint, incluidos componentes adicionales; no son los parámetros activos por token generado. | Texto ← Texto | 163.840 tokens | Conectar razonamiento y herramientas en flujos de agentes | MIT ↗ | ||||
| DeepSeek · DeepSeek | 8 mil millones Activos durante prefill · 16 mil millones Activos durante decode · aproximadamente 552 mil millones Red principal · aproximadamente 196 mil millones Memoria condicional Engram · Mezcla de expertos (MoE) · atención híbrida Recuento total de parámetros sin verificar | Texto, Imagen ← Texto | 1.000.000 tokens | Agente multimodal para entradas muy largas | MIT ↗ | ||||
| Gemma · Google DeepMind | aproximadamente 12 mil millones · Denso | Texto, Imagen ← Texto | 131.072 tokens | Consultar imágenes y texto con Gemma 3 intermedio | gemma ↗ | ||||
| Gemma · Google DeepMind | aproximadamente 1 mil millones · Denso | Texto ← Texto | 32.768 tokens | Asistente de texto pequeño de la familia Gemma 3 | gemma ↗ | ||||
| Gemma · Google DeepMind | aproximadamente 27 mil millones · Denso | Texto, Imagen ← Texto | 131.072 tokens | Comprender texto e imagen con el mayor Gemma 3 de la lista | gemma ↗ | ||||
| Gemma · Google DeepMind | aproximadamente 4 mil millones · Denso | Texto, Imagen ← Texto | 131.072 tokens | Primeros pasos con imágenes en la familia Gemma 3 | gemma ↗ | ||||
| Gemma · Google DeepMind | aproximadamente 26 mil millones nominales · aproximadamente 25,2 mil millones Componente lingüístico de la tabla de la entidad editora · Mezcla de expertos (MoE) Recuento total de parámetros sin verificar | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Razonamiento multimodal con Gemma 4 MoE | Apache-2.0 ↗ | ||||
| Gemma · Google DeepMind | aproximadamente 2,3 mil millones Recuento efectivo sin la tabla de embeddings · aproximadamente 5,1 mil millones Componente lingüístico con embeddings · aproximadamente 0,3 mil millones Codificador de audio · Denso Recuento total de parámetros sin verificar | Texto, Imagen, Audio, Vídeo ← Texto | 131.072 tokens | Procesamiento local de texto, imagen y audio con Gemma 4 pequeño | Apache-2.0 ↗ | ||||
| Granite · IBM | aproximadamente 2 mil millones · Denso | Texto ← Texto | 131.072 tokens | Generar respuestas a partir de documentos recuperados | Apache-2.0 ↗ | ||||
| E5 · intfloat / multilingual E5 authors | 0,118 mil millones · Denso | Texto ← Vector | 512 tokens | Recuperación multilingüe con vectores de pocas dimensiones | MIT ↗ | ||||
| Llama · Meta | aproximadamente 70 mil millones · Denso | Texto ← Texto | 131.072 tokens | Asistente general con Llama 3.1 grande | llama3.1 ↗ | ||||
| Llama · Meta | aproximadamente 8 mil millones · Denso | Texto ← Texto | 131.072 tokens | Chat y tareas de texto con Llama 3.1 8B | llama3.1 ↗ | ||||
| Llama · Meta | aproximadamente 1 mil millones · Denso | Texto ← Texto | 131.072 tokens | Reescritura y resumen locales con Llama pequeño | llama3.2 ↗ | ||||
| Llama · Meta | aproximadamente 3 mil millones · Denso | Texto ← Texto | 131.072 tokens | Asistente de texto en el dispositivo con Llama 3B | llama3.2 ↗ | ||||
| Phi · Microsoft | aproximadamente 3,8 mil millones · Denso | Texto ← Texto | 131.072 tokens | Análisis y lógica con recursos más limitados | MIT ↗ | ||||
| Mistral · Mistral AI | aproximadamente 24 mil millones · Denso | Texto, Imagen ← Texto | 262.144 tokens | Agente de edición de varios archivos y búsqueda en repositorios | Apache-2.0 ↗ | ||||
| Mistral · Mistral AI | aproximadamente 3,4 mil millones Componente lingüístico · Denso Recuento total de parámetros sin verificar | Texto, Imagen ← Texto | 262.144 tokens Pesos publicados en FP8; la capacidad de ejecución depende de la precisión y de la memoria del contexto. | Asistente multimodal para despliegue en el borde | Apache-2.0 ↗ | ||||
| Mistral · Mistral AI | aproximadamente 7 mil millones · Denso | Texto ← Texto | 32.768 tokens | Asistente textual con formato Mistral de llamadas a funciones | Apache-2.0 ↗ | ||||
| Mistral · Mistral AI | aproximadamente 24 mil millones · Denso | Texto, Imagen ← Texto | 131.072 tokens | Asistente multilingüe de texto e imagen | Apache-2.0 ↗ | ||||
| Nemotron · NVIDIA | aproximadamente 9 mil millones · Híbrido · atención híbrida | Texto ← Texto | 131.072 tokens | Respuestas basadas en documentos con presupuesto de razonamiento | nvidia-open-model-license ↗ | ||||
| gpt-oss · OpenAI | aproximadamente 117 mil millones · 5,1 mil millones activos · Mezcla de expertos (MoE) | Texto ← Texto | 131.072 tokens Con la configuración de YaRN que acompaña al modelo publicado | Agente de razonamiento ajustable con gpt-oss grande | Apache-2.0 ↗ | ||||
| gpt-oss · OpenAI | aproximadamente 21 mil millones · 3,6 mil millones activos · Mezcla de expertos (MoE) | Texto ← Texto | 131.072 tokens Con la configuración de YaRN que acompaña al modelo publicado | Razonamiento local con gpt-oss pequeño | Apache-2.0 ↗ | ||||
| GLM · Z.ai | aproximadamente 30 mil millones · 3 mil millones activos · Mezcla de expertos (MoE) | Texto ← Texto | 202.752 tokens | Agente de programación con razonamiento conservado | MIT ↗ | ||||
| Kimi · Moonshot AI | aproximadamente 1000 mil millones nominales · 32 mil millones activos · Mezcla de expertos (MoE) Recuento total de parámetros sin verificar | Texto ← Texto | 131.072 tokens | Agente textual para programación y flujos con herramientas | Modified MIT ↗ Uso comercial sujeto a licencia | ||||
| Kimi · Moonshot AI | aproximadamente 1000 mil millones nominales · 32 mil millones activos · Mezcla de expertos (MoE) Recuento total de parámetros sin verificar | Texto ← Texto | 262.144 tokens | Agente de razonamiento para cadenas largas de herramientas y análisis | Modified MIT ↗ Uso comercial sujeto a licencia | ||||
| Kimi · Moonshot AI | aproximadamente 1000 mil millones nominales · 32 mil millones activos · Mezcla de expertos (MoE) Recuento total de parámetros sin verificar | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Agente multimodal para programar a partir de diseños visuales y analizar documentos | Modified MIT ↗ Uso comercial sujeto a licencia | ||||
| MiniMax · MiniMax | aproximadamente 230 mil millones nominales · 10 mil millones activos · Mezcla de expertos (MoE) Recuento total de parámetros sin verificar | Texto ← Texto | 196.608 tokens | Asistente de desarrollo de software para flujos con herramientas | Modified MIT ↗ Uso comercial sujeto a licencia | ||||
| MiniMax · MiniMax | aproximadamente 230 mil millones nominales · 10 mil millones activos · Mezcla de expertos (MoE) Recuento total de parámetros sin verificar | Texto ← Texto | 196.608 tokens | Modelo con herramientas para programación y planificación por etapas | Modified MIT ↗ Uso comercial sujeto a licencia | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 235 mil millones · 22 mil millones activos · Mezcla de expertos (MoE) | Texto ← Texto | 262.144 tokens | Asistente grande de respuesta directa con contexto largo | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 480 mil millones · 35 mil millones activos · Mezcla de expertos (MoE) | Texto ← Texto | 262.144 tokens | Agente de programación para repositorios grandes con varios archivos | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 27 mil millones · Denso · atención híbrida | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Asistente multimodal para análisis, código y documentos | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 0,8 mil millones · Denso · atención híbrida | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Modelo pequeño para prototipos y especialización por tarea | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 122 mil millones · 10 mil millones activos · Mezcla de expertos (MoE) | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Modelo MoE multimodal para análisis y uso de herramientas | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 397 mil millones · 17 mil millones activos · Mezcla de expertos (MoE) | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Asistente multimodal grande para problemas complejos | Apache-2.0 ↗ | ||||
| Llama · Meta | aproximadamente 70 mil millones nominales · Denso Recuento total de parámetros sin verificar | Texto ← Texto | 131.072 tokens | Asistente textual multilingüe para respuestas y tareas empresariales | llama3.3 ↗ Uso comercial sujeto a licencia | ||||
| Phi · Microsoft | aproximadamente 14 mil millones nominales · Denso Recuento total de parámetros sin verificar | Texto ← Texto | 16.384 tokens | Modelo en inglés para matemáticas, lógica y generación de texto | MIT ↗ | ||||
| SmolVLM · Hugging Face | aproximadamente 2,2 mil millones nominales · Denso Recuento total de parámetros sin verificar | Texto, Imagen, Vídeo ← Texto | 8192 tokens | Modelo pequeño para preguntas sobre imágenes y video | Apache-2.0 ↗ | ||||
| MiniLM · Sentence Transformers | 0,023 mil millones · Denso | Texto ← Vector | 256 tokens | Embeddings ligeros en inglés para búsqueda y agrupación | Apache-2.0 ↗ | ||||
| E5 · intfloat / multilingual E5 authors | 0,278 mil millones · Denso | Texto ← Vector | 512 tokens | Embeddings multilingües con prefijos distintos para consultas y documentos | MIT ↗ | ||||
| E5 · intfloat / multilingual E5 authors | 0,56 mil millones · Denso | Texto ← Vector | 512 tokens | Embeddings multilingües para búsqueda semántica | MIT ↗ | ||||
| BGE · BAAI | 0,033 mil millones · Denso | Texto ← Vector | 512 tokens | Modelo pequeño de embeddings en inglés para recuperación de documentos | MIT ↗ | ||||
| BGE · BAAI | 0,278 mil millones · Denso | Texto ← Datos estructurados | 512 tokens | Reclasificador en inglés y chino para resultados de búsqueda | MIT ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 7,61 mil millones · Denso | Texto ← Texto | 32.768 tokens | Asistente pequeño de programación para explicar y corregir código | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 14,7 mil millones · Denso | Texto ← Texto | 32.768 tokens | Asistente de programación para generar, explicar y depurar código | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | aproximadamente 32,5 mil millones · Denso | Texto ← Texto | 32.768 tokens | Asistente de programación con mayor capacidad para problemas difíciles | Apache-2.0 ↗ | ||||
| EmbeddingGemma · Google DeepMind | aproximadamente 0,3 mil millones nominales · Denso Recuento total de parámetros sin verificar | Texto ← Vector | 2048 tokens | Modelo pequeño de embeddings multilingües para ejecución en el dispositivo | gemma ↗ Uso comercial sujeto a licencia | ||||
| Jina · Jina AI | aproximadamente 0,57 mil millones nominales · Denso Recuento total de parámetros sin verificar | Texto ← Vector | 8192 tokens | Modelo de embeddings multilingües con adaptadores por tarea | CC-BY-NC-4.0 ↗ Uso comercial sujeto a licencia | ||||
| Jina · Jina AI | 0,278 mil millones · Denso | Texto ← Datos estructurados | 1024 tokens | Reclasificador multilingüe para documentos más largos | CC-BY-NC-4.0 ↗ Uso comercial sujeto a licencia | ||||
| Mixedbread · Mixedbread | 0,335 mil millones · Denso | Texto ← Vector | 512 tokens | Modelo de embeddings en inglés para recuperación con instrucciones de consulta | Apache-2.0 ↗ | ||||
| Nomic · Nomic AI | 0,137 mil millones · Denso | Texto ← Vector | 8192 tokens | Modelo de embeddings en inglés con contexto largo y dimensiones reducibles | Apache-2.0 ↗ | ||||
| ModernBERT · Answer.AI / LightOn | 0,15 mil millones · Denso | Texto ← Datos estructurados | 8192 tokens | Codificador base para entrenar clasificación y extracción de entidades | Apache-2.0 ↗ | ||||
| Qwen · Qwen | 1,54 mil millones · Denso | Texto ← Texto | 32.768 tokens | Completado de código y relleno intermedio | apache-2.0 ↗ | ||||
| StarCoder2 · bigcode | 3 mil millones · Denso | Texto ← Texto | 16.384 tokens Atención local con ventana de 4096 tokens. | Completado de código con atención de ventana deslizante | bigcode-openrail-m ↗ Uso comercial sujeto a licencia | ||||
| Qwen · Qwen | 80 mil millones · 3 mil millones activos · Mezcla de expertos (MoE) · atención híbrida | Texto ← Texto | 262.144 tokens | Agente de programación | apache-2.0 ↗ | ||||
| E5 · intfloat | 0,56 mil millones · Denso | Texto ← Vector | 512 tokens | Recuperación multilingüe con instrucciones de tarea | mit ↗ | ||||
| Qwen · Qwen | 4 mil millones · Denso | Texto ← Texto | 262.144 tokens | Asistente pequeño de respuesta directa | apache-2.0 ↗ | ||||
| Tooka · PartAI | 0,123 mil millones · Denso | Texto ← Vector | 512 tokens | Embeddings de texto en persa | — | ||||
| Tooka · PartAI | 0,353 mil millones · Denso | Texto ← Vector | 512 tokens | Embeddings de texto en persa | — | ||||
| ParsBERT · HooshvareLab | Denso Recuento de parámetros no registrado | Texto ← Datos estructurados | 512 tokens | Base de entrenamiento para tareas en persa | — | ||||
| Salamandra · BSC-LT | 2,253 mil millones · Denso | Texto ← Texto | 8192 tokens | Generación de texto en lenguas ibéricas | Apache-2.0 ↗ | ||||
| Salamandra · BSC-LT | 7,768 mil millones · Denso | Texto ← Texto | 8192 tokens | Generación de texto en lenguas ibéricas | Apache-2.0 ↗ | ||||
| MiniCPM · openbmb | 2,517 mil millones · Denso | Texto ← Texto | 131.072 tokens | Razonamiento con un modelo compacto | Apache-2.0 ↗ | ||||
| LFM · LiquidAI | 1,17 mil millones · Híbrido | Texto ← Texto | 32.768 tokens | Extracción de información en el dispositivo | LFM Open License 1.0 ↗ Uso comercial sujeto a licencia | ||||
| Granite · ibm-granite | 3,66 mil millones · Denso | Texto ← Texto | 131.072 tokens | Razonamiento con un modelo compacto | Apache-2.0 ↗ | ||||
| GLM · Z.ai | 744 mil millones · 40 mil millones activos · Mezcla de expertos (MoE) | Texto ← Texto | 202.752 tokens | Programación y uso de herramientas | MIT ↗ | ||||
| GLM · Z.ai | 753,864 mil millones de elementos almacenados · Mezcla de expertos (MoE) Recuento almacenado en el checkpoint, incluidos componentes adicionales; no son los parámetros activos por token generado. | Texto ← Texto | 202.752 tokens | Programación y uso de herramientas | MIT ↗ | ||||
| GLM · Z.ai | 753,33 mil millones de elementos almacenados · Mezcla de expertos (MoE) Recuento almacenado en el checkpoint, incluidos componentes adicionales; no son los parámetros activos por token generado. | Texto ← Texto | 1.048.576 tokens | Programación y uso de herramientas | MIT ↗ | ||||
| GLM · Z.ai | Mezcla de expertos (MoE) Recuento de parámetros no registrado | Texto ← Texto | 1.048.576 tokens | Programación y uso de herramientas | GLM-5.3 License ↗ Uso comercial sujeto a licencia | ||||
| Kimi · Moonshot AI | 1000 mil millones · 32 mil millones activos · Mezcla de expertos (MoE) | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Programación y uso de herramientas | Modified MIT ↗ Uso comercial sujeto a licencia | ||||
| Kimi · Moonshot AI | 1000 mil millones · 32 mil millones activos · Mezcla de expertos (MoE) | Texto, Imagen, Vídeo ← Texto | 262.144 tokens | Programación y uso de herramientas | Modified MIT ↗ Uso comercial sujeto a licencia | ||||
| Kimi · Moonshot AI | 2800 mil millones · 104 mil millones activos · Mezcla de expertos (MoE) | Texto, Imagen, Vídeo ← Texto | 1.048.576 tokens | Programación y uso de herramientas | Kimi K3 License ↗ Uso comercial sujeto a licencia | ||||
| Qwen · Qwen | 2 mil millones · Denso | Texto, Imagen, Vídeo ← Vector | 32.768 tokens | Recuperación multimodal | Apache-2.0 ↗ | ||||
| Qwen · Qwen | 8 mil millones · Denso | Texto, Imagen, Vídeo ← Vector | 32.768 tokens | Recuperación multimodal | Apache-2.0 ↗ | ||||
| Qwen · Qwen | 2 mil millones · Denso | Texto, Imagen, Vídeo ← Datos estructurados | 32.768 tokens | Reordenación multimodal | Apache-2.0 ↗ | ||||
| Qwen · Qwen | 8 mil millones · Denso | Texto, Imagen, Vídeo ← Datos estructurados | 32.768 tokens | Reordenación multimodal | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | 27,781 mil millones · aproximadamente 27 mil millones Componente lingüístico; cifra redondeada del editor · Denso · atención híbrida | Texto, Imagen, Vídeo ← Texto | 262.144 tokens Hasta 1.010.000 tokens con Requiere configurar YaRN; contexto nativo de 262.144 tokens. | Modelo textual y visual con atención híbrida | Apache-2.0 ↗ | ||||
| Qwen · Qwen / Alibaba Cloud | 35,952 mil millones · 3 mil millones activos · aproximadamente 35 mil millones Componente lingüístico; cifra redondeada del editor · Mezcla de expertos (MoE) · atención híbrida | Texto, Imagen, Vídeo ← Texto | 262.144 tokens Hasta 1.010.000 tokens con Requiere configurar YaRN; contexto nativo de 262.144 tokens. | Modelo textual y visual con atención híbrida | Apache-2.0 ↗ | ||||
| HY-MT · Tencent | 1,8 mil millones · Denso | Texto ← Texto | — | Traducción especializada de texto | Tencent HY Community License ↗ Uso comercial sujeto a licencia | ||||
| HY-MT · Tencent | 7 mil millones · Denso | Texto ← Texto | — | Traducción especializada de texto | Tencent HY Community License ↗ Uso comercial sujeto a licencia | ||||
| HY-MT · Tencent | 1,8 mil millones · Denso | Texto ← Texto | — | Traducción especializada | Apache-2.0 ↗ | ||||
| HY-MT · Tencent | 7 mil millones · Denso | Texto ← Texto | — | Traducción especializada | Apache-2.0 ↗ | ||||
| HY-MT · Tencent | 30 mil millones · 3 mil millones activos · Mezcla de expertos (MoE) | Texto ← Texto | — | Traducción especializada | Apache-2.0 ↗ | ||||
| Gemma · Google | 4 mil millones · Denso | Texto, Imagen ← Texto | — | Traducción especializada | Gemma terms ↗ Uso comercial sujeto a licencia | ||||
| Gemma · Google | 12 mil millones · Denso | Texto, Imagen ← Texto | — | Traducción especializada | Gemma terms ↗ Uso comercial sujeto a licencia | ||||
| Gemma · Google | 27 mil millones · Denso | Texto, Imagen ← Texto | — | Traducción especializada | Gemma terms ↗ Uso comercial sujeto a licencia | ||||
| MADLAD · Google | 3 mil millones · Denso | Texto ← Texto | — | Traducción especializada | Apache-2.0 ↗ | ||||
| NLLB · Meta | 0,6 mil millones · Denso | Texto ← Texto | — | Traducción especializada | CC-BY-NC-4.0 ↗ Uso comercial sujeto a licencia | ||||
| Qwen-Image · Qwen / Alibaba | aproximadamente 7 mil millones Generador de imágenes DiT · aproximadamente 8 mil millones Codificador Qwen3-VL · Otro Recuento total de parámetros sin verificar | Texto, Imagen ← Imagen | — | Generación y edición de imágenes | Qwen Research License — no comercial ↗ Uso comercial sujeto a licencia | ||||
| MiMo · Xiaomi MiMo | 1020 mil millones · 42 mil millones activos · Mezcla de expertos (MoE) · atención híbrida | Texto, Imagen, Vídeo, Audio ← Texto | 1.048.576 tokens | Programación, agentes de software y análisis de texto e imágenes | MIT ↗ |
«—» indica que no hay información registrada; no significa que el modelo carezca de esa capacidad.
Adecuación del modelo a la tarea
Modelos para conversación, programación, búsqueda y documentos.
Prueba de la columna de resultados: MIRACL · nDCG@10 · es
Esta selección se aplica a las columnas de resultados. Las condiciones figuran en los detalles de cada modelo.
Resultados agrupados por prueba ←¿Qué modelo conviene considerar?
Puntos de partida documentados, no una clasificación de calidad.
Recuperación en español
E5-Small es una referencia de menor tamaño; Large-Instruct obtiene más en este informe MIRACL en español. Los resultados de Qwen son agregados multilingües, no puntuaciones específicas de español.
Cuando consultas y documentos están en español; identifique por separado la recuperación entre idiomas.
La diferencia de 51,2 a 53,7 no acredita la calidad de la respuesta final ni la cobertura de todas las variedades del español.
Recuperación en inglés
Trate Large y Large-Instruct como variantes distintas: Large obtiene más en MIRACL inglés en este informe. Para valorar un reranker, use la comparación de Qwen con el mismo conjunto de candidatos.
Cuando importa más la evidencia en el idioma objetivo que una media multilingüe.
La etiqueta Instruct no garantiza una mejora en todas las tareas.
Añadir una etapa de reranking
Empiece la comparación de tamaños con 0,6B. Considere 4B y 8B si la mejora en la tarea justifica el presupuesto de la segunda etapa; 8B no encabeza todas las métricas.
Cuando los documentos pertinentes están entre los candidatos pero aparecen mal ordenados; la cantidad de candidatos forma parte del diseño.
El reranker no puede recuperar un documento ausente de su conjunto de entrada.
¿Ejercicios de programación o edición de código?
Para un asistente que sigue instrucciones, separa edición de repositorios y ejercicios de programación. StarCoder2-3B sirve para autocompletado/FIM; HumanEval no mide conversación ni calidad de un agente editor.
Una vez definida la interfaz: autocompletado, cambios en varios archivos o resolución de un ejercicio.
Los parámetros activos de un MoE no determinan la memoria de todos sus pesos residentes.
Un modelo pequeño para una tarea acotada
LFM es un candidato pequeño para extracción y flujos acotados; MiniCPM y Granite también cuentan con evidencia de razonamiento y herramientas. El tamaño real de los pesos puede diferir de la cifra redondeada del nombre.
Cuando se conocen la tarea, el formato de salida y el límite de memoria.
Una buena puntuación de un modelo pequeño no demuestra menor latencia ni viabilidad en portátil con el contexto máximo.
Elegir un modelo generativo para español
Salamandra aporta evidencia directa en varias tareas españolas. Compárelo con candidatos multilingües generales; los datos disponibles no identifican al mejor chatbot en español.
Cuando es necesario separar la evidencia en español de una afirmación multilingüe general.
La cobertura del idioma no acredita todas las regiones ni los ámbitos profesionales.
Clasificación de intenciones y textos
Use MassiveIntent y MTOP para valorar la clasificación de intenciones. El modelo de embeddings es un componente; el resultado también depende del clasificador y de sus datos de entrenamiento.
Para un conjunto definido de etiquetas; la evidencia publicada ayuda a formar una lista inicial.
Un modelo de embeddings o ParsBERT sin adaptación no es un chatbot listo para usar.
Modelo de 3 mil millones con dos modos de razonamiento. Para respuestas breves, elige el modo sin razonamiento y un límite explícito de salida.
es: Declaración del editorSmolLM3-3B — model card · Informe del editor
https://huggingface.co/HuggingFaceTB/SmolLM3-3B/blob/a07cc9a04f16550a088caea529712d1d335b0ac1/README.md ↗- Entidad editora / autoría
- Hugging Face
- Fecha de consulta
- 2026-09-15
- Revisión / commit
- a07cc9a04f16550a088caea529712d1d335b0ac1
- Sección pertinente de la fuente
- README.md: model description / architecture / intended use; matching lines 26, 33, 345
- Las cifras del anuncio del modelo están redondeadas; safetensors.total cuenta elementos almacenados, no necesariamente parámetros únicos.
SmolLM3-3B — Hub metadata · Informe del editor
https://huggingface.co/api/models/HuggingFaceTB/SmolLM3-3B?blobs=true ↗- Entidad editora / autoría
- Hugging Face
- Fecha de consulta
- 2026-09-15
- Revisión / commit
- a07cc9a04f16550a088caea529712d1d335b0ac1
- Sección pertinente de la fuente
- $.sha; $.id; $.pipeline_tag; $.cardData; $.safetensors; $.siblings
- El inventario de archivos y el número de tensores no equivalen a memoria de ejecución ni a parámetros únicos.
SmolLM3-3B — parameter specification · Informe del editor
https://huggingface.co/HuggingFaceTB/SmolLM3-3B/blob/a07cc9a04f16550a088caea529712d1d335b0ac1/README.md ↗- Entidad editora / autoría
- Hugging Face
- Fecha de consulta
- 2026-09-15
- Revisión / commit
- a07cc9a04f16550a088caea529712d1d335b0ac1
- Sección pertinente de la fuente
- README.md: parameter count / named model variant; matching lines 14, 35, 59, 90, 151, 160, 210, 216, 221, 225, 246, 261
- Las cifras del anuncio del modelo están redondeadas; safetensors.total cuenta elementos almacenados, no necesariamente parámetros únicos.
SmolLM3-3B — license declaration · Informe del editor
https://huggingface.co/HuggingFaceTB/SmolLM3-3B/blob/a07cc9a04f16550a088caea529712d1d335b0ac1/README.md ↗- Entidad editora / autoría
- Hugging Face
- Fecha de consulta
- 2026-09-15
- Revisión / commit
- a07cc9a04f16550a088caea529712d1d335b0ac1
- Sección pertinente de la fuente
- README.md: license / underlying-model terms; Hub $.cardData.license; matching lines 3, 31, 381, 382
SmolLM3-3B — configuration · Informe del editor
https://huggingface.co/HuggingFaceTB/SmolLM3-3B/blob/a07cc9a04f16550a088caea529712d1d335b0ac1/config.json ↗- Entidad editora / autoría
- Hugging Face
- Fecha de consulta
- 2026-09-15
- Revisión / commit
- a07cc9a04f16550a088caea529712d1d335b0ac1
- Sección pertinente de la fuente
- config.json: architectures, model_type, text_config, max_position_embeddings, quantization_config, torch_dtype/dtype
SmolLM3 release · Informe del editor
https://huggingface.co/blog/smollm3 ↗- Entidad editora / autoría
- Hugging Face
- Fecha de consulta
- 2026-09-15
- Sección pertinente de la fuente
- Publication date July 8 2025; SmolLM3-3B
- Fecha de publicación de las variantes indicadas, no de creación del repositorio ni de extracción de datos.
SmolLM3-3B — declared context · Informe del editor
https://huggingface.co/HuggingFaceTB/SmolLM3-3B/blob/a07cc9a04f16550a088caea529712d1d335b0ac1/README.md ↗- Entidad editora / autoría
- Hugging Face
- Fecha de consulta
- 2026-09-15
- Sección pertinente de la fuente
- Key features; Long context processing: trained at 64k; YaRN for 128k
- Capacidad documentada de la variante indicada; distinta de la longitud de salida de una prueba o del límite de una API alojada
HuggingFaceTB/SmolLM3-3B — model card · Informe del editor
https://huggingface.co/HuggingFaceTB/SmolLM3-3B/raw/a07cc9a04f16550a088caea529712d1d335b0ac1/README.md ↗- Entidad editora / autoría
- Hugging Face
- Fecha de consulta
- 2026-09-15
- Sección pertinente de la fuente
- Description; model details; usage
HuggingFaceTB/SmolLM3-3B — repository metadata · Informe del editor
https://huggingface.co/api/models/HuggingFaceTB/SmolLM3-3B?blobs=true ↗- Entidad editora / autoría
- Hugging Face
- Fecha de consulta
- 2026-09-15
- Sección pertinente de la fuente
- cardData; sha; safetensors; siblings
Filtros avanzados 3 controles
Comparación de filas y condiciones
Regla de comparación: Los modelos pueden diferir; tarea, idioma, datos, versión de la prueba, métrica y unidad deben coincidir o declararse.
| Comparar | Detalles | Función en el sistema | Uso principal | Característica distintiva y justificación | Condición de uso pertinente | Fundamento de la recomendación | Empezar | |
|---|---|---|---|---|---|---|---|---|
| Recuperación de documentos | Recuperación híbrida de documentos en RAG | Salidas densas, dispersas y multivector en un modelo; más de 100 idiomas, entradas de 8192 tokens y vectores densos de 1024 dimensiones. | Use FlagEmbedding para las tres salidas a la vez; la salida de GGUF u Ollama depende del backend. | Recomendación analítica de la guía | ||||
| Reordenamiento de documentos | Reordenar documentos recuperados | Lee la consulta y el documento conjuntamente para puntuar relevancia; complementa la recuperación de BGE-M3. | Recupere primero un conjunto limitado de candidatos. La puntuación sigmoid no es probabilidad de respuesta correcta y la salida no es un embedding. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada | Redacción y chat multilingües con documentos largos | Aya Expanse 32B tiene un contexto de 131 072 tokens; el persa figura entre los 23 idiomas declarados por la entidad editora. | Versión de investigación con licencia no comercial; la longitud de contexto no demuestra una precisión uniforme en todo el documento. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada | Asistente de redacción y reescritura multilingüe | Aya Expanse 8B combina un contexto de 8192 tokens con entrenamiento de preferencias multilingües; también es candidato para evaluar redacción en persa. | Respete la licencia no comercial y el límite de contexto de esta variante; no hereda los resultados de 32B. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Chat local en varios idiomas | Tiny Aya Global ofrece cobertura lingüística amplia; es distinta de las variantes regionales Earth, Fire y Water. | Evalúe ejemplos en persa si ese es el uso previsto; las variantes regionales o base no sustituyen este checkpoint sin revisión. | Recomendación analítica de la guía | ||||
| Llamadas a herramientas, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Crear un prototipo de asistente pequeño con llamadas a funciones | La mayor variante SmolLM2 de la lista admite un formato de llamadas a funciones además de seguir instrucciones; las dos menores no heredan esa función. | Modelo principalmente en inglés. La aplicación anfitriona ejecuta las funciones y debe validar sus argumentos. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada | Explorar el seguimiento de instrucciones con un modelo muy pequeño | La variante SmolLM2 de 135 millones de parámetros sirve para prototipos sencillos de generación y para explorar los límites de modelos muy pequeños. | Use entradas cortas y tareas acotadas; no espere conocimiento amplio ni las llamadas a herramientas de la variante 1.7B. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada | Reescritura y resumen de textos cortos | SmolLM2 360M usa SFT y DPO para ajustar instrucciones; su ficha incluye un ejemplo de ejecución en CPU. | Enfocado en inglés; el tamaño pequeño no demuestra velocidad ni calidad en persa. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Asistente pequeño con modo de razonamiento seleccionable | SmolLM3 3B ofrece modos de respuesta directa y razonamiento, contexto de entrenamiento de 65 536 tokens y detalles públicos del entrenamiento. | Ampliar el contexto requiere YaRN. La ficha nombra seis idiomas nativos, incluido alemán, mientras las etiquetas del repositorio enumeran ocho distintos; ninguna lista incluye persa. Requiere Transformers 4.53 o posterior., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Crear un prototipo de chat con el menor Qwen3 | Qwen3 0.6B denso ofrece modos con y sin razonamiento; hay un archivo oficial Q8_0. | Limite el presupuesto de salida; compartir familia no demuestra la capacidad de resolver problemas de variantes mayores., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Asistente de texto pequeño con control del razonamiento | Qwen3-1.7B figura entre las opciones de menos de 2 mil millones de parámetros; la plantilla de mensajes permite elegir respuesta directa. | En modo de razonamiento, los tokens de pensamiento cuentan en el costo y la longitud de salida. El GGUF oficial de este registro es Q8_0., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Generación y análisis de texto con Qwen3 denso | Qwen3-14B es un modelo denso con dos modos de respuesta; sus variantes GGUF oficiales permiten elegir precisión de pesos. | Hay paquetes Q4_K_M y Q8_0; esta guía no ha probado su velocidad ni calidad., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Llamadas a herramientas, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación | Asistente con herramientas y arquitectura MoE | Qwen3-30B-A3B usa expertos seleccionados y el patrón Qwen-Agent para conectar herramientas. | Los parámetros activos no sustituyen el tamaño de todos los pesos al estimar memoria; la ejecución requiere plantillas y parsers compatibles., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Razonamiento, Programación, Generación de texto, Generación basada en documentos, Extracción estructurada, Llamadas a herramientas | Análisis por etapas con un Qwen3 denso mayor | A diferencia de 30B-A3B, Qwen3-32B es denso; el modo de razonamiento se puede elegir según la complejidad de la pregunta. | Compare respuesta directa y razonamiento con presupuestos de salida y condiciones equiparables; esta descripción no es una clasificación de calidad., Es un modelo general; Coder especializado tiene entrenamiento y formatos de herramientas distintos., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida. | Recomendación analítica de la guía, Uso documentado por el editor | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Asistente general de cuatro mil millones de parámetros | Qwen3-4B cambia el modo de razonamiento dentro de un checkpoint; los archivos GGUF oficiales ofrecen varias cuantizaciones. | El contexto nativo es de 32 768 tokens; ampliarlo requiere configurar la extensión de contexto., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Chat y tareas de texto con control del razonamiento | Qwen3-8B es un modelo general denso con 8,2 mil millones de parámetros declarados; la plantilla selecciona respuesta directa o razonamiento. | Hay archivos oficiales Q4_K_M y Q8_0 para uso local; esta guía no ha medido su calidad ni su memoria de ejecución., La recuperación, la inserción de documentos y la comprobación de citas corresponden al sistema; esta relación no es una prueba de RAG ni de persa., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Programación, Llamadas a herramientas, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento | Edición de repositorios con un asistente que usa herramientas | Qwen3-Coder-30B-A3B-Instruct está ajustado para generar código, editar repositorios y trabajar con agentes de programación; su contexto nativo es de 262 144 tokens. | Es una variante sin modo de razonamiento. Use el formato de herramientas de Coder; es distinta de Qwen3-30B-A3B general., La aplicación anfitriona proporciona herramientas de archivos, pruebas y ejecución., Este checkpoint solo produce respuestas directas; no tiene un modo de razonamiento independiente. | Recomendación analítica de la guía, Uso documentado por el editor | ||||
| Recuperación de documentos | Recuperación vectorial con el menor Qwen3 Embedding | La variante 0.6B produce embeddings condicionados por instrucciones, con hasta 1024 dimensiones y entradas de 32 768 tokens. | Añada la instrucción de tarea a la consulta; indexe los documentos con el mismo modelo y configuración de dimensiones. | Recomendación analítica de la guía | ||||
| Recuperación de documentos | Indexación multilingüe con vectores ajustables | Qwen3-Embedding-4B produce hasta 2560 dimensiones y usa instrucciones de consulta para adaptar las representaciones a la tarea. | Reducir dimensiones requiere comprobar la calidad de recuperación en la colección prevista; una puntuación MTEB no sustituye esa comprobación. | Recomendación analítica de la guía | ||||
| Recuperación de documentos | Recuperación de documentos con el mayor Qwen3 Embedding de la lista | Qwen3-Embedding-8B admite hasta 4096 dimensiones y 32 768 tokens de contexto; recibe texto y produce vectores. | Contabilice la indexación y el almacenamiento vectorial aparte de la generación; este modelo no redacta la respuesta final. | Recomendación analítica de la guía | ||||
| Reordenamiento de documentos | Reclasificación ligera en la familia Qwen3 | Qwen3-Reranker 0.6B está ajustado para puntuar la relevancia consulta–documento con instrucciones de tarea. | Requiere la plantilla de reclasificación y puntuación yes/no; no use la ruta de chat ni de generación de embeddings. | Recomendación analítica de la guía | ||||
| Reordenamiento de documentos | Reclasificación de documentos candidatos con instrucciones | Qwen3-Reranker-4B es la opción intermedia; consulta, instrucción de recuperación y documento intervienen en la puntuación de relevancia. | Envíe solo documentos candidatos a esta etapa; más pares consulta–documento aumentan el costo de la segunda fase. | Recomendación analítica de la guía | ||||
| Reordenamiento de documentos | Reclasificación con la variante Qwen3 de 8B | Qwen3-Reranker-8B es el mayor reclasificador de esta colección; puntúa la relevancia consulta–documento. | Para elegir entre este y 4B, compare calidad de recuperación y latencia en sus documentos; el tamaño por sí solo no establece una clasificación. | Recomendación analítica de la guía | ||||
| Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Leer imágenes y documentos con Qwen3-VL | Qwen3-VL 8B Instruct combina entradas de texto, imagen y video para comprensión visual y trabajo con documentos. | Use el procesador y la plantilla multimodales; los checkpoints Thinking e Instruct tienen comportamientos distintos. | Recomendación analítica de la guía | ||||
| Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Prototipos multimodales con Qwen3.5 pequeño | Qwen3.5-2B se presenta para prototipos y ajuste por tarea; admite entradas visuales junto con texto. | La calidad de variantes mayores no se transfiere a este modelo de 2 mil millones de parámetros., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Llamadas a herramientas, Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación | Agente multimodal con Qwen3.5 MoE | La variante 35B-A3B combina una base de texto e imagen con arquitectura híbrida; es candidata para flujos de trabajo de varias etapas. | Qwen3.5-Flash alojado ofrece herramientas y contexto predeterminado distintos; las especificaciones de la API no se transfieren a los pesos locales., Use los ajustes multimodales y límites de imagen documentados para estos pesos., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía, Uso documentado por el editor | ||||
| Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Procesamiento de texto e imagen con cuatro mil millones de parámetros | Qwen3.5-4B pertenece a la generación integrada de texto e imagen; es una alternativa menor que 9B para explorar extracción de información documental. | Los documentos escaneados requieren la ruta multimodal; el límite de contexto textual no determina cuántas imágenes se pueden procesar., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Asistente de documentos e imágenes con Qwen3.5 denso | Qwen3.5 9B combina texto e imágenes en una arquitectura densa. | Compare con 4B usando los mismos documentos y ajustes de imagen; distinga los parámetros lingüísticos de los visuales., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Llamadas a herramientas, Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación | Flujos de trabajo largos con un agente de texto e imagen | Qwen3.8-27B es un modelo denso de texto e imagen con control del razonamiento; su anuncio destaca programación, investigación y tareas por etapas. | Las funciones anunciadas del servicio en la nube, como herramientas integradas y contexto predeterminado, no son garantías de los pesos locales., Las dimensiones de imagen y el muestreo de fotogramas forman parte de las condiciones de uso., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía, Uso documentado por el editor | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Investigación de seguimiento de instrucciones con entrenamiento examinable | Olmo 3 7B Instruct se publica con datos Dolma 3 y Dolci; los detalles públicos del entrenamiento lo distinguen para investigación reproducible. | Este checkpoint es Instruct; no le atribuya resultados de Olmo Think. Requiere Transformers 4.57 o posterior. | Recomendación analítica de la guía | ||||
| Razonamiento, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Explorar razonamiento destilado de R1-0528 | Posentrenado a partir de Qwen3-8B-Base con cadenas de razonamiento de DeepSeek-R1-0528; distinto de Qwen3-8B estándar. | Los resultados del R1-0528 completo no corresponden a esta variante de 8B., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida. | Recomendación analítica de la guía | ||||
| Razonamiento, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Razonamiento destilado sobre Llama 70B | Este checkpoint destila R1 sobre una base Llama y es la mayor variante destilada de la lista. | Importan tanto la licencia base de Llama como las condiciones de la entidad que destila; estime por separado tamaño de pesos y longitud del razonamiento., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida. | Recomendación analítica de la guía | ||||
| Razonamiento, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Explorar los límites del razonamiento en un modelo destilado muy pequeño | La variante 1.5B destila R1 sobre Qwen2.5-Math y permite explorar la transferencia de razonamiento a un modelo pequeño. | Las respuestas largas pueden volverse repetitivas., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida. | Recomendación analítica de la guía | ||||
| Razonamiento, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Resolución de problemas con una destilación R1 intermedia | DeepSeek-R1-Distill-Qwen-14B usa Qwen2.5-14B y datos generados por R1; sus pesos no son los del R1 completo. | Las cifras publicadas corresponden a esta variante y configuración; evite compararlas con respuestas directas en condiciones distintas., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida. | Recomendación analítica de la guía | ||||
| Razonamiento, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Análisis y programación con una destilación densa de 32B | La variante Qwen-32B destila R1 sobre una base Qwen2.5. | La capacidad de razonamiento declarada no equivale a llamadas a herramientas ni ejecución automática de código; la aplicación debe aportar herramientas y validación., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida. | Recomendación analítica de la guía | ||||
| Razonamiento, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Resolución de problemas con la destilación R1 de 7B | Basado en Qwen2.5-Math-7B; distinto de la destilación posterior R1-0528 sobre Qwen3. | Mantenga la plantilla y el tokenizador de este repositorio; compararlo con la variante 8B requiere una evaluación común., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida. | Recomendación analítica de la guía | ||||
| Llamadas a herramientas, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación | Conectar razonamiento y herramientas en flujos de agentes | DeepSeek-V3.2 combina atención dispersa DSA y posentrenamiento orientado a agentes; su plantilla de chat difiere de versiones anteriores. | Use plantillas y rutas de ejecución específicas de V3.2; los resultados de Speciale no se transfieren a este modelo., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Llamadas a herramientas, Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación | Agente multimodal para entradas muy largas | DeepSeek-V4.1-Flash procesa texto e imágenes con arquitectura CED; el número de parámetros activos difiere entre prefill y decode. | Los parámetros activos no son una cifra fija; la compresión KV y una ruta de ejecución específica forman parte de esta arquitectura., Use la ruta de ejecución específica de CED; esta relación no es un resultado de evaluación de OCR., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía, Uso documentado por el editor | ||||
| Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Consultar imágenes y texto con Gemma 3 intermedio | Gemma 3 12B IT es una variante multimodal ajustada a instrucciones con 131 072 tokens de contexto; conecta imágenes de entrada con respuestas textuales. | Requiere el procesador visual y la plantilla Gemma 3; el contexto máximo no demuestra comprensión uniforme de documentos largos. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Asistente de texto pequeño de la familia Gemma 3 | A diferencia de las variantes mayores de esta generación, Gemma 3 1B IT solo admite texto y tiene 32 768 tokens de contexto. | Las imágenes escaneadas requieren primero OCR externo; las funciones multimodales de 4B y superiores no se aplican a esta variante. | Recomendación analítica de la guía | ||||
| Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Comprender texto e imagen con el mayor Gemma 3 de la lista | Gemma 3 27B IT es la variante densa mayor de esta generación, con entrada visual y cobertura multilingüe. | Descargar los pesos requiere aceptar la licencia Gemma. | Recomendación analítica de la guía | ||||
| Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Primeros pasos con imágenes en la familia Gemma 3 | Gemma 3 4B IT es el menor modelo multimodal de esta generación en la lista; a diferencia de 1B, lee imágenes junto con texto. | Descargue juntos los pesos y el procesador de 4B; valide los números extraídos del documento en la salida textual. | Recomendación analítica de la guía | ||||
| Razonamiento, Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Razonamiento multimodal con Gemma 4 MoE | Gemma 4 26B-A4B es un modelo de expertos con control del razonamiento y 262 144 tokens de contexto; su arquitectura difiere de E2B pequeño. | Esta variante no admite audio; los parámetros activos difieren de todos los pesos del modelo., Requiere la ruta del procesador de imagen; la compatibilidad de audio de E2B no se transfiere a este modelo., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida. | Recomendación analítica de la guía, Uso documentado por el editor | ||||
| Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Procesamiento local de texto, imagen y audio con Gemma 4 pequeño | Gemma 4 E2B se presenta para ejecución en el dispositivo y admite audio. E2B es un recuento efectivo, no todos los pesos. | Use el recuento total y los archivos reales para calcular memoria; las rutas de audio e imagen requieren sus procesadores correspondientes., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Generación basada en documentos, Extracción estructurada, Generación de texto, Programación, Llamadas a herramientas | Generar respuestas a partir de documentos recuperados | Granite 3.3 2B Instruct es un modelo pequeño orientado a empresas, con RAG, resumen, extracción de texto y modo de razonamiento. | El sistema debe recuperar documentos e incluirlos en el prompt; el modelo no es un buscador. El persa no figura entre sus 12 idiomas declarados., Valide la salida con el esquema de la aplicación; pedir un formato no garantiza JSON válido. | Recomendación analítica de la guía, Uso documentado por el editor | ||||
| Recuperación de documentos | Recuperación multilingüe con vectores de pocas dimensiones | Multilingual E5 Small convierte texto en vectores de 384 dimensiones con un límite de entrada de 512 tokens; es candidato para fragmentos cortos de documentos. | Los prefijos query: y passage: se requieren también fuera del inglés; divida los textos largos antes de indexarlos. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Asistente general con Llama 3.1 grande | Llama 3.1 70B Instruct admite chat multilingüe y tareas de texto con 131 072 tokens de contexto. | Esta variante recibe texto; el uso de los pesos está sujeto a la licencia Llama. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Chat y tareas de texto con Llama 3.1 8B | Llama 3.1 8B está ajustado para asistencia general y seguimiento de instrucciones; difiere del modelo base del mismo tamaño. | Mantenga la plantilla y el tokenizador Instruct; un contexto largo por sí solo no garantiza calidad de respuestas basadas en documentos. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Reescritura y resumen locales con Llama pequeño | Llama 3.2 1B Instruct es el modelo textual pequeño de esta generación, presentado para tareas acotadas en dispositivos locales. | No admite imágenes directamente; los modelos Llama 3.2 Vision son productos distintos. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Asistente de texto en el dispositivo con Llama 3B | Llama 3.2 3B Instruct está ajustado para chat, reescritura y resumen, con más parámetros que la variante 1B. | Compare calidad y latencia en la tarea prevista; ninguno de los modelos textuales 1B y 3B admite imágenes. | Recomendación analítica de la guía | ||||
| Razonamiento, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Análisis y lógica con recursos más limitados | Phi-4-mini-instruct se centra en datos de razonamiento y seguimiento de instrucciones, con 131 072 tokens de contexto. | Distinto de mini-reasoning y multimodal-instruct; compare ejemplos matemáticos o lógicos con el nombre exacto de esta variante. | Recomendación analítica de la guía | ||||
| Programación, Llamadas a herramientas, Generación de texto, Generación basada en documentos, Extracción estructurada, Comprensión de imágenes | Agente de edición de varios archivos y búsqueda en repositorios | Devstral Small 2 se orienta a ingeniería de software y revisión y edición de código con herramientas; esta generación también admite imágenes. | Los pesos Instruct de este repositorio son FP8; use el formato Mistral y las dependencias de esta revisión, no ajustes genéricos de chat., Las herramientas del agente y las plantillas Mistral deben corresponder a la revisión del modelo., Requiere el procesador y componentes visuales de esta revisión; la cantidad de imágenes, resolución y fotogramas afectan al consumo de memoria. | Recomendación analítica de la guía, Uso documentado por el editor | ||||
| Comprensión de imágenes, Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Asistente multimodal para despliegue en el borde | Ministral 3 3B Instruct es el modelo pequeño de texto e imagen de la familia; el componente lingüístico tiene 3,4 mil millones de parámetros y el codificador visual, 0,4 mil millones. | Los pesos oficiales son FP8; 3B en el nombre no cuenta todos los parámetros lingüísticos y visuales. | Recomendación analítica de la guía | ||||
| Llamadas a herramientas, Generación de texto, Generación basada en documentos, Extracción estructurada | Asistente textual con formato Mistral de llamadas a funciones | Mistral 7B Instruct v0.3 añade la tercera versión del tokenizador y llamadas a funciones a este modelo textual. | Use el formato de herramientas y tokenizador v3 de este checkpoint; esta variante no admite imágenes. | Recomendación analítica de la guía | ||||
| Comprensión de imágenes, Extracción estructurada, Generación de texto, Generación basada en documentos, Programación, Llamadas a herramientas | Asistente multilingüe de texto e imagen | Mistral Small 3.1 24B Instruct añade procesamiento de imágenes y contexto largo a Small; el persa figura en la lista de idiomas de la entidad editora. | Las herramientas y la salida JSON requieren plantilla y parser compatibles; no mezcle resultados Base e Instruct., Configure el parser y la validación de esquema en la aplicación. | Recomendación analítica de la guía, Uso documentado por el editor | ||||
| Generación basada en documentos, Generación de texto, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Respuestas basadas en documentos con presupuesto de razonamiento | Nemotron Nano 9B v2 combina Mamba-2 con atención; permite controlar el modo de razonamiento y su presupuesto de tokens. | Los documentos recuperados se suministran externamente; el persa no figura entre los seis idiomas declarados y el backend debe admitir la arquitectura híbrida., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Llamadas a herramientas, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento | Agente de razonamiento ajustable con gpt-oss grande | gpt-oss-120b es un modelo MoE con 117 mil millones de parámetros totales y 5,1 mil millones activos; los pesos de expertos se publican en MXFP4. | La ejecución correcta requiere el formato harmony; la aplicación proporciona navegador o Python. La memoria declarada por la entidad editora no es una medición del sitio., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Razonamiento, Generación de texto, Generación basada en documentos, Extracción estructurada, Llamadas a herramientas | Razonamiento local con gpt-oss pequeño | gpt-oss-20b tiene 21 mil millones de parámetros totales y 3,6 mil millones activos, se orienta a uso local o especializado y ofrece tres niveles de razonamiento. | Requiere formato harmony y backend compatible con MXFP4; no sustituya el recuento real de pesos por el nombre 20B en los cálculos., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida. | Recomendación analítica de la guía | ||||
| Llamadas a herramientas, Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación | Agente de programación con razonamiento conservado | GLM-4.7-Flash es un MoE de clase 30B-A3B; su ficha describe la conservación del razonamiento entre turnos para agentes de varias etapas. | Las rutas vLLM y SGLang dependen de versiones de desarrollo concretas., Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Agente textual para programación y flujos con herramientas | — | — | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Agente de razonamiento para cadenas largas de herramientas y análisis | — | Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas, Comprensión de imágenes | Agente multimodal para programar a partir de diseños visuales y analizar documentos | — | Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto., Requiere el procesador y componentes visuales de esta revisión; la cantidad de imágenes, resolución y fotogramas afectan al consumo de memoria. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Asistente de desarrollo de software para flujos con herramientas | — | Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Modelo con herramientas para programación y planificación por etapas | — | Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Asistente grande de respuesta directa con contexto largo | — | Este checkpoint solo produce respuestas directas; no tiene un modo de razonamiento independiente. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Agente de programación para repositorios grandes con varios archivos | — | Este checkpoint solo produce respuestas directas; no tiene un modo de razonamiento independiente. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas, Comprensión de imágenes | Asistente multimodal para análisis, código y documentos | — | Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto., Requiere el procesador y componentes visuales de esta revisión; la cantidad de imágenes, resolución y fotogramas afectan al consumo de memoria. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas, Comprensión de imágenes | Modelo pequeño para prototipos y especialización por tarea | — | Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto., Requiere el procesador y componentes visuales de esta revisión; la cantidad de imágenes, resolución y fotogramas afectan al consumo de memoria. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas, Comprensión de imágenes | Modelo MoE multimodal para análisis y uso de herramientas | — | Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto., Requiere el procesador y componentes visuales de esta revisión; la cantidad de imágenes, resolución y fotogramas afectan al consumo de memoria. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas, Comprensión de imágenes | Asistente multimodal grande para problemas complejos | — | Para respuestas sencillas, desactive el razonamiento si se admite o limite el presupuesto de salida., Incluya los tokens de razonamiento en el tiempo de respuesta y el contexto., Requiere el procesador y componentes visuales de esta revisión; la cantidad de imágenes, resolución y fotogramas afectan al consumo de memoria. | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación, Llamadas a herramientas | Asistente textual multilingüe para respuestas y tareas empresariales | — | — | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Modelo en inglés para matemáticas, lógica y generación de texto | — | — | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Comprensión de imágenes | Modelo pequeño para preguntas sobre imágenes y video | — | Requiere el procesador y componentes visuales de esta revisión; la cantidad de imágenes, resolución y fotogramas afectan al consumo de memoria. | Recomendación analítica de la guía | ||||
| Recuperación de documentos | Embeddings ligeros en inglés para búsqueda y agrupación | — | Media de tokens con máscara de atención y normalización L2 | Uso documentado por el editor | ||||
| Recuperación de documentos | Embeddings multilingües con prefijos distintos para consultas y documentos | — | Media con máscara y L2; query: para consultas y passage: para documentos | Uso documentado por el editor | ||||
| Recuperación de documentos | Embeddings multilingües para búsqueda semántica | — | Media con máscara y L2; query: para consultas y passage: para documentos | Uso documentado por el editor | ||||
| Recuperación de documentos | Modelo pequeño de embeddings en inglés para recuperación de documentos | — | Pooling CLS y normalización; instrucción de recuperación solo en las consultas | Uso documentado por el editor | ||||
| Reordenamiento de documentos | Reclasificador en inglés y chino para resultados de búsqueda | — | Cross-encoder sobre pares consulta–documento; puntuación de relevancia | Uso documentado por el editor | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Asistente pequeño de programación para explicar y corregir código | — | — | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Asistente de programación para generar, explicar y depurar código | — | — | Recomendación analítica de la guía | ||||
| Generación de texto, Generación basada en documentos, Extracción estructurada, Programación | Asistente de programación con mayor capacidad para problemas difíciles | — | — | Recomendación analítica de la guía | ||||
| Recuperación de documentos | Modelo pequeño de embeddings multilingües para ejecución en el dispositivo | — | Más de 100 idiomas; reducción de dimensiones con Matryoshka hasta 128 | Uso documentado por el editor | ||||
| Recuperación de documentos | Modelo de embeddings multilingües con adaptadores por tarea | — | Adaptadores retrieval.query / retrieval.passage; media de tokens y L2 | Uso documentado por el editor | ||||
| Reordenamiento de documentos | Reclasificador multilingüe para documentos más largos | — | Reclasificación multilingüe con entradas de hasta 1024 tokens; licencia no comercial | Uso documentado por el editor | ||||
| Recuperación de documentos | Modelo de embeddings en inglés para recuperación con instrucciones de consulta | — | Instrucción para la consulta: Represent this sentence for searching relevant passages: | Uso documentado por el editor | ||||
| Recuperación de documentos | Modelo de embeddings en inglés con contexto largo y dimensiones reducibles | — | Prefijo search_query: para consultas y search_document: para documentos; normalización y reducción de dimensiones | Uso documentado por el editor | ||||
| Extracción estructurada | Codificador base para entrenar clasificación y extracción de entidades | — | Codificador bidireccional; salida de tokens o cabeza de tarea entrenada | Uso documentado por el editor | ||||
| Autocompletado / FIM | Completado de código y relleno intermedio | Modelo base de programación con unos 1,54 mil millones de parámetros; para FIM y continuación de código, no chat con instrucciones. | Use el formato de completado / FIM de este modelo; no lo sustituya por la plantilla de chat de un modelo ajustado a instrucciones. | Uso documentado por el editor | ||||
| Autocompletado / FIM | Completado de código con atención de ventana deslizante | Modelo base de programación; entrada de 16 384 tokens y ventana de atención de 4096 tokens. Para completado, no como asistente de chat. | Use el formato de completado / FIM de este modelo; no lo sustituya por la plantilla de chat de un modelo ajustado a instrucciones. | Uso documentado por el editor | ||||
| Programación | Agente de programación | Modelo MoE con 80 mil millones de parámetros totales y 3 mil millones activos, atención híbrida y respuesta directa; la memoria de pesos corresponde al modelo completo. | — | Uso documentado por el editor | ||||
| Recuperación de documentos | Recuperación multilingüe con instrucciones de tarea | Embeddings de 1024 dimensiones; añada una instrucción de una frase a las consultas y pase los documentos sin ella. | Formato de consulta: Instruct: … Query: …; documentos sin instrucciones. Media con máscara y normalización L2; máximo de 512 tokens. | Uso documentado por el editor | ||||
| Generación de texto | Asistente pequeño de respuesta directa | Variante 4B ajustada a instrucciones con límite textual de 262 144 tokens; este checkpoint no tiene modo de razonamiento. | — | Uso documentado por el editor | ||||
| Recuperación de documentos | Embeddings de texto en persa | Variante pequeña de Tooka-SBERT-V2 con vectores de 768 dimensiones; candidato centrado en persa para recuperación y similitud textual. | Los metadatos obtenidos no especifican una licencia de uso. | Uso documentado por el editor | ||||
| Recuperación de documentos | Embeddings de texto en persa | Variante grande de Tooka-SBERT-V2 con vectores de 1024 dimensiones; los resultados PTEB no se pueden clasificar directamente frente a otras pruebas. | Los metadatos obtenidos no especifican una licencia de uso. | Uso documentado por el editor | ||||
| Extracción estructurada | Base de entrenamiento para tareas en persa | ParsBERT base para comprensión de texto persa; clasificación y NER requieren cabezas de tarea y entrenamiento. No es un modelo de embeddings de recuperación listo para usar. | Los pesos base por sí solos no son un clasificador ni un modelo NER listo para usar., Los metadatos obtenidos no especifican una licencia de uso. | Uso documentado por el editor | ||||
| Generación de texto | Generación de texto en lenguas ibéricas | Candidato de referencia para español y lenguas ibéricas, con resultados publicados por tarea. La variante 2B ajustada para instrucciones aporta una comparación lingüística; sus resultados no demuestran superioridad general. | — | Uso documentado por el editor | ||||
| Generación de texto | Generación de texto en lenguas ibéricas | Candidato de referencia para español y lenguas ibéricas, con resultados publicados por tarea. La variante 7B ajustada para instrucciones aporta una comparación lingüística; sus resultados no demuestran superioridad general. | — | Uso documentado por el editor | ||||
| Razonamiento | Razonamiento con un modelo compacto | Candidato compacto para razonamiento y uso de herramientas, con unos 2,52 mil millones de parámetros según los metadatos. Hay que separar las evaluaciones del desarrollador de las cifras tomadas de Artificial Analysis. Este paquete no acredita calidad específica en español o persa. | — | Uso documentado por el editor | ||||
| Extracción estructurada | Extracción de información en el dispositivo | Candidato compacto para extracción de datos y tareas acotadas en el dispositivo. El editor desaconseja usarlo para programación y tareas que requieren muchos conocimientos. Declara español, pero este paquete no aporta una puntuación específica de calidad en ese idioma. Tiene licencia propia. | — | Uso documentado por el editor | ||||
| Razonamiento | Razonamiento con un modelo compacto | Modelo de razonamiento Granite con modos thinking y non-thinking. La etiqueta 3B identifica la gama; los metadatos registran unos 3,66 mil millones de parámetros. Distinga el contexto nativo de 128K de la ampliación anunciada a 512K. | — | Uso documentado por el editor | ||||
| Recuperación de documentos | Recuperación multimodal | Recuperación de texto, imágenes y vídeo con vectores de 64–2048 dimensiones y un contexto de tarea de 32K tokens. | — | Recomendación analítica de la guía | ||||
| Recuperación de documentos | Recuperación multimodal | Recuperación de texto, imágenes y vídeo con vectores de 64–4096 dimensiones y un contexto de tarea de 32K tokens. | — | Recomendación analítica de la guía | ||||
| Reordenamiento de documentos | Reordenación multimodal | Puntúa la relevancia de texto, imágenes y vídeo respecto a la consulta; reordena candidatos con hasta 32K tokens. | — | Recomendación analítica de la guía | ||||
| Reordenamiento de documentos | Reordenación multimodal | Puntúa la relevancia de texto, imágenes y vídeo respecto a la consulta; reordena candidatos con hasta 32K tokens. | — | Recomendación analítica de la guía | ||||
| Generación de texto, Comprensión de imágenes, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Modelo textual y visual con atención híbrida | Qwen3.6-27B acepta texto, imágenes y vídeo. Pesos BF16 oficiales registrados; la memoria de atención híbrida requiere medición específica del motor. | — | Recomendación analítica de la guía | ||||
| Generación de texto, Comprensión de imágenes, Generación basada en documentos, Extracción estructurada, Razonamiento, Programación, Llamadas a herramientas | Modelo textual y visual con atención híbrida | Qwen3.6-35B-A3B acepta texto, imágenes y vídeo. Pesos BF16 oficiales registrados; la memoria de atención híbrida requiere medición específica del motor. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada de texto | Modelo dedicado a traducción con terminología y contexto; no se elige para chat general ni preguntas sobre documentos. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada de texto | Modelo dedicado a traducción con terminología y contexto; no se elige para chat general ni preguntas sobre documentos. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada | Traductor Hy-MT de segunda generación con instrucciones y control terminológico. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada | Traductor Hy-MT de segunda generación con instrucciones y control terminológico. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada | Traductor Hy-MT de segunda generación con instrucciones y control terminológico. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada | Traductor de texto e imágenes con límite de entrada de 2K y plantilla específica. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada | Traductor de texto e imágenes con límite de entrada de 2K y plantilla específica. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada | Traductor de texto e imágenes con límite de entrada de 2K y plantilla específica. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada | Traductor T5 con amplia cobertura; el prefijo de idioma destino forma parte de la entrada. | — | Recomendación analítica de la guía | ||||
| Generación de texto | Traducción especializada | Referencia de traducción para investigación, licencia no comercial y entradas de entrenamiento hasta 512 tokens. | — | Recomendación analítica de la guía | ||||
| Programación | Programación, agentes de software y análisis de texto e imágenes | Modelo multimodal de Xiaomi para programación, uso de herramientas y entradas largas; el checkpoint RL publica pesos con metadatos de licencia MIT. | Aproximadamente 1,02 billones de parámetros totales y 42 mil millones activos; los archivos ocupan 534,1 GiB. Este checkpoint no cabe en una sola GPU de 24 o 48 GB., Índice de inteligencia de Artificial Analysis v4.3.2: 46 para el servicio MiMo-V2.6-Pro; no es una evaluación en persa ni una prueba local del checkpoint RL. | Recomendación analítica de la guía |
«—» indica que no hay información registrada; no significa que el modelo carezca de esa capacidad.
Viabilidad en el hardware
Memoria para pesos, KV y ejecución con la configuración seleccionada.
Cálculo a partir de especificaciones. El contexto incluye historial, entrada y salida. Las solicitudes activas no equivalen a usuarios diarios.
Configuraciones de GPU · 3 Configuración seleccionada
Especificaciones en la guía de GPU →Método de cálculo y límites del escenario
Tamaño real del archivo de pesos + caché KV + reserva de ejecución. Los escenarios GGUF usan caché KV en FP16. La reserva predeterminada es de 2 GiB por GPU y de 4 GiB en CPU; son supuestos de planificación.
El cálculo de los modelos MoE incluye todos sus pesos. La capacidad nominal de la GPU se utiliza como presupuesto en GiB; para el despliegue se necesita la memoria libre que informa el dispositivo. La suma de la memoria de varias GPU no es memoria unificada.
Los escenarios FP32 de SmolLM2 usan FP32 para pesos y caché KV. Se excluyen los escenarios que superan el contexto del archivo seleccionado, incluido Aya Expanse 32B con el límite de 8192 tokens del archivo GGUF seleccionado.
Filtros avanzados 1 controles
Comparación de filas y condiciones
Regla de comparación: Las celdas de hardware comparten el escenario de su fila. Comparar filas requiere igualar las condiciones ajenas al hardware.
| Comparar | Detalles | Modelo | Versión de los pesos | RTX 4090 24GB | RTX 5090 32GB | RTX 6000 Ada 48GB | |||
|---|---|---|---|---|---|---|---|---|---|
| Q8_0 | 3,47 GiB | 0,6 GiB | 0,88 GiB | ||||||
| Q8_0 | 4,58 GiB | 1,71 GiB | 0,88 GiB | ||||||
| Q4_K_M | 5,45 GiB | 2,33 GiB | 1,13 GiB | ||||||
| Q8_0 | 7,11 GiB | 3,99 GiB | 1,13 GiB | ||||||
| Q4_K_M | 7,81 GiB | 4,68 GiB | 1,13 GiB | ||||||
| Q8_0 | 11,24 GiB | 8,11 GiB | 1,13 GiB | ||||||
| Q4_K_M | 11,63 GiB | 8,38 GiB | 1,25 GiB | ||||||
| Q8_0 | 17,87 GiB | 14,62 GiB | 1,25 GiB | ||||||
| Q4_K_M | 20,03 GiB | 17,28 GiB | 0,75 GiB | ||||||
| Q8_0 | 33 GiB | 30,25 GiB | 0,75 GiB | ||||||
| Q4_K_M | 22,4 GiB | 18,4 GiB | 2 GiB | ||||||
| Q8_0 | 36,43 GiB | 32,43 GiB | 2 GiB | ||||||
| Q4_K_M | 44,1 GiB | 39,6 GiB | 2,5 GiB | ||||||
| Q8_0 | 74,33 GiB | 69,83 GiB | 2,5 GiB | ||||||
| Q4_K_M | 11,87 GiB | 8,37 GiB | 1,5 GiB | ||||||
| Q8_0 | 18,12 GiB | 14,62 GiB | 1,5 GiB | ||||||
| Q4_K_M | 22,49 GiB | 18,49 GiB | 2 GiB | ||||||
| Q8_0 | 36,43 GiB | 32,43 GiB | 2 GiB | ||||||
| Q4_K_M | 6,8 GiB | 4,36 GiB | 0,44 GiB | ||||||
| Q8_0 | 9,98 GiB | 7,54 GiB | 0,44 GiB | ||||||
| Q4_K_M | 44,1 GiB | 39,6 GiB | 2,5 GiB | ||||||
| Q8_0 | 74,33 GiB | 69,83 GiB | 2,5 GiB | ||||||
| Q4_K_M | 7,58 GiB | 4,58 GiB | 1 GiB | ||||||
| Q8_0 | 10,95 GiB | 7,95 GiB | 1 GiB | ||||||
| Q4_K_M | 21,69 GiB | 18,44 GiB | 1,25 GiB | ||||||
| Q8_0 | 35,22 GiB | 31,97 GiB | 1,25 GiB | ||||||
| Q4_K_M | 7,71 GiB | 4,71 GiB | 1 GiB | ||||||
| Q8_0 | 10,95 GiB | 7,95 GiB | 1 GiB | ||||||
| Q4_K_M | 4,48 GiB | 0,98 GiB | 1,5 GiB | ||||||
| Q4_K_M | 2,27 GiB | 0,1 GiB | 0,18 GiB | ||||||
| Q8_0 | 2,31 GiB | 0,13 GiB | 0,18 GiB | ||||||
| Q8_0 | 2,67 GiB | 0,36 GiB | 0,31 GiB | ||||||
| Q4_K_M | 20,03 GiB | 17,28 GiB | 0,75 GiB | ||||||
| Q8_0 | 33 GiB | 30,25 GiB | 0,75 GiB | ||||||
| Q4_K_M | 7,81 GiB | 4,68 GiB | 1,13 GiB | ||||||
| Q8_0 | 11,24 GiB | 8,11 GiB | 1,13 GiB | ||||||
| Q4_K_M | 3,26 GiB | 1,04 GiB | 0,22 GiB | ||||||
| Q8_0 | 3,98 GiB | 1,76 GiB | 0,22 GiB | ||||||
| Q4_K_M | 4,06 GiB | 1,44 GiB | 0,63 GiB | ||||||
| Q8_0 | 5,13 GiB | 2,51 GiB | 0,63 GiB | ||||||
| Q4_K_M | 5,32 GiB | 2,32 GiB | 1 GiB | ||||||
| Q8_0 | 6,8 GiB | 3,8 GiB | 1 GiB | ||||||
| Q4_K_M | 7,07 GiB | 4,07 GiB | 1 GiB | ||||||
| Q8_0 | 10,17 GiB | 7,17 GiB | 1 GiB | ||||||
| Q4_K_M | 136,32 GiB | 132,85 GiB | 1,47 GiB | ||||||
| Q8_0 | 236,24 GiB | 232,77 GiB | 1,47 GiB | ||||||
| Q4_K_M | 274,8 GiB | 270,86 GiB | 1,94 GiB | ||||||
| Q8_0 | 479,24 GiB | 475,3 GiB | 1,94 GiB | ||||||
| Q4_K_M | 11,99 GiB | 8,43 GiB | 1,56 GiB | ||||||
| Q8_0 | 18,07 GiB | 14,51 GiB | 1,56 GiB | ||||||
| Q4_K_M | 6,8 GiB | 4,36 GiB | 0,44 GiB | ||||||
| Q8_0 | 9,98 GiB | 7,54 GiB | 0,44 GiB | ||||||
| Q4_K_M | 11,87 GiB | 8,37 GiB | 1,5 GiB | ||||||
| Q8_0 | 18,12 GiB | 14,62 GiB | 1,5 GiB | ||||||
| Q4_K_M | 22,49 GiB | 18,49 GiB | 2 GiB | ||||||
| Q8_0 | 36,43 GiB | 32,43 GiB | 2 GiB |
«—» indica que no hay información registrada; no significa que el modelo carezca de esa capacidad.
Software de inferencia y servicio
Comparación de software
Compara software de inferencia local y servicio de modelos.
Filtros avanzados 36 controles
Comparación de filas y condiciones
Regla de comparación: Las versiones pueden mostrarse juntas. Al comparar interfaces se mantiene el backend; al comparar el sistema completo puede variar.
| Comparar | Detalles | ¿Para qué sirve? | Ventaja práctica | Condición de elección | Empezar | ||
|---|---|---|---|---|---|---|---|
| Motor / biblioteca de inferencia, Servidor API, Gestor de modelos | Inicio local, desarrollo y servicios pequeños | Descarga y gestión de modelos e inicio de API en una herramienta | La ejecución local y en la nube son independientes; OLLAMA_NO_CLOUD=1 desactiva las rutas en la nube. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia, Servidor API | API de modelos de lenguaje con solicitudes simultáneas | Procesamiento continuo por lotes y gestión de caché KV; API compatible con OpenAI | GGUF requiere instalar por separado vllm-gguf-plugin; la compatibilidad con este formato es experimental. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia, Servidor API | Servicio de modelos de lenguaje y multimodales en una GPU o un clúster | Generación de texto, Procesamiento continuo por lotes, Caché de prefijos, Salida estructurada Los parsers de herramientas y los kernels de cuantización dependen de la arquitectura del modelo. Desde 0.5.20 ya no se publican paquetes ni imágenes CUDA 12; 0.5.19 es la última versión para esta vía. Las imágenes publicadas anteriormente siguen disponibles. El almacenamiento de Responses está desactivado por defecto. La recuperación, previous_response_id y las solicitudes en segundo plano requieren --enable-response-store; no puede activarse en despliegues con prefill y decode separados (PD). | Los parsers de herramientas y los kernels de cuantización dependen de la arquitectura del modelo. Desde 0.5.20 ya no se publican paquetes ni imágenes CUDA 12; 0.5.19 es la última versión para esta vía. Las imágenes publicadas anteriormente siguen disponibles. El almacenamiento de Responses está desactivado por defecto. La recuperación, previous_response_id y las solicitudes en segundo plano requieren --enable-response-store; no puede activarse en despliegues con prefill y decode separados (PD). | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia, Servidor API | Servicio multiusuario y cargas con prefijos compartidos | Procesamiento por lotes y caché de prefijos; ajuste según la carga | Los parsers de herramientas y kernels de cuantización dependen de la arquitectura; consulte la versión y los ajustes de cada fila junto con el resultado. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia, Servidor API | GGUF en CPU, GPU y RAM/VRAM combinadas | Control de cuantización, reparto de capas y ejecución en CPU | La ejecución parcial en CPU es distinta de la carga por capas de AirLLM. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia, Servidor API | Despliegue especializado en GPU de NVIDIA | Optimización de modelo, kernels y servicio | Las rutas compatibles y ajustes varían según versión y arquitectura. | Primeros pasos ↗ | |||
| Servidor API, Gestor de despliegue | Gestionar servicios de modelos y cadenas de inferencia | Gestión de modelos, planificación e integración de backends especializados | La versión 2.72.0 no incluye un contenedor del backend TensorRT-LLM. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia, Servidor API | Servicio de embeddings de documentos y consultas | Procesamiento por lotes y API de embeddings; imágenes para CPU y GPU | La compatibilidad con embeddings no implica reclasificación para todas las arquitecturas. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia | Ejecutar modelos grandes con VRAM limitada | Cargar y descargar capas mediante memoria del host y almacenamiento | El objetivo principal es reducir memoria de GPU; el chat simultáneo requiere una prueba de esa carga. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia, Servidor API | Investigación, control directo del modelo y rutas personalizadas | Acceso directo al modelo y a la lógica de procesamiento | La velocidad de una ruta sencilla de Transformers no representa todos los motores para ese modelo. | Primeros pasos ↗ | |||
| Pasarela de modelos, Servidor API | Gestionar varios proveedores y backends | API común, enrutamiento y gestión del consumo | La capacidad de ejecutar pesos procede del backend. | Primeros pasos ↗ | |||
| Interfaz de conversación | Panel de chat conectado a backends de modelos | Interfaz de chat para usuarios y conexión al motor | La memoria y velocidad del modelo corresponden al backend conectado. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia, Servidor API | Mantenimiento del servicio de generación de texto para modelos compatibles | Generación de texto, Distribución del modelo entre GPU (condicionado), Salida en streaming, Procesamiento continuo por lotes El repositorio está archivado y es de solo lectura desde el 21 de marzo de 2026. | El repositorio está archivado y es de solo lectura desde el 21 de marzo de 2026. | Primeros pasos ↗ | |||
| Interfaz de conversación, Gestor de modelos, Servidor API | Descargar modelos, conversar e iniciar una API local | Carga y descarga de modelos, Salida en streaming, Salida estructurada, Solicitudes simultáneas Las capacidades y los formatos del modelo dependen del motor elegido. | Las capacidades y los formatos del modelo dependen del motor elegido. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia | Cuando la memoria del sistema y la GPU forman parte del diseño del despliegue. | Ejecución heterogénea en CPU y GPU, con rutas optimizadas para modelos MoE compatibles. | El rendimiento depende del modelo, la CPU, la memoria y la configuración. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia | Para implementar y evaluar la capa de recuperación. | Embeddings para recuperación semántica y modelos CrossEncoder para puntuar o reordenar resultados. | La compatibilidad de la biblioteca no demuestra la calidad en cada tarea o idioma. | Primeros pasos ↗ | |||
| Motor / biblioteca de inferencia | Ejecución de la familia BGE y sus reclasificadores | Salidas densas, dispersas y multivector de BGE-M3 | Las tres salidas de BGE-M3 requieren diferentes formas de indexación y uso; la salida densa no sustituye a las tres. | Primeros pasos ↗ | |||
MLX LM · v0.31.3 | Motor / biblioteca de inferencia | Generación local y cuantización de modelos compatibles en Apple silicon | Generación de texto (condicionado), Salida en streaming (condicionado), Caché de prefijos (condicionado), Distribución del modelo entre GPU (condicionado) Ruta directa para generación local y cuantización en Apple silicon con modelos compatibles. No sume la memoria unificada dos veces como RAM y VRAM. El requisito de macOS 15 del README se refiere al bloqueo de memoria para modelos grandes, no a todas las funciones. | Ruta directa para generación local y cuantización en Apple silicon con modelos compatibles. No sume la memoria unificada dos veces como RAM y VRAM. El requisito de macOS 15 del README se refiere al bloqueo de memoria para modelos grandes, no a todas las funciones. | Primeros pasos ↗ |
«—» indica que no hay información registrada; no significa que el modelo carezca de esa capacidad.
Resultados de evaluación
Evidencias para elegir un modelo
Cómo se selecciona y compara
En MIRACL español, nDCG@10 pasa de 51,2 con Small a 53,7 con Large-Instruct. En inglés, Large obtiene 52,9 y Large-Instruct 51,5; en persa, 59,0 y 59,4. La media multilingüe no sustituye la comparación en el idioma de uso.
Dos cifras mostradas juntas no son automáticamente comparables para ordenar modelos. Revise variante, versión del benchmark, idioma, modo y protocolo. Una diferencia de puntuación no es una proporción de calidad ni demuestra significación estadística.
MIRACL · nDCG@10· español
| Modelo | Puntuación | Diferencia respecto a la primera fila | Fuente y configuración |
|---|---|---|---|
| 51,2 puntos / 100 | — | Fuente y configuraciónMultilingual E5 technical report, arXiv:2402.05672v1 ↗Informe del editor del modeloAppendix / detailed MIRACL results / language=es / column=1
| |
| 51,5 puntos / 100 | 0,3 | Fuente y configuraciónMultilingual E5 technical report, arXiv:2402.05672v1 ↗Informe del editor del modeloAppendix / detailed MIRACL results / language=es / column=2
| |
| 52,9 puntos / 100 | 1,7 | Fuente y configuraciónMultilingual E5 technical report, arXiv:2402.05672v1 ↗Informe del editor del modeloAppendix / detailed MIRACL results / language=es / column=3
| |
| 53,7 puntos / 100 | 2,5 | Fuente y configuraciónMultilingual E5 technical report, arXiv:2402.05672v1 ↗Informe del editor del modeloAppendix / detailed MIRACL results / language=es / column=4
|
MIRACL · Recall@100· español
| Modelo | Puntuación | Diferencia respecto a la primera fila | Fuente y configuración |
|---|---|---|---|
| 87,6 puntos / 100 | — | Fuente y configuraciónMultilingual E5 technical report, arXiv:2402.05672v1 ↗Informe del editor del modeloAppendix / detailed MIRACL results / language=es / column=5
| |
| 88,6 puntos / 100 | 1 | Fuente y configuraciónMultilingual E5 technical report, arXiv:2402.05672v1 ↗Informe del editor del modeloAppendix / detailed MIRACL results / language=es / column=6
| |
| 89,1 puntos / 100 | 1,5 | Fuente y configuraciónMultilingual E5 technical report, arXiv:2402.05672v1 ↗Informe del editor del modeloAppendix / detailed MIRACL results / language=es / column=7
| |
| 89,3 puntos / 100 | 1,7 | Fuente y configuraciónMultilingual E5 technical report, arXiv:2402.05672v1 ↗Informe del editor del modeloAppendix / detailed MIRACL results / language=es / column=8
|
Calidad en evaluaciones publicadas
MIRACL · nDCG@10 · español · / 100
| Seleccionar para comparar | Modelo | Puntuación y escala | Modo / subconjunto | Autor del informe | Fuente |
|---|---|---|---|---|---|
| 51,2 / 100 | —development | Microsoft E5 authorsInforme del editor | Condiciones y fuenteMIRACL · nDCG@10: 51,2Informe del editor · Microsoft E5 authors· es
Multilingual E5 technical report, arXiv:2402.05672v1 · Informe del editorhttps://arxiv.org/html/2402.05672v1 ↗
| ||
| 51,5 / 100 | —development | Microsoft E5 authorsInforme del editor | Condiciones y fuenteMIRACL · nDCG@10: 51,5Informe del editor · Microsoft E5 authors· es
Multilingual E5 technical report, arXiv:2402.05672v1 · Informe del editorhttps://arxiv.org/html/2402.05672v1 ↗
| ||
| 52,9 / 100 | —development | Microsoft E5 authorsInforme del editor | Condiciones y fuenteMIRACL · nDCG@10: 52,9Informe del editor · Microsoft E5 authors· es
Multilingual E5 technical report, arXiv:2402.05672v1 · Informe del editorhttps://arxiv.org/html/2402.05672v1 ↗
| ||
| 53,7 / 100 | —development | Microsoft E5 authorsInforme del editor | Condiciones y fuenteMIRACL · nDCG@10: 53,7Informe del editor · Microsoft E5 authors· es
Multilingual E5 technical report, arXiv:2402.05672v1 · Informe del editorhttps://arxiv.org/html/2402.05672v1 ↗
|
Modelos pequeños y especializados complementarios
Compara funciones especializadas, límites de entrada, dimensiones y resultados del idioma seleccionado.
Prueba de la columna de resultados: MIRACL · nDCG@10 · es
Esta selección se aplica a las columnas de resultados. Las condiciones figuran en los detalles de cada modelo.
Resultados agrupados por prueba ←Filtros avanzados 6 controles
Comparación de filas y condiciones
Regla de comparación: La métrica y la unidad deben describir la misma tarea; document/s no se convierte implícitamente en token/s.
| Comparar | Detalles | Tarea concreta | Tipo / dimensiones de salida | Idiomas y evidencia del idioma seleccionado | Licencia | Resultado del idioma seleccionado | Descarga y puesta en marcha | ||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Recuperación densa, dispersa y multivector | aproximadamente 0,569 mil millones | 8192 tokens | Vector denso de 1024 dimensiones + pesos de tokens + salida multivector | multilingual es: Sin evidencia registrada | MIT ↗ | — | 3,81 GiB / un millón de vectores | ||||
| Reclasificación de pares consulta–documento | aproximadamente 0,568 mil millones | 8192 tokens | Puntuación de relevancia; sigmoid opcional para el intervalo 0–1 | multilingual es: Sin evidencia registrada | Apache-2.0 ↗ | — | No almacena vectores fijos | ||||
| Recuperación semántica y embeddings de texto | aproximadamente 0,6 mil millones | 32.768 tokens | Vector denso; 1024 dimensiones predeterminadas / máximas | multilingual es: Sin evidencia registrada | Apache-2.0 ↗ | — | 3,81 GiB / un millón de vectores | ||||
| Recuperación semántica y embeddings de texto | aproximadamente 4 mil millones | 32.768 tokens | Vector denso; 2560 dimensiones predeterminadas / máximas | multilingual es: Sin evidencia registrada | Apache-2.0 ↗ | — | 9,54 GiB / un millón de vectores | ||||
| Recuperación semántica y embeddings de texto | aproximadamente 8 mil millones | 32.768 tokens | Vector denso; 4096 dimensiones predeterminadas / máximas | multilingual es: Sin evidencia registrada | Apache-2.0 ↗ | — | 15,26 GiB / un millón de vectores | ||||
| Reclasificación de pares consulta–documento | aproximadamente 0,6 mil millones | 32.768 tokens | Puntuación de relevancia del par de textos; sin salida de embeddings | multilingual es: Sin evidencia registrada | Apache-2.0 ↗ | — | No almacena vectores fijos | ||||
| Reclasificación de pares consulta–documento | aproximadamente 4 mil millones | 32.768 tokens | Puntuación de relevancia del par de textos; sin salida de embeddings | multilingual es: Sin evidencia registrada | Apache-2.0 ↗ | — | No almacena vectores fijos | ||||
| Reclasificación de pares consulta–documento | aproximadamente 8 mil millones | 32.768 tokens | Puntuación de relevancia del par de textos; sin salida de embeddings | multilingual es: Sin evidencia registrada | Apache-2.0 ↗ | — | No almacena vectores fijos | ||||
| Recuperación y similitud de texto | 0,118 mil millones | 512 tokens | Vector de 384 dimensiones | multilingual, af, am, ar, as, az, be, bg, bn, br, bs, ca, cs, cy, da, de, el, en, eo, es, et, eu, fa, fi, fr, fy, ga, gd, gl, gu, ha, he, hi, hr, hu, hy, id, is, it, ja, jv, ka, kk, km, kn, ko, ku, ky, la, lo, lt, lv, mg, mk, ml, mn, mr, ms, my, ne, nl, no, om, or, pa, pl, ps, pt, ro, ru, sa, sd, si, sk, sl, so, sq, sr, su, sv, sw, ta, te, th, tl, tr, ug, uk, ur, uz, vi, xh, yi, zh es: Resultado publicado | MIT ↗ | 1,43 GiB / un millón de vectores | |||||
| Recuperación y similitud de texto | 0,023 mil millones | 256 tokens | Vector de 384 dimensiones | en es: Sin evidencia registrada | Apache-2.0 ↗ | — | 1,43 GiB / un millón de vectores | ||||
| Recuperación y similitud de texto | 0,278 mil millones | 512 tokens | Vector de 768 dimensiones | multilingual, af, am, ar, as, az, be, bg, bn, br, bs, ca, cs, cy, da, de, el, en, eo, es, et, eu, fa, fi, fr, fy, ga, gd, gl, gu, ha, he, hi, hr, hu, hy, id, is, it, ja, jv, ka, kk, km, kn, ko, ku, ky, la, lo, lt, lv, mg, mk, ml, mn, mr, ms, my, ne, nl, no, om, or, pa, pl, ps, pt, ro, ru, sa, sd, si, sk, sl, so, sq, sr, su, sv, sw, ta, te, th, tl, tr, ug, uk, ur, uz, vi, xh, yi, zh es: Resultado publicado | MIT ↗ | 2,86 GiB / un millón de vectores | |||||
| Recuperación y similitud de texto | 0,56 mil millones | 512 tokens | Vector de 1024 dimensiones | multilingual, af, am, ar, as, az, be, bg, bn, br, bs, ca, cs, cy, da, de, el, en, eo, es, et, eu, fa, fi, fr, fy, ga, gd, gl, gu, ha, he, hi, hr, hu, hy, id, is, it, ja, jv, ka, kk, km, kn, ko, ku, ky, la, lo, lt, lv, mg, mk, ml, mn, mr, ms, my, ne, nl, no, om, or, pa, pl, ps, pt, ro, ru, sa, sd, si, sk, sl, so, sq, sr, su, sv, sw, ta, te, th, tl, tr, ug, uk, ur, uz, vi, xh, yi, zh es: Resultado publicado | MIT ↗ | 3,81 GiB / un millón de vectores | |||||
| Recuperación y similitud de texto | 0,033 mil millones | 512 tokens | Vector de 384 dimensiones | en es: Sin evidencia registrada | MIT ↗ | — | 1,43 GiB / un millón de vectores | ||||
| Reclasificación de resultados de búsqueda | 0,278 mil millones | 512 tokens | Puntuación de relevancia de consulta–documento | en, zh es: Sin evidencia registrada | MIT ↗ | — | No almacena vectores fijos | ||||
| Recuperación y similitud de texto | aproximadamente 0,3 mil millones nominales Recuento total de parámetros sin verificar | 2048 tokens | Vector de 768 dimensiones | multilingual es: Sin evidencia registrada | gemma ↗ Uso comercial sujeto a licencia | — | 2,86 GiB / un millón de vectores | ||||
| Recuperación y similitud de texto | aproximadamente 0,57 mil millones nominales Recuento total de parámetros sin verificar | 8192 tokens | Vector de 1024 dimensiones | multilingual, af, am, ar, as, az, be, bg, bn, br, bs, ca, cs, cy, da, de, el, en, eo, es, et, eu, fa, fi, fr, fy, ga, gd, gl, gu, ha, he, hi, hr, hu, hy, id, is, it, ja, jv, ka, kk, km, kn, ko, ku, ky, la, lo, lt, lv, mg, mk, ml, mn, mr, ms, my, ne, nl, no, om, or, pa, pl, ps, pt, ro, ru, sa, sd, si, sk, sl, so, sq, sr, su, sv, sw, ta, te, th, tl, tr, ug, uk, ur, uz, vi, xh, yi, zh es: Resultado publicado | CC-BY-NC-4.0 ↗ Uso comercial sujeto a licencia | — | 3,81 GiB / un millón de vectores | ||||
| Reclasificación de resultados de búsqueda | 0,278 mil millones | 1024 tokens | Puntuación de relevancia de consulta–documento | multilingual es: Sin evidencia registrada | CC-BY-NC-4.0 ↗ Uso comercial sujeto a licencia | — | No almacena vectores fijos | ||||
| Recuperación y similitud de texto | 0,335 mil millones | 512 tokens | Vector de 1024 dimensiones | en es: Sin evidencia registrada | Apache-2.0 ↗ | — | 3,81 GiB / un millón de vectores | ||||
| Recuperación y similitud de texto | 0,137 mil millones | 8192 tokens | Vector de 768 dimensiones | en es: Sin evidencia registrada | Apache-2.0 ↗ | — | 2,86 GiB / un millón de vectores | ||||
| Especialización en clasificación y reconocimiento de entidades | 0,15 mil millones | 8192 tokens | Representaciones de tokens; cabeza de tarea tras el entrenamiento | en es: Sin evidencia registrada | Apache-2.0 ↗ | — | No almacena vectores fijos | ||||
| Recuperación y similitud de texto | 0,56 mil millones | 512 tokens | Vector denso | af, am, ar, as, az, be, bg, bn, br, bs, ca, cs, cy, da, de, el, en, eo, es, et, eu, fa, fi, fr, fy, ga, gd, gl, gu, ha, he, hi, hr, hu, hy, id, is, it, ja, jv, ka, kk, km, kn, ko, ku, ky, la, lo, lt, lv, mg, mk, ml, mn, mr, ms, my, ne, nl, no, om, or, pa, pl, ps, pt, ro, ru, sa, sd, si, sk, sl, so, sq, sr, su, sv, sw, ta, te, th, tl, tr, ug, uk, ur, uz, vi, xh, yi, zh es: Resultado publicado | mit ↗ | 3,81 GiB / un millón de vectores | |||||
| Recuperación y similitud de texto | 0,123 mil millones | 512 tokens | Vector denso | fa es: Sin evidencia registrada | — | — | 2,86 GiB / un millón de vectores | ||||
| Recuperación y similitud de texto | 0,353 mil millones | 512 tokens | Vector denso | fa es: Sin evidencia registrada | — | — | 3,81 GiB / un millón de vectores | ||||
| Base para entrenar clasificación y reconocimiento de entidades | — | 512 tokens | Representaciones de tokens; la cabeza de tarea requiere entrenamiento | fa es: Sin evidencia registrada | — | — | No almacena vectores fijos | ||||
| Recuperación de texto, imágenes y vídeo | 2 mil millones | 32.768 tokens | Vector de hasta 2048 dimensiones | — es: Sin evidencia registrada | Apache-2.0 ↗ | — | 7,63 GiB / un millón de vectores | ||||
| Recuperación de texto, imágenes y vídeo | 8 mil millones | 32.768 tokens | Vector de hasta 4096 dimensiones | — es: Sin evidencia registrada | Apache-2.0 ↗ | — | 15,26 GiB / un millón de vectores | ||||
| Reordenador | 2 mil millones | 32.768 tokens | — | — es: Sin evidencia registrada | Apache-2.0 ↗ | — | No almacena vectores fijos | ||||
| Reordenador | 8 mil millones | 32.768 tokens | — | — es: Sin evidencia registrada | Apache-2.0 ↗ | — | No almacena vectores fijos |
«—» indica que no hay información registrada; no significa que el modelo carezca de esa capacidad.
Artículos de la guía
Selección de modelos, memoria, software de ejecución y evaluación de calidad.
RAG, CAG, KAG, fine-tuning e instruction tuning: ¿en qué se diferencian y cuál elegir?
Cuando un modelo no responde bien, ¿necesita más entrenamiento o simplemente acceso a la información adecuada? Mediante ejemplos sencillos, este artículo compara RAG, CAG y KAG con el fine-tuning y el instruction tuning: recuperar documentos, almacenar cálculos en caché, razonar sobre relaciones y cambiar el comportamiento del modelo. Una tabla comparativa y varios escenarios prácticos ayudan a distinguir la falta de conocimiento de un comportamiento inadecuado antes de invertir en entrenamiento, y a elegir el método o la combinación que necesita el proyecto.
RAG, CAG, KAG, fine-tuning e instruction tuning: ¿en qué se diferencian y cuál elegir?
Cuando un modelo no responde bien, ¿necesita más entrenamiento o simplemente acceso a la información adecuada? Mediante ejemplos sencillos, este artículo compara RAG, CAG y KAG con el fine-tuning y el instruction tuning: recuperar documentos, almacenar cálculos en caché, razonar sobre relaciones y cambiar el comportamiento del modelo. Una tabla comparativa y varios escenarios prácticos ayudan a distinguir la falta de conocimiento de un comportamiento inadecuado antes de invertir en entrenamiento, y a elegir el método o la combinación que necesita el proyecto.
INT8 o FP8: qué puede ejecutar realmente una GPU
Un formato de modelo de ocho bits no define su vía de ejecución. Hay que examinar los kernels, la memoria y la calidad antes de elegir hardware para inferencia de modelos de lenguaje.
INT8 o FP8: qué puede ejecutar realmente una GPU
Un formato de modelo de ocho bits no define su vía de ejecución. Hay que examinar los kernels, la memoria y la calidad antes de elegir hardware para inferencia de modelos de lenguaje.
Ollama, vLLM, SGLang o llama.cpp: cómo elegir el motor de inferencia
Cómo cambian la elección la planificación, la caché KV, los formatos y el control operativo: comparación de cuatro motores con un cálculo de memoria y un método reproducible.
Ollama, vLLM, SGLang o llama.cpp: cómo elegir el motor de inferencia
Cómo cambian la elección la planificación, la caché KV, los formatos y el control operativo: comparación de cuatro motores con un cálculo de memoria y un método reproducible.
Por qué la GPU más rápida no siempre ofrece la respuesta más rápida
Más capacidad de cálculo y una mayor tasa de tokens no siempre se traducen en una respuesta más rápida. Analizamos el tiempo hasta el primer token y hasta completar la respuesta, la memoria, la concurrencia, el reparto entre GPU y LPU y el coste de comunicación para elegir infraestructura según la capacidad de atender solicitudes con la calidad y latencia necesarias.
Por qué la GPU más rápida no siempre ofrece la respuesta más rápida
Más capacidad de cálculo y una mayor tasa de tokens no siempre se traducen en una respuesta más rápida. Analizamos el tiempo hasta el primer token y hasta completar la respuesta, la memoria, la concurrencia, el reparto entre GPU y LPU y el coste de comunicación para elegir infraestructura según la capacidad de atender solicitudes con la calidad y latencia necesarias.