Los últimos modelos de IA local de 2026: Kimi K3, Inkling, Laguna, DeepSeek, Qwen, Muse y Nemotron
Entre mediados de julio y mediados de agosto de 2026 apareció una generación especialmente variada de modelos descargables: gigantes de frontera, modelos MoE eficientes y opciones pensadas para agentes locales. Esta guía separa capacidad, tamaño y viabilidad para ayudarte a elegir qué merece una prueba en tu hardware.

La conclusión rápida
No existe un único ganador local. Kimi K3 y Qwen3.8-Max persiguen capacidad de frontera, pero exigen infraestructura de servidor. Inkling e Inkling-Small priorizan multimodalidad y personalización. Laguna S 2.1 y DeepSeek V4 Flash destacan en código con arquitecturas MoE. Muse Glimmer apunta a una GPU de consumo potente y Nemotron 3.5 Lightning prioriza velocidad y volumen.
- Máxima capacidad: Kimi K3 y Qwen3.8-Max.
- Código y agentes con mejor equilibrio: Laguna S 2.1 y DeepSeek V4 Flash 0731.
- Multimodal y personalizable: Inkling-Small.
- Hardware de consumo: Muse Glimmer, si la cuantización cabe en tu VRAM.
- Alto throughput: Nemotron 3.5 Lightning.
Kimi K3: frontera abierta, no modelo de portátil
Moonshot publica Kimi K3 con 2,8T parámetros totales, unos 104B activos, contexto de un millón de tokens y entrada multimodal. Sus resultados publicados, como 93,5 en GPQA Diamond y 88,3 en Terminal-Bench 2.1, lo sitúan cerca de modelos cerrados de frontera. El límite es físico: incluso MXFP4 requiere infraestructura distribuida y alrededor de 1,5 TB para pesos y sobrecarga operativa.
- Adecuado para centros de datos, proveedores de inferencia e investigación.
- No debe venderse como una instalación doméstica por el simple hecho de tener pesos descargables.
- Licencia propia Kimi K3: revisa sus condiciones antes de redistribuir o integrar a gran escala.
Inkling e Inkling-Small: multimodalidad abierta
Thinking Machines Lab lanzó Inkling, un MoE de 975B totales y 41B activos, y después Inkling-Small, de 276B y 12B activos. Ambos aceptan texto, imagen y audio, ofrecen hasta un millón de tokens de contexto y usan Apache 2.0. Small puede igualar o superar al grande en algunas tareas, una buena advertencia contra elegir solo por número de parámetros.
- Inkling-Small es la opción práctica de la familia, aunque sigue necesitando hardware de servidor o cuantización agresiva.
- La ficha oficial advierte que algunos resultados se obtuvieron con un checkpoint distinto al publicado.
- Son candidatos interesantes para ajuste y productos multimodales propios.
Laguna S 2.1 y DeepSeek V4 Flash: foco en agentes de código
Laguna S 2.1 combina 117,6B parámetros con 8,5B activos y publica 70,2 en Terminal-Bench 2.1 y 78,5 en SWE-bench Multilingual. DeepSeek V4 Flash 0731 usa unos 284B totales y 13B activos, un millón de tokens de contexto y publica 82,7 en Terminal-Bench 2.1. Los dos son grandes, pero su activación dispersa mejora el coste por token frente a modelos densos equivalentes.
- Laguna dispone de GGUF y MLX; una cuantización razonable sigue ocupando decenas de GB.
- DeepSeek Flash es una opción fuerte para agentes y servidores compatibles con APIs de código.
- Antes de adoptar, repite tus propias incidencias y tests con el mismo harness.
Qwen3.8-Max, Muse Glimmer y Nemotron 3.5 Lightning
Qwen3.8-Max representa la clase Max de Qwen con 2,4T totales y unos 95B activos; está orientado a agentes y trabajo multimodal de largo horizonte. Muse Glimmer, un modelo denso de 30B, busca ofrecer código y herramientas en menos de 20 GB con cuantización de 4 bits. Nemotron 3.5 Lightning usa una arquitectura híbrida muy dispersa, con unos 30B totales y 3B activos, para maximizar throughput más que inteligencia absoluta.
- Qwen3.8-Max pertenece a infraestructura de clúster; la variante 27B es la candidata local.
- Muse Glimmer es el punto de entrada para una GPU de 24 GB y agentes siempre activos.
- Nemotron Lightning encaja en clasificación, extracción y agentes de alto volumen donde la latencia importa.
- Comprueba siempre repositorio, licencia y revisión exacta antes de descargar: estos lanzamientos cambian con rapidez.
Qué muestran los benchmarks vivos de local.ai
La fotografía de local.ai consultada el 16 de agosto añade algo que los benchmarks del fabricante no ofrecen: ejecuciones sobre hardware real con inteligencia agregada, tiempo, energía y tamaño de cuantización. En sus mejores runs, DeepSeek V4 Flash 0731 ronda un 77% de Intelligence con cuantizaciones de unos 90-104 GB; Laguna S 2.1 varía aproximadamente entre 57% y 72% según cuantización y entorno; Nemotron 3.5 Lightning alcanza alrededor de 66% ocupando cerca de 22 GB. Qwen3.6 27B y 35B-A3B aparecen como referencias muy eficientes, aunque no sean lanzamientos centrales de esta lista.
- No compares porcentajes sin abrir el run: cambian modelo, cuantización, runtime y hardware.
- Una cuantización pequeña puede ganar en tiempo y energía aunque pierda calidad absoluta.
- Intelligence por joule favorece a menudo modelos medianos como Qwen3.6 35B-A3B y Nemotron Lightning.
- local.ai es un panel vivo: conserva fecha y configuración cuando cites un resultado.
Mac, RTX o DGX Spark: resultados que cambian la compra
Los runs aportados muestran el intercambio entre capacidad y velocidad. Un M5 Max con 128 GB puede cargar DeepSeek V4 Flash o Laguna cuantizados con consumos aproximados de 35-45 W, pero algunas tareas tardan entre cinco y once minutos. Una RTX 5090 de 32 GB resuelve modelos de 27-35B mucho más rápido, a menudo por debajo de dos minutos, a cambio de mayor consumo y un límite de VRAM estricto. DGX Spark y RTX PRO 6000 permiten mejores cuantizaciones de los modelos grandes.
- Mac Mini M4 Pro 48 GB: Qwen3.6 35B-A3B ofrece un equilibrio fuerte en tareas de 6-7 minutos y unos 18-22 W.
- M5 Max 128 GB: prioriza capacidad y eficiencia energética frente a velocidad máxima.
- RTX 5090: prioriza velocidad para modelos que caben completamente en 32 GB.
- Comprar hardware solo para ahorrar API rara vez se justifica sin medir volumen, privacidad y coste total durante varios años.
Cómo elegir sin dejarte llevar por el benchmark
Empieza por memoria disponible, tarea y tolerancia a errores. Ejecuta entre 20 y 50 casos propios y registra calidad, latencia, tokens por segundo, energía, reintentos y memoria máxima. Un modelo que gana un benchmark puede perder en tu idioma, tus herramientas o tu formato de salida.
- 8-16 GB de memoria: usa modelos menores o destilados, no esta lista de gigantes.
- 24 GB de VRAM: considera modelos de 27-32B a 4 bits.
- 64-128 GB de memoria unificada: Laguna cuantizado o modelos MoE medianos pueden ser viables.
- Clúster: Kimi K3, Qwen3.8-Max e Inkling completo pasan a ser opciones reales.
Comparativa rápida
| Modelo | Tamaño / activos | Contexto | Uso recomendado |
|---|---|---|---|
| Kimi K3 | 2,8T / 104B | 1M | Frontera y clúster |
| Inkling / Small | 975B / 41B · 276B / 12B | 1M | Multimodal y ajuste |
| Laguna S 2.1 | 117,6B / 8,5B | 262K nativo; hasta 1M | Código local potente |
| DeepSeek V4 Flash 0731 | 284B / 13B | 1M | Agentes de código |
| Qwen3.8-Max | 2,4T / 95B | 1M | Agentes multimodales |
| Muse Glimmer | 30B denso | 131K | GPU de consumo |
| Nemotron 3.5 Lightning | ~30B / ~3B | 1M | Velocidad y volumen |
Preguntas frecuentes
¿Cuál es el mejor modelo para una GPU de 24 GB?
De esta lista, Muse Glimmer a 4 bits es el candidato más directo. También conviene comparar variantes de 27-32B y medir calidad real antes de elegir.
¿Puedo ejecutar Kimi K3 o Qwen3.8-Max en casa?
No de forma práctica con hardware doméstico convencional. Que los pesos sean descargables no elimina la memoria, almacenamiento y comunicación necesarios.
¿Open-weight significa open source?
No siempre. Revisa la licencia de cada checkpoint: Apache 2.0, MIT, OpenMDW o licencias propias conceden derechos y obligaciones diferentes.
Fuentes consultadas
- local.ai · benchmarks independientes en hardware real — Panel vivo consultado el 16 de agosto de 2026; abre cada run para comprobar hardware, runtime y cuantización.
- Kimi K3 model card
- Thinking Machines · Introducing Inkling
- Thinking Machines · Inkling-Small
- Poolside · Laguna S 2.1 model card
- DeepSeek V4 Flash 0731 checkpoint