Saltar al contenido
Aulafy
Inicio/Blog/IA local
IA local · Actualizado 16 de agosto de 2026 · 14 min

Los últimos modelos de IA local de 2026: Kimi K3, Inkling, Laguna, DeepSeek, Qwen, Muse y Nemotron

Entre mediados de julio y mediados de agosto de 2026 apareció una generación especialmente variada de modelos descargables: gigantes de frontera, modelos MoE eficientes y opciones pensadas para agentes locales. Esta guía separa capacidad, tamaño y viabilidad para ayudarte a elegir qué merece una prueba en tu hardware.

Revisado el 16 de agosto de 2026. Las cifras son resultados publicados por fabricantes o fichas de modelo; no son comparables sin igualar harness, presupuesto de cómputo y configuración. 'Open-weight' no significa que el modelo sea práctico en un portátil.
Los últimos modelos de IA local de 2026: Kimi K3, Inkling, Laguna, DeepSeek, Qwen, Muse y Nemotron

La conclusión rápida

No existe un único ganador local. Kimi K3 y Qwen3.8-Max persiguen capacidad de frontera, pero exigen infraestructura de servidor. Inkling e Inkling-Small priorizan multimodalidad y personalización. Laguna S 2.1 y DeepSeek V4 Flash destacan en código con arquitecturas MoE. Muse Glimmer apunta a una GPU de consumo potente y Nemotron 3.5 Lightning prioriza velocidad y volumen.

  • Máxima capacidad: Kimi K3 y Qwen3.8-Max.
  • Código y agentes con mejor equilibrio: Laguna S 2.1 y DeepSeek V4 Flash 0731.
  • Multimodal y personalizable: Inkling-Small.
  • Hardware de consumo: Muse Glimmer, si la cuantización cabe en tu VRAM.
  • Alto throughput: Nemotron 3.5 Lightning.

Kimi K3: frontera abierta, no modelo de portátil

Moonshot publica Kimi K3 con 2,8T parámetros totales, unos 104B activos, contexto de un millón de tokens y entrada multimodal. Sus resultados publicados, como 93,5 en GPQA Diamond y 88,3 en Terminal-Bench 2.1, lo sitúan cerca de modelos cerrados de frontera. El límite es físico: incluso MXFP4 requiere infraestructura distribuida y alrededor de 1,5 TB para pesos y sobrecarga operativa.

  • Adecuado para centros de datos, proveedores de inferencia e investigación.
  • No debe venderse como una instalación doméstica por el simple hecho de tener pesos descargables.
  • Licencia propia Kimi K3: revisa sus condiciones antes de redistribuir o integrar a gran escala.

Inkling e Inkling-Small: multimodalidad abierta

Thinking Machines Lab lanzó Inkling, un MoE de 975B totales y 41B activos, y después Inkling-Small, de 276B y 12B activos. Ambos aceptan texto, imagen y audio, ofrecen hasta un millón de tokens de contexto y usan Apache 2.0. Small puede igualar o superar al grande en algunas tareas, una buena advertencia contra elegir solo por número de parámetros.

  • Inkling-Small es la opción práctica de la familia, aunque sigue necesitando hardware de servidor o cuantización agresiva.
  • La ficha oficial advierte que algunos resultados se obtuvieron con un checkpoint distinto al publicado.
  • Son candidatos interesantes para ajuste y productos multimodales propios.

Laguna S 2.1 y DeepSeek V4 Flash: foco en agentes de código

Laguna S 2.1 combina 117,6B parámetros con 8,5B activos y publica 70,2 en Terminal-Bench 2.1 y 78,5 en SWE-bench Multilingual. DeepSeek V4 Flash 0731 usa unos 284B totales y 13B activos, un millón de tokens de contexto y publica 82,7 en Terminal-Bench 2.1. Los dos son grandes, pero su activación dispersa mejora el coste por token frente a modelos densos equivalentes.

  • Laguna dispone de GGUF y MLX; una cuantización razonable sigue ocupando decenas de GB.
  • DeepSeek Flash es una opción fuerte para agentes y servidores compatibles con APIs de código.
  • Antes de adoptar, repite tus propias incidencias y tests con el mismo harness.

Qwen3.8-Max, Muse Glimmer y Nemotron 3.5 Lightning

Qwen3.8-Max representa la clase Max de Qwen con 2,4T totales y unos 95B activos; está orientado a agentes y trabajo multimodal de largo horizonte. Muse Glimmer, un modelo denso de 30B, busca ofrecer código y herramientas en menos de 20 GB con cuantización de 4 bits. Nemotron 3.5 Lightning usa una arquitectura híbrida muy dispersa, con unos 30B totales y 3B activos, para maximizar throughput más que inteligencia absoluta.

  • Qwen3.8-Max pertenece a infraestructura de clúster; la variante 27B es la candidata local.
  • Muse Glimmer es el punto de entrada para una GPU de 24 GB y agentes siempre activos.
  • Nemotron Lightning encaja en clasificación, extracción y agentes de alto volumen donde la latencia importa.
  • Comprueba siempre repositorio, licencia y revisión exacta antes de descargar: estos lanzamientos cambian con rapidez.

Qué muestran los benchmarks vivos de local.ai

La fotografía de local.ai consultada el 16 de agosto añade algo que los benchmarks del fabricante no ofrecen: ejecuciones sobre hardware real con inteligencia agregada, tiempo, energía y tamaño de cuantización. En sus mejores runs, DeepSeek V4 Flash 0731 ronda un 77% de Intelligence con cuantizaciones de unos 90-104 GB; Laguna S 2.1 varía aproximadamente entre 57% y 72% según cuantización y entorno; Nemotron 3.5 Lightning alcanza alrededor de 66% ocupando cerca de 22 GB. Qwen3.6 27B y 35B-A3B aparecen como referencias muy eficientes, aunque no sean lanzamientos centrales de esta lista.

  • No compares porcentajes sin abrir el run: cambian modelo, cuantización, runtime y hardware.
  • Una cuantización pequeña puede ganar en tiempo y energía aunque pierda calidad absoluta.
  • Intelligence por joule favorece a menudo modelos medianos como Qwen3.6 35B-A3B y Nemotron Lightning.
  • local.ai es un panel vivo: conserva fecha y configuración cuando cites un resultado.

Mac, RTX o DGX Spark: resultados que cambian la compra

Los runs aportados muestran el intercambio entre capacidad y velocidad. Un M5 Max con 128 GB puede cargar DeepSeek V4 Flash o Laguna cuantizados con consumos aproximados de 35-45 W, pero algunas tareas tardan entre cinco y once minutos. Una RTX 5090 de 32 GB resuelve modelos de 27-35B mucho más rápido, a menudo por debajo de dos minutos, a cambio de mayor consumo y un límite de VRAM estricto. DGX Spark y RTX PRO 6000 permiten mejores cuantizaciones de los modelos grandes.

  • Mac Mini M4 Pro 48 GB: Qwen3.6 35B-A3B ofrece un equilibrio fuerte en tareas de 6-7 minutos y unos 18-22 W.
  • M5 Max 128 GB: prioriza capacidad y eficiencia energética frente a velocidad máxima.
  • RTX 5090: prioriza velocidad para modelos que caben completamente en 32 GB.
  • Comprar hardware solo para ahorrar API rara vez se justifica sin medir volumen, privacidad y coste total durante varios años.

Cómo elegir sin dejarte llevar por el benchmark

Empieza por memoria disponible, tarea y tolerancia a errores. Ejecuta entre 20 y 50 casos propios y registra calidad, latencia, tokens por segundo, energía, reintentos y memoria máxima. Un modelo que gana un benchmark puede perder en tu idioma, tus herramientas o tu formato de salida.

  • 8-16 GB de memoria: usa modelos menores o destilados, no esta lista de gigantes.
  • 24 GB de VRAM: considera modelos de 27-32B a 4 bits.
  • 64-128 GB de memoria unificada: Laguna cuantizado o modelos MoE medianos pueden ser viables.
  • Clúster: Kimi K3, Qwen3.8-Max e Inkling completo pasan a ser opciones reales.

Comparativa rápida

ModeloTamaño / activosContextoUso recomendado
Kimi K32,8T / 104B1MFrontera y clúster
Inkling / Small975B / 41B · 276B / 12B1MMultimodal y ajuste
Laguna S 2.1117,6B / 8,5B262K nativo; hasta 1MCódigo local potente
DeepSeek V4 Flash 0731284B / 13B1MAgentes de código
Qwen3.8-Max2,4T / 95B1MAgentes multimodales
Muse Glimmer30B denso131KGPU de consumo
Nemotron 3.5 Lightning~30B / ~3B1MVelocidad y volumen

Preguntas frecuentes

¿Cuál es el mejor modelo para una GPU de 24 GB?

De esta lista, Muse Glimmer a 4 bits es el candidato más directo. También conviene comparar variantes de 27-32B y medir calidad real antes de elegir.

¿Puedo ejecutar Kimi K3 o Qwen3.8-Max en casa?

No de forma práctica con hardware doméstico convencional. Que los pesos sean descargables no elimina la memoria, almacenamiento y comunicación necesarios.

¿Open-weight significa open source?

No siempre. Revisa la licencia de cada checkpoint: Apache 2.0, MIT, OpenMDW o licencias propias conceden derechos y obligaciones diferentes.

Fuentes consultadas

Sigue aprendiendo