Saltar al contenido
Revisión pendiente desde 29 jul 20263 fuentes primarias

Ollama, vLLM, SGLang y MLX: qué usar

La pregunta real no es cuál es mejor, sino cuál encaja con tu tarea, tu hardware y tu nivel de operación. Prototipar, servir a varios usuarios y exprimir un Mac no piden la misma herramienta.

Qué vas a conseguir ahora

Una decisión o prueba aplicada a «Ollama, vLLM, SGLang y MLX: qué usar».

  1. 1Entiende el criterio
  2. 2Haz una práctica pequeña
  3. 3Guarda una evidencia
Evidencia

Una nota breve con qué hiciste, qué salió bien, qué falló y qué revisarías después.

Objetivos de aprendizaje
  • Elegir runtime según caso de uso: prueba, RAG, agente o producción.
  • Evitar migraciones prematuras que complican sin aportar valor.
  • Medir latencia, memoria y errores antes de decidir.
En cristiano: runtime de inferencia. Es el programa que carga el modelo y responde peticiones. El modelo puede ser el mismo, pero la experiencia cambia muchísimo según el runtime.

Decisión rápida

  • Ollama: empezar rápido, demos, escritorio, cursos y prototipos.
  • llama.cpp: control fino, GGUF, CPU/GPU sencilla y despliegues pequeños.
  • vLLM: muchas peticiones, API compatible, batching y GPU NVIDIA.
  • SGLang: serving avanzado, flujos estructurados y cargas complejas.
  • MLX: Apple Silicon, experimentación local eficiente en Mac.
Terminal
Mide antes de opinar:

caso: "chat_rag_pyme"
modelo: "local-coder"
hardware: "Mac M4 24GB"
runtime: "Ollama"
metricas:
  first_token_ms: 850
  tokens_s: 28
  ram_gb: 11
  errores_20_preguntas: 2
decision: "suficiente para prototipo; no migrar todavía"
Idea clave. Si solo tienes un usuario y una cola pequeña, Ollama puede ser suficiente. Si empiezas a tener concurrencia, colas y acuerdos de tiempo de respuesta, mira vLLM, SGLang o un gateway.
Cuidado. No mezcles benchmark de internet con tu caso. Un ranking no sabe si tus documentos son largos, si usas tool calling o si tu GPU se queda sin VRAM.
Comprueba que funciona. Ejecuta las mismas 20 preguntas con el mismo prompt, modelo y documentos en dos runtimes. Compara latencia, errores, consumo y facilidad de operación.
Guardar y reabrir el proyecto.
Guarda una tabla de decisión por proyecto. Dentro de tres meses te evitará discutir otra vez por qué elegiste ese stack.

Si has guardado la evidencia de esta lección, continúa con «Windows/WSL2 vs Mac». Si no, repite la comprobación antes de avanzar.

Mapa completo de AulafyConsulta cómo encaja esta lección sin salir de tu ruta.

Mapa completo de Aulafy

Cómo se relacionan todos los cursos

No es una lista que debas completar. Empieza por la base, elige un resultado y profundiza solo cuando tu proyecto necesite más control.

  1. 1Comprender
  2. 2Aplicar o construir
  3. 3Operar con confianza
01

Empieza aquí

Crea una base común: qué puede hacer la IA, cómo pedir resultados y cómo comprobarlos antes de especializarte.

Desde esta base puedes aplicar la IA a una tarea o aprender a construir con código.

02

Elige una aplicación

Convierte la base en un resultado visible: una web, una mejora de negocio, contenido o una experiencia interactiva.

Si necesitas mantener código, datos o infraestructura, continúa por la rama técnica.

03

Construye con código

Prepara el entorno, trabaja con agentes de programación y aprende a ejecutar modelos con control sobre tus proyectos.

Esta rama prepara los conocimientos necesarios para diseñar y operar sistemas de IA fiables.

04

Lleva sistemas a producción

Combina recuperación, agentes, evaluación, seguridad, despliegue y adaptación de modelos cuando el problema lo exija.

No es obligatorio completarlo todo: elige solo la pieza que tu sistema necesita y vuelve al mapa cuando crezca.

Ver catálogo completo