- Elegir runtime según caso de uso: prueba, RAG, agente o producción.
- Evitar migraciones prematuras que complican sin aportar valor.
- Medir latencia, memoria y errores antes de decidir.
Decisión rápida
- Ollama: empezar rápido, demos, escritorio, cursos y prototipos.
- llama.cpp: control fino, GGUF, CPU/GPU sencilla y despliegues pequeños.
- vLLM: muchas peticiones, API compatible, batching y GPU NVIDIA.
- SGLang: serving avanzado, flujos estructurados y cargas complejas.
- MLX: Apple Silicon, experimentación local eficiente en Mac.
Mide antes de opinar: caso: "chat_rag_pyme" modelo: "local-coder" hardware: "Mac M4 24GB" runtime: "Ollama" metricas: first_token_ms: 850 tokens_s: 28 ram_gb: 11 errores_20_preguntas: 2 decision: "suficiente para prototipo; no migrar todavía"
Fuentes oficiales
Si has guardado la evidencia de esta lección, continúa con «Windows/WSL2 vs Mac». Si no, repite la comprobación antes de avanzar.