- Elegir entre Ollama, llama.cpp, vLLM, LiteLLM y Ray Serve según el caso.
- Distinguir demo local, servicio interno y producción real.
- Diseñar una arquitectura mínima con gateway, observabilidad y evals.
Regla rápida
- Ollama: prototipos locales, enseñanza, apps personales y equipos pequeños.
- llama.cpp server: GGUF ligero, CPU/GPU modesta, control fino y servidor local simple.
- vLLM: GPUs, alto rendimiento, batching, API compatible OpenAI y modelos grandes.
- LiteLLM: gateway para unificar proveedores, claves, presupuestos, caché y fallbacks.
- Ray Serve: escalar varias réplicas, multi-modelo, autoscaling y patrones de producción.
Arquitectura mínima
app web -> API propia /api/chat -> gateway LiteLLM -> backend local: llama.cpp | vLLM | Ollama -> observabilidad: Langfuse / OpenTelemetry -> evals: promptfoo o tests propios -> logs: request_id, modelo, latencia, coste, resultado
Si has guardado la evidencia de esta lección, continúa con «llama.cpp server». Si no, repite la comprobación antes de avanzar.