Saltar al contenido
Cursos/MLOps local/Mapa de serving
Revisión pendiente desde 29 jul 20263 fuentes primarias

Mapa de serving: Ollama, llama.cpp, vLLM

Ejecutar un modelo en tu máquina es el primer paso. Servirlo bien significa API estable, límites, logs, métricas, colas, caché y una forma clara de cambiar de modelo sin romper la app.

Qué vas a conseguir ahora

Una decisión o prueba aplicada a «Mapa de serving: Ollama, llama.cpp, vLLM».

  1. 1Entiende el criterio
  2. 2Haz una práctica pequeña
  3. 3Guarda una evidencia
Evidencia

Una nota breve con qué hiciste, qué salió bien, qué falló y qué revisarías después.

Objetivos de aprendizaje
  • Elegir entre Ollama, llama.cpp, vLLM, LiteLLM y Ray Serve según el caso.
  • Distinguir demo local, servicio interno y producción real.
  • Diseñar una arquitectura mínima con gateway, observabilidad y evals.
En cristiano: serving. Es poner el modelo detrás de una API para que otras aplicaciones lo usen de forma estable, medible y controlada.

Regla rápida

  • Ollama: prototipos locales, enseñanza, apps personales y equipos pequeños.
  • llama.cpp server: GGUF ligero, CPU/GPU modesta, control fino y servidor local simple.
  • vLLM: GPUs, alto rendimiento, batching, API compatible OpenAI y modelos grandes.
  • LiteLLM: gateway para unificar proveedores, claves, presupuestos, caché y fallbacks.
  • Ray Serve: escalar varias réplicas, multi-modelo, autoscaling y patrones de producción.
Idea clave. La API compatible con OpenAI se ha convertido en un puente práctico: puedes cambiar backend sin reescribir toda la aplicación.

Arquitectura mínima

Terminal
app web
  -> API propia /api/chat
  -> gateway LiteLLM
  -> backend local: llama.cpp | vLLM | Ollama
  -> observabilidad: Langfuse / OpenTelemetry
  -> evals: promptfoo o tests propios
  -> logs: request_id, modelo, latencia, coste, resultado
Cuidado. No expongas directamente el servidor del modelo a internet. Pon una API delante con autenticación, límites, logs y validación.
Comprueba que funciona. Decide para tu caso: si tienes una GPU potente y varios usuarios, mira vLLM; si quieres portátil o mini PC, empieza por llama.cpp/Ollama; si hay varios proveedores, pon LiteLLM delante.
Guardar y reabrir el proyecto.
MLOps para IA no empieza con Kubernetes. Empieza con una API medible, límites claros y capacidad de cambiar modelo sin romper el producto.

Si has guardado la evidencia de esta lección, continúa con «llama.cpp server». Si no, repite la comprobación antes de avanzar.

Mapa completo de AulafyConsulta cómo encaja esta lección sin salir de tu ruta.

Mapa completo de Aulafy

Cómo se relacionan todos los cursos

No es una lista que debas completar. Empieza por la base, elige un resultado y profundiza solo cuando tu proyecto necesite más control.

  1. 1Comprender
  2. 2Aplicar o construir
  3. 3Operar con confianza
01

Empieza aquí

Crea una base común: qué puede hacer la IA, cómo pedir resultados y cómo comprobarlos antes de especializarte.

Desde esta base puedes aplicar la IA a una tarea o aprender a construir con código.

02

Elige una aplicación

Convierte la base en un resultado visible: una web, una mejora de negocio, contenido o una experiencia interactiva.

Si necesitas mantener código, datos o infraestructura, continúa por la rama técnica.

03

Construye con código

Prepara el entorno, trabaja con agentes de programación y aprende a ejecutar modelos con control sobre tus proyectos.

Esta rama prepara los conocimientos necesarios para diseñar y operar sistemas de IA fiables.

04

Lleva sistemas a producción

Combina recuperación, agentes, evaluación, seguridad, despliegue y adaptación de modelos cuando el problema lo exija.

No es obligatorio completarlo todo: elige solo la pieza que tu sistema necesita y vuelve al mapa cuando crezca.

Ver catálogo completo