Saltar al contenido
Revisión pendiente desde 29 jul 20263 fuentes primarias

vLLM con API compatible OpenAI

vLLM está pensado para servir modelos de forma eficiente en GPU. Su gran ventaja práctica: expone una API compatible con OpenAI, así muchas apps pueden cambiar de backend con pocos cambios.

Qué vas a conseguir ahora

Una decisión o prueba aplicada a «vLLM con API compatible OpenAI».

  1. 1Entiende el criterio
  2. 2Haz una práctica pequeña
  3. 3Guarda una evidencia
Evidencia

Una nota breve con qué hiciste, qué salió bien, qué falló y qué revisarías después.

Objetivos de aprendizaje
  • Levantar un servidor vLLM para pruebas locales o de laboratorio.
  • Conectar una app usando el cliente OpenAI apuntando a tu endpoint.
  • Medir latencia, tokens por segundo y errores básicos.
En cristiano: API compatible OpenAI. Tu servidor acepta rutas y formato parecidos a OpenAI. La app no necesita saber si detrás hay OpenAI, vLLM, llama.cpp o un gateway.

Servidor mínimo

Terminal
python -m venv .venv
source .venv/bin/activate
pip install -U vllm

vllm serve Qwen/Qwen3-8B \
  --host 127.0.0.1 \
  --port 8000
Idea clave. La documentación oficial de vLLM indica que puede servir modelos con protocolo compatible OpenAI y que por defecto suele escuchar en localhost:8000.

Cliente OpenAI contra vLLM

Terminal
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "local",
  baseURL: "http://127.0.0.1:8000/v1",
});

const response = await client.chat.completions.create({
  model: "Qwen/Qwen3-8B",
  messages: [{ role: "user", content: "Dame una checklist de despliegue LLM." }],
});

console.log(response.choices[0].message.content);
Cuidado. vLLM no convierte automáticamente una demo en producción. Aún necesitas autenticación, límites, logs, colas, monitorización y gestión de fallos.
Comprueba que funciona. Haz 20 peticiones seguidas y mide latencia media, p95 y errores. Si no tienes esos números, no sabes si tu servicio aguanta.
Guardar y reabrir el proyecto.
vLLM es el motor; tu producto necesita también gateway, observabilidad, evals y límites.

Si has guardado la evidencia de esta lección, continúa con «LiteLLM gateway». Si no, repite la comprobación antes de avanzar.

Mapa completo de AulafyConsulta cómo encaja esta lección sin salir de tu ruta.

Mapa completo de Aulafy

Cómo se relacionan todos los cursos

No es una lista que debas completar. Empieza por la base, elige un resultado y profundiza solo cuando tu proyecto necesite más control.

  1. 1Comprender
  2. 2Aplicar o construir
  3. 3Operar con confianza
01

Empieza aquí

Crea una base común: qué puede hacer la IA, cómo pedir resultados y cómo comprobarlos antes de especializarte.

Desde esta base puedes aplicar la IA a una tarea o aprender a construir con código.

02

Elige una aplicación

Convierte la base en un resultado visible: una web, una mejora de negocio, contenido o una experiencia interactiva.

Si necesitas mantener código, datos o infraestructura, continúa por la rama técnica.

03

Construye con código

Prepara el entorno, trabaja con agentes de programación y aprende a ejecutar modelos con control sobre tus proyectos.

Esta rama prepara los conocimientos necesarios para diseñar y operar sistemas de IA fiables.

04

Lleva sistemas a producción

Combina recuperación, agentes, evaluación, seguridad, despliegue y adaptación de modelos cuando el problema lo exija.

No es obligatorio completarlo todo: elige solo la pieza que tu sistema necesita y vuelve al mapa cuando crezca.

Ver catálogo completo