- Levantar un servidor vLLM para pruebas locales o de laboratorio.
- Conectar una app usando el cliente OpenAI apuntando a tu endpoint.
- Medir latencia, tokens por segundo y errores básicos.
Servidor mínimo
python -m venv .venv source .venv/bin/activate pip install -U vllm vllm serve Qwen/Qwen3-8B \ --host 127.0.0.1 \ --port 8000
Cliente OpenAI contra vLLM
import OpenAI from "openai";
const client = new OpenAI({
apiKey: "local",
baseURL: "http://127.0.0.1:8000/v1",
});
const response = await client.chat.completions.create({
model: "Qwen/Qwen3-8B",
messages: [{ role: "user", content: "Dame una checklist de despliegue LLM." }],
});
console.log(response.choices[0].message.content);Si has guardado la evidencia de esta lección, continúa con «LiteLLM gateway». Si no, repite la comprobación antes de avanzar.