- Compilar o instalar llama.cpp y levantar un servidor local.
- Probar una petición HTTP sin depender de una interfaz gráfica.
- Registrar modelo, puerto, contexto y parámetros usados.
Servidor mínimo
git clone https://github.com/ggml-org/llama.cpp.git cd llama.cpp cmake -B build cmake --build build --config Release ./build/bin/llama-server \ -m models/modelo.gguf \ --host 127.0.0.1 \ --port 8080 \ -c 4096
Prueba con curl
curl http://127.0.0.1:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "local-gguf",
"messages": [
{"role": "user", "content": "Explica qué es una cola en MLOps IA en 3 frases"}
],
"temperature": 0.2
}'Manifest del servicio
servicio: llama-server-local modelo: models/modelo.gguf hash_modelo: sha256:... host: 127.0.0.1 puerto: 8080 contexto: 4096 cuantizacion: Q4_K_M uso: desarrollo local fecha: 2026-07-03
Si has guardado la evidencia de esta lección, continúa con «vLLM OpenAI-compatible». Si no, repite la comprobación antes de avanzar.