- Registrar trazas útiles sin filtrar datos sensibles.
- Medir latencia, errores, coste y calidad por ruta.
- Usar request_id para seguir una petición completa.
Qué registrar
- Identidad técnica: request_id, ruta, versión de app.
- Modelo: proveedor, nombre, versión y parámetros.
- Rendimiento: latencia total, tokens, errores y reintentos.
- RAG: documentos recuperados, no necesariamente texto completo.
- Calidad: eval asociada, feedback y resultado esperado.
Evento mínimo
{
"request_id": "req_20260703_001",
"route": "/api/chat",
"model": "local-qwen",
"prompt_version": "support-v3",
"latency_ms": 1840,
"input_tokens": 620,
"output_tokens": 210,
"retrieved_docs": ["manual-001#p4", "faq-009#p1"],
"error": null
}Tracking de experimentos y registry ligero
Además de trazas por petición, guarda qué versión de modelo, prompt, dataset y configuración produjo cada resultado. Puedes empezar con una tabla simple antes de montar un registry completo.
model_registry:
id: "support-router-v3"
base_model: "qwen3:8b"
quantization: "Q5"
runtime: "ollama"
prompt_version: "support-es-v7"
eval_dataset: "support-evals-2026-07"
score:
answer_ok: 0.86
refusal_ok: 0.94
citation_ok: 0.81
status: "pilot"
owner: "equipo-soporte"Si has guardado la evidencia de esta lección, continúa con «Colas y costes». Si no, repite la comprobación antes de avanzar.