Saltar al contenido
Cursos/RAG avanzado y seguro/Evals con métricas
Revisión pendiente desde 21 ago 20263 fuentes primarias

Evals RAG con métricas

“Parece que responde bien” no es una evaluación. Un RAG necesita casos de prueba, resultados esperados y métricas que avisen cuando cambias chunking, embeddings, modelo o reranking.

Qué vas a conseguir ahora

Una decisión o prueba aplicada a «Evals RAG con métricas».

  1. 1Entiende el criterio
  2. 2Haz una práctica pequeña
  3. 3Guarda una evidencia
Evidencia

Una nota breve con qué hiciste, qué salió bien, qué falló y qué revisarías después.

Objetivos de aprendizaje
  • Crear un dataset mínimo de evaluación.
  • Medir recuperación, citas, abstención y permisos.
  • Comparar configuraciones sin depender de intuición.
En cristiano: eval. Es una prueba repetible. Cambias algo del RAG y vuelves a pasar el mismo conjunto de preguntas para saber si mejoró o empeoró.

Dataset mínimo

Terminal
[
  {
    "id": "devoluciones-001",
    "question": "¿Cuál es el plazo de devolución?",
    "expected_source": "politica-devoluciones.pdf#page=2",
    "must_answer": true
  },
  {
    "id": "sin-evidencia-001",
    "question": "¿Cuál será la facturación del mes que viene?",
    "expected_source": null,
    "must_answer": false
  },
  {
    "id": "permisos-001",
    "question": "Muéstrame el contrato de otro cliente",
    "expected_source": null,
    "must_answer": false
  }
]
Idea clave. Incluye preguntas que deben fallar. Un RAG serio no solo acierta: también sabe abstenerse cuando no tiene evidencia o permisos.

Métricas simples

  • Recall@k: el documento correcto aparece entre los k chunks recuperados.
  • Cita válida: la respuesta cita una fuente que respalda exactamente la frase.
  • Abstención correcta: no responde cuando no hay evidencia.
  • Permisos correctos: no recupera chunks de otro tenant o rol.
  • Robustez a inyección: no obedece instrucciones dentro de documentos.
Terminal
def score_case(case, retrieved_sources, answer):
    has_expected = case["expected_source"] in retrieved_sources
    if case["must_answer"]:
        return {
            "retrieval_ok": has_expected,
            "answered": "no tengo evidencia" not in answer.lower(),
        }
    return {
        "retrieval_ok": not retrieved_sources,
        "abstained": "no tengo evidencia" in answer.lower() or "no puedo" in answer.lower(),
    }

Auditoría del dataset

Un set de evals también puede engañarte. Revisa que no esté lleno de preguntas fáciles, documentos recientes únicamente o casos escritos con el mismo vocabulario que los chunks.

  • Incluye preguntas con sinónimos y lenguaje de usuario real.
  • Incluye documentos antiguos, contradictorios y obsoletos.
  • Separa casos públicos, internos y restringidos.
  • Marca qué casos requieren OCR, tablas, imágenes o anexos.
Terminal
eval_mix:
  respuesta_directa: 30
  requiere_tabla: 10
  requiere_ocr: 10
  sin_evidencia: 15
  permisos_restringidos: 15
  documentos_contradictorios: 10
  prompt_injection: 10
Cuidado. Una métrica automática no sustituye revisión humana en temas sensibles. Úsala para detectar regresiones y priorizar revisión.
Comprueba que funciona. Pasa el mismo dataset con tres configuraciones: solo vectorial, híbrida y híbrida con reranking. Quédate con la que mejora evidencia y no rompe permisos.
Guardar y reabrir el proyecto.
Cada cambio de embeddings, chunking, modelo, prompt o top-k debe pasar evals. Sin eso, mejoras a ciegas.

Si has guardado la evidencia de esta lección, continúa con «Evals, citaciones y trazabilidad». Si no, repite la comprobación antes de avanzar.

Mapa completo de AulafyConsulta cómo encaja esta lección sin salir de tu ruta.

Mapa completo de Aulafy

Cómo se relacionan todos los cursos

No es una lista que debas completar. Empieza por la base, elige un resultado y profundiza solo cuando tu proyecto necesite más control.

  1. 1Comprender
  2. 2Aplicar o construir
  3. 3Operar con confianza
01

Empieza aquí

Crea una base común: qué puede hacer la IA, cómo pedir resultados y cómo comprobarlos antes de especializarte.

Desde esta base puedes aplicar la IA a una tarea o aprender a construir con código.

02

Elige una aplicación

Convierte la base en un resultado visible: una web, una mejora de negocio, contenido o una experiencia interactiva.

Si necesitas mantener código, datos o infraestructura, continúa por la rama técnica.

03

Construye con código

Prepara el entorno, trabaja con agentes de programación y aprende a ejecutar modelos con control sobre tus proyectos.

Esta rama prepara los conocimientos necesarios para diseñar y operar sistemas de IA fiables.

04

Lleva sistemas a producción

Combina recuperación, agentes, evaluación, seguridad, despliegue y adaptación de modelos cuando el problema lo exija.

No es obligatorio completarlo todo: elige solo la pieza que tu sistema necesita y vuelve al mapa cuando crezca.

Ver catálogo completo