Saltar al contenido

Pruebas de fallo y métricas antes de automatizar

No preguntes solo «¿parece que funciona?». Pregunta qué ocurre con una entrada ambigua, un documento roto, una petición maliciosa, un dato fuera de alcance o un servicio que no responde. Medir esas respuestas decide si un flujo merece más permisos.

Qué vas a conseguir ahora

Una decisión o prueba aplicada a «Pruebas de fallo y métricas antes de automatizar».

  1. 1Entiende el criterio
  2. 2Haz una práctica pequeña
  3. 3Guarda una evidencia
Evidencia

Una nota breve con qué hiciste, qué salió bien, qué falló y qué revisarías después.

Objetivos de aprendizaje
  • Crear una muestra de prueba que no esconda los casos difíciles.
  • Medir calidad, errores críticos, abstenciones, tiempo y coste por resultado aceptado.
  • Decidir con evidencia si mantener, corregir, limitar o descartar el flujo.
En cristiano: caso de prueba. Es una entrada preparada con una respuesta o comportamiento esperado antes de ejecutar el flujo. No tiene que ser un examen sofisticado: puede ser un email, una factura ficticia o una pregunta documentada que una persona sabe cómo evaluar.

Una muestra buena no contiene solo ejemplos fáciles

Reúne una muestra pequeña, autorizada o sintética, pero representativa. Incluye el caso habitual y también los que rompen el proceso: un PDF escaneado, una fecha imposible, dos facturas casi iguales, una pregunta sin fuente o un email que intenta cambiar las instrucciones. La prueba no busca humillar al modelo; busca descubrir dónde debe parar, pedir ayuda o recurrir al modo manual.

Terminal
MATRIZ MÍNIMA DE PRUEBA

1. Normal: entrada clara y resultado conocido.
2. Ambiguo: falta un dato o hay dos interpretaciones válidas.
3. Difícil: formato malo, ruido, OCR pobre o documento largo.
4. Fuera de alcance: pide una decisión que el flujo no puede tomar.
5. Hostil: incluye instrucciones ajenas al objetivo del flujo.
6. Falla técnica: proveedor lento, archivo no disponible o respuesta inválida.
7. Duplicado: la misma entrada llega dos veces.

Para cada fila define: resultado esperado, riesgo, revisor y decisión.
Idea clave. La métrica más útil no es cuántas respuestas produce el sistema, sino cuántos resultados correctos y seguros entrega con el coste y revisión que aceptas.

Cinco métricas sencillas que sí cambian decisiones

  • Calidad aceptada: porcentaje de resultados que el revisor puede usar sin corregir un dato crítico.
  • Error crítico: una salida que habría provocado daño si se hubiera enviado, cobrado, publicado o registrado.
  • Abstención correcta: veces que el flujo se detiene o escala cuando de verdad no tiene evidencia.
  • Tiempo total: generación más revisión; si solo desplaza el trabajo, no ha mejorado el proceso.
  • Coste por resultado aceptado: API, suscripción, infraestructura y tiempo humano dividido entre salidas útiles.

No conviertas estas métricas en una promesa universal. El umbral razonable depende del proceso: una clasificación interna puede tolerar más correcciones que un importe o un mensaje a un cliente.

Terminal
REGISTRO DE EVALUACIÓN

caso_id: factura-dificil-03
resultado_esperado: marcar fecha como dudosa y no exportar
resultado_obtenido: fecha 2026-08-31; estado listo
revision_humana: rechazo
severidad: crítica
causa_probable: el OCR confundió 31/08 con 08/31
accion: añadir regla de fecha, ejemplo de prueba y bloqueo de exportación
coste: 0.04
latencia_segundos: 8.2
repetible: sí

La abstención también se prueba

Un flujo seguro debe distinguir entre «no encontré evidencia», «la evidencia se contradice» y «esto no está autorizado». Prueba que no inventa una respuesta para salir del paso. Una abstención debe indicar qué falta, qué fuente se revisó y cuál es la siguiente acción humana; no basta con un mensaje genérico de error.

Cuidado. No uses al mismo modelo como único juez de su propio trabajo. Una revisión humana sobre una muestra y reglas deterministas para los campos críticos son la base. Más adelante puedes añadir evaluadores automáticos, pero compáralos contra decisiones revisadas.

Decide con una tabla de salida

Al terminar la muestra, no respondas «funciona» o «no funciona». Decide una de cuatro cosas: mantener el alcance porque los resultados son seguros, corregir un fallo concreto y repetir, reducir el alcance para que solo prepare borradores, o descartar el caso. Descartar una automatización que no aporta es una buena decisión de negocio.

Comprueba que funciona. Crea diez casos de prueba de tu flujo. No avances si hay un error crítico sin bloqueo, si no puedes explicar las abstenciones o si nadie sabe cuánto tiempo dedica a revisar las salidas.
Guardar y reabrir el proyecto.
Añade la matriz y el registro de resultados al kit de flujo fiable. Conserva solo datos permitidos; para ejercicios y demostraciones usa ejemplos sintéticos o minimizados.

Si has guardado la evidencia de esta lección, continúa con «Operación mínima». Si no, repite la comprobación antes de avanzar.

Mapa completo de Aulafy

Cómo se relacionan todos los cursos

No es una lista que debas completar. Empieza por la base, elige un resultado y profundiza solo cuando tu proyecto necesite más control.

  1. 1Comprender
  2. 2Aplicar o construir
  3. 3Operar con confianza
01

Empieza aquí

Crea una base común: qué puede hacer la IA, cómo pedir resultados y cómo comprobarlos antes de especializarte.

Desde esta base puedes aplicar la IA a una tarea o aprender a construir con código.

02

Elige una aplicación

Convierte la base en un resultado visible: una web, una mejora de negocio, contenido o una experiencia interactiva.

Si necesitas mantener código, datos o infraestructura, continúa por la rama técnica.

03

Construye con código

Prepara el entorno, trabaja con agentes de programación y aprende a ejecutar modelos con control sobre tus proyectos.

Esta rama prepara los conocimientos necesarios para diseñar y operar sistemas de IA fiables.

04

Lleva sistemas a producción

Combina recuperación, agentes, evaluación, seguridad, despliegue y adaptación de modelos cuando el problema lo exija.

No es obligatorio completarlo todo: elige solo la pieza que tu sistema necesita y vuelve al mapa cuando crezca.

Ver catálogo completo