- Separar peticiones interactivas de trabajos pesados.
- Aplicar rate limits por usuario, equipo o tenant.
- Usar caché sin romper seguridad ni frescura de datos.
Qué va en cola y qué no
- Interactivo: chat, autocomplete, acciones que el usuario espera en pantalla.
- Cola: resumir 100 PDFs, generar audios, procesar vídeos, evaluar muchos prompts.
- Programado: reindexar documentos, recalcular embeddings, ejecutar evals nocturnas.
Rate limit conceptual
limites:
usuario_gratis:
requests_minuto: 10
tokens_dia: 20000
equipo_interno:
requests_minuto: 60
tokens_dia: 500000
trabajos_pesados:
concurrencia: 2
reintentos: 1
timeout_segundos: 300Caché responsable
- Cachea respuestas públicas o preguntas repetidas sin datos privados.
- No cachees respuestas con datos personales sin diseño explícito.
- Incluye modelo, prompt version y permisos en la clave de caché.
- Invalida caché cuando cambian documentos o políticas.
Si has guardado la evidencia de esta lección, continúa con «Proyecto producción». Si no, repite la comprobación antes de avanzar.