Saltar al contenido
Cursos/MLOps local/Colas y costes
Revisión pendiente desde 29 jul 20263 fuentes primarias

Colas, rate limits y caché

Los modelos son lentos y caros comparados con una función normal. Si varias personas los usan a la vez, necesitas colas, límites, reintentos y caché antes de que llegue el susto.

Qué vas a conseguir ahora

Una decisión o prueba aplicada a «Colas, rate limits y caché».

  1. 1Entiende el criterio
  2. 2Haz una práctica pequeña
  3. 3Guarda una evidencia
Evidencia

Una nota breve con qué hiciste, qué salió bien, qué falló y qué revisarías después.

Objetivos de aprendizaje
  • Separar peticiones interactivas de trabajos pesados.
  • Aplicar rate limits por usuario, equipo o tenant.
  • Usar caché sin romper seguridad ni frescura de datos.
En cristiano: cola. Es una lista ordenada de trabajos. En vez de intentar hacerlo todo al mismo tiempo, los trabajos entran, esperan y se procesan con control.

Qué va en cola y qué no

  • Interactivo: chat, autocomplete, acciones que el usuario espera en pantalla.
  • Cola: resumir 100 PDFs, generar audios, procesar vídeos, evaluar muchos prompts.
  • Programado: reindexar documentos, recalcular embeddings, ejecutar evals nocturnas.
Idea clave. BullMQ documenta colas sobre Redis con rate limiting. Para apps Node, es una pieza sencilla para trabajos en segundo plano.

Rate limit conceptual

Terminal
limites:
  usuario_gratis:
    requests_minuto: 10
    tokens_dia: 20000
  equipo_interno:
    requests_minuto: 60
    tokens_dia: 500000
  trabajos_pesados:
    concurrencia: 2
    reintentos: 1
    timeout_segundos: 300

Caché responsable

  • Cachea respuestas públicas o preguntas repetidas sin datos privados.
  • No cachees respuestas con datos personales sin diseño explícito.
  • Incluye modelo, prompt version y permisos en la clave de caché.
  • Invalida caché cuando cambian documentos o políticas.
Cuidado. Una caché mal diseñada puede filtrar respuestas de un usuario a otro. En RAG multiusuario, la caché debe incluir tenant, permisos y versión de documentos.
Comprueba que funciona. Simula 50 peticiones. El sistema debe rechazar, encolar o degradar con mensaje claro; nunca quedarse colgado sin explicación.
Guardar y reabrir el proyecto.
Coste y latencia se diseñan. Si esperas a tener usuarios para pensar en límites, llegarás tarde.

Si has guardado la evidencia de esta lección, continúa con «Proyecto producción». Si no, repite la comprobación antes de avanzar.

Mapa completo de AulafyConsulta cómo encaja esta lección sin salir de tu ruta.

Mapa completo de Aulafy

Cómo se relacionan todos los cursos

No es una lista que debas completar. Empieza por la base, elige un resultado y profundiza solo cuando tu proyecto necesite más control.

  1. 1Comprender
  2. 2Aplicar o construir
  3. 3Operar con confianza
01

Empieza aquí

Crea una base común: qué puede hacer la IA, cómo pedir resultados y cómo comprobarlos antes de especializarte.

Desde esta base puedes aplicar la IA a una tarea o aprender a construir con código.

02

Elige una aplicación

Convierte la base en un resultado visible: una web, una mejora de negocio, contenido o una experiencia interactiva.

Si necesitas mantener código, datos o infraestructura, continúa por la rama técnica.

03

Construye con código

Prepara el entorno, trabaja con agentes de programación y aprende a ejecutar modelos con control sobre tus proyectos.

Esta rama prepara los conocimientos necesarios para diseñar y operar sistemas de IA fiables.

04

Lleva sistemas a producción

Combina recuperación, agentes, evaluación, seguridad, despliegue y adaptación de modelos cuando el problema lo exija.

No es obligatorio completarlo todo: elige solo la pieza que tu sistema necesita y vuelve al mapa cuando crezca.

Ver catálogo completo