- Diseñar grupos de modelos por tarea, coste y sensibilidad.
- Usar fallbacks sin ocultar errores importantes.
- Registrar cuándo una tarea salió de local a cloud.
model_list:
- model_name: local-fast
litellm_params:
model: ollama/qwen2.5:7b
api_base: http://localhost:11434
- model_name: local-gpu
litellm_params:
model: openai/Qwen/Qwen2.5-14B-Instruct
api_base: http://localhost:8000/v1
api_key: none
- model_name: frontier-review
litellm_params:
model: openai/gpt-4.1-mini
api_key: os.environ/OPENAI_API_KEYPolítica práctica
- Local-fast: borradores, clasificación, resumen de documentos no sensibles.
- Local-gpu: tareas largas, RAG interno y agentes con más contexto.
- Frontier-review: revisión final, razonamiento difícil o fallo repetido local.
routing_rules:
sensitive_data: local_only
max_local_retries: 2
allow_cloud_fallback:
- public_code_review
- generic_planning
- final_quality_check
require_human_approval:
- customer_data
- legal_docs
- financial_docsSi has guardado la evidencia de esta lección, continúa con «Observabilidad». Si no, repite la comprobación antes de avanzar.