- Elegir quant según hardware y tarea.
- Medir velocidad, calidad y contexto en vez de fiarte de rankings.
- Preparar una prueba mínima para coding agents locales.
Regla práctica
- Q4: entra en más hardware, buena velocidad, puede perder matices.
- Q5: equilibrio frecuente para uso diario.
- Q8: más calidad, más memoria, menos margen para contexto.
- FP8/KV cache: útil en serving, pero hay que validar estabilidad.
# Prueba repetible para comparar modelos ollama run qwen2.5-coder:7b "Crea tests para una función que parsea fechas ISO." ollama run qwen2.5-coder:14b "Crea tests para una función que parsea fechas ISO." # Observa contexto y carga efectiva ollama ps # Guarda resultados: # - tokens/s # - tiempo al primer token # - calidad del test # - si compila # - memoria usada
Test mínimo para un modelo de coding
- Explicar un bug real de tu repo.
- Generar tests que fallen antes del fix.
- Proponer parche pequeño.
- Ejecutar lint y build.
- Comparar diff y errores.
Si has guardado la evidencia de esta lección, continúa con «Agentes de código locales». Si no, repite la comprobación antes de avanzar.