- Entender qué significan Q4, Q5, Q8 y los sufijos
_K_M. - Elegir quant según VRAM, RAM y uso: chat, RAG o programación.
- Importar un GGUF en Ollama con un
Modelfile.
Regla práctica
- Q4_K_M: primera opción si vas justo de VRAM o quieres velocidad.
- Q5_K_M: punto dulce cuando puedes gastar algo más de memoria por mejor calidad.
- Q8_0: cerca de calidad alta, pero mucho más pesado; úsalo si el modelo cabe cómodo.
Tabla mental de elección
8 GB VRAM: 7B/8B en Q4_K_M 14B solo si aceptas ir justo o bajar contexto 12 GB VRAM: 7B/8B en Q5_K_M o Q8_0 14B en Q4_K_M 16 GB VRAM: 14B en Q5_K_M 30B pequeño en Q4 si el contexto no es enorme 24 GB+ VRAM: 14B en Q8_0 30B/32B en Q4_K_M o Q5_K_M
num_ctx o metes documentos largos.Importar un GGUF en Ollama
Ollama permite importar modelos GGUF con un Modelfile. Crea una carpeta, guarda el GGUF y escribe:
FROM ./mi-modelo.Q5_K_M.gguf PARAMETER temperature 0.2 PARAMETER num_ctx 8192 SYSTEM """ Eres un asistente técnico preciso. Si no sabes algo, dilo. """
Después crea el modelo:
ollama create mi-modelo-q5 -f Modelfile ollama run mi-modelo-q5
Cuantizar tú mismo con llama.cpp
Cuando partes de un modelo ya convertido a GGUF en alta precisión, llama.cpp permite crear una versión cuantizada.
# Ejemplo genérico; el binario puede llamarse llama-quantize o quantize según tu build ./llama-quantize modelo-f16.gguf modelo-Q4_K_M.gguf Q4_K_M ./llama-quantize modelo-f16.gguf modelo-Q5_K_M.gguf Q5_K_M ./llama-quantize modelo-f16.gguf modelo-Q8_0.gguf Q8_0
Si has guardado la evidencia de esta lección, continúa con «Conecta Claude Code con tu IA local». Si no, repite la comprobación antes de avanzar.