- Instalar Ollama en Windows, macOS o Linux.
- Elegir un modelo según memoria, velocidad y calidad.
- Comprobar la API local para usarla después con tus apps.
No existe un mínimo universal
- Modelo y cuantización: determina el tamaño que debe cargarse.
- Contexto: una ventana mayor también consume memoria.
- Equipo: CPU, GPU, VRAM o memoria unificada cambian la velocidad.
- Tarea: chat corto, documentos y concurrencia no exigen lo mismo.
Empieza con un modelo pequeño cuya ficha y licencia hayas leído. Mide en tu equipo antes de comprar hardware o prometer tiempos.
Instalación
Entra en la web oficial de Ollama, instala la versión de tu sistema y abre una terminal nueva. En Linux también puedes usar el instalador por terminal:
curl -fsSL https://ollama.com/install.sh | sh
Comprueba que el comando existe:
ollama --version
Tu primer modelo
Abre la biblioteca oficial, elige un modelo pequeño disponible hoy y copia su nombre y tag exactos. Los ejemplos siguientes usan un marcador para no convertir una versión concreta en recomendación permanente.
ollama run NOMBRE:TAG
Comprueba la API local
Por defecto, Ollama escucha en http://127.0.0.1:11434. La API local no exige autenticación: no cambies la dirección de escucha para exponerla en red como parte de esta práctica.
curl http://127.0.0.1:11434/api/generate -d '{
"model": "NOMBRE:TAG",
"prompt": "Resume en una frase qué es la IA local.",
"stream": false
}'response, ya tienes una IA local lista para usar en apps de RAG, PDF, automatización y prototipos privados.Comandos que usarás cada semana
ollama list ollama run NOMBRE:TAG ollama pull NOMBRE:TAG ollama rm modelo:tag ollama ps
Si has guardado la evidencia de esta lección, continúa con «Cuantización GGUF». Si no, repite la comprobación antes de avanzar.