- Distinguir Ollama local, modelos cloud e integraciones externas.
- Medir una tarea concreta sin convertir una ejecución en un benchmark.
- Detectar una exposición de red y comprender por qué la API local exige control.
- Incluir licencia, hardware, energía, soporte y revisión en el coste real.
gemma3:4b (3,34 GB aproximados) y datos ficticios. Las cifras solo describen ese equipo y esa ejecución.localhost con un modelo instalado localmente. Ollama también ofrece modelos cloud: usar el mismo programa no garantiza que toda petición permanezca en el ordenador.1. Define una prueba que pueda fallar
Usaremos una empresa inventada. La única información autorizada dice que la tienda abre de lunes a viernes. La pregunta será si abre el sábado. Una respuesta responsable debe abstenerse: No consta.
No empieces con contratos, facturas o conversaciones reales. Primero comprueba que sabes ejecutar, medir, detener y explicar el flujo con datos sintéticos.
EMPRESA FICTICIA: Nube Clara HECHO AUTORIZADO: La tienda abre de lunes a viernes de 09:00 a 18:00. PREGUNTA: ¿La tienda abre el sábado? RESPUESTA ESPERADA: No consta.
2. Comprueba versión, modelos y dirección de escucha
La documentación oficial sitúa la API local en http://localhost:11434/api. Además, la API local no exige autenticación. Esa comodidad es precisamente la razón por la que no debes publicarla en una LAN o en Internet sin diseñar otra capa de seguridad.
ollama --version ollama list ollama ps # macOS o Linux: la salida segura debe mostrar 127.0.0.1:11434 lsof -nP -iTCP:11434 -sTCP:LISTEN
0.0.0.0:11434, una IP de red o una configuración deOLLAMA_HOST que no reconoces, detente. No continúes con datos de empresa. Este curso no enseña a exponer la API: un servicio compartido necesita autenticación, autorización, TLS, segmentación, logs y una revisión de amenazas propia.3. Clona y verifica el laboratorio
El laboratorio MIT de Aulafy no descarga modelos, no usa claves y bloquea cualquier destino que no sea loopback. Sus pruebas emplean un servidor local simulado, por lo que pueden ejecutarse aunque Ollama esté apagado.
git clone https://github.com/aulafy/taller.git cd taller/cursos/ia-pymes/laboratorios/ollama-piloto-seguro npm run verificar npm run diagnostico
solo loopback; sin destino remoto, la versión y los modelos ya instalados. No copies un comando de descarga hasta haber revisado tamaño, ficha y licencia del modelo.4. Elige un modelo sin aceptar un ranking
No hay un “mejor modelo pequeño” permanente. Elige uno que ya tengas o consulta su ficha oficial. Registra nombre y tag exactos, tamaño descargado, cuantización, licencia, idiomas y limitaciones. La licencia MIT de Ollama no convierte los pesos del modelo en MIT.
Si el modelo no cabe con suficiente margen para el sistema, el contexto y otras aplicaciones, prueba uno menor. No compres hardware antes de medir una tarea representativa.
# Inspecciona el modelo local y su licencia
curl http://127.0.0.1:11434/api/show -d '{
"model": "gemma3:4b"
}'
# Sustituye el nombre por uno que aparezca en ollama list
OLLAMA_MODEL=gemma3:4b npm run probar5. Lee la evidencia, no solo la respuesta
El endpoint de generación devuelve tiempos en nanosegundos y recuentos de tokens. El laboratorio convierte esas cifras y también mide el tiempo percibido. Separa la carga inicial de la generación: una segunda consulta puede ser más rápida si el modelo sigue en memoria.
EJECUCIÓN DE REFERENCIA — NO ES UNA PROMESA equipo: Apple M4; 24 GB de memoria unificada ollama_servidor: 0.32.1 modelo: gemma3:4b tamaño_aproximado: 3.34 GB respuesta: "No consta." coincide: true tiempo_total: 2.08 s tiempo_carga: 1.64 s tokens_salida: 4 tokens_por_segundo: 44.67
6. Decide con una matriz honesta
- Continúa investigando: la tarea funciona, la latencia es aceptable y puedes crear una batería autorizada.
- Reduce el modelo o el contexto: hay esperas, presión de memoria o bloqueo del equipo.
- Compara una opción cloud o híbrida: necesitas más calidad, concurrencia, soporte o disponibilidad de la que puedes operar localmente.
- Descarta: la revisión cuesta más que el proceso manual, no puedes proteger los datos o el fallo tiene demasiado impacto.
DECISIÓN DEL PILOTO tarea: modelo_y_licencia: equipo_y_memoria: datos_usados: sintéticos / autorizados / minimizados api_confirmada_en_loopback: sí / no latencia_mediana_de_varias_pruebas: casos_correctos: abstenciones_correctas: correcciones_humanas: coste: equipo + energía + soporte + revisión + mantenimiento decisión: ampliar / ajustar / comparar / descartar responsable: próxima_revisión:
Privacidad, cloud y mantenimiento
Ollama afirma que no recibe prompts ni datos cuando el modelo se ejecuta localmente. Para un modo estrictamente local, su documentación permite desactivar las funciones cloud; hacerlo elimina modelos cloud y búsqueda web. Comprueba la configuración y los logs, no te limites a confiar en el nombre de la herramienta.
Actualiza con control: registra la versión, relee las notas de lanzamiento y repite la batería después de cambiar Ollama, modelo, cuantización, prompt o contexto. La API pretende mantener compatibilidad, pero no está estrictamente versionada.
# Configuración oficial para desactivar funciones cloud
# ~/.ollama/server.json
{
"disable_ollama_cloud": true
}
# Alternativa mediante variable antes de iniciar el servidor
OLLAMA_NO_CLOUD=1Fuentes oficiales consultadas
Si has guardado la evidencia de esta lección, continúa con «RGPD básico». Si no, repite la comprobación antes de avanzar.