- Entender los límites reales de DeepSeek local en hardware de consumo.
- Comparar modelos destilados frente a modelos grandes cuantizados.
- Elegir si una tarea encaja en local, API o batch lento.
Tres familias de despliegue
Para DSH hay tres rutas distintas: API DeepSeek oficial, modelos destilados pequeños y modelos grandes cuantizados con offload. No las mezcles en una sola promesa: cada una sirve para un tipo de trabajo.
En 24 GB de VRAM suelen ser más realistas modelos destilados de tamaño medio que intentar ejecutar un modelo grande completo. Los modelos enormes con Q1/Q2 u offload a SSD pueden ser útiles en batch, pero no son una experiencia fluida de agente.
- API: mejor punto de partida para productividad y contexto largo.
- Destilados locales: privacidad, coste variable bajo y tareas acotadas.
- Q1/Q2 con offload: experimentación y tareas largas no interactivas.
Tabla de decisión para DSH
Elige modelo por misión, no por ranking. Un agente necesita estabilidad de tool calling, capacidad de seguir permisos, buena lectura de repositorios y latencia suficiente para iterar.
Si el modelo local tarda tanto que no revisas sus acciones, el sistema se vuelve menos seguro aunque sea más privado.
Hardware / ruta Uso razonable en DSH 8-16 GB RAM pruebas pequeñas con destilados ligeros 24 GB VRAM R1 destilado 14B/32B cuantizado para tareas acotadas Mac 64-128 GB + SSD batch lento con cuantizaciones agresivas API DeepSeek trabajo diario, contexto largo y productividad
Benchmark mínimo
No copies tokens por segundo de internet. Ejecuta el mismo prompt, mismo workspace y mismo modo varias veces. Registra calidad y tiempo hasta un resultado usable.
Compara siempre contra V4-Flash o V4-Pro para saber si el ahorro local compensa la pérdida de velocidad, calidad o coordinación.
Medición DSH local vs API: - modelo exacto y cuantización - runtime usado - hardware y memoria - modo DSH - contexto configurado - tokens por segundo - cache hit rate - tiempo total - resultado aceptado - reintentos necesarios
Cómo conectarlo sin convertirlo en otro tutorial
DSH solo necesita que el runtime local exponga un endpoint compatible con el proveedor que declares. La instalación, GPU, seguridad de red y troubleshooting del runtime local pertenecen al tutorial de IA local.
En esta fase solo valida que el endpoint responde, que el nombre de modelo coincide y que el Trajectory registra claramente cuándo una tarea fue local y cuándo fue por API.
Checklist antes de usar un modelo local en DSH: - runtime local ya probado fuera de DSH - modelo exacto y licencia revisados - endpoint accesible solo donde corresponde - tarea sin datos sensibles en la primera prueba - comparación contra DeepSeek API guardada
Si has guardado la evidencia de esta lección, continúa con «Casos de uso, métricas y benchmarks». Si no, repite la comprobación antes de avanzar.