Saltar al contenido
Cursos/DeepSeek Harness (DSH)/DeepSeek Harness · Fase 8
Revisión pendiente desde 21 ago 20262 fuentes primarias

Modelos DeepSeek locales y cuantización

Esta fase no enseña un runtime local desde cero: analiza cuándo tiene sentido conectar modelos DeepSeek locales o cuantizados a DSH y cuándo conviene quedarse con la API oficial.

Qué vas a conseguir ahora

Una decisión o prueba aplicada a «Modelos DeepSeek locales y cuantización».

  1. 1Entiende el criterio
  2. 2Haz una práctica pequeña
  3. 3Guarda una evidencia
Evidencia

Una nota breve con qué hiciste, qué salió bien, qué falló y qué revisarías después.

Objetivos de aprendizaje
  • Entender los límites reales de DeepSeek local en hardware de consumo.
  • Comparar modelos destilados frente a modelos grandes cuantizados.
  • Elegir si una tarea encaja en local, API o batch lento.

Tres familias de despliegue

Para DSH hay tres rutas distintas: API DeepSeek oficial, modelos destilados pequeños y modelos grandes cuantizados con offload. No las mezcles en una sola promesa: cada una sirve para un tipo de trabajo.

En 24 GB de VRAM suelen ser más realistas modelos destilados de tamaño medio que intentar ejecutar un modelo grande completo. Los modelos enormes con Q1/Q2 u offload a SSD pueden ser útiles en batch, pero no son una experiencia fluida de agente.

  • API: mejor punto de partida para productividad y contexto largo.
  • Destilados locales: privacidad, coste variable bajo y tareas acotadas.
  • Q1/Q2 con offload: experimentación y tareas largas no interactivas.

Tabla de decisión para DSH

Elige modelo por misión, no por ranking. Un agente necesita estabilidad de tool calling, capacidad de seguir permisos, buena lectura de repositorios y latencia suficiente para iterar.

Si el modelo local tarda tanto que no revisas sus acciones, el sistema se vuelve menos seguro aunque sea más privado.

Terminal
Hardware / ruta             Uso razonable en DSH
8-16 GB RAM                 pruebas pequeñas con destilados ligeros
24 GB VRAM                  R1 destilado 14B/32B cuantizado para tareas acotadas
Mac 64-128 GB + SSD         batch lento con cuantizaciones agresivas
API DeepSeek                trabajo diario, contexto largo y productividad

Benchmark mínimo

No copies tokens por segundo de internet. Ejecuta el mismo prompt, mismo workspace y mismo modo varias veces. Registra calidad y tiempo hasta un resultado usable.

Compara siempre contra V4-Flash o V4-Pro para saber si el ahorro local compensa la pérdida de velocidad, calidad o coordinación.

Terminal
Medición DSH local vs API:
- modelo exacto y cuantización
- runtime usado
- hardware y memoria
- modo DSH
- contexto configurado
- tokens por segundo
- cache hit rate
- tiempo total
- resultado aceptado
- reintentos necesarios

Cómo conectarlo sin convertirlo en otro tutorial

DSH solo necesita que el runtime local exponga un endpoint compatible con el proveedor que declares. La instalación, GPU, seguridad de red y troubleshooting del runtime local pertenecen al tutorial de IA local.

En esta fase solo valida que el endpoint responde, que el nombre de modelo coincide y que el Trajectory registra claramente cuándo una tarea fue local y cuándo fue por API.

Terminal
Checklist antes de usar un modelo local en DSH:
- runtime local ya probado fuera de DSH
- modelo exacto y licencia revisados
- endpoint accesible solo donde corresponde
- tarea sin datos sensibles en la primera prueba
- comparación contra DeepSeek API guardada
Comprueba que funciona. Compara una misión de solo lectura con DeepSeek API y con un modelo DeepSeek local o destilado. Registra velocidad, calidad, cache y decisión.
Guardar y reabrir el proyecto.
Local no es automáticamente mejor; es mejor cuando la tarea, el hardware y la política encajan.

Si has guardado la evidencia de esta lección, continúa con «Casos de uso, métricas y benchmarks». Si no, repite la comprobación antes de avanzar.

Mapa completo de AulafyConsulta cómo encaja esta lección sin salir de tu ruta.

Mapa completo de Aulafy

Cómo se relacionan todos los cursos

No es una lista que debas completar. Empieza por la base, elige un resultado y profundiza solo cuando tu proyecto necesite más control.

  1. 1Comprender
  2. 2Aplicar o construir
  3. 3Operar con confianza
01

Empieza aquí

Crea una base común: qué puede hacer la IA, cómo pedir resultados y cómo comprobarlos antes de especializarte.

Desde esta base puedes aplicar la IA a una tarea o aprender a construir con código.

02

Elige una aplicación

Convierte la base en un resultado visible: una web, una mejora de negocio, contenido o una experiencia interactiva.

Si necesitas mantener código, datos o infraestructura, continúa por la rama técnica.

03

Construye con código

Prepara el entorno, trabaja con agentes de programación y aprende a ejecutar modelos con control sobre tus proyectos.

Esta rama prepara los conocimientos necesarios para diseñar y operar sistemas de IA fiables.

04

Lleva sistemas a producción

Combina recuperación, agentes, evaluación, seguridad, despliegue y adaptación de modelos cuando el problema lo exija.

No es obligatorio completarlo todo: elige solo la pieza que tu sistema necesita y vuelve al mapa cuando crezca.

Ver catálogo completo