- Distinguir prompt engineering, RAG, SFT, LoRA, QLoRA y DPO.
- Elegir la técnica adecuada según coste, datos y objetivo.
- Evitar entrenar un modelo cuando solo necesitas recuperar información.
Decisión rápida
- Prompt: quieres cambiar formato, tono o instrucciones simples.
- RAG: quieres que use documentos actualizables o privados.
- SFT: quieres que aprenda patrones de pregunta-respuesta de tu dominio.
- LoRA: quieres entrenar pocos parámetros y guardar un adaptador ligero.
- QLoRA: quieres LoRA usando cuantización para reducir memoria.
- DPO: quieres alinear preferencias comparando respuestas buenas y malas.
Ficha de decisión
objetivo: "responder emails de soporte con tono de marca" datos_disponibles: ejemplos_buenos: 800 ejemplos_malos: 120 documentos_actualizables: true mejor_opcion: - RAG para políticas que cambian - SFT/LoRA para tono y formato no_entrenar_para: - memorizar precios - guardar contratos privados - sustituir permisos
Si has guardado la evidencia de esta lección, continúa con «Datasets de instrucciones». Si no, repite la comprobación antes de avanzar.