Entrenamiento y Adaptación
Adaptar un modelo cambia sus parámetros y por lo tanto su distribución de comportamiento. La técnica importa menos que la calidad de datos, el baseline, el objetivo, la infraestructura, las evals y la capacidad de revertir.
Modelo mental
La adaptación cambia comportamiento con ejemplos, preferencias o señales de un teacher. Objetivo, reference model, superficie de parámetros y dataset determinan qué mejora y qué puede olvidarse.
Hoja de ruta actual
- Cuándo fine-tunear
- Supervised fine-tuning
- LoRA y adapters
- QLoRA
- RLHF con PPO
- DPO
- Dataset de fine-tuning
- Calidad de datos
- Catastrophic forgetting
- Distillation
- Evaluar un fine-tune
- Costo y hardware
Conecta con: Datos para IA · Reinforcement Learning · Sistemas de Inferencia
Fuentes principales
- LoRA · QLoRA · DPO — papers primarios.
- PyTorch Distributed — infraestructura de entrenamiento distribuido.