Fase 03 — Entrenamiento e Inferencia
Entrenamiento e inferencia ejecutan graphs relacionados con restricciones distintas. Training guarda activaciones y gradientes; inferencia optimiza carga, tráfico de memoria, batching, caching y latencia.
Modelo mental
Entrenamiento es medir y actualizar repetidamente; inferencia es ejecutar un graph de sólo lectura bajo scheduling. Ambos están limitados por shapes, memoria, precisión, paralelismo y confiabilidad.
Hoja de ruta por ramas
Conecta con: Fase 02 — Aprendizaje y Modelos · Fase 04 — Contexto y Agencia
Fuentes principales
- PyTorch Distributed Overview — paralelismo de entrenamiento.
- QLoRA — adaptación eficiente en memoria.
- vLLM — serving de alto throughput.