Emergent abilities e in-context learning
La razón por la que los LLMs se sienten distintos del ML anterior es un conjunto de comportamientos que aparecen con scale: sobre todo, aprender una tarea nueva a partir de ejemplos en el prompt sin ningún entrenamiento.
In-context learning (ICL)
Mostrale a un modelo algunos ejemplos input→output en el prompt y realiza la tarea en un input nuevo: sin actualizaciones de pesos, sin fine-tuning. Esto es prompting few-shot. El modelo no está "aprendiendo" en el sentido de gradientes; el pretraining lo volvió bueno para inferir el patrón de un documento y continuarlo. ICL es la base del prompting y la razón por la que un único modelo congelado puede hacer miles de tareas.
Los ejemplos few-shot no actualizan el modelo: orientan un modelo fijo armando un patrón que completa. El "aprendizaje" ocurre en inferencia, dentro de la ventana de contexto.
Emergent abilities, con una salvedad
Algunas capacidades (aritmética multi-step, ciertos razonamientos) parecen aparecer de golpe después de un umbral de escala en vez de mejorar suavemente: emergent abilities. La versión honesta:
- El efecto es en parte real: modelos más grandes realmente desbloquean comportamientos cualitativamente nuevos.
- Es en parte un artefacto de métrica: métricas duras de todo-o-nada (exact match) hacen que un progreso subyacente suave parezca un salto repentino. Con métricas más blandas, la curva es más continua.
Tomá las afirmaciones dramáticas de "de repente pudo hacer X" con escepticismo calibrado, pero no descartes que la escala compra comportamiento nuevo.
Por qué importa
- A menudo podés saltear fine-tuning: ICL + buen prompting resuelve muchas tareas en un modelo congelado (la escalera de adaptación).
- La capacidad es difícil de predecir a nivel tarea aunque la loss sea predecible; entonces evaluá, no asumas (eval).
Conecta con: scaling laws · prompting few-shot · reasoning