The bitter lesson
"The bitter lesson" de Rich Sutton es la idea estratégica más útil para entender por qué la AI moderna se ve como se ve: a lo largo de décadas, los métodos generales que escalan con cómputo vencieron consistentemente a enfoques construidos sobre conocimiento humano hecho a mano. Es "bitter" porque los investigadores siguen invirtiendo en estructura ingeniosa y específica de dominio, y siguen siendo superados por métodos más simples que solo usan más cómputo y datos.
El patrón, repetido
- Ajedrez / Go — estrategia programada a mano perdió contra búsqueda masiva y self-play.
- Habla y visión — features diseñadas (fonemas, detectores de bordes) perdieron contra representaciones aprendidas desde deep nets.
- Lenguaje — gramáticas y pipelines perdieron contra predicción next-token a escala.
Cada vez, el prior humano fuerte ayudó al principio y después limitó el techo; el método general y hambriento de cómputo seguía mejorando a medida que crecían los recursos.
Por qué pasa
La estructura diseñada por humanos es satisfactoria y ayuda en el corto plazo, pero no escala: hornea nuestra comprensión limitada. Los métodos generales (búsqueda y aprendizaje) no tienen ese techo: dales más cómputo y datos y siguen mejorando. Este es el esqueleto estratégico detrás de "just scale it" y la era de foundation models.
El matiz (no lo sobreapliques)
The bitter lesson habla de la frontera de largo plazo, no de tu martes. En la práctica:
- Con datos/cómputo limitados, un buen prior (el modelo correcto, features) todavía gana: ver árboles en datos tabulares.
- La lección favorece métodos generales, pero calidad de datos, evals y diseño de sistema es donde vive la mayor parte del trabajo aplicado.
- Es una observación sobre trayectoria, no una licencia para tirarle cómputo a todo.
Trampa
Dos errores opuestos: sobreingenierizar estructura ingeniosa que la escala va a borrar, y hacer cargo cult de "solo agregá cómputo" cuando no tenés ni los datos ni el presupuesto, y un modelo más simple y rico en prior habría ganado. Sostené la lección como una dirección, no como una receta.
Conecta con: scaling laws · sesgo inductivo · emergence y escala