conceptDeep Learning~1 min de lecturaActualizado 2026-06-07#deep-learning#scaling#strategy#mental-model

The bitter lesson

"The bitter lesson" de Rich Sutton es la idea estratégica más útil para entender por qué la AI moderna se ve como se ve: a lo largo de décadas, los métodos generales que escalan con cómputo vencieron consistentemente a enfoques construidos sobre conocimiento humano hecho a mano. Es "bitter" porque los investigadores siguen invirtiendo en estructura ingeniosa y específica de dominio, y siguen siendo superados por métodos más simples que solo usan más cómputo y datos.

El patrón, repetido

  • Ajedrez / Go — estrategia programada a mano perdió contra búsqueda masiva y self-play.
  • Habla y visión — features diseñadas (fonemas, detectores de bordes) perdieron contra representaciones aprendidas desde deep nets.
  • Lenguaje — gramáticas y pipelines perdieron contra predicción next-token a escala.

Cada vez, el prior humano fuerte ayudó al principio y después limitó el techo; el método general y hambriento de cómputo seguía mejorando a medida que crecían los recursos.

Por qué pasa

La estructura diseñada por humanos es satisfactoria y ayuda en el corto plazo, pero no escala: hornea nuestra comprensión limitada. Los métodos generales (búsqueda y aprendizaje) no tienen ese techo: dales más cómputo y datos y siguen mejorando. Este es el esqueleto estratégico detrás de "just scale it" y la era de foundation models.

El matiz (no lo sobreapliques)

The bitter lesson habla de la frontera de largo plazo, no de tu martes. En la práctica:

  • Con datos/cómputo limitados, un buen prior (el modelo correcto, features) todavía gana: ver árboles en datos tabulares.
  • La lección favorece métodos generales, pero calidad de datos, evals y diseño de sistema es donde vive la mayor parte del trabajo aplicado.
  • Es una observación sobre trayectoria, no una licencia para tirarle cómputo a todo.

Trampa

Dos errores opuestos: sobreingenierizar estructura ingeniosa que la escala va a borrar, y hacer cargo cult de "solo agregá cómputo" cuando no tenés ni los datos ni el presupuesto, y un modelo más simple y rico en prior habría ganado. Sostené la lección como una dirección, no como una receta.

Conecta con: scaling laws · sesgo inductivo · emergence y escala