conceptintermediatecurrentDeep Learning~1 min de lecturaVerificado 2026-07-20#deep-learning#optimizers#adam#sgd#momentum

Optimizadores: de SGD a AdamW

El optimizador convierte gradientes en actualizaciones de pesos. Todos se apoyan en gradient descent; las diferencias están en cómo usan la historia de gradientes para dar pasos más inteligentes.

La progresión

  • SGD — paso opuesto al gradiente del mini-batch. Simple, bien entendido, muchas veces generaliza mejor en visión, pero es lento y sensible al learning rate.
  • Momentum — acumula una velocidad que promedia gradientes recientes, así el optimizador atraviesa ruido y baches chicos en vez de zigzaguear. Pensalo como una pelota rodando cuesta abajo.
  • RMSProp / Adagrad — escala el paso de cada parámetro según la magnitud reciente de su propio gradiente, así los parámetros poco actualizados todavía se mueven.
  • Adam — momentum + escalado por parámetro combinados. Robusto, converge rápido, perdonador con learning rate: el default para la mayoría de deep nets.
  • AdamW — Adam con weight decay desacoplado, lo que hace que la regularización L2 se comporte correctamente. El estándar para entrenar transformers.

Qué compra lo "adaptativo"

Adam adapta el tamaño de paso efectivo por parámetro usando promedios móviles del gradiente (primer momento) y su cuadrado (segundo momento). En la práctica: funciona con menos tuning, por eso domina. SGD con momentum + un buen schedule puede generalizar un poco mejor, pero necesita más cuidado.

La perilla que todavía importa más

Ningún optimizador te salva de un mal learning rate. Adam reduce la sensibilidad pero no la elimina: combinalo con un schedule de warmup + decay. Demasiado alto → el loss diverge (NaNs); demasiado bajo → avanza a paso de tortuga.

Default razonable: AdamW + warmup + cosine decay. Usá SGD+momentum puro cuando estés exprimiendo el último poco de generalización de un modelo de visión.

Conecta con: gradient descent · schedules de LR · weight decay