Deep Learning
Deep learning es lo que pasa cuando apilás muchas capas simples y diferenciables y dejás que gradient descent descubra las features en vez de diseñarlas a mano. Ese único cambio — representaciones aprendidas por encima de features artesanales — es la razón por la que tomó visión, habla y lenguaje, y es el sustrato sobre el que se construye todo LLM.
Una red neuronal es un stack de modelos lineales separados por no linealidades, entrenada end to end con backprop. Todo lo demás es hacer que eso entrene establemente a escala.
Modelo mental
Deep learning compone transformaciones diferenciables para aprender representaciones junto con la tarea. La arquitectura define caminos de información; el objetivo aporta presión; backprop asigna crédito; optimización y sistemas numéricos permiten escalar.
Hoja de ruta: cómo aprende una red
- Redes neuronales y backpropagation
- Funciones de activación y por qué importa la no linealidad
- Funciones de pérdida en deep learning
Hacer que el entrenamiento funcione
- Inicialización y normalización
- Optimizadores: de SGD a AdamW
- Regularización: dropout, weight decay y augmentation
- Dinámicas de entrenamiento: schedules, warmup y debugging
Arquitecturas
Representaciones y escala
Paradigmas y estrategia
- Reinforcement learning, lo esencial cubre reward, policy y el paradigma detrás de RLHF y modelos de razonamiento.
- The bitter lesson explica por qué los métodos generales y hambrientos de cómputo siguen venciendo a la estructura hecha a mano.
Conecta con: Cómputo y Autodiff · Arquitecturas de Modelos · Modelos de Lenguaje
Fuentes principales
- Andrej Karpathy — Neural Networks: Zero to Hero (micrograd → makemore → GPT).
- 3Blue1Brown — serie Neural Networks (intuición visual para backprop).
- Dive into Deep Learning (d2l.ai) — ejecutable, amplio.
- Goodfellow, Bengio, Courville — Deep Learning (texto de referencia).
- Stanford CS231n; Distill.pub para explicaciones visuales.
- Deep Learning — referencia canónica.
- Dive into Deep Learning — implementaciones ejecutables.
- Neural Networks: Zero to Hero — de autodiff escalar a GPT.