indexDeep Learning#deep-learning#neural-networks

Deep Learning

Deep learning es lo que pasa cuando apilás muchas capas simples y diferenciables y dejás que gradient descent descubra las features en vez de diseñarlas a mano. Ese único cambio — representaciones aprendidas por encima de features artesanales — es la razón por la que tomó visión, habla y lenguaje, y es el sustrato sobre el que se construye todo LLM.

Una red neuronal es un stack de modelos lineales separados por no linealidades, entrenada end to end con backprop. Todo lo demás es hacer que eso entrene establemente a escala.

Modelo mental

Deep learning compone transformaciones diferenciables para aprender representaciones junto con la tarea. La arquitectura define caminos de información; el objetivo aporta presión; backprop asigna crédito; optimización y sistemas numéricos permiten escalar.

Hoja de ruta: cómo aprende una red

Hacer que el entrenamiento funcione

Arquitecturas

Representaciones y escala

Paradigmas y estrategia

Conecta con: Cómputo y Autodiff · Arquitecturas de Modelos · Modelos de Lenguaje

Fuentes principales

  • Andrej Karpathy — Neural Networks: Zero to Hero (micrograd → makemore → GPT).
  • 3Blue1Brown — serie Neural Networks (intuición visual para backprop).
  • Dive into Deep Learning (d2l.ai) — ejecutable, amplio.
  • Goodfellow, Bengio, Courville — Deep Learning (texto de referencia).
  • Stanford CS231n; Distill.pub para explicaciones visuales.
  • Deep Learning — referencia canónica.
  • Dive into Deep Learning — implementaciones ejecutables.
  • Neural Networks: Zero to Hero — de autodiff escalar a GPT.