indexModelos de Lenguaje y Fundacionales#llms#transformers

LLMs

Un large language model es un transformer entrenado con un objetivo engañosamente simple: predecir el próximo token, a una escala enorme. Todo lo que resulta mágico o irritante de los LLMs (in-context learning, alucinación, sensibilidad al wording) sale de ese objetivo y de la arquitectura que lo rodea. Esta rama construye el modelo mental desde adentro hacia afuera.

Un LLM es un predictor del próximo token. Es asombrosamente capaz y no tiene una noción incorporada de verdad: ambas cosas vienen del mismo objetivo de entrenamiento.

Modelo mental

Un modelo de lenguaje factoriza la probabilidad de una secuencia en predicciones repetidas del próximo token. El transformer produce logits, decoding compromete un token y ese prefijo vuelve a ser el próximo input.

Hoja de ruta: arquitectura a comportamiento

Entrenamiento y adaptación

Generación y contexto

Comportamiento y despliegue

Conecta con: Arquitecturas · Entrenamiento y Adaptación · Sistemas de Inferencia

Fuentes principales

  • Andrej Karpathy — Let's build GPT, Intro to LLMs, Deep Dive into LLMs.
  • Sebastian Raschka — Build a Large Language Model (From Scratch).
  • Jay Alammar — The Illustrated Transformer / Illustrated GPT-2.
  • Hugging Face — LLM Course; Jurafsky & Martin — Speech and Language Processing (SLP3).
  • Lilian Weng — blog (attention, hallucination, agents).
  • Attention Is All You Need — arquitectura transformer.
  • Speech and Language Processing — referencia actual de NLP y LLMs.
  • Hugging Face LLM Course — material ejecutable.