LLMs
Un large language model es un transformer entrenado con un objetivo engañosamente simple: predecir el próximo token, a una escala enorme. Todo lo que resulta mágico o irritante de los LLMs (in-context learning, alucinación, sensibilidad al wording) sale de ese objetivo y de la arquitectura que lo rodea. Esta rama construye el modelo mental desde adentro hacia afuera.
Un LLM es un predictor del próximo token. Es asombrosamente capaz y no tiene una noción incorporada de verdad: ambas cosas vienen del mismo objetivo de entrenamiento.
Modelo mental
Un modelo de lenguaje factoriza la probabilidad de una secuencia en predicciones repetidas del próximo token. El transformer produce logits, decoding compromete un token y ese prefijo vuelve a ser el próximo input.
Hoja de ruta: arquitectura a comportamiento
- Mapa de attention del transformer
- Tokenization: por qué los modelos ven tokens, no palabras
- Positional encodings y RoPE
Entrenamiento y adaptación
- Pretraining: predicción del próximo token
- Modelos base vs instruct vs chat
- Emergent abilities e in-context learning
Generación y contexto
- Decoding y sampling
- Ventana de contexto y KV cache
- Long context y lost in the middle
- Reasoning y test-time compute
Comportamiento y despliegue
Conecta con: Arquitecturas · Entrenamiento y Adaptación · Sistemas de Inferencia
Fuentes principales
- Andrej Karpathy — Let's build GPT, Intro to LLMs, Deep Dive into LLMs.
- Sebastian Raschka — Build a Large Language Model (From Scratch).
- Jay Alammar — The Illustrated Transformer / Illustrated GPT-2.
- Hugging Face — LLM Course; Jurafsky & Martin — Speech and Language Processing (SLP3).
- Lilian Weng — blog (attention, hallucination, agents).
- Attention Is All You Need — arquitectura transformer.
- Speech and Language Processing — referencia actual de NLP y LLMs.
- Hugging Face LLM Course — material ejecutable.