Sistemas de Inferencia
Inferencia es un sistema de memoria, cómputo y scheduling. El mismo modelo puede tener comportamiento operativo radicalmente distinto según hardware, precisión, tamaño de batch, patrón de prompts, caching y motor de serving.
Modelo mental
Prefill y decode tienen cuellos distintos. Batching, KV cache, precisión, forma del modelo y hardware determinan juntos el sobre viable de latencia, throughput, memoria y costo.
Hoja de ruta
- Por qué inferencia concentra el costo
- Latencia vs throughput
- Fundamentos de GPU y hardware
- KV cache y memoria
- Batching
- Quantization
- FlashAttention
- Speculative decoding
- Prefix y semantic caching
- Motores de serving
- Right-sizing
- Modelado de costo
Conecta con: Computación y Autodiff · Del prompt al token generado · Serving e inferencia
Fuentes principales
- vLLM — serving y continuous batching.
- PagedAttention · FlashAttention · Speculative Decoding — mecanismos primarios.