indexSistemas de Inferencia#inference#optimization#serving#latency#cost

Sistemas de Inferencia

Inferencia es un sistema de memoria, cómputo y scheduling. El mismo modelo puede tener comportamiento operativo radicalmente distinto según hardware, precisión, tamaño de batch, patrón de prompts, caching y motor de serving.

Modelo mental

Prefill y decode tienen cuellos distintos. Batching, KV cache, precisión, forma del modelo y hardware determinan juntos el sobre viable de latencia, throughput, memoria y costo.

Hoja de ruta

Conecta con: Computación y Autodiff · Del prompt al token generado · Serving e inferencia

Fuentes principales