Fase 03 — De modelos a inferencia en el browser
Esta fase pasa de kernels construidos a mano a modelos reales exportados. Ahora el éxito depende de que coincidan tres contratos: grafo y pesos del modelo, soporte de operadores/backends del runtime y transformaciones de medios alrededor de la inferencia.
Ramas
- Formatos de modelos, conversión y cuantización — ONNX, TFLite/LiteRT, safetensors, formatos especializados, optimización de grafos, formas, cobertura de operadores, precisión, calibración y drift numérico.
- Runtimes de inferencia en el browser — ONNX Runtime Web, LiteRT.js, Transformers.js, MediaPipe, TensorFlow.js cuando corresponda, sesiones, tensores, ciclo de vida, execution providers y fallbacks.
- Preprocesamiento, posprocesamiento y pipelines de medios — decodificación de imagen/audio/texto, resize, normalización, layouts, tokenización, masks, umbrales e interpretación determinista del resultado.
Hito del Workbench
v3 — Modelos y runtimes reales: exportá el mismo modelo pequeño a ONNX y TFLite/LiteRT en FP32 y en una forma cuantizada justificada, ejecutalo mediante ONNX Runtime Web y LiteRT.js, y compará cada pipeline completo con golden outputs.
Qué establece esta fase
- Comandos de exportación reproducibles y manifests de artefactos.
- Compatibilidad de operadores y formas verificada antes de la integración de producto.
- Una interfaz conceptual de backend sin borrar el comportamiento específico de cada runtime.
- Ownership y liberación explícitos de tensores, preprocesamiento y posprocesamiento.
- Comparaciones numéricas que separan drift de conversión, cuantización, runtime y pipeline.
Criterios de salida
- Cada artefacto de modelo tiene fuente, formato, precisión, checksum, tamaño y supuestos de operadores.
- Los mismos fixtures se ejecutan por ambos caminos de runtime o producen un resultado explícito de no soportado.
- Preprocesamiento y posprocesamiento coinciden con la implementación de referencia dentro de tolerancias declaradas.
- Se registran inicialización, primera inferencia, inferencia warm, memoria máxima, limpieza y fallback.
Seguí con Fase 04: Aceleración por hardware.