Fase 04 — Aceleración por hardware
La aceleración no es un checkbox. Introduce un dispositivo, un modelo de comandos y sincronización, residencia de buffers, costos de transferencia, límites de capacidades y nuevas fuentes de variación numérica. Esta fase compara dos niveles de abstracción diferentes sin presentar ninguno como “Wasm más rápido”.
Ramas
- WebGPU para IA — adapters, devices, buffers, bind groups, compute pipelines, WGSL, workgroups, dispatch, sincronización, profiling y costos de transferencia CPU/GPU.
- WebNN y backends adaptativos — construcción de grafos,
MLTensor, selección de dispositivo, soporte de operadores, detección de capacidades, buffers compartidos, compatibilidad y política de fallback visible.
Hito del Workbench
v4 — Backend adaptativo: detectá las capacidades reales y seleccioná WebNN, WebGPU, Wasm SIMD o Wasm escalar según una política documentada. Mostrá en la UI y el reporte el backend seleccionado, la razón, la compatibilidad de modelo/runtime y cualquier fallback.
Qué establece esta fase
- Un kernel WebGPU cuyo movimiento de datos y dispatch pueden compararse con Wasm SIMD.
- Un camino WebNN tratado como una API en evolución y no universal.
- Verificaciones de capacidades basadas en las operaciones necesarias, no solo en la presencia de la API.
- Comparaciones golden y políticas de tolerancia específicas para cada backend.
- Un sistema de decisión que puede rechazar o degradar en lugar de sustituir trabajo silenciosamente.
Criterios de salida
- El tiempo de cómputo WebGPU y el de transferencia se miden por separado.
- El soporte WebNN se registra con build del browser, dispositivo, operadores y fecha de consulta.
- Cada backend consume fixtures equivalentes e informa la diferencia numérica.
- Pruebas de fallback forzado demuestran que el backend seleccionado y la razón siguen visibles.
Seguí con Fase 05: IA local-first.