phase~2 min de lecturaActualizado 2026-07-16#phase#benchmarking#security#verification

Siempre activo — Performance, seguridad y verificación

Esta no es una fase final de limpieza. Empieza con el primer módulo WAT y sigue activa a través de runtimes de browser, aceleradores, modelos offline, componentes WASI y herramientas en sandbox.

Rama

  • Performance, seguridad y oficio en Wasm AI — protocolo de benchmark, comportamiento cold/warm, distribuciones de latencia, throughput, memoria, copias, tamaño de binario/modelo, golden outputs, compatibilidad, integridad y evidencia de release.

Obligaciones permanentes

  • Fijá revisión de fuente, toolchain, dependencias, modelo, conversión, runtime, backend, browser, sistema operativo y hardware.
  • Mantené fixtures deterministas y golden outputs bajo control de versiones con tolerancias documentadas.
  • Separá descarga, compilación, instanciación, carga de modelo, primera inferencia, inferencia warm y posprocesamiento.
  • Preservá muestras crudas e informá p50/p95 en vez de un promedio sin contexto.
  • Registrá memoria máxima, costos de copia de tensores, tamaño del binario Wasm, tamaño del modelo y uso de almacenamiento.
  • Probá capacidades no soportadas, fallbacks forzados, artefactos corruptos, capacidades denegadas, traps y cancelación.
  • Aplicá CSP, requisitos de aislamiento, checksums de artefactos, procedencia y evidencia de build reproducible cuando corresponda.
  • Publicá el soporte como una matriz observada y fechada, nunca como una afirmación de browser sin calificar.

Contrato de reporte del Workbench

Cada hito v0–v8 emite un reporte legible por máquina y un resumen humano con runtime, backend, browser, sistema operativo, hardware, versión y tamaño del modelo, tamaño del binario Wasm, cold start, inferencia warm p50/p95, memoria máxima, checksum del resultado, diferencia numérica y fallbacks observados. Las muestras crudas y los metadatos del método quedan disponibles detrás del resumen.

Criterios de salida para cada hito

  • El artefacto se construye o ejecuta con los comandos documentados.
  • El resultado coincide con una referencia golden o explica una diferencia revisada.
  • Las afirmaciones de performance incluyen entorno, método, distribución y evidencia cruda.
  • El backend y los fallbacks son visibles tanto en la UI como en el reporte.
  • Los límites de seguridad y las capacidades no disponibles tienen pruebas negativas.
  • Otra ejecución puede identificar cada entrada necesaria para reproducir o investigar el resultado.

Usá Registro de referencias para normalizar especificaciones cambiantes, versiones de runtimes, artefactos de modelos, observaciones de compatibilidad y evidencia de benchmarks.