WebAssembly AI Atlas
Del bytecode portable a la inteligencia local.
Low-Level Atlas explicó la máquina. AI Atlas explicó los sistemas inteligentes. Este crossover independiente estudia cómo ejecutar esos sistemas de forma portable, local, acelerada cuando esté disponible, dentro de límites explícitos y con outputs verificables.
Aprendé cada capa haciéndola observable.
Empezá con WAT y memoria lineal, construí un motor de inferencia chico, medí SIMD y workers, mové modelos reales por runtimes reales, y después agregá aceleración adaptativa, offline, componentes portables y tools en sandbox.
Prerrequisitos: Comodidad con TypeScript, typed arrays, layout básico de memoria y la forma de un pipeline de inferencia. Wasm y los mecanismos de aceleración se introducen progresivamente.
WasmAI Workbench · v0 → v8
Una workbench local-first en el browser que progresivamente carga, ejecuta, compara, verifica y reporta modelos de AI sobre CPU/Wasm, WebGPU, WebNN y componentes portables. Cada decisión de backend queda visible.
WebAssembly visible
- Capa
- WAT · módulo · memoria lineal
- Output esperado
- Un módulo vectorial WAT escrito a mano, instanciado desde TypeScript y con su binario inspeccionado.
Tiny inference engine
- Capa
- kernels tensoriales · forward pass
- Output esperado
- Tensores densos, matmul, bias, ReLU, softmax y una MLP preentrenada verificada.
SIMD y paralelismo
- Capa
- SIMD128 · workers · memoria compartida
- Output esperado
- Kernels escalar, SIMD y paralelo comparados bajo un benchmark reproducible.
Modelos y runtimes reales
- Capa
- ONNX · TFLite · adapters
- Output esperado
- El mismo modelo exportado ejecutado con ONNX Runtime Web y LiteRT.js contra golden outputs.
Backend adaptativo
- Capa
- WebNN → WebGPU → Wasm SIMD → escalar
- Output esperado
- Detección de capacidades, selección explícita, fallbacks visibles, métricas y verificación.
Multimodal local-first
- Capa
- imagen · audio · embeddings · offline
- Output esperado
- Pipelines locales de imagen y audio que siguen siendo útiles sin conexión.
Semantic search local
- Capa
- IndexedDB · embeddings · vector search
- Output esperado
- Importación, chunking y embeddings locales, retrieval persistente y resultados con evidencia.
Componente portable de inferencia
- Capa
- WIT · Component Model · WASI
- Output esperado
- Un componente tipado del pipeline ejecutado fuera del browser con un runtime WASI.
AI tools en sandbox
- Capa
- capabilities · fuel · tools tipadas
- Output esperado
- Un host de agente local invocando tools Wasm determinísticas, con presupuestos y sin acceso implícito.
Core estable, aceleración condicional.
El soporte se detecta en runtime y queda registrado. Los paths experimentales o dependientes del browser nunca se presentan como universales.
WebAssembly Core · JS API
Módulos validados, memoria lineal, SIMD y threads cuando el host habilita el aislamiento requerido.
WebGPU · Wasm threads
Aceleración detectada por capabilities con límites, políticas del browser y costos de transferencia registrados.
WebNN · WASI-NN
Caminos de grafos e inferencia del host prometedores cuya disponibilidad y semántica aún exigen checks explícitos.
Wasm SIMD → scalar
Cada camino adaptativo nombra el backend elegido y verifica el output antes de declarar éxito.
Capas diferentes, trabajos diferentes.
WebAssembly, WebGPU y WebNN son mecanismos complementarios, no runtimes intercambiables.
Orientación
Prerrequisitos, diferencias entre plataformas, límites de capacidades, herramientas esperadas y rutas lineales o guiadas por proyectos.
Empezar acá
Prerrequisitos, límites de plataforma, recorridos de lectura y el hilo práctico para comenzar WebAssembly AI Atlas.
Abrir ramaLo imprescindible
Las distinciones y reglas de evidencia mínimas para razonar correctamente sobre IA portable, local, acelerada y en sandbox.
Abrir ramaÍndice Wasm AI
Mapa raíz del WebAssembly AI Atlas, que conecta bytecode portable, inferencia en el browser, aceleración, IA local-first, componentes WASI y entregas verificables.
Abrir ramaFundamentos de WebAssembly
Entender módulos y bytecode, comparar toolchains y hacer explícita la frontera de memoria lineal entre guest y host.
Modelo de Ejecución WebAssembly
WAT, módulos binarios, validación, máquina de stack, imports, exports, tables, referencias, memoria lineal, traps, instanciación y contrato de sandbox.
Toolchains y Targets de Lenguaje
Cómo WAT, C/C++ y Rust llegan a Wasm; glue code, source maps, debugging, optimización con Binaryen y targets browser/WASI.
Memoria Lineal, ABI e Interop con el Host
Punteros, offsets, typed arrays, ownership, allocación, growth, strings, structs, transferencia de tensores, Canonical ABI y límites de zero-copy.
Inferencia desde Primeros Principios
Implementar mecánica tensorial debajo de un runtime y medir qué cambian SIMD, threads, workers y memoria compartida.
Kernels Tensoriales e Inferencia desde Cero
Shapes, strides, layouts, matmul, convolution, activaciones, normalización, pesos, forward pass y tolerancias numéricas debajo de un runtime.
SIMD, Threads y Workers
SIMD128, autovectorización, memoria compartida, atomics, worker pools, cross-origin isolation, false sharing y speedups medibles.
De Modelos a Inferencia en Browser
Exportar modelos, entender formatos y cuantización, comparar runtimes y validar el pre/postprocesamiento alrededor de ellos.
Formatos, Conversión y Cuantización
Compute graphs, ONNX, TFLite/LiteRT, safetensors, límites de GGUF, export, cobertura de operadores, optimización, cuantización y drift.
Runtimes de Inferencia en Browser
Comparación crítica de ONNX Runtime Web, LiteRT.js, Transformers.js, MediaPipe y TensorFlow.js por lifecycle, backends, cobertura, memoria y fallbacks.
Pre/Postprocesamiento y Pipelines de Media
Las transformaciones de imagen, audio y texto que los demos esconden: decode, resize, normalización, tokenización, spectrograms, masks, NMS, logits y thresholds.
Aceleración de Hardware
Tratar WebGPU y WebNN como caminos distintos, con detección, costos de transferencia, fallbacks explícitos y outputs verificados.
WebGPU para AI
Adapters, devices, buffers, bind groups, compute WGSL, dispatch, workgroups, sincronización, residencia de tensores, profiling y costos de transferencia.
WebNN y Backends Adaptativos
Graph builder, MLTensor, selección CPU/GPU/NPU, feature detection, buffer sharing, compatibilidad, fallback explícito y política auditable.
AI Local-First
Diseñar entrega, persistencia, offline, pipelines multimodales, embeddings y retrieval alrededor de límites reales del dispositivo.
AI Multimodal Local-First y Offline
Service workers, cache de modelos, IndexedDB, descargas reanudables, warm-up, presión de memoria, cancelación, privacidad y lifecycle offline.
LLMs, Embeddings y RAG en Browser
Modelos chicos, tokenización, prefill/decode, KV cache, streaming, embeddings, vector search, chunking local, retrieval con evidencia y generación opcional.
Más Allá del Browser
Usar WIT, Component Model, WASI y hosts basados en capabilities para mover inferencia y tools determinísticas fuera de un browser.
WASI, Componentes y WASI-NN
Core modules vs components, WIT, Canonical ABI, composición, recursos, streams/futures async, capabilities, runtimes WASI e inferencia provista por el host.
Tools y Plugins AI en Sandbox
Contratos WIT tipados, capabilities explícitas, tools determinísticas, presupuestos de memoria/CPU, fuel, timeouts, supply chain, firmas y frontera agente/tool.
Siempre Activo
Medir paths cold/warm, testear drift numérico, proteger supply chain y hacer auditables los fallbacks y outputs.
Especificaciones antes que abstracciones
El registro mantiene estándares, documentación de implementación, referencias de runtimes y APIs sensibles a cambios de forma explícita y revisable.