Visión, Audio e IA Multimodal
Distintas modalidades cambian la representación, las simetrías útiles, el costo computacional y la forma de evaluar. Esta rama conecta visión y speech con modelos generativos y fusión multimodal sin reducir el campo a demos de texto-a-imagen.
Modelo mental
Los sistemas multimodales alinean, fusionan o generan representaciones de espacios distintos. Cada modalidad exige supuestos, métricas y controles propios de estructura, tiempo, provenance y riesgo.
Hoja de ruta
- Panorama multimodal
- Vision Transformers
- CLIP y espacios compartidos
- Modelos visión-lenguaje
- Audio y speech
- Diffusion models
- Latent diffusion
- Conditioning y CFG
- Control de generación
- Generación de video
- Evaluación de medios generativos
- Deepfakes, provenance y watermarking
Conecta con: Arquitecturas de Modelos · Datos para IA · Evaluación y Medición
Fuentes principales
- CLIP · Vision Transformer · Latent Diffusion — papers primarios.
- Speech and Language Processing — audio, speech y modelos de lenguaje.