Seguridad de IA
Una aplicación de IA cruza un trust boundary cuando datos no confiables influyen al modelo y su salida puede alcanzar información, código, dinero o personas. El modelo es un componente no confiable dentro del perímetro; nunca es el perímetro.
Modelo mental
Limitá autoridad, validá efectos fuera del modelo, aislá datos e instrucciones, y prepará detección y respuesta. Un prompt no reemplaza un control de acceso.
Hoja de ruta
- Threat modeling de apps LLM
- Prompt injection directo
- Prompt injection indirecto
- Agencia excesiva
- Defense in depth y mínimo privilegio
- Red teaming
Conecta con: Autonomía y control · Evaluación · Ética y Gobernanza
Fuentes principales
- OWASP Top 10 for LLM Applications — taxonomía de riesgos y mitigaciones.
- MITRE ATLAS — tácticas, técnicas y casos adversariales de ML.
- NIST Adversarial Machine Learning Taxonomy — terminología de ataques y defensas.
- Indirect Prompt Injection — análisis sistemático del ataque vía datos externos.