Interpretabilidad
Interpretabilidad pregunta qué evidencia sostiene un claim sobre comportamiento o cómputo interno. Una explicación plausible no es automáticamente fiel al mecanismo que produjo el output.
Modelo mental
Empezá por la pregunta y la unidad de análisis: feature, ejemplo, neurona, dirección de activación, representación, circuito o camino causal. Elegí un método observacional o de intervención cuyos límites coincidan con el claim y validalo con controles y efectos conductuales.
Roadmap
Feature importance · LIME y SHAP · saliency e Integrated Gradients · probes · activaciones y steering · mechanistic interpretability · circuits · sparse autoencoders · intervenciones causales · faithfulness y explanation theater.
Límite
Interpretabilidad no prueba por sí sola safety, fairness, verdad o causalidad en el mundo. Puede generar y testear hipótesis sobre un modelo bajo intervenciones concretas.
Conecta con: Análisis sistemático de errores · Transparencia y explicabilidad · Red teaming de sistemas de IA
Fuentes principales
- SHAP — framing formal de atribución.
- Integrated Gradients — axiomas y método.
- Transformer Circuits — descomposición mecanicista fundacional.