indexintermediateplannedInterpretabilidad#interpretability#explainability#representations#causality

Interpretabilidad

Interpretabilidad pregunta qué evidencia sostiene un claim sobre comportamiento o cómputo interno. Una explicación plausible no es automáticamente fiel al mecanismo que produjo el output.

Modelo mental

Empezá por la pregunta y la unidad de análisis: feature, ejemplo, neurona, dirección de activación, representación, circuito o camino causal. Elegí un método observacional o de intervención cuyos límites coincidan con el claim y validalo con controles y efectos conductuales.

Roadmap

Feature importance · LIME y SHAP · saliency e Integrated Gradients · probes · activaciones y steering · mechanistic interpretability · circuits · sparse autoencoders · intervenciones causales · faithfulness y explanation theater.

Límite

Interpretabilidad no prueba por sí sola safety, fairness, verdad o causalidad en el mundo. Puede generar y testear hipótesis sobre un modelo bajo intervenciones concretas.

Conecta con: Análisis sistemático de errores · Transparencia y explicabilidad · Red teaming de sistemas de IA

Fuentes principales