conceptintermediatecurrentDeep Learning~1 min de lecturaVerificado 2026-07-20#deep-learning#cnn#convolution#vision

CNNs: convolución y estructura espacial

Una convolutional neural network es una red cuyo sesgo inductivo matchea imágenes: los píxeles cercanos se relacionan y un patrón significa lo mismo donde sea que aparezca. Codificar eso en la arquitectura es por lo que las CNNs dominaron visión durante una década.

Convolución: un filtro chico, deslizado por todos lados

En vez de conectar cada píxel con cada neurona, una CNN desliza filtros pequeños (por ejemplo 3×3) por la imagen. Cada filtro aprende a detectar un patrón local — un borde, una textura — y aplica los mismos pesos en todos lados (weight sharing). Dos grandes ganancias:

  • Localidad — las neuronas miran vecindarios chicos, matcheando cómo funciona la estructura visual.
  • Invariancia a traslación — un detector de gatos se activa esté el gato arriba a la izquierda o en el centro, porque el filtro se comparte entre posiciones.

Weight sharing también significa muchísimos menos parámetros que una red fully-connected sobre la misma imagen: menos overfitting, menos cómputo.

La jerarquía de features

Convoluciones apiladas construyen una jerarquía de features: capas tempranas detectan bordes y colores, capas medias detectan texturas y partes, capas profundas detectan objetos. Pooling (downsampling) achica el tamaño espacial y agranda el receptive field, así neuronas más profundas "ven" más de la imagen. Esto es representation learning hecho espacial.

Dónde están hoy las CNNs

Las CNNs todavía impulsan mucha visión en producción (clasificación, detección, segmentación) y son baratas y rápidas. Vision Transformers (ViT) ahora las igualan o superan a gran escala, pero los ViTs necesitan más datos justamente porque carecen del sesgo convolucional y deben aprender localidad desde cero. El tradeoff es el mismo de siempre: prior más fuerte vs más datos (y la historia de attention sigue directo hacia LLMs).

Trampa

Las CNNs asumen datos con estructura de grilla y correlación local. Forzarlas sobre datos tabulares (sin estructura espacial) desperdicia su sesgo: los árboles suelen ganar ahí.

Conecta con: sesgo inductivo · attention vs convolución · jerarquía de features