conceptMachine Learning Estadístico~1 min de lecturaActualizado 2026-06-07#machine-learning#feature-engineering#preprocessing

Feature engineering

En ML clásico, las features deciden el techo y el algoritmo solo se acerca. Deep learning automatiza esto para texto e imágenes, pero para datos tabulares las features pensadas todavía le ganan a un modelo más sofisticado. Es donde entra el conocimiento de dominio.

El toolkit cotidiano

  • Escalado — estandarizá/normalizá features numéricas para que modelos basados en distancia y gradiente se comporten (kNN, SVM, lineales, redes neuronales). A los árboles no les importa.
  • Encoding de categóricas — one-hot para baja cardinalidad; target/ordinal/hashing o embeddings para alta cardinalidad.
  • Manejo de valores faltantes — imputá (media/mediana/modelo) y muchas veces agregá una bandera "was-missing", porque la ausencia en sí puede ser señal.
  • Transformaciones — log/Box-Cox para valores sesgados; binning; fecha → (dayofweek, mes, is_holiday).
  • Interacciones y ratiosprice_per_sqft, clicks/impressions. Los modelos lineales no pueden inventarlos; tenés que agregarlos (una forma de inyectar sesgo inductivo a mano).

Las buenas features comparten rasgos

  • Relevantes para el target (llevan señal), no solo disponibles.
  • Disponibles al momento de predicción: si una feature se conoce solo después del resultado, es target leakage.
  • Estables: no propensas a drift que rompa el modelo más adelante.

La trampa de leakage

Cualquier feature aprendida de datos (estadísticas de scaler, target encoding, TF-IDF) debe ajustarse solo sobre el training fold, dentro de un pipeline. Target encoding es especialmente peligroso: computar medias por categoría sobre todas las filas filtra la etiqueta.

Más features no es mejor. Features relevantes, sin leakage y disponibles en serving sí. Podá agresivamente; cada feature débil agrega varianza.

Conecta con: pipelines y leakage · representaciones · regularización para selección