Feature engineering
En ML clásico, las features deciden el techo y el algoritmo solo se acerca. Deep learning automatiza esto para texto e imágenes, pero para datos tabulares las features pensadas todavía le ganan a un modelo más sofisticado. Es donde entra el conocimiento de dominio.
El toolkit cotidiano
- Escalado — estandarizá/normalizá features numéricas para que modelos basados en distancia y gradiente se comporten (kNN, SVM, lineales, redes neuronales). A los árboles no les importa.
- Encoding de categóricas — one-hot para baja cardinalidad; target/ordinal/hashing o embeddings para alta cardinalidad.
- Manejo de valores faltantes — imputá (media/mediana/modelo) y muchas veces agregá una bandera "was-missing", porque la ausencia en sí puede ser señal.
- Transformaciones — log/Box-Cox para valores sesgados; binning; fecha → (dayofweek, mes, is_holiday).
- Interacciones y ratios —
price_per_sqft,clicks/impressions. Los modelos lineales no pueden inventarlos; tenés que agregarlos (una forma de inyectar sesgo inductivo a mano).
Las buenas features comparten rasgos
- Relevantes para el target (llevan señal), no solo disponibles.
- Disponibles al momento de predicción: si una feature se conoce solo después del resultado, es target leakage.
- Estables: no propensas a drift que rompa el modelo más adelante.
La trampa de leakage
Cualquier feature aprendida de datos (estadísticas de scaler, target encoding, TF-IDF) debe ajustarse solo sobre el training fold, dentro de un pipeline. Target encoding es especialmente peligroso: computar medias por categoría sobre todas las filas filtra la etiqueta.
Más features no es mejor. Features relevantes, sin leakage y disponibles en serving sí. Podá agresivamente; cada feature débil agrega varianza.
Conecta con: pipelines y leakage · representaciones · regularización para selección