Módulo 04 · Unidad I

Transformación de variables y pipelines

Transformar, escalar, codificar y construir variables sin filtrar información ni romper la reproducibilidad.

Dedicación2 encuentros RequisitosMódulos 00 a 03

Centro del módulo

Índice interactivo

Abrí cada recurso y marcá el avance. El estado se conserva en tu navegador.

Presentaciones

Una presentación de 14 diapositivas para distinguir escala, forma, objeto transformado, geometría, robustez, PCA y prevención de leakage. También podés recorrerla directamente desde esta página.

Visor integrado. Abrí cada bloque para avanzar las diapositivas sin salir de Datos y Decisiones. Si preferís una vista más grande, usá “Abrir a pantalla completa”. Si Google solicita acceso, iniciá sesión desde “Abrir en Google Slides”.

Diapositivas · Fundamentos y criterio de decisión Unidades, geometría, robustez, PCA, diagnóstico y prevención de leakage

Laboratorio de simulaciones

Doce experimentos coordinados para comparar transformaciones, algoritmos, objetos y protocolos de validación antes de elegir un pipeline.

Simulación Transformación de variables · recorrido completo Centro de acceso a doce simulaciones sobre escala, forma, robustez, PCA, leakage, pipelines, objetivo, texto y selección. Abrir ahora Simulación Simulación 01 · Distancia, unidades y KNN Observá cómo una unidad numéricamente grande puede dominar la vecindad. Abrir ahora Simulación Simulación 02 · Comparador de escaladores Contrastá Standard, Min-Max, Robust y MaxAbs sobre los mismos datos. Abrir ahora Simulación Simulación 03 · Transformaciones de forma Explorá log, Box-Cox, Yeo-Johnson y cuantiles según dominio y distribución. Abrir ahora Simulación Simulación 04 · Outliers, centro y escala Compará media y desvío con mediana e IQR bajo contaminación. Abrir ahora Simulación Simulación 05 · PCA, covarianza y correlación Descubrí cuándo el primer componente refleja unidades en lugar de estructura. Abrir ahora Simulación Simulación 06 · Arena de algoritmos y escala Compará sensibilidad a escala en KNN, logística, K-means y árboles. Abrir ahora Simulación Simulación 07 · Columnas, filas y objetivo Decidí si corresponde transformar features, observaciones, target o ciclos. Abrir ahora Simulación Simulación 08 · Leakage y validación Separá fit y transform para no aprender del test ni del futuro. Abrir ahora Simulación Simulación 09 · Constructor de pipelines Ordená y justificá cada etapa de un preprocesamiento reproducible. Abrir ahora Simulación Simulación 10 · Transformación del objetivo Compará errores absolutos y relativos e invertí predicciones correctamente. Abrir ahora Simulación Simulación 11 · Clustering de documentos Contrastá magnitud, normalización por fila y similitud coseno. Abrir ahora Simulación Simulación 12 · Selector de transformaciones Vinculá diagnóstico, objetivo, alternativa y riesgo de distorsión. Abrir ahora

Laboratorios en Google Colab

Conservá el laboratorio canónico del módulo y aplicá el flujo completo con Python dentro de un pipeline reproducible.

Repaso y evaluación

Consolidá el criterio con 20 preguntas desarrolladas y un glosario interactivo de 84 términos.

Al completar el módulo

Resultados de aprendizaje

  • Distinguir escalado, transformación de forma y normalización según el objeto que se modifica.
  • Elegir estadísticas de centro y escala según algoritmo, geometría y presencia de outliers.
  • Comparar PCA sobre covarianza y correlación sin confundir varianza con relevancia de negocio.
  • Transformar features, texto, tiempo y variable objetivo conservando semántica e interpretación.
  • Encapsular preparación y estimación dentro de pipelines y validación sin leakage.

Marco conceptual

Ideas que organizan la práctica

01

Primero se define qué objeto se transforma

Escalar una columna, normalizar una fila, codificar una categoría, representar un ciclo o transformar el objetivo responden preguntas distintas. La operación correcta empieza por la semántica del objeto.

02

Escala y forma resuelven problemas diferentes

Standard, Min-Max, Robust y MaxAbs cambian centro o magnitud; log, Box-Cox, Yeo-Johnson y cuantiles cambian la forma. Un scaler no corrige por sí solo asimetría, outliers ni restricciones de dominio.

03

La geometría del algoritmo determina la sensibilidad

KNN, K-means, SVM, PCA, redes y modelos penalizados heredan unidades, distancias, varianzas o gradientes. Los árboles suelen ser menos sensibles porque dividen por umbrales y preservan el orden.

04

Robustez y PCA exigen un criterio explícito

Media, desvío, mínimo y máximo reaccionan a extremos; mediana e IQR describen mejor la masa central bajo contaminación. En PCA, escalar decide si se preserva varianza absoluta o se comparan patrones relativos.

05

Fit y transform deben quedar dentro de la validación

Cada imputación, escala, cuantil, categoría o parámetro de potencia se aprende solo con entrenamiento. Pipeline y cross-validation reproducen ese orden en cada fold y mantienen test como evidencia final.

Nivel profesional

Profundización aplicada

Estos temas conectan el fundamento con decisiones modernas, evaluación rigurosa y operación real.

01

Covarianza frente a correlación en PCA y estabilidad de componentes ante cambios de unidad.

02

Transformaciones de potencia, cuantiles y objetivo dentro de validación anidada.

03

Normalización por fila para texto, codificación cíclica y representación de categorías.

04

Disponibilidad temporal y point-in-time correctness en ingeniería de variables.

Control de calidad

Errores frecuentes que invalidan la conclusión

  • Usar un scaler para intentar resolver asimetría, outliers o errores de dominio.
  • Normalizar filas cuando el problema requería escalar columnas, o viceversa.
  • Calcular estadísticas de transformación con todo el dataset.
  • Elegir una transformación por métrica sin revisar interpretación, estabilidad e inversión.
  • Crear variables con datos posteriores al momento de decisión.

Caso de negocio

Decidir con contexto

Un equipo segmenta clientes con edad, ingreso, antigüedad y reclamos. Sin escalar, el ingreso domina la distancia; si además calcula estadísticas con todo el dataset, la validación aprende indirectamente de casos futuros.

Explorar en la simulación

Práctica guiada

Secuencia de laboratorio

  1. 01Identificar si se transforma una columna, una fila, el objetivo, una categoría o el tiempo.
  2. 02Diagnosticar dominio, ceros, negativos, forma, outliers, unidades y sensibilidad del algoritmo.
  3. 03Comparar escaladores y transformaciones de forma sobre la misma referencia.
  4. 04Contrastar PCA sobre datos crudos y estandarizados y documentar qué cambia.
  5. 05Construir un ColumnTransformer dentro de un Pipeline y validarlo por fold.
  6. 06Medir el resultado en unidades de negocio y registrar interpretación, riesgo y reversión.
Desafío de transferencia

Tomar una decisión defendible

Defendé un pipeline completo indicando qué se aprende en train, qué se conserva, qué puede distorsionarse y cómo se mide el resultado en unidades de negocio.

  1. Escribí una hipótesis antes de calcular.
  2. Definí la evidencia que podría refutarla.
  3. Compará al menos dos escenarios.
  4. Terminá con acción, límite y responsable.
Producto del módulo

Entregable esperado

Matriz de decisión por variable, comparación justificada de alternativas y pipeline reproducible con prueba explícita de que cada fit ocurre solo en train.