Módulo 03 · Unidad I

Outliers, robustez e influencia

Separar errores, rarezas válidas y observaciones influyentes con criterios estadísticos y de negocio.

Dedicación2 encuentros + laboratorio RequisitosMódulos 01 y 02

Centro del módulo

Índice interactivo

Abrí cada recurso y marcá el avance. El estado se conserva en tu navegador.

Presentaciones

Dos recorridos complementarios: primero diagnóstico, robustez e influencia; después métodos modernos de detección con Machine Learning. También podés recorrerlos directamente desde esta página.

Visor integrado. Abrí cada bloque para avanzar las diapositivas sin salir de Datos y Decisiones. Si preferís una vista más grande, usá “Abrir a pantalla completa”. Si Google solicita acceso, iniciá sesión desde “Abrir en Google Slides”.

Diapositivas 01 · Diagnóstico, robustez y tratamiento Reglas clásicas, influencia, decisiones de tratamiento y leakage
Diapositivas 02 · Métodos de detección con ML Aislamiento, densidad, fronteras, clustering y reconstrucción

Laboratorio de simulaciones

Compare reglas, geometrías, modelos y umbrales sobre escenarios controlados antes de elegir una intervención.

Laboratorios en Google Colab

Avance desde reglas clásicas hasta una comparación profesional de detectores y un caso aplicado de reservas hoteleras.

Repaso y evaluación

Consolide el criterio con 30 preguntas desarrolladas y un glosario ampliado de consulta rápida.

Al completar el módulo

Resultados de aprendizaje

  • Definir rareza respecto de una distribución, relación, segmento o tiempo.
  • Comparar IQR, Z-score, MAD y criterios multivariados sin automatizar la eliminación.
  • Diferenciar residuo, leverage, influencia y anomalía respecto del modelo.
  • Seleccionar y evaluar detectores con ML según geometría, densidad, escala y objetivo.
  • Calibrar thresholds y justificar conservar, corregir, transformar, segmentar o excluir.

Marco conceptual

Ideas que organizan la práctica

01

La rareza necesita una referencia

Un caso puede ser extremo en una variable, improbable en una relación, raro entre sus vecinos o anómalo solo para un segmento o momento. Detectar exige declarar primero qué patrón se considera normal.

02

Robustez antes que automatismo

IQR y MAD resisten mejor la contaminación; Z-score funciona cuando media y desvío representan bien el proceso. Los umbrales son señales de inspección, no órdenes automáticas de borrado.

03

Rareza e influencia no son sinónimos

En regresión, un caso puede tener gran residuo, alta palanca o ambas. La distancia de Cook y la comparación con y sin el caso muestran si la observación cambia parámetros, predicciones o decisiones.

04

Los métodos de ML modelan rarezas distintas

Isolation Forest aísla; LOF compara densidades; One-Class SVM aprende una frontera; Elliptic Envelope usa covarianza robusta; DBSCAN trata ruido y PCA observa error de reconstrucción. Ninguno domina siempre.

05

Del score a una decisión auditable

Contaminación, percentiles, capacidad de revisión y costo de falsos positivos y negativos convierten un score en un threshold operativo. El preprocesamiento debe ajustarse solo con entrenamiento para evitar leakage.

Nivel profesional

Profundización aplicada

Estos temas conectan el fundamento con decisiones modernas, evaluación rigurosa y operación real.

01

Distancia de Mahalanobis robusta, leverage, Cook y sensibilidad de parámetros.

02

Rareza global, local y contextual por segmento, tiempo, canal o régimen.

03

Outlier detection frente a novelty detection y datos de referencia limpios.

04

Isolation Forest, LOF, One-Class SVM, Elliptic Envelope, DBSCAN y PCA.

05

Calibración de thresholds por etiquetas, capacidad, contaminación y costo.

Control de calidad

Errores frecuentes que invalidan la conclusión

  • Eliminar automáticamente todo punto marcado por una regla estadística.
  • Usar puntuación z en distribuciones muy asimétricas sin contraste robusto.
  • Ajustar escala, modelo o threshold con información del conjunto de test.
  • Comparar detectores con orientaciones de score o tasas de alerta diferentes.
  • Evaluar influencia sin contrastar conclusiones con y sin el caso.

Caso de negocio

Decidir con contexto

En reservas hoteleras, un lead time muy alto puede ser error, grupo legítimo o señal temprana de cancelación. El equipo debe contrastar distribución, segmento e impacto predictivo antes de intervenir.

Explorar en la simulación

Práctica guiada

Secuencia de laboratorio

  1. 01Verificar unidades, reglas, duplicados, temporalidad y procedencia.
  2. 02Comparar IQR, Z-score y MAD bajo distintas formas de distribución.
  3. 03Medir residuo, leverage, Cook y cambios del modelo con y sin el caso.
  4. 04Detectar rarezas multivariadas después de escalar y segmentar.
  5. 05Contrastar Isolation Forest, LOF y One-Class SVM con una referencia común.
  6. 06Calibrar el threshold y registrar tratamiento, impacto, límite y responsable.
Desafío de transferencia

Tomar una decisión defendible

Construí un protocolo que separe error, evento raro válido, segmento especial, observación influyente y cambio de régimen; luego definí una acción y un responsable para cada clase.

  1. Escribí una hipótesis antes de calcular.
  2. Definí la evidencia que podría refutarla.
  3. Compará al menos dos escenarios.
  4. Terminá con acción, límite y responsable.
Producto del módulo

Entregable esperado

Informe de diagnóstico con bitácora de casos, comparación de detectores, threshold justificado, análisis de sensibilidad y recomendación de tratamiento.