Cuestionario académico interactivo · Módulo Outliers

Outliers, robustez, influencia y detección de anomalías

Un recorrido de 30 preguntas desde los fundamentos estadísticos hasta Isolation Forest, LOF, One-Class SVM, error de reconstrucción, evaluación, thresholds, costos, leakage y drift. Cada respuesta incluye interpretación, aplicación y criterio de decisión.

IQR · MAD · Z-scoreInfluencia · CookIsolation ForestLOF · One-Class SVMThresholds · CostosProducción · Drift
Material elaborado por el profesor Sergio Gevatschnaider.
0 / 30 revisadas0%

Ruta de estudio

Primero definí qué significa rareza en el problema, luego elegí una estadística o geometría compatible, evaluá la influencia y finalmente convertí el score en una decisión calibrada. La detección no termina cuando un punto se colorea de rojo.

No hay preguntas que coincidan con el filtro o la búsqueda.
Respuesta
Un outlier es una observación que se aleja de un patrón de referencia. La referencia puede ser una distribución, una relación entre variables, una densidad local, una frontera aprendida por un modelo o un comportamiento histórico. Ser raro no implica ser incorrecto.
Clasificación útil
Antes de tratarlo conviene separar al menos cuatro posibilidades: error de captura o medición, evento raro válido, observación perteneciente a otro segmento y señal de cambio del proceso.
Ejemplo
Una venta corporativa veinte veces mayor al ticket habitual puede ser estadísticamente extrema y, sin embargo, representar el segmento más valioso del negocio.
Decisión
La primera acción no es borrar: es verificar procedencia, unidades, reglas de negocio, temporalidad y trazabilidad.
Idea para recordar: Un detector identifica rareza; el analista decide qué significa esa rareza.
Marcá la pregunta cuando puedas explicarla sin mirar.
Univariado
El valor es extremo al analizar una sola variable, por ejemplo un ingreso muy superior al resto.
Bivariado
La observación rompe el patrón entre dos variables. Edad e ingreso pueden ser normales por separado, pero su combinación puede resultar muy inusual.
Multivariado
La rareza surge al considerar simultáneamente varias variables. El punto puede no ser extremo en ninguna columna aislada y aun así ser anómalo en el espacio conjunto.
Implicancia
Aplicar IQR columna por columna no reemplaza una detección multivariada basada en distancia, densidad, aislamiento o reconstrucción.
Idea para recordar: La normalidad marginal no garantiza normalidad conjunta.
Marcá la pregunta cuando puedas explicarla sin mirar.
Global
Es raro respecto del conjunto completo. Suele aparecer lejos de la masa principal de datos.
Local
Es raro respecto de sus vecinos. Un punto puede estar dentro del rango global y ser anómalo porque su densidad local es mucho menor que la del entorno.
Contextual
Solo es anómalo bajo cierto contexto: hora, estación, segmento, ubicación, producto o régimen.
Ejemplo
Una temperatura de 30 °C puede ser normal en verano y anómala en invierno; un monto de USD 5.000 puede ser normal para clientes corporativos y extremo para clientes minoristas.
Idea para recordar: La pregunta correcta no siempre es «¿es raro?», sino «¿raro respecto de qué referencia?».
Marcá la pregunta cuando puedas explicarla sin mirar.
Reglas duras
Hay anomalías que se detectan sin estadística: edad negativa, cantidad vendida mayor que stock disponible, porcentaje superior a 100 cuando la definición no lo permite.
Reglas blandas
Otros casos requieren contexto: una operación nocturna puede ser válida para un segmento y sospechosa para otro.
Valor analítico
El conocimiento del dominio ayuda a distinguir imposibilidad, improbabilidad y novedad.
Riesgo
Un criterio puramente numérico puede eliminar precisamente los eventos de mayor interés: fraude, fallas, clientes premium o shocks.
Idea para recordar: El modelo aporta una señal; el dominio aporta significado.
Marcá la pregunta cuando puedas explicarla sin mirar.
Concepto
Un detector entrenado con el pasado puede marcar como anómalos datos que pertenecen a una nueva distribución estable.
Señal
La tasa de alertas aumenta persistentemente y se concentra en periodos recientes o segmentos específicos.
Diagnóstico
Conviene comparar distribuciones por ventana temporal, revisar drift y verificar cambios operativos, regulatorios, comerciales o tecnológicos.
Acción
Puede ser necesario recalibrar thresholds, reentrenar el detector o segmentar el proceso en regímenes.
Idea para recordar: Una explosión de outliers puede ser un problema del detector o una noticia sobre el mundo.
Marcá la pregunta cuando puedas explicarla sin mirar.
Definición
IQR = Q3 − Q1, donde Q1 es el percentil 25 y Q3 el percentil 75.
Regla
Límite inferior = Q1 − k·IQR y límite superior = Q3 + k·IQR. Es habitual comenzar con k = 1,5.
Fortaleza
Usa cuantiles y, por lo tanto, es menos sensible a extremos que la media y el desvío estándar.
Limitación
No considera relaciones entre variables y puede marcar muchos valores válidos cuando la distribución es naturalmente asimétrica o de colas pesadas.
IQR = Q3 − Q1    |    LI = Q1 − 1,5·IQR    |    LS = Q3 + 1,5·IQR
Idea para recordar: La regla IQR es un criterio de detección, no una orden automática de eliminación.
Marcá la pregunta cuando puedas explicarla sin mirar.
Regla
Marca observaciones alejadas más de tres desvíos estándar de la media.
Problema
La media y el desvío estándar son sensibles a los mismos extremos que intentamos detectar.
Asimetría
En distribuciones log-normales, exponenciales o con colas pesadas, una gran cantidad de observaciones válidas puede caer más allá de un umbral gaussiano.
Uso razonable
Funciona mejor como referencia cuando la variable es aproximadamente normal, estable y sin mezclas evidentes.
z = (x − μ) / σ    →    alerta si |z| > 3
Idea para recordar: Un z-score grande significa distancia respecto de media y escala; no prueba que el dato sea erróneo.
Marcá la pregunta cuando puedas explicarla sin mirar.
Definición
MAD = mediana(|xᵢ − mediana(x)|).
Ventaja
La mediana y el MAD tienen alta resistencia a observaciones extremas; un pequeño número de valores gigantes no los desplaza tanto como a la media y al desvío.
Z modificado
Puede construirse un score robusto dividiendo la desviación respecto de la mediana por una escala basada en MAD.
Uso
Es útil en distribuciones con contaminación moderada cuando se necesita un criterio univariado robusto.
MAD = mediana(|xᵢ − x̃|)    |    escala robusta ≈ 1,4826·MAD
Idea para recordar: Robustez significa que la estimación no cambia drásticamente por unos pocos casos extremos.
Marcá la pregunta cuando puedas explicarla sin mirar.
Media
Utiliza la magnitud de todas las observaciones; un valor enorme participa directamente en la suma.
Mediana
Depende fundamentalmente del orden de los datos y del centro posicional.
Consecuencia
La separación entre media y mediana puede ser una señal de asimetría o de observaciones influyentes.
Uso práctico
Compararlas antes y después de un tratamiento permite medir cuánto depende el resumen estadístico de los extremos.
Idea para recordar: Una medida robusta sacrifica cierta eficiencia bajo condiciones ideales a cambio de estabilidad ante contaminación.
Marcá la pregunta cuando puedas explicarla sin mirar.
Eliminar
Quita filas. Solo es defendible cuando existe evidencia suficiente de error, irrelevancia o una definición explícita del universo analizado.
Winsorizar
Limita valores a determinados percentiles o umbrales. Conserva filas, pero modifica magnitudes y puede ocultar eventos reales.
Transformar
Log, Box-Cox u otras transformaciones pueden reducir asimetría sin etiquetar necesariamente observaciones como erróneas.
Segmentar
Si los extremos pertenecen a una población distinta, puede ser mejor modelar ese segmento por separado.
Idea para recordar: Tratar un outlier cambia los datos; por eso el tratamiento debe justificarse y quedar registrado.
Marcá la pregunta cuando puedas explicarla sin mirar.
Residuo
Diferencia entre el valor observado y el predicho por el modelo.
Leverage
Mide qué tan excepcional es una observación en el espacio de predictores X.
Influencia
Resume cuánto cambiaría el ajuste si la observación se retirara o modificara.
Idea
Un punto con gran residuo pero poco leverage puede afectar menos la pendiente que un punto de alto leverage situado en una región extrema de X.
Idea para recordar: Extremo, alta palanca e influyente son conceptos relacionados, pero no equivalentes.
Marcá la pregunta cuando puedas explicarla sin mirar.
Concepto
Cook combina el tamaño del residuo con el leverage para cuantificar cuánto puede cambiar el modelo por una observación.
Lectura
Valores grandes merecen inspección. La regla 4/n se usa como referencia exploratoria, no como ley universal.
Diagnóstico
Conviene observar cómo cambian coeficientes, predicciones, R², RMSE y conclusiones de negocio con y sin el caso.
Precaución
Una distancia de Cook alta no demuestra error; demuestra dependencia del ajuste respecto de esa observación.
Idea para recordar: La influencia es una propiedad del punto en relación con un modelo específico.
Marcá la pregunta cuando puedas explicarla sin mirar.
Escenario A
Se conserva el conjunto completo.
Escenario B
Se aplica un tratamiento explícito y reproducible a los casos extremos.
Comparación
Se evalúan parámetros, errores, rankings, decisiones y segmentos bajo ambos escenarios.
Interpretación
Si la conclusión cambia sustancialmente, el análisis depende de supuestos de tratamiento y esa dependencia debe reportarse.
Idea para recordar: Una conclusión robusta sobrevive a tratamientos razonables alternativos.
Marcá la pregunta cuando puedas explicarla sin mirar.
MSE
Eleva al cuadrado los errores; duplicar un residuo cuadruplica su contribución.
Consecuencia
Unos pocos errores enormes pueden dominar el objetivo de optimización.
Alternativas
MAE, Huber loss, regresión cuantílica y estimadores robustos reducen la influencia relativa de errores extremos.
Decisión
No siempre hay que eliminar el dato: a veces corresponde cambiar la función de pérdida o el modelo.
MSE = (1/n) Σ(yᵢ − ŷᵢ)²    |    MAE = (1/n) Σ|yᵢ − ŷᵢ|
Idea para recordar: La robustez también puede diseñarse dentro del algoritmo.
Marcá la pregunta cuando puedas explicarla sin mirar.
Objetivo
Estimar una relación central reduciendo la influencia de observaciones extremas.
Ejemplos
HuberRegressor, RANSAC y Theil-Sen implementan ideas distintas de robustez.
Ventaja
Permiten conservar información y comparar un ajuste sensible con otro resistente.
Limitación
La robustez no elimina la necesidad de investigar la causa de los extremos ni garantiza que el modelo sea adecuado para subpoblaciones distintas.
Idea para recordar: Cambiar de estimador puede ser más informativo que borrar observaciones.
Marcá la pregunta cuando puedas explicarla sin mirar.
Outlier detection
El conjunto utilizado para ajustar el algoritmo puede estar contaminado con anomalías.
Novelty detection
El modelo aprende a partir de un conjunto de referencia mayormente normal y luego evalúa observaciones nuevas.
Implicancia
La interpretación de métodos como LOF cambia según se quiera puntuar el conjunto de entrenamiento o nuevos casos.
Producción
Novelty detection se parece más al escenario de scoring online: aprender una frontera de normalidad y detectar desviaciones futuras.
Idea para recordar: Definir el escenario de uso evita aplicar correctamente un algoritmo al problema equivocado.
Marcá la pregunta cuando puedas explicarla sin mirar.
Idea
Construye particiones aleatorias del espacio usando variables y puntos de corte.
Principio
Los puntos aislados suelen quedar solos con menos particiones que los puntos ubicados en regiones densas.
Score
La profundidad media de aislamiento se transforma en un anomaly score.
Fortaleza
Escala bien en datos tabulares y no requiere asumir una distribución gaussiana.
Idea para recordar: Isolation Forest define rareza como facilidad de aislamiento.
Marcá la pregunta cuando puedas explicarla sin mirar.
Concepto
Contamination suele intervenir en la conversión de scores continuos a etiquetas normales/anómalas.
Riesgo
Si se fija 5%, el sistema puede verse empujado a producir aproximadamente ese nivel de alertas aun cuando la tasa real cambie.
Práctica
Es preferible separar el score del threshold y calibrar la política usando validación, capacidad operativa o costos.
Interpretación
Contamination no es una verdad descubierta por el algoritmo; es un supuesto o un parámetro de decisión.
Idea para recordar: Score y decisión son dos capas distintas.
Marcá la pregunta cuando puedas explicarla sin mirar.
Idea
LOF estima una densidad local basada en vecinos cercanos y compara la densidad de cada observación con la de su entorno.
Interpretación
Un LOF alto indica que el punto vive en una zona mucho menos densa que sus vecinos.
Parámetro
n_neighbors determina la escala espacial del concepto de localidad.
Fortaleza
Puede detectar anomalías locales que no son extremas respecto del conjunto global.
Idea para recordar: LOF responde «¿este punto es raro respecto de quienes lo rodean?».
Marcá la pregunta cuando puedas explicarla sin mirar.
Idea
Aprende una función que encierra la mayor parte de los datos de referencia y asigna el exterior a una región anómala.
Kernel
Con RBF puede representar fronteras no lineales.
Parámetros
nu controla aproximadamente la tolerancia a casos fuera de la frontera y gamma regula el alcance del kernel.
Precaución
Es sensible al escalado y puede ser costoso en grandes volúmenes.
Idea para recordar: One-Class SVM define normalidad por pertenencia a una región aprendida.
Marcá la pregunta cuando puedas explicarla sin mirar.
Supuesto
Los datos normales se aproximan razonablemente a una distribución unimodal elíptica.
Método
Estima centro y covarianza robustos y usa una distancia tipo Mahalanobis.
Ventaja
Es interpretable cuando la geometría normal es aproximadamente gaussiana.
Falla típica
Clusters separados, formas curvas, colas pesadas o fronteras no elípticas pueden producir muchos falsos positivos.
Idea para recordar: Un modelo puede estar bien calculado y, sin embargo, ser geométricamente inadecuado.
Marcá la pregunta cuando puedas explicarla sin mirar.
Idea
DBSCAN forma clusters donde existen suficientes puntos dentro de una vecindad.
Ruido
Los casos que no pertenecen a ninguna región densa reciben la etiqueta −1.
Parámetros
eps define el radio de vecindad y min_samples la cantidad mínima de evidencia para formar una región densa.
Limitación
DBSCAN no es un detector de novelty detection natural y puede ser muy sensible al escalado y a densidades heterogéneas.
Idea para recordar: Ruido de clustering y anomalía operacional pueden coincidir, pero no son sinónimos.
Marcá la pregunta cuando puedas explicarla sin mirar.
Aprendizaje
Se aprende una representación comprimida de los patrones normales.
Reconstrucción
Cada observación se proyecta y se reconstruye a partir de esa estructura.
Score
El error entre x y x̂ funciona como score de anomalía.
Intuición
Una observación que no sigue la estructura aprendida resulta difícil de reconstruir y obtiene un error mayor.
errorᵢ = ||xᵢ − x̂ᵢ||²
Idea para recordar: La anomalía se interpreta como incapacidad del modelo para explicar el patrón observado.
Marcá la pregunta cuando puedas explicarla sin mirar.
Ejemplo
Si solo 1% de los casos es anómalo, predecir siempre «normal» produce 99% de accuracy.
Problema
La métrica ignora que el sistema no detectó ninguna anomalía.
Alternativas
Precision, recall, F1, curva Precision-Recall, Average Precision y métricas de costo.
Contexto
La elección depende de qué error sea más grave: investigar falsas alarmas o dejar pasar anomalías reales.
Idea para recordar: Una métrica debe reflejar el objetivo de decisión, no solo la proporción total de aciertos.
Marcá la pregunta cuando puedas explicarla sin mirar.
Precision
De todas las alertas emitidas, qué proporción correspondía realmente a anomalías.
Recall
De todas las anomalías reales, qué proporción fue detectada.
Trade-off
Bajar el threshold suele aumentar recall y reducir precision; subirlo suele hacer lo contrario.
Negocio
Fraude, salud, mantenimiento y ciberseguridad pueden asignar costos muy distintos a FP y FN.
Precision = TP/(TP+FP)    |    Recall = TP/(TP+FN)
Idea para recordar: No existe un threshold óptimo sin una definición de costo o prioridad.
Marcá la pregunta cuando puedas explicarla sin mirar.
Problema
En fuerte desbalance, una curva ROC puede verse optimista aunque haya muchas falsas alarmas en términos absolutos.
AP
Average Precision resume el desempeño sobre la curva Precision-Recall.
Lectura
Un score alto significa que el ranking coloca anomalías reales temprano sin degradar demasiado la precision.
Uso
Es apropiado para comparar detectores antes de elegir un threshold operativo.
Idea para recordar: Primero puede evaluarse la calidad del ranking; después se elige la política de decisión.
Marcá la pregunta cuando puedas explicarla sin mirar.
Train/Referencia
Se usa para aprender la normalidad o ajustar el detector.
Validación
Se usa para elegir threshold, contamination efectiva o criterios de costo.
Test
Se reserva para estimar el desempeño final bajo una política ya elegida.
Leakage
Elegir el threshold mirando las etiquetas del test produce una evaluación optimista.
Idea para recordar: El threshold también es un hiperparámetro de decisión y debe validarse.
Marcá la pregunta cuando puedas explicarla sin mirar.
FP
Puede implicar tiempo de analista, bloqueo innecesario, inspección o pérdida de experiencia de usuario.
FN
Puede significar fraude no detectado, falla mecánica, incumplimiento o pérdida financiera.
Costo
Para cada threshold se calcula el costo esperado y se selecciona una política compatible con restricciones operativas.
Capacidad
A veces el threshold también debe respetar cuántas alertas puede revisar el equipo por día.
Costo = FP·C_FP + FN·C_FN
Idea para recordar: El mejor F1 no siempre minimiza el costo.
Marcá la pregunta cuando puedas explicarla sin mirar.
Escalado
Ajustar StandardScaler o RobustScaler con todo el dataset filtra información del test.
PCA
Aprender componentes con datos futuros hace que la estructura latente incorpore información que no debería conocer.
Threshold
Calibrar percentiles usando el test también contamina la evaluación.
Temporalidad
En series de tiempo, mezclar ventanas futuras con el entrenamiento invalida el escenario operativo.
Idea para recordar: Todo objeto que aprende parámetros debe respetar la frontera entre entrenamiento y evaluación.
Marcá la pregunta cuando puedas explicarla sin mirar.
1 · Validar
Revisar semántica, unidades, duplicados, proceso de captura y reglas de negocio.
2 · Caracterizar
Distinguir rareza global/local/contextual, univariada/multivariada y posible cambio de régimen.
3 · Puntuar
Usar métodos coherentes con la geometría: IQR/MAD, Mahalanobis, Isolation Forest, LOF, One-Class SVM, reconstrucción u otros.
4 · Calibrar
Elegir threshold con validación, costos, capacidad y objetivos.
5 · Comparar
Realizar análisis de sensibilidad y comparar modelos/tratamientos.
6 · Monitorear
Seguir tasa de alertas, drift, estabilidad del score y resultados reales.
Idea para recordar: El objetivo no es producir una lista de puntos rojos; es construir una decisión reproducible y auditable.
Marcá la pregunta cuando puedas explicarla sin mirar.