from IPython.display import display, HTML html_content = r""" Glosario del Paradigma EDA
Paradigma EDA

Glosario interactivo completo de Análisis Exploratorio de Datos

Este glosario reúne los conceptos centrales del paradigma EDA con un enfoque didáctico y aplicado. Cada término está desarrollado para servir como material de estudio, consulta y apoyo de clase: definición, propósito analítico, señales que busca el analista y ejemplo de uso.

Exploración Visualización Calidad de datos Distribuciones Relaciones Preparación para modelado
0 / 0 abiertos 0%

Cómo leer este glosario

La lógica del EDA parte de una idea simple: antes de modelar, primero hay que comprender los datos. Por eso los términos aquí no están pensados como un listado aislado, sino como una red conceptual: tipo de variable, distribución, outliers, missing values, relación entre variables, transformación, sesgo, leakage, visualización y calidad del dato.

Ningún término coincide con la búsqueda.
A
Definición
Es la parte del EDA en la que se explora cómo se vinculan dos variables. Puede tratarse de dos variables numéricas, una numérica y una categórica, o dos categóricas.
Propósito
Pasar de la descripción aislada de cada variable a la comprensión de sus relaciones. Permite ver si cambian juntas, si una segmenta a la otra o si parecen independientes.
Qué busca
Tendencias, asociaciones lineales o no lineales, diferencias entre grupos, patrones de dispersión, concentración y posibles relaciones espurias.
Gráficos típicos
Scatter plot, boxplot agrupado, violin plot, barras agrupadas, tabla de contingencia, mosaic plot.
Ejemplo: analizar la relación entre total_bill y tip en el dataset tips, o comparar la distribución de una variable numérica según categorías.
Definición
Es la etapa del EDA en la que se analiza el comportamiento conjunto de múltiples variables, no solo de a pares.
Propósito
Detectar estructuras más complejas: redundancia, alta correlación, clusters, combinaciones lineales, relaciones latentes o efectos que no aparecen en el análisis bivariado.
Herramientas
Pair plots, matrices de correlación, PCA exploratorio, heatmaps, proyecciones bidimensionales, análisis por subgrupos.
Señales útiles
Variables que casi duplican información, estructuras de bloque, relaciones dominadas por pocos factores y posibles problemas de multicolinealidad.
Ejemplo: revisar todas las variables numéricas de un dataset para detectar cuáles se mueven juntas antes de entrenar un modelo.
Definición
Consiste en examinar una sola variable a la vez, sin considerar todavía su relación con otras.
Propósito
Construir una primera lectura del dato: forma de la distribución, rango, valores frecuentes, asimetría, dispersión, faltantes y posibles outliers.
Herramientas
Histogramas, boxplots, curvas de densidad, tablas de frecuencia, gráficos de barras, percentiles y medidas descriptivas.
Importancia
Es el primer filtro de calidad y comprensión. Un análisis univariado sólido evita interpretar mal relaciones posteriores.
Ejemplo: estudiar la distribución de la edad de clientes antes de cruzarla con ingresos o comportamiento de compra.
Definición
Una distribución es asimétrica cuando no presenta equilibrio alrededor de su centro. Puede tener cola más larga hacia la derecha o hacia la izquierda.
Propósito analítico
Detectar si una variable se aleja de una forma aproximadamente simétrica y si conviene usar transformaciones, medidas robustas o escalas logarítmicas.
Señales
Media y mediana alejadas, histogramas sesgados, boxplots con bigotes muy distintos, acumulación de valores en un extremo.
Implicancia
Afecta interpretación, modelado y elección de estadísticas descriptivas. En presencia de fuerte asimetría, la mediana suele ser más representativa que la media.
Ejemplo: ingresos, montos de compra y tiempos de espera suelen presentar asimetría positiva.
B
Definición
Describe si las clases de una variable categórica aparecen con proporciones relativamente similares o si una domina ampliamente a las demás.
Propósito
Evaluar si el dataset puede inducir sesgos en el modelado y si ciertas métricas serán engañosas.
Qué revisar
Frecuencias absolutas, porcentajes, presencia de clases raras, categorías casi vacías y estabilidad por segmento temporal o geográfico.
Visualizaciones
Gráfico de barras, proporciones, tablas de frecuencia, barras apiladas por subgrupo.
Ejemplo: en fraude, churn o morosidad suele haber fuerte desbalance, y el EDA debe dejarlo explícito antes del entrenamiento.
Definición
Es un gráfico donde cada barra representa una categoría y su altura indica conteo o proporción.
Uso en EDA
Permite ver la moda, el desbalance entre categorías, la rareza de ciertos grupos y la composición general de una variable cualitativa.
Diferencia clave
No debe confundirse con el histograma. En barras las categorías son separadas; en histogramas los intervalos son contiguos porque representan continuidad numérica.
Buenas prácticas
Ordenar categorías cuando tiene sentido, rotular porcentajes si son pocos grupos y evitar exceso de etiquetas si la cardinalidad es alta.
Ejemplo: distribución de clientes por canal, región, método de pago o categoría de producto.
Definición
Gráfico que resume una variable cuantitativa mediante Q1, mediana, Q3, rango intercuartílico y puntos extremos.
Propósito
Condensar mucha información en poco espacio y facilitar comparaciones entre grupos.
Qué muestra
Posición central, amplitud del 50% central de los datos, asimetría aproximada y observaciones alejadas.
Cuándo conviene
Cuando se quiere comparar una variable numérica entre varias categorías o revisar rápidamente si hay valores atípicos.
Ejemplo: boxplots de salario por área, gasto por segmento o edad por tipo de cliente.
C
Definición
Es el número de valores únicos de una variable. En categóricas puede ser baja, media o muy alta.
Por qué importa
Condiciona visualización, codificación y modelado. Variables con cardinalidad muy alta pueden producir sparsity o sobreajuste si se codifican sin criterio.
Qué revisar
Cantidad de niveles, frecuencia de categorías raras, presencia de errores de escritura y consistencia semántica.
Señal típica
Una variable como ciudad, SKU o usuario puede tener cientos o miles de valores únicos, y no siempre es conveniente usarla tal cual.
Ejemplo: una columna “provincia” tiene cardinalidad baja; una columna “email” suele ser prácticamente identificadora.
Definición
Es el conjunto de criterios que permiten determinar si los datos son confiables para analizar y modelar.
Dimensiones
Completitud, consistencia interna, unicidad, exactitud aparente, coherencia temporal, plausibilidad y formato.
Qué busca el EDA
Missing values, duplicados, categorías mal escritas, fechas imposibles, magnitudes absurdas, registros contradictorios y outliers potencialmente erróneos.
Razón pedagógica
El EDA no solo describe variables: también detecta problemas que, si se ignoran, contaminan todo el pipeline analítico.
Ejemplo: edades negativas, ventas con fecha futura o un mismo cliente repetido múltiples veces sin justificación.
Definición
Resume la fuerza y dirección de una asociación, usualmente lineal, entre dos variables numéricas.
Propósito en EDA
Detectar variables que se mueven juntas, redundancia informativa y posibles señales para el modelado o la reducción de dimensión.
Precaución
Correlación no implica causalidad. Además, una correlación baja no descarta una relación no lineal, y una correlación alta puede estar dominada por outliers o por subgrupos.
Visualización complementaria
Siempre conviene acompañarla con scatter plots, pair plots o segmentaciones por grupo.
Ejemplo: ingreso y gasto mensual pueden correlacionar positivamente, pero la relación puede variar si se segmenta por edad o región.
Definición
Se produce cuando dos variables parecen relacionadas, pero la asociación surge por azar, por una tercera variable o por una tendencia compartida que no expresa vínculo real.
Importancia
Es uno de los riesgos clásicos del EDA: ver patrones donde no hay relación sustantiva o interpretar como causal algo meramente coincidente.
Cómo detectarla
Segmentando, incorporando contexto, revisando temporalidad, controlando variables de confusión y verificando estabilidad en distintos subconjuntos.
Lección
EDA descubre patrones, pero no debe convertir toda asociación en explicación causal.
Ejemplo: dos series que crecen juntas con el tiempo pueden parecer correlacionadas solo porque ambas siguen una tendencia ascendente.
Definición
Describe, de manera resumida, si una distribución presenta colas relativamente pesadas o livianas y cómo se concentra la masa de datos alrededor del centro.
Uso práctico
En EDA suele ser secundaria respecto de histogramas y boxplots, pero puede ayudar a detectar presencia de colas pesadas o valores extremos frecuentes.
Cuidado
No conviene interpretarla aislada. Es más útil como complemento de la visualización que como diagnóstico autónomo.
Lectura prudente
Una curtosis alta sugiere distribución con mayor peso en colas o eventos extremos relativamente frecuentes.
Ejemplo: retornos financieros o tiempos de falla pueden exhibir curtosis elevada por presencia de observaciones extremas.
D
Definición
Son celdas sin valor, vacías o codificadas como nulas. En EDA no se consideran un detalle técnico menor, sino una fuente potencial de sesgo.
Qué importa revisar
Cantidad de faltantes, patrón de aparición, concentración por variable, fila, segmento, fecha o grupo de interés.
Pregunta central
No solo cuánto falta, sino cómo falta. Si la ausencia no es aleatoria, puede distorsionar inferencias y modelos.
Tratamientos
Eliminar, imputar, crear indicador de ausencia o rediseñar el análisis, según contexto y objetivo.
Ejemplo: si faltan ingresos principalmente en clientes de cierto segmento, la ausencia ya contiene información y no debería ignorarse sin más.
Definición
Es una estimación continua de la distribución de una variable, construida a partir de funciones kernel y un parámetro de suavizado.
Ventaja
Muestra la forma global de la distribución de manera más suave que un histograma y facilita comparar varias curvas en el mismo eje.
Precaución
Su apariencia depende del ancho de banda. Demasiado suavizado oculta estructura; muy poco suavizado exagera irregularidades.
Cuándo conviene
Especialmente en variables continuas o cuando interesa comparar distribuciones entre grupos.
Ejemplo: comparar la densidad de una variable entre hombres y mujeres, o entre clientes activos e inactivos.
Definición
Describe cómo se ubican y concentran las observaciones: dónde se agrupan, qué tan dispersas están, si son simétricas, si tienen colas largas o varios picos.
Por qué importa
Entender la distribución es una de las metas principales del EDA, porque condiciona las decisiones sobre estadística descriptiva, transformaciones y modelado.
Elementos
Centro, dispersión, forma, simetría, multimodalidad, extremos y densidad relativa en distintos rangos.
Herramientas
Histograma, KDE, boxplot, percentiles, tablas de frecuencia y resúmenes numéricos.
Ejemplo: una variable puede tener la misma media que otra y, sin embargo, una distribución totalmente distinta.
Definición
Son observaciones repetidas exactamente o con pequeñas variaciones que representan la misma entidad o evento.
Riesgo
Pueden sobreestimar conteos, modificar proporciones, alterar medias y sesgar relaciones entre variables.
Qué revisar
Duplicados exactos, duplicados por clave, repetición temporal legítima versus repetición errónea y consistencia entre columnas identificadoras.
Decisión
No todo duplicado debe eliminarse: primero hay que entender si representa un error, una actualización o una transacción repetida legítima.
Ejemplo: un cliente repetido por error en la tabla maestra no es lo mismo que varias compras reales del mismo cliente.
E
Definición
Es la fase inicial del trabajo con datos en la que se describen variables, se visualizan distribuciones, se detectan problemas de calidad y se formulan hipótesis preliminares.
Idea rectora
Antes de modelar, primero hay que mirar, resumir, graficar y cuestionar los datos. El EDA reduce el riesgo de aplicar técnicas a ciegas.
Objetivos
Comprender estructura, identificar outliers, revisar missing values, estudiar relaciones, detectar sesgos, anticipar transformaciones y elegir mejor las técnicas posteriores.
Naturaleza
Es descriptivo, diagnóstico y orientador. No reemplaza la inferencia ni el modelado, pero los prepara.
Ejemplo: revisar un dataset nuevo con resúmenes, gráficos, filtros y segmentaciones antes de construir un modelo predictivo.
Definición
Consiste en modificar la escala numérica de una variable sin cambiar su información sustantiva principal.
Propósito
Evitar que variables con gran magnitud dominen a otras y mejorar el comportamiento de métodos sensibles a distancia o magnitud.
Conexión con EDA
El EDA ayuda a decidir si el escalado es necesario al detectar escalas muy diferentes, asimetrías severas o amplitudes extremas.
Ejemplos
Standardization, min-max scaling, transformaciones robustas basadas en mediana e IQR.
Ejemplo: combinar edad en años con ingresos anuales sin escalado puede ser problemático en métodos como kNN o k-means.
Definición
Incluye medidas como media, mediana, desvío estándar, mínimo, máximo, percentiles y rango intercuartílico.
Rol en EDA
Brinda una primera lectura numérica de la variable y sirve de complemento a la inspección visual.
Limitación
No alcanza por sí sola. Dos distribuciones distintas pueden compartir estadísticas descriptivas similares.
Uso correcto
Debe leerse junto con gráficos y contexto del negocio o fenómeno analizado.
Ejemplo: media y mediana cercanas sugieren menor asimetría que cuando están muy separadas.
F
Definición
Consiste en crear nuevas representaciones de los datos: ratios, agregados, indicadores binarios, variables temporales, interacciones o transformaciones.
Relación con EDA
El EDA sugiere oportunidades de feature engineering al revelar asimetrías, relaciones no lineales, segmentaciones o variables poco informativas en su forma original.
Cuidado
Debe evitarse introducir leakage o variables artificiales sin sentido sustantivo.
Pregunta útil
¿La variable original ya expresa bien el fenómeno o conviene derivar otra que lo represente mejor?
Ejemplo: transformar fecha en día de semana, mes o antigüedad; calcular gasto por cliente o tasa de conversión.
Definición
Puede expresarse como conteo absoluto o como proporción relativa respecto del total.
Uso en EDA
Es la base para entender cómo se distribuyen categorías, detectar modas, rarezas y desbalances.
Visualización
Tablas de frecuencia, gráficos de barras y barras apiladas cuando se comparan grupos.
Importancia
Una categoría muy infrecuente puede ser ruido, error, nicho importante o señal de segmentación relevante.
Ejemplo: frecuencia de métodos de pago, provincias, diagnóstico clínico o clases de churn.
H
Definición
Representa magnitudes mediante color. En EDA suele usarse para matrices de correlación, tablas pivote o patrones de missing values.
Propósito
Hacer visible de un vistazo dónde hay bloques, asociaciones fuertes, estructuras repetidas o vacíos sistemáticos.
Cuidado
Debe acompañarse de escala clara, orden adecuado y, si es posible, clustering o reorganización lógica de filas y columnas.
Ventaja
Sintetiza matrices grandes mejor que una tabla numérica densa.
Ejemplo: heatmap de correlaciones entre variables numéricas o mapa de faltantes por columna y registro.
Definición
Agrupa observaciones en intervalos o bins y muestra cuántas caen en cada uno.
Qué aporta
Permite detectar sesgo, multimodalidad, acumulaciones, colas largas, vacíos y rango efectivo de la variable.
Limitación
La forma observada depende del número y ancho de bins. Por eso conviene probar más de una configuración.
Lectura correcta
Sirve para describir forma, no solo para “contar barras”.
Ejemplo: histograma de ingresos, edades, montos de compra, tiempo de sesión o puntajes.
I
Definición
Mide la amplitud del 50% central de los datos y es menos sensible a valores extremos que el rango total.
Uso en EDA
Sirve para describir dispersión robusta y para reglas simples de detección de outliers, como la regla de 1.5 × IQR.
Ventaja
Permite resumir variabilidad sin quedar dominado por unos pocos extremos.
Dónde aparece
Boxplots, resúmenes descriptivos robustos y análisis de dispersión en distribuciones asimétricas.
Ejemplo: si Q1 = 10 y Q3 = 18, el IQR es 8, que resume la amplitud del corazón de la distribución.
Definición
Consiste en completar celdas faltantes usando un criterio explícito: media, mediana, moda, valor constante, interpolación o modelos específicos.
Relación con EDA
El EDA ayuda a decidir si imputar, cómo hacerlo y qué riesgos implica según el patrón de ausencia.
Peligro
Una imputación mal elegida puede aplanar la variabilidad, introducir sesgo o ocultar un patrón informativo de ausencia.
Criterio
La imputación debe depender del contexto, la variable y el objetivo, no de una receta automática.
Ejemplo: imputar con mediana puede ser razonable en variables con outliers; imputar con media puede ser problemático si hay asimetría fuerte.
L
Definición
Ocurre cuando una variable o transformación incorpora información que no estaría disponible en el momento real de predicción.
Lugar del EDA
El EDA puede detectar variables sospechosamente “demasiado buenas”, relaciones imposibles temporalmente o columnas derivadas del target.
Consecuencia
Produce modelos artificialmente exitosos durante entrenamiento y evaluación, pero inservibles en producción.
Regla
Siempre preguntarse si la variable estaría disponible en el instante en que se necesita predecir.
Ejemplo: usar fecha de cancelación para predecir churn antes de que ocurra la cancelación es leakage.
M
Definición
Se obtiene sumando los valores y dividiendo por la cantidad de observaciones. Resume el centro de gravedad numérico de la distribución.
Fortaleza
Es una medida muy conocida, interpretable y útil cuando la distribución no está dominada por outliers extremos.
Limitación
Es sensible a valores atípicos y a distribuciones muy sesgadas.
Relación útil
Comparar media con mediana ayuda a detectar asimetría.
Ejemplo: si unos pocos clientes gastan muchísimo, la media de gasto puede quedar muy por encima del valor “típico”.
Definición
Es el percentil 50. En variables con asimetría o outliers, suele representar mejor el centro típico que la media.
Ventaja
Es robusta frente a extremos y permite una lectura más estable del centro en distribuciones sesgadas.
Uso en EDA
Sirve junto con media, boxplots y percentiles para interpretar forma y sesgo de la distribución.
Señal útil
Si media y mediana difieren mucho, suele haber asimetría o valores extremos influyentes.
Ejemplo: en ingresos, la mediana suele describir mejor el valor típico que la media.
Definición
No solo importa la cantidad de missing values, sino si aparecen al azar o concentrados en ciertas columnas, filas, grupos o momentos.
Por qué importa
Un patrón sistemático puede indicar sesgo de medición, limitación operativa, diseño de captura o incluso información latente relevante.
Herramientas
Mapas de faltantes, proporciones por grupo, tablas cruzadas y análisis temporal de ausencia.
Decisión analítica
El tratamiento correcto depende tanto del porcentaje faltante como del patrón observado.
Ejemplo: si faltan ingresos sobre todo en clientes premium, la ausencia no es aleatoria y merece interpretación sustantiva.
Definición
Es la categoría o valor con mayor frecuencia observada. En variables categóricas suele ser especialmente relevante.
Uso
Permite identificar el valor predominante y ayuda a resumir variables cualitativas o discretas.
Matiz
Una distribución puede ser unimodal, bimodal o multimodal. La existencia de varias modas puede señalar subpoblaciones distintas.
Herramienta
Tablas de frecuencia, barras e histogramas son la forma más directa de detectarla.
Ejemplo: el método de pago más usado, la categoría más vendida o la edad más frecuente en una muestra discreta.
Definición
Aparece cuando varias variables contienen información muy parecida o combinaciones casi lineales entre sí.
Por qué importa
Puede volver inestables ciertos modelos, dificultar la interpretación de coeficientes y aumentar sensibilidad al ruido.
Detección en EDA
Matrices de correlación, pair plots, redundancia conceptual y revisión de variables derivadas o duplicadas.
No siempre es “mala”
A veces no afecta predicción, pero sí interpretación. La decisión depende del objetivo.
Ejemplo: superficie en metros y superficie en pies cuadrados transportan prácticamente la misma información.
O
Definición
Es una observación que aparece muy separada del resto según magnitud, posición o comportamiento relativo.
Error común
No todo outlier es un error. Puede ser un dato mal cargado, pero también un caso raro real y analíticamente importante.
Cómo se revisa
Boxplots, percentiles extremos, reglas con IQR, scatter plots y validación contra contexto de negocio o dominio.
Pregunta correcta
No “¿lo elimino?”, sino “¿qué representa y cómo afecta el análisis?”.
Ejemplo: una compra 100 veces mayor que la media puede ser fraude, error o cliente corporativo extraordinario.
P
Definición
Es una cuadrícula en la que la diagonal suele mostrar distribuciones univariadas y el resto scatter plots para cada par de variables.
Utilidad
Permite detectar rápidamente asociaciones, clusters, patrones lineales o no lineales y redundancias entre múltiples variables.
Limitación
Pierde eficacia cuando el número de variables es muy grande. En esos casos conviene seleccionar subconjuntos relevantes.
Valor didáctico
Es una síntesis muy poderosa del paso entre análisis univariado, bivariado y multivariado.
Ejemplo: revisar 4 o 5 variables numéricas clave al inicio de un proyecto para detectar relaciones antes del modelado.
Definición
El percentil p indica el valor por debajo del cual cae aproximadamente el p% de las observaciones.
Uso en EDA
Ayudan a describir posición, colas, amplitud y extremos relativos. Son clave para boxplots e interpretación robusta.
Ejemplos importantes
P25, P50 (mediana), P75, P90, P95 o P99, según el tipo de análisis y sensibilidad deseada.
Ventaja
Son menos sensibles a extremos que medidas basadas exclusivamente en media y desvío.
Ejemplo: usar P95 para definir un umbral alto sin depender de un valor máximo aislado.
Definición
El Análisis de Componentes Principales construye combinaciones lineales ortogonales de las variables originales para resumir la estructura del dataset.
Uso exploratorio
Sirve para visualizar datos de alta dimensión, detectar agrupamientos, redundancia y direcciones dominantes de variabilidad.
Qué no hace
No reemplaza la interpretación sustantiva ni garantiza que las nuevas componentes sean fáciles de explicar.
Conexión con EDA
Es un paso exploratorio avanzado, útil cuando las relaciones multivariadas son difíciles de ver en tablas o gráficos simples.
Ejemplo: proyectar decenas de variables numéricas a dos dimensiones para detectar clusters o redundancias.
Definición
Incluye limpieza, imputación, codificación, escalado, filtrado, agregación y construcción de variables derivadas.
Rol del EDA
El EDA no es idéntico al preprocesamiento, pero lo orienta. Primero diagnostica; luego sugiere qué transformaciones son razonables.
Error frecuente
Preprocesar automáticamente sin haber entendido antes la estructura del dato.
Principio
Toda transformación debería responder a una necesidad detectada, no a una rutina aplicada ciegamente.
Ejemplo: si el EDA muestra asimetría fuerte, quizá convenga una transformación logarítmica antes del modelado.
Q
Definición
Q1 es el percentil 25, Q2 la mediana y Q3 el percentil 75.
Uso en EDA
Permiten describir la estructura posicional de la distribución y son la base del IQR y del boxplot.
Ventaja
Son más robustos que el mínimo, máximo o la media frente a observaciones extremas.
Interpretación
Ayudan a entender dónde cae el 25%, 50% y 75% de la variable, y cómo se distribuye el grueso de los datos.
Ejemplo: si Q1 y Q3 están muy alejados, la dispersión central de la variable es amplia.
R
Definición
Resume la amplitud total del conjunto de datos: Rango = Máximo - Mínimo.
Ventaja
Es simple e intuitivo como referencia rápida del alcance observado de la variable.
Limitación
Es extremadamente sensible a outliers y no describe la estructura interna de la distribución.
Uso correcto
Conviene complementarlo con IQR, percentiles o desvío estándar.
Ejemplo: dos variables pueden tener el mismo rango, pero una estar muy concentrada y otra muy dispersa.
Definición
Marca como posibles outliers a los valores menores que Q1 - 1.5·IQR o mayores que Q3 + 1.5·IQR.
Ventaja
Es un criterio simple, robusto y fácil de aplicar en boxplots y resúmenes exploratorios.
Precaución
Es una regla heurística, no una verdad absoluta. Puede marcar observaciones reales valiosas o pasar por alto patrones multivariados raros.
Buena práctica
Usarla como disparador de inspección, no como criterio automático de eliminación.
Ejemplo: en ventas o ingresos, valores por encima del umbral pueden ser anómalos o simplemente clientes extraordinarios.
Definición
Se da cuando varias columnas expresan casi lo mismo, ya sea por unidades distintas, derivaciones triviales o alta correlación estructural.
Importancia
Puede complicar interpretación, aumentar complejidad innecesaria y en algunos modelos generar multicolinealidad.
Detección
Correlación alta, inspección semántica, análisis de fórmula, pair plots y revisión del origen de las variables.
Decisión
No siempre debe eliminarse: depende de si el objetivo es predicción, interpretación o documentación del sistema.
Ejemplo: tener “monto en dólares” y “monto en moneda local” calculados uno a partir del otro.
S
Definición
Cada observación se representa como un punto ubicado por sus coordenadas en dos ejes numéricos.
Qué permite ver
Tendencias, relaciones lineales o no lineales, heterocedasticidad, clusters y outliers bivariados.
Valor en EDA
Es el complemento natural de la correlación, porque revela estructura que un solo coeficiente puede ocultar.
Extensión
Puede enriquecerse con color, tamaño o facetas para incorporar una tercera o cuarta dimensión.
Ejemplo: relación entre gasto y antigüedad, edad e ingreso, o total de cuenta y propina.
Definición
Es una distorsión sistemática que hace que los datos observados no representen adecuadamente la realidad de interés.
Dónde aparece
Muestreo, medición, registros incompletos, faltantes no aleatorios, variables mal definidas o procesos históricos de selección.
Rol del EDA
No siempre puede “corregir” el sesgo, pero sí puede descubrir señales tempranas de que el dataset no es neutral ni representativo.
Preguntas clave
¿Quiénes están sobre-representados? ¿Quiénes faltan? ¿Qué proceso generó estos datos?
Ejemplo: entrenar con datos de clientes activos solamente y luego querer generalizar al total de la población.
Definición
Ocurre cuando el mecanismo de inclusión de casos favorece sistemáticamente ciertos perfiles y excluye otros.
Impacto
Las conclusiones del análisis pueden ser válidas solo para la muestra observada y no para la población a la que se quiere generalizar.
Detección
Comparar distribución de variables clave con referencias externas, revisar cobertura geográfica, temporal y operativa, e inspeccionar subgrupos ausentes.
Lección metodológica
No todo dataset grande es representativo. El volumen no reemplaza la calidad del proceso de selección.
Ejemplo: estudiar satisfacción solo con respuestas voluntarias suele sobre-representar perfiles muy satisfechos o muy insatisfechos.
T
Definición
Incluye operaciones como logaritmos, raíces, winsorización, recodificación, binning, estandarización o combinación con otras variables.
Cuándo surge
Cuando el EDA detecta asimetría fuerte, outliers, escalas incompatibles, no linealidad o una representación poco útil de la variable.
Criterio
Toda transformación debe estar justificada por un problema o una necesidad de interpretación, no aplicarse automáticamente.
Riesgo
Transformar sin criterio puede hacer perder interpretabilidad o introducir artificios innecesarios.
Ejemplo: aplicar log a ingresos o ventas cuando la distribución presenta cola muy larga.
Definición
Es un patrón global de aumento, disminución o cambio sistemático, especialmente visible en relaciones bivariadas o series temporales.
Importancia
Ayuda a distinguir estructura de ruido y orienta hipótesis sobre comportamiento del fenómeno.
Dónde verla
Scatter plots, líneas temporales, agregaciones por grupo, suavizados locales y gráficos por tramo.
Precaución
Una tendencia global puede ocultar patrones distintos por subgrupo o cambiar de sentido según el segmento analizado.
Ejemplo: mayor antigüedad puede asociarse con menor churn, pero solo en ciertos segmentos de clientes.
V
Definición
Es un atributo que puede tomar distintos valores entre observaciones: numéricos, categóricos, ordinales, binarios, temporales, etc.
Rol en EDA
Todo el análisis parte de reconocer qué tipo de variable se tiene delante y cómo debe describirse o visualizarse.
Clasificación útil
Cuantitativa o cualitativa, continua o discreta, nominal u ordinal, explicativa, objetivo, temporal, identificadora.
Pregunta inicial
¿Qué representa exactamente esta variable y qué tipo de valores puede tomar?
Ejemplo: edad, género, fecha de compra, provincia, saldo, número de hijos o nivel de satisfacción.
Definición
Es la salida o resultado de interés: churn, fraude, precio, diagnóstico, conversión, morosidad, etc.
Rol del EDA
Antes de modelar, conviene describir su distribución, balance de clases, variabilidad, presencia de valores extremos y coherencia temporal.
Importancia
Comprender bien el target evita elegir métricas inadecuadas o estrategias erróneas de entrenamiento.
Cuidado
Muchas fugas de información se detectan revisando qué variables parecen construidas a partir del target.
Ejemplo: si el target es churn, importa saber si está desbalanceado y si cambia de comportamiento según el período.
Definición
Cuantifica cuánto se dispersan los valores respecto de la media. Su raíz cuadrada es el desvío estándar.
Uso en EDA
Ayuda a evaluar heterogeneidad de una variable y a detectar si algunas columnas casi no varían o, por el contrario, fluctúan mucho.
Precaución
Compararla entre variables con escalas muy distintas puede ser engañoso sin estandarización o contexto.
Relación
Más que una medida “intuitiva” para comunicar, suele ser una base técnica para otras herramientas.
Ejemplo: una variable con varianza casi nula puede aportar muy poca señal para modelado.
Definición
Consiste en representar los datos de forma gráfica para facilitar la detección de estructura, relaciones, anomalías y variaciones relevantes.
Lugar central
En EDA, visualizar no es adornar. Es una forma de pensar y de descubrir cosas que una tabla numérica puede ocultar.
Principio
Cada gráfico debe responder una pregunta clara: distribución, comparación, asociación, composición, evolución, faltantes o incertidumbre.
Buena práctica
Elegir el gráfico en función de la variable y la pregunta, no por costumbre o estética.
Ejemplo: histogramas para forma, boxplots para dispersión robusta, scatter plots para relación y heatmaps para estructura global.
W
Definición
En lugar de eliminar outliers, se los reemplaza por valores límite como percentiles bajos y altos.
Cuándo aparece
Cuando el EDA muestra colas extremas que afectan fuertemente ciertos métodos, pero no se desea descartar observaciones completas.
Ventaja
Reduce sensibilidad a extremos sin perder tamaño muestral.
Cuidado
Debe usarse con criterio y documentarse, porque modifica la distribución original.
Ejemplo: reemplazar valores por encima del percentil 99 por el propio valor del P99.
""" display(HTML(html_content))