from IPython.display import display, HTML html_content = r""" Cuestionario - Paradigma EDA
Cuestionario académico

Cuestionario completo sobre Paradigma EDA

Este material está diseñado para estudiar, repasar y consolidar los conceptos centrales del Análisis Exploratorio de Datos. Cada pregunta está desarrollada con explicación conceptual, propósito analítico, errores frecuentes y aplicación práctica, de modo que el cuestionario funcione tanto como guía de estudio como material de cátedra.

EDA Distribuciones Outliers Missing Values Visualización Preprocesamiento
0 / 20 abiertas 0%

Propósito del cuestionario

El cuestionario sigue la lógica natural del EDA: primero comprender qué es y para qué sirve, después estudiar variables, distribuciones y visualizaciones, y finalmente revisar problemas de calidad del dato, sesgos, leakage y decisiones de preparación. La idea rectora es simple: antes de modelar, primero hay que entender los datos.

Respuesta
El EDA, o Análisis Exploratorio de Datos, es la fase inicial del trabajo con datos en la que el analista observa, resume, visualiza y cuestiona el dataset antes de aplicar modelos estadísticos o de machine learning. Su finalidad es comprender la estructura real de los datos, detectar patrones, identificar anomalías, revisar calidad y formular primeras hipótesis.
Por qué es fundamental
Porque evita trabajar a ciegas. Modelar sin haber explorado puede llevar a usar variables mal definidas, ignorar missing values, interpretar mal distribuciones o confiar en relaciones artificiales. El EDA permite detectar problemas y oportunidades antes de que esos problemas contaminen todo el pipeline.
Idea clave
El EDA no reemplaza al modelado ni a la inferencia, pero los prepara. Su valor está en convertir una tabla de datos en un objeto comprensible desde el punto de vista analítico.
Resumen: el EDA es diagnóstico, descriptivo y orientador. Es la etapa en la que el analista aprende a leer los datos antes de intentar explicarlos o predecirlos.
Análisis univariado
Estudia una sola variable por vez. Permite observar distribución, rango, tendencia central, dispersión, sesgo, outliers y frecuencia de categorías.
Análisis bivariado
Examina la relación entre dos variables. Puede revelar asociación, dependencia, contraste entre grupos, tendencia lineal o no lineal y posibles relaciones espurias.
Análisis multivariado
Analiza varias variables al mismo tiempo. Busca estructuras más complejas como redundancia, bloques de correlación, clustering, componentes latentes o interacciones entre múltiples dimensiones.
Lógica metodológica
La progresión suele ir de lo univariado a lo multivariado, porque primero conviene entender cada variable en sí misma y recién después interpretar relaciones más complejas.
Resumen: univariado describe una variable, bivariado estudia vínculos entre dos y multivariado examina la estructura global del conjunto.
Respuesta
Porque el tipo de variable condiciona la forma correcta de resumirla y visualizarla. No se analiza igual una variable cuantitativa continua, una discreta, una nominal o una ordinal.
Ejemplos
Una variable categórica se resume con frecuencias y gráficos de barras; una cuantitativa continua suele explorarse con histogramas, densidades, boxplots y percentiles. En variables ordinales también importa el orden de las categorías.
Riesgo de no hacerlo
Elegir gráficos o estadísticas inadecuadas puede producir interpretaciones erróneas. Por ejemplo, calcular una media sobre categorías codificadas numéricamente pero sin significado cuantitativo real.
Idea central: la clasificación correcta de variables es uno de los primeros pasos del EDA, porque organiza casi todas las decisiones posteriores.
Qué aporta
Resume cantidad de observaciones, media, desvío estándar, mínimo, percentiles, mediana, máximo y otras medidas de posición o dispersión. Permite obtener una primera visión cuantitativa del comportamiento de una variable.
Qué permite detectar
Diferencia entre media y mediana, amplitud del rango, dispersión central, escalas muy distintas entre variables y presencia posible de valores extremos.
Limitaciones
No muestra forma completa de la distribución. Dos variables muy distintas pueden compartir estadísticas descriptivas parecidas. Tampoco revela multimodalidad, vacíos o estructura fina.
Conclusión: la estadística descriptiva es necesaria, pero no suficiente. Debe leerse siempre junto con gráficos y contexto.
Media
Es el promedio aritmético. Resume el centro de gravedad numérico de la distribución, pero es sensible a outliers y asimetrías.
Mediana
Es el valor central de los datos ordenados. Divide a la muestra en dos mitades y es robusta frente a valores extremos.
Cuándo priorizar media
Cuando la distribución es razonablemente simétrica y no está dominada por observaciones extremas.
Cuándo priorizar mediana
Cuando hay asimetría fuerte, colas largas o outliers que desplazan artificialmente el promedio.
Señal útil: si media y mediana se separan mucho, suele haber asimetría o extremos influyentes.
Definición
Una distribución es asimétrica cuando no presenta equilibrio alrededor de su centro. Puede tener cola más larga hacia la derecha o hacia la izquierda.
Señales en EDA
Histogramas inclinados, boxplots con bigotes desbalanceados, media y mediana alejadas, concentración de observaciones en un extremo y pocos valores muy grandes o muy pequeños.
Implicancias
Afecta qué medida resume mejor el centro, puede justificar transformaciones, y obliga a interpretar con cuidado la dispersión y los outliers.
Ejemplos típicos
Ingresos, ventas, tiempos de espera, consumo energético y montos de transacción suelen tener asimetría positiva.
Idea clave: la forma de la distribución no es un detalle visual; condiciona las decisiones analíticas.
Histograma
Muestra frecuencias por intervalos y ayuda a ver forma, concentración, colas, sesgo y multimodalidad. Su apariencia depende del número y ancho de bins.
Curva de densidad
Ofrece una visión suave de la distribución. Es útil para comparar grupos y para percibir la forma sin depender tanto de intervalos discretos, aunque depende del suavizado elegido.
Boxplot
Resume mediana, cuartiles, IQR y posibles outliers. Es muy eficiente para comparar distribuciones entre grupos y detectar extremos.
Relación entre ellos
No compiten, se complementan. El histograma y la densidad muestran forma; el boxplot resume posición y dispersión robusta.
Definición
Un outlier es una observación muy alejada del patrón general de la variable o del conjunto de datos. Puede aparecer como extremo univariado o como punto raro en una relación bivariada.
Razón de prudencia
Porque un outlier puede ser error de carga, medición incorrecta o registro inconsistente, pero también puede representar un caso raro real, valioso e incluso central para el problema.
Qué hacer
Investigar su origen, revisar contexto, comparar con otras variables, validar con expertos del dominio y analizar impacto antes de eliminar o transformar.
Regla práctica
El outlier no se elimina por reflejo. Primero se interpreta, luego se decide.
Ejemplo: una compra extraordinariamente alta puede ser fraude, error o cliente premium. El gráfico solo marca la rareza; la interpretación requiere contexto.
Definición
Son celdas vacías, nulas o sin información observada en una variable.
Por qué no basta el porcentaje
Porque no solo importa cuánto falta, sino cómo falta. Un 5% de missing values puede ser irrelevante o gravísimo según su patrón de aparición.
Qué debe revisar el EDA
Concentración por variable, por grupo, por fila, por tiempo y por segmento. También si la ausencia parece aleatoria o sistemática.
Consecuencia
Los faltantes pueden introducir sesgo, afectar representatividad o incluso contener información útil sobre el proceso que generó los datos.
Idea central: los missing values no son solo ausencia; muchas veces son señal.
Imputar
Consiste en reemplazar el valor faltante por un valor estimado o definido, como media, mediana, moda o una imputación basada en modelos. Mantiene tamaño de muestra, pero puede distorsionar distribución si se usa mal.
Eliminar
Supone descartar registros o columnas con faltantes. Es simple, pero puede reducir mucho la muestra o introducir sesgo si la ausencia no es aleatoria.
Crear indicador
Consiste en agregar una variable binaria que marque si faltaba el dato. Es útil cuando la ausencia en sí misma puede ser informativa.
Criterio correcto
La decisión debe depender del patrón de faltantes, del tipo de variable, del porcentaje, del objetivo del análisis y del significado sustantivo de la ausencia.
Qué aporta
Resume, mediante coeficientes, la fuerza y dirección de la asociación entre pares de variables numéricas. Permite detectar variables que se mueven juntas y posibles redundancias.
Utilidad en EDA
Sirve para detectar bloques de variables similares, anticipar multicolinealidad y seleccionar subgrupos de variables para explorar con más detalle.
Límites
No detecta bien relaciones no lineales, puede estar afectada por outliers y jamás debe interpretarse como prueba de causalidad.
Buena práctica
Acompañar la matriz con scatter plots, pair plots y segmentaciones por grupo para no depender de un único número.
Resumen: la matriz de correlación orienta, pero no reemplaza la inspección visual ni el criterio causal.
Definición
Es una asociación aparente entre variables que no refleja un vínculo sustantivo estable, sino coincidencia, efecto de una tercera variable o tendencia compartida.
Riesgo en EDA
El EDA busca patrones, pero eso puede llevar a encontrar relaciones visualmente sugestivas que no tienen interpretación válida si no se contrastan con contexto y segmentación.
Cómo reducir el riesgo
Revisar subgrupos, incorporar temporalidad, pensar variables de confusión, contrastar con lógica sustantiva y evitar conclusiones causales apresuradas.
Lección: detectar una asociación es el comienzo de una pregunta, no el final de una explicación.
Definición
Un dataset tiene problemas de calidad cuando su información presenta faltantes, duplicados, errores de formato, inconsistencias internas, valores imposibles o registros poco plausibles.
Qué revisar
Completitud, coherencia entre columnas, formato correcto, duplicación, plausibilidad de rangos, categorías mal escritas, fechas imposibles y estabilidad temporal.
Por qué importa
Porque un modelo sofisticado no compensa datos defectuosos. Si la calidad es baja, las conclusiones también serán débiles o engañosas.
Rol del EDA
Funciona como diagnóstico temprano de estas fallas y orienta decisiones de limpieza y preprocesamiento.
Definición
Es la distorsión que aparece cuando los datos disponibles no representan bien a la población o fenómeno que se quiere estudiar, porque el mecanismo de inclusión favorece ciertos perfiles y excluye otros.
Consecuencia
El análisis puede ser internamente coherente y aun así no generalizar. Es decir, se obtienen conclusiones válidas solo para la muestra observada, no para el universo de interés.
Cómo sospecharlo
Observando subgrupos ausentes, cobertura geográfica o temporal sesgada, respuestas voluntarias muy desequilibradas o un proceso de captura sesgado por diseño.
Lección: un dataset grande no necesariamente es representativo. El tamaño no reemplaza la calidad del proceso de selección.
Definición
Leakage es la filtración de información del futuro o del target hacia variables o procesos que el modelo usa durante entrenamiento, aunque esa información no estaría disponible al momento real de predecir.
Por qué es grave
Produce modelos que parecen excelentes en validación, pero fallan en producción porque aprendieron información indebida.
Cómo detectarlo en EDA
Revisando temporalidad de variables, preguntando cuándo estaría disponible cada dato, identificando columnas derivadas del target y observando relaciones sospechosamente perfectas.
Regla de oro: si una variable contiene información que solo se conoce después del evento a predecir, probablemente hay leakage.
EDA
Diagnostica: describe variables, detecta problemas, revela patrones, sugiere hipótesis y ayuda a decidir qué transformaciones pueden ser necesarias.
Preprocesamiento
Actúa sobre los datos: limpia, imputa, transforma, codifica, escala o deriva variables.
Relación correcta
El EDA debe preceder y orientar al preprocesamiento. Primero se entiende el problema, luego se decide qué operación aplicar.
Error frecuente
Aplicar recetas estándar de limpieza o transformación sin haber entendido antes si realmente son necesarias o si destruyen información valiosa.
Principio: no transformar por rutina; transformar por diagnóstico.
Definición
Una variable tiene alta cardinalidad cuando posee una gran cantidad de valores únicos o categorías distintas.
Problemas que plantea
Dificulta visualización, produce tablas extensas, puede esconder errores de escritura y complica codificación para modelado.
Qué debe revisar el EDA
Frecuencia de categorías raras, consistencia semántica, posible carácter identificador y conveniencia de agrupar, truncar o redefinir niveles.
Ejemplo típico
Ciudad, SKU, email, nombre de producto o identificador de cliente.
Escalado
Suele ser necesario cuando variables numéricas tienen magnitudes muy distintas y luego se usarán algoritmos sensibles a distancia o escala, como kNN o k-means.
Transformación
Puede ser útil cuando una variable tiene cola muy larga, asimetría extrema o relación no lineal que conviene estabilizar. Ejemplo clásico: logaritmo.
Rol del EDA
Detecta esas necesidades mediante histogramas, boxplots, percentiles, dispersión y comparación de escalas entre columnas.
Advertencia
No toda variable debe escalarse o transformarse. La decisión depende del objetivo, el algoritmo y el significado sustantivo de la variable.
Visualización adecuada
Es aquella que representa correctamente la estructura de la variable o relación y que ayuda a responder una pregunta analítica concreta.
No es solo estética
Un gráfico puede ser atractivo y, sin embargo, inducir a error si no corresponde al tipo de variable o si oculta aspectos relevantes como escalas, extremos o distribución real.
Criterio de elección
Depende del tipo de variable, del objetivo de la exploración y de qué se quiere mostrar: distribución, frecuencia, comparación, asociación o evolución.
Idea clave: en EDA, visualizar es pensar. El gráfico correcto es parte del razonamiento, no un adorno final.
Síntesis
El EDA es la etapa en la que los datos dejan de ser una tabla y comienzan a convertirse en información interpretable. Su propósito es comprender antes de modelar, detectar problemas antes de automatizar y formular preguntas mejores antes de sacar conclusiones.
Tres funciones
Comprender estructura, diagnosticar calidad del dato y orientar decisiones posteriores de análisis o modelado.
Actitud correcta
Mirar, resumir, graficar, comparar, cuestionar y contextualizar. No asumir que los datos “hablan solos”, sino aprender a interrogarlos con criterio.
Frase de cierre: primero entender los datos, después transformarlos, y solo entonces modelar con fundamento.
Explorar antes de modelar Diagnosticar antes de decidir Visualizar antes de concluir
""" display(HTML(html_content))