La Data Understanding (Comprensión de los Datos) es una de las fases más importantes dentro de la metodología de la Ciencia de Datos. Su objetivo consiste en explorar, comprender y evaluar los datos recopilados para determinar si son adecuados para resolver el problema de negocio definido en las etapas anteriores.
Durante esta fase se analizan las características del conjunto de datos, su estructura, calidad, distribución, relaciones entre variables y posibles problemas que puedan afectar al desarrollo del modelo de Machine Learning. La comprensión de los datos constituye el primer contacto analítico con la información disponible y permite identificar oportunidades, limitaciones y necesidades de preparación antes de comenzar el modelado.
Una buena comprensión de los datos reduce significativamente el riesgo de construir modelos sobre información incompleta, inconsistente o sesgada, facilitando la toma de decisiones durante las siguientes fases del proyecto.
¿Qué es Data Understanding?
Data Understanding es el proceso de exploración y análisis inicial del conjunto de datos con el fin de conocer su contenido, calidad y comportamiento.
Esta fase busca responder preguntas como:
- ¿Qué información contienen los datos?
- ¿Son suficientes para resolver el problema?
- ¿Existen errores o inconsistencias?
- ¿Qué variables son relevantes?
- ¿Qué relaciones existen entre ellas?
- ¿Qué problemas deberán resolverse durante la preparación de datos?
El resultado es un conocimiento profundo del conjunto de datos antes de aplicar cualquier transformación.
Objetivos de Data Understanding
La fase de comprensión de los datos persigue varios objetivos.
Entre los principales destacan:
- Conocer la estructura del conjunto de datos.
- Identificar problemas de calidad.
- Detectar valores nulos.
- Detectar valores atípicos.
- Analizar la distribución de las variables.
- Comprender las relaciones entre variables.
- Identificar posibles sesgos.
- Validar que los datos cumplen los requisitos definidos previamente.
Preguntas que debe responder
Una correcta fase de Data Understanding debería responder, al menos, las siguientes preguntas.
Sobre la estructura de los datos
- ¿Cuántos registros existen?
- ¿Cuántas variables contiene el conjunto?
- ¿Qué tipo de variables hay?
- ¿Cuál es la variable objetivo?
- ¿Qué significado tiene cada atributo?
Sobre la calidad de los datos
- ¿Existen valores nulos?
- ¿Hay registros duplicados?
- ¿Existen errores de formato?
- ¿Hay valores inconsistentes?
- ¿Los datos cumplen las reglas del negocio?
Sobre las variables
- ¿Qué variables son numéricas?
- ¿Cuáles son categóricas?
- ¿Qué variables presentan alta cardinalidad?
- ¿Existen variables constantes?
- ¿Hay variables redundantes?
Sobre las distribuciones
- ¿Las variables siguen distribuciones normales?
- ¿Existen valores extremos?
- ¿Hay variables muy sesgadas?
- ¿Es necesario transformar alguna variable?
Sobre las relaciones
- ¿Existen correlaciones elevadas?
- ¿Hay multicolinealidad?
- ¿Qué variables parecen más importantes?
- ¿Cómo se relacionan con la variable objetivo?
Sobre el problema
- ¿Los datos representan correctamente el negocio?
- ¿Será necesario recopilar información adicional?
- ¿Existen limitaciones importantes?
Responder estas preguntas facilita enormemente las siguientes fases del proyecto.
Resultado esperado
Al finalizar la fase de Data Understanding debería disponerse de:
- Un conocimiento profundo del conjunto de datos.
- Un inventario de problemas detectados.
- Un análisis de calidad de los datos.
- Estadísticas descriptivas.
- Visualizaciones exploratorias.
- Identificación de valores nulos.
- Identificación de duplicados.
- Identificación de valores atípicos.
- Relación entre variables.
- Hipótesis iniciales sobre el comportamiento de los datos.
- Un plan para la fase de Data Preparation.
En otras palabras, el resultado esperado no es un modelo entrenado, sino una comprensión completa del conjunto de datos y una lista clara de acciones necesarias antes del modelado.
Flujo de trabajo
Una forma habitual de abordar esta fase consiste en seguir el siguiente flujo de trabajo.
- Cargar el conjunto de datos.
- Inspeccionar su estructura general.
- Analizar los tipos de datos.
- Calcular estadísticas descriptivas.
- Analizar la calidad de los datos.
- Detectar valores nulos.
- Detectar registros duplicados.
- Detectar valores atípicos.
- Analizar la distribución de las variables.
- Estudiar la relación entre variables.
- Analizar la variable objetivo.
- Documentar las conclusiones.
- Definir las tareas de Data Preparation.
Este flujo puede repetirse varias veces a medida que aparecen nuevos conocimientos sobre los datos.
¿Cómo funciona?
La comprensión de los datos combina análisis estadístico y visualización. Durante esta fase suelen realizarse actividades como:
- Estadística descriptiva.
- Visualización de distribuciones.
- Histogramas.
- Diagramas de caja.
- Diagramas de dispersión.
- Matrices de correlación.
- Tablas de frecuencias.
- Análisis de valores nulos.
- Perfilado de datos (Data Profiling).
No se modifican todavía los datos, únicamente se analizan.
Principales actividades
Las tareas más habituales incluyen:
- Exploración inicial.
- Data Profiling.
- Análisis univariante.
- Análisis bivariante.
- Análisis multivariante.
- Evaluación de calidad.
- Detección de anomalías.
- Comprensión del significado de las variables.
- Identificación de posibles transformaciones.
Ejemplo conceptual
Supongamos un conjunto de datos de clientes.
Durante la fase de Data Understanding podrían detectarse situaciones como:
- La edad contiene valores negativos.
- El 30 % de los ingresos son nulos.
- Existen clientes duplicados.
- El género presenta categorías inconsistentes.
- El precio contiene valores extremos.
Todos estos problemas deberán resolverse posteriormente durante la preparación de datos.
Ejemplo práctico
Imaginemos un conjunto de datos para predecir el abandono de clientes.
Durante el análisis se detecta que:
| Observación | Resultado |
|---|---|
| Registros | 50.000 |
| Variables | 35 |
| Valores nulos | 8 % |
| Duplicados | 245 |
| Variables categóricas | 12 |
| Variables numéricas | 23 |
| Variable objetivo | Churn |
Este análisis constituye la base del plan de limpieza y preparación de datos.
Data Understanding vs Data Preparation
Ambas fases están estrechamente relacionadas, aunque cumplen funciones diferentes.
| Data Understanding | Data Preparation |
|---|---|
| Analiza los datos | Modifica los datos |
| Detecta problemas | Corrige problemas |
| Explora | Transforma |
| Genera conocimiento | Genera un conjunto listo para modelar |
| No altera los datos originales | Produce un nuevo conjunto preparado |
Comprender los datos siempre precede a su preparación.
Beneficios
Una correcta fase de Data Understanding ofrece numerosas ventajas.
- Reduce errores durante el modelado.
- Facilita la selección de variables.
- Mejora la calidad del conjunto de datos.
- Reduce el riesgo de sobreajuste.
- Permite detectar problemas tempranamente.
- Facilita la comunicación entre los equipos.
- Aumenta la confianza en los resultados obtenidos.
¿Cuándo realizar Data Understanding?
Esta fase debe comenzar inmediatamente después de la recopilación de datos.
También resulta recomendable repetirla cuando:
- Se incorporan nuevas fuentes de información.
- Cambian los datos disponibles.
- Aparecen nuevas variables.
- Se detectan problemas durante el modelado.
- Se actualiza el conjunto de datos.
En proyectos iterativos es habitual regresar varias veces a esta fase.
Ventajas y desventajas
| Ventajas | Desventajas |
|---|---|
| Detecta problemas antes del modelado | Puede consumir bastante tiempo |
| Mejora la calidad del proyecto | Requiere conocimientos estadísticos |
| Facilita la preparación de datos | Grandes conjuntos de datos pueden dificultar el análisis |
| Reduce errores posteriores | Puede ser necesario repetir el proceso |
| Permite comprender el negocio a través de los datos | No corrige directamente los problemas encontrados |
Limitaciones
Aunque resulta imprescindible, presenta algunas limitaciones.
- No corrige los problemas detectados.
- Depende de la calidad de los datos recopilados.
- Algunas anomalías solo aparecen durante el entrenamiento del modelo.
- Puede resultar costosa en conjuntos de datos muy grandes.
- Requiere experiencia para interpretar correctamente los resultados.
Por ello, suele combinarse con herramientas automáticas de perfilado de datos.
Buenas prácticas
Para desarrollar correctamente la fase de Data Understanding se recomienda:
- Comprender previamente el problema de negocio.
- Analizar tanto variables numéricas como categóricas.
- Documentar todas las observaciones realizadas.
- Combinar análisis estadístico y visual.
- No modificar los datos durante esta fase.
- Validar los resultados con expertos del dominio cuando sea necesario.
- Registrar todas las hipótesis que surjan durante el análisis.
- Elaborar un plan de acciones para la fase de Data Preparation.
Conclusión
La Data Understanding constituye una de las fases más importantes dentro de la metodología de la Ciencia de Datos, ya que proporciona una comprensión profunda de la información disponible antes de iniciar cualquier transformación o proceso de modelado. A través del análisis exploratorio, la evaluación de la calidad de los datos y el estudio de las relaciones entre variables, es posible identificar problemas, validar hipótesis y planificar las tareas necesarias para preparar correctamente el conjunto de datos.
Lejos de ser una simple revisión inicial, esta fase representa el fundamento sobre el que se construirá todo el proyecto analítico. Una comprensión adecuada de los datos permite reducir riesgos, mejorar la calidad de los modelos y tomar decisiones fundamentadas durante las etapas posteriores de Data Preparation, Modeling y Evaluation, incrementando significativamente las probabilidades de éxito del proyecto de Ciencia de Datos.



