Data Collection (Recolección de Datos)

Escrito por

en

La Data Collection (Recolección de Datos) es una de las fases fundamentales de la metodología de la Ciencia de Datos. Su objetivo consiste en obtener los datos necesarios para responder al problema de negocio definido en las etapas anteriores del proyecto. Esta fase transforma los requisitos de datos (Data Requirements) en conjuntos de datos reales que posteriormente serán analizados, preparados y utilizados para entrenar modelos de Machine Learning.

La calidad de cualquier proyecto analítico depende en gran medida de la calidad de los datos recopilados. Incluso el algoritmo más avanzado producirá resultados poco fiables si los datos son incompletos, inconsistentes o no representan correctamente el problema que se desea resolver.

La recolección de datos implica mucho más que descargar un conjunto de datos. Incluye identificar fuentes de información, acceder a ellas, integrar datos procedentes de múltiples sistemas, validar su calidad inicial y documentar todo el proceso para garantizar la reproducibilidad del proyecto.

¿Qué es la Data Collection?

La Data Collection es el proceso mediante el cual se obtienen los datos que serán utilizados durante el proyecto de Ciencia de Datos.

Esta fase comprende actividades como:

  • Localizar las fuentes de datos.
  • Obtener permisos de acceso.
  • Extraer la información.
  • Integrar datos procedentes de diferentes sistemas.
  • Almacenar los datos.
  • Validar que cumplen los requisitos definidos previamente.

El resultado es uno o varios conjuntos de datos preparados para iniciar la fase de Data Understanding.

Objetivos de la Data Collection

La recolección de datos persigue varios objetivos.

Entre los principales destacan:

  • Obtener todos los datos necesarios.
  • Garantizar que los datos representan correctamente el problema.
  • Reducir pérdidas de información.
  • Minimizar errores durante la extracción.
  • Facilitar las fases posteriores del proyecto.
  • Mantener la trazabilidad del origen de los datos.

¿Cómo funciona?

El proceso de recopilación suele desarrollarse siguiendo una serie de pasos.

  1. Revisar los Data Requirements.
  2. Identificar las fuentes de datos disponibles.
  3. Obtener acceso a dichas fuentes.
  4. Extraer la información.
  5. Integrar datos de distintos orígenes cuando sea necesario.
  6. Almacenar los datos de forma estructurada.
  7. Realizar una validación inicial de calidad.
  8. Documentar el proceso de extracción.

Una correcta planificación reduce significativamente los problemas posteriores de limpieza y preparación de datos.

Principales fuentes de datos

Los datos pueden proceder de numerosas fuentes.

Entre las más habituales se encuentran:

  • Bases de datos relacionales.
  • Data Warehouses.
  • Data Lakes.
  • APIs.
  • Archivos CSV.
  • Archivos Excel.
  • Archivos JSON.
  • Sensores IoT.
  • Aplicaciones empresariales.
  • Redes sociales.
  • Sistemas ERP.
  • Sistemas CRM.
  • Registros (logs) de aplicaciones.
  • Web Scraping.
  • Datos abiertos (Open Data).
  • Plataformas de competiciones como Kaggle o DrivenData.

En muchos proyectos es necesario combinar varias fuentes simultáneamente.

Tipos de datos recopilados

Dependiendo del proyecto pueden obtenerse distintos tipos de información.

  • Datos estructurados.
  • Datos semiestructurados.
  • Datos no estructurados.
  • Series temporales.
  • Datos geoespaciales.
  • Imágenes.
  • Audio.
  • Vídeo.
  • Texto.
  • Registros de eventos.

Cada tipo requiere estrategias de recopilación diferentes.

Métodos de recolección de datos

La adquisición de datos puede realizarse mediante diferentes mecanismos.

MétodoEjemplo
Consulta SQLExtraer datos de una base de datos
API RESTObtener información desde un servicio web
Lectura de archivosCSV, Excel, JSON o Parquet
StreamingKafka, MQTT, Event Hub
Web ScrapingExtraer información de páginas web
SensoresIoT y dispositivos inteligentes
EncuestasFormularios y cuestionarios
Integración entre sistemasERP, CRM o Data Warehouse

La elección dependerá del origen de los datos y de los requisitos del proyecto.

Ejemplo conceptual

Supongamos que una empresa desea desarrollar un modelo para predecir el abandono de clientes.

Durante la fase de Data Collection podrían recopilarse datos procedentes de:

  • CRM.
  • Sistema de facturación.
  • Plataforma de atención al cliente.
  • Historial de incidencias.
  • Portal web.
  • Aplicación móvil.

Posteriormente todos estos datos se integran en un único conjunto para su análisis.

Ejemplo práctico

Imaginemos un proyecto para predecir el precio de viviendas.

La recopilación podría incluir:

FuenteInformación obtenida
CatastroSuperficie y antigüedad
Portal inmobiliarioPrecio de venta
Instituto Nacional de EstadísticaDatos demográficos
API meteorológicaInformación climática
Sistema GISUbicación geográfica

La combinación de estas fuentes permite construir un conjunto de datos mucho más completo.

Data Collection vs Data Requirements

Aunque ambas fases están relacionadas, cumplen funciones distintas.

Data RequirementsData Collection
Define qué datos son necesariosObtiene los datos
Actividad de planificaciónActividad de ejecución
Se realiza antesSe realiza después
Produce especificacionesProduce conjuntos de datos
Depende del negocioDepende de las fuentes disponibles

Los requisitos establecen las necesidades; la recolección las materializa.

Beneficios

Una correcta recolección de datos aporta numerosas ventajas.

  • Mejora la calidad del proyecto.
  • Reduce errores posteriores.
  • Disminuye el tiempo de preparación de datos.
  • Facilita la integración de múltiples fuentes.
  • Incrementa la fiabilidad de los modelos.
  • Favorece la reproducibilidad del proyecto.
  • Reduce costes derivados de datos incompletos.

¿Cuándo realizar la Data Collection?

Esta fase debe ejecutarse una vez definidos los requisitos de datos.

Resulta especialmente importante cuando:

  • Se inicia un nuevo proyecto.
  • Existen múltiples fuentes de información.
  • Se requiere información histórica.
  • Es necesario recopilar datos en tiempo real.
  • Deben integrarse diferentes sistemas.
  • Se trabaja con grandes volúmenes de información.

En metodologías iterativas, la recolección puede repetirse durante varias fases del proyecto.

Ventajas y desventajas

VentajasDesventajas
Permite obtener información realPuede requerir mucho tiempo
Facilita modelos más precisosAlgunas fuentes pueden no estar disponibles
Integra múltiples sistemasPuede generar problemas de compatibilidad
Favorece la trazabilidadRequiere permisos y aspectos legales
Reduce incertidumbreLa calidad inicial puede ser baja

Limitaciones

La recolección de datos presenta diversas limitaciones.

  • Restricciones legales o de privacidad.
  • Coste de acceso a determinadas fuentes.
  • Calidad insuficiente de los datos.
  • Cambios en las APIs o sistemas de origen.
  • Datos incompletos o inconsistentes.
  • Problemas de integración entre diferentes formatos.
  • Limitaciones de almacenamiento o infraestructura.

Por ello, esta fase suele combinarse con procesos iniciales de validación.

Buenas prácticas durante la Data Collection

Para obtener conjuntos de datos de calidad se recomienda:

  • Documentar todas las fuentes utilizadas.
  • Registrar la fecha y versión de los datos.
  • Automatizar el proceso de extracción cuando sea posible.
  • Verificar permisos y aspectos legales.
  • Mantener copias de seguridad.
  • Conservar los datos originales sin modificaciones.
  • Registrar posibles incidencias durante la recopilación.
  • Validar el volumen y la estructura de los datos obtenidos.

Buenas prácticas en Python

Al implementar procesos de Data Collection mediante Python se recomienda:

  • Utilizar rutas configurables y no codificadas directamente.
  • Gestionar adecuadamente excepciones y errores de conexión.
  • Registrar los procesos mediante archivos de log.
  • Automatizar las extracciones repetitivas.
  • Validar la estructura de los datos tras cada extracción.
  • Conservar siempre una copia de los datos originales.
  • Modularizar el código para facilitar su mantenimiento.

Conclusión

La Data Collection constituye una fase crítica dentro de la metodología de la Ciencia de Datos, ya que transforma los requisitos de información definidos previamente en conjuntos de datos reales sobre los que se desarrollará todo el proyecto analítico. Una recopilación bien planificada garantiza que los datos sean completos, consistentes y adecuados para responder al problema de negocio.

Aunque suele percibirse como una actividad puramente técnica, la recolección de datos requiere una estrecha colaboración entre los equipos de negocio, ingeniería y análisis, así como una correcta documentación de las fuentes, los procesos de extracción y las validaciones realizadas. Una ejecución rigurosa de esta fase facilita las etapas posteriores de Data Understanding, Data Preparation y Modeling, incrementando significativamente la calidad y la fiabilidad de los resultados obtenidos.