Modeling (Modelado)

Escrito por

en

La fase de Modeling (Modelado) representa el punto en el que los datos preparados se transforman en conocimiento mediante la construcción de modelos analíticos y de Machine Learning. Después de comprender el problema de negocio, recopilar los datos, analizarlos y prepararlos, llega el momento de entrenar algoritmos capaces de aprender patrones y realizar predicciones sobre nuevos datos.

Durante esta fase se seleccionan los algoritmos más adecuados, se entrenan diferentes modelos, se ajustan sus hiperparámetros y se comparan sus resultados utilizando métricas de evaluación apropiadas. El objetivo no consiste únicamente en obtener el modelo con mayor precisión, sino en desarrollar una solución robusta, interpretable y alineada con los objetivos del proyecto.

El modelado suele ser un proceso iterativo. Es habitual entrenar varios modelos, comparar su rendimiento y regresar a fases anteriores cuando los resultados no son satisfactorios.

¿Qué es Modeling?

Modeling es la fase de la metodología de Ciencia de Datos en la que se construyen y entrenan modelos utilizando los datos preparados para resolver el problema definido durante el Business Understanding.

Dependiendo del tipo de problema, el modelado puede implicar:

  • Clasificación.
  • Regresión.
  • Clustering.
  • Sistemas de recomendación.
  • Series temporales.
  • Detección de anomalías.
  • Procesamiento del Lenguaje Natural (NLP).
  • Visión por computador.
  • Aprendizaje profundo (Deep Learning).

El resultado es uno o varios modelos candidatos que posteriormente serán evaluados.

Objetivos del Modeling

La fase de modelado persigue varios objetivos.

Entre los principales destacan:

  • Construir modelos predictivos.
  • Descubrir patrones en los datos.
  • Comparar diferentes algoritmos.
  • Ajustar hiperparámetros.
  • Evaluar el rendimiento de los modelos.
  • Seleccionar el mejor modelo para el problema.
  • Generar predicciones fiables.

Preguntas que debe responder

Al finalizar esta fase deberían responderse preguntas como las siguientes.

Sobre el algoritmo

  • ¿Qué algoritmo se adapta mejor al problema?
  • ¿Es un problema supervisado o no supervisado?
  • ¿El modelo cumple los objetivos del negocio?

Sobre el entrenamiento

  • ¿El modelo ha aprendido correctamente?
  • ¿Existe sobreajuste (Overfitting)?
  • ¿Existe infraajuste (Underfitting)?
  • ¿Es necesario ajustar hiperparámetros?

Sobre el rendimiento

  • ¿Qué métricas se utilizarán?
  • ¿El rendimiento es suficientemente bueno?
  • ¿Cómo se comporta con datos no vistos?
  • ¿Es estable el modelo?

Sobre el negocio

  • ¿El modelo aporta valor?
  • ¿Puede implementarse en producción?
  • ¿Es suficientemente interpretable?
  • ¿Cumple los requisitos del proyecto?

Resultado esperado

Al finalizar la fase de Modeling debería disponerse de:

  • Uno o varios modelos entrenados.
  • Comparativa entre algoritmos.
  • Hiperparámetros optimizados.
  • Métricas de rendimiento.
  • Predicciones sobre datos de prueba.
  • Modelo seleccionado para evaluación final.
  • Documentación del proceso de entrenamiento.

Este conjunto de resultados servirá como entrada para la fase de Evaluación.

Flujo de trabajo

Un flujo de trabajo habitual durante la fase de modelado es el siguiente.

  1. Seleccionar el algoritmo adecuado.
  2. Dividir los datos en entrenamiento y prueba (si no se ha realizado previamente).
  3. Entrenar un modelo inicial.
  4. Obtener predicciones.
  5. Evaluar el rendimiento.
  6. Ajustar hiperparámetros.
  7. Comparar diferentes algoritmos.
  8. Validar el modelo mediante técnicas apropiadas.
  9. Seleccionar el mejor modelo.
  10. Documentar todo el proceso.

Este proceso suele repetirse varias veces hasta obtener un modelo satisfactorio.

¿Cómo funciona?

El modelado consiste en permitir que un algoritmo aprenda patrones presentes en los datos.

De forma simplificada, el proceso sigue estos pasos:

  1. El algoritmo recibe los datos de entrenamiento.
  2. Aprende relaciones entre las variables.
  3. Construye un modelo matemático.
  4. Utiliza dicho modelo para realizar predicciones sobre nuevos datos.
  5. Se compara el resultado con los valores reales.
  6. Se evalúa su rendimiento mediante métricas específicas.

El aprendizaje dependerá tanto del algoritmo seleccionado como de la calidad de los datos.

Selección del algoritmo

La elección del algoritmo depende del problema que se desea resolver.

Tipo de problemaAlgoritmos habituales
ClasificaciónLogistic Regression, Decision Tree, Random Forest, XGBoost, SVM
RegresiónLinear Regression, Random Forest Regressor, XGBoost Regressor
ClusteringK-Means, DBSCAN, Agglomerative Clustering
Sistemas de recomendaciónKNN, Matrix Factorization, SVD
Series temporalesARIMA, Prophet, LSTM
Deep LearningRedes neuronales, CNN, RNN, Transformers

No existe un algoritmo universalmente superior.

Entrenamiento del modelo

Durante el entrenamiento el algoritmo aprende a partir del conjunto de entrenamiento.

Dependiendo del algoritmo pueden aprenderse:

  • Relaciones lineales.
  • Fronteras de decisión.
  • Árboles de decisión.
  • Patrones complejos.
  • Representaciones latentes.

El objetivo es generalizar correctamente sobre datos nuevos.

Ajuste de hiperparámetros

Muchos algoritmos poseen parámetros configurables.

Algunos ejemplos son:

  • Número de árboles.
  • Profundidad máxima.
  • Número de vecinos.
  • Learning rate.
  • Número de épocas.
  • Batch size.

El ajuste de estos hiperparámetros puede mejorar significativamente el rendimiento del modelo.

Validación del modelo

Antes de seleccionar un modelo es necesario validar su comportamiento.

Las técnicas más utilizadas incluyen:

  • Hold-Out Validation.
  • Train/Test Split.
  • K-Fold Cross Validation.
  • Stratified K-Fold.
  • Leave-One-Out Cross Validation.

Estas estrategias permiten estimar la capacidad de generalización del modelo.

Ejemplo conceptual

Supongamos un proyecto para predecir el abandono de clientes.

Después de preparar los datos podrían entrenarse varios modelos.

  • Regresión Logística.
  • Random Forest.
  • XGBoost.

Posteriormente se comparan utilizando ROC-AUC.

El modelo con mejor equilibrio entre rendimiento e interpretabilidad será el candidato para pasar a la siguiente fase.

Ejemplo práctico

Imaginemos un proyecto de predicción del precio de viviendas. Podrían entrenarse los siguientes modelos.

ModeloRMSE
Regresión Lineal35.200 €
Random Forest18.700 €
XGBoost16.900 €

En este caso XGBoost obtiene el menor error.

No obstante, antes de seleccionarlo también deberían evaluarse:

  • Tiempo de entrenamiento.
  • Interpretabilidad.
  • Robustez.
  • Complejidad del modelo.

Modeling vs Evaluation

Aunque están estrechamente relacionadas, ambas fases tienen objetivos distintos.

ModelingEvaluation
Construye modelosValida el modelo seleccionado
Entrena algoritmosEvalúa si cumple los objetivos del negocio
Ajusta hiperparámetrosAnaliza el rendimiento final
Compara modelosDecide si el modelo está preparado para producción
Produce modelos candidatosProduce una decisión final

El modelado construye soluciones; la evaluación decide si esas soluciones son aceptables.

Beneficios

Una correcta fase de modelado aporta numerosas ventajas.

  • Permite automatizar decisiones.
  • Descubre patrones ocultos.
  • Genera predicciones.
  • Facilita la toma de decisiones.
  • Permite comparar algoritmos.
  • Optimiza el rendimiento mediante ajuste de hiperparámetros.
  • Constituye la base de sistemas inteligentes.

¿Cuándo realizar Modeling?

El modelado debe comenzar únicamente cuando:

  • Los datos han sido preparados.
  • Los problemas de calidad se han resuelto.
  • Existe una variable objetivo (en aprendizaje supervisado).
  • Se dispone de un conjunto de entrenamiento adecuado.

No resulta recomendable entrenar modelos sobre datos sin preparar.

Ventajas y desventajas

VentajasDesventajas
Permite generar modelos predictivosRequiere datos de calidad
Automatiza la toma de decisionesPuede consumir muchos recursos computacionales
Descubre relaciones complejasExiste riesgo de sobreajuste
Permite comparar algoritmosAlgunos modelos son difíciles de interpretar
Puede mejorar continuamenteEl ajuste de hiperparámetros puede ser costoso

Limitaciones

La fase de modelado presenta diversas limitaciones.

  • Depende completamente de la calidad de los datos.
  • No existe un algoritmo óptimo para todos los problemas.
  • Algunos modelos requieren grandes cantidades de datos.
  • Puede ser necesario entrenar múltiples modelos.
  • Los resultados pueden variar con nuevos datos.
  • El mejor modelo según una métrica no siempre es el mejor para el negocio.

Por ello, el rendimiento técnico debe complementarse con una evaluación desde la perspectiva del problema empresarial.

Buenas prácticas

Para desarrollar correctamente la fase de Modeling se recomienda:

  • Comenzar con modelos sencillos antes de utilizar algoritmos complejos.
  • Comparar siempre varios modelos en lugar de asumir que uno será el mejor.
  • Utilizar técnicas de validación adecuadas, como la validación cruzada.
  • Ajustar los hiperparámetros de forma sistemática y evitar búsquedas aleatorias sin criterio.
  • Evitar el sobreajuste mediante regularización, selección de características o más datos cuando sea posible.
  • Registrar las métricas, hiperparámetros y versiones utilizadas para garantizar la reproducibilidad.
  • Evaluar tanto el rendimiento técnico como la interpretabilidad y el impacto sobre el negocio.
  • Mantener un pipeline reproducible que incluya el preprocesamiento y el entrenamiento del modelo.