Técnicas Supervisadas vs No Supervisadas

Escrito por

en

La reducción de la dimensionalidad engloba un conjunto de técnicas cuyo objetivo es disminuir el número de variables de un conjunto de datos conservando la mayor cantidad posible de información. Sin embargo, no todas estas técnicas funcionan de la misma manera. Una de las clasificaciones más importantes distingue entre técnicas supervisadas y técnicas no supervisadas.

La principal diferencia entre ambas radica en el uso de la variable objetivo (target) durante el proceso de transformación. Mientras que las técnicas supervisadas utilizan la información de las clases o etiquetas para generar una representación más discriminativa de los datos, las técnicas no supervisadas ignoran completamente dicha información y se centran únicamente en la estructura interna del conjunto de datos.

Comprender esta diferencia resulta fundamental para seleccionar la técnica más adecuada en función del problema de Machine Learning que se desea resolver.

¿Qué son las técnicas supervisadas y no supervisadas?

Las técnicas de reducción de la dimensionalidad pueden clasificarse en dos grandes categorías según utilicen o no la variable objetivo durante el proceso de aprendizaje.

Técnicas supervisadas

  • Las técnicas supervisadas utilizan tanto las variables predictoras como la variable objetivo para construir una nueva representación de los datos.
  • Su propósito principal consiste en encontrar nuevas dimensiones que permitan separar mejor las distintas clases del problema. Este enfoque suele utilizarse en problemas de:
    • Clasificación.
    • Reconocimiento de patrones.
    • Diagnóstico médico.
    • Detección de fraude.
  • Técnicas no supervisadas: Las técnicas no supervisadas únicamente utilizan las variables predictoras. No necesitan conocer las etiquetas de los datos y buscan describir la estructura interna del conjunto de datos conservando la mayor cantidad posible de información. Se utilizan principalmente para:
    • Compresión de datos.
    • Eliminación de redundancia.
    • Visualización.
    • Análisis exploratorio.
    • Preprocesamiento.

¿Cómo funcionan?

Aunque ambas familias reducen el número de dimensiones, sus objetivos son diferentes.

Funcionamiento de las técnicas supervisadas

El proceso general consiste en:

  1. Analizar las variables predictoras.
  2. Utilizar las etiquetas del conjunto de datos.
  3. Buscar las combinaciones de variables que mejor separen las clases.
  4. Generar nuevas dimensiones con alto poder discriminativo.

El resultado favorece el rendimiento de modelos de clasificación.

Funcionamiento de las técnicas no supervisadas

En este caso el procedimiento consiste en:

  1. Analizar únicamente las variables predictoras.
  2. Detectar relaciones entre ellas.
  3. Identificar redundancias.
  4. Generar una representación más compacta del conjunto de datos.

No existe información sobre las clases durante el proceso.

Diferencias principales

CaracterísticaTécnicas SupervisadasTécnicas No Supervisadas
Utilizan variable objetivoNo
Requieren etiquetasNo
Objetivo principalSeparar clasesConservar información
Aplicación habitualClasificaciónExploración y preprocesamiento
Pueden utilizarse con datos sin etiquetarNo

Esta es la diferencia fundamental entre ambos enfoques.

Técnicas supervisadas más utilizadas

Las técnicas supervisadas son menos numerosas, pero muy eficaces cuando existen etiquetas disponibles.

TécnicaObjetivo
Linear Discriminant Analysis (LDA)Maximizar la separación entre clases
Partial Least Squares (PLS)Maximizar la relación entre variables predictoras y objetivo
Neighborhood Components Analysis (NCA)Optimizar la representación para clasificación basada en vecinos

Dentro de esta guía, el principal representante será Linear Discriminant Analysis (LDA).

Técnicas no supervisadas más utilizadas

Las técnicas no supervisadas son las más utilizadas en Ciencia de Datos.

TécnicaObjetivo
Principal Component Analysis (PCA)Maximizar la varianza explicada
Independent Component Analysis (ICA)Encontrar componentes estadísticamente independientes
t-SNEVisualización de datos complejos
UMAPReducción y visualización preservando la estructura local
Truncated SVDReducción de dimensionalidad en datos dispersos

Cada una optimiza un criterio diferente.

Beneficios

La utilización del enfoque adecuado aporta numerosas ventajas.

Entre los principales beneficios destacan:

  • Reduce el número de variables.
  • Disminuye el coste computacional.
  • Facilita la visualización.
  • Reduce el ruido.
  • Disminuye la redundancia.
  • Puede mejorar la capacidad de generalización.
  • Simplifica modelos complejos.

¿Cuándo utilizar técnicas supervisadas?

Es recomendable utilizar técnicas supervisadas cuando:

  • Existe una variable objetivo.
  • El problema es de clasificación.
  • Interesa maximizar la separación entre clases.
  • Se desea mejorar el rendimiento de un clasificador.
  • Se dispone de etiquetas fiables.

¿Cuándo utilizar técnicas no supervisadas?

Las técnicas no supervisadas resultan más adecuadas cuando:

  • No existen etiquetas.
  • Se realiza análisis exploratorio.
  • Se desea visualizar datos.
  • Se pretende reducir el ruido.
  • Se busca eliminar redundancia.
  • Se trabaja con grandes conjuntos de variables.

Ventajas y desventajas

Técnicas SupervisadasTécnicas No Supervisadas
Mejoran la separación entre clasesFuncionan sin etiquetas
Suelen mejorar la clasificaciónMuy útiles para exploración
Aprovechan información adicionalAplicables a cualquier conjunto de datos
Requieren datos etiquetadosNo optimizan la separación entre clases
No sirven para datos sin etiquetasPueden eliminar información útil para clasificación

Limitaciones

Ambos enfoques presentan ciertas limitaciones.

Técnicas supervisadas

  • Requieren datos etiquetados.
  • Dependen de la calidad de las etiquetas.
  • No pueden utilizarse en problemas no supervisados.
  • Pueden sobreajustarse si existen pocas observaciones.

Técnicas no supervisadas

  • No consideran la variable objetivo.
  • No garantizan mejorar la clasificación.
  • Algunas técnicas dificultan la interpretación.
  • Determinadas transformaciones pueden perder información relevante.

Comparación entre las principales técnicas

TécnicaSupervisadaObjetivo principalUso habitual
PCANoMaximizar la varianzaPreprocesamiento
ICANoSeparar componentes independientesProcesamiento de señales
t-SNENoVisualizaciónAnálisis exploratorio
UMAPNoVisualización y reducciónExploración y ML
LDASeparar clasesClasificación
PLSRelacionar variables con el objetivoRegresión y clasificación

¿Cuál elegir?

La elección depende principalmente del tipo de problema.

SituaciónTécnica recomendada
No existen etiquetasPCA, ICA, UMAP, t-SNE
Problemas de clasificaciónLDA
Visualización de datosUMAP o t-SNE
Compresión de datosPCA
Procesamiento de señalesICA
Datos dispersosTruncated SVD

No existe una técnica universalmente superior. La elección debe realizarse en función de los objetivos del análisis.

Aplicaciones en Data Science y Machine Learning

Las técnicas supervisadas y no supervisadas aparecen en numerosos ámbitos.

Entre sus aplicaciones destacan:

  • Clasificación.
  • Regresión.
  • Clustering.
  • Sistemas de recomendación.
  • Procesamiento del Lenguaje Natural (NLP).
  • Visión por computador.
  • Bioinformática.
  • Detección de fraude.
  • Detección de anomalías.
  • Visualización de datos de alta dimensión.
  • Compresión de información.

Buenas prácticas

Para seleccionar correctamente una técnica de reducción de dimensionalidad se recomienda:

  • Identificar si el problema dispone de una variable objetivo.
  • Utilizar técnicas supervisadas únicamente cuando existan etiquetas fiables.
  • Aplicar técnicas no supervisadas para exploración o compresión de datos.
  • Normalizar los datos cuando la técnica lo requiera.
  • Comparar varias técnicas antes de seleccionar una.
  • Evaluar el impacto sobre el rendimiento del modelo final.
  • Documentar el motivo por el que se ha elegido una técnica determinada.

Conclusión

La clasificación de las técnicas de reducción de la dimensionalidad en supervisadas y no supervisadas constituye uno de los criterios más importantes para seleccionar el método adecuado en un proyecto de Ciencia de Datos. Mientras que las técnicas supervisadas utilizan la información de la variable objetivo para construir representaciones que favorezcan la separación entre clases, las no supervisadas se centran en descubrir la estructura interna de los datos sin necesidad de etiquetas.

Comprender esta diferencia permite elegir herramientas como LDA cuando el objetivo es mejorar un modelo de clasificación, o recurrir a técnicas como PCA, ICA, t-SNE o UMAP cuando se desea reducir la dimensionalidad, explorar los datos o facilitar su visualización. La elección correcta dependerá siempre del problema, de la disponibilidad de etiquetas y de los objetivos del análisis.