Método del Rango Intercuartílico (IQR)

Escrito por

en

El Método del Rango Intercuartílico (Interquartile Range, IQR) es una de las técnicas estadísticas más utilizadas para detectar valores atípicos (outliers) en variables numéricas. Su popularidad se debe a su simplicidad, facilidad de interpretación y robustez frente a valores extremos, ya que basa sus cálculos en los cuartiles en lugar de utilizar la media y la desviación estándar.

Dentro de la fase de Data Preparation, el método IQR permite identificar observaciones que se encuentran significativamente alejadas del comportamiento habitual de los datos. Es especialmente útil durante el Análisis Exploratorio de Datos (EDA) y en los procesos iniciales de limpieza de datos, donde ayuda a detectar errores de captura, anomalías o casos excepcionales que pueden afectar al rendimiento de los modelos de Machine Learning.

Aunque se trata de una técnica relativamente sencilla, constituye una herramienta fundamental en Ciencia de Datos y suele ser el primer método aplicado antes de recurrir a algoritmos más complejos como Isolation Forest, Local Outlier Factor (LOF) o One-Class SVM.

¿Qué es el Método del Rango Intercuartílico (IQR)?

El método IQR es una técnica estadística que identifica valores atípicos utilizando la dispersión de la parte central de la distribución de los datos.

En lugar de analizar todos los valores, únicamente considera el 50 % central de la distribución, comprendido entre el primer y el tercer cuartil.

Los conceptos fundamentales son:

  • Primer cuartil (Q1): 25 % de los datos quedan por debajo.
  • Segundo cuartil (Q2): mediana.
  • Tercer cuartil (Q3): 75 % de los datos quedan por debajo.
  • Rango intercuartílico (IQR): diferencia entre Q3 y Q1.

Este enfoque hace que el método sea mucho menos sensible a valores extremos que otras técnicas basadas en la media.

Objetivos del método IQR

  • Detectar valores atípicos.
  • Analizar la dispersión de los datos.
  • Mejorar la calidad del conjunto de datos.
  • Facilitar el análisis exploratorio.
  • Identificar errores de captura.
  • Ayudar a decidir el tratamiento de los outliers.

Preguntas que debe responder

Antes de aplicar el método IQR conviene responder varias preguntas.

Sobre los datos

  • ¿Existen valores extremos?
  • ¿Qué porcentaje representan?
  • ¿En qué variables aparecen?

Sobre el análisis

  • ¿Los valores extremos corresponden a errores?
  • ¿Son observaciones reales?
  • ¿Conviene conservarlos?

Sobre el modelado

  • ¿Los algoritmos utilizados son sensibles a los outliers?
  • ¿Es necesario tratarlos antes del entrenamiento?
  • ¿Qué impacto tendrán sobre el modelo?

Responder a estas preguntas evita eliminar observaciones que puedan resultar valiosas.

Resultado esperado

Al finalizar el análisis mediante IQR debería disponerse de:

  • Valores Q1 y Q3.
  • Valor del IQR.
  • Límites inferior y superior.
  • Registros identificados como outliers.
  • Un informe de los valores extremos detectados.
  • Una estrategia de tratamiento documentada.

El objetivo del método no es eliminar automáticamente los valores extremos, sino identificarlos para facilitar su análisis.

Flujo de trabajo

Una estrategia habitual consiste en seguir el siguiente flujo.

  1. Seleccionar la variable numérica.
  2. Calcular Q1.
  3. Calcular Q3.
  4. Obtener el IQR.
  5. Calcular los límites inferior y superior.
  6. Detectar los valores situados fuera de esos límites.
  7. Analizar el origen de los outliers.
  8. Decidir el tratamiento adecuado.
  9. Validar el impacto sobre el conjunto de datos.

¿Cómo funciona?

El método utiliza los cuartiles para definir un rango considerado normal.

El procedimiento consiste en:

  1. Ordenar los datos.
  2. Calcular Q1.
  3. Calcular Q3.
  4. Obtener el Rango Intercuartílico.

La fórmula es:

IQR = Q3 − Q1

Posteriormente se calculan dos límites.

Límite inferior:

Q1 − 1.5 × IQR

Límite superior:

Q3 + 1.5 × IQR

Cualquier observación situada fuera de estos límites se considera un posible outlier. Es importante destacar que el factor 1.5 es una convención ampliamente aceptada, aunque puede modificarse según el contexto del problema.

Interpretación del IQR

El valor del IQR proporciona información sobre la dispersión del conjunto de datos.

  • IQR pequeño indica poca variabilidad.
  • IQR grande indica una elevada dispersión.
  • Valores fuera de los límites representan posibles observaciones atípicas.

No todos los outliers detectados deben eliminarse.

Ejemplo conceptual

Supongamos los siguientes salarios.

Salario (€)
24.000
26.000
28.000
31.000
33.000
35.000
38.000
250.000

El salario de 250.000 € aparece claramente alejado del resto. Aplicando el método IQR se identifica automáticamente como un posible valor atípico.

Sin embargo, antes de eliminarlo conviene comprobar si corresponde realmente al salario de un director ejecutivo o a un error de captura.

Ejemplo práctico

Consideremos la siguiente variable.

Edad
20
22
23
24
25
26
27
120

Después de calcular los cuartiles:

  • Q1 = 22.5
  • Q3 = 26.5
  • IQR = 4

Los límites serían:

  • Inferior = 16.5
  • Superior = 32.5

La edad de 120 años queda fuera del límite superior y se identifica como un posible outlier.

¿Por qué utilizar 1.5 × IQR?

El factor 1.5 fue propuesto por el estadístico John Tukey como una regla práctica para identificar observaciones inusuales sin asumir una distribución normal de los datos. En algunos casos también se utilizan otros factores.

FactorInterpretación
1.5 × IQROutliers moderados
3 × IQROutliers extremos

En proyectos de Ciencia de Datos suele utilizarse el factor 1.5.

Método IQR vs Z-Score

Ambos métodos son muy utilizados, aunque presentan diferencias importantes.

Método IQRZ-Score
Basado en cuartilesBasado en media y desviación estándar
No requiere normalidadFunciona mejor con distribuciones normales
Muy robusto frente a outliersSensible a valores extremos
Adecuado para distribuciones sesgadasMenos recomendable con fuerte asimetría
Fácil interpretaciónMayor fundamento estadístico

La elección depende de la naturaleza de los datos.

¿Cuándo utilizar el método IQR?

Resulta especialmente recomendable cuando:

  • Se trabaja con variables numéricas.
  • Existen distribuciones asimétricas.
  • Se realiza análisis exploratorio.
  • Se desconoce la distribución de los datos.
  • Se desea una técnica robusta y sencilla.
  • Se necesitan identificar rápidamente posibles anomalías.

Es uno de los primeros métodos que suelen aplicarse durante Data Preparation.

Ventajas y desventajas

VentajasDesventajas
Muy fácil de aplicarSolo funciona con variables numéricas
Robusto frente a valores extremosAnaliza una variable cada vez
No requiere normalidadNo detecta relaciones multivariantes
Muy utilizado en estadísticaPuede detectar demasiados outliers en distribuciones muy sesgadas
Excelente para EDAEl factor 1.5 puede no ser adecuado en todos los casos

Limitaciones

Aunque resulta muy útil, el método presenta algunas limitaciones.

  • Solo analiza variables individualmente.
  • No considera relaciones entre variables.
  • Puede generar falsos positivos.
  • No detecta anomalías contextuales.
  • No resulta adecuado para datos de alta dimensionalidad.
  • No sustituye a métodos multivariantes.

Por ello, suele combinarse con otras técnicas cuando los datos son complejos.

Implementación en Python

Python permite implementar el método IQR de forma muy sencilla mediante Pandas.

Calcular los cuartiles

Q1 = df["salario"].quantile(0.25)
Q3 = df["salario"].quantile(0.75)

Calcular el IQR

IQR = Q3 - Q1

Calcular los límites

limite_inferior = Q1 - 1.5 * IQR
limite_superior = Q3 + 1.5 * IQR

Detectar los outliers

outliers = df[
    (df["salario"] < limite_inferior) |
    (df["salario"] > limite_superior)
]

Contar el número de outliers

print(len(outliers))

Visualizar mediante Boxplot

import matplotlib.pyplot as plt

plt.boxplot(df["salario"])
plt.show()

Eliminar los valores atípicos

df_limpio = df[
    (df["salario"] >= limite_inferior) &
    (df["salario"] <= limite_superior)
]

Estos ejemplos representan la implementación básica del método IQR. En proyectos reales, la detección suele combinarse con una revisión manual o con reglas de negocio antes de decidir si los valores identificados deben eliminarse, transformarse o conservarse.

Buenas prácticas

Para utilizar correctamente el método IQR se recomienda:

  • Analizar siempre el origen de los valores detectados antes de eliminarlos.
  • Aplicar el método únicamente sobre variables numéricas.
  • Complementar el análisis con visualizaciones como histogramas y diagramas de caja.
  • No asumir que todos los outliers son errores; algunos pueden representar eventos relevantes para el negocio.
  • Combinar el IQR con otros métodos cuando existan múltiples variables o relaciones complejas.
  • Documentar los criterios utilizados para detectar y tratar los valores atípicos.
  • Validar el efecto del tratamiento sobre el rendimiento del modelo.
  • Conservar una copia del conjunto de datos original para garantizar la trazabilidad.