El Método del Rango Intercuartílico (Interquartile Range, IQR) es una de las técnicas estadísticas más utilizadas para detectar valores atípicos (outliers) en variables numéricas. Su popularidad se debe a su simplicidad, facilidad de interpretación y robustez frente a valores extremos, ya que basa sus cálculos en los cuartiles en lugar de utilizar la media y la desviación estándar.
Dentro de la fase de Data Preparation, el método IQR permite identificar observaciones que se encuentran significativamente alejadas del comportamiento habitual de los datos. Es especialmente útil durante el Análisis Exploratorio de Datos (EDA) y en los procesos iniciales de limpieza de datos, donde ayuda a detectar errores de captura, anomalías o casos excepcionales que pueden afectar al rendimiento de los modelos de Machine Learning.
Aunque se trata de una técnica relativamente sencilla, constituye una herramienta fundamental en Ciencia de Datos y suele ser el primer método aplicado antes de recurrir a algoritmos más complejos como Isolation Forest, Local Outlier Factor (LOF) o One-Class SVM.
¿Qué es el Método del Rango Intercuartílico (IQR)?
El método IQR es una técnica estadística que identifica valores atípicos utilizando la dispersión de la parte central de la distribución de los datos.
En lugar de analizar todos los valores, únicamente considera el 50 % central de la distribución, comprendido entre el primer y el tercer cuartil.
Los conceptos fundamentales son:
- Primer cuartil (Q1): 25 % de los datos quedan por debajo.
- Segundo cuartil (Q2): mediana.
- Tercer cuartil (Q3): 75 % de los datos quedan por debajo.
- Rango intercuartílico (IQR): diferencia entre Q3 y Q1.
Este enfoque hace que el método sea mucho menos sensible a valores extremos que otras técnicas basadas en la media.

Objetivos del método IQR
- Detectar valores atípicos.
- Analizar la dispersión de los datos.
- Mejorar la calidad del conjunto de datos.
- Facilitar el análisis exploratorio.
- Identificar errores de captura.
- Ayudar a decidir el tratamiento de los outliers.
Preguntas que debe responder
Antes de aplicar el método IQR conviene responder varias preguntas.
Sobre los datos
- ¿Existen valores extremos?
- ¿Qué porcentaje representan?
- ¿En qué variables aparecen?
Sobre el análisis
- ¿Los valores extremos corresponden a errores?
- ¿Son observaciones reales?
- ¿Conviene conservarlos?
Sobre el modelado
- ¿Los algoritmos utilizados son sensibles a los outliers?
- ¿Es necesario tratarlos antes del entrenamiento?
- ¿Qué impacto tendrán sobre el modelo?
Responder a estas preguntas evita eliminar observaciones que puedan resultar valiosas.
Resultado esperado
Al finalizar el análisis mediante IQR debería disponerse de:
- Valores Q1 y Q3.
- Valor del IQR.
- Límites inferior y superior.
- Registros identificados como outliers.
- Un informe de los valores extremos detectados.
- Una estrategia de tratamiento documentada.
El objetivo del método no es eliminar automáticamente los valores extremos, sino identificarlos para facilitar su análisis.
Flujo de trabajo
Una estrategia habitual consiste en seguir el siguiente flujo.
- Seleccionar la variable numérica.
- Calcular Q1.
- Calcular Q3.
- Obtener el IQR.
- Calcular los límites inferior y superior.
- Detectar los valores situados fuera de esos límites.
- Analizar el origen de los outliers.
- Decidir el tratamiento adecuado.
- Validar el impacto sobre el conjunto de datos.
¿Cómo funciona?
El método utiliza los cuartiles para definir un rango considerado normal.
El procedimiento consiste en:
- Ordenar los datos.
- Calcular Q1.
- Calcular Q3.
- Obtener el Rango Intercuartílico.
La fórmula es:
IQR = Q3 − Q1
Posteriormente se calculan dos límites.
Límite inferior:
Q1 − 1.5 × IQR
Límite superior:
Q3 + 1.5 × IQR
Cualquier observación situada fuera de estos límites se considera un posible outlier. Es importante destacar que el factor 1.5 es una convención ampliamente aceptada, aunque puede modificarse según el contexto del problema.
Interpretación del IQR
El valor del IQR proporciona información sobre la dispersión del conjunto de datos.
- IQR pequeño indica poca variabilidad.
- IQR grande indica una elevada dispersión.
- Valores fuera de los límites representan posibles observaciones atípicas.
No todos los outliers detectados deben eliminarse.
Ejemplo conceptual
Supongamos los siguientes salarios.
| Salario (€) |
|---|
| 24.000 |
| 26.000 |
| 28.000 |
| 31.000 |
| 33.000 |
| 35.000 |
| 38.000 |
| 250.000 |
El salario de 250.000 € aparece claramente alejado del resto. Aplicando el método IQR se identifica automáticamente como un posible valor atípico.
Sin embargo, antes de eliminarlo conviene comprobar si corresponde realmente al salario de un director ejecutivo o a un error de captura.
Ejemplo práctico
Consideremos la siguiente variable.
| Edad |
|---|
| 20 |
| 22 |
| 23 |
| 24 |
| 25 |
| 26 |
| 27 |
| 120 |
Después de calcular los cuartiles:
- Q1 = 22.5
- Q3 = 26.5
- IQR = 4
Los límites serían:
- Inferior = 16.5
- Superior = 32.5
La edad de 120 años queda fuera del límite superior y se identifica como un posible outlier.
¿Por qué utilizar 1.5 × IQR?
El factor 1.5 fue propuesto por el estadístico John Tukey como una regla práctica para identificar observaciones inusuales sin asumir una distribución normal de los datos. En algunos casos también se utilizan otros factores.
| Factor | Interpretación |
|---|---|
| 1.5 × IQR | Outliers moderados |
| 3 × IQR | Outliers extremos |
En proyectos de Ciencia de Datos suele utilizarse el factor 1.5.
Método IQR vs Z-Score
Ambos métodos son muy utilizados, aunque presentan diferencias importantes.
| Método IQR | Z-Score |
|---|---|
| Basado en cuartiles | Basado en media y desviación estándar |
| No requiere normalidad | Funciona mejor con distribuciones normales |
| Muy robusto frente a outliers | Sensible a valores extremos |
| Adecuado para distribuciones sesgadas | Menos recomendable con fuerte asimetría |
| Fácil interpretación | Mayor fundamento estadístico |
La elección depende de la naturaleza de los datos.
¿Cuándo utilizar el método IQR?
Resulta especialmente recomendable cuando:
- Se trabaja con variables numéricas.
- Existen distribuciones asimétricas.
- Se realiza análisis exploratorio.
- Se desconoce la distribución de los datos.
- Se desea una técnica robusta y sencilla.
- Se necesitan identificar rápidamente posibles anomalías.
Es uno de los primeros métodos que suelen aplicarse durante Data Preparation.
Ventajas y desventajas
| Ventajas | Desventajas |
|---|---|
| Muy fácil de aplicar | Solo funciona con variables numéricas |
| Robusto frente a valores extremos | Analiza una variable cada vez |
| No requiere normalidad | No detecta relaciones multivariantes |
| Muy utilizado en estadística | Puede detectar demasiados outliers en distribuciones muy sesgadas |
| Excelente para EDA | El factor 1.5 puede no ser adecuado en todos los casos |
Limitaciones
Aunque resulta muy útil, el método presenta algunas limitaciones.
- Solo analiza variables individualmente.
- No considera relaciones entre variables.
- Puede generar falsos positivos.
- No detecta anomalías contextuales.
- No resulta adecuado para datos de alta dimensionalidad.
- No sustituye a métodos multivariantes.
Por ello, suele combinarse con otras técnicas cuando los datos son complejos.
Implementación en Python
Python permite implementar el método IQR de forma muy sencilla mediante Pandas.
Calcular los cuartiles
Q1 = df["salario"].quantile(0.25)
Q3 = df["salario"].quantile(0.75)Calcular el IQR
IQR = Q3 - Q1Calcular los límites
limite_inferior = Q1 - 1.5 * IQR
limite_superior = Q3 + 1.5 * IQRDetectar los outliers
outliers = df[
(df["salario"] < limite_inferior) |
(df["salario"] > limite_superior)
]Contar el número de outliers
print(len(outliers))Visualizar mediante Boxplot
import matplotlib.pyplot as plt
plt.boxplot(df["salario"])
plt.show()
Eliminar los valores atípicos
df_limpio = df[
(df["salario"] >= limite_inferior) &
(df["salario"] <= limite_superior)
]Estos ejemplos representan la implementación básica del método IQR. En proyectos reales, la detección suele combinarse con una revisión manual o con reglas de negocio antes de decidir si los valores identificados deben eliminarse, transformarse o conservarse.
Buenas prácticas
Para utilizar correctamente el método IQR se recomienda:
- Analizar siempre el origen de los valores detectados antes de eliminarlos.
- Aplicar el método únicamente sobre variables numéricas.
- Complementar el análisis con visualizaciones como histogramas y diagramas de caja.
- No asumir que todos los outliers son errores; algunos pueden representar eventos relevantes para el negocio.
- Combinar el IQR con otros métodos cuando existan múltiples variables o relaciones complejas.
- Documentar los criterios utilizados para detectar y tratar los valores atípicos.
- Validar el efecto del tratamiento sobre el rendimiento del modelo.
- Conservar una copia del conjunto de datos original para garantizar la trazabilidad.