Correlation Matrix
Correlation Matrix
Qué es
Heatmap especializado donde cada celda muestra el coeficiente de correlación entre dos variables. Permite explorar todas las relaciones entre múltiples variables simultáneamente.
Para qué sirve
Para el análisis exploratorio de datasets con múltiples variables numéricas: qué pares de variables están correlacionados y en qué dirección.
Cómo leerlo
Anatomía
La celda coloreada para representar correlación entre dos variables es una técnica bien establecida en estadística exploratoria; el aporte más influyente sobre este formato específico no fue la celda en sí, sino la regla de reordenar filas y columnas mediante clustering jerárquico para que las variables "parecidas" queden adyacentes: en cualquier tabla o gráfico, las variables sin un orden natural deberían ordenarse según lo que se quiere mostrar u observar, no dejarse en el orden alfabético o de llegada en que aparecen en la base de datos original. La matriz se refleja siempre sobre su diagonal, y el color codifica tanto el signo como la fuerza de cada correlación.
Por qué funciona
Fundamento perceptivo
Presenta n(n-1)/2 relaciones en una sola visualización. Permite identificar multicolinealidad y grupos de variables relacionadas de un vistazo.
Errores comunes
Correlación no es causalidad
documenta siempre el método usado (Pearson, Spearman) y el tamaño de muestra, porque las correlaciones altas pueden ser espurias.
Dónde se usa
Contextos de aplicación

Exploración de variables de un dataset
Todas las correlaciones por pares antes de modelar.

Relación entre métricas de negocio
Qué indicadores se mueven juntos y cuáles son independientes.

Investigación multivariada
La matriz simétrica resume la estructura de dependencia de un estudio.
Cómo construirlo
El mismo gráfico, en 11 librerías open source
Cada librería resuelve las mismas decisiones de diseño, como la escala, el espaciado entre barras o la inserción de la etiqueta de valor, de un modo distinto. Algunas las automatizan; otras las dejan explícitas en el código, a criterio de quien lo escribe. Comparar once implementaciones con los mismos datos y el mismo color de marca aísla esa diferencia, que de otro modo queda oculta detrás de estilos visuales distintos.
imshow() sigue siendo la base, con un bucle a mano para escribir el coeficiente encima de cada celda —sns.heatmap(annot=True) hace exactamente esto mismo en un solo parámetro.
import matplotlib.pyplot as plt
import numpy as np
labels = ["Pobreza", "Desempleo", "Informalidad"]
matriz = np.array([[1.0, 0.296, 0.826], [0.296, 1.0, 0.024], [0.826, 0.024, 1.0]])
# imshow() sigue siendo la base, con un bucle a mano para escribir el
# coeficiente encima de cada celda -- sns.heatmap(annot=True) hace
# exactamente esto mismo en un solo parametro (ver seaborn).
fig, ax = plt.subplots(figsize=(4.6, 4))
im = ax.imshow(matriz, cmap="Reds", vmin=0, vmax=1)
ax.set_xticks(range(3)); ax.set_xticklabels(labels); ax.xaxis.tick_top()
ax.set_yticks(range(3)); ax.set_yticklabels(labels)
for i in range(3):
for j in range(3):
v = matriz[i, j]
ax.text(j, i, f"{v:.2f}", ha="center", va="center", color="white" if v > 0.5 else "black")
plt.show()Herramientas para construirlo
No-code, desktop y plataformas web, con su licencia visible, abierta o comercial.
Términos relacionados
Con datos reales
Ejemplos de uso.
Pobreza e informalidad laboral van de la mano en las regiones de Chile
Correlación entre pobreza, desempleo e informalidad, 16 regiones de Chile.
Fuente: CASEN 2024 (MDSF) y BCN, en base a Banco Central e INE
Gráficos relacionados