Nube en el plano: covarianza 2×2, vectores propios PC1 y PC2 desde la media, perpendiculares a la recta PC1 y franja de puntuaciones sobre la primera componente.
Sobre el modelo
El análisis de componentes principales en el plano empieza por centrar los datos. La matriz de covarianza 2×2 de los puntos centrados es simétrica y semidefinida positiva; sus vectores propios son direcciones mutuamente perpendiculares de máxima varianza, ordenadas por los valores propios λ₁ ≥ λ₂ ≥ 0. PC1 es la recta por la media a lo largo de la cual la proyección ortogonal conserva la mayor fracción de varianza; PC2 es perpendicular y se lleva el resto. La puntuación de un punto sobre PC1 es el producto escalar (p − μ)·v₁ con el vector propio unitario, es decir, la coordenada al proyectar sobre el subespacio unidimensional. En pantalla: la media, flechas de longitud del orden de √λ, perpendiculares de los puntos a la recta PC1 y la franja inferior de esas mismas puntuaciones. La covarianza se calcula con divisor n.
Para quién: Álgebra lineal y estadística: vectores propios de la covarianza, proyección, varianza explicada.
Conceptos clave
análisis de componentes principales
matriz de covarianza
vector propio
valor propio
centrado
proyección ortogonal
varianza explicada
aproximación de rango 1
Cómo funciona
Tras el centrado se arma la covarianza 2×2; los vectores propios son PC1 (máximo de varianza) y PC2. La puntuación sobre PC1 es (p − μ)·v₁ y es la coordenada de la proyección ortogonal sobre la recta PC1. La franja de abajo son esos mismos valores sobre un eje; las flechas se escalan más o menos como √λ.
Preguntas frecuentes
¿Por qué giran las flechas si se mueve un punto lejano?
El análisis de componentes principales es global: la covarianza depende de todos los puntos. Un atípico fuerte puede torcer la elipse de inercia y cambiar ambas direcciones propias. Hay variantes robustas; aquí no se muestran.
¿Aquí el divisor es n o n−1?
El divisor n es más simple para muestras chicas y gráficas de aula. El orden de las componentes principales es el mismo; las λ absolutas difieren de la variante n−1 por un factor constante.
¿Qué muestra la franja de abajo?
Las mismas puntuaciones (p − μ)·v₁ que la proyección ortogonal sobre la recta PC1. El signo coincide con la flecha de la primera componente: es la misma nube en una dimensión.