Necesita ajustar X e Y para el factor de confusión
El primer enfoque (usando regresión múltiple) siempre es correcto. Su segundo enfoque no es correcto como lo ha indicado, pero puede hacerse casi correcto con un ligero cambio. Para hacer el segundo enfoque correcto, es necesario retroceder tanto y por separado en . Me gusta escribir para los residuos de la regresión de en y para los residuos de la regresión de y . Podemos interpretar como ajustado para (igual que su ) y comoYXZY. ZYZX. ZXZY.ZYZRX.ZXajustado para . A continuación, puede retroceder en .ZY.ZX.Z
Con este cambio, los dos enfoques darán el mismo coeficiente de regresión y los mismos residuos. Sin embargo, el segundo enfoque seguirá calculando incorrectamente los grados residuales de libertad como lugar de (donde es el número de valores de datos para cada variable). Como resultado, el estadístico de prueba para del segundo enfoque será un poco demasiado grande y el valor p será un poco demasiado pequeño. Si el número de observaciones es grande, entonces los dos enfoques convergerán y esta diferencia no importará.n−1n−2nXn
Es fácil ver por qué los grados residuales de libertad del segundo enfoque no serán del todo correctos. Ambos enfoques regresión tanto en y . El primer enfoque lo hace en un solo paso, mientras que el segundo enfoque lo hace en dos pasos. Sin embargo, el segundo enfoque "olvida" que resultó de una regresión en y por lo tanto descuida restar el grado de libertad para esta variable.YXZY.ZZ
El diagrama variable agregado
Sanford Weisberg (Regresión lineal aplicada, 1985) solía recomendar trazar vs en un diagrama de dispersión. Esto se denomina una trama variable de agregado , y se la dio una representación visual eficaz de la relación entre y después de ajustar por .Y.ZX.ZYXZ
Si no ajusta X, entonces subestima el coeficiente de regresión
El segundo enfoque como lo dijo originalmente, que regresa a en , es demasiado conservador. Subestimará la importancia de la relación entre y ajustando para porque subestima el tamaño del coeficiente de regresión. Esto se produce porque está en regresión en el conjunto de en lugar de sólo en la parte de que es independiente de . En la fórmula estándar para el coeficiente de regresión en regresión lineal simple, el numerador (covarianza de con ) será correcto pero el denominador (la varianza deY.ZXYXZY.ZXXZY.ZXX) será demasiado grande. La covariable correcta siempre tiene una varianza menor que hace .X.ZX
Para hacer este preciso, su Método 2 voluntad bajo-estimar el coeficiente de regresión parcial para en un factor de donde es el coeficiente de correlación de Pearson entre y .X1−r2rXZ
Un ejemplo numérico
Aquí hay un pequeño ejemplo numérico para mostrar que el método de la variable agregada representa el coeficiente de regresión de en correctamente, mientras que su segundo enfoque (Método 2) puede ser arbitrariamente incorrecto.YX
Primero simulamos , e :XZY
> set.seed(20180525)
> Z <- 10*rnorm(10)
> X <- Z+rnorm(10)
> Y <- X+Z
Aquí entonces los verdaderos coeficientes de regresión para y son ambos 1 y la intersección es 0.Y=X+ZXZ
Luego formamos los dos vectores residuales (igual que mi ) y :RY.ZX.Z
> R <- Y.Z <- residuals(lm(Y~Z))
> X.Z <- residuals(lm(X~Z))
La regresión múltiple completa con e como predictores da exactamente los coeficientes de regresión verdaderos:XY
> coef(lm(Y~X+Z))
(Intercept) X Z
5.62e-16 1.00e+00 1.00e+00
El enfoque variable agregado (Método 3) también da el coeficiente para exactamente correcto:X
> coef(lm(R~X.Z))
(Intercept) X.Z
-6.14e-17 1.00e+00
Por el contrario, su Método 2 encuentra que el coeficiente de regresión es solo 0.01:
> coef(lm(R~X))
(Intercept) X
0.00121 0.01170
Por lo tanto, su Método 2 subestima el verdadero tamaño del efecto en un 99%. El factor de subestimación viene dado por la correlación entre y :XZ
> 1-cor(X,Z)^2
[1] 0.0117
Para ver todo esto visualmente, la gráfica variable agregada de vs muestra una relación lineal perfecta con la unidad de pendiente, que representa la verdadera relación marginal entre y :RX.ZYX

Por el contrario, la gráfica de frente a la no ajustada no muestra ninguna relación. La verdadera relación se ha perdido por completo:RX
