2-Modelos Lineales

Modelos lineales: Regresion, ANOVA y ANCOVA
Luis Cayuela Septiembre de 2011
Area de Biodiversidad y Conservacin, Universidad Rey Juan Carlos, o Departamental 1 DI. 231, c/ Tulipn s/n. E-28933 Mstoles (Madrid), a o Espaa. E-mail: luis.cayuela@urjc.es. n
Modelos lineales: Regresin, ANOVA y ANCOVA (versin o o 1.4)

Publicado por: Luis Cayuela
Se autoriza a cualquier persona a utilizar, copiar, distribuir y modicar esta obra con las siguientes condiciones: (1) que se reconozca la autor de la misma; a (2) que no se utilice con nes comerciales; y (3) que si se altera la obra original, el trabajo resultante sea distribuido bajo una licencia similar a sta. e
Para cualquier comentario o sugerencia por favor remitirse al autor de la obra.
Indice
1. Conceptos estad sticos bsicos a 2. Cosas importantes antes de empezar 3. Regresin simple o 3.1. Como ajustar un modelo lineal en R . . . . . . . . . . . . . . . . 3.2. Fundamentos tericos del clculo e interpretacin de los parmeto a o a ros de la recta de regresin . . . . . . . . . . . . . . . . . . . . . o 3.2.1. Ajustar los datos a un modelo lineal . . . . . . . . . . . . 3.2.2. Varianzas y covarianzas . . . . . . . . . . . . . . . . . . . 3.2.3. Estimadores por m nimos cuadrados . . . . . . . . . . . . 3.2.4. Componentes de la varianza y el coeciente de determinacin . . . . . . . . . . . . . . . . . . . . . . . . . . . . . o 3.2.5. Test de hiptesis . . . . . . . . . . . . . . . . . . . . . . . o 4 5 6 6 9 9 11 12 14 15
3.3. Evaluacin de los supuestos del modelo: Exploracin de los residuos 17 o o 3.4. Ejercicios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4. Anlisis de la varianza (ANOVA) a 4.1. Cambio del nivel de referencia en los contrastes de los niveles del factor . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4.2. Ejercicios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5. Anlisis de la covarianza (ANCOVA) a 5.1. Homogeneidad de pendientes . . . . . . . . . . . . . . . . . . . . 5.2. Qu ocurre si la interaccin es signicativa? . . . . . . . . . . . e o 5.3. Ejercicios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6. Problemas de colinealidad: Reduccin de variables o 7. Sumas de cuadrados de tipo I y III 7.1. Cundo usar una u otra? . . . . . . . . . . . . . . . . . . . . . . a 7.2. Especicar diferentes sumas de cuadrados en R . . . . . . . . . . 8. Referencias 19 19 24 25 25 28 30 31 32 34 34 35 36
Luis Cayuela
Modelos lineales
1.
Conceptos estad sticos bsicos a
Qu es una regresin? Y un ANOVA? Cul es la principal diferencia entre e o a ambos? Qu supuestos estad e sticos debemos asumir cuando llevemos a cabo este tipo de anlisis? Estas y otras preguntas son cr a ticas en la aplicacin de o modelos lineales a la resolucin de problemas estad o sticos. Por ello, la primera parte de esta sesin la dedicaremos a aclarar dichos conceptos. o El anlisis de regresin se usa para explicar o modelar la relacin entre una a o o variable continua Y, llamada variable respuesta o variable dependiente, y una o ms variables continuas X1,.....,Xp, llamadas variables explicativas o a independientes. Cuando p = 1, se denomina regresin simple y cuando p > 1 o se denomina regresin mltiple. Cuando hay ms de una variable respuesta Y, o u a entonces el anlisis se denomina regresin mltiple multivariada. Cuando las Y a o u son totalmente independientes entre s entonces hacer una regresin mltiple , o u multivariada ser el equivalente a realizar tantas regresiones mltiples a u univariadas como Ys haya. Si la(s) variable(s) explicativas son categricas en vez de continuas entonces o nos enfrentamos ante un caso t pico de anlisis de la varianza o ANOVA a (ADEVA en espaol). Al igual que antes, si p = 1, el anlisis se denomina n a ANOVA unifactorial, mientras que si p > 1 el anlisis se denomina ANOVA a multifactorial. Si en vez de una variable respuesta continua tenemos dos o ms a Y, entonces el anlisis se denomina ANOVA multivariado (MANOVA) de uno a o varios factores. Este tipo de anlisis tambin queda fuera del mbito de esta a e a sesin. o Por ultimo, es posible que en el mismo anlisis aparezcan tanto variables a explicativas continuas como categricas, y en este caso el anlisis pasar a o a a denominarse anlisis de la covarianza o ANCOVA. Aqu ya no har a amos distincin entre unico o mltiple ya que este anlisis se compone siempre de, al o u a menos, dos variables explicativas (una continua y una categrica). o A pesar de la abundancia de terminolog todos estos modelos caen dentro de a, la categor de modelos lineales. En esta sesin nos centraremos unicamente en a o las tcnicas univariadas (regresin, ANOVA y ANCOVA). En R todos los e o anlisis univariados de este tipo se ajustan utilizando una unica funcin, la a o funcin lm(), ya que la forma de ajustar cualquiera de estos modelos es o idntica, independientemente de que tengamos una o ms variables e a explicativas y de que stas sean continuas o categricas. e o
Luis Cayuela
Modelos lineales
Figura 1: Esquema conceptual de los pasos que deben seguirse a la hora de ajustar un modelo lineal univariante.
Sin entrar en muchos detalles, cabe recordar que los modelos lineales se basan en una serie de supuestos, algunos de los cuales pueden y deben comprobarse una vez ajustado el modelo. Estos son: 1. Independencia. Los sujetos muestrales y, por tanto, los residuos del modelo, son independientes entre s . 2. Linealidad. La respuesta de Y frente a X es lineal. 3. Normalidad. Los residuos del modelo son normales, es decir, siguen una distribucin de tipo gaussiana (campana de Gauss). o 4. Homocedasticidad. La varianza residual tiene que ser constante.
2.
Cosas importantes antes de empezar
La estad stica comienza con un problema, continua con la recogida de datos, y termina con el anlisis de los mismos, lo que conduce a unas conclusiones sobre a 5
Luis Cayuela
Modelos lineales
las hiptesis de partida. Es un error muy comn enredarse en anlisis muy o u a complejos sin prestar atencin a los objetivos que se persiguen, a la pregunta o que se quiere contestar, o incluso a si los datos de los que se dispone son los apropiados para el anlisis propuesto. Para formular el problema a correctamente uno debe: 1. Comprender el problema de fondo y su contexto. 2. Comprender bien el objetivo u objetivos del estudio. Hay que tener cuidado con los anlisis no dirigidos. Si buscas lo suciente siempre a encontrars algn tipo de relacin entre variables, pero puede que esta a u o relacin no sea ms que una coincidencia. o a 3. Plantear el problema en trminos estad e sticos. Este es uno de los pasos ms dif a ciles e implica la formulacin de hiptesis y modelos. Una vez o o que el problema ha sido traducido al lenguaje de la estad stica, la solucin suele ser rutinaria. o 4. Entender bien los datos. Son datos observacionales o experimentales? Hay valores faltantes? Cmo estn representadas las variables o a cualitativas? Cules son las unidades de medida? Hay algn error en a u los datos? Por todo ello, es importante revisar bien los datos y llevar a cabo algn anlisis preliminar para detectar anomal en los mismos. u a as
3.
3.1.
Regresin simple o
Como ajustar un modelo lineal en R
Una vez que tenemos el problema formulado y los datos recogidos, ajustar un modelo lineal es muy, muy sencillo en R. La funcin lm() nos permite ajustar o el modelo especicado. La forma ms comn de especicar el modelo es a u utilizando el operador para indicar que la respuesta Y es modelada por un predictor lineal denido por X1,...,Xn. Tomemos como ejemplo la base de datos cars, que contiene la velocidad de 50 coches (millas/hora) y la distancia (pies) que les lleva frenar (ojo! son datos de los aos 20!). n > data(cars) > lm.cars <- lm(dist ~ speed, data = cars) Ahora ya tenemos un objeto, llamado lm.cars, que contiene el modelo lineal ajustado, en dnde la distancia de frenado ser una funcin de la velocidad de o a o los mismos. Si utilizamos la funcin str() veremos que este nuevo objeto tiene, o en apariencia, una estructura muy compleja. Esto no debe asustarnos. El objeto creado contiene en realidad toda la informacin referente al modelo o ajustado, como los coecientes del modelo, la varianza explicada, los valores de los residuos, etc. Podemos acceder a esta informacin utilizando el operador $ o de manera similar a cmo acced o amos a las variables de un arreglo de datos (p.e. lm.cars$tted.values). Sin embargo, resulta mucho ms fcil obtener los a a resultados del modelo utilizando la funcin summary(). o 6
Luis Cayuela
Modelos lineales
> summary(lm.cars) Call: lm(formula = dist ~ speed, data = cars) Residuals: Min 1Q -29.069 -9.525
Median -2.272
3Q 9.215
Max 43.201
Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) -17.5791 6.7584 -2.601 0.0123 * speed 3.9324 0.4155 9.464 1.49e-12 *** --Signif. codes: 0 *** 0.001 ** 0.01 * 0.05 . 0.1 1 Residual standard error: 15.38 on 48 degrees of freedom Multiple R-squared: 0.6511, Adjusted R-squared: 0.6438 F-statistic: 89.57 on 1 and 48 DF, p-value: 1.490e-12 Aqu podemos ver muchas de las cosas que nos interesan para responder a nuestra pregunta. En primer lugar tenemos los coecientes del modelo ajustado y su signicacin (Pr(>|t|)). El modelo no slo tiene un coeciente o o que modela la relacin lineal entre la variable respuesta (dist) y la variable o explicativa (speed), sino que adems tiene una constante, que es lo que R a denomina Intercept o punto de corte con el eje Y, es decir el valor que toma Y cuando X = 0. Si este valor no es muy distinto de 0 entonces el Intercept suele no ser signicativo1 . En este caso, s es signicativo y toma un valor de -17.5791. Esto indicar tericamente que cuando la velocidad del coche es 0, a o su distancia de frenado es -17.5791 pies, si bien como todos sabemos, esta aseveracin no tiene sentido alguno. El problema est en los supuestos de los o a modelos lineales, ya que la relacin entre muchas variables es lineal slo en un o o determinado rango de los valores de X y no puede extrapolarse ms all de a a estos valores, tal es el caso de nuestro ejemplo. Para representar grcamente a la recta de regresin, podemos usar la funcin grca de bajo nivel abline(). o o a
1 La signicacin es un valor que nos indica con que probabilidad la relacin observada es o o distinta de la hiptesis nula (en este ejemplo la hiptesis nula ser que el punto de corte con o o a el eje Y es cero) .
Luis Cayuela
Modelos lineales
> plot(cars$dist ~ cars$speed, xlab = "Velocidad", ylab = "Distancia de frenado") > abline(lm.cars)
120
100
q q
Distancia de frenado
80
q q q q q q q q q q q q q q q q q q q q q q q q q q q q q q q q q q q q q q
40
60
20
q q q q q q
10
15 Velocidad
20
25
Ms all de la interpretacin que hagamos de la constante, lo que interesar a a o a ms ser la signicacin de la variable explicativa speed, que en este caso a a o concreto toma un valor muy bajo (Pr(>|t|) = 1.49e-12). Esto signica que hay una probabilidad muy baja de que el coeciente estimado de speed en el modelo lineal est dentro de una distribucin aleatoria de valores nulos, es e o decir, de coecientes obtenidos aleatoriamente pero que en realidad no son distintos de cero. Por tanto rechazar amos la hiptesis nula de que este o coeciente es cero. Por ultimo, interesa ver el coeciente de determinacin del modelo o R2 . Este o coeciente indica la cantidad de variabilidad explicada por el modelo. Cuanto mayor sea este coeciente ms predecible es la variable respuesta en funcin de a o la variable o variables explicativas. El R2 ajustado corrige el R2 por el nmero u de parmetros (variables explicativas) del modelo ya que, en general, cuantas a ms variables explicativas estn incluidas en el modelo, mayor es el R2 , a e independientemente de que dichas variables sean o no relevantes para el modelo. En nuestro modelo, el R2 corregido es 0.6438, lo que signica que el 64 % de la variabilidad de la distancia de frenado se puede explicar por la velocidad a la que va el coche.
Luis Cayuela
Modelos lineales
3.2.
Fundamentos tericos del clculo e interpretacin de o a o los parmetros de la recta de regresin a o
El ajuste de un modelo de regresin comienza por el planteamiento de una o hiptesis sobre causa y efecto: el valor de la variable X causa, directa o o indirectamente, el valor de la variable Y. En algunos casos, la direccionalidad de la causa y el efecto es muy clara -nosotros hipotetizamos que la distancia de frenado de un coche depende de su velocidad y no al revs. En otros casos, la e direccin de la causa y el efecto no es tan obvia -controlan los predadores la o abundancia de las presas, o es la abundancia de las presas la que controla la abundancia de los predadores? Una vez que hemos tomado una decisin sobre la direccin de la causa y el o o efecto, el siguiente paso es describir la relacin como una funcin matemtica: o o a Y = f (X) En otras palabras, aplicaremos una funcin a cada valor de la variable X (el o input) para generar un valor correspondiente de Y (el output). Hay muchas y muy complejas formas de describir matemticamente la relacin entre dos a o variables, pero una de las ms sencillas es que Y sea una funcin linear de X: a o Y = 0 + 1 X Esta funcin dice que tomes el valor de la variable X, lo multipliques por 1 , y o se lo aadas a 0 . El resultado de esto es el valor de la variable Y. Esta n ecuacin describe la grca de una l o a nea recta (ver la grca en el apartado a 3.1). El modelo tiene dos parmetros 0 y 1 , que se denominan intercepto y a pendiente respectivamente. El intercepto (0 ) es el valor de la funcin cuando o X=0. El intercepto se mide en las mismas unidades que la variable Y. La pendiente (1 ) mide el cambio en la variable Y por cada unidad de cambio en la variable X. La pendiente es por tanto un ratio y se mide en unidades Y / X. Si se conoce el valor de la pendiente y el intercepto, se puede calcular cualquier valor de Y para cualquier valor conocido de X. 3.2.1. Ajustar los datos a un modelo lineal
Los datos en un anlisis de regresin consisten en una serie de observaciones a o pareadas. Cada observacin incluye un valor para la variable X y un valor para o la correspondiente variable Y, que tienen que ser medidos necesariamente sobre la misma muestra (rplica). En nuestro ejemplo, estos datos estn recogidos en e a el arreglo de datos cars. El sub ndice i indica el nmero de la rplica o u e muestra. Si hay un total de n rplicas en nuestros datos, el sub e ndice i puede tomar cualquier valor desde i = 1 a n. El modelo que ajustaremos ser a entonces el siguiente: Yi = 0 + 1 Xi + i
Luis Cayuela
Modelos lineales
Los dos parmetros 0 y 1 son desconocidos. Pero hay tambin otro a e parmetro desconocido, i , que representa el trmino error. Mientras que 0 y a e 1 son constantes en el modelo, i es una variable aleatoria que sigue una distribucin normal. Esta distribucin tiene un valor esperado (media) de 0, y o o una varianza equivalente a 2 , que puede ser conocida o desconocida. Si todos nuestros datos caen perfectamente a lo largo de una unica l nea recta, entonces la 2 = 0, y ser una cuestin fcil conectar todos los puntos y medir el a o a intercepto (0 ) y la pendiente (1 ) de esa recta directamente de la l nea. Sin embargo, la mayor de los datos ecolgicos exhiben un cierto grado de a o variacin, y nuestros datos aparecern dispersos formando una nube en lugar o a de una l nea recta perfecta. Cuanto mayor sea el valor de 2 , mayor ser el a ruido o error de los datos en torno a la recta de regresin. o Si observamos la gura del ejemplo anterior, vemos que hay una clara relacin o entre la distancia de frenado de un coche y su velocidad, pero los puntos no caen a lo largo de una l nea recta perfecta. Dnde deber o amos colocar la recta de regresin? Intuitivamente, parece que la l o nea de la recta de regresin o deber de pasar por el centro de la nube de datos, denida por los a a puntos (X, Y ). Para nuestro ejemplo, el centro corresponder a los puntos: > meanX <- mean(cars$speed) > meanY <- mean(cars$dist) > meanX [1] 15.4 > meanY [1] 42.98 Ahora podemos rotar la l nea en torno a este punto central hasta que llegemos al mejor ajuste posible. Pero cmo denimos el mejor ajuste posible? Para o entender sto, vamos a denir primero los residuos cuadrados d2 , como la e i diferencia entre el valor observado de Y (Yi ) y el valor Y predicho por la ecuacin de regresin (Yi ). Los residuos cuadrados d2 se calculan de la o o i siguiente forma: d2 = (Yi Yi )2 i Se calcula el cuadrado de los residuos porque estamos interesados en la magnitud, y no en el signo, de la diferencia entre el valor observado y el valor predicho. Para cualquier valor observado de Y, podr amos hacer pasar la recta de regresin por ese punto, de tal manera que minimizramos su residuo o a (di = 0). Pero la l nea de la recta de regresin tiene que ajustarse a todos los o datos de forma colectiva, por lo que habr que tener en cuenta la suma de a todos los residuos, que es lo que se conoce como la suma de cuadrados residual, abreviado como RSS (del ingls residual sum of squares). e RSS =
n i=1 (Yi
Yi )2
10
Luis Cayuela
Modelos lineales
La l nea de regresin que mejor se ajuste a los datos ser aquella que minimice o a la suma de cuadrados residual (RSS). Minimizando la suma de cuadrados residual, aseguramos que la recta de regresin resulte en la menor diferencia o entre cada valor observado de Yi y cada valor Yi predicho por el modelo de regresin. o Pero esto sigue sin explicar cmo elegimos la recta de regresin que mejor se o o ajusta. Podr amos hacer que la l nea de regresin pase por el punto central o (X, Y ), y luego girarla hasta que encontremos una pendiente y un intercepto que minimice la suma de cuadrados residual. Esto implicar numerosas a estimaciones de la pendiente y el intercepto. Por suerte, hay una forma ms a fcil de estimar estos parmetros, pero antes vamos a explicar brevemente qu a a e es la varianza y la covarianza. 3.2.2. Varianzas y covarianzas
La suma de cuadrados de una variable Y (SSY ) es una medida de cuanta variabilidad existe en esa variable o, dicho de otra forma, de cuanto se desv a cada una de las observaciones hechas sobre la media de las observaciones. SSY =
n i=1 (Yi
Y i )2
Si dividimos esta suma por (n-1) obtenemos la formula de la varianza (s2 ): Y s2 = Y

1 n1 n i=1 (Yi
Y i )2
Si en lugar de tener una unica variable Y, tenemos dos variables X e Y, en lugar de la suma de cuadrados de una variable, podemos denir la suma de sus productos (SSXY ) de la siguiente forma: SSXY =
n i=1 (Xi
X i )(Yi Y i )
Y la covarianza de la muestra (sXY ): sXY =

1 n1 n i=1 (Xi
X i )(Yi Y i )
La varianza, al ser una suma de cuadrados, siempre es un nmero positivo. Sin u embargo, esto no es necesariamente cierto para la covarianza. Si valores altos de X se asocian con valores altos de Y, entonces la suma de sus productos generar una covarianza grande. Si por el contrario no existe una relacin clara a o entre X e Y, ocurrir que algunos valores altos de X estarn asociados con a a valores pequeos o incluso negativos de Y. Esto generar al nal una coleccin n a o muy heterognea de trminos de covarianza, algunos con s e e mbolo positivo y otros con s mbolo negativo. La suma de todos estos trminos estar muy e a prxima a cero. o Vamos a calcular la varianza y la covarianza para nuestro ejemplo anterior:
11
Luis Cayuela
Modelos lineales
> > > > > >
n <- dim(cars)[1] SSy <- sum((cars$dist - meanY)^2) s.y2 <- SSy/(n - 1) SSxy <- sum((cars$dist - meanY) * (cars$speed - meanX)) s.xy <- SSxy/(n - 1) s.y2
[1] 664.0608 > s.xy [1] 109.9469 La mayor parte de los trminos de la covarianza son positivos. e > (cars$dist - meanY) * (cars$speed - meanX) [1] 467.172 375.972 327.432 176.232 199.652 211.072 134.892 91.692 48.492 [10] 114.312 65.912 98.532 78.132 64.532 50.932 40.752 21.552 21.552 [19] -7.248 23.772 9.772 -23.828 -51.828 9.192 6.792 -4.408 -6.588 [28] -1.788 -17.568 -4.768 11.232 -2.548 33.852 85.852 106.652 -25.128 [37] 10.872 90.072 -50.508 23.092 41.492 59.892 96.692 151.932 83.752 [46] 232.372 421.572 430.172 662.372 403.392 Intuitivamente, esto deber de estar relacionado con la pendiente de la recta a de regresin, ya que describe la relacin (positiva o negativa) entre la variacin o o o en la variable X y la variacin en la variable Y. o 3.2.3. Estimadores por m nimos cuadrados
Habiendo denido qu es la covarianza, podemos ahora estimar los parmetros e a de la recta de regresin que minimizan la suma de cuadrados residual. o 1 =
sXY s2 X
SSXY SSx
dnde la suma de cuadrados de X (SSX ) es: o SS X =

n i=1 (Xi
X)
Utilizaremos el s mbolo 1 para designar nuestra estima de la pendiente, y para distinguirlo de 1 , que es el verdadero valor del parmetro2 . Por tanto, la a pendiente ser la covarianza de X e Y, escalada por la varianza de X. Como el a denominador (n-1) es idntico para los clculos de sXY y s2 , la pendiente e a X puede expresarse tambin como el ratio entre la suma de productos (SSXY ) y e la suma de cuadrados de X (SSx ). Para nuestros datos anteriores, tendr amos la siguiente estimacin de la pendiente: o
que tener en cuenta que 1 slo tiene un valor verdadero en el contexto de la estad o stica clsica (frecuentista). En un anlisis Bayesiano, los parmetros mismos son vistos como a a a una muestra aleatoria de una distribucin de posibles parmetros. o a
2 Hay
12
Luis Cayuela
Modelos lineales
> s.x2 <- sum((cars$speed - meanX)^2)/(n - 1) > B1 <- s.xy/s.x2 > B1 [1] 3.932409 Y, como observamos, se trata del mismo valor que obten amos cuando usbamos la funcin lm(). Este valor indicar que por cada incremento a o a unitario en la velocidad (expresada en millas/hora), tendr amos un incremento estimado de la distancia de frenado de 3.93 pies. Para calcular el intercepto en la ecuacin slo hay que tener en cuenta que la o o l nea de regresin ha de pasar a travs del centro de la nube de puntos, o e o denida por (X, Y ). Esto permite resolver la siguiente ecuacin. 0 = Y 1 X que para nuestro ejemplo, se calcular en R de la siguiente forma: a > B0 <- meanY - (B1 * meanX) > B0 [1] -17.57909 El intercepto coincide exactamente con el valor estimado utilizando la funcin o lm() en el apartado 3.1. Todav nos quedar un ultimo parmetro por estimar: el trmino error a a a e (i ). El error tiene una distribucin normal con media 0 y varianza 2 . Cmo o o podemos estimar 2 ? Lo primero que hay que observar es que cuanto ms a pequeo sea 2 , los datos estarn ms prximos a la recta de regresin. Si n a a o o 2 = 0 entonces no habr desviacin con respecto a las predicciones, es decir, a o que todos los datos caern sobre la recta de regresin. Esta descripcin es muy a o o similar a la de la suma de cuadrados residuales (RSS), que mide la desviacin o cuadrada de cada observacin con respecto al valor predicho por el modelo. o Recordemos que la varianza de la muestra mide la desviacin promedio de o cada observacin con respecto a la media. De forma similar, nuestra estima de o la varianza del trmino error (o varianza residual de la muestra) es la e desviacin promedio de cada observacin con respecto al valor predicho. o o
n
2 =
RSS n2
i=1
(Yi Yi )2 n2
i=1
[Yi (0 +1 Xi )] n2
La ra cuadrada de la varianza del trmino error, , es el error estndar de z e a la regresin. F o jate que en el denominador de la frmula utilizamos (n-2) en o vez de (n-1), como hac amos antes en el caso de la varianza de la muestra. El denominador indica el nmero de grados de libertad, es decir, el nmero de u u piezas de informacin independientes utilizadas en el clculo de la varianza. En o a este caso, ya hemos utilizado dos grados de libertad para estimar el intercepto y la pendiente de la recta de regresin. Para nuestro ejemplo, la varianza o residual, la varianza residual de la muestra y el error estndar de la regresin a o se calcular manualmente de la siguiente forma: a 13
Luis Cayuela
Modelos lineales
> > > >
RSS <- sum((cars$dist - (B0 + B1 * cars$speed))^2) RMS <- RSS/(n - 2) sterror <- RMS^0.5 RMS
[1] 236.5317 > sterror [1] 15.37959 El valor de la varianza residual de la muestra es lo que se denomina cuadrados medios residuales (RMS) en la tabla anova, que se obtendr en R con la a funcin anova(). Y la varianza residual (total) es el equivalente a las sumas de o cuadrados (RSS). > anova(lm.cars) Analysis of Variance Table Response: dist Df Sum Sq Mean Sq F value Pr(>F) speed 1 21186 21185.5 89.567 1.490e-12 *** Residuals 48 11354 236.5 --Signif. codes: 0 *** 0.001 ** 0.01 * 0.05 . 0.1 1 Como vemos, los nmeros coinciden perfectamente. u 3.2.4. Componentes de la varianza y el coeciente de determinacin o
Una tcnica fundamental en los anlisis paramtricos es la de la particin de la e a e o suma de cuadrados en diferentes componentes. Empezando con los datos en bruto, considera que la suma de cuadrados de la variable Y (SSY ) representa la variacin total que estamos intentando particionar. o Uno de los componentes de esta variacin total es el error aleatorio. Esta o variacin no puede ser atribuida a ninguna fuente espec o ca y se estima a partir de la suma de cuadrados residual (RSS). La variacin restante en Yi no o es aleatoria. Algunos valores de Yi son altos porque estn asociados con valores a altos de Xi . La fuente de esta variacin queda expresada en la relacin de o o regresin Yi = 0 + 1 Xi . De esta forma, conociendo la variacin total (SSY ) y o o la varianza residual (RSS) podemos calcular la varianza atribuida al modelo de regresin de la siguiente forma: o SSreg = SSY RSS 14
Luis Cayuela
Modelos lineales
O expresado de otra forma, la varianza total es la suma de la varianza explicada por el modelo y la varianza residual. SSY = SSreg + RSS Para nuestro ejemplo de la distancia de frenado, la varianza total es SSy y la varianza residual es res.var (las calculamos anteriormente). Luego la varianza explicada por el modelo ser a: > SSreg <- SSy - RSS > SSreg [1] 21185.46 Un ndice natural que describe la importancia relativa de la regresin frente a o la variacin residual es el coeciente de determinacin, r2 : o o r2 =
SSreg SSY
SSreg SSreg +RSS
El coeciente de determinacin nos dice que proporcin de la variacin en la o o o variable Y puede ser atribuida a la variacin en la variable X por medio de la o recta de regresin. Esta proporcin va de 0.0 a 1.0. Cuanto mayor sea este o o valor mejor ser el ajuste de los datos a la recta de regresin. Para nuestro a o ejemplo anterior, r2 se calcular de la siguiente forma: a > r2 <- SSreg/SSy Es importante recordar que la relacin causal entre X e Y es una hiptesis que o o el investigador propone de forma expl cita. El coeciente de determinacin, por o muy alto que sea, no conrma una relacin causa-efecto entre dos variables. o Un estad stico asociado al coeciente de determinacin es el coeciente de o correlacin, r, que se calcula como la raiz cuadrada del coeciente de o determinacin. El signo de r indica cmo es la relacin entre X e Y, si positiva o o o o negativa. 3.2.5. Test de hiptesis o
Hasta el momento hemos aprendido como jar una l nea recta para datos continuos de X e Y, y cmo utilizar el criterio de m o nimos cuadrados para estimar la pendiente, el intercepto, y la varianza de la l nea de regresin. El o siguiente paso es testar hiptesis sobre la l o nea de regresin ajustada. o Recordemos que los clculos de m a nimos cuadrados nos proporcionan estimaciones (0 , 1 , 2 ) de los verdaderos valores de los parmetros a (0 , 1 , 2 ). Como hay incertidumbre sobre estas estimaciones, vamos a querer testar si algunas de las estimas de estos parmetros dieren signicativamente a de cero.
15
Luis Cayuela
Modelos lineales
En particular, el supuesto que subyace a la relacin causa-efecto de nuestras o variables X e Y est contenido en el parmetro de la pendiente. La magnitud de a a 1 mide la fuerza de la respuesta de Y a cambios en X. Nuestra hiptesis nula o es que 1 no es diferente de cero. Si no podemos rechazar la hiptesis nula, o entonces no tenemos evidencias para establecer una relacin entre las variables o X e Y. Las hiptesis nula y alternativa se formular de la siguiente forma: o an 1 = 0 (Hiptesis nula) o 1 = 0 (Hiptesis alternativa) o Para comprobar la hiptesis nula se deben de organizar los datos en la tabla o del anlisis de la varianza (ANOVA). Aunque una tabla ANOVA se asocia de a forma natural con el anlisis de la varianza (seccin4), la particin de la suma a o o de cuadrados es comn al ANOVA, a la regresin y al ANCOVA, adems de a u o a otros modelos lineales generalizados. La tabla ANOVA tiene una serie de columnas que resumen la particin de la o suma de cuadrados, como ya hemos ido viendo a lo largo de esta seccin. En o las las aparecern las diferentes fuentes de variacin. Si el modelo tiene una a o unica variable explicativa, entonces aparecern dos las: X y residual. Si a hubiera ms variables explicativas, entonces habr tantas las como variables a a haya en el modelo ms la habitual de la varianza residual. a En lo que respecta a la comprobacin de la hiptesis nula establecida o o anteriormente, sta se lleva a cabo utilizando un estad e stico denominado F (F-ratio). Este se calcula diviendo los cuadrados medios del modelo por los cuadrados medios residuales, o lo que es lo mismo: F ratio =
SSreg /1 RSS/(n2)
El F-ratio se compara con una distribucin del estad o stico F generada bajo el supuesto de que 1 = 0. Esta distribucin se genera conociendo los grados de o libertad en el denominador y en el numerador. Si nuestro F-ratio queda probabil sticamente muy alejada de la distribucin del estad o stico F, entonces podremos decir con cierta seguridad que rechazamos la hiptesis nula, con lo o que 1 = 0. El p-valor, que se genera a partir del F-ratio conociendo la funcin de distribucin del estad o o stico F, es por tanto la probabilidad de obtener un test estad stico (F-ratio) tan extremo como el observado, asumiendo que la hiptesis nula es cierta. Si el p-valor es de 0.8, quiere decir o que 8 de cada 10 veces obtendremos por azar un F-ratio igual al que hemos obtenido a partir de las relaciones observadas entre X e Y. Cmo saber o cuando esta probabilidad es sucientemente pequea como para rechazar la n hiptesis nula? Pues bien, esto tenemos que denirlo a priori y es lo que se o conoce como nivel de signicacin, . Normalmente = 0,05. Si p-valor < o entonces rechazaremos la hiptesis nula. Si por el contrario el p-valor = , o aceptaremos la hiptesis nula, por lo que no tendremos evidencia suciente o para decir que 1 = 0. Vamos a calcular el F-ratio y ver dnde estar situado dentro de una o a distribucin del estad o stico F asumiendo la hiptesis nula. o 16
Luis Cayuela
Modelos lineales
> > + > >
F.ratio <- (SSreg/1)/(RSS/(n - 2)) plot(density(rf(n = 10000, df1 = 1, df2 = n - 2)), xlim = c(0, F.ratio + 5), main = "", xlab = "F-value") title("Distribucin del estadstico F. gl(1, 48)") o abline(v = F.ratio, lwd = 2, lty = 3)
Distribucin del estadstico F. gl(1, 48)

1.0 Density 0.0 0 0.2 0.4 0.6 0.8
20
40 Fvalue
60
80
3.3.
Evaluacin de los supuestos del modelo: Exploracin o o de los residuos
Una parte muy importante de la construccin de modelos estad o sticos paramtricos es la comprobacin de los supuestos del modelo. En concreto, nos e o interesa comprobar las hiptesis de normalidad y homocedasticidad o (homogeneidad de varianzas). La funcin plot() dibuja los grcos de los residuos cuando el argumento o a principal es un objeto del tipo lm.
17
Luis Cayuela
Modelos lineales
> par(mfcol = c(2, 2)) > plot(lm.cars)
Residuals vs Fitted
Standardized residuals 40 1.5
q 23 q 35
ScaleLocation
q 23 q 35q qq qq q q qq q q q q q q q q q q q q q q q q q q q q
49 q
49 q
Residuals
20
q q q
q qq
q qq
q q q q
q q q
1.0
20
40
60
80
0.0
q q q q q q q qqq qqqq q q q qqq q q q q
0.5
qqq q q q q
q qqqq q
20
q q q
20
40
60
80
Fitted values
Fitted values
Normal QQ
Standardized residuals Standardized residuals 3 3
23 q49 q
q 35 qq q q qqq qqq q q qq qq qqq qq q qq qq qq qq qq qqq qq q q qq qq q qq q
Residuals vs Leverage
q 23 q qq qq q q q q q q q q q q q q q q q q q qqq q q q q q q q q q q q qq q q q q q q q q 39
49 q
0.5
Cook's distance 0.04 0.08
0.00
Theoretical Quantiles
Leverage
En los grcos de los residuos vemos que los datos no son del todo normales ya a que se desv ligeramente de la diagonal en el Q-Q plot. Tambin parece que an e los datos son ligeramente heterocedsticos, como indica el grco de residuos a a frente a valores predichos. Para comprobar estad sticamente (ms que a visualmente) si los residuos son normales podemos utilizar el test de Shapiro-Wilk (funcin shapiro.test()). Este test comprueba la hiptesis nula de o o que los datos son normales. Si rechazamos la hiptesis nula (p-valor < 0.05) o podemos por tanto asumir que nuestro modelo NO es normal. > shapiro.test(residuals(lm.cars)) Shapiro-Wilk normality test data: residuals(lm.cars) W = 0.9451, p-value = 0.02153 Por lo que podr amos asumir que nuestro modelo no es normal, adems de la a heterocedasticidad que se maniesta en el grco de residuos frente a valores a predichos. Habr que pensar por tanto en la posibilidad de transformar a variables o utilizar algn otro tipo de modelo (modelos lineales generalizados, u modelos no lineales, modelos aditivos generalizados, modelos no paramtricos). e
18
Luis Cayuela
Modelos lineales
Podemos tambin comprobar la hiptesis de normalidad con el test RESET. e o Este test comprueba si X e Y se relacionan de forma lineal o, si por el contrario, existe una relacin no lineal entre ellas denida por potencias de la o variable respuesta, la variable explicativa o el primer componente principal de X. La hiptesis nula es que se relacionan de modo lineal. Si el p-valor es muy o bajo (< 0.05) se rechaza la hiptesis nula, lo que indicar algn tipo de o a u relacin no lineal. Para comprobar esta hiptesis podemos usar la funcin o o o resettest() del paquete lmtest, que habr que instalar previamente. a > library(lmtest) > resettest(lm.cars) RESET test data: lm.cars RESET = 1.5554, df1 = 2, df2 = 46, p-value = 0.222 En principio podemos asumir que hay linealidad.
3.4.
Ejercicios
1. El archivo gala (accesible como archivo de datos de R dentro del paquete faraway) contiene informacin sobre la riqueza de especies en 30 islas del o archipilago de las Galpagos. Queremos saber si hay un efecto de las e a variables rea de la isla (Area), elevacin mxima de la isla (Elevation) a o a y distancia a la isla ms prxima (Nearest) sobre la riqueza de especies a o (Species). Se aconseja seguir los siguientes pasos:
Instalar y cargar el paquete faraway. Representar grcas exploratorias de la variable respuesta (Species) con a
respecto a cada una de las variables explicativas.

Ajustar el modelo lineal. Interpretar los resultados del modelo. Comprobar los supuestos del modelo.
4.
Anlisis de la varianza (ANOVA) a
Supongamos ahora que nuestra variable explicativa no es cuantitativa sino categrica, con tres niveles: velocidad baja, velocidad media y velocidad alta. o > speed.cat <- cut(cars$speed, breaks = c(0, 12, 18, 26)) > levels(speed.cat) <- c("Baja", "Media", "Alta")
19
Luis Cayuela
Modelos lineales
La pregunta sigue siendo la misma Depende la distancia de frenado de la velocidad del coche? Lo que cambia aqu es la naturaleza de la variable explicativa y por ello el anlisis se denomina anlisis de la varianza en vez de a a anlisis de regresin, aunque en esencia, ambos procedimientos son a o prcticamente iguales. De hecho, la funcin que utilizaremos para ajustar un a o modelo ANOVA es la misma funcin que se utiliza para ajustar un modelo de o regresin: la funcin lm(). o o > lm.cars2 <- lm(cars$dist ~ speed.cat) > summary(lm.cars2) Call: lm(formula = cars$dist ~ speed.cat) Residuals: Min 1Q -33.467 -12.392 Coefficients: (Intercept) speed.catMedia speed.catAlta --Signif. codes: Estimate Std. Error t value Pr(>|t|) 18.200 4.717 3.859 0.000347 *** 26.500 6.240 4.247 0.000101 *** 47.267 6.670 7.086 6.05e-09 *** 0 *** 0.001 ** 0.01 * 0.05 . 0.1 1
Median -1.833
3Q 8.925
Max 54.533
Residual standard error: 18.27 on 47 degrees of freedom Multiple R-squared: 0.518, Adjusted R-squared: 0.4975 F-statistic: 25.25 on 2 and 47 DF, p-value: 3.564e-08 Cmo se interpretan aqu los resultados? Para entender sto, hay primero que o e entender cmo se ajusta el modelo en el caso de tener variables explicativas o categricas. Cuando una de las variables explicativas es categrica, el modelo o o entiende que hay tantos coecientes en el modelo como niveles del factor -1. Es decir, que si el factor tiene tres niveles, el modelo tendr dos parmetros ms a a a el punto de corte con el eje Y o Intercept. Este ultimo recoger el valor que a toma la variable respuesta cuando los dos niveles del factor para los cuales se ha estimado un coeciente son cero, es decir, que representar el tercer nivel a del factor, no representado de manera expl cita en el modelo. Por tanto, una variable categrica con tres niveles representa en realidad a tres variables o explicativas que toman valores 0 ` 1. A este tipo de variables se les denomina o variables dummy.
20
Luis Cayuela
Modelos lineales
Coche Coche Coche Coche Coche . . .
1 2 3 4 5
Velocidad baja 0 0 1 0 1 . . . 0
Velocidad media 1 0 0 0 0 . . . 1
Velocidad alta 0 1 0 1 0 . . . 0
Coche n
En este caso concreto el modelo que formulamos ser de la siguiente forma: a Y = 0 + 1 X1 + 2 X2 o dicho forma ms espec a ca: Distancia = 0 + 1 V elocida.media + 2 V elocidad.alta Dnde velocidad media y velocidad alta tomar valores 0 o 1 o an respectivamente. Por tanto, un coche que tenga una velocidad de 25 millas por hora (alta en los aos 20!!!) tomar un valor X1 = 0 y un valor X2 = 1, n a mientras que un coche con una velocidad de 8 millas por hora (velocidad baja) tomar un valor de X1 = 0 y X2 = 0, por lo que quedar representado en el a a modelo por el 0 o Intercept. En nuestro ejemplo, la signicacin alta (Pr(>|t|) < 0.05) del punto de corte y o de los dos coecientes del modelo indican que los tres niveles del factor son importantes para determinar la velocidad de frenado de un coche. Los valores estimados segn el modelo ser de 18,200 pies de distancia de frenado para u an aquellos coches que van una velocidad baja, 44,700 pies (18,200 + 26,500*X1) para aquellos coches que van una velocidad media, y 65,466 pies para aquellos coches que van a una velocidad alta (18,200 + 47,267*X2). Podemos ver estos valores con la funcin tted.values(). o > fitted.values(lm.cars2) 1 18.20000 9 18.20000 17 44.70000 25 44.70000 33 44.70000 2 18.20000 10 18.20000 18 44.70000 26 44.70000 34 44.70000 3 18.20000 11 18.20000 19 44.70000 27 44.70000 35 44.70000 4 18.20000 12 18.20000 20 44.70000 28 44.70000 36 65.46667 21 5 18.20000 13 18.20000 21 44.70000 29 44.70000 37 65.46667 6 18.20000 14 18.20000 22 44.70000 30 44.70000 38 65.46667 7 18.20000 15 18.20000 23 44.70000 31 44.70000 39 65.46667 8 18.20000 16 44.70000 24 44.70000 32 44.70000 40 65.46667
Luis Cayuela
Modelos lineales
41 42 43 44 45 46 47 48 65.46667 65.46667 65.46667 65.46667 65.46667 65.46667 65.46667 65.46667 49 50 65.46667 65.46667 El coeciente de determinacin del modelo (R2 ) es, en este caso, menor que en o el caso anterior y, el modelo en su conjunto explicar un 49,75 % de la a variabilidad de la variable respuesta (distancia de frenado). Otra manera de representar los resultados es considerando la signicacin del o factor en su conjunto. Un factor es signicativo si la variable respuesta en al menos uno de sus niveles es signicativamente distinta del resto de los niveles. La manera de representar estos datos es a travs de la tabla ANOVA, en dnde e o se muestra el factor como una variable unica en vez de considerar los niveles del factor como variables dummy. Para ello se puede utilizar la funcin anova(). o > anova(lm.cars2) Analysis of Variance Table Response: cars$dist Df Sum Sq Mean Sq F value Pr(>F) speed.cat 2 16855 8427.3 25.253 3.564e-08 *** Residuals 47 15684 333.7 --Signif. codes: 0 *** 0.001 ** 0.01 * 0.05 . 0.1 1 En esta tabla tenemos la signicacin de la variable explicativa speed.cat y la o suma de cuadrados, que se utilizan para calcular el coeciente de determinacin y la variabilidad explicada por cada una de las variables en el o caso de tener ms de un predictor. Las funciones anova() y summary() se deben a de utilizar de manera complementaria para interpretar mejor los resultados del modelo. En el caso del ANOVA podemos adems estar interesados en cmo son de a o distintos los niveles del factor comparados dos a dos. En este caso, sabemos que el nivel Velocidad media es signicativamente superior al nivel Velocidad baja, ya que el coeciente estimado para el ultimo es positivo y adems a signicativo, lo que indica que es mayor que el punto de corte o Intercept, que representa al nivel del factor Velocidad baja. Lo mismo podemos decir con respecto al nivel Velocidad alta con respecto al nivel Velocidad baja. Pero son signicativamente distintos entre s los niveles del factor Velocidad media y Velocidad alta? Para comprobar sto, se pueden utilizar el test de Bonferroni, e aunque hay otros muchos tests que se pueden aplicar igualmente. El test de Bonferroni compara los niveles del factor dos a dos y ajusta el nivel de signicacin para disminuir el error de tipo I (rechazar hiptesis nula siendo o o falsa). La funcin pairwise.t.test() implementa este test. o > pairwise.t.test(cars$dist, speed.cat, p.adjust = "bonferroni") 22
Luis Cayuela
Modelos lineales
Pairwise comparisons using t tests with pooled SD data: cars$dist and speed.cat
Baja Media Media 0.00030 Alta 1.8e-08 0.00511 P value adjustment method: bonferroni Lo que indica que, efectivamente, todos los niveles del factor son signicativamente distintos (p-valor < 0.05) entre s . Faltar por ultimo, evaluar los supuestos del modelo. Para ello analizaremos, a, como hicimos anteriormente, los grcos de los residuos. a > par(mfcol = c(2, 2)) > plot(lm.cars2)
Residuals vs Fitted
60 Standardized residuals 1.5
49 q
q 35 q 23 q
ScaleLocation
49 q
q 35 q 23 q q q q q q q q q q q q q q q q q q q q q q q q q
Residuals
20
q q q q q q q q q q q q
q q q q q q q q q q q q
1.0 0.0 0.5
q q q q q q q q q q q q q
40
q q q q q q q q q q q
20
30
40
50
60
20
30
40
50
60
Fitted values
Fitted values
Normal QQ
Standardized residuals Standardized residuals 3 3
49 q
q 35 q 23 q q q q q q q qq qq q q qq qq qq qq qq qq q q q q qq qq qq qq qq qq qq q q
49 q
q 35 q q q q q q q q q q q q q q
q q q q q q q q q q q q q q q q
Cook's distance 0.00 0.02 0.04
39 q
0.06
Leverage
En los grcos de los residuos vemos fundamentalmente problemas de a heterocedasticidad. Adems de comprobar estad a sticamente si los residuos son normales con el test de Shapiro-Wilk (funcin shapiro.test()), comprobaremos o la hiptesis concreta de homogeneidad de varianzas con el test de Levene o (funcin levene.test() del paquete car, que deberemos de instalar si no lo o hemos hecho antes). 23
Luis Cayuela
Modelos lineales
> shapiro.test(residuals(lm.cars2)) Shapiro-Wilk normality test data: residuals(lm.cars2) W = 0.9564, p-value = 0.06288 > install.packages("car", dep = T) > library(car) > levene.test(dist ~ speed.cat, data = cars) Levene's Test for Homogeneity of Variance (center = median) Df F value Pr(>F) group 2 3.202 0.0497 * 47 --Signif. codes: 0 *** 0.001 ** 0.01 * 0.05 . 0.1 1 Con lo que vemos que nuestros datos son normales, pero no homocedsticos. a
4.1.
Cambio del nivel de referencia en los contrastes de los niveles del factor
Cuando se hace un ANOVA, R interpreta cual es el nivel de referencia con el que comparar los coecientes estimados para el resto de los niveles del factor. Este es siempre el primer nivel del factor en orden alfabtico. Si escribimos: e > levels(speed.cat) [1] "Baja" "Media" "Alta"
Vemos que Baja es el primer nivel en orden alfabtico, y ste ser el que use e e a R como nivel de referencia. Esto slo tiene importancia a la hora de o interpretar los valores de los coecientes estimados para los otros niveles, que si son positivos querr decir que incrementan la respuesta con respecto al nivel a Baja y si son negativos se interpretar como que disminuyen la respuesta con a respecto a este mismo nivel. En ocasiones, nos puede interesar utilizar un nivel de referencia que no es el que selecciona R por defecto cmo cambiamos sto? Muy fcil. La funcin o e a o relevel() nos permite hacerlo de la siguiente forma: > speed.cat <- relevel(speed.cat, ref = "Media") > levels(speed.cat) [1] "Media" "Baja" "Alta"
24
Luis Cayuela
Modelos lineales
4.2.
Ejercicios
1. El archivo InsectSprays (accesible como archivo de datos de R) contiene informacin sobre 72 parcelas experimentales que han sido sometidas a 6 o tipos de insecticidas distintos. La variable respuesta es nmero de u insectos recogidos en trampas de insectos tras aplicar el tratamiento (count). La variable explicativa es el tipo de tratamiento aplicado (spray). Qu sprays son ms efectivos? e a Se aconseja seguir los siguientes pasos:
Representar los datos (count) en funcin del tipo de spray (grco de o a
cajas).
Ajustar el modelo lineal. Realizar comparaciones m ltiples de los niveles del factor dos a dos. u Interpretar los resultados. Comprobar los supuestos del modelo.
5.
Anlisis de la covarianza (ANCOVA) a
Una vez entendidos los fundamentos de la regresin simple y el ANOVA o unifactorial, la interpretacin de modelos con ms variables explicativas es o a simplemente una extensin de lo visto hasta el momento, incluso en el caso de o que se combinen variables explicativas continuas y categricas. Tal es el caso o del ANCOVA o anlisis de la covarianza. a Tomemos como ejemplo un experimento realizado con la planta herbcea a Echinochloa crus-galli en Norteamrica (Potvin et al. 1990) en dnde se e o pretende ver el efecto que distintas variables tienen sobre la captacin de CO2 o por parte de esta planta. En concreto, se pretende investigar si plantas sometidas a distintas concentraciones de CO2 (conc) captan o no la misma cantidad de este compuesto (uptake) y, adems, interesa ver qu efecto tienen a e dos tratamientos distintos (enfriamiento de la planta por la noche vs. no enfriamiento) a los que se somete la planta (Treatment) sobre su capacidad de jacin de CO2 . Estos datos estn contenidos en el archivo de datos CO2 3 . o a > str(CO2) Las hiptesis nulas que vamos a comprobar son, en principio, dos: o H0A : No hay una relacin signicativa entre la captacin de CO2 por parte de o o la planta y la concentracin atmosfrica de este compuesto (la pendiente es o e nula).
3 Aunque los datos originales fueron tomados sobre un dise o de medidas repetidas (Potvin n et al. 1990), para este ejemplo asumiremos que las muestras representan a individuos distintos y son, por tanto, independientes.
25
Luis Cayuela
Modelos lineales
H00B : No hay diferencias en la captacin de CO2 entre plantas sometidas a o distintos tratamientos. El modelo terico que se plantea ser por tanto el siguiente: o a uptake conc + Treatment Pero el modelo estad stico subyacente ser este otro: a uptake C0 + C1*conc + C2*Treatment 2 dnde C0, C1 y C2 ser los coecientes del modelo y el efecto del o an Tratamiento 1 quedar representado en el trmino C0. a e Antes de empezar es recomendable explorar los datos. > par(mfrow = c(1, 2)) > plot(uptake ~ conc, data = CO2) > boxplot(uptake ~ Treatment, data = CO2)
40
q q q q q q q q q q q q q
q q q q q
q q q q
q q q
30
uptake
q q q q q q q q q q q q q q q q q
q q q q q q q
20
10
200
400
600 conc
800
1000
10
20
q q
30
q q
q q
40
q q
q q q q
q q q q
q q q q q q
nonchilled
chilled
A primera vista parece que existe una relacin positiva, aunque no del todo o clara, entre la jacin de CO2 y la concentracin atmosfrica de dicho o o e compuesto. Tambin parece que hay alguna diferencia entre los dos e tratamientos. El siguiente paso es llevar a cabo un anlisis de la covarianza a para ver si estas diferencias que se observan a primera vista son estad sticamente signicativas o no lo son. Una vez ms, utilizaremos la a funcin lm(). o > CO2.model <- lm(uptake ~ Treatment + conc, data = CO2) Para obtener informacin adicional sobre los coecientes del modelo, as como o el R2 , utilizaremos el comando summary(). > summary(CO2.model)
26
Luis Cayuela
Modelos lineales
Call: lm(formula = uptake ~ Treatment + conc, data = CO2) Residuals: Min 1Q -19.401 -7.066 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 22.930052 1.989746 11.524 < 2e-16 *** Treatmentchilled -6.859524 1.944840 -3.527 0.000695 *** conc 0.017731 0.003306 5.364 7.55e-07 *** --Signif. codes: 0 *** 0.001 ** 0.01 * 0.05 . 0.1 1 Residual standard error: 8.912 on 81 degrees of freedom Multiple R-squared: 0.3372, Adjusted R-squared: 0.3208 F-statistic: 20.6 on 2 and 81 DF, p-value: 5.837e-08 Para obtener la tabla ANOVA con la suma de cuadrados, los F, y los niveles de signicacin del factor o factores, utilizaremos el comando anova(). o > anova(CO2.model) Analysis of Variance Table Response: uptake Df Sum Sq Mean Sq F value Pr(>F) Treatment 1 988.1 988.11 12.440 0.0006952 *** conc 1 2285.0 2284.99 28.767 7.55e-07 *** Residuals 81 6433.9 79.43 --Signif. codes: 0 *** 0.001 ** 0.01 * 0.05 . 0.1 1 Cmo interpretamos estos resultados? Al igual que ocurr con el ANOVA, se o a estiman tantos coecientes para el factor como niveles 1. El nivel del factor que no se estima queda incluido en el punto de corte del modelo (Intercept). Los niveles de signicacin nos indican que el coeciente estimado para uno de o los tratamientos (Treatmentchilled) es signicativamente menor que cero. El Intercept tambin es signicativo, lo que indica que el otro tratamiento e (Treatmentnonchilled) es signicativamente distinto de cero y, en este caso, tiene un efecto positivo sobre la jacin de CO2 (Estimate = 22.019163). o Podemos utilizar el grco de cajas (boxplot) para ayudarnos a interpretar a estos resultados. Lo segundo que vemos es que el modelo en su conjunto es signicativo (p-value: 5.837e-08) y que explica cerca del 32 % de la variabilidad en la jacin de CO2 de la planta (adjusted R-squared: 0.3208). o Como en este caso el factor slo tiene dos niveles, no hace falta hacer o comparaciones mltiples. Al ser signicativo el efecto del factor ya sabemos u 27
Median -1.168
3Q 7.573
Max 17.597
Luis Cayuela
Modelos lineales
que uno ser mayor que el otro. Los coecientes estimados para el modelo nos a dan esta informacin, como ya hemos visto. o
5.1.
Homogeneidad de pendientes
En el caso del ANCOVA, es necesario cumplir un supuesto ms adems de los a a supuestos estad sticos ya vistos para la regresin y el ANOVA: la o homogeneidad de pendientes. Las pendientes de las rectas de regresin o entre X e Y dentro de cada uno de los niveles del factor tienen que ser paralelas para poder estimar con precisin los efectos principales del factor. o La hiptesis nula H0 de que las pendientes entre grupos son iguales, o 1 = 2 = ... = n , se puede testar estad sticamente examinando si la interaccin entre el factor y la variable continua es igual a 0, es decir, si no o existe interaccin. Una interaccin entre un factor y una variable continua se o o interpreta como un cambio en la pendiente de la recta de regresin entre la o variable respuesta y la covariable en los distintos niveles del factor. Para el ejemplo anterior, un trmino de interaccin en el modelo signicar que la e o a respuesta de captacin de CO2 de la planta frente a las concentraciones o atmosfricas de CO2 depende del tipo de tratamiento al que han sido e sometidas. Un caso extremo de esta interaccin ser por ejemplo, que o a, mientras las plantas sometidas al tratamiento nonchilled reaccionan positivamente a las concentraciones de CO2 atmosfrico, las plantas sometidas e al tratamiento chilled reaccionan negativamente a las mismas. En cambio, si no hay interaccin, esto indica que las pendientes son iguales, y por tanto, los o efectos principales del factor (estimados sobre el intercepto de las rectas de regresin) son creibles independientemente del valor de la covariable. Cuando o no hay interaccin, siempre hay que reajustar el modelo eliminando o este trmino. De otra manera, la interaccin (sea signicativa o no) podr e o a afectar los clculos del estad a stico F y los p-valores para los efectos principales (factor y covariable). Una manera de explorar la homogeneidad de pendientes visualmente es utilizando la funcin grca interaction.plot(). o a
28
Luis Cayuela
Modelos lineales
> attach(CO2) > interaction.plot(x.factor = conc, trace.factor = Treatment, response = uptake)
35
Treatment nonchilled chilled
mean of uptake
15 95
20
25
30
175
250
350
500 conc
675
1000
Para testar la homogeneidad de pendientes, se debe incluir el trmino e interaccin entre el factor y la covariable en el modelo estad o stico. Para ello se pueden utilizar dos sintaxis distintas. > CO2.model2 <- lm(uptake ~ Treatment + conc + Treatment:conc, + data = CO2) > CO2.model2 <- lm(uptake ~ Treatment * conc, data = CO2) El operador : espec ca la interaccin entre dos trminos del modelo pero no se o e reere al efecto de cada uno de los trminos indivuales sobre la variable e respuesta, mientras que el operador * se reere tanto a los trminos simples e como a la interaccin entre ellos. Ambas frmulas son equivalentes. o o Ahora obtenemos la tabla ANOVA con la suma de cuadrados, los F, y los niveles de signicacin del factor. o > anova(CO2.model2) Analysis of Variance Table Response: uptake Df Sum Sq Mean Sq F value 29
Pr(>F)
Luis Cayuela
Modelos lineales
Treatment 1 988.1 988.11 12.3476 0.0007297 *** conc 1 2285.0 2284.99 28.5535 8.377e-07 *** Treatment:conc 1 31.9 31.87 0.3983 0.5297890 Residuals 80 6402.0 80.02 --Signif. codes: 0 *** 0.001 ** 0.01 * 0.05 . 0.1 1 Vemos que el factor y la covariable son signicativos, pero la interaccin entre o ambos no lo es, como parec indicar el grco de interacciones. Por lo tanto, a a debemos quedarnos con el modelo anterior, no slo porque tiene menos o parmetros y explica prcticamente la misma cantidad de variabilidad, sino a a tambin porque el modelo ANCOVA asume homogeneidad de pendientes e e incluir un trmino interaccin estar violando este supuesto. e o a Por ultimo, deber amos comprobar el resto de los supuestos del modelo utilizando para ello los grcos de los residuos (opcionalmente podr a amos tambin testar las hiptesis concretas de normalidad y homocedasticidad). e o > par(mfcol = c(2, 2)) > plot(CO2.model)
Standardized residuals
1.5
Residuals vs Fitted
20
q 38 32 q q q q q q qq q q q q q q q qq q q q q q q q q q q q qq qq q q q q q q q q q
ScaleLocation
q 38 32 q q q q q q q q q q q q q q q q q q qq q qq q q q q q q q q q q q q q q
77 q
q q q q qq qq q q q q q q qq q q q q q q q q q q q q q
10
q q q q q q q q q q q
Residuals
q q q q
q q q q q q
0.5
q q q q q
1.0
q q
qq qq qq
q q
q q q q
q q q q
20
20
25
30
35
40
0.0 20
77 q
25
30
35
40
Fitted values
Fitted values
Normal QQ
qq qq qq qq qq q q qq qq qq qq qq qq q q q q q q q q q q q q q q q q q qq q q qq qq qq q q q q q q q qq qq qq qq qq qq qq q q qqq qq q q q 77
38 32 q q
q q q q q q q q q q q q q q q q q q q q q
2 1
q q qq qq q qq q q q q qq q q qq q q q q q q q q qq q
q q q q q q q q q q q q q q q q q q 63 q
84
Cook's distance 0.00 0.02 0.04 0.06
q 77
Leverage
5.2.
Qu ocurre si la interaccin es signicativa? e o
La homogeneidad de pendientes no deber ser considerada simplemente como a un supuesto del modelo ANCOVA. Las interacciones entre factores y 30
Luis Cayuela
Modelos lineales
covariables normalmente representan efectos de considerable inters biolgico. e o Las diferencias entre las pendientes de las rectas de regresin indican que los o tratamientos afectan la relacin entre la variable respuesta Y y la covariable. o Explicar esto puede ser tan interesante o ms que explicar los efectos a principales. Cuando las pendientes son claramente heterogneas (la interaccin es e o signicativa en el modelo) se pueden hacer varias cosas, dependiendo de cual sea la cuestin de inters para el investigador. o e Si la interaccin es lo que ms nos interesa, nos vale con quedarnos con el o a modelo ANCOVA con interaccin y concluir que la respuesta de la covariable o es diferente entre grupos, pero sin concluir nada sobre los efectos principales. Si nos interesa el efecto de la covariable entonces lo ms fcil ser ajustar a a a tantos modelos de regresin como niveles del factor haya. Se pueden proyectar o todas las rectas de regresin en una unica grca para ver las diferencias entre o a ellas. Otras opciones son discutidas en Quinn & Keough (2002).
5.3.
Ejercicios
El arreglo de datos restauracion (http://tinyurl.com/restauracion) contiene informacin sobre un experimento de restauracin llevado a cabo en taludes de o o carretera. El objetivo es ver si la exposicin a la luz y la sequ estival afectan la o a produccin de biomasa leosa y, por tanto, a la capacidad del matorral para jar el o n suelo en taludes de carretera. Para comprobar el efecto de estos dos factores se ha diseado un experimento en dnde se han delimitado parcelas de 2 x 2 m en 91 n o taludes con caracter sticas similares en cuanto a pendiente, exposicin, clima, etc. o El experimento se ha aleatorizado y se ha asignado a cada talud unas condiciones de exposicin a la luz y cantidad de agua disponible (simulando la sequ estival) o a diferentes. En concreto, para el factor exposicin a la luz se han denido a priori o 3 niveles: nivel 1 (100 % de luz), nivel 2 (80 % de luz), nivel 3 (50 % de luz); y para el factor sequia estival se han denido dos niveles: sequ estival (condiciones a permanentes de sequ durantes los meses de julio y agosto) y lluvia estival (riego a una vez a la semana durante los meses de julio y agosto). Tras los meses de verano se ha cortado toda la vegetacin leosa, se ha secado y se ha pesado, o n teniendo as una estimacin de la biomasa leosa producida durante este periodo. o n
Tiene la luz un efecto sobre la produccin de biomasa le osa? o n Tiene la disponibilidad de agua (sequ estival) un efecto sobre la a
produccin de biomasa leosa? o n

Existe una interaccin entre ambos factores? De ser as cmo se o o
interpreta sta? qu grcos puedes usar para ayudarte a interpretar e e a esta interaccin en caso de que sea signicativa? o
31
Luis Cayuela
Modelos lineales
6.
Problemas de colinealidad: Reduccin de o variables
Cuando tenemos modelos con un gran nmero de variables explicativas puede u ocurrir que dichas variables sean redundantes o, lo que es lo mismo, que muchas de estas variables estn correlacionadas entre s Al introducir e . variables correlacionadas en un modelo, el modelo se vuelve inestable. Por un lado, las estimaciones de los parmetros del modelo se vuelven imprecisas y los a signos de los coecientes pueden llegar incluso a ser opuestos a lo que la intuicin nos sugiere. Por otro, se inan los errores estndar de dichos o a coecientes por lo que los test estad sticos pueden fallar a la hora de revelar la signicacin de estas variables. o Por tanto, siempre que tengamos varias variables explicativas (sobretodo cuando tenemos un gran nmero de ellas), es importante explorar la relacin u o entre ellas previamente al ajuste del modelo estad stico. Tomemos como ejemplo datos sobre las caracter sticas climticas a predominantes en la regin de origen de 54 especies del gnero Acacia. Dichas o e caracter sticas podr explicar el nmero de inorescencias que desarrollan an u estas plantas, lo que a su vez podr determinar el carcter invasivo de las a a especies. Los datos estn disponibles en http://tinyurl.com/yz446yz. a > acacia <- read.table(url("http://tinyurl.com/y2nkjhd"), header = T, + sep = "\t", dec = ",") > names(acacia) [1] [4] [7] [10] [13] [16] [19] [22] [25] [28] [31] [34] [37] [40] [43] [46] "Especie" "Tm_anual" "Rango_T.diurno" "P_mes_humedo" "Estacionalidad_P" "Max_Tm_anual" "Max_Rango_T.diurno" "Max_P_mes_humedo" "Max_Estacionalidad_P" "Min_Tm_anual" "Min_Rango_T.diurno" "Min_P_mes_humedo" "Min_Estacionalidad_P" "Rango_Tm" "Rango_P_anual" "Rango_Estacionalidad_T" "Invasora" "Tmax_mes_calido" "Rango_T_anual" "P_mes_seco" "Altitud" "Max_Tmax_mes_calido" "Max_Rango_T_anual" "Max_P_mes_seco" "Max_Altitud" "Min_Tmax_mes_calido" "Min_Rango_T_anual" "Min_P_mes_seco" "Min_Altitud" "Rango_Tmax_mes_calido" "Rango_P_mes_humedo" "Rango_Estacionalidad_P" "Inflor" "Tmin_mes_frio" "P_anual" "Estacionalidad_T" "P_cuarto_seco" "Max_Tmin_mes_frio" "Max_P_anual" "Max_Estacionalidad_T" "Max_P_cuarto_seco" "Min_Tmin_mes_frio" "Min_P_anual" "Min_Estacionalidad_T" "Min_P_cuarto_seco" "Rango_Tmin_mes_frio" "Rango_P_mes_seco" "Rango_Altitud"
Imaginemos que queremos construir un modelo lineal en dnde el nmero de o u inorescencias quede en funcin de las variables climticas. Para ello, antes de o a construir el modelo deberemos comprobar la correlacin entre las variables o explicativas. Cmo hay un gran nmero de ellas (45), slo vamos a explorar la o u o correlacin entre las 7 primeras a modo de ejemplo. o 32
Luis Cayuela
Modelos lineales
> acacia <- na.omit(acacia) > round(cor(acacia[, c(4:10)]), 3) Tm_anual Tmax_mes_calido Tmin_mes_frio Rango_T.diurno 1.000 0.844 0.855 0.292 0.844 1.000 0.547 0.700 0.855 0.547 1.000 -0.185 0.292 0.700 -0.185 1.000 0.050 0.530 -0.420 0.946 -0.068 -0.527 0.188 -0.769 0.358 -0.125 0.604 -0.638 Rango_T_anual P_anual P_mes_humedo Tm_anual 0.050 -0.068 0.358 Tmax_mes_calido 0.530 -0.527 -0.125 Tmin_mes_frio -0.420 0.188 0.604 Rango_T.diurno 0.946 -0.769 -0.638 Rango_T_anual 1.000 -0.759 -0.746 P_anual -0.759 1.000 0.880 P_mes_humedo -0.746 0.880 1.000 Tm_anual Tmax_mes_calido Tmin_mes_frio Rango_T.diurno Rango_T_anual P_anual P_mes_humedo La funcin na.omit() la utilizamos para eliminar las las que tengan datos o faltantes (NA). Tambin podr e amos utilizar la funcin grca pairs(). o a > pairs(acacia[, c(4:10)])
25
35
q q qq q q q qq qq q qq q qq q qq q qqq q qq q qq q q qq qq q qq q q q qq q q q qq q q qq q q qq qq q qq q qq q qq qqq qq q q qq qqq qq q q q qq q qq q q
10
q q q
13
qq q q q q q q qq q q q q q qq qqqqq q qq q q q q qqq q qq q q q q qq q q qqqq q qq q q q qq qq q q qq q qq qq q q q q qq qq qqqq q qq q q q q qq q qq q q q q
500
1500
q q q q q qq qq q qq qqq q qq q q qq qq q q qq qq q qq qq qq qq q qq qq q q qq q q q q q q qqq q qq q q qq q qq q qqqq q q q qqq q q q qqq q qq q q q
Tm_anual
q q q q q q q qq qq q qqq q qq qq qq q q qq q qq qq qqq q q q qq qq q q q
q q q q q q q q q q qq q qqq q qqq q q q qq q q q q q q qqq q qq q qq q q qq q q q q qq q q qq q q qq q q q qqq q q q q qq q q qq q q q q q q qq qq q qq q q q q q
q q q q q q qq q q qq q q q qq q q q q qq q qq qq q q q qq q q q qqq qq q q q q q q q q q q q q q qq q q qqq q q q q qq q q qq q qqq q q qq qqq q qq q q q q q q q qq q q q q q q q qq q qq q qq qqq q qq q qq qqq q qq qq q q q q q q q q q q qq q qqq q q q q qq qq q q qqq q qq q qq qq q qq qq q q qq q q q q q q q q q q q q q qq q q q q q qq q q q q qqq qqq q q q q qq q qqqq q q q q q
q qq q q q q q q q q q qq qq q q q q q q qq q q q qq qq q qq qqq qq q q qq q q q
35
qq q
Tmax_mes_calido
25
q q qq q qq qq q q q qq qq q q q q qqq q qq qq qqqq qq qqqq q q q q
q q
q q q q q qq q q qq q q q q qq q q q q q q qq q qq qqq q q qqqq q q q q q q q
q q q q q q qq q q qq qq q q qq q q q q qq qq qqq q q qq q q q q q q q q q qq qq q qq qq q qq q q q q q q q qq qqqq q qq q q qq q q qq q qq qq q q q q q qqq qq q qq q q q q q q q qq qq qq q q q qq q q qqq qq q qq q q q
q q q qq q qq q q qq q q qq q qq qq q qq qq qqq q qq qqqq q q q qq q qq q q q q
10
q q
q qq q q qq q q qq q q q qq q q q qq q q qq qq q q q q q q qq q q q q q q q q qq q q q qq q q q qq q q qq qq q q qq q qq q q qqqq q qq q q q q q q q q
q q q q q qq q qq qq qqq q q q qq q q q qq q q qq q q qqq q qq q q qq q q q q
Rango_T.diurno
q q q q q q qqq qq qqq q q q qq qq q qq qq q qq q q q qqq q q qq q q q
q q q qq q q qq qq qq qq qq q q q qq qqq qq q qqqq q qq q q q q q q q q q
13
q q
Rango_T_anual
q q
q q q q
q q q
q q
q q q q
1500
q q qq qq q qq qqq q q qq q qqqq q q q q q qqq qq qq q q q q q q q q q q q q q q q q q q qqqqq q qq qq qqq qq q q q qq q q qq q qq qqq qq q q q q q q
q qq q qqq qq qq q qq q q qq qq qqq qq q q q qq q q q q q q q q q qq q q q qq q q q q q qq q q q qq q qq qq q q q qq q q q qq q q q q q q q qq q q q q qq q qq
q q qq qq q qq q q q q q qq q q q q qq q qqq q q q q q q q q qq qq q q qq q q q q qq q q qqq q q q qq q q q q q q q q q q q q q q qq q q q q q q q q qq q q qq q qq
q q q q q qqq qqq q q q q qq q qq q q q q q qq q qqq qq q q q q q q
qq
q q qq q qq q q q qqq q q qq q q q q q q q q q q qq q q qq q qq q qq qq q q q q q
P_anual
500
P_mes_humedo
q q q q q qqq qq qq q qqqq q qq q qq q qq q qqqq q qq q q q q q qq qq q q qq q q q q q qqq qq q q q qq q q q qq qq qq q q qq qq qq q q qqqq q q q qq q q qq qqqq q q qqq q q q qq qq q q q q q q qq qq q q q qq qq q q q q qq q q qqq qqq qq q qq qq qq qq qqq q qqq qq q qq
15
25
0 5
15
18 24 30
50
250
Qu variables estn ms correlacionadas entre s (p.e. |r > 0.8|)? Dado que e a a 33
50
250
q q
q q
18 24 30
q q qq qqqq q qq q q qq q q qqq q q q q q qq qq q q q qqqq q qqqq q q q
q q q q q qq qq q qq q q q q qq q q qq q q q qq q qq qq q qq q q qq q q q q
0 5
qqq q q q q qq q q q qq q q q qq q qqqq q q qq q qq q q q q q q q
Tmin_mes_frio
q q q q q qqq q q q q q q q q q q q q q qqqqqq q q q qq q q q qq q q qq
15
q q
q q
15
25
q q
qq
Luis Cayuela
Modelos lineales
existe correlacin alta entre algunas variables, la solucin podr ser hacer una o o a seleccin de las variables que estn menos correlacionadas entre s En el caso o e . de que haya mucha colinealidad entre las variables explicativas, o de que haya muchas variables explicativas, como en este caso, otra opcin es hacer un o anlisis de componentes principales (PCA) para reducir la dimensionalidad de a los datos. El PCA resume en vectores ortogonales (es decir, independientes) la variabilidad representada por un conjunto de variables. El ejemplo ms t a pico son las variables climticas, en donde existe casi siempre una alta colinealidad. a Un conjunto de 25 o 30 variables climticas pueden resumirse en dos o tres a ejes que representen ciertas caracter sticas de los datos (por ejemplo, estacionalidad, temperatura) y que resuman una gran proporcin de la o variabilidad de las variables originales (a veces dos o tres ejes del PCA pueden resumir hasta un 80 % o un 90 % de la variabilidad de los datos originales).
7.
Sumas de cuadrados de tipo I y III
Cuando tenemos modelos con ms de una variable explicativa existen varias a formas de calcular las sumas de cuadrados para cada una de ellas (es decir, la variacin compartida de cada una de ellas con la variable respuesta). Las o sumas de cuadrados ms comnmente utilizadas son las de tipo I y III. a u Las sumas de cuadrado de tipo I se obtienen calculando la reduccin en la o suma de cuadrados residual a medida que vamos aadiendo trminos al n e modelo de forma secuencial. Las sumas de cuadrados de tipo III se denominan sumas de cuadrados marginales. Este tipo de sumas de cuadrados calculan la reduccin en la suma o de cuadrados residual para un efecto tras haber ajustado todos los dems a efectos en el modelo. Para estimar la suma de cuadrados para cada uno de los coecientes del modelo se hace lo siguiente: al modelo completo (una vez que hemos estimado los coecientes del mismo) se le quita una variable y se estima la suma de cuadrados de esta variable calculando la diferencia entre la suma de cuadrados explicada del modelo completo y la suma de cuadrados explicada del modelo al que se le ha extraido dicha variable. Es importante que tengamos en cuenta que los coecientes estimados del modelo utilizando una suma de cuadrados de tipo I y III no cambian, lo que cambia es la variabilidad explicada por cada uno de ellos y su signicacin. o
7.1.
Cundo usar una u otra? a
Existe un intenso debate entre los estad sticos sobre qu tipo de suma de e cuadrados se debe de utilizar. En principio, si nuestro modelo lineal slo o contiene variables continuas (regresin), el tipo de suma de cuadrados que o utilicemos no es relevante siempre y cuando no exista co-linealidad (ver seccin o 6) entre nuestras variables explicativas. Si existe colinealidad, aunque sea pequea, entonces deberemos preguntarnos si existe una cierta jerarquizacin n o de los efectos sobre la variable respuesta. Por ejemplo, si tenemos un modelo en dnde queremos comprobar el efecto de la temperatura media anual y de la o 34
Luis Cayuela
Modelos lineales
intensidad de uso antrpico sobre la abundancia de una especie (variable o respuesta) ser lgico pensar que la variable climtica va a tener un efecto a o a regional y ms general que la variable de uso antrpico, que tendr un efecto a o a ms local, por lo que el uso de una suma de cuadrados de tipo I con un orden a de entrada denido primero por las variables que tienen un efecto ms regional a (temperatura media anual) y luego por las variables de efecto ms local (uso a antrpico) tiene sentido. o Si tenemos un diseo de tipo ANOVA o ANCOVA, entonces la cosa no est n a tan clara y es aqu en dnde el debate se vuelve ms intenso. Algunos libros o a dicen que si el diseo es balanceado (mismo nmero de casos en cada nivel del n u factor) entonces se debe de utilizar una suma de cuadrados de tipo I. Tambin e usaremos una suma de cuadrados de tipo I si existe un efecto bloque o una cierta anidacin en el orden de entrada de las variables en el modelo, lo cual o suele ser bastante frecuente en modelos ecolgicos. Esto es util porque nos o permite controlar la variabilidad de determinadas variables (bloques) antes de testar las hiptesis de inters. Recordemos que para el tipo I, las sumas de o e cuadrados para cada uno de los efectos en el modelo pueden cambiar si cambiamos el orden de entrada de las variables en el modelo. La suma de cuadrados de tipo III se debe de utilizar cuando no asumamos un efecto anidado, tanto para diseos balanceados como para diseos no n n balanceados. Es muy importante, por tanto, pensar bien sobre las hiptesis que estamos o comprobando y sobre su posible anidacin en el modelo, aunque el tema de la o anidacin de variables tambin se puede (y debe) tratar con otro tipo de o e herramientas como son los modelos lineales mixtos. Dicho esto, hay que tener en cuenta que, por defecto, R siempre va a calcular sumas de cuadrados de tipo I cuando usemos cualquier tipo de modelo lineal o modelo lineal generalizado, mientras que las sumas de cuadrados implementadas por defecto en otros software estad sticos como SPSS o Statistica es la de tipo III. Por tanto, si repetimos el mismo anlisis con R y a SPSS o Statistica y no cambiamos el tipo de suma de cuadrados, es posible que obtengamos distintos resultados.
7.2.
Especicar diferentes sumas de cuadrados en R
Como ya hemos dicho, las sumas de cuadrados que R implementa por defecto son las de tipo I. Si queremos utilizar otras sumas de cuadrados podemos utilizar la funcin Anova() del paquete car de John Fox. o > install.packages("car", dep = T) > library(car) > lm.acacia <- lm(Inflor ~ Tmin_mes_frio + Tm_anual, data = acacia) > anova(lm.acacia) Analysis of Variance Table
35
Luis Cayuela
Modelos lineales
Response: Inflor Df Sum Sq Mean Sq F value Pr(>F) Tmin_mes_frio 1 231.0 230.999 4.0509 0.04955 * Tm_anual 1 0.0 0.000 0.0000 0.99915 Residuals 50 2851.2 57.024 --Signif. codes: 0 *** 0.001 ** 0.01 * 0.05 . 0.1 1 > Anova(lm.acacia, type = "III") Anova Table (Type III tests) Response: Inflor Sum Sq Df F value (Intercept) 85.95 1 1.5073 Tmin_mes_frio 62.13 1 1.0895 Tm_anual 0.00 1 0.0000 Residuals 2851.19 50
Pr(>F) 0.2253 0.3016 0.9992
8.
Referencias
Crawley, M.J. (2007). The R Book. Wiley. Engqvist, L. (2005). The mistreatment of covariate interaction terms in
linear model analyses of behavioural and evolutionary ecology studies. Animal Behaviour 70: 967-971.
Faraway, J.J. (2005). Linear models with R. Chapman & Hall/CRC
Press, Florida, USA.

Quinn, G.P. & Keough, M.J. (2002). Experimental design and data
analysis for biologists. Cambridge University Press, Cambridge.

Zuur, A.F., Ieno, E.N. & Smith, G.M. (2007). Analysing ecological data.
Springer, New York.
36

2-Modelos Lineales

Uploaded by

Document Information

Original Title

Copyright

Available Formats

Share this document

Share or Embed Document

Sharing Options

Did you find this document useful?

Is this content inappropriate?

Copyright:

Available Formats

2-Modelos Lineales

Uploaded by

Copyright:

Available Formats

Modelos lineales: Regresion, ANOVA y ANCOVA

Luis Cayuela Septiembre de 2011

Modelos lineales: Regresin, ANOVA y ANCOVA (versin o o 1.4)

Para cualquier comentario o sugerencia por favor remitirse al autor de la obra.

Conceptos estad sticos bsicos a

Cosas importantes antes de empezar

Fundamentos tericos del clculo e interpretacin de o a o los parmetros de la recta de regresin a o

Si dividimos esta suma por (n-1) obtenemos la formula de la varianza (s2 ): Y s2 = Y

Y la covarianza de la muestra (sXY ): sXY =

> > > > > >

dnde la suma de cuadrados de X (SSX ) es: o SS X =

> > > >

SSreg SSreg +RSS

> > + > >

Distribucin del estadstico F. gl(1, 48)

Evaluacin de los supuestos del modelo: Exploracin o o de los residuos

> par(mfcol = c(2, 2)) > plot(lm.cars)

q q q q q q q qqq qqqq q q q qqq q q q q

Cook's distance 0.04 0.08

respecto a cada una de las variables explicativas.

Anlisis de la varianza (ANOVA) a

Coche Coche Coche Coche Coche . . .

1.0 0.0 0.5

Cook's distance 0.00 0.02 0.04

Anlisis de la covarianza (ANCOVA) a

> attach(CO2) > interaction.plot(x.factor = conc, trace.factor = Treatment, response = uptake)

Treatment nonchilled chilled

Cook's distance 0.00 0.02 0.04 0.06

Qu ocurre si la interaccin es signicativa? e o

produccin de biomasa leosa? o n

Problemas de colinealidad: Reduccin de o variables

q q q q q q q q q q qq q qqq q qqq q q q qq q q q q q q qqq q qq q qq q q qq q q q q qq q q qq q q qq q q q qqq q q q q qq q q qq q q q q q q qq qq q qq q q q q q

q q qq q qq qq q q q qq qq q q q q qqq q qq qq qqqq qq qqqq q q q q

q q q q q q qq q q qq qq q q qq q q q q qq qq qqq q q qq q q q q q q q q q qq qq q qq qq q qq q q q q q q q qq qqqq q qq q q qq q q qq q qq qq q q q q q qqq qq q qq q q q q q q q qq qq qq q q q qq q q qqq qq q qq q q q

q q qq qq q qq qqq q q qq q qqqq q q q q q qqq qq qq q q q q q q q q q q q q q q q q q q qqqqq q qq qq qqq qq q q q qq q q qq q qq qqq qq q q q q q q

q q q q q qqq qqq q q q q qq q qq q q q q q qq q qqq qq q q q q q q

Qu variables estn ms correlacionadas entre s (p.e. |r > 0.8|)? Dado que e a a 33

q q qq qqqq q qq q q qq q q qqq q q q q q qq qq q q q qqqq q qqqq q q q

Sumas de cuadrados de tipo I y III

Cundo usar una u otra? a

Especicar diferentes sumas de cuadrados en R

Pr(>F) 0.2253 0.3016 0.9992

Press, Florida, USA.

analysis for biologists. Cambridge University Press, Cambridge.

Springer, New York.

You might also like