Busca en el Blog

lunes, 7 de abril de 2014

R² y R² Ajustado (V)

Su sugerencia es informar sobre el R², n y k y dejar que el lector decida sobre la forma de ajustar el R² considerando n y a k.

A pesar de esta sugerencia, es el R² ajustado, como aparecen en (7.8.4), el que es utilizado por la mayoría de los paquetes estadísticos junto con el R² convencional. Se aconseja al lector tratar el R² como cualquier otro estadístico más de resumen.

Además de R² y R² ajustado como medidas de bondad de ajuste, a menudo se utilizan otros criterios para juzgar la bondad de un modelo de resgresión. Dos de estos son el criterio de información Alkaike y el criterio de predicción de Amemiya, los cuales son utilizados para escoger entre modelos que compiten. Se analizarán estos criterios cuando se considere el problema de selección de modelos de mayor detalle en un capítulo posterior.

domingo, 6 de abril de 2014

R² y R² Ajustado (IV)

De la ecuación (7.8.4) se hace inmediatamente entendible que (1) para k > 1, R² < R² lo cual implica que a medida que el número de variables X aumenta, el R² ajustado aumenta menos que el R² no ajustado; y (2) el R² puede ser negativo, aun cuando el R² es necesariamente no-negativo. En caso de que el R² resulte ser negativo en una aplicación, su valor se toma como cero. (El lector debe verificar que para el ejemplo ilustrativo dado anteriormente, el R² es 0.8519, que es menor que el valor de R² 0.8766).

Cuál R² se debe utilizar en la práctica? Como lo anota Theil:

... es una buena práctica utilizar R² en lugar de R² por que R² tiende a dar una imagen demasiada optimista del ajuste de la regresión, particularmente cuando el número de variables explicativas no es muy pequeño comparado con el número de observaciones.

Pero la opinión de Theil no es compartida totalmente, ya que él no ha dado una justificación teórica general para la "superioridad" de R². Por ejemplo, Goldberger argumenta que el siguiente R², denominado R² modificado, servirá igualmente.

R² Modificado = (1-k/n)R²

sábado, 5 de abril de 2014

R² y R² Ajustado (III)

La ecuación (7.8.2) puede se escrita también como
donde σ² es la varianza residual, un estimador insesgado de la verdadera σ², y S²y es la varianza muestral de Y.

Es fácil ver que el R² y el R² están relacionados porque, al incluir (7.8.1) en (7.8.2), se obtiene.

viernes, 4 de abril de 2014

R² y R² Ajustado (II)

Ahora, Σyi² es independiente del número de variables X en el modelo porque es simplemente Σ(Yi-Y)². La SRC, Σûi², sin embargo, depende del número de regresores presentes en el modelo. Intuitivamente, es calor que a medida que el número de variables X aumenta, es más probable que Σui² disminuya (al menos no aumentará); por tanto, el R² como ha sido definido en (7.8.1) aumentará. En vista de esto, al comparar los modelos de regresión con la misma variable dependiente pero un número diferente de variables X. se debe tener mucho cuidado al escoger el modelo con el R² más alto.

Para compara dos términos R², se debe tener en cuenta el número de variables X presentes en el modelo. Esto puede hacerse fácilmente si se considera un coeficiente de determinación alternativo, que es el siguiente:
donde k = el número de parámetros en el modelo incluyendo el término de intercepto. (En la regresión con tres variables, k = 3. Por qué? El R² así definido se conoce como R² ajustado, denotado por R². El término ajustado significa ajustado por los g de l asociados con las sumas de los cuadrados que se consideran en (7.8.1): Σûi² tiene n-k g de l en un modelo que contiene k parámetros, el cual incluye el término de intercepto y Σyi² tiene n-1 g de l. Por qué? Para el caso de tres variables, se sabe que Σûi² tiene n-3 g de l.

jueves, 3 de abril de 2014

R² y R² Ajustado (I)

Una propiedad importante el R² es que es una función no decreciente del número de variables explicativas o de regresores presentes en el modelo, a medida que aumenta el número de regresores, el R² aumenta casi invariablemente y nunca disminuye. Planteado de otra forma, una variable adicional X no reducira al R². Para ver esto, recuérdese la definición del coeficiente e determinación.


miércoles, 2 de abril de 2014

La regresión simple en el contexto de Regresión múltiple: Introducción al sesgo de especificación (VII)

La conclusión de la discusión en esta sección es simplemente esta: Si se requiere una regresión de tres variables, no efectuar una regresión simple o de dos variables. O, en forma más general, si se adopta un modelo particular de regresión como el "verdadero" modelo, no modificar omitiendo una o más variables de éste. Si ignora este principio, es probable que se obtengan estimados sesgados de los parárametros. No sólo eso, es probable que se subestime la verdadera varianza (σ²) y, por consiguiente los errores estándar estimados de los coeficientes de regresión. Aunque se demostrará esto formalmente en el capítulo 13, es posible darse una idea a este respecto comparando los resultados de las regresiones (7.6.2) y (7.7.6). El error estándar de β2 es mucho menor (en relación con su coeficiente) en (7.6.2) que en (7.7.6) (en relación con su coeficiente). Por tanto, los intervalos de confianza y la prueba e hipótesis basados en el modelo (correcto) (7.6.2) tienden a ser mucho más confiables que aquellos basados en el modelo mal especificado (7.7.6)

martes, 1 de abril de 2014

La regresión simple en el contexto de Regresión múltiple: Introducción al sesgo de especificación (VI)

Como lo indica esta ecuación, b32 = 1.1138 significa que a medida que X2 aumenta en una unidad, X3 aumenta en promedio cerca de 1.11 unidades. Pero si X3 aumenta en estas unidades, su efecto sobre Y será (1.4700)(1.1138) = β3b32= 1.6373. Por consiguiente, de (7.7.2) finalmente tenemos que