Método

Ejercicios: Coeficiente de determinación

R2=1R^{2} = 1 - no explicada / total · 0R210 \leq R^{2} \leq 1

Si no te acordás cómo se usa, repasá la teoría.

Las 12 actividades recorren los distintos tipos de ejercicio del tema, con tres variantes de cada uno. Si te trabás en una, mirá la solución y seguí con la siguiente.

1. En una regresión de las ventas del día sobre la cantidad de visitas con 88 casos, la variabilidad total de yy es (yyˉ)2=123,875\sum (y - \bar{y})^{2} = 123{,}875 y la parte no explicada por el modelo es 25,4625{,}46. Calculá el coeficiente de determinación.

Ver solución

1. Escribimos la descomposición. La variabilidad total de yy se parte en dos: la que el modelo explica y la que queda en los residuos. SCT=SCE+SCRSCT = SCE + SCR.

2. Calculamos la parte explicada. SCE=123,87525,46=98,415SCE = 123{,}875 - 25{,}46 = 98{,}415

3. Aplicamos la fórmula. R2=1SCRSCT=125,46123,8750,7945R^{2} = 1 - \dfrac{SCR}{SCT} = 1 - \dfrac{25{,}46}{123{,}875} \approx 0{,}7945

4. Verificamos el rango. 00,794510 \leq 0{,}7945 \leq 1, como tiene que ser siempre.

5. Interpretamos. El modelo explica el 79,45%79{,}45\% de la variabilidad de las ventas del día. El resto, un 20,55%20{,}55\%, queda sin explicar por esta variable.

6. Lo que un R2R^{2} alto no garantiza. Que el modelo lineal sea el correcto. Hay que mirar los residuos igual: un patrón en ellos indica un modelo mal elegido por más alto que sea el R2R^{2}.

Respuesta: R2=0,7945R^{2} = 0{,}7945, o sea el 79,45%79{,}45\%

2. Con los datos (3;27)(3; 27) · (4;24)(4; 24) · (5;20)(5; 20) · (6;20)(6; 20) · (11;1)(11; -1) · (13;3)(13; -3) · (15;10)(15; -10) · (17;17)(17; -17), calculá el coeficiente de correlación lineal y el de determinación, y verificá la relación entre los dos.

Ver solución

1. Calculamos las tres sumas centradas. Sxx=205,5S_{xx} = 205{,}5, Syy=2054S_{yy} = 2054 y Sxy=647S_{xy} = -647.

2. Calculamos la correlación. r=SxySxxSyy=647205,52054=0,9959r = \dfrac{S_{xy}}{\sqrt{S_{xx} \cdot S_{yy}}} = \dfrac{-647}{\sqrt{205{,}5 \cdot 2054}} = -0{,}9959

3. Calculamos el coeficiente de determinación. R2=SCESCT=2037,026820540,9917R^{2} = \dfrac{SCE}{SCT} = \dfrac{2037{,}0268}{2054} \approx 0{,}9917

4. Verificamos la relación. r2=(0,9959)20,9917r^{2} = (-0{,}9959)^{2} \approx 0{,}9917, que coincide con R2R^{2}. En regresión lineal simple los dos son exactamente lo mismo, y de ahí viene la notación.

5. Vemos qué aporta cada uno. r=0,9959r = -0{,}9959 conserva el signo, así que dice si la relación es creciente o decreciente. R2=0,9917R^{2} = 0{,}9917 pierde el signo pero se interpreta como proporción de variabilidad explicada.

6. Un aviso. La igualdad R2=r2R^{2} = r^{2} vale solo con una variable explicativa. En regresión múltiple el R2R^{2} sigue existiendo pero ya no es el cuadrado de una correlación simple.

Respuesta: r=0,9959r = -0{,}9959 y R2=0,9917=r2R^{2} = 0{,}9917 = r^{2}

3. En una regresión de las ventas del día sobre la cantidad de visitas, la variabilidad total es 750750 y el coeficiente de determinación dio 0,880{,}88. Calculá la variabilidad explicada y la no explicada, e interpretá el resultado.

Ver solución

1. Escribimos la definición. R2=SCESCTR^{2} = \dfrac{SCE}{SCT}, la proporción de la variabilidad de yy que el modelo explica.

2. Despejamos la parte explicada. SCE=0,88750=660SCE = 0{,}88 \cdot 750 = 660

3. Calculamos la no explicada. SCR=750660=90SCR = 750 - 660 = 90

4. Interpretamos. El 88%88\% de la variabilidad de las ventas del día queda explicado por la cantidad de visitas. El 12%12\% restante se debe a otros factores o al azar.

5. Evaluamos la calidad del ajuste. Es un ajuste fuerte: la variable explicativa da cuenta de la mayor parte de la variabilidad.

6. Lo que hay que hacer igual. Mirar los residuos. Un R2R^{2} alto con un patrón claro en los residuos indica que la relación existe pero no es lineal, y el modelo está mal elegido.

Respuesta: SCE=660SCE = 660 y SCR=90SCR = 90: el modelo explica el 88%88\%

4. En una regresión lineal simple se obtuvo lo siguiente: R2=0,94R^{2} = 0{,}94, pero al graficar los residuos contra xx aparece una curva clara en forma de U. Decidí si el modelo es adecuado y qué habría que hacer.

Ver solución

1. Leemos el coeficiente de determinación. El valor es alto, así que la recta explica buena parte de la variabilidad. Mirado solo, el ajuste parece muy bueno.

2. Vemos por qué eso no alcanza. El R2R^{2} resume el tamaño de los residuos, pero no dice nada sobre su forma. Un modelo mal elegido puede dejar residuos chicos y con un patrón evidente.

3. Diagnosticamos. Acá la relación es fuerte pero no lineal: el modelo recto captura la tendencia general y falla de forma sistemática en los extremos y en el centro.

4. Concluimos sobre el modelo. El modelo lineal no es adecuado, aunque el número del ajuste sugiera lo contrario.

5. Decidimos qué hacer. Conviene probar un modelo cuadrático o transformar alguna de las variables.

6. La regla que deja el ejercicio. Mirar los residuos siempre, aunque el R2R^{2} sea alto. El gráfico de residuos detecta problemas que ningún resumen numérico muestra.

Respuesta: El modelo no es adecuado pese al R2R^{2} alto: la relación es fuerte pero no lineal: el modelo recto captura la tendencia general y falla de forma sistemática en los extremos y en el centro. Conviene probar un modelo cuadrático o transformar alguna de las variables

5. En una regresión de el sueldo en miles sobre los años de antigüedad con 88 casos, la variabilidad total de yy es (yyˉ)2=1237,5\sum (y - \bar{y})^{2} = 1237{,}5 y la parte no explicada por el modelo es 45,5545{,}55. Calculá el coeficiente de determinación.

Ver solución

1. Escribimos la descomposición. La variabilidad total de yy se parte en dos: la que el modelo explica y la que queda en los residuos. SCT=SCE+SCRSCT = SCE + SCR.

2. Calculamos la parte explicada. SCE=1237,545,55=1191,95SCE = 1237{,}5 - 45{,}55 = 1191{,}95

3. Aplicamos la fórmula. R2=1SCRSCT=145,551237,50,9632R^{2} = 1 - \dfrac{SCR}{SCT} = 1 - \dfrac{45{,}55}{1237{,}5} \approx 0{,}9632

4. Verificamos el rango. 00,963210 \leq 0{,}9632 \leq 1, como tiene que ser siempre.

5. Interpretamos. El modelo explica el 96,32%96{,}32\% de la variabilidad de el sueldo en miles. El resto, un 3,68%3{,}68\%, queda sin explicar por esta variable.

6. Lo que un R2R^{2} alto no garantiza. Que el modelo lineal sea el correcto. Hay que mirar los residuos igual: un patrón en ellos indica un modelo mal elegido por más alto que sea el R2R^{2}.

Respuesta: R2=0,9632R^{2} = 0{,}9632, o sea el 96,32%96{,}32\%

6. Con los datos (1;28)(1; 28) · (2;31)(2; 31) · (3;36)(3; 36) · (4;35)(4; 35) · (5;35)(5; 35) · (11;47)(11; 47) · (7;42)(7; 42), calculá el coeficiente de correlación lineal y el de determinación, y verificá la relación entre los dos.

Ver solución

1. Calculamos las tres sumas centradas. Sxx=69,4286S_{xx} = 69{,}4286, Syy=247,4286S_{yy} = 247{,}4286 y Sxy=126,5714S_{xy} = 126{,}5714.

2. Calculamos la correlación. r=SxySxxSyy=126,571469,4286247,4286=0,9657r = \dfrac{S_{xy}}{\sqrt{S_{xx} \cdot S_{yy}}} = \dfrac{126{,}5714}{\sqrt{69{,}4286 \cdot 247{,}4286}} = 0{,}9657

3. Calculamos el coeficiente de determinación. R2=SCESCT=230,7454247,42860,9326R^{2} = \dfrac{SCE}{SCT} = \dfrac{230{,}7454}{247{,}4286} \approx 0{,}9326

4. Verificamos la relación. r2=(0,9657)20,9326r^{2} = (0{,}9657)^{2} \approx 0{,}9326, que coincide con R2R^{2}. En regresión lineal simple los dos son exactamente lo mismo, y de ahí viene la notación.

5. Vemos qué aporta cada uno. r=0,9657r = 0{,}9657 conserva el signo, así que dice si la relación es creciente o decreciente. R2=0,9326R^{2} = 0{,}9326 pierde el signo pero se interpreta como proporción de variabilidad explicada.

6. Un aviso. La igualdad R2=r2R^{2} = r^{2} vale solo con una variable explicativa. En regresión múltiple el R2R^{2} sigue existiendo pero ya no es el cuadrado de una correlación simple.

Respuesta: r=0,9657r = 0{,}9657 y R2=0,9326=r2R^{2} = 0{,}9326 = r^{2}

7. En una regresión de la nota del parcial sobre las horas de estudio, la variabilidad total es 250250 y el coeficiente de determinación dio 0,150{,}15. Calculá la variabilidad explicada y la no explicada, e interpretá el resultado.

Ver solución

1. Escribimos la definición. R2=SCESCTR^{2} = \dfrac{SCE}{SCT}, la proporción de la variabilidad de yy que el modelo explica.

2. Despejamos la parte explicada. SCE=0,15250=37,5SCE = 0{,}15 \cdot 250 = 37{,}5

3. Calculamos la no explicada. SCR=25037,5=212,5SCR = 250 - 37{,}5 = 212{,}5

4. Interpretamos. El 15%15\% de la variabilidad de la nota del parcial queda explicado por las horas de estudio. El 85%85\% restante se debe a otros factores o al azar.

5. Evaluamos la calidad del ajuste. Es un ajuste débil: la mayor parte de la variabilidad queda sin explicar por este modelo.

6. Lo que hay que hacer igual. Mirar los residuos. Un R2R^{2} alto con un patrón claro en los residuos indica que la relación existe pero no es lineal, y el modelo está mal elegido.

Respuesta: SCE=37,5SCE = 37{,}5 y SCR=212,5SCR = 212{,}5: el modelo explica el 15%15\%

8. En una regresión lineal simple se obtuvo lo siguiente: R2=0,91R^{2} = 0{,}91, y los residuos se abren en forma de embudo al crecer xx. Decidí si el modelo es adecuado y qué habría que hacer.

Ver solución

1. Leemos el coeficiente de determinación. El valor es alto, así que la recta explica buena parte de la variabilidad. Mirado solo, el ajuste parece muy bueno.

2. Vemos por qué eso no alcanza. El R2R^{2} resume el tamaño de los residuos, pero no dice nada sobre su forma. Un modelo mal elegido puede dejar residuos chicos y con un patrón evidente.

3. Diagnosticamos. Acá la varianza de los errores no es constante: el modelo predice bien para xx chicos y cada vez peor a medida que xx crece.

4. Concluimos sobre el modelo. El modelo lineal no es adecuado, aunque el número del ajuste sugiera lo contrario.

5. Decidimos qué hacer. Conviene transformar yy, por ejemplo con logaritmo, o usar mínimos cuadrados ponderados.

6. La regla que deja el ejercicio. Mirar los residuos siempre, aunque el R2R^{2} sea alto. El gráfico de residuos detecta problemas que ningún resumen numérico muestra.

Respuesta: El modelo no es adecuado pese al R2R^{2} alto: la varianza de los errores no es constante: el modelo predice bien para xx chicos y cada vez peor a medida que xx crece. Conviene transformar yy, por ejemplo con logaritmo, o usar mínimos cuadrados ponderados

9. En una regresión de la cantidad de consultas sobre el gasto en publicidad con 88 casos, la variabilidad total de yy es (yyˉ)2=223,875\sum (y - \bar{y})^{2} = 223{,}875 y la parte no explicada por el modelo es 22,863622{,}8636. Calculá el coeficiente de determinación.

Ver solución

1. Escribimos la descomposición. La variabilidad total de yy se parte en dos: la que el modelo explica y la que queda en los residuos. SCT=SCE+SCRSCT = SCE + SCR.

2. Calculamos la parte explicada. SCE=223,87522,8636=201,0114SCE = 223{,}875 - 22{,}8636 = 201{,}0114

3. Aplicamos la fórmula. R2=1SCRSCT=122,8636223,8750,8979R^{2} = 1 - \dfrac{SCR}{SCT} = 1 - \dfrac{22{,}8636}{223{,}875} \approx 0{,}8979

4. Verificamos el rango. 00,897910 \leq 0{,}8979 \leq 1, como tiene que ser siempre.

5. Interpretamos. El modelo explica el 89,79%89{,}79\% de la variabilidad de la cantidad de consultas. El resto, un 10,21%10{,}21\%, queda sin explicar por esta variable.

6. Lo que un R2R^{2} alto no garantiza. Que el modelo lineal sea el correcto. Hay que mirar los residuos igual: un patrón en ellos indica un modelo mal elegido por más alto que sea el R2R^{2}.

Respuesta: R2=0,8979R^{2} = 0{,}8979, o sea el 89,79%89{,}79\%

10. Con los datos (4;49)(4; 49) · (6;57)(6; 57) · (8;65)(8; 65) · (10;72)(10; 72) · (8;63)(8; 63) · (14;89)(14; 89), calculá el coeficiente de correlación lineal y el de determinación, y verificá la relación entre los dos.

Ver solución

1. Calculamos las tres sumas centradas. Sxx=59,3333S_{xx} = 59{,}3333, Syy=944,8333S_{yy} = 944{,}8333 y Sxy=236,3333S_{xy} = 236{,}3333.

2. Calculamos la correlación. r=SxySxxSyy=236,333359,3333944,8333=0,9982r = \dfrac{S_{xy}}{\sqrt{S_{xx} \cdot S_{yy}}} = \dfrac{236{,}3333}{\sqrt{59{,}3333 \cdot 944{,}8333}} = 0{,}9982

3. Calculamos el coeficiente de determinación. R2=SCESCT=941,3502944,83330,9963R^{2} = \dfrac{SCE}{SCT} = \dfrac{941{,}3502}{944{,}8333} \approx 0{,}9963

4. Verificamos la relación. r2=(0,9982)20,9963r^{2} = (0{,}9982)^{2} \approx 0{,}9963, que coincide con R2R^{2}. En regresión lineal simple los dos son exactamente lo mismo, y de ahí viene la notación.

5. Vemos qué aporta cada uno. r=0,9982r = 0{,}9982 conserva el signo, así que dice si la relación es creciente o decreciente. R2=0,9963R^{2} = 0{,}9963 pierde el signo pero se interpreta como proporción de variabilidad explicada.

6. Un aviso. La igualdad R2=r2R^{2} = r^{2} vale solo con una variable explicativa. En regresión múltiple el R2R^{2} sigue existiendo pero ya no es el cuadrado de una correlación simple.

Respuesta: r=0,9982r = 0{,}9982 y R2=0,9963=r2R^{2} = 0{,}9963 = r^{2}

11. En una regresión de el sueldo en miles sobre los años de antigüedad, la variabilidad total es 600600 y el coeficiente de determinación dio 0,150{,}15. Calculá la variabilidad explicada y la no explicada, e interpretá el resultado.

Ver solución

1. Escribimos la definición. R2=SCESCTR^{2} = \dfrac{SCE}{SCT}, la proporción de la variabilidad de yy que el modelo explica.

2. Despejamos la parte explicada. SCE=0,15600=90SCE = 0{,}15 \cdot 600 = 90

3. Calculamos la no explicada. SCR=60090=510SCR = 600 - 90 = 510

4. Interpretamos. El 15%15\% de la variabilidad de el sueldo en miles queda explicado por los años de antigüedad. El 85%85\% restante se debe a otros factores o al azar.

5. Evaluamos la calidad del ajuste. Es un ajuste débil: la mayor parte de la variabilidad queda sin explicar por este modelo.

6. Lo que hay que hacer igual. Mirar los residuos. Un R2R^{2} alto con un patrón claro en los residuos indica que la relación existe pero no es lineal, y el modelo está mal elegido.

Respuesta: SCE=90SCE = 90 y SCR=510SCR = 510: el modelo explica el 15%15\%

12. En una regresión lineal simple se obtuvo lo siguiente: R2=0,89R^{2} = 0{,}89, y al mirar el gráfico se ve que el ajuste está dominado por un solo punto muy alejado del resto. Decidí si el modelo es adecuado y qué habría que hacer.

Ver solución

1. Leemos el coeficiente de determinación. El valor es alto, así que la recta explica buena parte de la variabilidad. Mirado solo, el ajuste parece muy bueno.

2. Vemos por qué eso no alcanza. El R2R^{2} resume el tamaño de los residuos, pero no dice nada sobre su forma. Un modelo mal elegido puede dejar residuos chicos y con un patrón evidente.

3. Diagnosticamos. Acá un dato influyente puede inflar el R2R^{2} por sí solo: sin ese punto el ajuste sería mucho peor.

4. Concluimos sobre el modelo. El modelo lineal no es adecuado, aunque el número del ajuste sugiera lo contrario.

5. Decidimos qué hacer. Conviene recalcular la recta sin ese punto y comparar, y revisar si es un error de carga o una observación legítima.

6. La regla que deja el ejercicio. Mirar los residuos siempre, aunque el R2R^{2} sea alto. El gráfico de residuos detecta problemas que ningún resumen numérico muestra.

Respuesta: El modelo no es adecuado pese al R2R^{2} alto: un dato influyente puede inflar el R2R^{2} por sí solo: sin ese punto el ajuste sería mucho peor. Conviene recalcular la recta sin ese punto y comparar, y revisar si es un error de carga o una observación legítima

Las cuentas de este material están verificadas una por una. Si aun así encontrás algo raro, .