Ejercicios: Coeficiente de determinación
Si no te acordás cómo se usa, repasá la teoría.
Las 12 actividades recorren los distintos tipos de ejercicio del tema, con tres variantes de cada uno. Si te trabás en una, mirá la solución y seguí con la siguiente.
1. En una regresión de las ventas del día sobre la cantidad de visitas con casos, la variabilidad total de es y la parte no explicada por el modelo es . Calculá el coeficiente de determinación.
Ver solución
1. Escribimos la descomposición. La variabilidad total de se parte en dos: la que el modelo explica y la que queda en los residuos. .
2. Calculamos la parte explicada.
3. Aplicamos la fórmula.
4. Verificamos el rango. , como tiene que ser siempre.
5. Interpretamos. El modelo explica el de la variabilidad de las ventas del día. El resto, un , queda sin explicar por esta variable.
6. Lo que un alto no garantiza. Que el modelo lineal sea el correcto. Hay que mirar los residuos igual: un patrón en ellos indica un modelo mal elegido por más alto que sea el .
Respuesta: , o sea el
2. Con los datos · · · · · · · , calculá el coeficiente de correlación lineal y el de determinación, y verificá la relación entre los dos.
Ver solución
1. Calculamos las tres sumas centradas. , y .
2. Calculamos la correlación.
3. Calculamos el coeficiente de determinación.
4. Verificamos la relación. , que coincide con . En regresión lineal simple los dos son exactamente lo mismo, y de ahí viene la notación.
5. Vemos qué aporta cada uno. conserva el signo, así que dice si la relación es creciente o decreciente. pierde el signo pero se interpreta como proporción de variabilidad explicada.
6. Un aviso. La igualdad vale solo con una variable explicativa. En regresión múltiple el sigue existiendo pero ya no es el cuadrado de una correlación simple.
Respuesta: y
3. En una regresión de las ventas del día sobre la cantidad de visitas, la variabilidad total es y el coeficiente de determinación dio . Calculá la variabilidad explicada y la no explicada, e interpretá el resultado.
Ver solución
1. Escribimos la definición. , la proporción de la variabilidad de que el modelo explica.
2. Despejamos la parte explicada.
3. Calculamos la no explicada.
4. Interpretamos. El de la variabilidad de las ventas del día queda explicado por la cantidad de visitas. El restante se debe a otros factores o al azar.
5. Evaluamos la calidad del ajuste. Es un ajuste fuerte: la variable explicativa da cuenta de la mayor parte de la variabilidad.
6. Lo que hay que hacer igual. Mirar los residuos. Un alto con un patrón claro en los residuos indica que la relación existe pero no es lineal, y el modelo está mal elegido.
Respuesta: y : el modelo explica el
4. En una regresión lineal simple se obtuvo lo siguiente: , pero al graficar los residuos contra aparece una curva clara en forma de U. Decidí si el modelo es adecuado y qué habría que hacer.
Ver solución
1. Leemos el coeficiente de determinación. El valor es alto, así que la recta explica buena parte de la variabilidad. Mirado solo, el ajuste parece muy bueno.
2. Vemos por qué eso no alcanza. El resume el tamaño de los residuos, pero no dice nada sobre su forma. Un modelo mal elegido puede dejar residuos chicos y con un patrón evidente.
3. Diagnosticamos. Acá la relación es fuerte pero no lineal: el modelo recto captura la tendencia general y falla de forma sistemática en los extremos y en el centro.
4. Concluimos sobre el modelo. El modelo lineal no es adecuado, aunque el número del ajuste sugiera lo contrario.
5. Decidimos qué hacer. Conviene probar un modelo cuadrático o transformar alguna de las variables.
6. La regla que deja el ejercicio. Mirar los residuos siempre, aunque el sea alto. El gráfico de residuos detecta problemas que ningún resumen numérico muestra.
Respuesta: El modelo no es adecuado pese al alto: la relación es fuerte pero no lineal: el modelo recto captura la tendencia general y falla de forma sistemática en los extremos y en el centro. Conviene probar un modelo cuadrático o transformar alguna de las variables
5. En una regresión de el sueldo en miles sobre los años de antigüedad con casos, la variabilidad total de es y la parte no explicada por el modelo es . Calculá el coeficiente de determinación.
Ver solución
1. Escribimos la descomposición. La variabilidad total de se parte en dos: la que el modelo explica y la que queda en los residuos. .
2. Calculamos la parte explicada.
3. Aplicamos la fórmula.
4. Verificamos el rango. , como tiene que ser siempre.
5. Interpretamos. El modelo explica el de la variabilidad de el sueldo en miles. El resto, un , queda sin explicar por esta variable.
6. Lo que un alto no garantiza. Que el modelo lineal sea el correcto. Hay que mirar los residuos igual: un patrón en ellos indica un modelo mal elegido por más alto que sea el .
Respuesta: , o sea el
6. Con los datos · · · · · · , calculá el coeficiente de correlación lineal y el de determinación, y verificá la relación entre los dos.
Ver solución
1. Calculamos las tres sumas centradas. , y .
2. Calculamos la correlación.
3. Calculamos el coeficiente de determinación.
4. Verificamos la relación. , que coincide con . En regresión lineal simple los dos son exactamente lo mismo, y de ahí viene la notación.
5. Vemos qué aporta cada uno. conserva el signo, así que dice si la relación es creciente o decreciente. pierde el signo pero se interpreta como proporción de variabilidad explicada.
6. Un aviso. La igualdad vale solo con una variable explicativa. En regresión múltiple el sigue existiendo pero ya no es el cuadrado de una correlación simple.
Respuesta: y
7. En una regresión de la nota del parcial sobre las horas de estudio, la variabilidad total es y el coeficiente de determinación dio . Calculá la variabilidad explicada y la no explicada, e interpretá el resultado.
Ver solución
1. Escribimos la definición. , la proporción de la variabilidad de que el modelo explica.
2. Despejamos la parte explicada.
3. Calculamos la no explicada.
4. Interpretamos. El de la variabilidad de la nota del parcial queda explicado por las horas de estudio. El restante se debe a otros factores o al azar.
5. Evaluamos la calidad del ajuste. Es un ajuste débil: la mayor parte de la variabilidad queda sin explicar por este modelo.
6. Lo que hay que hacer igual. Mirar los residuos. Un alto con un patrón claro en los residuos indica que la relación existe pero no es lineal, y el modelo está mal elegido.
Respuesta: y : el modelo explica el
8. En una regresión lineal simple se obtuvo lo siguiente: , y los residuos se abren en forma de embudo al crecer . Decidí si el modelo es adecuado y qué habría que hacer.
Ver solución
1. Leemos el coeficiente de determinación. El valor es alto, así que la recta explica buena parte de la variabilidad. Mirado solo, el ajuste parece muy bueno.
2. Vemos por qué eso no alcanza. El resume el tamaño de los residuos, pero no dice nada sobre su forma. Un modelo mal elegido puede dejar residuos chicos y con un patrón evidente.
3. Diagnosticamos. Acá la varianza de los errores no es constante: el modelo predice bien para chicos y cada vez peor a medida que crece.
4. Concluimos sobre el modelo. El modelo lineal no es adecuado, aunque el número del ajuste sugiera lo contrario.
5. Decidimos qué hacer. Conviene transformar , por ejemplo con logaritmo, o usar mínimos cuadrados ponderados.
6. La regla que deja el ejercicio. Mirar los residuos siempre, aunque el sea alto. El gráfico de residuos detecta problemas que ningún resumen numérico muestra.
Respuesta: El modelo no es adecuado pese al alto: la varianza de los errores no es constante: el modelo predice bien para chicos y cada vez peor a medida que crece. Conviene transformar , por ejemplo con logaritmo, o usar mínimos cuadrados ponderados
9. En una regresión de la cantidad de consultas sobre el gasto en publicidad con casos, la variabilidad total de es y la parte no explicada por el modelo es . Calculá el coeficiente de determinación.
Ver solución
1. Escribimos la descomposición. La variabilidad total de se parte en dos: la que el modelo explica y la que queda en los residuos. .
2. Calculamos la parte explicada.
3. Aplicamos la fórmula.
4. Verificamos el rango. , como tiene que ser siempre.
5. Interpretamos. El modelo explica el de la variabilidad de la cantidad de consultas. El resto, un , queda sin explicar por esta variable.
6. Lo que un alto no garantiza. Que el modelo lineal sea el correcto. Hay que mirar los residuos igual: un patrón en ellos indica un modelo mal elegido por más alto que sea el .
Respuesta: , o sea el
10. Con los datos · · · · · , calculá el coeficiente de correlación lineal y el de determinación, y verificá la relación entre los dos.
Ver solución
1. Calculamos las tres sumas centradas. , y .
2. Calculamos la correlación.
3. Calculamos el coeficiente de determinación.
4. Verificamos la relación. , que coincide con . En regresión lineal simple los dos son exactamente lo mismo, y de ahí viene la notación.
5. Vemos qué aporta cada uno. conserva el signo, así que dice si la relación es creciente o decreciente. pierde el signo pero se interpreta como proporción de variabilidad explicada.
6. Un aviso. La igualdad vale solo con una variable explicativa. En regresión múltiple el sigue existiendo pero ya no es el cuadrado de una correlación simple.
Respuesta: y
11. En una regresión de el sueldo en miles sobre los años de antigüedad, la variabilidad total es y el coeficiente de determinación dio . Calculá la variabilidad explicada y la no explicada, e interpretá el resultado.
Ver solución
1. Escribimos la definición. , la proporción de la variabilidad de que el modelo explica.
2. Despejamos la parte explicada.
3. Calculamos la no explicada.
4. Interpretamos. El de la variabilidad de el sueldo en miles queda explicado por los años de antigüedad. El restante se debe a otros factores o al azar.
5. Evaluamos la calidad del ajuste. Es un ajuste débil: la mayor parte de la variabilidad queda sin explicar por este modelo.
6. Lo que hay que hacer igual. Mirar los residuos. Un alto con un patrón claro en los residuos indica que la relación existe pero no es lineal, y el modelo está mal elegido.
Respuesta: y : el modelo explica el
12. En una regresión lineal simple se obtuvo lo siguiente: , y al mirar el gráfico se ve que el ajuste está dominado por un solo punto muy alejado del resto. Decidí si el modelo es adecuado y qué habría que hacer.
Ver solución
1. Leemos el coeficiente de determinación. El valor es alto, así que la recta explica buena parte de la variabilidad. Mirado solo, el ajuste parece muy bueno.
2. Vemos por qué eso no alcanza. El resume el tamaño de los residuos, pero no dice nada sobre su forma. Un modelo mal elegido puede dejar residuos chicos y con un patrón evidente.
3. Diagnosticamos. Acá un dato influyente puede inflar el por sí solo: sin ese punto el ajuste sería mucho peor.
4. Concluimos sobre el modelo. El modelo lineal no es adecuado, aunque el número del ajuste sugiera lo contrario.
5. Decidimos qué hacer. Conviene recalcular la recta sin ese punto y comparar, y revisar si es un error de carga o una observación legítima.
6. La regla que deja el ejercicio. Mirar los residuos siempre, aunque el sea alto. El gráfico de residuos detecta problemas que ningún resumen numérico muestra.
Respuesta: El modelo no es adecuado pese al alto: un dato influyente puede inflar el por sí solo: sin ese punto el ajuste sería mucho peor. Conviene recalcular la recta sin ese punto y comparar, y revisar si es un error de carga o una observación legítima
Integradores de Inferencia estadística: practicá este tema junto con el resto de la unidad
Las cuentas de este material están verificadas una por una. Si aun así encontrás algo raro, .