Método

Ejercicios: Predicción y sus límites

se abre al alejarse de xˉ\bar{x} · fuera del rango no vale

Si no te acordás cómo se usa, repasá la teoría.

Las 12 actividades recorren los distintos tipos de ejercicio del tema, con tres variantes de cada uno. Si te trabás en una, mirá la solución y seguí con la siguiente.

1. Una regresión de el sueldo en miles sobre los años de antigüedad con 66 casos dio y^=31,8333+1,625x\hat{y} = 31{,}8333 + 1{,}625 x, xˉ=4\bar{x} = 4, (xxˉ)2=16\sum (x - \bar{x})^{2} = 16 y s=2,6021s = 2{,}6021. Construí el intervalo del 95%95\% para el valor medio de yy cuando x=3x = 3 años.

Ver solución

1. Calculamos la predicción puntual. y^=31,8333+1,6253=36,7083\hat{y} = 31{,}8333 + 1{,}625 \cdot 3 = 36{,}7083 miles de pesos.

2. Escribimos el error estándar de la media predicha. EE=s1n+(x0xˉ)2(xxˉ)2EE = s \sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{\sum (x - \bar{x})^{2}}}

3. Reemplazamos. EE=2,602116+(34)216=1,2457EE = 2{,}6021 \cdot \sqrt{\dfrac{1}{6} + \dfrac{(3 - 4)^{2}}{16}} = 1{,}2457

4. Armamos el intervalo. t=2,7764t = 2{,}7764 con 44 grados, margen 3,45853{,}4585: [33,2498;40,1668][33{,}2498; 40{,}1668] miles de pesos.

5. Interpretamos. Es un intervalo para el promedio de el sueldo en miles de todos los casos con los años de antigüedad igual a 33, no para un caso individual.

6. Verificamos que no sea extrapolación. Los datos de xx van de 11 a 66, y 33 queda adentro.

Respuesta: El intervalo para la media es [33,2498;40,1668][33{,}2498; 40{,}1668] miles de pesos

2. Con la misma regresión de la cantidad de consultas sobre el gasto en publicidad (88 casos, s=2,0902s = 2{,}0902), en x=5x = 5 miles de pesos la predicción puntual es 23,0723{,}07 consultas. Construí el intervalo de confianza para la media y el de predicción para un caso individual, y compará.

Ver solución

1. Escribimos los dos errores estándar. Para la media: s1n+(x0xˉ)2Sxxs \sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{S_{xx}}}. Para un caso individual: s1+1n+(x0xˉ)2Sxxs \sqrt{1 + \dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{S_{xx}}}.

2. Calculamos el de la media. EE=0,8101EE = 0{,}8101, y el intervalo es [21,0877;25,0522][21{,}0877; 25{,}0522].

3. Calculamos el de predicción. EE=2,2417EE = 2{,}2417, y el intervalo es [17,5847;28,5552][17{,}5847; 28{,}5552].

4. Comparamos los anchos. 3,96443{,}9644 contra 10,970510{,}9705: el de predicción es bastante más ancho.

5. Explicamos de dónde viene el 11 extra. El intervalo de la media solo carga con el error de estimar la recta. El de predicción carga además con la dispersión propia de un caso individual alrededor de la recta, y esa no se achica nunca por más datos que se tengan.

6. Cuál usar en cada caso. Si la pregunta es «cuánto vale en promedio la cantidad de consultas para el gasto en publicidad igual a 55», va el primero. Si es «cuánto va a dar un caso concreto», va el segundo. Confundirlos es el error más común del tema.

Respuesta: Media: [21,0877;25,0522][21{,}0877; 25{,}0522]. Predicción individual: [17,5847;28,5552][17{,}5847; 28{,}5552]

3. Con la recta y^=37,5622+2,8554x\hat{y} = 37{,}5622 + 2{,}8554 x, ajustada con datos de xx entre 55 y 1313 visitas, alguien predice el valor para x=39x = 39 visitas. Calculá lo que da la fórmula y evaluá si la predicción es válida.

Ver solución

1. Calculamos lo que devuelve la recta. y^=37,5622+2,855439148,9237\hat{y} = 37{,}5622 + 2{,}8554 \cdot 39 \approx 148{,}9237 unidades.

2. Comparamos con el rango observado. Los datos van de 55 a 1313, y 3939 queda 2626 unidades por encima del máximo.

3. Nombramos el problema. Es una extrapolación: se está usando el modelo fuera del rango donde se lo ajustó.

4. Explicamos por qué no se puede confiar. Los datos no dicen nada sobre cómo se comporta la relación afuera de ese rango. Puede seguir siendo lineal, curvarse o cortarse por completo, y nada en el ajuste permite distinguirlo.

5. Mostramos que el modelo no avisa. La fórmula devuelve 148,9237148{,}9237 sin ninguna señal de alerta. La responsabilidad de verificar el rango es de quien usa el modelo.

6. Qué hacer. Limitar las predicciones al intervalo [5;13][5; 13], o conseguir datos en el rango nuevo y volver a ajustar.

Respuesta: La fórmula da 148,9237148{,}9237, pero la predicción no es válida: 3939 queda fuera del rango [5;13][5; 13] de los datos

4. Con una regresión de el consumo de energía sobre la temperatura (66 casos, xˉ=5,1667\bar{x} = 5{,}1667, (xxˉ)2=42,8333\sum (x - \bar{x})^{2} = 42{,}8333, s=1,7089s = 1{,}7089), calculá el ancho del intervalo de confianza para la media predicha en x=5x = 5 y en x=10x = 10 grados, y explicá la diferencia.

Ver solución

1. Escribimos el error estándar. EE=s1n+(x0xˉ)2SxxEE = s \sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{S_{xx}}}: el segundo término crece con la distancia al promedio de las xx.

2. Calculamos en x=5x = 5. (x0xˉ)2=0,0278(x_0 - \bar{x})^{2} = 0{,}0278, y el ancho del intervalo es 3,88153{,}8815.

3. Calculamos en x=10x = 10. (x0xˉ)2=23,3611(x_0 - \bar{x})^{2} = 23{,}3611, y el ancho es 8,00738{,}0073.

4. Comparamos. 8,00738{,}0073 contra 3,88153{,}8815: el intervalo es más ancho lejos del centro de los datos.

5. Explicamos por qué. La recta está mejor determinada cerca del promedio de las xx: ahí la incertidumbre sobre la pendiente casi no mueve la predicción. Lejos del centro, un pequeño error en la pendiente se amplifica.

6. La forma que toma el gráfico. Las bandas de confianza se abren hacia los dos lados como un moño, con la cintura en el promedio de las xx. Esa forma es la razón geométrica de por qué extrapolar es tan riesgoso.

Respuesta: El ancho pasa de 3,88153{,}8815 en el centro a 8,00738{,}0073 en el extremo: el intervalo se abre al alejarse de la media de las xx

5. Una regresión de la nota del parcial sobre las horas de estudio con 77 casos dio y^=36,7043+2,0439x\hat{y} = 36{,}7043 + 2{,}0439 x, xˉ=10\bar{x} = 10, (xxˉ)2=114\sum (x - \bar{x})^{2} = 114 y s=1,711s = 1{,}711. Construí el intervalo del 95%95\% para el valor medio de yy cuando x=14x = 14 horas.

Ver solución

1. Calculamos la predicción puntual. y^=36,7043+2,04391465,3183\hat{y} = 36{,}7043 + 2{,}0439 \cdot 14 \approx 65{,}3183 puntos.

2. Escribimos el error estándar de la media predicha. EE=s1n+(x0xˉ)2(xxˉ)2EE = s \sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{\sum (x - \bar{x})^{2}}}

3. Reemplazamos. EE=1,71117+(1410)2114=0,9106EE = 1{,}711 \cdot \sqrt{\dfrac{1}{7} + \dfrac{(14 - 10)^{2}}{114}} = 0{,}9106

4. Armamos el intervalo. t=2,5706t = 2{,}5706 con 55 grados, margen 2,34072{,}3407: [62,9776;67,659][62{,}9776; 67{,}659] puntos.

5. Interpretamos. Es un intervalo para el promedio de la nota del parcial de todos los casos con las horas de estudio igual a 1414, no para un caso individual.

6. Verificamos que no sea extrapolación. Los datos de xx van de 55 a 1717, y 1414 queda adentro.

Respuesta: El intervalo para la media es [62,9776;67,659][62{,}9776; 67{,}659] puntos

6. Con la misma regresión de el sueldo en miles sobre los años de antigüedad (66 casos, s=2,529s = 2{,}529), en x=10x = 10 años la predicción puntual es 11,833311{,}8333 miles de pesos. Construí el intervalo de confianza para la media y el de predicción para un caso individual, y compará.

Ver solución

1. Escribimos los dos errores estándar. Para la media: s1n+(x0xˉ)2Sxxs \sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{S_{xx}}}. Para un caso individual: s1+1n+(x0xˉ)2Sxxs \sqrt{1 + \dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{S_{xx}}}.

2. Calculamos el de la media. EE=1,407EE = 1{,}407, y el intervalo es [7,9269;15,7398][7{,}9269; 15{,}7398].

3. Calculamos el de predicción. EE=2,894EE = 2{,}894, y el intervalo es [3,7982;19,8685][3{,}7982; 19{,}8685].

4. Comparamos los anchos. 7,81297{,}8129 contra 16,070316{,}0703: el de predicción es bastante más ancho.

5. Explicamos de dónde viene el 11 extra. El intervalo de la media solo carga con el error de estimar la recta. El de predicción carga además con la dispersión propia de un caso individual alrededor de la recta, y esa no se achica nunca por más datos que se tengan.

6. Cuál usar en cada caso. Si la pregunta es «cuánto vale en promedio el sueldo en miles para los años de antigüedad igual a 1010», va el primero. Si es «cuánto va a dar un caso concreto», va el segundo. Confundirlos es el error más común del tema.

Respuesta: Media: [7,9269;15,7398][7{,}9269; 15{,}7398]. Predicción individual: [3,7982;19,8685][3{,}7982; 19{,}8685]

7. Con la recta y^=30,06252,3125x\hat{y} = 30{,}0625 - 2{,}3125 x, ajustada con datos de xx entre 11 y 1111 horas, alguien predice el valor para x=36x = 36 horas. Calculá lo que da la fórmula y evaluá si la predicción es válida.

Ver solución

1. Calculamos lo que devuelve la recta. y^=30,06252,312536=53,1875\hat{y} = 30{,}0625 - 2{,}3125 \cdot 36 = -53{,}1875 puntos.

2. Comparamos con el rango observado. Los datos van de 11 a 1111, y 3636 queda 2525 unidades por encima del máximo.

3. Nombramos el problema. Es una extrapolación: se está usando el modelo fuera del rango donde se lo ajustó.

4. Explicamos por qué no se puede confiar. Los datos no dicen nada sobre cómo se comporta la relación afuera de ese rango. Puede seguir siendo lineal, curvarse o cortarse por completo, y nada en el ajuste permite distinguirlo.

5. Mostramos que el modelo no avisa. La fórmula devuelve 53,1875-53{,}1875 sin ninguna señal de alerta. La responsabilidad de verificar el rango es de quien usa el modelo.

6. Qué hacer. Limitar las predicciones al intervalo [1;11][1; 11], o conseguir datos en el rango nuevo y volver a ajustar.

Respuesta: La fórmula da 53,1875-53{,}1875, pero la predicción no es válida: 3636 queda fuera del rango [1;11][1; 11] de los datos

8. Con una regresión de la cantidad de consultas sobre el gasto en publicidad (88 casos, xˉ=8,25\bar{x} = 8{,}25, (xxˉ)2=73,5\sum (x - \bar{x})^{2} = 73{,}5, s=2,2902s = 2{,}2902), calculá el ancho del intervalo de confianza para la media predicha en x=8x = 8 y en x=14x = 14 miles de pesos, y explicá la diferencia.

Ver solución

1. Escribimos el error estándar. EE=s1n+(x0xˉ)2SxxEE = s \sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{S_{xx}}}: el segundo término crece con la distancia al promedio de las xx.

2. Calculamos en x=8x = 8. (x0xˉ)2=0,0625(x_0 - \bar{x})^{2} = 0{,}0625, y el ancho del intervalo es 3,9763{,}976.

3. Calculamos en x=14x = 14. (x0xˉ)2=33,0625(x_0 - \bar{x})^{2} = 33{,}0625, y el ancho es 8,49748{,}4974.

4. Comparamos. 8,49748{,}4974 contra 3,9763{,}976: el intervalo es más ancho lejos del centro de los datos.

5. Explicamos por qué. La recta está mejor determinada cerca del promedio de las xx: ahí la incertidumbre sobre la pendiente casi no mueve la predicción. Lejos del centro, un pequeño error en la pendiente se amplifica.

6. La forma que toma el gráfico. Las bandas de confianza se abren hacia los dos lados como un moño, con la cintura en el promedio de las xx. Esa forma es la razón geométrica de por qué extrapolar es tan riesgoso.

Respuesta: El ancho pasa de 3,9763{,}976 en el centro a 8,49748{,}4974 en el extremo: el intervalo se abre al alejarse de la media de las xx

9. Una regresión de la cantidad de consultas sobre el gasto en publicidad con 88 casos dio y^=30,6376+3,9978x\hat{y} = 30{,}6376 + 3{,}9978 x, xˉ=5,625\bar{x} = 5{,}625, (xxˉ)2=55,875\sum (x - \bar{x})^{2} = 55{,}875 y s=1,6266s = 1{,}6266. Construí el intervalo del 95%95\% para el valor medio de yy cuando x=4x = 4 miles de pesos.

Ver solución

1. Calculamos la predicción puntual. y^=30,6376+3,9978446,6286\hat{y} = 30{,}6376 + 3{,}9978 \cdot 4 \approx 46{,}6286 consultas.

2. Escribimos el error estándar de la media predicha. EE=s1n+(x0xˉ)2(xxˉ)2EE = s \sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{\sum (x - \bar{x})^{2}}}

3. Reemplazamos. EE=1,626618+(45,625)255,875=0,6751EE = 1{,}6266 \cdot \sqrt{\dfrac{1}{8} + \dfrac{(4 - 5{,}625)^{2}}{55{,}875}} = 0{,}6751

4. Armamos el intervalo. t=2,4469t = 2{,}4469 con 66 grados, margen 1,65191{,}6519: [44,9767;48,2805][44{,}9767; 48{,}2805] consultas.

5. Interpretamos. Es un intervalo para el promedio de la cantidad de consultas de todos los casos con el gasto en publicidad igual a 44, no para un caso individual.

6. Verificamos que no sea extrapolación. Los datos de xx van de 11 a 99, y 44 queda adentro.

Respuesta: El intervalo para la media es [44,9767;48,2805][44{,}9767; 48{,}2805] consultas

10. Con la misma regresión de la nota del parcial sobre las horas de estudio (77 casos, s=1,8974s = 1{,}8974), en x=4x = 4 horas la predicción puntual es 36,333336{,}3333 puntos. Construí el intervalo de confianza para la media y el de predicción para un caso individual, y compará.

Ver solución

1. Escribimos los dos errores estándar. Para la media: s1n+(x0xˉ)2Sxxs \sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{S_{xx}}}. Para un caso individual: s1+1n+(x0xˉ)2Sxxs \sqrt{1 + \dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{S_{xx}}}.

2. Calculamos el de la media. EE=0,7545EE = 0{,}7545, y el intervalo es [34,3939;38,2728][34{,}3939; 38{,}2728].

3. Calculamos el de predicción. EE=2,0419EE = 2{,}0419, y el intervalo es [31,0845;41,5821][31{,}0845; 41{,}5821].

4. Comparamos los anchos. 3,87893{,}8789 contra 10,497610{,}4976: el de predicción es bastante más ancho.

5. Explicamos de dónde viene el 11 extra. El intervalo de la media solo carga con el error de estimar la recta. El de predicción carga además con la dispersión propia de un caso individual alrededor de la recta, y esa no se achica nunca por más datos que se tengan.

6. Cuál usar en cada caso. Si la pregunta es «cuánto vale en promedio la nota del parcial para las horas de estudio igual a 44», va el primero. Si es «cuánto va a dar un caso concreto», va el segundo. Confundirlos es el error más común del tema.

Respuesta: Media: [34,3939;38,2728][34{,}3939; 38{,}2728]. Predicción individual: [31,0845;41,5821][31{,}0845; 41{,}5821]

11. Con la recta y^=10,3594+2,9736x\hat{y} = 10{,}3594 + 2{,}9736 x, ajustada con datos de xx entre 44 y 1616 miles de pesos, alguien predice el valor para x=39x = 39 miles de pesos. Calculá lo que da la fórmula y evaluá si la predicción es válida.

Ver solución

1. Calculamos lo que devuelve la recta. y^=10,3594+2,973639126,3295\hat{y} = 10{,}3594 + 2{,}9736 \cdot 39 \approx 126{,}3295 consultas.

2. Comparamos con el rango observado. Los datos van de 44 a 1616, y 3939 queda 2323 unidades por encima del máximo.

3. Nombramos el problema. Es una extrapolación: se está usando el modelo fuera del rango donde se lo ajustó.

4. Explicamos por qué no se puede confiar. Los datos no dicen nada sobre cómo se comporta la relación afuera de ese rango. Puede seguir siendo lineal, curvarse o cortarse por completo, y nada en el ajuste permite distinguirlo.

5. Mostramos que el modelo no avisa. La fórmula devuelve 126,3295126{,}3295 sin ninguna señal de alerta. La responsabilidad de verificar el rango es de quien usa el modelo.

6. Qué hacer. Limitar las predicciones al intervalo [4;16][4; 16], o conseguir datos en el rango nuevo y volver a ajustar.

Respuesta: La fórmula da 126,3295126{,}3295, pero la predicción no es válida: 3939 queda fuera del rango [4;16][4; 16] de los datos

12. Con una regresión de el sueldo en miles sobre los años de antigüedad (77 casos, xˉ=8,2857\bar{x} = 8{,}2857, (xxˉ)2=129,4286\sum (x - \bar{x})^{2} = 129{,}4286, s=2,2283s = 2{,}2283), calculá el ancho del intervalo de confianza para la media predicha en x=8x = 8 y en x=15x = 15 años, y explicá la diferencia.

Ver solución

1. Escribimos el error estándar. EE=s1n+(x0xˉ)2SxxEE = s \sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^{2}}{S_{xx}}}: el segundo término crece con la distancia al promedio de las xx.

2. Calculamos en x=8x = 8. (x0xˉ)2=0,0816(x_0 - \bar{x})^{2} = 0{,}0816, y el ancho del intervalo es 4,33954{,}3395.

3. Calculamos en x=15x = 15. (x0xˉ)2=45,0816(x_0 - \bar{x})^{2} = 45{,}0816, y el ancho es 8,02888{,}0288.

4. Comparamos. 8,02888{,}0288 contra 4,33954{,}3395: el intervalo es más ancho lejos del centro de los datos.

5. Explicamos por qué. La recta está mejor determinada cerca del promedio de las xx: ahí la incertidumbre sobre la pendiente casi no mueve la predicción. Lejos del centro, un pequeño error en la pendiente se amplifica.

6. La forma que toma el gráfico. Las bandas de confianza se abren hacia los dos lados como un moño, con la cintura en el promedio de las xx. Esa forma es la razón geométrica de por qué extrapolar es tan riesgoso.

Respuesta: El ancho pasa de 4,33954{,}3395 en el centro a 8,02888{,}0288 en el extremo: el intervalo se abre al alejarse de la media de las xx

Las cuentas de este material están verificadas una por una. Si aun así encontrás algo raro, .