Ejercicios: Predicción y sus límites
Si no te acordás cómo se usa, repasá la teoría.
Las 12 actividades recorren los distintos tipos de ejercicio del tema, con tres variantes de cada uno. Si te trabás en una, mirá la solución y seguí con la siguiente.
1. Una regresión de el sueldo en miles sobre los años de antigüedad con casos dio , , y . Construí el intervalo del para el valor medio de cuando años.
Ver solución
1. Calculamos la predicción puntual. miles de pesos.
2. Escribimos el error estándar de la media predicha.
3. Reemplazamos.
4. Armamos el intervalo. con grados, margen : miles de pesos.
5. Interpretamos. Es un intervalo para el promedio de el sueldo en miles de todos los casos con los años de antigüedad igual a , no para un caso individual.
6. Verificamos que no sea extrapolación. Los datos de van de a , y queda adentro.
Respuesta: El intervalo para la media es miles de pesos
2. Con la misma regresión de la cantidad de consultas sobre el gasto en publicidad ( casos, ), en miles de pesos la predicción puntual es consultas. Construí el intervalo de confianza para la media y el de predicción para un caso individual, y compará.
Ver solución
1. Escribimos los dos errores estándar. Para la media: . Para un caso individual: .
2. Calculamos el de la media. , y el intervalo es .
3. Calculamos el de predicción. , y el intervalo es .
4. Comparamos los anchos. contra : el de predicción es bastante más ancho.
5. Explicamos de dónde viene el extra. El intervalo de la media solo carga con el error de estimar la recta. El de predicción carga además con la dispersión propia de un caso individual alrededor de la recta, y esa no se achica nunca por más datos que se tengan.
6. Cuál usar en cada caso. Si la pregunta es «cuánto vale en promedio la cantidad de consultas para el gasto en publicidad igual a », va el primero. Si es «cuánto va a dar un caso concreto», va el segundo. Confundirlos es el error más común del tema.
Respuesta: Media: . Predicción individual:
3. Con la recta , ajustada con datos de entre y visitas, alguien predice el valor para visitas. Calculá lo que da la fórmula y evaluá si la predicción es válida.
Ver solución
1. Calculamos lo que devuelve la recta. unidades.
2. Comparamos con el rango observado. Los datos van de a , y queda unidades por encima del máximo.
3. Nombramos el problema. Es una extrapolación: se está usando el modelo fuera del rango donde se lo ajustó.
4. Explicamos por qué no se puede confiar. Los datos no dicen nada sobre cómo se comporta la relación afuera de ese rango. Puede seguir siendo lineal, curvarse o cortarse por completo, y nada en el ajuste permite distinguirlo.
5. Mostramos que el modelo no avisa. La fórmula devuelve sin ninguna señal de alerta. La responsabilidad de verificar el rango es de quien usa el modelo.
6. Qué hacer. Limitar las predicciones al intervalo , o conseguir datos en el rango nuevo y volver a ajustar.
Respuesta: La fórmula da , pero la predicción no es válida: queda fuera del rango de los datos
4. Con una regresión de el consumo de energía sobre la temperatura ( casos, , , ), calculá el ancho del intervalo de confianza para la media predicha en y en grados, y explicá la diferencia.
Ver solución
1. Escribimos el error estándar. : el segundo término crece con la distancia al promedio de las .
2. Calculamos en . , y el ancho del intervalo es .
3. Calculamos en . , y el ancho es .
4. Comparamos. contra : el intervalo es más ancho lejos del centro de los datos.
5. Explicamos por qué. La recta está mejor determinada cerca del promedio de las : ahí la incertidumbre sobre la pendiente casi no mueve la predicción. Lejos del centro, un pequeño error en la pendiente se amplifica.
6. La forma que toma el gráfico. Las bandas de confianza se abren hacia los dos lados como un moño, con la cintura en el promedio de las . Esa forma es la razón geométrica de por qué extrapolar es tan riesgoso.
Respuesta: El ancho pasa de en el centro a en el extremo: el intervalo se abre al alejarse de la media de las
5. Una regresión de la nota del parcial sobre las horas de estudio con casos dio , , y . Construí el intervalo del para el valor medio de cuando horas.
Ver solución
1. Calculamos la predicción puntual. puntos.
2. Escribimos el error estándar de la media predicha.
3. Reemplazamos.
4. Armamos el intervalo. con grados, margen : puntos.
5. Interpretamos. Es un intervalo para el promedio de la nota del parcial de todos los casos con las horas de estudio igual a , no para un caso individual.
6. Verificamos que no sea extrapolación. Los datos de van de a , y queda adentro.
Respuesta: El intervalo para la media es puntos
6. Con la misma regresión de el sueldo en miles sobre los años de antigüedad ( casos, ), en años la predicción puntual es miles de pesos. Construí el intervalo de confianza para la media y el de predicción para un caso individual, y compará.
Ver solución
1. Escribimos los dos errores estándar. Para la media: . Para un caso individual: .
2. Calculamos el de la media. , y el intervalo es .
3. Calculamos el de predicción. , y el intervalo es .
4. Comparamos los anchos. contra : el de predicción es bastante más ancho.
5. Explicamos de dónde viene el extra. El intervalo de la media solo carga con el error de estimar la recta. El de predicción carga además con la dispersión propia de un caso individual alrededor de la recta, y esa no se achica nunca por más datos que se tengan.
6. Cuál usar en cada caso. Si la pregunta es «cuánto vale en promedio el sueldo en miles para los años de antigüedad igual a », va el primero. Si es «cuánto va a dar un caso concreto», va el segundo. Confundirlos es el error más común del tema.
Respuesta: Media: . Predicción individual:
7. Con la recta , ajustada con datos de entre y horas, alguien predice el valor para horas. Calculá lo que da la fórmula y evaluá si la predicción es válida.
Ver solución
1. Calculamos lo que devuelve la recta. puntos.
2. Comparamos con el rango observado. Los datos van de a , y queda unidades por encima del máximo.
3. Nombramos el problema. Es una extrapolación: se está usando el modelo fuera del rango donde se lo ajustó.
4. Explicamos por qué no se puede confiar. Los datos no dicen nada sobre cómo se comporta la relación afuera de ese rango. Puede seguir siendo lineal, curvarse o cortarse por completo, y nada en el ajuste permite distinguirlo.
5. Mostramos que el modelo no avisa. La fórmula devuelve sin ninguna señal de alerta. La responsabilidad de verificar el rango es de quien usa el modelo.
6. Qué hacer. Limitar las predicciones al intervalo , o conseguir datos en el rango nuevo y volver a ajustar.
Respuesta: La fórmula da , pero la predicción no es válida: queda fuera del rango de los datos
8. Con una regresión de la cantidad de consultas sobre el gasto en publicidad ( casos, , , ), calculá el ancho del intervalo de confianza para la media predicha en y en miles de pesos, y explicá la diferencia.
Ver solución
1. Escribimos el error estándar. : el segundo término crece con la distancia al promedio de las .
2. Calculamos en . , y el ancho del intervalo es .
3. Calculamos en . , y el ancho es .
4. Comparamos. contra : el intervalo es más ancho lejos del centro de los datos.
5. Explicamos por qué. La recta está mejor determinada cerca del promedio de las : ahí la incertidumbre sobre la pendiente casi no mueve la predicción. Lejos del centro, un pequeño error en la pendiente se amplifica.
6. La forma que toma el gráfico. Las bandas de confianza se abren hacia los dos lados como un moño, con la cintura en el promedio de las . Esa forma es la razón geométrica de por qué extrapolar es tan riesgoso.
Respuesta: El ancho pasa de en el centro a en el extremo: el intervalo se abre al alejarse de la media de las
9. Una regresión de la cantidad de consultas sobre el gasto en publicidad con casos dio , , y . Construí el intervalo del para el valor medio de cuando miles de pesos.
Ver solución
1. Calculamos la predicción puntual. consultas.
2. Escribimos el error estándar de la media predicha.
3. Reemplazamos.
4. Armamos el intervalo. con grados, margen : consultas.
5. Interpretamos. Es un intervalo para el promedio de la cantidad de consultas de todos los casos con el gasto en publicidad igual a , no para un caso individual.
6. Verificamos que no sea extrapolación. Los datos de van de a , y queda adentro.
Respuesta: El intervalo para la media es consultas
10. Con la misma regresión de la nota del parcial sobre las horas de estudio ( casos, ), en horas la predicción puntual es puntos. Construí el intervalo de confianza para la media y el de predicción para un caso individual, y compará.
Ver solución
1. Escribimos los dos errores estándar. Para la media: . Para un caso individual: .
2. Calculamos el de la media. , y el intervalo es .
3. Calculamos el de predicción. , y el intervalo es .
4. Comparamos los anchos. contra : el de predicción es bastante más ancho.
5. Explicamos de dónde viene el extra. El intervalo de la media solo carga con el error de estimar la recta. El de predicción carga además con la dispersión propia de un caso individual alrededor de la recta, y esa no se achica nunca por más datos que se tengan.
6. Cuál usar en cada caso. Si la pregunta es «cuánto vale en promedio la nota del parcial para las horas de estudio igual a », va el primero. Si es «cuánto va a dar un caso concreto», va el segundo. Confundirlos es el error más común del tema.
Respuesta: Media: . Predicción individual:
11. Con la recta , ajustada con datos de entre y miles de pesos, alguien predice el valor para miles de pesos. Calculá lo que da la fórmula y evaluá si la predicción es válida.
Ver solución
1. Calculamos lo que devuelve la recta. consultas.
2. Comparamos con el rango observado. Los datos van de a , y queda unidades por encima del máximo.
3. Nombramos el problema. Es una extrapolación: se está usando el modelo fuera del rango donde se lo ajustó.
4. Explicamos por qué no se puede confiar. Los datos no dicen nada sobre cómo se comporta la relación afuera de ese rango. Puede seguir siendo lineal, curvarse o cortarse por completo, y nada en el ajuste permite distinguirlo.
5. Mostramos que el modelo no avisa. La fórmula devuelve sin ninguna señal de alerta. La responsabilidad de verificar el rango es de quien usa el modelo.
6. Qué hacer. Limitar las predicciones al intervalo , o conseguir datos en el rango nuevo y volver a ajustar.
Respuesta: La fórmula da , pero la predicción no es válida: queda fuera del rango de los datos
12. Con una regresión de el sueldo en miles sobre los años de antigüedad ( casos, , , ), calculá el ancho del intervalo de confianza para la media predicha en y en años, y explicá la diferencia.
Ver solución
1. Escribimos el error estándar. : el segundo término crece con la distancia al promedio de las .
2. Calculamos en . , y el ancho del intervalo es .
3. Calculamos en . , y el ancho es .
4. Comparamos. contra : el intervalo es más ancho lejos del centro de los datos.
5. Explicamos por qué. La recta está mejor determinada cerca del promedio de las : ahí la incertidumbre sobre la pendiente casi no mueve la predicción. Lejos del centro, un pequeño error en la pendiente se amplifica.
6. La forma que toma el gráfico. Las bandas de confianza se abren hacia los dos lados como un moño, con la cintura en el promedio de las . Esa forma es la razón geométrica de por qué extrapolar es tan riesgoso.
Respuesta: El ancho pasa de en el centro a en el extremo: el intervalo se abre al alejarse de la media de las
Integradores de Inferencia estadística: practicá este tema junto con el resto de la unidad
Las cuentas de este material están verificadas una por una. Si aun así encontrás algo raro, .