Ejercicios: Mínimos cuadrados
Si no te acordás cómo se usa, repasá la teoría.
Las 12 actividades recorren los distintos tipos de ejercicio del tema, con tres variantes de cada uno. Si te trabás en una, mirá la solución y seguí con la siguiente.
1. Se relevaron casos con = la temperatura e = el consumo de energía: · · · · · · · . Hallá la recta de mínimos cuadrados.
Ver solución
1. Calculamos los dos promedios. y .
2. Calculamos las sumas centradas. y .
3. Calculamos la pendiente.
4. Calculamos la ordenada al origen.
5. Escribimos la recta.
6. Qué minimiza esta recta. La suma de los cuadrados de las distancias verticales entre los puntos y la recta. Se toman verticales y no perpendiculares porque el objetivo es predecir a partir de , así que el error que interesa es el de predicción.
Respuesta:
2. De casos con = el gasto en publicidad e = la cantidad de consultas se obtuvo la recta . Predecí el valor de para miles de pesos y verificá que el punto quede dentro del rango de los datos.
Ver solución
1. Escribimos la recta.
2. Reemplazamos. consultas.
3. Verificamos el rango de los datos. Los valores de observados van de a miles de pesos, y queda adentro. La predicción es una interpolación.
4. Interpretamos. Para un caso con el gasto en publicidad igual a miles de pesos, el modelo predice un valor de consultas para la cantidad de consultas.
5. Marcamos el límite del modelo. La recta sigue dando números fuera de , pero esos valores no tienen respaldo en lo observado. Extrapolar es el error más frecuente del tema.
6. Qué es esta predicción. El valor promedio de que el modelo espera para ese , no el valor exacto de un caso particular. Los casos individuales se desvían de la recta.
Respuesta: consultas
3. Con = las horas de estudio e = la nota del parcial se obtuvo la recta , con los datos de entre y horas. Interpretá los dos coeficientes en el contexto del problema.
Ver solución
1. Interpretamos la pendiente. significa que por cada hora más de las horas de estudio, la nota del parcial disminuye en promedio puntos.
2. Marcamos que es un promedio. No dice que cada caso concreto cambie exactamente eso: describe la tendencia media de la nube de puntos.
3. Interpretamos la ordenada al origen. es el valor predicho para .
4. Vemos si esa interpretación tiene sentido. Los datos de van de a , y queda fuera de ese rango, así que el número es una extrapolación y no se puede interpretar literalmente. Funciona como constante de ajuste, no como una predicción real.
5. Lo que la recta no dice. Nada sobre causa. Describe la nube de puntos, no explica por qué se mueven juntas las dos variables.
6. El chequeo de sentido. El signo de la pendiente tiene que coincidir con la relación esperada. Acá es negativa, así que las dos variables se mueven en sentidos opuestos.
Respuesta: : cambio promedio de la nota del parcial por unidad de las horas de estudio. : valor predicho en
4. Con la recta y los datos · · · · · · , calculá los residuos y verificá que sumen cero.
Ver solución
1. Definimos residuo. : la distancia vertical entre el punto observado y la recta. Es positivo si el punto está por encima y negativo si está por debajo.
2. Calculamos los valores predichos. : 2{,}6222 · : -0{,}6889 · : -0{,}6889 · : -2{,}3444 · : -4 · : -5{,}6556 · : -17{,}2444
3. Calculamos los residuos. · · · · · ·
4. Verificamos que sumen cero. . Siempre da cero: es una consecuencia directa de cómo se eligen y al minimizar la suma de cuadrados.
5. Identificamos el punto peor ajustado. El residuo más grande en valor absoluto es , en : es el punto que más se aparta de la recta.
6. Para qué se miran los residuos. Si al graficarlos contra aparece un patrón, curva o embudo, el modelo lineal no es el adecuado. Ese diagnóstico no lo da ningún resumen numérico del ajuste.
Respuesta: Los residuos son ; ; ; ; ; ; , y suman
5. Se relevaron casos con = las horas de estudio e = la nota del parcial: · · · · · · . Hallá la recta de mínimos cuadrados.
Ver solución
1. Calculamos los dos promedios. y .
2. Calculamos las sumas centradas. y .
3. Calculamos la pendiente.
4. Calculamos la ordenada al origen.
5. Escribimos la recta.
6. Qué minimiza esta recta. La suma de los cuadrados de las distancias verticales entre los puntos y la recta. Se toman verticales y no perpendiculares porque el objetivo es predecir a partir de , así que el error que interesa es el de predicción.
Respuesta:
6. De casos con = la temperatura e = el consumo de energía se obtuvo la recta . Predecí el valor de para grados y verificá que el punto quede dentro del rango de los datos.
Ver solución
1. Escribimos la recta.
2. Reemplazamos. kWh.
3. Verificamos el rango de los datos. Los valores de observados van de a grados, y queda adentro. La predicción es una interpolación.
4. Interpretamos. Para un caso con la temperatura igual a grados, el modelo predice un valor de kWh para el consumo de energía.
5. Marcamos el límite del modelo. La recta sigue dando números fuera de , pero esos valores no tienen respaldo en lo observado. Extrapolar es el error más frecuente del tema.
6. Qué es esta predicción. El valor promedio de que el modelo espera para ese , no el valor exacto de un caso particular. Los casos individuales se desvían de la recta.
Respuesta: kWh
7. Con = los años de antigüedad e = el sueldo en miles se obtuvo la recta , con los datos de entre y años. Interpretá los dos coeficientes en el contexto del problema.
Ver solución
1. Interpretamos la pendiente. significa que por cada año más de los años de antigüedad, el sueldo en miles aumenta en promedio miles de pesos.
2. Marcamos que es un promedio. No dice que cada caso concreto cambie exactamente eso: describe la tendencia media de la nube de puntos.
3. Interpretamos la ordenada al origen. es el valor predicho para .
4. Vemos si esa interpretación tiene sentido. Los datos de van de a , y queda fuera de ese rango, así que el número es una extrapolación y no se puede interpretar literalmente. Funciona como constante de ajuste, no como una predicción real.
5. Lo que la recta no dice. Nada sobre causa. Describe la nube de puntos, no explica por qué se mueven juntas las dos variables.
6. El chequeo de sentido. El signo de la pendiente tiene que coincidir con la relación esperada. Acá es positiva, así que las dos variables se mueven en el mismo sentido.
Respuesta: : cambio promedio de el sueldo en miles por unidad de los años de antigüedad. : valor predicho en
8. Con la recta y los datos · · · · · · , calculá los residuos y verificá que sumen cero.
Ver solución
1. Definimos residuo. : la distancia vertical entre el punto observado y la recta. Es positivo si el punto está por encima y negativo si está por debajo.
2. Calculamos los valores predichos. : 35{,}5751 · : 39{,}3244 · : 50{,}5722 · : 58{,}0708 · : 65{,}5694 · : 54{,}3215 · : 80{,}5666
3. Calculamos los residuos. · · · · · ·
4. Verificamos que sumen cero. . Siempre da cero: es una consecuencia directa de cómo se eligen y al minimizar la suma de cuadrados.
5. Identificamos el punto peor ajustado. El residuo más grande en valor absoluto es , en : es el punto que más se aparta de la recta.
6. Para qué se miran los residuos. Si al graficarlos contra aparece un patrón, curva o embudo, el modelo lineal no es el adecuado. Ese diagnóstico no lo da ningún resumen numérico del ajuste.
Respuesta: Los residuos son ; ; ; ; ; ; , y suman
9. Se relevaron casos con = la cantidad de visitas e = las ventas del día: · · · · · · . Hallá la recta de mínimos cuadrados.
Ver solución
1. Calculamos los dos promedios. y .
2. Calculamos las sumas centradas. y .
3. Calculamos la pendiente.
4. Calculamos la ordenada al origen.
5. Escribimos la recta.
6. Qué minimiza esta recta. La suma de los cuadrados de las distancias verticales entre los puntos y la recta. Se toman verticales y no perpendiculares porque el objetivo es predecir a partir de , así que el error que interesa es el de predicción.
Respuesta:
10. De casos con = las horas de estudio e = la nota del parcial se obtuvo la recta . Predecí el valor de para horas y verificá que el punto quede dentro del rango de los datos.
Ver solución
1. Escribimos la recta.
2. Reemplazamos. puntos.
3. Verificamos el rango de los datos. Los valores de observados van de a horas, y queda adentro. La predicción es una interpolación.
4. Interpretamos. Para un caso con las horas de estudio igual a horas, el modelo predice un valor de puntos para la nota del parcial.
5. Marcamos el límite del modelo. La recta sigue dando números fuera de , pero esos valores no tienen respaldo en lo observado. Extrapolar es el error más frecuente del tema.
6. Qué es esta predicción. El valor promedio de que el modelo espera para ese , no el valor exacto de un caso particular. Los casos individuales se desvían de la recta.
Respuesta: puntos
11. Con = la cantidad de visitas e = las ventas del día se obtuvo la recta , con los datos de entre y visitas. Interpretá los dos coeficientes en el contexto del problema.
Ver solución
1. Interpretamos la pendiente. significa que por cada visita más de la cantidad de visitas, las ventas del día aumenta en promedio unidades.
2. Marcamos que es un promedio. No dice que cada caso concreto cambie exactamente eso: describe la tendencia media de la nube de puntos.
3. Interpretamos la ordenada al origen. es el valor predicho para .
4. Vemos si esa interpretación tiene sentido. Los datos de van de a , y queda fuera de ese rango, así que el número es una extrapolación y no se puede interpretar literalmente. Funciona como constante de ajuste, no como una predicción real.
5. Lo que la recta no dice. Nada sobre causa. Describe la nube de puntos, no explica por qué se mueven juntas las dos variables.
6. El chequeo de sentido. El signo de la pendiente tiene que coincidir con la relación esperada. Acá es positiva, así que las dos variables se mueven en el mismo sentido.
Respuesta: : cambio promedio de las ventas del día por unidad de la cantidad de visitas. : valor predicho en
12. Con la recta y los datos · · · · · · , calculá los residuos y verificá que sumen cero.
Ver solución
1. Definimos residuo. : la distancia vertical entre el punto observado y la recta. Es positivo si el punto está por encima y negativo si está por debajo.
2. Calculamos los valores predichos. : 45{,}6667 · : 54{,}3333 · : 63 · : 71{,}6667 · : 80{,}3333 · : 67{,}3333 · : 71{,}6667
3. Calculamos los residuos. · · · · · ·
4. Verificamos que sumen cero. . Siempre da cero: es una consecuencia directa de cómo se eligen y al minimizar la suma de cuadrados.
5. Identificamos el punto peor ajustado. El residuo más grande en valor absoluto es , en : es el punto que más se aparta de la recta.
6. Para qué se miran los residuos. Si al graficarlos contra aparece un patrón, curva o embudo, el modelo lineal no es el adecuado. Ese diagnóstico no lo da ningún resumen numérico del ajuste.
Respuesta: Los residuos son ; ; ; ; ; ; , y suman
Integradores de Inferencia estadística: practicá este tema junto con el resto de la unidad
Las cuentas de este material están verificadas una por una. Si aun así encontrás algo raro, .