Método

Ejercicios: Regresión lineal múltiple

y^=b0+b1x1+b2x2++bkxk\hat{y} = b_{0} + b_{1}x_{1} + b_{2}x_{2} + \ldots + b_{k}x_{k}

Si no te acordás cómo se usa, repasá la teoría.

Las 12 actividades recorren los distintos tipos de ejercicio del tema, con tres variantes de cada uno. Si te trabás en una, mirá la solución y seguí con la siguiente.

1. Se ajustó el modelo y^=55+4x1+2x2\hat{y} = 55 + 4 x_1 + 2 x_2, donde yy es el sueldo, en miles, x1x_1 es los años de experiencia y x2x_2 es los años de estudio. Predecí el valor de yy para x1=19x_1 = 19 y x2=4x_2 = 4.

Ver solución

1. Escribimos el modelo. y^=b0+b1x1+b2x2\hat{y} = b_0 + b_1 x_1 + b_2 x_2: en vez de una recta, el ajuste es un plano.

2. Reemplazamos los dos valores. y^=55+419+24\hat{y} = 55 + 4 \cdot 19 + 2 \cdot 4

3. Calculamos los términos. 419=764 \cdot 19 = 76 y 24=82 \cdot 4 = 8.

4. Sumamos. y^=55+76+8=139\hat{y} = 55 + 76 + 8 = 139 miles de pesos.

5. Marcamos el mismo límite que en la regresión simple. La predicción vale solo dentro del rango donde se observaron las dos variables explicativas. Con dos variables el rango es una región del plano, no dos intervalos por separado.

6. Un cuidado extra del caso múltiple. x1=19x_1 = 19 y x2=4x_2 = 4 pueden ser valores razonables por separado y aun así esa combinación puede no haberse observado nunca.

Respuesta: y^=139\hat{y} = 139 miles de pesos

2. En el modelo y^=50+3x12x2\hat{y} = 50 + 3 x_1 - 2 x_2, donde yy es el sueldo, en miles, x1x_1 es los años de experiencia y x2x_2 es los años de estudio, interpretá el coeficiente b1b_1 y explicá qué cambia respecto de la regresión simple.

Ver solución

1. Escribimos la interpretación. b1=3b_1 = 3 significa que por cada unidad más de los años de experiencia, el sueldo, en miles aumenta en promedio 33 miles de pesos, manteniendo la otra variable constante.

2. Marcamos la parte que cambia todo. «Manteniendo la otra variable constante». En regresión simple no había nada que mantener fijo; acá el coeficiente mide el efecto propio de esa variable, ya descontado lo que aporta la otra.

3. Interpretamos el segundo coeficiente. b2=2b_2 = -2: por cada unidad más de los años de estudio, el sueldo, en miles baja 22 miles de pesos en promedio, con los años de experiencia fija.

4. Vemos por qué la diferencia importa. Si las dos variables explicativas están relacionadas entre sí, el coeficiente de una en el modelo múltiple puede ser muy distinto del que tendría en un modelo simple, y hasta cambiar de signo.

5. Interpretamos la constante. b0=50b_0 = 50 es el valor predicho cuando las dos explicativas valen cero, y casi nunca corresponde a un caso real.

6. Lo que sigue sin decir el modelo. Nada sobre causa. Que un coeficiente sea grande no prueba que esa variable empuje a la respuesta.

Respuesta: b1=3b_1 = 3: cambio promedio de el sueldo, en miles por unidad de los años de experiencia, manteniendo los años de estudio constante

3. Un modelo de regresión múltiple para el precio de la vivienda, en miles con 44 variables explicativas y 2020 casos dio R2=0,9R^{2} = 0{,}9. Calculá el R2R^{2} ajustado y explicá para qué sirve.

Ver solución

1. Escribimos la fórmula. Raj2=1(1R2)n1nk1R^{2}_{aj} = 1 - (1 - R^{2}) \cdot \dfrac{n - 1}{n - k - 1}

2. Identificamos los datos. n=20n = 20, k=4k = 4 variables explicativas, R2=0,9R^{2} = 0{,}9.

3. Reemplazamos. Raj2=1(10,9)191510,11,26670,8733R^{2}_{aj} = 1 - (1 - 0{,}9) \cdot \dfrac{19}{15} \approx 1 - 0{,}1 \cdot 1{,}2667 \approx 0{,}8733

4. Comparamos. 0,8733<0,90{,}8733 < 0{,}9: el ajustado siempre queda por debajo, y la diferencia es de 0,02670{,}0267.

5. Explicamos para qué sirve. El R2R^{2} común nunca baja al agregar variables, así que no sirve para comparar modelos con distinta cantidad de explicativas. El ajustado penaliza por cada variable agregada.

6. Cómo se usa. Si al sumar una variable el R2R^{2} sube pero el ajustado baja, esa variable no aporta lo suficiente para justificar el grado de libertad que consume.

Respuesta: Raj2=0,8733R^{2}_{aj} = 0{,}8733, menor que el R2=0,9R^{2} = 0{,}9

4. Con 2525 casos, un modelo con 22 variables explicativas dio R2=0,59R^{2} = 0{,}59. Se agrega una tercera variable, sin relación aparente con las ventas mensuales, en miles, y el R2R^{2} pasa a 0,5920{,}592. Decidí si conviene incorporarla.

Ver solución

1. Observamos qué pasó con el R2R^{2}. Subió de 0,590{,}59 a 0,5920{,}592, o sea 0,0020{,}002.

2. Explicamos por qué siempre sube. Agregar una variable nunca puede empeorar el ajuste dentro de la muestra: en el peor caso el método le asigna un coeficiente cercano a cero. El R2R^{2} solo puede subir o quedarse igual, aunque la variable sea puro ruido.

3. Calculamos el ajustado del modelo original. 1(10,59)24220,55271 - (1 - 0{,}59) \cdot \dfrac{24}{22} \approx 0{,}5527

4. Calculamos el ajustado del modelo ampliado. 1(10,592)24210,53371 - (1 - 0{,}592) \cdot \dfrac{24}{21} \approx 0{,}5337

5. Comparamos. El ajustado bajó de 0,55270{,}5527 a 0,53370{,}5337.

6. Decidimos. No conviene incorporarla: la mejora del ajuste no compensa el grado de libertad que consume.

Respuesta: El R2R^{2} sube siempre, pero el ajustado va de 0,55270{,}5527 a 0,53370{,}5337: no conviene incorporarla

5. Se ajustó el modelo y^=45+4x1+1x2\hat{y} = 45 + 4 x_1 + 1 x_2, donde yy es el rendimiento del cultivo, x1x_1 es los kilos de fertilizante y x2x_2 es los milímetros de lluvia. Predecí el valor de yy para x1=5x_1 = 5 y x2=10x_2 = 10.

Ver solución

1. Escribimos el modelo. y^=b0+b1x1+b2x2\hat{y} = b_0 + b_1 x_1 + b_2 x_2: en vez de una recta, el ajuste es un plano.

2. Reemplazamos los dos valores. y^=45+45+110\hat{y} = 45 + 4 \cdot 5 + 1 \cdot 10

3. Calculamos los términos. 45=204 \cdot 5 = 20 y 110=101 \cdot 10 = 10.

4. Sumamos. y^=45+20+10=75\hat{y} = 45 + 20 + 10 = 75 quintales.

5. Marcamos el mismo límite que en la regresión simple. La predicción vale solo dentro del rango donde se observaron las dos variables explicativas. Con dos variables el rango es una región del plano, no dos intervalos por separado.

6. Un cuidado extra del caso múltiple. x1=5x_1 = 5 y x2=10x_2 = 10 pueden ser valores razonables por separado y aun así esa combinación puede no haberse observado nunca.

Respuesta: y^=75\hat{y} = 75 quintales

6. En el modelo y^=20+3x1+2x2\hat{y} = 20 + 3 x_1 + 2 x_2, donde yy es el precio de la vivienda, en miles, x1x_1 es los metros cuadrados y x2x_2 es la antigüedad en años, interpretá el coeficiente b1b_1 y explicá qué cambia respecto de la regresión simple.

Ver solución

1. Escribimos la interpretación. b1=3b_1 = 3 significa que por cada unidad más de los metros cuadrados, el precio de la vivienda, en miles aumenta en promedio 33 miles de pesos, manteniendo la otra variable constante.

2. Marcamos la parte que cambia todo. «Manteniendo la otra variable constante». En regresión simple no había nada que mantener fijo; acá el coeficiente mide el efecto propio de esa variable, ya descontado lo que aporta la otra.

3. Interpretamos el segundo coeficiente. b2=2b_2 = 2: por cada unidad más de la antigüedad en años, el precio de la vivienda, en miles sube 22 miles de pesos en promedio, con los metros cuadrados fija.

4. Vemos por qué la diferencia importa. Si las dos variables explicativas están relacionadas entre sí, el coeficiente de una en el modelo múltiple puede ser muy distinto del que tendría en un modelo simple, y hasta cambiar de signo.

5. Interpretamos la constante. b0=20b_0 = 20 es el valor predicho cuando las dos explicativas valen cero, y casi nunca corresponde a un caso real.

6. Lo que sigue sin decir el modelo. Nada sobre causa. Que un coeficiente sea grande no prueba que esa variable empuje a la respuesta.

Respuesta: b1=3b_1 = 3: cambio promedio de el precio de la vivienda, en miles por unidad de los metros cuadrados, manteniendo la antigüedad en años constante

7. Un modelo de regresión múltiple para las ventas mensuales, en miles con 44 variables explicativas y 5050 casos dio R2=0,72R^{2} = 0{,}72. Calculá el R2R^{2} ajustado y explicá para qué sirve.

Ver solución

1. Escribimos la fórmula. Raj2=1(1R2)n1nk1R^{2}_{aj} = 1 - (1 - R^{2}) \cdot \dfrac{n - 1}{n - k - 1}

2. Identificamos los datos. n=50n = 50, k=4k = 4 variables explicativas, R2=0,72R^{2} = 0{,}72.

3. Reemplazamos. Raj2=1(10,72)494510,281,08890,6951R^{2}_{aj} = 1 - (1 - 0{,}72) \cdot \dfrac{49}{45} \approx 1 - 0{,}28 \cdot 1{,}0889 \approx 0{,}6951

4. Comparamos. 0,6951<0,720{,}6951 < 0{,}72: el ajustado siempre queda por debajo, y la diferencia es de 0,02490{,}0249.

5. Explicamos para qué sirve. El R2R^{2} común nunca baja al agregar variables, así que no sirve para comparar modelos con distinta cantidad de explicativas. El ajustado penaliza por cada variable agregada.

6. Cómo se usa. Si al sumar una variable el R2R^{2} sube pero el ajustado baja, esa variable no aporta lo suficiente para justificar el grado de libertad que consume.

Respuesta: Raj2=0,6951R^{2}_{aj} = 0{,}6951, menor que el R2=0,72R^{2} = 0{,}72

8. Con 2525 casos, un modelo con 22 variables explicativas dio R2=0,56R^{2} = 0{,}56. Se agrega una tercera variable, sin relación aparente con el rendimiento del cultivo, y el R2R^{2} pasa a 0,5640{,}564. Decidí si conviene incorporarla.

Ver solución

1. Observamos qué pasó con el R2R^{2}. Subió de 0,560{,}56 a 0,5640{,}564, o sea 0,0040{,}004.

2. Explicamos por qué siempre sube. Agregar una variable nunca puede empeorar el ajuste dentro de la muestra: en el peor caso el método le asigna un coeficiente cercano a cero. El R2R^{2} solo puede subir o quedarse igual, aunque la variable sea puro ruido.

3. Calculamos el ajustado del modelo original. 1(10,56)2422=0,521 - (1 - 0{,}56) \cdot \dfrac{24}{22} = 0{,}52

4. Calculamos el ajustado del modelo ampliado. 1(10,564)24210,50171 - (1 - 0{,}564) \cdot \dfrac{24}{21} \approx 0{,}5017

5. Comparamos. El ajustado bajó de 0,520{,}52 a 0,50170{,}5017.

6. Decidimos. No conviene incorporarla: la mejora del ajuste no compensa el grado de libertad que consume.

Respuesta: El R2R^{2} sube siempre, pero el ajustado va de 0,520{,}52 a 0,50170{,}5017: no conviene incorporarla

9. Se ajustó el modelo y^=50+3x1+2x2\hat{y} = 50 + 3 x_1 + 2 x_2, donde yy es las ventas mensuales, en miles, x1x_1 es el gasto en publicidad, en miles y x2x_2 es la cantidad de vendedores. Predecí el valor de yy para x1=10x_1 = 10 y x2=13x_2 = 13.

Ver solución

1. Escribimos el modelo. y^=b0+b1x1+b2x2\hat{y} = b_0 + b_1 x_1 + b_2 x_2: en vez de una recta, el ajuste es un plano.

2. Reemplazamos los dos valores. y^=50+310+213\hat{y} = 50 + 3 \cdot 10 + 2 \cdot 13

3. Calculamos los términos. 310=303 \cdot 10 = 30 y 213=262 \cdot 13 = 26.

4. Sumamos. y^=50+30+26=106\hat{y} = 50 + 30 + 26 = 106 miles de pesos.

5. Marcamos el mismo límite que en la regresión simple. La predicción vale solo dentro del rango donde se observaron las dos variables explicativas. Con dos variables el rango es una región del plano, no dos intervalos por separado.

6. Un cuidado extra del caso múltiple. x1=10x_1 = 10 y x2=13x_2 = 13 pueden ser valores razonables por separado y aun así esa combinación puede no haberse observado nunca.

Respuesta: y^=106\hat{y} = 106 miles de pesos

10. En el modelo y^=10+3x1+2x2\hat{y} = 10 + 3 x_1 + 2 x_2, donde yy es las ventas mensuales, en miles, x1x_1 es el gasto en publicidad, en miles y x2x_2 es la cantidad de vendedores, interpretá el coeficiente b1b_1 y explicá qué cambia respecto de la regresión simple.

Ver solución

1. Escribimos la interpretación. b1=3b_1 = 3 significa que por cada unidad más de el gasto en publicidad, en miles, las ventas mensuales, en miles aumenta en promedio 33 miles de pesos, manteniendo la otra variable constante.

2. Marcamos la parte que cambia todo. «Manteniendo la otra variable constante». En regresión simple no había nada que mantener fijo; acá el coeficiente mide el efecto propio de esa variable, ya descontado lo que aporta la otra.

3. Interpretamos el segundo coeficiente. b2=2b_2 = 2: por cada unidad más de la cantidad de vendedores, las ventas mensuales, en miles sube 22 miles de pesos en promedio, con el gasto en publicidad, en miles fija.

4. Vemos por qué la diferencia importa. Si las dos variables explicativas están relacionadas entre sí, el coeficiente de una en el modelo múltiple puede ser muy distinto del que tendría en un modelo simple, y hasta cambiar de signo.

5. Interpretamos la constante. b0=10b_0 = 10 es el valor predicho cuando las dos explicativas valen cero, y casi nunca corresponde a un caso real.

6. Lo que sigue sin decir el modelo. Nada sobre causa. Que un coeficiente sea grande no prueba que esa variable empuje a la respuesta.

Respuesta: b1=3b_1 = 3: cambio promedio de las ventas mensuales, en miles por unidad de el gasto en publicidad, en miles, manteniendo la cantidad de vendedores constante

11. Un modelo de regresión múltiple para el rendimiento del cultivo con 44 variables explicativas y 2020 casos dio R2=0,72R^{2} = 0{,}72. Calculá el R2R^{2} ajustado y explicá para qué sirve.

Ver solución

1. Escribimos la fórmula. Raj2=1(1R2)n1nk1R^{2}_{aj} = 1 - (1 - R^{2}) \cdot \dfrac{n - 1}{n - k - 1}

2. Identificamos los datos. n=20n = 20, k=4k = 4 variables explicativas, R2=0,72R^{2} = 0{,}72.

3. Reemplazamos. Raj2=1(10,72)191510,281,26670,6453R^{2}_{aj} = 1 - (1 - 0{,}72) \cdot \dfrac{19}{15} \approx 1 - 0{,}28 \cdot 1{,}2667 \approx 0{,}6453

4. Comparamos. 0,6453<0,720{,}6453 < 0{,}72: el ajustado siempre queda por debajo, y la diferencia es de 0,07470{,}0747.

5. Explicamos para qué sirve. El R2R^{2} común nunca baja al agregar variables, así que no sirve para comparar modelos con distinta cantidad de explicativas. El ajustado penaliza por cada variable agregada.

6. Cómo se usa. Si al sumar una variable el R2R^{2} sube pero el ajustado baja, esa variable no aporta lo suficiente para justificar el grado de libertad que consume.

Respuesta: Raj2=0,6453R^{2}_{aj} = 0{,}6453, menor que el R2=0,72R^{2} = 0{,}72

12. Con 6060 casos, un modelo con 22 variables explicativas dio R2=0,57R^{2} = 0{,}57. Se agrega una tercera variable, sin relación aparente con el sueldo, en miles, y el R2R^{2} pasa a 0,5710{,}571. Decidí si conviene incorporarla.

Ver solución

1. Observamos qué pasó con el R2R^{2}. Subió de 0,570{,}57 a 0,5710{,}571, o sea 0,0010{,}001.

2. Explicamos por qué siempre sube. Agregar una variable nunca puede empeorar el ajuste dentro de la muestra: en el peor caso el método le asigna un coeficiente cercano a cero. El R2R^{2} solo puede subir o quedarse igual, aunque la variable sea puro ruido.

3. Calculamos el ajustado del modelo original. 1(10,57)59570,55491 - (1 - 0{,}57) \cdot \dfrac{59}{57} \approx 0{,}5549

4. Calculamos el ajustado del modelo ampliado. 1(10,571)59560,5481 - (1 - 0{,}571) \cdot \dfrac{59}{56} \approx 0{,}548

5. Comparamos. El ajustado bajó de 0,55490{,}5549 a 0,5480{,}548.

6. Decidimos. No conviene incorporarla: la mejora del ajuste no compensa el grado de libertad que consume.

Respuesta: El R2R^{2} sube siempre, pero el ajustado va de 0,55490{,}5549 a 0,5480{,}548: no conviene incorporarla

Las cuentas de este material están verificadas una por una. Si aun así encontrás algo raro, .