Método

Integradores de Inferencia estadística

Un integrador junta varios temas de la unidad en un solo ejercicio, con consignas encadenadas a), b), c) y d) — como en un parcial.

1.

Una embotelladora carga botellas con un desvío poblacional conocido de 44 mililitros y contenido normal. La etiqueta declara 500500 mililitros. Se midieron diez botellas: 503503; 499499; 505505; 501501; 500500; 504504; 498498; 502502; 506506; 502502.

  • a)Construí el intervalo de confianza del 9595 por ciento para el contenido medio.
  • b)Con la media y el error estándar de a), contrastá al 55 por ciento si el contenido medio supera los 500500 mililitros declarados.
  • c)Si el contenido medio real fuera 503503 mililitros, calculá el error de tipo II y la potencia del test de b).
  • d)Calculá cuántas botellas habría que medir para que el margen del intervalo de a) no pase de 22 mililitros.
Ver solución

a)

1. Calculamos la media muestral. Los 1010 contenidos suman 50205020, y divididos por 1010 dan 502502 mililitros.

2. Elegimos la distribución. El desvío poblacional se conoce y vale 44, así que corresponde el crítico de la normal y no el de la t.

3. Calculamos el error estándar. 410=21051,2649\dfrac{4}{\sqrt{10}} = \dfrac{2 \sqrt{10}}{5} \approx 1{,}2649.

4. Armamos el margen y el intervalo. 1,961,26492,47921{,}96 \cdot 1{,}2649 \approx 2{,}4792, así que el intervalo va de 499,5208499{,}5208 a 504,4792504{,}4792 mililitros.

Respuesta: el intervalo va de 5029810125499,5208502 - \dfrac{98 \sqrt{10}}{125} \approx 499{,}5208 a 9810125+502504,4792\dfrac{98 \sqrt{10}}{125} + 502 \approx 504{,}4792

b)

1. Planteamos la hipótesis. La afirmación a probar es que el contenido medio supera 500500, así que el test es de cola derecha.

2. Elegimos el estadístico. Con sigma conocido va el estadístico z, con el mismo error estándar 1,26491{,}2649 que se usó en a).

3. Calculamos. 5025002105=1021,5811\dfrac{502 - 500}{\dfrac{2 \sqrt{10}}{5}} = \dfrac{\sqrt{10}}{2} \approx 1{,}5811.

4. Comparamos con el crítico. El crítico de cola derecha al 55 por ciento es 1,6451{,}645, y el estadístico 1,58111{,}5811 no lo alcanza, así que no se rechaza. El intervalo de a) contiene a 500500, y las dos conclusiones son la misma leída de dos formas.

Respuesta: el estadístico vale 1021,5811\dfrac{\sqrt{10}}{2} \approx 1{,}5811 y no se rechaza

c)

1. Ubicamos el punto de corte. El test de b) rechaza cuando la media muestral supera 500+1,6451,2649502,0808500 + 1{,}645 \cdot 1{,}2649 \approx 502{,}0808 mililitros.

2. Cambiamos el centro de la distribución. El error de tipo II se calcula suponiendo que la media real es 503503, no la de la hipótesis nula. Centrar la distribución en la nula daría alfa y no beta, que es el error del subtema.

3. Calculamos beta. Es el área a la izquierda de 502,0808502{,}0808 en una normal centrada en 503503: da 0,23370{,}2337.

4. Calculamos la potencia. Restando de uno queda 0,76630{,}7663. Con esta muestra el test detecta una diferencia de 33 mililitros algo más de tres veces de cada cuatro.

Respuesta: el error de tipo II vale 0,23370{,}2337 y la potencia 0,76630{,}7663

d)

1. Escribimos la condición. El margen es el crítico por el error estándar, y se pide que no supere 22 mililitros. En a) daba alrededor de 2,47922{,}4792, así que hace falta más muestra.

2. Despejamos el tamaño. n(1,9642)2=960462515,3664n \geq \left(\dfrac{1{,}96 \cdot 4}{2}\right)^{2} = \dfrac{9604}{625} \approx 15{,}3664.

3. Redondeamos hacia arriba. Con 1515 botellas el margen quedaría apenas por encima del pedido, así que hacen falta 1616.

4. Anotamos la regla. Pasar de 1010 a 1616 botellas achica el margen menos de lo que sugiere el salto: la reducción va con la raíz del tamaño.

Respuesta: hacen falta 1616 botellas

Repasá: Intervalo de confianza para la media · Test para la media con $\sigma$ conocido · Potencia y error de tipo II · Tamaño de muestra necesario

2.

Una línea de atención tiene un desvío poblacional conocido de 66 segundos y tiempos normales. El estándar del servicio es de 5050 segundos. Se cronometraron doce llamadas: 5252; 4949; 5555; 5151; 5353; 4848; 5454; 5050; 5252; 5151; 5353; 5656.

  • a)Estimá puntualmente el tiempo medio de atención y decí qué propiedad tiene ese estimador.
  • b)Con la estimación de a), construí el intervalo del 9090 por ciento para el tiempo medio.
  • c)Contrastá al 55 por ciento si el tiempo medio de atención supera el estándar de 5050 segundos.
  • d)Si el tiempo medio real fuera 5353 segundos, calculá el error de tipo II y la potencia del test de c).
Ver solución

a)

1. Elegimos el estimador. La media muestral estima la media poblacional.

2. Calculamos. La suma de las 1212 llamadas da 624624, y dividida por 1212 queda 5252 segundos.

3. Nombramos la propiedad. Es insesgado: en promedio, sobre todas las muestras posibles, da el parámetro. Además es consistente, porque su error estándar tiende a cero cuando crece la muestra.

Respuesta: la estimación puntual del tiempo medio es 5252 segundos

b)

1. Elegimos el crítico. El desvío poblacional se conoce, así que va el de la normal. Para el 9090 por ciento a dos colas vale 1,6451{,}645.

2. Calculamos el error estándar. 612=31,7321\dfrac{6}{\sqrt{12}} = \sqrt{3} \approx 1{,}7321 segundos.

3. Armamos el margen. 1,6451,73212,84921{,}645 \cdot 1{,}7321 \approx 2{,}8492.

4. Escribimos el intervalo. De 49,150849{,}1508 a 54,849254{,}8492 segundos. Es más angosto que uno del 9595 por ciento: más confianza cuesta más ancho.

Respuesta: el intervalo va de 52329320049,150852 - \dfrac{329 \sqrt{3}}{200} \approx 49{,}1508 a 3293200+5254,8492\dfrac{329 \sqrt{3}}{200} + 52 \approx 54{,}8492

c)

1. Escribimos la hipótesis. La afirmación es que el tiempo medio supera 5050, así que la región de rechazo queda a la derecha.

2. Elegimos el estadístico. Con sigma conocido corresponde z.

3. Calculamos. 52503=2331,1547\dfrac{52 - 50}{\sqrt{3}} = \dfrac{2 \sqrt{3}}{3} \approx 1{,}1547.

4. Decidimos. El crítico de cola derecha al 55 por ciento es 1,6451{,}645 y el estadístico 1,15471{,}1547 queda por debajo: no se rechaza el estándar. El intervalo de b) contiene a 5050 y dice lo mismo.

Respuesta: el estadístico vale 2331,1547\dfrac{2 \sqrt{3}}{3} \approx 1{,}1547 y no se rechaza

d)

1. Buscamos el punto de corte. El test rechaza cuando la media muestral pasa de 50+1,6451,732152,849250 + 1{,}645 \cdot 1{,}7321 \approx 52{,}8492 segundos.

2. Recentramos. Beta se calcula con la distribución de la media muestral centrada en el valor real 5353, no en el de la nula.

3. Calculamos beta. El área a la izquierda del corte en esa normal da 0,46530{,}4653.

4. Calculamos la potencia. Restando de uno queda 0,53470{,}5347. Es baja: con doce llamadas el test detecta una diferencia de 33 segundos apenas la mitad de las veces, y esa es la razón principal para agrandar la muestra.

Respuesta: el error de tipo II vale 0,46530{,}4653 y la potencia 0,53470{,}5347

Repasá: Estimación puntual y propiedades · Intervalo de confianza para la media · Test para la media con $\sigma$ conocido · Potencia y error de tipo II

3.

A diez pacientes se les midió la presión sistólica antes y después de un tratamiento. Antes: 8282; 7575; 9090; 6868; 7979; 8585; 7272; 8888; 7676; 8181. Después: 7878; 7373; 8585; 7070; 7474; 8888; 7070; 8383; 7272; 7777. A un grupo de control de ocho pacientes que no recibió el tratamiento se le midió una sola vez: 8080; 7777; 8686; 7272; 8181; 8383; 7575; 8484.

  • a)Estimá puntualmente la presión media del grupo de control y decí qué propiedad tiene ese estimador.
  • b)Sobre los diez pares de antes y después, calculá el estadístico del test para muestras apareadas al 55 por ciento y decidí.
  • c)Con la media de a), contrastá al 55 por ciento si la presión media del grupo de control es de 7878.
  • d)Con el estadístico de b), construí el intervalo del 9595 por ciento para la diferencia media.
Ver solución

a)

1. Elegimos el estimador. Para la media poblacional se usa la media muestral, porque su esperanza es el parámetro: es insesgada.

2. Sumamos y dividimos. Los 88 valores del control suman 638638, y divididos por 88 dan 3194=79,75\dfrac{319}{4} = 79{,}75.

3. Anotamos para qué sirve el control. El grupo de control no está apareado con nadie: sirve para ver dónde está la presión sin tratamiento, y es una muestra independiente de las otras dos.

Respuesta: la presión media del control se estima en 3194=79,75\dfrac{319}{4} = 79{,}75

b)

1. Armamos las diferencias. Restando después menos antes en cada par queda: 4-4; 2-2; 5-5; 22; 5-5; 33; 2-2; 5-5; 4-4; 4-4.

2. Calculamos su media. Suman 26-26, y divididas por 1010 dan 135=2,6- \dfrac{13}{5} = -2{,}6.

3. Calculamos su desvío. Los desvíos al cuadrado suman 3825\dfrac{382}{5}, así que la varianza es 382458,4889\dfrac{382}{45} \approx 8{,}4889 y el desvío 1910152,9136\dfrac{\sqrt{1910}}{15} \approx 2{,}9136.

4. Armamos el estadístico. 13519115=391911912,8219\dfrac{- \dfrac{13}{5}}{\dfrac{\sqrt{191}}{15}} = - \dfrac{39 \sqrt{191}}{191} \approx -2{,}8219, que en módulo supera el crítico 2,2622{,}262 de a): se rechaza que no haya cambio.

5. Anotamos por qué van apareadas. Tratar las dos series como muestras independientes usaría el doble de grados de libertad y un error estándar más grande, y perdería justamente lo que hace fuerte al diseño: cada sujeto es su propio control.

Respuesta: el estadístico vale 391911912,8219- \dfrac{39 \sqrt{191}}{191} \approx -2{,}8219 y se rechaza

c)

1. Elegimos la distribución. El desvío poblacional del control no se conoce y hay que estimarlo con el muestral, así que corresponde la t y no la z.

2. Calculamos el desvío muestral. Los desvíos al cuadrado respecto de 79,7579{,}75 suman 3192\dfrac{319}{2}, así que la varianza es 3191422,7857\dfrac{319}{14} \approx 22{,}7857 y el desvío 4466144,7734\dfrac{\sqrt{4466}}{14} \approx 4{,}7734.

3. Armamos el estadístico. 319478223328=722333191,0369\dfrac{\dfrac{319}{4} - 78}{\dfrac{\sqrt{2233}}{28}} = \dfrac{7 \sqrt{2233}}{319} \approx 1{,}0369, con 77 grados de libertad.

4. Decidimos. El crítico a dos colas al 55 por ciento es 2,3652{,}365 y el estadístico no lo alcanza: no se rechaza. Notar la diferencia con b): allá cada paciente era su propio control y el test detectó el cambio; acá la comparación es contra un valor de referencia y con una sola medición.

Respuesta: el estadístico t vale 722333191,0369\dfrac{7 \sqrt{2233}}{319} \approx 1{,}0369 con 77 grados de libertad y no se rechaza

d)

1. Elegimos la distribución. Se estima el desvío con el de las diferencias, así que corresponde la t con 99 grados de libertad, la misma de a).

2. Calculamos el error estándar. 2,9136100,9214\dfrac{2{,}9136}{\sqrt{10}} \approx 0{,}9214.

3. Armamos el margen. 2,2620,92142,08412{,}262 \cdot 0{,}9214 \approx 2{,}0841.

4. Escribimos el intervalo. 2,6±2,0841-2{,}6 \pm 2{,}0841, o sea de 4,6841-4{,}6841 a 0,5159-0{,}5159. No contiene al cero, lo cual coincide con el rechazo de b).

Respuesta: el intervalo va de 13537719125004,6841- \dfrac{13}{5} - \dfrac{377 \sqrt{191}}{2500} \approx -4{,}6841 a 135+37719125000,5159- \dfrac{13}{5} + \dfrac{377 \sqrt{191}}{2500} \approx -0{,}5159

Repasá: Estimación puntual y propiedades · Muestras apareadas · Test para la media con $\sigma$ desconocido · Intervalo con desvío desconocido

4.

Ocho operarios rindieron una prueba de tiempo, en segundos, antes y después de una capacitación. Antes: 120120; 135135; 128128; 142142; 131131; 125125; 138138; 133133. Después: 115115; 133133; 126126; 140140; 128128; 127127; 133133; 131131.

  • a)Escribí la hipótesis nula y la alternativa, la cantidad de colas y el valor crítico que corresponde al 55 por ciento.
  • b)Usando el diseño apareado y el crítico de a), calculá el estadístico y tomá la decisión.
  • c)Obtené el valor p asociado al estadístico de b) y contrastalo con el nivel de significación.
  • d)Estimá por intervalo, con 9595 por ciento de confianza, la diferencia media entre las dos mediciones.
Ver solución

a)

1. Escribimos las hipótesis. La nula dice que la diferencia media entre después y antes vale 00, y la alternativa que es distinta de cero.

2. Elegimos la cola. La afirmación del enunciado no indica dirección, así que el test es de dos colas y la región de rechazo se reparte entre los dos extremos.

3. Elegimos la distribución. El desvío de las diferencias no se conoce y hay que estimarlo, así que va la t con n1=7n - 1 = 7 grados de libertad.

4. Escribimos el valor crítico. Al 55 por ciento y a dos colas, la t con 77 grados de libertad da 2,3652{,}365. Se rechaza si el estadístico queda fuera de ese intervalo.

Respuesta: test de dos colas, con valor crítico 2,3652{,}365 y 77 grados de libertad

b)

1. Armamos las diferencias. Restando después menos antes en cada par queda: 5-5; 2-2; 2-2; 2-2; 3-3; 22; 5-5; 2-2.

2. Calculamos su media. Suman 19-19, y divididas por 88 dan 198=198- \dfrac{19}{8} = - \dfrac{19}{8}.

3. Calculamos su desvío. Los desvíos al cuadrado suman 2718\dfrac{271}{8}, así que la varianza es 271564,8393\dfrac{271}{56} \approx 4{,}8393 y el desvío 3794282,1998\dfrac{\sqrt{3794}}{28} \approx 2{,}1998.

4. Armamos el estadístico. 198189756=1918972713,0536\dfrac{- \dfrac{19}{8}}{\dfrac{\sqrt{1897}}{56}} = - \dfrac{19 \sqrt{1897}}{271} \approx -3{,}0536, que en módulo supera el crítico 2,3652{,}365 de a): se rechaza que no haya cambio.

5. Anotamos por qué van apareadas. Tratar las dos series como muestras independientes usaría el doble de grados de libertad y un error estándar más grande, y perdería justamente lo que hace fuerte al diseño: cada sujeto es su propio control.

Respuesta: el estadístico vale 1918972713,0536- \dfrac{19 \sqrt{1897}}{271} \approx -3{,}0536 y se rechaza

c)

1. Definimos el valor p. Es la probabilidad de obtener un estadístico tan extremo o más que el observado, suponiendo cierta la hipótesis nula.

2. Elegimos la cola. Como el test de a) es de dos colas, se toma el área de las dos puntas más allá de 3,05363{,}0536 en módulo.

3. Buscamos en la tabla. Con 77 grados de libertad, el valor p da 0,01850{,}0185.

4. Comparamos con alfa. 0,01850{,}0185 queda por debajo del nivel de significación, así que se rechaza. Da la misma decisión que b), y tiene que darla: el valor p y la región crítica son dos formas de mirar lo mismo.

Respuesta: el valor p es 0,01850{,}0185 y queda por debajo del nivel de significación

d)

1. Elegimos la distribución. Se estima el desvío con el de las diferencias, así que corresponde la t con 77 grados de libertad, la misma de a).

2. Calculamos el error estándar. 2,199880,7778\dfrac{2{,}1998}{\sqrt{8}} \approx 0{,}7778.

3. Armamos el margen. 2,3650,77781,83942{,}365 \cdot 0{,}7778 \approx 1{,}8394.

4. Escribimos el intervalo. 198±1,8394- \dfrac{19}{8} \pm 1{,}8394, o sea de 4,2144-4{,}2144 a 0,5356-0{,}5356. No contiene al cero, lo cual coincide con el rechazo de b).

Respuesta: el intervalo va de 1984731897112004,2144- \dfrac{19}{8} - \dfrac{473 \sqrt{1897}}{11200} \approx -4{,}2144 a 198+4731897112000,5356- \dfrac{19}{8} + \dfrac{473 \sqrt{1897}}{11200} \approx -0{,}5356

Repasá: Hipótesis, errores y decisión · Muestras apareadas · El valor p · Intervalo con desvío desconocido

5.

Tres fertilizantes se probaron en parcelas iguales y se midió el rendimiento, en quintales. Fertilizante A: 1212; 1414; 1313; 1515; 1111. Fertilizante B: 1616; 2020; 1717; 2222; 1515. Fertilizante C: 2020; 2222; 2121; 2323; 1919.

  • a)Contrastá al 55 por ciento si los fertilizantes A y B tienen la misma variabilidad.
  • b)Con el resultado de a), comparál las medias de A y B con un test al 55 por ciento.
  • c)Escribí las hipótesis del test de b), de cuántas colas es y cuál es el valor crítico que corresponde al 55 por ciento.
  • d)Con los tres fertilizantes juntos, calculá el estadístico del análisis de la varianza y sus grados de libertad.
Ver solución

a)

1. Calculamos las dos varianzas muestrales. El fertilizante A: media 1313 y varianza 522,5\dfrac{5}{2} \approx 2{,}5. El fertilizante B: media 1818 y varianza 1728,5\dfrac{17}{2} \approx 8{,}5.

2. Armamos el cociente con la mayor arriba. 17252=1753,4\dfrac{\dfrac{17}{2}}{\dfrac{5}{2}} = \dfrac{17}{5} \approx 3{,}4, con 44 y 44 grados de libertad.

3. Comparamos con el crítico. El test es de dos colas, porque la hipótesis alternativa es que las varianzas sean distintas, así que el 55 por ciento se reparte entre las dos puntas y el crítico de la derecha es el que deja 2,52{,}5 por ciento: con 44 y 44 grados de libertad vale 9,609{,}60. El estadístico no lo alcanza.

4. Concluimos. No se rechaza la igualdad de varianzas, que es justo el supuesto que hace falta para las dos consignas que siguen.

Respuesta: el cociente vale 1753,4\dfrac{17}{5} \approx 3{,}4 con 44 y 44 grados de libertad, y no se rechaza la igualdad de varianzas

b)

1. Usamos el supuesto de a). Como las varianzas se pueden suponer iguales, se combinan en una sola estimación.

2. Calculamos la varianza combinada. 452+41728=1125,5\dfrac{4 \cdot \dfrac{5}{2} + 4 \cdot \dfrac{17}{2}}{8} = \dfrac{11}{2} \approx 5{,}5. Se pondera por los grados de libertad, no por el tamaño: promediar las dos varianzas a secas es el error del subtema.

3. Calculamos el error estándar. 112(15+15)1,4832\sqrt{\dfrac{11}{2} \cdot \left(\dfrac{1}{5} + \dfrac{1}{5}\right)} \approx 1{,}4832.

4. Armamos el estadístico y decidimos. 1318555=555113,371\dfrac{13 - 18}{\dfrac{\sqrt{55}}{5}} = - \dfrac{5 \sqrt{55}}{11} \approx -3{,}371, con 88 grados de libertad. En módulo supera el crítico 2,3062{,}306, así que se rechaza la igualdad de medias entre A y B.

Respuesta: el estadístico vale 555113,371- \dfrac{5 \sqrt{55}}{11} \approx -3{,}371 y se rechaza la igualdad de medias

c)

1. Escribimos la nula y la alternativa. La nula dice que los dos fertilizantes rinden lo mismo en promedio, o sea que la diferencia de medias vale 00. La alternativa, que no.

2. Elegimos la cola. El enunciado no afirma cuál de los dos rinde más, así que el test es de dos colas y la región de rechazo se reparte entre los dos extremos.

3. Elegimos la distribución. Las varianzas se estiman de los datos, y en a) quedó establecido que se pueden suponer iguales, así que va la t con n1+n22=8n_1 + n_2 - 2 = 8 grados de libertad.

4. Escribimos el valor crítico. Al 55 por ciento y a dos colas, con 88 grados de libertad, la t vale 2,3062{,}306. Es exactamente el número contra el que se comparó el estadístico de b), y los dos errores posibles son rechazar siendo cierta la nula o no rechazar siendo falsa.

Respuesta: test de dos colas, con 88 grados de libertad y valor crítico 2,3062{,}306

d)

1. Calculamos la media general. Con los 1515 datos, la media general es 52317,3333\dfrac{52}{3} \approx 17{,}3333.

2. Calculamos la variación entre grupos. Pesando el cuadrado de la distancia de cada media a la general por el tamaño del grupo, queda 4903163,3333\dfrac{490}{3} \approx 163{,}3333 con 22 grados de libertad.

3. Calculamos la variación dentro de los grupos. Sumando los desvíos al cuadrado internos queda 545454 \approx 54 con 1212 grados de libertad.

4. Armamos el cociente. 245392=4902718,1481\dfrac{\dfrac{245}{3}}{\dfrac{9}{2}} = \dfrac{490}{27} \approx 18{,}1481. Con un crítico de 3,893{,}89 al 55 por ciento, el estadístico lo supera ampliamente: al menos un fertilizante rinde distinto. El análisis de la varianza responde eso y no cuál, que es lo que sí contestó b) para el par A y B.

Respuesta: el estadístico F vale 4902718,1481\dfrac{490}{27} \approx 18{,}1481 con 22 y 1212 grados de libertad

Repasá: Comparación de varianzas · Intervalo y test para dos medias · Hipótesis, errores y decisión · Análisis de la varianza

6.

Tres turnos de una planta se compararon por la cantidad de piezas terminadas por hora. Turno mañana: 3030; 3434; 3232; 3636; 2828. Turno tarde: 3838; 4242; 4040; 4444; 3636. Turno noche: 3333; 4040; 3535; 4242; 3535.

  • a)Decidí al 55 por ciento si el turno mañana y el turno noche tienen la misma variabilidad.
  • b)Apoyándote en a), contrastá al 55 por ciento si el turno mañana y el turno noche tienen la misma producción media.
  • c)Contrastá al 55 por ciento si el turno tarde produce en promedio 3737 piezas por hora.
  • d)Con los tres turnos juntos, calculá el estadístico del análisis de la varianza y sus grados de libertad.
Ver solución

a)

1. Calculamos las dos varianzas muestrales. El turno mañana: media 3232 y varianza 101010 \approx 10. El turno noche: media 3737 y varianza 29214,5\dfrac{29}{2} \approx 14{,}5.

2. Armamos el cociente con la mayor arriba. 29210=29201,45\dfrac{\dfrac{29}{2}}{10} = \dfrac{29}{20} \approx 1{,}45, con 44 y 44 grados de libertad.

3. Comparamos con el crítico. El test es de dos colas, porque la hipótesis alternativa es que las varianzas sean distintas, así que el 55 por ciento se reparte entre las dos puntas y el crítico de la derecha es el que deja 2,52{,}5 por ciento: con 44 y 44 grados de libertad vale 9,609{,}60. El estadístico no lo alcanza.

4. Concluimos. No se rechaza la igualdad de varianzas, que es justo el supuesto que hace falta para las dos consignas que siguen.

Respuesta: el cociente vale 29201,45\dfrac{29}{20} \approx 1{,}45 con 44 y 44 grados de libertad, y no se rechaza la igualdad de varianzas

b)

1. Usamos el supuesto de a). Como las varianzas se pueden suponer iguales, se combinan en una sola estimación.

2. Calculamos la varianza combinada. 410+42928=49412,25\dfrac{4 \cdot 10 + 4 \cdot \dfrac{29}{2}}{8} = \dfrac{49}{4} \approx 12{,}25. Se pondera por los grados de libertad, no por el tamaño: promediar las dos varianzas a secas es el error del subtema.

3. Calculamos el error estándar. 494(15+15)2,2136\sqrt{\dfrac{49}{4} \cdot \left(\dfrac{1}{5} + \dfrac{1}{5}\right)} \approx 2{,}2136.

4. Armamos el estadístico y decidimos. 323771010=51072,2588\dfrac{32 - 37}{\dfrac{7 \sqrt{10}}{10}} = - \dfrac{5 \sqrt{10}}{7} \approx -2{,}2588, con 88 grados de libertad. En módulo no llega al crítico 2,3062{,}306, así que no se rechaza la igualdad de medias entre esos dos turnos.

Respuesta: el estadístico vale 51072,2588- \dfrac{5 \sqrt{10}}{7} \approx -2{,}2588 y no se rechaza la igualdad de medias

c)

1. Elegimos la distribución. El desvío poblacional no se conoce, así que corresponde la t y no la z.

2. Calculamos el error estándar. 3,162351,4142\dfrac{3{,}1623}{\sqrt{5}} \approx 1{,}4142.

3. Armamos el estadístico. 40372=3222,1213\dfrac{40 - 37}{\sqrt{2}} = \dfrac{3 \sqrt{2}}{2} \approx 2{,}1213, con 44 grados de libertad.

4. Decidimos. El crítico a dos colas al 55 por ciento es 2,7762{,}776, y el estadístico no lo alcanza: no se rechaza.

Respuesta: el estadístico t vale 3222,1213\dfrac{3 \sqrt{2}}{2} \approx 2{,}1213 y no se rechaza

d)

1. Calculamos la media general. Con los 1515 datos, la media general es 109336,3333\dfrac{109}{3} \approx 36{,}3333.

2. Calculamos la variación entre grupos. Pesando el cuadrado de la distancia de cada media a la general por el tamaño del grupo, queda 4903163,3333\dfrac{490}{3} \approx 163{,}3333 con 22 grados de libertad.

3. Calculamos la variación dentro de los grupos. Sumando los desvíos al cuadrado internos queda 138138138 \approx 138 con 1212 grados de libertad.

4. Armamos el cociente. 2453232=490697,1014\dfrac{\dfrac{245}{3}}{\dfrac{23}{2}} = \dfrac{490}{69} \approx 7{,}1014. Con un crítico de 3,893{,}89 al 55 por ciento, el estadístico lo supera: hay al menos un turno que produce distinto, aunque el par comparado en b) no haya mostrado diferencia.

Respuesta: el estadístico F vale 490697,1014\dfrac{490}{69} \approx 7{,}1014 con 22 y 1212 grados de libertad

Repasá: Comparación de varianzas · Intervalo y test para dos medias · Test para la media con $\sigma$ desconocido · Análisis de la varianza

7.

Una tienda comparó dos canales de venta. Del canal web, sobre 200200 visitas, 6060 terminaron en compra. Del canal telefónico, sobre 150150 llamadas, 3030 terminaron en compra.

  • a)Armá la tabla de doble entrada y contrastá al 55 por ciento si el canal y el resultado de la visita son independientes.
  • b)Con los mismos datos, contrastá al 55 por ciento si las dos proporciones de compra son iguales.
  • c)Construí el intervalo del 9595 por ciento para la proporción de compra del canal web.
  • d)Calculá el valor p del estadístico de b) y comprobá que da la misma decisión.
Ver solución

a)

1. Armamos la tabla de doble entrada. El canal web: 6060 compras y 140140 no compras. El canal telefónico: 3030 y 120120. En total 350350 casos.

2. Calculamos las frecuencias esperadas. Cada esperada es el total de su fila por el total de su columna, dividido por el total general. Es lo que habría si las dos variables fueran independientes.

3. Sumamos los aportes. Sumando el cuadrado de cada diferencia dividido por su esperada queda 175394,4872\dfrac{175}{39} \approx 4{,}4872.

4. Escribimos los grados de libertad. En una tabla de dos por dos son (21)(21)=1(2 - 1)(2 - 1) = 1, y el crítico al 55 por ciento vale 3,843{,}84. El estadístico lo supera, así que se rechaza la independencia: el canal y el resultado están asociados.

Respuesta: el estadístico vale 175394,4872\dfrac{175}{39} \approx 4{,}4872 con 11 grado de libertad

b)

1. Calculamos las dos proporciones. 60200=0,3\dfrac{60}{200} = 0{,}3 y 30150=0,2\dfrac{30}{150} = 0{,}2.

2. Calculamos la proporción combinada. Bajo la hipótesis de igualdad las dos son la misma, así que se junta todo: 90350=9350,2571\dfrac{90}{350} = \dfrac{9}{35} \approx 0{,}2571.

3. Calculamos el error estándar y el estadístico. El error estándar da 2733500,0472\dfrac{\sqrt{273}}{350} \approx 0{,}0472 y el estadístico 0,30,2273350=5273392,1183\dfrac{0{,}3 - 0{,}2}{\dfrac{\sqrt{273}}{350}} = \dfrac{5 \sqrt{273}}{39} \approx 2{,}1183.

4. Comparamos con a). El cuadrado de 2,11832{,}1183 es 4,48724{,}4872, que es el chi cuadrado de a). No es casualidad: en una tabla de dos por dos los dos tests son el mismo. En módulo el estadístico supera 1,961{,}96, así que se rechaza la igualdad de proporciones, igual que en a).

Respuesta: el estadístico vale 5273392,1183\dfrac{5 \sqrt{273}}{39} \approx 2{,}1183 y se rechaza la igualdad de proporciones

c)

1. Chequeamos que se pueda usar la normal. np=60np = 60 y n(1p)=140n(1 - p) = 140, los dos por encima de cinco.

2. Calculamos el error estándar de esa proporción. 0,30,7200=422000,0324\sqrt{\dfrac{0{,}3 \cdot 0{,}7}{200}} = \dfrac{\sqrt{42}}{200} \approx 0{,}0324. Notar que acá va la proporción del grupo y no la combinada de b): la combinada solo tiene sentido bajo la hipótesis de igualdad.

3. Armamos el margen. 1,960,03240,06351{,}96 \cdot 0{,}0324 \approx 0{,}0635.

4. Escribimos el intervalo. 0,3±0,06350{,}3 \pm 0{,}0635, o sea de 0,23650{,}2365 a 0,36350{,}3635.

Respuesta: el intervalo va de 310494250000,2365\dfrac{3}{10} - \dfrac{49 \sqrt{42}}{5000} \approx 0{,}2365 a 49425000+3100,3635\dfrac{49 \sqrt{42}}{5000} + \dfrac{3}{10} \approx 0{,}3635

d)

1. Definimos el valor p. Es la probabilidad de obtener un estadístico tan extremo o más que el observado, suponiendo que las dos proporciones son iguales.

2. Elegimos la cola. El test de b) es de dos colas, así que se suman las dos puntas más allá de 2,11832{,}1183 en módulo.

3. Buscamos en la tabla. En la normal estándar, esa área vale 0,03410{,}0341.

4. Comparamos con alfa. Queda por debajo del nivel de significación, así que se rechaza la igualdad de proporciones. Es la misma conclusión de b) y del chi cuadrado de a): el valor p y la región crítica son dos formas de mirar lo mismo.

Respuesta: el valor p es 0,03410{,}0341 y queda por debajo del nivel de significación

Repasá: El test chi cuadrado de independencia · Comparación de dos proporciones · Intervalo para una proporción · El valor p

8.

Un municipio evaluó dos campañas de reciclado. En el barrio A, de 150150 hogares encuestados, 4545 separaron residuos. En el barrio B, de 200200 hogares, 7070 los separaron.

  • a)Construí la tabla de doble entrada y decidí al 55 por ciento si el barrio y la conducta de separar son independientes.
  • b)Contrastá al 55 por ciento si las dos proporciones de hogares que separan son iguales.
  • c)Construí el intervalo del 9595 por ciento para la proporción de hogares del barrio A que separan residuos.
  • d)Calculá cuántos hogares del barrio A habría que encuestar para que el error del intervalo de c) no supere 0,040{,}04.
Ver solución

a)

1. Armamos la tabla de doble entrada. El barrio A: 4545 separan y 105105 no separan. El barrio B: 7070 y 130130. En total 350350 casos.

2. Calculamos las frecuencias esperadas. Cada esperada es el total de su fila por el total de su columna, dividido por el total general. Es lo que habría si las dos variables fueran independientes.

3. Sumamos los aportes. Sumando el cuadrado de cada diferencia dividido por su esperada queda 105010810,9713\dfrac{1050}{1081} \approx 0{,}9713.

4. Escribimos los grados de libertad. En una tabla de dos por dos son (21)(21)=1(2 - 1)(2 - 1) = 1, y el crítico al 55 por ciento vale 3,843{,}84. El estadístico no lo alcanza, así que no se rechaza la independencia entre barrio y conducta.

Respuesta: el estadístico vale 105010810,9713\dfrac{1050}{1081} \approx 0{,}9713 con 11 grado de libertad

b)

1. Calculamos las dos proporciones. 45150=0,3\dfrac{45}{150} = 0{,}3 y 70200=0,35\dfrac{70}{200} = 0{,}35.

2. Calculamos la proporción combinada. Bajo la hipótesis de igualdad las dos son la misma, así que se junta todo: 115350=23700,3286\dfrac{115}{350} = \dfrac{23}{70} \approx 0{,}3286.

3. Calculamos el error estándar y el estadístico. El error estándar da 4540242000,0507\dfrac{\sqrt{45402}}{4200} \approx 0{,}0507 y el estadístico 0,30,35454024200=54540210810,9856\dfrac{0{,}3 - 0{,}35}{\dfrac{\sqrt{45402}}{4200}} = - \dfrac{5 \sqrt{45402}}{1081} \approx -0{,}9856.

4. Comparamos con a). El cuadrado de 0,9856-0{,}9856 es 0,97130{,}9713, que es el chi cuadrado de a). No es casualidad: en una tabla de dos por dos los dos tests son el mismo. En módulo el estadístico no llega a 1,961{,}96, así que no se rechaza la igualdad, la misma conclusión de a).

Respuesta: el estadístico vale 54540210810,9856- \dfrac{5 \sqrt{45402}}{1081} \approx -0{,}9856 y no se rechaza la igualdad de proporciones

c)

1. Chequeamos que se pueda usar la normal. np=45np = 45 y n(1p)=105n(1 - p) = 105, los dos por encima de cinco.

2. Calculamos el error estándar de esa proporción. 0,30,7150=141000,0374\sqrt{\dfrac{0{,}3 \cdot 0{,}7}{150}} = \dfrac{\sqrt{14}}{100} \approx 0{,}0374. Notar que acá va la proporción del grupo y no la combinada de b): la combinada solo tiene sentido bajo la hipótesis de igualdad.

3. Armamos el margen. 1,960,03740,07331{,}96 \cdot 0{,}0374 \approx 0{,}0733.

4. Escribimos el intervalo. 0,3±0,07330{,}3 \pm 0{,}0733, o sea de 0,22670{,}2267 a 0,37330{,}3733.

Respuesta: el intervalo va de 310491425000,2267\dfrac{3}{10} - \dfrac{49 \sqrt{14}}{2500} \approx 0{,}2267 a 49142500+3100,3733\dfrac{49 \sqrt{14}}{2500} + \dfrac{3}{10} \approx 0{,}3733

d)

1. Escribimos la condición. El margen del intervalo de c) tiene que quedar por debajo de 0,040{,}04.

2. Despejamos el tamaño. n1,9620,30,70,042504,21n \geq \dfrac{1{,}96^{2} \cdot 0{,}3 \cdot 0{,}7}{0{,}04^{2}} \approx 504{,}21.

3. Redondeamos hacia arriba. Hacen falta 505505 casos. Truncar dejaría el error por encima del tolerado.

4. Anotamos de dónde sale la proporción previa. Se usó la 0,30{,}3 observada. Si no hubiera dato previo se usaría 0,50{,}5, que es la proporción que maximiza el tamaño necesario y por lo tanto la elección conservadora.

Respuesta: hacen falta 505505 casos

Repasá: El test chi cuadrado de independencia · Comparación de dos proporciones · Intervalo para una proporción · Tamaño de muestra necesario

9.

Una cooperativa registró sus ventas anuales, en millones de pesos, durante seis años consecutivos numerados del uno al seis: (1;100)(1; 100) · (2;112)(2; 112) · (3;121)(3; 121) · (4;135)(4; 135) · (5;142)(5; 142) · (6;158)(6; 158).

  • a)Calculá el número índice simple del sexto año tomando el primero como base, y la serie de medias móviles de orden tres.
  • b)Con los mismos años y ventas, ajustá la recta de mínimos cuadrados.
  • c)Con la recta de b), calculá el coeficiente de determinación e interpretalo.
  • d)Con la pendiente de b) y los residuos de c), contrastá al 55 por ciento si la pendiente es distinta de cero.
Ver solución

a)

1. Escribimos el índice simple. Es el valor del período dividido por el de la base, multiplicado por cien.

2. Calculamos. 158100100=158\dfrac{158}{100} \cdot 100 = 158, así que las ventas crecieron un 5858 por ciento respecto del primer año.

3. Armamos las medias móviles. Cada una promedia tres años consecutivos, y por eso la serie suavizada tiene dos términos menos que la original.

4. Calculamos las cuatro. 111111111 \approx 111 · 3683122,6667\dfrac{368}{3} \approx 122{,}6667 · 3983132,6667\dfrac{398}{3} \approx 132{,}6667 · 145145145 \approx 145, una serie que sube parejo y deja ver la tendencia sin los saltos año a año.

Respuesta: índice 158158 y medias móviles 111111, 3683\dfrac{368}{3}, 3983\dfrac{398}{3}, 145145

b)

1. Calculamos las medias. El año medio es 72\dfrac{7}{2} y la venta media 128128128 \approx 128.

2. Calculamos las sumas cruzadas. Sxx=352S_{xx} = \dfrac{35}{2} y Sxy=197S_{xy} = 197.

3. Calculamos la pendiente. 197352=3943511,2571\dfrac{197}{\dfrac{35}{2}} = \dfrac{394}{35} \approx 11{,}2571 millones por año.

4. Calculamos la ordenada al origen. 1283943572=443588,6128 - \dfrac{394}{35} \cdot \dfrac{7}{2} = \dfrac{443}{5} \approx 88{,}6. La recta suaviza la serie igual que las medias móviles de a), pero con una fórmula que además permite extrapolar dentro del rango.

Respuesta: la recta es y=39435x+4435y = \dfrac{394}{35}x + \dfrac{443}{5}, con pendiente 3943511,2571\dfrac{394}{35} \approx 11{,}2571 y ordenada 443588,6\dfrac{443}{5} \approx 88{,}6

c)

1. Escribimos qué mide. Es la fracción de la variabilidad de las ventas que la recta explica.

2. Calculamos la variabilidad total. Syy=22342234S_{yy} = 2234 \approx 2234.

3. Calculamos los residuos. La suma de los cuadrados de los residuos da 5723516,3429\dfrac{572}{35} \approx 16{,}3429.

4. Armamos el coeficiente. 1572352234=38809390950,99271 - \dfrac{\dfrac{572}{35}}{2234} = \dfrac{38809}{39095} \approx 0{,}9927, o sea que la recta de b) explica alrededor del 99,268499{,}2684 por ciento de la variación de las ventas. Los residuos que quedan son los que va a usar d) para estimar el error de la pendiente.

Respuesta: el coeficiente de determinación vale 38809390950,9927\dfrac{38809}{39095} \approx 0{,}9927

d)

1. Escribimos la hipótesis. La nula dice que la pendiente vale cero, o sea que el año no aporta nada a explicar las ventas.

2. Estimamos la varianza residual. 572354=143354,0857\dfrac{\dfrac{572}{35}}{4} = \dfrac{143}{35} \approx 4{,}0857, con n2=4n - 2 = 4 grados de libertad, porque se estimaron dos parámetros.

3. Calculamos el error estándar de la pendiente. 14335352=286350,4832\sqrt{\dfrac{\dfrac{143}{35}}{\dfrac{35}{2}}} = \dfrac{\sqrt{286}}{35} \approx 0{,}4832.

4. Armamos el estadístico y decidimos. 3943528635=19728614323,2977\dfrac{\dfrac{394}{35}}{\dfrac{\sqrt{286}}{35}} = \dfrac{197 \sqrt{286}}{143} \approx 23{,}2977, muy por encima del crítico 2,7762{,}776: se rechaza que la pendiente sea cero.

Respuesta: el estadístico vale 19728614323,2977\dfrac{197 \sqrt{286}}{143} \approx 23{,}2977 y se rechaza que la pendiente sea cero

Repasá: Números índices y series cronológicas · Mínimos cuadrados · Coeficiente de determinación · Inferencia sobre la pendiente

10.

Un edificio registró su consumo eléctrico, en miles de kilovatios hora, en siete meses consecutivos numerados del uno al siete: (1;52)(1; 52) · (2;58)(2; 58) · (3;61)(3; 61) · (4;68)(4; 68) · (5;72)(5; 72) · (6;79)(6; 79) · (7;84)(7; 84).

  • a)Calculá el número índice del séptimo mes con base en el primero, y el consumo promedio de los siete meses.
  • b)Ajustá la recta de mínimos cuadrados del consumo en función del mes.
  • c)Con la recta de b), calculá el coeficiente de determinación.
  • d)Con la recta de b), predecí el consumo del quinto mes y explicá hasta dónde llega esa predicción.
Ver solución

a)

1. Escribimos el índice. Es el valor del período sobre el de la base, por cien.

2. Calculamos. 8452100=210013161,5385\dfrac{84}{52} \cdot 100 = \dfrac{2100}{13} \approx 161{,}5385, un crecimiento de alrededor del 61,538561{,}5385 por ciento.

3. Calculamos el promedio. 52+58+61+68+72+79+847=474767,7143\dfrac{52 + 58 + 61 + 68 + 72 + 79 + 84}{7} = \dfrac{474}{7} \approx 67{,}7143.

Respuesta: índice 210013161,5385\dfrac{2100}{13} \approx 161{,}5385 y consumo promedio 474767,7143\dfrac{474}{7} \approx 67{,}7143

b)

1. Partimos del promedio de a). El consumo medio ya lo calculamos en a), 474767,7143\dfrac{474}{7} \approx 67{,}7143; el mes medio es 44.

2. Calculamos las sumas cruzadas. Sxx=28S_{xx} = 28 y Sxy=149S_{xy} = 149.

3. Obtenemos la pendiente. 14928=149285,3214\dfrac{149}{28} = \dfrac{149}{28} \approx 5{,}3214 por mes.

4. Obtenemos la ordenada al origen. 4747149284=325746,4286\dfrac{474}{7} - \dfrac{149}{28} \cdot 4 = \dfrac{325}{7} \approx 46{,}4286.

Respuesta: la recta es y=14928x+3257y = \dfrac{149}{28}x + \dfrac{325}{7}, con pendiente 149285,3214\dfrac{149}{28} \approx 5{,}3214 y ordenada 325746,4286\dfrac{325}{7} \approx 46{,}4286

c)

1. Calculamos la variabilidad total. Syy=55827797,4286S_{yy} = \dfrac{5582}{7} \approx 797{,}4286.

2. Calculamos la variabilidad no explicada. Los residuos al cuadrado suman 127284,5357\dfrac{127}{28} \approx 4{,}5357.

3. Armamos el cociente. 11272855827=22201223280,99431 - \dfrac{\dfrac{127}{28}}{\dfrac{5582}{7}} = \dfrac{22201}{22328} \approx 0{,}9943.

4. Interpretamos. El mes explica alrededor del 99,431299{,}4312 por ciento de la variación del consumo. Lo que queda es la parte que la recta de b) no captura, y es lo que limita la predicción de d).

Respuesta: el coeficiente de determinación vale 22201223280,9943\dfrac{22201}{22328} \approx 0{,}9943

d)

1. Reemplazamos en la recta. 3257+149285=20452873,0357\dfrac{325}{7} + \dfrac{149}{28} \cdot 5 = \dfrac{2045}{28} \approx 73{,}0357 miles de kilovatios hora.

2. Comparamos con el dato observado. El quinto mes se registró 7272, así que la recta se acerca bastante, cosa esperable con el coeficiente de determinación alto de c).

3. Marcamos el límite. La recta se ajustó con meses del 11 al 77: predecir para el mes veinte sería extrapolar, y nada en los datos garantiza que la tendencia siga siendo lineal fuera de ese rango.

4. Anotamos la otra fuente de error. Aun dentro del rango, la predicción es un valor medio y no un valor individual. Un intervalo para una observación nueva es más ancho que uno para el promedio.

Respuesta: la predicción del quinto mes es 20452873,0357\dfrac{2045}{28} \approx 73{,}0357

Repasá: Números índices y series cronológicas · Mínimos cuadrados · Coeficiente de determinación · Predicción y sus límites

11.

De seis sucursales se registró la antigüedad en años, la cantidad de empleados y la facturación mensual en millones, en ese orden: (1;1;10)(1; 1; 10) · (2;1;13)(2; 1; 13) · (3;2;17)(3; 2; 17) · (4;3;21)(4; 3; 21) · (5;4;24)(5; 4; 24) · (6;4;29)(6; 4; 29).

  • a)Ajustá la regresión lineal múltiple de la facturación sobre la antigüedad y la cantidad de empleados.
  • b)Ajustá ahora la recta simple de la facturación en función de la antigüedad solamente.
  • c)Con la recta simple de b), contrastá al 55 por ciento si la pendiente es distinta de cero.
  • d)Con la recta simple de b), predecí la facturación de una sucursal de cuatro años y marcá el límite de esa predicción.
Ver solución

a)

1. Escribimos el modelo. La facturación se explica con una constante más un coeficiente por la antigüedad más otro por la cantidad de empleados.

2. Planteamos las ecuaciones normales. Los coeficientes salen de resolver el sistema que minimiza la suma de cuadrados de los residuos, con tres incógnitas y tres ecuaciones.

3. Resolvemos. Queda una constante de 2955,8\dfrac{29}{5} \approx 5{,}8, un coeficiente de 79203,95\dfrac{79}{20} \approx 3{,}95 por año de antigüedad y uno de 140,25- \dfrac{1}{4} \approx -0{,}25 por empleado.

4. Leemos los coeficientes. Cada uno mide el efecto de su variable manteniendo la otra fija, que es justamente lo que una regresión simple no puede separar.

Respuesta: los coeficientes son 295\dfrac{29}{5}, 7920\dfrac{79}{20} y 14- \dfrac{1}{4}

b)

1. Nos quedamos con una sola variable. Se ignora la cantidad de empleados y se ajusta la recta con la antigüedad.

2. Calculamos las medias y las sumas cruzadas. Antigüedad media 72\dfrac{7}{2}, facturación media 1919, Sxx=352S_{xx} = \dfrac{35}{2} y Sxy=66S_{xy} = 66.

3. Calculamos la pendiente y la ordenada. Pendiente 132353,7714\dfrac{132}{35} \approx 3{,}7714 y ordenada 2955,8\dfrac{29}{5} \approx 5{,}8.

4. Comparamos con a). La pendiente simple 3,77143{,}7714 no coincide con el coeficiente de antigüedad 3,953{,}95 de a). No es un error: la simple absorbe también el efecto de los empleados, porque las dos variables crecen juntas.

Respuesta: la recta simple es y=13235x+295y = \dfrac{132}{35}x + \dfrac{29}{5}, con pendiente 132353,7714\dfrac{132}{35} \approx 3{,}7714 y ordenada 2955,8\dfrac{29}{5} \approx 5{,}8

c)

1. Escribimos la hipótesis. La nula dice que la antigüedad no aporta nada, o sea pendiente cero.

2. Calculamos la varianza residual. Los residuos al cuadrado suman 38351,0857\dfrac{38}{35} \approx 1{,}0857, y divididos por n2=4n - 2 = 4 dan 19700,2714\dfrac{19}{70} \approx 0{,}2714.

3. Calculamos el error estándar de la pendiente. 1970352=19350,1245\sqrt{\dfrac{\dfrac{19}{70}}{\dfrac{35}{2}}} = \dfrac{\sqrt{19}}{35} \approx 0{,}1245.

4. Armamos el estadístico y decidimos. 132351935=132191930,2829\dfrac{\dfrac{132}{35}}{\dfrac{\sqrt{19}}{35}} = \dfrac{132 \sqrt{19}}{19} \approx 30{,}2829, muy por encima del crítico 2,7762{,}776: la pendiente es significativa.

Respuesta: el estadístico vale 132191930,2829\dfrac{132 \sqrt{19}}{19} \approx 30{,}2829 y se rechaza que la pendiente sea cero

d)

1. Reemplazamos. 295+132354=7313520,8857\dfrac{29}{5} + \dfrac{132}{35} \cdot 4 = \dfrac{731}{35} \approx 20{,}8857 millones.

2. Comparamos con el dato observado. La sucursal de cuatro años facturó 2121, así que la recta se queda algo corta.

3. Marcamos el rango válido. Los datos van de 11 a 66 años. Predecir a diez años sería extrapolar y la recta no lo sostiene.

4. Anotamos qué mejora el modelo de a). La predicción simple ignora la cantidad de empleados. El modelo múltiple de a) usa las dos variables y por eso deja residuos más chicos.

Respuesta: la predicción es 7313520,8857\dfrac{731}{35} \approx 20{,}8857 millones

Repasá: Regresión lineal múltiple · Mínimos cuadrados · Inferencia sobre la pendiente · Predicción y sus límites

12.

De siete comercios se relevó la superficie en decenas de metros cuadrados, la cantidad de referencias en góndola y las ventas semanales en miles, en ese orden: (2;10;25)(2; 10; 25) · (3;12;31)(3; 12; 31) · (4;15;38)(4; 15; 38) · (5;16;43)(5; 16; 43) · (6;20;52)(6; 20; 52) · (7;21;56)(7; 21; 56) · (8;25;65)(8; 25; 65).

  • a)Ajustá la regresión múltiple de las ventas sobre la superficie y la cantidad de referencias.
  • b)Ajustando ahora la recta simple de las ventas sobre la superficie, calculá el coeficiente de determinación.
  • c)Con la recta simple de b), contrastá al 55 por ciento si la superficie aporta a explicar las ventas.
  • d)Con la recta simple de b), predecí las ventas de un comercio de superficie seis y explicá el alcance de la predicción.
Ver solución

a)

1. Escribimos el modelo. Ventas igual a una constante más un coeficiente por superficie más otro por cantidad de referencias.

2. Resolvemos las ecuaciones normales. Se minimiza la suma de cuadrados de los residuos, lo que da un sistema de tres ecuaciones con tres incógnitas.

3. Escribimos los coeficientes. Constante 307704,3857\dfrac{307}{70} \approx 4{,}3857, 61203,05\dfrac{61}{20} \approx 3{,}05 por unidad de superficie y 29201,45\dfrac{29}{20} \approx 1{,}45 por referencia.

4. Anotamos la lectura correcta. Cada coeficiente mide el efecto de su variable con la otra fija. Las dos variables están muy correlacionadas entre sí, y eso hace que los coeficientes individuales sean menos estables de lo que parece.

Respuesta: los coeficientes son 30770\dfrac{307}{70}, 6120\dfrac{61}{20} y 2920\dfrac{29}{20}

b)

1. Ajustamos la recta simple. Pendiente 4676,5714\dfrac{46}{7} \approx 6{,}5714 y ordenada 80711,4286\dfrac{80}{7} \approx 11{,}4286.

2. Calculamos la variabilidad total. Syy=850871215,4286S_{yy} = \dfrac{8508}{7} \approx 1215{,}4286.

3. Calculamos los residuos. Suman 4476,2857\dfrac{44}{7} \approx 6{,}2857.

4. Armamos el coeficiente. 144785087=211621270,99481 - \dfrac{\dfrac{44}{7}}{\dfrac{8508}{7}} = \dfrac{2116}{2127} \approx 0{,}9948: la superficie sola explica alrededor del 99,482899{,}4828 por ciento de las ventas, casi tanto como el modelo de a) con dos variables. Los residuos que quedan son los que c) usa para el error de la pendiente.

Respuesta: el coeficiente de determinación vale 211621270,9948\dfrac{2116}{2127} \approx 0{,}9948

c)

1. Traducimos la pregunta. Que la superficie aporte quiere decir que la pendiente de la recta de b) no es cero, así que la nula es que vale cero.

2. Estimamos la varianza residual. 4475=44351,2571\dfrac{\dfrac{44}{7}}{5} = \dfrac{44}{35} \approx 1{,}2571, con 55 grados de libertad.

3. Calculamos el error estándar de la pendiente. 443528=55350,2119\sqrt{\dfrac{\dfrac{44}{35}}{28}} = \dfrac{\sqrt{55}}{35} \approx 0{,}2119.

4. Decidimos. 4675535=46551131,0132\dfrac{\dfrac{46}{7}}{\dfrac{\sqrt{55}}{35}} = \dfrac{46 \sqrt{55}}{11} \approx 31{,}0132, muy por encima del crítico 2,5712{,}571: la superficie sí aporta.

Respuesta: el estadístico vale 46551131,0132\dfrac{46 \sqrt{55}}{11} \approx 31{,}0132 y se rechaza que la pendiente sea cero

d)

1. Reemplazamos. 807+4676=356750,8571\dfrac{80}{7} + \dfrac{46}{7} \cdot 6 = \dfrac{356}{7} \approx 50{,}8571 miles.

2. Comparamos con lo observado. El comercio de superficie seis vendió 5252, así que la recta se acerca.

3. Marcamos el rango. Los datos van de 22 a 88. Fuera de ahí la recta no autoriza ninguna predicción, por bueno que sea el ajuste de b).

4. Separamos los dos intervalos. Un intervalo para la venta media de todos los comercios de esa superficie es más angosto que uno para la venta de un comercio en particular, porque el segundo suma la variabilidad individual.

Respuesta: la predicción es 356750,8571\dfrac{356}{7} \approx 50{,}8571 miles

Repasá: Regresión lineal múltiple · Coeficiente de determinación · Inferencia sobre la pendiente · Predicción y sus límites

Las cuentas de este material están verificadas una por una. Si aun así encontrás algo raro, .