Integradores de Inferencia estadística
Un integrador junta varios temas de la unidad en un solo ejercicio, con consignas encadenadas a), b), c) y d) — como en un parcial.
1.
Una embotelladora carga botellas con un desvío poblacional conocido de mililitros y contenido normal. La etiqueta declara mililitros. Se midieron diez botellas: ; ; ; ; ; ; ; ; ; .
- a)Construí el intervalo de confianza del por ciento para el contenido medio.
- b)Con la media y el error estándar de a), contrastá al por ciento si el contenido medio supera los mililitros declarados.
- c)Si el contenido medio real fuera mililitros, calculá el error de tipo II y la potencia del test de b).
- d)Calculá cuántas botellas habría que medir para que el margen del intervalo de a) no pase de mililitros.
Ver solución
a)
1. Calculamos la media muestral. Los contenidos suman , y divididos por dan mililitros.
2. Elegimos la distribución. El desvío poblacional se conoce y vale , así que corresponde el crítico de la normal y no el de la t.
3. Calculamos el error estándar. .
4. Armamos el margen y el intervalo. , así que el intervalo va de a mililitros.
Respuesta: el intervalo va de a
b)
1. Planteamos la hipótesis. La afirmación a probar es que el contenido medio supera , así que el test es de cola derecha.
2. Elegimos el estadístico. Con sigma conocido va el estadístico z, con el mismo error estándar que se usó en a).
3. Calculamos. .
4. Comparamos con el crítico. El crítico de cola derecha al por ciento es , y el estadístico no lo alcanza, así que no se rechaza. El intervalo de a) contiene a , y las dos conclusiones son la misma leída de dos formas.
Respuesta: el estadístico vale y no se rechaza
c)
1. Ubicamos el punto de corte. El test de b) rechaza cuando la media muestral supera mililitros.
2. Cambiamos el centro de la distribución. El error de tipo II se calcula suponiendo que la media real es , no la de la hipótesis nula. Centrar la distribución en la nula daría alfa y no beta, que es el error del subtema.
3. Calculamos beta. Es el área a la izquierda de en una normal centrada en : da .
4. Calculamos la potencia. Restando de uno queda . Con esta muestra el test detecta una diferencia de mililitros algo más de tres veces de cada cuatro.
Respuesta: el error de tipo II vale y la potencia
d)
1. Escribimos la condición. El margen es el crítico por el error estándar, y se pide que no supere mililitros. En a) daba alrededor de , así que hace falta más muestra.
2. Despejamos el tamaño. .
3. Redondeamos hacia arriba. Con botellas el margen quedaría apenas por encima del pedido, así que hacen falta .
4. Anotamos la regla. Pasar de a botellas achica el margen menos de lo que sugiere el salto: la reducción va con la raíz del tamaño.
Respuesta: hacen falta botellas
Repasá: Intervalo de confianza para la media · Test para la media con $\sigma$ conocido · Potencia y error de tipo II · Tamaño de muestra necesario
2.
Una línea de atención tiene un desvío poblacional conocido de segundos y tiempos normales. El estándar del servicio es de segundos. Se cronometraron doce llamadas: ; ; ; ; ; ; ; ; ; ; ; .
- a)Estimá puntualmente el tiempo medio de atención y decí qué propiedad tiene ese estimador.
- b)Con la estimación de a), construí el intervalo del por ciento para el tiempo medio.
- c)Contrastá al por ciento si el tiempo medio de atención supera el estándar de segundos.
- d)Si el tiempo medio real fuera segundos, calculá el error de tipo II y la potencia del test de c).
Ver solución
a)
1. Elegimos el estimador. La media muestral estima la media poblacional.
2. Calculamos. La suma de las llamadas da , y dividida por queda segundos.
3. Nombramos la propiedad. Es insesgado: en promedio, sobre todas las muestras posibles, da el parámetro. Además es consistente, porque su error estándar tiende a cero cuando crece la muestra.
Respuesta: la estimación puntual del tiempo medio es segundos
b)
1. Elegimos el crítico. El desvío poblacional se conoce, así que va el de la normal. Para el por ciento a dos colas vale .
2. Calculamos el error estándar. segundos.
3. Armamos el margen. .
4. Escribimos el intervalo. De a segundos. Es más angosto que uno del por ciento: más confianza cuesta más ancho.
Respuesta: el intervalo va de a
c)
1. Escribimos la hipótesis. La afirmación es que el tiempo medio supera , así que la región de rechazo queda a la derecha.
2. Elegimos el estadístico. Con sigma conocido corresponde z.
3. Calculamos. .
4. Decidimos. El crítico de cola derecha al por ciento es y el estadístico queda por debajo: no se rechaza el estándar. El intervalo de b) contiene a y dice lo mismo.
Respuesta: el estadístico vale y no se rechaza
d)
1. Buscamos el punto de corte. El test rechaza cuando la media muestral pasa de segundos.
2. Recentramos. Beta se calcula con la distribución de la media muestral centrada en el valor real , no en el de la nula.
3. Calculamos beta. El área a la izquierda del corte en esa normal da .
4. Calculamos la potencia. Restando de uno queda . Es baja: con doce llamadas el test detecta una diferencia de segundos apenas la mitad de las veces, y esa es la razón principal para agrandar la muestra.
Respuesta: el error de tipo II vale y la potencia
Repasá: Estimación puntual y propiedades · Intervalo de confianza para la media · Test para la media con $\sigma$ conocido · Potencia y error de tipo II
3.
A diez pacientes se les midió la presión sistólica antes y después de un tratamiento. Antes: ; ; ; ; ; ; ; ; ; . Después: ; ; ; ; ; ; ; ; ; . A un grupo de control de ocho pacientes que no recibió el tratamiento se le midió una sola vez: ; ; ; ; ; ; ; .
- a)Estimá puntualmente la presión media del grupo de control y decí qué propiedad tiene ese estimador.
- b)Sobre los diez pares de antes y después, calculá el estadístico del test para muestras apareadas al por ciento y decidí.
- c)Con la media de a), contrastá al por ciento si la presión media del grupo de control es de .
- d)Con el estadístico de b), construí el intervalo del por ciento para la diferencia media.
Ver solución
a)
1. Elegimos el estimador. Para la media poblacional se usa la media muestral, porque su esperanza es el parámetro: es insesgada.
2. Sumamos y dividimos. Los valores del control suman , y divididos por dan .
3. Anotamos para qué sirve el control. El grupo de control no está apareado con nadie: sirve para ver dónde está la presión sin tratamiento, y es una muestra independiente de las otras dos.
Respuesta: la presión media del control se estima en
b)
1. Armamos las diferencias. Restando después menos antes en cada par queda: ; ; ; ; ; ; ; ; ; .
2. Calculamos su media. Suman , y divididas por dan .
3. Calculamos su desvío. Los desvíos al cuadrado suman , así que la varianza es y el desvío .
4. Armamos el estadístico. , que en módulo supera el crítico de a): se rechaza que no haya cambio.
5. Anotamos por qué van apareadas. Tratar las dos series como muestras independientes usaría el doble de grados de libertad y un error estándar más grande, y perdería justamente lo que hace fuerte al diseño: cada sujeto es su propio control.
Respuesta: el estadístico vale y se rechaza
c)
1. Elegimos la distribución. El desvío poblacional del control no se conoce y hay que estimarlo con el muestral, así que corresponde la t y no la z.
2. Calculamos el desvío muestral. Los desvíos al cuadrado respecto de suman , así que la varianza es y el desvío .
3. Armamos el estadístico. , con grados de libertad.
4. Decidimos. El crítico a dos colas al por ciento es y el estadístico no lo alcanza: no se rechaza. Notar la diferencia con b): allá cada paciente era su propio control y el test detectó el cambio; acá la comparación es contra un valor de referencia y con una sola medición.
Respuesta: el estadístico t vale con grados de libertad y no se rechaza
d)
1. Elegimos la distribución. Se estima el desvío con el de las diferencias, así que corresponde la t con grados de libertad, la misma de a).
2. Calculamos el error estándar. .
3. Armamos el margen. .
4. Escribimos el intervalo. , o sea de a . No contiene al cero, lo cual coincide con el rechazo de b).
Respuesta: el intervalo va de a
Repasá: Estimación puntual y propiedades · Muestras apareadas · Test para la media con $\sigma$ desconocido · Intervalo con desvío desconocido
4.
Ocho operarios rindieron una prueba de tiempo, en segundos, antes y después de una capacitación. Antes: ; ; ; ; ; ; ; . Después: ; ; ; ; ; ; ; .
- a)Escribí la hipótesis nula y la alternativa, la cantidad de colas y el valor crítico que corresponde al por ciento.
- b)Usando el diseño apareado y el crítico de a), calculá el estadístico y tomá la decisión.
- c)Obtené el valor p asociado al estadístico de b) y contrastalo con el nivel de significación.
- d)Estimá por intervalo, con por ciento de confianza, la diferencia media entre las dos mediciones.
Ver solución
a)
1. Escribimos las hipótesis. La nula dice que la diferencia media entre después y antes vale , y la alternativa que es distinta de cero.
2. Elegimos la cola. La afirmación del enunciado no indica dirección, así que el test es de dos colas y la región de rechazo se reparte entre los dos extremos.
3. Elegimos la distribución. El desvío de las diferencias no se conoce y hay que estimarlo, así que va la t con grados de libertad.
4. Escribimos el valor crítico. Al por ciento y a dos colas, la t con grados de libertad da . Se rechaza si el estadístico queda fuera de ese intervalo.
Respuesta: test de dos colas, con valor crítico y grados de libertad
b)
1. Armamos las diferencias. Restando después menos antes en cada par queda: ; ; ; ; ; ; ; .
2. Calculamos su media. Suman , y divididas por dan .
3. Calculamos su desvío. Los desvíos al cuadrado suman , así que la varianza es y el desvío .
4. Armamos el estadístico. , que en módulo supera el crítico de a): se rechaza que no haya cambio.
5. Anotamos por qué van apareadas. Tratar las dos series como muestras independientes usaría el doble de grados de libertad y un error estándar más grande, y perdería justamente lo que hace fuerte al diseño: cada sujeto es su propio control.
Respuesta: el estadístico vale y se rechaza
c)
1. Definimos el valor p. Es la probabilidad de obtener un estadístico tan extremo o más que el observado, suponiendo cierta la hipótesis nula.
2. Elegimos la cola. Como el test de a) es de dos colas, se toma el área de las dos puntas más allá de en módulo.
3. Buscamos en la tabla. Con grados de libertad, el valor p da .
4. Comparamos con alfa. queda por debajo del nivel de significación, así que se rechaza. Da la misma decisión que b), y tiene que darla: el valor p y la región crítica son dos formas de mirar lo mismo.
Respuesta: el valor p es y queda por debajo del nivel de significación
d)
1. Elegimos la distribución. Se estima el desvío con el de las diferencias, así que corresponde la t con grados de libertad, la misma de a).
2. Calculamos el error estándar. .
3. Armamos el margen. .
4. Escribimos el intervalo. , o sea de a . No contiene al cero, lo cual coincide con el rechazo de b).
Respuesta: el intervalo va de a
Repasá: Hipótesis, errores y decisión · Muestras apareadas · El valor p · Intervalo con desvío desconocido
5.
Tres fertilizantes se probaron en parcelas iguales y se midió el rendimiento, en quintales. Fertilizante A: ; ; ; ; . Fertilizante B: ; ; ; ; . Fertilizante C: ; ; ; ; .
- a)Contrastá al por ciento si los fertilizantes A y B tienen la misma variabilidad.
- b)Con el resultado de a), comparál las medias de A y B con un test al por ciento.
- c)Escribí las hipótesis del test de b), de cuántas colas es y cuál es el valor crítico que corresponde al por ciento.
- d)Con los tres fertilizantes juntos, calculá el estadístico del análisis de la varianza y sus grados de libertad.
Ver solución
a)
1. Calculamos las dos varianzas muestrales. El fertilizante A: media y varianza . El fertilizante B: media y varianza .
2. Armamos el cociente con la mayor arriba. , con y grados de libertad.
3. Comparamos con el crítico. El test es de dos colas, porque la hipótesis alternativa es que las varianzas sean distintas, así que el por ciento se reparte entre las dos puntas y el crítico de la derecha es el que deja por ciento: con y grados de libertad vale . El estadístico no lo alcanza.
4. Concluimos. No se rechaza la igualdad de varianzas, que es justo el supuesto que hace falta para las dos consignas que siguen.
Respuesta: el cociente vale con y grados de libertad, y no se rechaza la igualdad de varianzas
b)
1. Usamos el supuesto de a). Como las varianzas se pueden suponer iguales, se combinan en una sola estimación.
2. Calculamos la varianza combinada. . Se pondera por los grados de libertad, no por el tamaño: promediar las dos varianzas a secas es el error del subtema.
3. Calculamos el error estándar. .
4. Armamos el estadístico y decidimos. , con grados de libertad. En módulo supera el crítico , así que se rechaza la igualdad de medias entre A y B.
Respuesta: el estadístico vale y se rechaza la igualdad de medias
c)
1. Escribimos la nula y la alternativa. La nula dice que los dos fertilizantes rinden lo mismo en promedio, o sea que la diferencia de medias vale . La alternativa, que no.
2. Elegimos la cola. El enunciado no afirma cuál de los dos rinde más, así que el test es de dos colas y la región de rechazo se reparte entre los dos extremos.
3. Elegimos la distribución. Las varianzas se estiman de los datos, y en a) quedó establecido que se pueden suponer iguales, así que va la t con grados de libertad.
4. Escribimos el valor crítico. Al por ciento y a dos colas, con grados de libertad, la t vale . Es exactamente el número contra el que se comparó el estadístico de b), y los dos errores posibles son rechazar siendo cierta la nula o no rechazar siendo falsa.
Respuesta: test de dos colas, con grados de libertad y valor crítico
d)
1. Calculamos la media general. Con los datos, la media general es .
2. Calculamos la variación entre grupos. Pesando el cuadrado de la distancia de cada media a la general por el tamaño del grupo, queda con grados de libertad.
3. Calculamos la variación dentro de los grupos. Sumando los desvíos al cuadrado internos queda con grados de libertad.
4. Armamos el cociente. . Con un crítico de al por ciento, el estadístico lo supera ampliamente: al menos un fertilizante rinde distinto. El análisis de la varianza responde eso y no cuál, que es lo que sí contestó b) para el par A y B.
Respuesta: el estadístico F vale con y grados de libertad
Repasá: Comparación de varianzas · Intervalo y test para dos medias · Hipótesis, errores y decisión · Análisis de la varianza
6.
Tres turnos de una planta se compararon por la cantidad de piezas terminadas por hora. Turno mañana: ; ; ; ; . Turno tarde: ; ; ; ; . Turno noche: ; ; ; ; .
- a)Decidí al por ciento si el turno mañana y el turno noche tienen la misma variabilidad.
- b)Apoyándote en a), contrastá al por ciento si el turno mañana y el turno noche tienen la misma producción media.
- c)Contrastá al por ciento si el turno tarde produce en promedio piezas por hora.
- d)Con los tres turnos juntos, calculá el estadístico del análisis de la varianza y sus grados de libertad.
Ver solución
a)
1. Calculamos las dos varianzas muestrales. El turno mañana: media y varianza . El turno noche: media y varianza .
2. Armamos el cociente con la mayor arriba. , con y grados de libertad.
3. Comparamos con el crítico. El test es de dos colas, porque la hipótesis alternativa es que las varianzas sean distintas, así que el por ciento se reparte entre las dos puntas y el crítico de la derecha es el que deja por ciento: con y grados de libertad vale . El estadístico no lo alcanza.
4. Concluimos. No se rechaza la igualdad de varianzas, que es justo el supuesto que hace falta para las dos consignas que siguen.
Respuesta: el cociente vale con y grados de libertad, y no se rechaza la igualdad de varianzas
b)
1. Usamos el supuesto de a). Como las varianzas se pueden suponer iguales, se combinan en una sola estimación.
2. Calculamos la varianza combinada. . Se pondera por los grados de libertad, no por el tamaño: promediar las dos varianzas a secas es el error del subtema.
3. Calculamos el error estándar. .
4. Armamos el estadístico y decidimos. , con grados de libertad. En módulo no llega al crítico , así que no se rechaza la igualdad de medias entre esos dos turnos.
Respuesta: el estadístico vale y no se rechaza la igualdad de medias
c)
1. Elegimos la distribución. El desvío poblacional no se conoce, así que corresponde la t y no la z.
2. Calculamos el error estándar. .
3. Armamos el estadístico. , con grados de libertad.
4. Decidimos. El crítico a dos colas al por ciento es , y el estadístico no lo alcanza: no se rechaza.
Respuesta: el estadístico t vale y no se rechaza
d)
1. Calculamos la media general. Con los datos, la media general es .
2. Calculamos la variación entre grupos. Pesando el cuadrado de la distancia de cada media a la general por el tamaño del grupo, queda con grados de libertad.
3. Calculamos la variación dentro de los grupos. Sumando los desvíos al cuadrado internos queda con grados de libertad.
4. Armamos el cociente. . Con un crítico de al por ciento, el estadístico lo supera: hay al menos un turno que produce distinto, aunque el par comparado en b) no haya mostrado diferencia.
Respuesta: el estadístico F vale con y grados de libertad
Repasá: Comparación de varianzas · Intervalo y test para dos medias · Test para la media con $\sigma$ desconocido · Análisis de la varianza
7.
Una tienda comparó dos canales de venta. Del canal web, sobre visitas, terminaron en compra. Del canal telefónico, sobre llamadas, terminaron en compra.
- a)Armá la tabla de doble entrada y contrastá al por ciento si el canal y el resultado de la visita son independientes.
- b)Con los mismos datos, contrastá al por ciento si las dos proporciones de compra son iguales.
- c)Construí el intervalo del por ciento para la proporción de compra del canal web.
- d)Calculá el valor p del estadístico de b) y comprobá que da la misma decisión.
Ver solución
a)
1. Armamos la tabla de doble entrada. El canal web: compras y no compras. El canal telefónico: y . En total casos.
2. Calculamos las frecuencias esperadas. Cada esperada es el total de su fila por el total de su columna, dividido por el total general. Es lo que habría si las dos variables fueran independientes.
3. Sumamos los aportes. Sumando el cuadrado de cada diferencia dividido por su esperada queda .
4. Escribimos los grados de libertad. En una tabla de dos por dos son , y el crítico al por ciento vale . El estadístico lo supera, así que se rechaza la independencia: el canal y el resultado están asociados.
Respuesta: el estadístico vale con grado de libertad
b)
1. Calculamos las dos proporciones. y .
2. Calculamos la proporción combinada. Bajo la hipótesis de igualdad las dos son la misma, así que se junta todo: .
3. Calculamos el error estándar y el estadístico. El error estándar da y el estadístico .
4. Comparamos con a). El cuadrado de es , que es el chi cuadrado de a). No es casualidad: en una tabla de dos por dos los dos tests son el mismo. En módulo el estadístico supera , así que se rechaza la igualdad de proporciones, igual que en a).
Respuesta: el estadístico vale y se rechaza la igualdad de proporciones
c)
1. Chequeamos que se pueda usar la normal. y , los dos por encima de cinco.
2. Calculamos el error estándar de esa proporción. . Notar que acá va la proporción del grupo y no la combinada de b): la combinada solo tiene sentido bajo la hipótesis de igualdad.
3. Armamos el margen. .
4. Escribimos el intervalo. , o sea de a .
Respuesta: el intervalo va de a
d)
1. Definimos el valor p. Es la probabilidad de obtener un estadístico tan extremo o más que el observado, suponiendo que las dos proporciones son iguales.
2. Elegimos la cola. El test de b) es de dos colas, así que se suman las dos puntas más allá de en módulo.
3. Buscamos en la tabla. En la normal estándar, esa área vale .
4. Comparamos con alfa. Queda por debajo del nivel de significación, así que se rechaza la igualdad de proporciones. Es la misma conclusión de b) y del chi cuadrado de a): el valor p y la región crítica son dos formas de mirar lo mismo.
Respuesta: el valor p es y queda por debajo del nivel de significación
Repasá: El test chi cuadrado de independencia · Comparación de dos proporciones · Intervalo para una proporción · El valor p
8.
Un municipio evaluó dos campañas de reciclado. En el barrio A, de hogares encuestados, separaron residuos. En el barrio B, de hogares, los separaron.
- a)Construí la tabla de doble entrada y decidí al por ciento si el barrio y la conducta de separar son independientes.
- b)Contrastá al por ciento si las dos proporciones de hogares que separan son iguales.
- c)Construí el intervalo del por ciento para la proporción de hogares del barrio A que separan residuos.
- d)Calculá cuántos hogares del barrio A habría que encuestar para que el error del intervalo de c) no supere .
Ver solución
a)
1. Armamos la tabla de doble entrada. El barrio A: separan y no separan. El barrio B: y . En total casos.
2. Calculamos las frecuencias esperadas. Cada esperada es el total de su fila por el total de su columna, dividido por el total general. Es lo que habría si las dos variables fueran independientes.
3. Sumamos los aportes. Sumando el cuadrado de cada diferencia dividido por su esperada queda .
4. Escribimos los grados de libertad. En una tabla de dos por dos son , y el crítico al por ciento vale . El estadístico no lo alcanza, así que no se rechaza la independencia entre barrio y conducta.
Respuesta: el estadístico vale con grado de libertad
b)
1. Calculamos las dos proporciones. y .
2. Calculamos la proporción combinada. Bajo la hipótesis de igualdad las dos son la misma, así que se junta todo: .
3. Calculamos el error estándar y el estadístico. El error estándar da y el estadístico .
4. Comparamos con a). El cuadrado de es , que es el chi cuadrado de a). No es casualidad: en una tabla de dos por dos los dos tests son el mismo. En módulo el estadístico no llega a , así que no se rechaza la igualdad, la misma conclusión de a).
Respuesta: el estadístico vale y no se rechaza la igualdad de proporciones
c)
1. Chequeamos que se pueda usar la normal. y , los dos por encima de cinco.
2. Calculamos el error estándar de esa proporción. . Notar que acá va la proporción del grupo y no la combinada de b): la combinada solo tiene sentido bajo la hipótesis de igualdad.
3. Armamos el margen. .
4. Escribimos el intervalo. , o sea de a .
Respuesta: el intervalo va de a
d)
1. Escribimos la condición. El margen del intervalo de c) tiene que quedar por debajo de .
2. Despejamos el tamaño. .
3. Redondeamos hacia arriba. Hacen falta casos. Truncar dejaría el error por encima del tolerado.
4. Anotamos de dónde sale la proporción previa. Se usó la observada. Si no hubiera dato previo se usaría , que es la proporción que maximiza el tamaño necesario y por lo tanto la elección conservadora.
Respuesta: hacen falta casos
Repasá: El test chi cuadrado de independencia · Comparación de dos proporciones · Intervalo para una proporción · Tamaño de muestra necesario
9.
Una cooperativa registró sus ventas anuales, en millones de pesos, durante seis años consecutivos numerados del uno al seis: · · · · · .
- a)Calculá el número índice simple del sexto año tomando el primero como base, y la serie de medias móviles de orden tres.
- b)Con los mismos años y ventas, ajustá la recta de mínimos cuadrados.
- c)Con la recta de b), calculá el coeficiente de determinación e interpretalo.
- d)Con la pendiente de b) y los residuos de c), contrastá al por ciento si la pendiente es distinta de cero.
Ver solución
a)
1. Escribimos el índice simple. Es el valor del período dividido por el de la base, multiplicado por cien.
2. Calculamos. , así que las ventas crecieron un por ciento respecto del primer año.
3. Armamos las medias móviles. Cada una promedia tres años consecutivos, y por eso la serie suavizada tiene dos términos menos que la original.
4. Calculamos las cuatro. · · · , una serie que sube parejo y deja ver la tendencia sin los saltos año a año.
Respuesta: índice y medias móviles , , ,
b)
1. Calculamos las medias. El año medio es y la venta media .
2. Calculamos las sumas cruzadas. y .
3. Calculamos la pendiente. millones por año.
4. Calculamos la ordenada al origen. . La recta suaviza la serie igual que las medias móviles de a), pero con una fórmula que además permite extrapolar dentro del rango.
Respuesta: la recta es , con pendiente y ordenada
c)
1. Escribimos qué mide. Es la fracción de la variabilidad de las ventas que la recta explica.
2. Calculamos la variabilidad total. .
3. Calculamos los residuos. La suma de los cuadrados de los residuos da .
4. Armamos el coeficiente. , o sea que la recta de b) explica alrededor del por ciento de la variación de las ventas. Los residuos que quedan son los que va a usar d) para estimar el error de la pendiente.
Respuesta: el coeficiente de determinación vale
d)
1. Escribimos la hipótesis. La nula dice que la pendiente vale cero, o sea que el año no aporta nada a explicar las ventas.
2. Estimamos la varianza residual. , con grados de libertad, porque se estimaron dos parámetros.
3. Calculamos el error estándar de la pendiente. .
4. Armamos el estadístico y decidimos. , muy por encima del crítico : se rechaza que la pendiente sea cero.
Respuesta: el estadístico vale y se rechaza que la pendiente sea cero
Repasá: Números índices y series cronológicas · Mínimos cuadrados · Coeficiente de determinación · Inferencia sobre la pendiente
10.
Un edificio registró su consumo eléctrico, en miles de kilovatios hora, en siete meses consecutivos numerados del uno al siete: · · · · · · .
- a)Calculá el número índice del séptimo mes con base en el primero, y el consumo promedio de los siete meses.
- b)Ajustá la recta de mínimos cuadrados del consumo en función del mes.
- c)Con la recta de b), calculá el coeficiente de determinación.
- d)Con la recta de b), predecí el consumo del quinto mes y explicá hasta dónde llega esa predicción.
Ver solución
a)
1. Escribimos el índice. Es el valor del período sobre el de la base, por cien.
2. Calculamos. , un crecimiento de alrededor del por ciento.
3. Calculamos el promedio. .
Respuesta: índice y consumo promedio
b)
1. Partimos del promedio de a). El consumo medio ya lo calculamos en a), ; el mes medio es .
2. Calculamos las sumas cruzadas. y .
3. Obtenemos la pendiente. por mes.
4. Obtenemos la ordenada al origen. .
Respuesta: la recta es , con pendiente y ordenada
c)
1. Calculamos la variabilidad total. .
2. Calculamos la variabilidad no explicada. Los residuos al cuadrado suman .
3. Armamos el cociente. .
4. Interpretamos. El mes explica alrededor del por ciento de la variación del consumo. Lo que queda es la parte que la recta de b) no captura, y es lo que limita la predicción de d).
Respuesta: el coeficiente de determinación vale
d)
1. Reemplazamos en la recta. miles de kilovatios hora.
2. Comparamos con el dato observado. El quinto mes se registró , así que la recta se acerca bastante, cosa esperable con el coeficiente de determinación alto de c).
3. Marcamos el límite. La recta se ajustó con meses del al : predecir para el mes veinte sería extrapolar, y nada en los datos garantiza que la tendencia siga siendo lineal fuera de ese rango.
4. Anotamos la otra fuente de error. Aun dentro del rango, la predicción es un valor medio y no un valor individual. Un intervalo para una observación nueva es más ancho que uno para el promedio.
Respuesta: la predicción del quinto mes es
Repasá: Números índices y series cronológicas · Mínimos cuadrados · Coeficiente de determinación · Predicción y sus límites
11.
De seis sucursales se registró la antigüedad en años, la cantidad de empleados y la facturación mensual en millones, en ese orden: · · · · · .
- a)Ajustá la regresión lineal múltiple de la facturación sobre la antigüedad y la cantidad de empleados.
- b)Ajustá ahora la recta simple de la facturación en función de la antigüedad solamente.
- c)Con la recta simple de b), contrastá al por ciento si la pendiente es distinta de cero.
- d)Con la recta simple de b), predecí la facturación de una sucursal de cuatro años y marcá el límite de esa predicción.
Ver solución
a)
1. Escribimos el modelo. La facturación se explica con una constante más un coeficiente por la antigüedad más otro por la cantidad de empleados.
2. Planteamos las ecuaciones normales. Los coeficientes salen de resolver el sistema que minimiza la suma de cuadrados de los residuos, con tres incógnitas y tres ecuaciones.
3. Resolvemos. Queda una constante de , un coeficiente de por año de antigüedad y uno de por empleado.
4. Leemos los coeficientes. Cada uno mide el efecto de su variable manteniendo la otra fija, que es justamente lo que una regresión simple no puede separar.
Respuesta: los coeficientes son , y
b)
1. Nos quedamos con una sola variable. Se ignora la cantidad de empleados y se ajusta la recta con la antigüedad.
2. Calculamos las medias y las sumas cruzadas. Antigüedad media , facturación media , y .
3. Calculamos la pendiente y la ordenada. Pendiente y ordenada .
4. Comparamos con a). La pendiente simple no coincide con el coeficiente de antigüedad de a). No es un error: la simple absorbe también el efecto de los empleados, porque las dos variables crecen juntas.
Respuesta: la recta simple es , con pendiente y ordenada
c)
1. Escribimos la hipótesis. La nula dice que la antigüedad no aporta nada, o sea pendiente cero.
2. Calculamos la varianza residual. Los residuos al cuadrado suman , y divididos por dan .
3. Calculamos el error estándar de la pendiente. .
4. Armamos el estadístico y decidimos. , muy por encima del crítico : la pendiente es significativa.
Respuesta: el estadístico vale y se rechaza que la pendiente sea cero
d)
1. Reemplazamos. millones.
2. Comparamos con el dato observado. La sucursal de cuatro años facturó , así que la recta se queda algo corta.
3. Marcamos el rango válido. Los datos van de a años. Predecir a diez años sería extrapolar y la recta no lo sostiene.
4. Anotamos qué mejora el modelo de a). La predicción simple ignora la cantidad de empleados. El modelo múltiple de a) usa las dos variables y por eso deja residuos más chicos.
Respuesta: la predicción es millones
Repasá: Regresión lineal múltiple · Mínimos cuadrados · Inferencia sobre la pendiente · Predicción y sus límites
12.
De siete comercios se relevó la superficie en decenas de metros cuadrados, la cantidad de referencias en góndola y las ventas semanales en miles, en ese orden: · · · · · · .
- a)Ajustá la regresión múltiple de las ventas sobre la superficie y la cantidad de referencias.
- b)Ajustando ahora la recta simple de las ventas sobre la superficie, calculá el coeficiente de determinación.
- c)Con la recta simple de b), contrastá al por ciento si la superficie aporta a explicar las ventas.
- d)Con la recta simple de b), predecí las ventas de un comercio de superficie seis y explicá el alcance de la predicción.
Ver solución
a)
1. Escribimos el modelo. Ventas igual a una constante más un coeficiente por superficie más otro por cantidad de referencias.
2. Resolvemos las ecuaciones normales. Se minimiza la suma de cuadrados de los residuos, lo que da un sistema de tres ecuaciones con tres incógnitas.
3. Escribimos los coeficientes. Constante , por unidad de superficie y por referencia.
4. Anotamos la lectura correcta. Cada coeficiente mide el efecto de su variable con la otra fija. Las dos variables están muy correlacionadas entre sí, y eso hace que los coeficientes individuales sean menos estables de lo que parece.
Respuesta: los coeficientes son , y
b)
1. Ajustamos la recta simple. Pendiente y ordenada .
2. Calculamos la variabilidad total. .
3. Calculamos los residuos. Suman .
4. Armamos el coeficiente. : la superficie sola explica alrededor del por ciento de las ventas, casi tanto como el modelo de a) con dos variables. Los residuos que quedan son los que c) usa para el error de la pendiente.
Respuesta: el coeficiente de determinación vale
c)
1. Traducimos la pregunta. Que la superficie aporte quiere decir que la pendiente de la recta de b) no es cero, así que la nula es que vale cero.
2. Estimamos la varianza residual. , con grados de libertad.
3. Calculamos el error estándar de la pendiente. .
4. Decidimos. , muy por encima del crítico : la superficie sí aporta.
Respuesta: el estadístico vale y se rechaza que la pendiente sea cero
d)
1. Reemplazamos. miles.
2. Comparamos con lo observado. El comercio de superficie seis vendió , así que la recta se acerca.
3. Marcamos el rango. Los datos van de a . Fuera de ahí la recta no autoriza ninguna predicción, por bueno que sea el ajuste de b).
4. Separamos los dos intervalos. Un intervalo para la venta media de todos los comercios de esa superficie es más angosto que uno para la venta de un comercio en particular, porque el segundo suma la variabilidad individual.
Respuesta: la predicción es miles
Repasá: Regresión lineal múltiple · Coeficiente de determinación · Inferencia sobre la pendiente · Predicción y sus límites
Volver al índice de Estadística
Las cuentas de este material están verificadas una por una. Si aun así encontrás algo raro, .