Topic outline
-
ESTADÍSTICA I V - P3736-TEÓRICO-N0280-05-N01
PRIMER NIVEL
NELSON ALBERTO CERDA PRADO
—
CARLOS JULIO MAYORGA ARIAS
—
CARLOS JULIO MAYORGA ARIAS
—
usuario testadmin2
Educación inicial
-
Medición de probabilidad variables discretas 2
-
Introducción
Ahora que dominamos la distribución de probabilidad binomial, estamos listos para pasar a la siguiente distribución teórica discreta, la de Poisson. Esta distribución de probabilidad recibe su nombre de Simeón Poisson, un matemático francés que desarrolló la distribución a principios del siglo XIX.
Cuando estudiamos la teoría de probabilidades observamos las ventajas de calcular la frecuencia relativa con la que ocurren ciertos eventos y esta frecuencia relativa generalmente estaba relacionada con conceptos de espacio o tiempo.
Con frecuencia se utiliza para describir el número de llegadas de clientes por hora, el número de accidentes industriales cada mes, el número de conexiones eléctricas defectuosas por milla de cableado en un sistema eléctrico de una ciudad, o el número de máquinas que se dañan y esperan ser reparadas.
Proceso de Poisson
Sea X (t) el número de ocurrencias del evento con el tiempo (el proceso); entonces X (t) consiste en funciones de valores enteros no-decrecientes. La probabilidad de que sucedan exactamente k eventos en el tiempo t es:
Imag
Aplicación teorema de limite central
El teorema del límite central implica que si el tamaño de la muestra n es grande, la distribución de la suma parcial Yn es aproximadamente normal, con media nμ y varianza nσ2 . De forma equivalente, la media muestral es aproximadamente normal, con media μ y varianza σ2/n.
-
7.1 Distribución de Poisson?7.2 Funciones de distribución de Poisson Parte I
Empecemos con algunas definiciones
7.1 Distribución de Poisson?
Distribución de Poisson mide la probabilidad de un evento aleatorio sobre algún intervalo de tiempo o espacio, es decir trata de modelar si un evento se producirá en el tiempo o espacio y con qué probabilidad.
Frecuencia Relativa
Este modelo utiliza los datos de las observaciones que se han registrado, en base a estos calcula la frecuencia con la que ha presentado dicho evento y en base a esta frecuencia se calcula la probabilidad.

Figura 1: Fórmula de frecuencia relativa
Prado A. (2025)Adaptación de la fórmula de frecuencia relativa de Webster (2000) capitulo 3
Este modelo es también llamado a posteriori, dado que la probabilidad del evento se calcula luego de ser recabada la data.
También hay que recordar que al calcular este tipo de probabilidad se puede presentar algunos problemas, por ejemplo, de la fórmula podemos deducir que, si las observaciones no incluyen una o más opciones será imposible su cálculo de probabilidad y, por otro lado, si se cuenta con pocas observaciones sus resultados pueden ser engañosos
Esta distribución, ideada por Simeón Poisson en 1840, se refiere a variables aleatorias de naturaleza discreta que tratan de inferir la frecuencia relativa de un evento sobre alguna unidad de tiempo o espacio. Por ejemplo, se utiliza para describir el número de llegadas de clientes por hora, el número de accidentes cada mes, el número de defectos en un enlace de fibra óptima por kilómetro etc. Es decir, cada vez que usted vea un enunciado en el que se pretende conocer el valor de una variable por tiempo o espacio, será una clave para revisar la distribución de Poisson.
Qué es un
De acuerdo a Donnelly R. (2019), Un tiene las siguientes características:
- El experimento consiste en contar el número de ocurrencias de un evento durante un período de tiempo, área, distancia o cualquier otro tipo de medición, este valor será dado por el argumento k
- La probabilidad de ocurrencia del evento es constante para dos intervalos cualesquiera de tiempo o espacio. Por ejemplo, si seis clientes entran a la tienda durante la primera hora de actividad, esto no tendría ningún efecto en el número de clientes que llegarían durante la segunda hora, esto estaría calculado en la media como se menciona a continuación.
- La media de la distribución de Poisson tiene que ser la misma para cada intervalo de medición y se denota con el argumento λ
- El número de ocurrencias durante un intervalo es independiente del número de ocurrencias en cualquier otro intervalo
- Los intervalos no se superponen. Por ejemplo, al contar el número de clientes que entran a la tienda en períodos de una hora, los períodos de una hora no pueden superponerse entre sí. Podemos contar el número de clientes que llegan entre las 9 y las 10 a. m. y entre las 10 y las 11 a. m., y así sucesivamente, pero no podemos utilizar otro período de 9:30 a 10:30 a.m. porque se superpone con los otros intervalos.
7.2 Funciones Programáticas de la distribución de PoissonFunción PMF
Recordando el concepto de la función PMF, ésta calcula una probabilidad puntual, por ejemplo, la probabilidad de que entren 3 personas a una tienda asumiendo un lambda de x.
De acuerdo a Webster (2020). Dado los supuestos mencionados arriba la función de probabilidad estará dada por la siguiente fórmula

Figura 2: Función PMF para la distribución de Poisson
Prado A. (2025)Adaptación de la fórmula para la probabilidad puntual en distribución de Poisson tomado de Webster
(2000) capitulo 5
Note que al encontrar un k! implica que la variable debe ser discreta dado que no es posible calcular el factorial de un valor con decimales.
A diferencia de la distribución binomial en el cual el experimento toma solo dos posibles resultados (el evento se presenta o no), en el se puede tener cualquier cantidad de resultados en la unidad de medida. Por ejemplo, la cantidad de clientes que ingresan a un banco físicamente durante la siguiente hora podría ser cero, uno, dos, tres, etc. La variable aleatoria para la distribución de Poisson sería la cantidad real de ocurrencias, en este caso, la cantidad de clientes que llegan durante la siguiente hora. Con esto en mente, entonces el CDF que es la función de probabilidad acumulativa se evalúa como la sumatoria de las probabilidades de todos los posibles valores de la variable discreta (x) que sean menores al valor k, dando como resultado la siguiente fórmula por lo que es importante revisar la fórmula CDF de esta distribución.

Figura 3: Función CDF para distribución de Poisson
Tomado de Webster (2000) capitulo 5Note la sumatoria de todas las posibilidades de X menores a K
Aprende más
Para conocer más sobre Funciones matemáticas Poisson, describe las fórmulas de la distribución ¡Accede aquí!

Figura 4: Media o valor esperado de aciertos (a), Varianza (b) y Desviación (c) de la distribución de Poisson.
Prado A. (2025)Tomado de Webster (2000) capitulo 5
(a)

(b)

(c)

TEOREMA DEL LÍMITE CENTRAL EN POISSON
Por otro lado, es interesante mencionar como se aplica el teorema del límite central a la distribución de Poisson. Recordando el teorema establece que a medida que n se vuelve más grande, la distribución de las medias muestrales se aproxima a una distribución normal con una media de μ y un error estándar de σ/√n.
El siguiente código nos permite visualizar la aplicación del teorema del límite central.
#Primero vamos a crear varios datasets que cumple con una distribución de Poisson con distintos lambda
p1 <- rpois(n=10000 , lambda=1)
p2 <- rpois(n=10000 , lambda=2)
p3 <- rpois(n=10000 , lambda=5)
p4 <- rpois(n=10000 , lambda=10)
p5 <- rpois(n=10000 , lambda=20)
#Colocamos todos los datasets en el mismo dataframe
pos_df <- data.frame(l1=p1, l2=p2, l5=p3, l10=p4, l20=p5)
head(pos_df)
# Para poder visualizar mejor vamos a transponer las columnas en filas
#la función melt pasa valores que están en columnas a filas en una columna
#llamada valor en este caso
pos_melted <- melt( data=pos_df , variable.name="lambda", value.name="valor")
head(pos_melted)
class(pos_melted$lambda)
#Si la columna lambda fuera de tipo "character", necesitaríamos convertirla en tipo factor para poder manejar el agrupamiento, para lo cual deberemos hacer una conversión si arriba salió tipo factor estamos OK
head(pos_melted)
tail(pos_melted)
class(pos_melted$lambda)
#Visualizamos la densidad
ggplot(pos_melted , aes(x=valor))+
geom_density(aes(group=lambda, color=lambda, fill= lambda , alpha=1/2 ) )+
scale_color_discrete() +
scale_fill_discrete()+
xlab(“Valor de X”)

Figura 5: Demostración del teorema del límite central
Creación de autor Alfonso PradoEn este caso n serían todos los posibles valores que puede tomar la variable aleatoria, y por consiguiente está relacionado con lambda, en otras palabras, si indicamos que lambda=5 los valores posibles que puede tomar la variable se ubican alrededor de la media 5, es decir, son unos pocos valores, pero si estamos trabajando con una lambda de 100, los valores de X aumentarían considerablemente, aunque las probabilidades de algunos puedan ser muy baja.
Cuando lambda es pequeño podemos observar la densidad de estos pocos valores, pero en la medida que lambda aumenta la cantidad de posibles valores aumenta y su densidad va delineando la campana de Gauss.
Al igual que la distribución normal, los prefijos usados para las funciones de distribución siguen siendo las mismas: d para densidad, p para probabilidad acumulada, q para obtener el inverso de p y r para crear un vector con determinado lambda, y el sufijo será siempre pois.

Tabla 1: Funciones programáticas de la distribución Poisson
Creación de autor Alfonso PradoDonde:
x Vector de cuantiles que (enteros positivos).
q vector de cuantiles.
p vector de probabilidades.
n número de valores aleatorios a devolver.
Lambda vector de medias (no negativas).Aprende más
Para conocer más sobre Funciones programáticas, describe en detalle las funciones de la tabla ¡Accede aquí!
Veamos ejemplos de uso de las funciones
Función rpois
Esta función retorna una cantidad dada de valores que cumplen con una media de distribución dada por lambda en un tiempo definido o en un espacio determinado.
#Generar una serie con la distribución de Poisson
#La función rpois() obtiene la serie
#la sintaxis es:
#rpois(n, lambda)
#Donde:
#n es el número de valores deseados que deseamos
#lambda media histórica por unidad de tiempo
#Ejemplo: Generar una serie de 10 elementos que representa la ocurrencia de un evento, cuya media por unidad de tiempo ha sido 10
p0 <- rpois(n=10 , lambda=10)
p0
[1] 9 6 14 11 5 13 8 11 18 11
mean(p0)
[1] 10.6
#Note que la media se aproxima a lambda en Poisson pero no es exactamente 10, esto se debe a la baja cantidad de los valores solicitados.
#Intentando con un n más grande
p0 <- rpois(n=1000 , lambda=5)
head(p0,n=15)
[1] 5 6 3 7 7 4 3 6 1 3 4 5 2 5 3
mean(p0)
[1] 5.0324
#Vemos que se acerca más
Función dpois
Esta función nos permite obtener la densidad para un valor puntual X, en otras palabras, corresponde al PMF del vector. Si X es un vector con múltiples valores calculará la densidad para cada uno de los valores.
#Su sintaxis es:
#dpois(x, lambda, log = FALSE)
#Donde:
#x Vector de cuantiles.
#lambda es la media histórica
#log TRUE su se desea obtener log(P[X]) FALSE si se desea obtener P[X]
#Ejemplo: Cuál es la probabilidad de hacer de exactamente 4 ventas en una semana si la tasa de ventas promedio es de 3 por semana?
dpois(4, lambda=3)
[1] 0.1680314
#Otro ejemplo: Una compañía constructora es responsable por la construcción de un edificio, al terminar el mismo se han detectado 2 defectos por cada piso. Para el nuevo contrato, la contratante desea poner una multa por defectos Le preguntan a usted cual es la probabilidad de tener 3 defectos por piso.
dpois(3,lambda=2)
Es importante mencionar que el valor de x debe estar en iguales unidades que en las que se expresa lambda. Caso contrario se deberá hacer una conversión de la lambda para ponerlo en las mismas unidades. La conversión podría hacerse con la siguiente fórmula.
Fórmula
Veamos un ejemplo de esta conversión
Si usted recibe llamadas al celular a una tasa constante 2 llamadas por hora, usted va al cine, y se olvida de apagar su celular, cuál es la probabilidad de que en una película de 1.5 horas, su teléfono timbre?
De este problema debemos notar dos cosas, la primera es que otra vez el lambda del enunciado no está en la misma unidad de la lambda que se pregunta. Y la segunda es que el enunciado no indica si el teléfono sonará 1,2, o más veces, por lo tanto, concluimos que estamos ante una pregunta de probabilidad acumulativa o CDF.
#Primero realizamos la conversión al nuevo lambda
nuevo_lambda=2*1.5/1
#Aplicamos ppois
ppois(0 , lambda=nuevo_lambda, lower.tail=FALSE)
[1] 0.95
Otro ejemplo
Un puente está calculado para soportar 60 toneladas métricas, si se considera que el vehículo más pesado es de 5000kg (5 toneladas) el puente puede resistir el paso de 12 vehiulos. El constructor pregunta cuál es la tasa de transito que tiene este puente, le indican 10 vehículos al tiempo. Para estar seguro el constructor pregunta cuál es la probabilidad de que 12 o más vehículos circulen?
Respuesta:
ppois(11, lambda=10 , lower.tail=FALSE)
# Note el uso de lower tail=FALSE dado que el enuncionado indica 12 o más
[1] 0.3
Función ppois
Esta función calcula la probabilidad acumulativa CDF para una distribución Poisson, tomo como argumentos el vector de cuantiles q, el lambda y el argumento de lower.tail que tiene igual significación que lo visto anteriormente.
Ejemplo
El número medio de automóviles que pasan por la intersección en un minuto determinado es λ = 15, y queremos saber la probabilidad de que pasen exactamente 13 automóviles por ella en el próximo minuto.
dpois(x = 13, lambda = 15)
[1] 0.096
Pero más comúnmente las autoridades estarán interesadas en saber la probabilidad de que la cantidad de vehículos por minuto sea 20 o más, porque en dicha situación los mecanismos de control del tránsito ya no funcionarían.
ppois(x = 19, lambda = 15, lower.tail=FALSE)
[1] 0.12
COMO VISUALIZAR LA DENSIDAD DE PROBABILIDAD
Entender las probabilidades es mucho más fácil en forma visual. Veamos un ejemplo: Una comercializadora tiene un promedio de ventas a 3 clientes por hora, queremos saber cuál es la probabilidad de que en la próxima hora de consigan 0,1,2,3,4,5,6,7,9 o 10 ventas.
#opción para presentación de números con decimales o exponenciales
options(scipen = 999, digits = 2)
#creamos unos vectores
ventas <- 0:10
#Obtenemos las densidades
densidad <- dpois(x = ventas, lambda = 3)
#Obtenemos el CDF
prob <- ppois(q = ventas, lambda = 3, lower.tail = TRUE)
#pasamos los datos a dataframe
df <- data.frame(ventas, densidad, prob)
#Visualizamos
ggplot(df, aes(x = factor(ventas), y = densidad, fill="PDF")) +
geom_col() +
geom_text(
aes(label = round(densidad,2), y = densidad + 0.01),
position = position_dodge(0.9),
size = 3,
vjust = 0
) +
labs(title = "PDF y CDF de Poisson ",
x = "Ventas (x)",
y = "Densidad") +
geom_line(data = df, aes(x = ventas, y = prob) , color="blue")
#Comparemos con el gráfico
dpois( 1, lambda = 3) # da la probabilidad exacta de 1 venta
[1] 0.15
dpois( 4, lambda = 3) # da la probabilidad exacta de 4 ventas
[1] 0.17
ppois(4, lambda=3 , lower.tail=TRUE) #da la probabilidad de 4 ventas o menos
[1] 0.82
ppois(4, lambda=3 , lower.tail=FALSE)# da la probabilidad de mas de 4 ventas
[1] 0.18
Y obtenemos el siguiente gráfico

Figura 6: PMF Y CDF en Distribución Poisson
Creación de autor Alfonso PradoFunción qpois
Como ya sabemos estas funciones lo que nos indican es el inverso de las probabilidades, es decir, dado un vector p de probabilidades, encontrar los cuantiles debajo de los cuales se acumula las probabilidades p.
Por ejemplo:
# Por ejemplo, si tenemos un fenómeno Poisson con tasa promedio lambda de 55 eventos por minuto, podemos calcular los cuantiles que corresponden a las cuartiles 0.25, 0.50, 0.75:
p <- c(0.25, 0.50, 0.75)
qpois(p, lambda = 55)
[1] 50 55 60
#Indicaría que el primer cuartil estaría por debajo del valor 50, la media estaría por debajo del valor 55 y el tercer cuartil estaría ubicado debajo del valor 60
Profundiza más
Este recurso te ayudará a enfatizar sobre casos de distribución Poisson ¡Accede aquí!
-
-
Actividades
-
Estimación de intervalos de confianza
-
Introducción
El análisis estadístico en investigaciones se basa en la idea clave de que hacemos observaciones sobre una muestra de sujetos y luego extraemos inferencias sobre la población de todos esos sujetos de los que se extrajo la muestra. Si la muestra del estudio no es representativa de la población, es muy posible que nos confundamos obteniendo resultados no verdaderos.
En la presente clase veremos cómo obtener los estadísticos que describen a la población tomando en cuenta la variación aleatoria en la muestra, debido a que los resultados de una sola muestra estarán sujetos a incertidumbre estadística, que está estrechamente relacionada con el tamaño de la muestra
Varianza ponderada
La varianza ponderada de dos conjuntos de datos se calcula combinando las varianzas individuales de cada conjunto, tomando en cuenta el tamaño de cada conjunto
Casos y Controles
Un estudio de casos y controles es un tipo de diseño de investigación epidemiológica que compara a personas con una enfermedad o condición específica (los casos) con personas similares que no tienen esa enfermedad o condición (los controles) para identificar factores que puedan estar asociados con la enfermedad.
-
8. Estimación de intervalos de confianza8.1 Cuando sigma es conocido muestras grandes Parte I
¿Qué es inferencia?
La inferencia estadística es el conjunto de métodos y técnicas que permiten inducir, a partir de la información empírica proporcionada por una muestra, cual es el comportamiento de una determinada población con un riesgo de error medible en términos de probabilidad.
Los métodos paramétricos de la inferencia estadística se pueden dividir, básicamente, en dos:
- Métodos de estimación de parámetros
- Métodos de contraste de hipótesis.
Ambos métodos se basan en el conocimiento teórico de la distribución de probabilidad del estadístico muestral que se utiliza como estimador de un parámetro. (http://www.ub.edu/)
La inferencia nos permitirá trazar una línea lógica de causa-efecto, entre los diferentes puntos inferidos en la resolución del problema.
¿Qué es la estimación puntual?
Una estimación puntual es un valor único que describe mejor la población de interés, siendo la media de la muestra y la proporción de la muestra los más comunes.
¿Qué es un intervalo de confianza?
Existen muchas definiciones, de las cuales extraemos las más relevantes:
- Una estimación de intervalo combinada con una declaración de probabilidad
- Estimación de intervalo calculada a partir de estadísticas de los datos observados, que pueden contener el valor verdadero de un parámetro de población desconocido. El intervalo tiene un nivel de confianza asociado que califica el nivel de confianza de que un parámetro se encuentra en el intervalo
- Un rango de valores tan definido que existe una probabilidad específica de que el valor del parámetro se encuentre dentro de él.
De lo anterior podemos extraer las siguientes conclusiones: Es un intervalo de valores, es decir, este intervalo se encuentra entre un valor a y b. Dentro de este intervalo creemos que se encuentra una media poblacional de la variable bajo análisis. Y aunque no sabemos exactamente en que parte de este intervalo, podemos asegurar que existe una probabilidad concreta de que esto sea correcto.
Cuando usamos métodos paramétricos, la probabilidad se calcula en base a una distribución gaussiana o normal y sabemos que una muestra dada tendrá una media que se halla dentro de un nivel de significancia definido con la probabilidad de un error (el valor α)
Para el intervalo de confianza del 95 por ciento, el 95 por ciento de todos los intervalos contendrá la media de la población. El 5 por ciento restante podrían caer fuera del intervalo por temas de azar (muestra 5 en la figura 1).

Figura 1: Múltiples muestras y su media poblacional
Creación del autor Alfonso PradoNotamos que la muestra 5 de los intervalos no contiene la media de la población. Estos caen fuera en lo que denomina valor alfa (α), el nivel de significancia α representa la frontera de colas de la distribución y como la curva es simétrica, tendremos α/2 a cada lado.

Figura 2: Distribución normal y tamaño de colas
Creación de autor: Alfonso PradoLos niveles de confianza α están relacionados con los valores Z como se explica en la siguiente tabla:

Tabla 1: Relación entre valores Z y α
Creación del autor Alfonso PradoPor otro lado, es importante entender la relación entre el valor Z y la precisión. Como habíamos visto en clases anteriores mientras más alto es el valor de Z, el intervalo se hará más grande pero la precisión de nuestra inferencia será inferior.
Veamos un ejemplo: Tenemos una población de personas. Esta población tiene un parámetro, vamos a decir la edad. Tenemos un rango de edades de interés, digamos 8.7 a 10.6 años. Como ya hemos visto en la distribución, si yo muestreo, tengo una probabilidad de que aparezcan sujetos con ciertas edades de lo cual se puede establecer el intervalo.
Si yo defino este intervalo de 0-100 años, tengo gran amplitud, pero no tengo precisión, si tengo poca amplitud tengo más precisión. La amplitud va a estar dada por los valores Z como se puede ver en la tabla 1.

Figura 3: Media muestral e intervalo
Creación de autor Alfonso PradoEntonces definimos el intervalo de confianza para media (µ) con una confianza de (1-α) al intervalo (8.7 a 10.6 años) obtenido para una realización muestral dada, tal que: P(8.7≤ µ≤10.6)=1- α.
El grado de confianza más habitual que se presenta es del 95%, pero no existe estandarización al respecto, y depende del estudio que se esté realizando.
Por tanto, un único estudio suele dar una estimación muestral imprecisa del valor total de la población en la que estamos interesados. Esta imprecisión se indica mediante la amplitud del intervalo de confianza:
Cuanto más amplio sea el intervalo, menor será la precisión. La amplitud depende esencialmente de tres factores.
- El tamaño de la muestra: los tamaños de muestra más grandes darán resultados más precisos con intervalos de confianza más estrechos. En particular, los intervalos de confianza amplios enfatizan la falta de fiabilidad de las conclusiones basadas en muestras pequeñas.
- La variabilidad de la característica que se estudia: cuanto menos variable sea (entre sujetos, dentro de los sujetos, a partir del error de medición y de otras fuentes), más precisa será la estimación muestral y más estrecho el intervalo de confianza.
- El grado de confianza requerido: cuanto mayor sea la confianza, más amplio será el intervalo.
Intervalo de confianza clásico
Se basa en la distribución y se forma utilizando la media muestral como una estimación puntual para el cual se adiciona y se resta un cierto valor para obtener los límites superior e inferior del intervalo de confianza respectivamente.

Figura 4: Fórmula Intervalo de Confianza clásico de la media poblacional (Prado A. 2025) Adaptado de la fórmula intervalo de confianza según Webster(2000) capítulo 7
Donde:
μ= media poblacional
σ=desviación poblacional
Z=Nivel de confianza requerido (ver tabla 1)
SEM=Error estándar de la media
X̅ = media muestral
n=número de observaciones
Por otro lado, muchas veces nos topamos con el problema de comparar dos medias poblacionales, esto puede darse porque, ya sea tenemos dos muestras de la misma población y queremos saber si existen diferencias, pero más comúnmente es porque estamos tratando de encontrar diferencias entre sets que han sido sometidas a cierto tratamiento. En un experimento científico típico, nos interesan dos poblaciones (Çasos y Control) y si existe una diferencia entre sus medias (µCasos - µControl).

Figura 5: Diferencias entre medias en un estudios de Casos vs. Controles
Creación del autor Alfonso PradoAquí tenemos algunas situaciones diferentes que se pueden presentar dependiendo de las varianzas, los grados de libertad, si la muestra es pequeña o grande y del objeto de la prueba.
8.1 Cuando sigma es desconocido muestras grandes Parte IITenemos 2 poblaciones cuyas muestras son grandes, las varianzas son conocidas, en este caso utilizaremos el estadístico Z mediante la fórmula:
Fórmula
Intervalo de confianza para diferencia entre muestras grandes con varianzas conocidas (Prado A. 2025)
Adaptado de Webster(2000) capítulo 7 9.1
8.3 Cuando sigma son iguales pero desconocidos muestras pequeñasTenemos 2 poblaciones cuyas muestras son grandes, las varianzas son desconocidas, en este caso utilizaremos el estadístico Z y sustituyendo σ por s mediante la fórmula
Fórmula
Intervalo de confianza para diferencia entre muestras, σ no conocidos(Prado A. 2025)
Adaptado de Webster(2000) capítulo 7
8.4 Cuando sigmas son desiguales y muestras pequeñasEn este caso calcularemos primero una :
Fórmula
Fórmula de Varianzas ponderadas (Prado A. 2025)
Tomado de Webster(2000) capítulo 7
Aprende más
Para conocer más sobre varianza ponderada, explica funciones y ejemplos ¡Accede aquí!
El IC para la diferencia entre las medias poblacionales se halla entonces con una distribución t con grados de libertad n1+n2-2 de acuerdo a la siguiente fórmula
Fórmula
Cálculo de Intervalo de confianza para diferencia para muestras pequeñas, varianzas iguales pero desconocidas (Prado A. 2025)
Adaptado de Webster(2000) capítulo 9
8.2 Determinación del tamaño apropiado de la muestraEn este caso no se ha encontrado una distribución exacta pero podemos aplicar una aproximación mediante el cálculo de grados de libertad ponderados como se muestra en la siguiente figura
Fórmula
Fórmula para cálculo de Grados de libertad ponderados (Prado A. 2025)
Adaptado de Webster (2000) capítulo 9
Para luego calcular el estadístico t´ conseguido con los grados de libertad ponderados
Fórmula
Intervalo de confianza para diferencia para muestras pequeñas, varianzas desiguales y desconocidas (Prado A. 2025)
Adaptado de Webster(2000) capítulo 9
Veamos un ejemplo
Una empresa de construcción está interesada en comprar un bosque para explotacion de la madera. Tiene 2 opciones, para el primero se hace una muestral con 10 árboles, estimando que produce 69.5 p.t (Un pie tablar es 1 pie de largo x 1 pie de ancho x 1 pulgada de grueso) con una desviación de 2.2 pt, en el segundo se hace una muestra de 15 árboles y se obtiene una media de 72.2 on una desviación de 4.5.
Con un intervalo de confianza del 95% queremos estimar si hay diferencias entre los dos bosques.
En ese caso lo que están pidiendo es el IC para la diferencia en las medias poblacionales
xm1 <- 69.5
n1<- 10
sd1 <- 2.2
n2<- 15
xm2 <- 72.2
sd2 <- 4.5
Dado que las desviaciones son diferentes calculamos los gl ponderados
gl <- ((sd1^2/n1 + sd2^2/n2)^2) /( (sd1^2/(n1))^2/(n1-1) + (sd2^2/(n2))^2/(n2-1) )
gl <- round(gl,0)
tprima <- qt(.95,gl)
IC_medias_alto <- (xm1-xm2) + tprima* sqrt(sd1^2/n1 + sd2^2/n2)
[1] -0.37
IC_medias_bajo <- (xm1-xm2) - tprima* sqrt(sd1^2/n1 + sd2^2/n2)
[1] -5
A un 95% de confianza podemos establecer que el bosque 1 tiene un producción inferior
Sin embargo, de lo mencionado, muchas veces es complicado realizar muestreos con gran cantidad de observaciones o repetir muestreos de la misma población. Aquí entra la técnica de “Bootstrap” o intervalos de confianza basados en “Bootstrap”.
Técnicas de Remuestreo
De acuerdo a Webster 2020, el Bootstrap es un procedimiento de remuestreo que se puede utilizar para estimar la distribución de muestreo de casi cualquier estadístico, como la media, la mediana y los coeficientes de regresión, estos estadísticos toman un nombre genérico θ.
Una muestra Bootstrap es una muestra de los datos con reemplazo, esto quiere decir que cuando se realiza un remuestreo, el hecho de haber seleccionado un valor no impide que el mismo valor sea seleccionado en otro remuestreo.
En comparación con los intervalos de confianza clásicos basados en ecuaciones, un intervalo de confianza Bootstrap no asume ninguna distribución específica. En cambio, supone que la distribución observada en la muestra es una buena representación de la distribución de la población de la que se tomó la muestra. Por lo tanto, los intervalos de confianza Bootstrap se pueden utilizar como una alternativa si no cumplimos con los supuestos detrás de los intervalos de confianza clásicos o si no hay una ecuación para calcular dichos intervalos.
Bootstrap funciona de la siguiente forma. Asuma que tenemos una muestra de 10 observaciones, Bootstrap procede a realizar el primer remuestreo mediante la selección de 10 observaciones aleatorias, como resultado de este remuestreo es posible que algunos valores vayan a ser repetidos, así como otros valores de la muestra original podrían no aparecer. Sobre esta muestra se procede a realizar el cálculo del estadístico requerido (media, desviación etc.).
Por supuesto, la media de esta segunda muestra no tiene por qué coincidir con la media poblacional, entonces Bootstrap procede a hacer muestras adicionales, por ejemplo 1000 muestras. Mientras mayor sea la cantidad de remuestreos realizados, nos aproximaremos más a la media poblacional.
La siguiente figura explica el concepto

Figura 12: Proceso de remuestreo
Creación del autor Alfonso PradoLuego sorteamos los valores θ1,2,3..M , y ubicamos los valores de 0.025 y 0.975% es decir los cuantiles 5% y 95% y habremos obtenidos el intervalo de confianza la media poblacional. Es importante entender que dado este remuestreo, la técnica de Bootstrap no sirve para muestras pequeñas.
Recuerde el teorema del límite central, que indica que cuando la cantidad de observaciones es alta, la media muestral se aproximará a la media poblacional. En este caso mediante Bootstrap estamos generando una cantidad alta de remuestreos.
Aprende más
Para conocer más sobre Bootstraping en investigación científica, explica el uso de funciones para Bootstrap ¡Accede aquí!
De acuerdo a Donnely: El tamaño de la muestra juega un papel importante al determinar la probabilidad de error, así como en la precisión de la estimación. Una vez que se ha seleccionado el nivel de confianza, dos factores importantes influyen en el
tamaño muestral:
- La varianza de la población σx2
- El tamaño del error tolerable que el investigador está dispuesto a aceptar.
Mientras que el primer factor está más allá del control del investigador (no hay nada que se pueda hacer sobre la varianza de la población), sin embargo, sí es posible limitar el tamaño del error.
Podemos determinar el tamaño n de una muestra aleatoria que conduce a un error estándar de la media que es menor que un valor de q deseado, suponiendo que conocemos la varianza (σx2) . Sabemos que σx=σ/√n, por lo tanto, requerimos que σx/√(n) < q despejando n , n> (σx/q)2
Lo anterior puede reescribirse, de la siguiente forma:
Fórmula
Tamaño de la muestra requerido para un error dado
Ejemplo:
Uno de los problemas que tienen los grandes hoteles en el mundo es estimar
la cantidad de habitaciones no utilizadas. Para esto deciden hacer una encuesta por noche para ver cuantas habitaciones están libres, obviamente la cantidad de habitaciones es muy grande, por lo que necesitan estimar el tamaño de la muestra. El hotel piensa que puede aceptar un error de 50 habitaciones. Se ha determinado que la desviación entre hoteles es de 165 habitaciones. ¿Cuál es el tamaño de la muestra requerida?
muestra <- function(err){
Z=qnorm(0.005)
Z
s=165
aplicamos la fórmula de la figura 12
n<- (z^2)*(s^2)/err^2
n
}
muestra(50)
[1] 72.254
Podemos hacer el siguiente gráfico para entender esta relación
df <- data.frame(n=NULL, err=NULL)
for (e in seq(from=10 , to=100 , by=1))
{
dfline<- data.frame(n=muestra(e),err=e )
df <- rbind(df, dfline)
}
View(df)
ggplot(data=df, aes(x=n, y=err)) + geom_line()+
ggtitle("Error vs cantidad de muestras")
Notamos que en la medida que n crece la diferencia entre media muestral y poblacional disminuye

Figura 14: Relación entre el error (X̅̅ - μ ) y la cantidad de muestras
Creación de autor Alfonso PradoProfundiza más
Este recurso te ayudará a enfatizar sobre demostración en archivo RMD ¡Accede aquí!
-
-
Actividades
-