Estadística para la toma de decisiones

Aug 2026 · inferencia · distribuciones muestrales · tests de hipótesis · regresión

These are my notes for Estadística para la toma de decisiones, a second-year course at UCEMA. They come out of my class notebook, reordered and worked out until each topic stood on its own, without the lecture next to it. They are in Spanish, since they come from the transcription of that notebook.

They are not meant to replace a textbook. They are the course's own path, with the explanations I needed myself.

Parte I · Herramientas de probabilidad


1. La función generatriz de momentos

Una distribución de probabilidad queda descripta por su densidad f(x)f(x) o su función de probabilidad puntual p(x)p(x), pero esa no es la única descripción posible ni siempre la más cómoda. La función generatriz de momentos (FGM) es una segunda forma de codificar la misma información, y tiene dos ventajas decisivas: convierte el cálculo de momentos en derivadas, y convierte la suma de variables independientes en un producto.

Definición

MX(t)=E ⁣(etX)M_X(t) = E\!\left(e^{tX}\right)

que en el caso continuo es

MX(t)=+etxf(x)dxM_X(t) = \int_{-\infty}^{+\infty} e^{tx}\,f(x)\,dx

y en el discreto

MX(t)=xetxp(x)M_X(t) = \sum_{\forall x} e^{tx}\,p(x)

La variable tt es auxiliar: no tiene significado probabilístico. Es apenas el argumento de una función que se va a derivar.

Por qué "generatriz de momentos"

El kk-ésimo momento de XX respecto del origen es mk=E(Xk)m'_k = E(X^k). La propiedad fundamental de la FGM es que todos esos momentos están guardados en sus derivadas sucesivas evaluadas en cero:

dkMX(t)dtkt=0=mk=E(Xk)\left.\frac{d^k M_X(t)}{dt^k}\right|_{t=0} = m'_k = E(X^k)

La razón se ve desarrollando la exponencial en serie:

etX=1+tX+t2X22!+t3X33!+e^{tX} = 1 + tX + \frac{t^2X^2}{2!} + \frac{t^3X^3}{3!} + \cdots

Tomando esperanza término a término,

MX(t)=1+tE(X)+t22!E(X2)+t33!E(X3)+M_X(t) = 1 + t\,E(X) + \frac{t^2}{2!}E(X^2) + \frac{t^3}{3!}E(X^3) + \cdots

de modo que MXM_X es la serie de Taylor cuyos coeficientes son precisamente los momentos. Derivar kk veces y evaluar en t=0t=0 aísla el kk-ésimo.

En particular, E(X)=MX(0)E(X) = M'_X(0) y V(X)=MX(0)[MX(0)]2V(X) = M''_X(0) - \left[M'_X(0)\right]^2.

Ejemplo. Para XExp(λ)X \sim \text{Exp}(\lambda), con densidad f(x)=λeλxf(x) = \lambda e^{-\lambda x} en x>0x>0:

MX(t)=0etxλeλxdx=λ0e(λt)xdx=λλt,t<λM_X(t) = \int_0^\infty e^{tx}\,\lambda e^{-\lambda x}\,dx = \lambda\int_0^\infty e^{-(\lambda - t)x}\,dx = \frac{\lambda}{\lambda - t}, \qquad t < \lambda

La restricción t<λt<\lambda no es un detalle: si tλt \geq \lambda la integral diverge. Toda FGM tiene un dominio de existencia alrededor del origen, y ese dominio importa cuando se comparan dos FGM.

Derivando, MX(t)=λ(λt)2M'_X(t) = \lambda(\lambda-t)^{-2}, de donde E(X)=1/λE(X) = 1/\lambda; y MX(t)=2λ(λt)3M''_X(t) = 2\lambda(\lambda-t)^{-3}, de donde E(X2)=2/λ2E(X^2) = 2/\lambda^2 y V(X)=2/λ21/λ2=1/λ2V(X) = 2/\lambda^2 - 1/\lambda^2 = 1/\lambda^2.

El teorema de unicidad

Este resultado es el que hace que la FGM sea una herramienta y no una curiosidad:

Teorema. Si dos variables aleatorias tienen funciones generatrices de momentos que existen y coinciden en un entorno de t=0t = 0, entonces tienen la misma distribución.

Dicho de otro modo: la FGM identifica a la distribución. No hay dos distribuciones distintas con la misma FGM.

Es un teorema que se usa constantemente y casi siempre en silencio. Cada vez que en las páginas que siguen aparezca un razonamiento del tipo "la FGM de WW resultó ser eλ(et1)e^{\lambda(e^t-1)}, que es la de una Poisson, luego WW es Poisson", lo que está operando es este teorema. Sin él, la coincidencia de las FGM sería solo eso, una coincidencia.

Las FGM del curso

Conviene tener a mano las de las distribuciones que aparecen:

DistribuciónMX(t)M_X(t)E(X)E(X)V(X)V(X)
Bernoulli(p)(p)q+petq + pe^tpppqpq
Binomial(n,p)(n,p)(q+pet)n(q + pe^t)^nnpnpnpqnpq
Poisson(λ)(\lambda)eλ(et1)e^{\lambda(e^t-1)}λ\lambdaλ\lambda
Exponencial(λ)(\lambda)λλt\dfrac{\lambda}{\lambda-t}1/λ1/\lambda1/λ21/\lambda^2
Normal(μ,σ2)(\mu,\sigma^2)eμt+σ2t2/2e^{\mu t + \sigma^2t^2/2}μ\muσ2\sigma^2
Gamma(α,θ)(\alpha,\theta)(1θt)α(1-\theta t)^{-\alpha}αθ\alpha\thetaαθ2\alpha\theta^2
χn2\chi^2_n(12t)n/2(1-2t)^{-n/2}nn2n2n

Las últimas tres se deducen en las secciones §4 y §6. La de la normal estándar merece destacarse por lo simple que queda: con μ=0\mu = 0 y σ2=1\sigma^2 = 1,

MZ(t)=et2/2M_Z(t) = e^{t^2/2}

y de ahí, derivando, E(Z)=0E(Z) = 0 y E(Z2)=1E(Z^2) = 1, como debe ser.


2. La FGM de una suma de variables independientes

Muchas cantidades de interés son sumas: el total de reclamos de un mes, el gasto conjunto de un grupo de turistas, el número de piezas defectuosas en un lote. Y la media muestral, que es el objeto central de todo el curso, es una suma dividida por nn. La pregunta natural es entonces qué distribución tiene una suma, y la FGM la responde de manera notablemente limpia.

El resultado

Sean X1,,XnX_1,\ldots,X_n variables aleatorias independientes y Y=iXiY = \sum_i X_i. Entonces

MY(t)=i=1nMXi(t)\boxed{M_Y(t) = \prod_{i=1}^{n} M_{X_i}(t)}

La FGM de la suma es el producto de las FGM. La demostración cabe en tres renglones y muestra exactamente dónde entra la independencia:

MY(t)=E ⁣(etY)=E ⁣[e(X1++Xn)t]=E ⁣[eX1teXnt]M_Y(t) = E\!\left(e^{tY}\right) = E\!\left[e^{(X_1+\cdots+X_n)t}\right] = E\!\left[e^{X_1 t}\cdots e^{X_n t}\right]

Como los XiX_i son independientes, también lo son las funciones eXite^{X_i t}, y la esperanza de un producto de variables independientes es el producto de las esperanzas:

=E ⁣(eX1t)E ⁣(eXnt)=i=1nMXi(t)= E\!\left(e^{X_1 t}\right) \cdots E\!\left(e^{X_n t}\right) = \prod_{i=1}^{n} M_{X_i}(t)

El paso crítico es el último. Sin independencia, E(UV)E(U)E(V)E(UV) \neq E(U)E(V) y todo el argumento se cae.

¿La suma conserva la familia?

Con este resultado y el teorema de unicidad se puede responder, caso por caso, si la suma de dos variables de cierta familia pertenece a la misma familia. La respuesta no es siempre la misma, y ahí está lo interesante.

Suma de Poisson. Sean XPoisson(λ1)X \sim \text{Poisson}(\lambda_1) e YPoisson(λ2)Y \sim \text{Poisson}(\lambda_2) independientes, W=X+YW = X+Y:

MW(t)=eλ1(et1)eλ2(et1)=e(λ1+λ2)(et1)M_W(t) = e^{\lambda_1(e^t-1)}\cdot e^{\lambda_2(e^t-1)} = e^{(\lambda_1+\lambda_2)(e^t-1)}

Esta es exactamente la FGM de una Poisson de parámetro λ1+λ2\lambda_1+\lambda_2. Por unicidad,

WPoisson(λ1+λ2)W \sim \text{Poisson}(\lambda_1+\lambda_2)

La familia se conserva y los parámetros se suman. Tiene sentido: si un proceso produce en promedio λ1\lambda_1 eventos y otro independiente produce λ2\lambda_2, el conjunto produce λ1+λ2\lambda_1+\lambda_2.

Suma de exponenciales. Con XExp(λ1)X \sim \text{Exp}(\lambda_1) e YExp(λ2)Y \sim \text{Exp}(\lambda_2) independientes:

MW(t)=λ1λ1tλ2λ2t=λ1λ2(λ1t)(λ2t)M_W(t) = \frac{\lambda_1}{\lambda_1-t}\cdot\frac{\lambda_2}{\lambda_2-t} = \frac{\lambda_1\lambda_2}{(\lambda_1-t)(\lambda_2-t)}

Si WW fuera exponencial de algún parámetro λ\lambda, su FGM sería λ/(λt)\lambda/(\lambda-t). Igualando:

λ1λ2(λ1t)(λ2t)=λλtt\frac{\lambda_1\lambda_2}{(\lambda_1-t)(\lambda_2-t)} = \frac{\lambda}{\lambda-t} \qquad \forall t

El miembro izquierdo tiene dos polos (en t=λ1t=\lambda_1 y t=λ2t=\lambda_2) y el derecho uno solo. No hay ningún λ\lambda que satisfaga la igualdad para todo tt. Por lo tanto:

la suma de exponenciales no es exponencial.\textbf{la suma de exponenciales no es exponencial.}

Esto tiene una explicación intuitiva. La exponencial no tiene memoria y su moda está en cero: el valor más probable de una espera exponencial es una espera nula. La suma de dos esperas, en cambio, difícilmente sea cero, porque para eso las dos tendrían que serlo. La forma de la distribución cambia.

Que la suma no sea exponencial no significa que no tenga nombre. Es una Gamma, y eso se demuestra en §6, una vez introducida esa familia.

Suma de binomiales. Con XBin(n1,p1)X \sim \text{Bin}(n_1,p_1) e YBin(n2,p2)Y \sim \text{Bin}(n_2,p_2) independientes:

MW(t)=(q1+p1et)n1(q2+p2et)n2M_W(t) = (q_1+p_1e^t)^{n_1}(q_2+p_2e^t)^{n_2}

Este producto no se puede compactar en general. Pero si p1=p2=pp_1 = p_2 = p, las bases coinciden y los exponentes se suman:

MW(t)=(q+pet)n1+n2WBin(n1+n2, p)M_W(t) = (q+pe^t)^{n_1+n_2} \quad \Longrightarrow \quad W \sim \text{Bin}(n_1+n_2,\ p)

La condición es esencial y se entiende sin cuentas: una binomial cuenta éxitos en ensayos con una misma probabilidad de éxito. Juntar 10 ensayos con p=0,3p=0{,}3 y 15 con p=0,8p=0{,}8 da un experimento que ya no es binomial, porque los ensayos dejaron de ser homogéneos.

Suma de normales. Con X1N(μ1,σ12)X_1 \sim N(\mu_1,\sigma_1^2) y X2N(μ2,σ22)X_2 \sim N(\mu_2,\sigma_2^2) independientes:

MW(t)=eμ1t+σ12t2/2eμ2t+σ22t2/2=e(μ1+μ2)t+(σ12+σ22)t2/2M_W(t) = e^{\mu_1 t + \sigma_1^2t^2/2}\cdot e^{\mu_2 t + \sigma_2^2t^2/2} = e^{(\mu_1+\mu_2)t + (\sigma_1^2+\sigma_2^2)t^2/2}

que es la FGM de una N(μ1+μ2, σ12+σ22)N(\mu_1+\mu_2,\ \sigma_1^2+\sigma_2^2). La normal se conserva siempre, sin condiciones, y las medias y las varianzas se suman. Esta estabilidad es una de las razones por las que la normal ocupa el lugar que ocupa: es la única de la lista que atraviesa la suma sin deformarse ni pedir permiso.

Conviene registrar que las varianzas se suman también cuando las variables se restan. Como V(aX)=a2V(X)V(aX) = a^2V(X), en X1X2X_1 - X_2 el coeficiente 1-1 entra al cuadrado y queda V(X1X2)=σ12+σ22V(X_1-X_2) = \sigma_1^2+\sigma_2^2. Restar dos cantidades inciertas produce algo más incierto, no menos. Este hecho reaparece en todos los intervalos y tests de diferencias (§24 en adelante).

Familia¿La suma es de la misma familia?CondiciónParámetro resultante
Poissonningunaλ1+λ2\lambda_1+\lambda_2
Normalningunaμ1+μ2\mu_1+\mu_2; σ12+σ22\sigma_1^2+\sigma_2^2
Binomialp1=p2p_1 = p_2n1+n2n_1+n_2; pp
ExponencialNo(es Gamma, §6)

3. La distribución de Z2Z^2

Esta sección resuelve un problema puntual —hallar la distribución del cuadrado de una normal estándar— pero de él sale la χ2\chi^2, que es la distribución sobre la que se apoya casi toda la inferencia sobre varianzas del resto del curso.

El punto de partida es ZN(0,1)Z \sim N(0,1), con densidad

f(z)=12πez2/2f(z) = \frac{1}{\sqrt{2\pi}}\,e^{-z^2/2}

y función de distribución acumulada

F(z)=Φ(z)=z12πeu2/2duF(z) = \Phi(z) = \int_{-\infty}^{z} \frac{1}{\sqrt{2\pi}}\,e^{-u^2/2}\,du

Esta integral no tiene primitiva elemental: por eso la normal se evalúa con tablas o con funciones incorporadas al software. Todo lo que sigue se apoya en poder consultar Φ\Phi, no en calcularla.

Se define Y=Z2Y = Z^2 y se la estudia paso a paso.

a) La función de distribución de YY

Como YY es un cuadrado, solo toma valores positivos, y el suceso {Yy}\{Y \leq y\} se traduce en un intervalo simétrico para ZZ:

G(y)=P(Yy)=P(Z2y)=P(Zy)=P(yZy)=F(y)F(y)G(y) = P(Y \leq y) = P(Z^2 \leq y) = P(|Z| \leq \sqrt{y}) = P(-\sqrt{y} \leq Z \leq \sqrt{y}) = F(\sqrt{y}) - F(-\sqrt{y})

para y>0y>0. Como la normal estándar es simétrica, F(y)=1F(y)F(-\sqrt{y}) = 1-F(\sqrt{y}) y también puede escribirse G(y)=2F(y)1G(y) = 2F(\sqrt{y})-1.

b) La densidad

Se deriva GG respecto de yy, con la regla de la cadena:

g(y)=G(y)=f(y)12yf(y)(12y)=12y[f(y)+f(y)]g(y) = G'(y) = f(\sqrt{y})\cdot\frac{1}{2\sqrt{y}} - f(-\sqrt{y})\cdot\left(-\frac{1}{2\sqrt{y}}\right) = \frac{1}{2\sqrt{y}}\left[f(\sqrt{y}) + f(-\sqrt{y})\right]

y como la densidad normal es par, f(z)=f(z)f(-z) = f(z), los dos términos del corchete son iguales:

g(y)=12y212πey/2=ey/22πy,y>0g(y) = \frac{1}{2\sqrt{y}}\cdot 2\cdot\frac{1}{\sqrt{2\pi}}\,e^{-y/2} = \frac{e^{-y/2}}{\sqrt{2\pi}\,\sqrt{y}}, \qquad y > 0

Vale la pena mirar esta densidad. Tiene una asíntota vertical en y=0y=0 (por el y\sqrt{y} del denominador) y decae exponencialmente. Es fuertemente asimétrica hacia la derecha, y esa asimetría es la que después obliga a que los intervalos de confianza para la varianza no sean simétricos (§28).

c) La FGM

MY(t)=0etyey/22πydy=012πyey2(12t)dyM_Y(t) = \int_0^\infty e^{ty}\cdot\frac{e^{-y/2}}{\sqrt{2\pi}\,\sqrt{y}}\,dy = \int_0^\infty \frac{1}{\sqrt{2\pi}\,\sqrt{y}}\,e^{-\frac{y}{2}(1-2t)}\,dy

Con el cambio de variable u=12(12t)yu = \tfrac{1}{2}(1-2t)\,y la integral se reduce a una Γ(1/2)\Gamma(1/2) y queda

MY(t)=(12t)1/2,t<12\boxed{M_Y(t) = (1-2t)^{-1/2}}, \qquad t < \tfrac{1}{2}

d) y e) Esperanza y varianza

Con la FGM el cálculo es mecánico:

E(Y)=MY(0)=122(12t)3/2t=0=1E(Y) = M'_Y(0) = \left.\tfrac{1}{2}\cdot 2\,(1-2t)^{-3/2}\right|_{t=0} = 1 E(Y2)=MY(0)=322(12t)5/2t=0=3V(Y)=312=2E(Y^2) = M''_Y(0) = \left.\tfrac{3}{2}\cdot 2\,(1-2t)^{-5/2}\right|_{t=0} = 3 \quad\Longrightarrow\quad V(Y) = 3 - 1^2 = 2

El primer resultado, E(Z2)=1E(Z^2)=1, ya se conocía —es la varianza de una normal estándar— y sirve de control. El segundo, V(Z2)=2V(Z^2)=2, es nuevo.

f) Una probabilidad, por tres caminos

Calcular P(Z2>2)P(Z^2 > 2) admite tres enfoques que dan lo mismo, y compararlos es instructivo.

Por integración directa de la densidad hallada:

P(Z2>2)=2ey/22πydy=15,73%P(Z^2 > 2) = \int_2^\infty \frac{e^{-y/2}}{\sqrt{2\pi}\,\sqrt{y}}\,dy = 15{,}73\%

Volviendo a ZZ, que es el camino más económico porque usa la tabla normal de siempre:

P(Z2>2)=P(Z>2)=2P(Z>1,414)=20,0787=15,73%P(Z^2 > 2) = P(|Z| > \sqrt{2}\,) = 2\,P(Z > 1{,}414) = 2\cdot 0{,}0787 = 15{,}73\%

Reconociendo la distribución, que es lo que se hará a partir de la sección siguiente:

P(Z2>2)=P(χ12>2)=15,73%P(Z^2 > 2) = P(\chi^2_1 > 2) = 15{,}73\%

4. La distribución χ2\chi^2

Definición

La variable Y=Z2Y = Z^2 de la sección anterior recibe el nombre de chi-cuadrado con un grado de libertad, χ12\chi^2_1. La generalización natural es sumar cuadrados de normales estándar independientes:

χn2=i=1nZi2,ZiN(0,1)  i.i.d.\boxed{\chi^2_n = \sum_{i=1}^n Z_i^2}, \qquad Z_i \sim N(0,1) \ \text{ i.i.d.}

El parámetro nn se llama grados de libertad y cuenta cuántos cuadrados se sumaron. Es un número entero positivo.

n = 1n = 3n = 6n = 1205101520χ²
La χ² vive solo en los positivos y arrastra la cola a la derecha. Al crecer los grados de libertad se corre, se ensancha y se va pareciendo a una normal.

FGM y momentos

Aquí la maquinaria de §2 rinde de inmediato. Los Zi2Z_i^2 son independientes y cada uno tiene FGM (12t)1/2(1-2t)^{-1/2}, así que el producto de nn de ellas es

Mχn2(t)=[(12t)1/2]n=(12t)n/2,t<12M_{\chi^2_n}(t) = \left[(1-2t)^{-1/2}\right]^n = (1-2t)^{-n/2}, \qquad t<\tfrac12

y derivando —o simplemente sumando nn copias de E(Z2)=1E(Z^2)=1 y de V(Z2)=2V(Z^2)=2, que es lícito por independencia—:

E(χn2)=n,V(χn2)=2n\boxed{E(\chi^2_n) = n, \qquad V(\chi^2_n) = 2n}

De la forma de la FGM se sigue además una propiedad muy útil: la suma de dos χ2\chi^2 independientes es χ2\chi^2, y los grados de libertad se suman, ya que (12t)n/2(12t)m/2=(12t)(n+m)/2(1-2t)^{-n/2}(1-2t)^{-m/2} = (1-2t)^{-(n+m)/2}. Esta aditividad es la que hace funcionar la relación de Cochran (§11) y la descomposición del ANOVA (§43).

Forma de la distribución

La χ2\chi^2 vive en (0,)(0,\infty) y es asimétrica hacia la derecha. Para n=1n=1 y n=2n=2 la densidad es decreciente; a partir de n=3n=3 tiene una moda interior, situada en n2n-2. A medida que nn crece la asimetría se atenúa y la distribución se acerca a una normal —lo cual es de esperar, porque es una suma de nn términos i.i.d. y le corresponde el teorema central del límite.

Dos consecuencias prácticas de la asimetría, que reaparecen más adelante: los intervalos de confianza basados en la χ2\chi^2 no se escriben como "estimador ±\pm margen", y en un test bilateral los dos valores críticos deben buscarse por separado, porque no son opuestos entre sí.

Cómo se leen las tablas: el subíndice es área a la derecha

Este es el momento de fijar una convención que rige para todas las tablas del curso —ZZ, tt, χ2\chi^2 y FF— y que es fuente permanente de confusión:

χα;n2\chi^2_{\alpha;\,n} denota el valor que deja α\alpha de área a su derecha con nn grados de libertad.

De modo que χ0,05;22=5,9915\chi^2_{0,05;\,2} = 5{,}9915 significa P(χ22>5,9915)=0,05P(\chi^2_2 > 5{,}9915) = 0{,}05. Tres corolarios que conviene tener presentes:

  • El percentil 95 deja 0,950{,}95 a la izquierda y por lo tanto 0,050{,}05 a la derecha: se busca con subíndice 0,050{,}05.
  • Un valor de cola izquierda al 2,5%2{,}5\% se rotula χ0,9752\chi^2_{0,975}, no χ0,0252\chi^2_{0,025}.
  • A subíndice más chico corresponde valor más grande de la variable.

Dónde aparece la χ2\chi^2

Bajo el supuesto de población normal, XiN(μ,σ2)X_i \sim N(\mu,\sigma^2), la χ2\chi^2 aparece cada vez que se estudia una suma de desviaciones al cuadrado:

EstadísticoDistribuciónDe dónde sale
i=1n(Xiμ)2σ2\displaystyle\sum_{i=1}^n \frac{(X_i-\mu)^2}{\sigma^2}χn2\chi^2_nsuma de nn normales estándar al cuadrado
(n1)S2σ2\dfrac{(n-1)S^2}{\sigma^2}χn12\chi^2_{n-1}varianza insesgada, vía Cochran (§11)
nSn2σ2\dfrac{n\,S_n^2}{\sigma^2}χn12\chi^2_{n-1}varianza sesgada (es la misma cantidad)
nSn2σ2\dfrac{n\,S_n^{*2}}{\sigma^2}χn2\chi^2_nvarianza centrada en μ\mu

La segunda fila es la más importante del cuadro. De ella salen la distribución de S2S^2, el intervalo de confianza para la varianza, el test para σ2\sigma^2, la distribución tt de Student y —combinada con otra χ2\chi^2 independiente— la distribución FF. Se demuestra en §11.


5. La función Gamma

Antes de introducir la distribución Gamma hace falta la función que le da nombre. No es un objeto estadístico sino analítico: es la extensión del factorial a los números reales.

Γ(α)=0uα1eudu,α>0\Gamma(\alpha) = \int_0^\infty u^{\alpha-1}\,e^{-u}\,du, \qquad \alpha>0

La propiedad de recurrencia

Integrando por partes, con dv=eududv = e^{-u}du y w=uαw = u^{\alpha}:

Γ(α+1)=αΓ(α)\Gamma(\alpha+1) = \alpha\,\Gamma(\alpha)

Como además Γ(1)=0eudu=1\Gamma(1) = \int_0^\infty e^{-u}du = 1, aplicando la recurrencia repetidamente se obtiene, para nn entero,

Γ(n)=(n1)!\Gamma(n) = (n-1)!

Ese es el sentido en que Γ\Gamma generaliza al factorial: coincide con él en los enteros y está definida en todos los reales positivos.

El valor Γ(1/2)\Gamma(1/2)

El valor no entero que aparece una y otra vez —porque los grados de libertad impares producen argumentos semienteros— es Γ(1/2)\Gamma(1/2), y vale π\sqrt{\pi}. La demostración conecta la función Gamma con la integral de la normal, que es exactamente la razón por la que este valor aparece en la χ2\chi^2:

Γ(1/2)=0u1/2eudu\Gamma(1/2) = \int_0^\infty u^{-1/2}\,e^{-u}\,du

Con la sustitución v=2uv = \sqrt{2u}, esto es u=v2/2u = v^2/2 y du=vdvdu = v\,dv:

=0(v22)1/2ev2/2vdv=20ev2/2dv= \int_0^\infty \left(\frac{v^2}{2}\right)^{-1/2} e^{-v^2/2}\,v\,dv = \sqrt{2}\int_0^\infty e^{-v^2/2}\,dv

La integral restante es media campana de Gauss sin normalizar, que vale 2π/2\sqrt{2\pi}/2. Por lo tanto

Γ(1/2)=22π2=π\Gamma(1/2) = \sqrt{2}\cdot\frac{\sqrt{2\pi}}{2} = \sqrt{\pi}

Y con la recurrencia se generan los demás semienteros:

Γ(3/2)=12Γ(1/2)=π2,Γ(5/2)=32Γ(3/2)=3π4\Gamma(3/2) = \tfrac{1}{2}\,\Gamma(1/2) = \frac{\sqrt{\pi}}{2}, \qquad \Gamma(5/2) = \tfrac{3}{2}\,\Gamma(3/2) = \frac{3\sqrt{\pi}}{4}
α\alpha123nn entero1/21/23/23/25/25/2
Γ(α)\Gamma(\alpha)112(n1)!(n-1)!π\sqrt{\pi}π/2\sqrt{\pi}/23π/43\sqrt{\pi}/4

6. La distribución Gamma

La distribución Gamma es una familia flexible de distribuciones sobre (0,)(0,\infty) que contiene como casos particulares a la exponencial y a la χ2\chi^2. Su utilidad aquí es doble: permite ver a la χ2\chi^2 como miembro de una familia mayor, y resuelve la pregunta que quedó abierta en §2 sobre la suma de exponenciales.

Parametrización

El curso usa el parámetro de escala θ\theta, relacionado con la tasa por θ=1/λ\theta = 1/\lambda. Conviene fijarlo porque la otra parametrización, con λ\lambda, es igual de común y las fórmulas cambian.

f(x;α,θ)=xα1ex/θΓ(α)θα,x>0f(x;\,\alpha,\theta) = \frac{x^{\alpha-1}\,e^{-x/\theta}}{\Gamma(\alpha)\,\theta^\alpha}, \qquad x > 0

El parámetro α>0\alpha > 0 se llama de forma: gobierna el aspecto de la densidad. El parámetro θ>0\theta>0 es de escala: estira o comprime el eje sin cambiar la forma.

MX(t)=(1θt)α,t<1/θE(X)=αθ,V(X)=αθ2M_X(t) = (1-\theta t)^{-\alpha}, \quad t<1/\theta \qquad\qquad E(X) = \alpha\theta, \qquad V(X) = \alpha\theta^2

Los casos particulares

La exponencial es una Gamma con α=1\alpha=1. Reemplazando en la densidad, Γ(1)=1\Gamma(1)=1 y queda f(x)=ex/θ/θf(x) = e^{-x/\theta}/\theta, que es la exponencial de media θ\theta. La FGM lo confirma: (1θt)1=λ/(λt)(1-\theta t)^{-1} = \lambda/(\lambda-t) con θ=1/λ\theta = 1/\lambda.

La chi-cuadrado es una Gamma con α=n/2\alpha = n/2 y θ=2\theta = 2. El chequeo es inmediato por FGM:

MΓ(n/2,2)(t)=(12t)n/2=Mχn2(t)M_{\Gamma(n/2,\,2)}(t) = (1-2t)^{-n/2} = M_{\chi^2_n}(t) χn2Γ ⁣(n2, 2)\boxed{\chi^2_n \sim \Gamma\!\left(\tfrac{n}{2},\ 2\right)}

y de ahí, aplicando E(X)=αθE(X)=\alpha\theta y V(X)=αθ2V(X)=\alpha\theta^2, se recuperan E(χn2)=(n/2)(2)=nE(\chi^2_n) = (n/2)(2) = n y V(χn2)=(n/2)(4)=2nV(\chi^2_n) = (n/2)(4) = 2n, coincidentes con lo obtenido en §4 por otro camino.

La suma de exponenciales, resuelta

Con esto se cierra la pregunta abierta en §2. Sean X1,,XnX_1,\ldots,X_n exponenciales independientes de igual parámetro θ\theta, y W=iXiW = \sum_i X_i. Cada una tiene FGM (1θt)1(1-\theta t)^{-1}, de modo que

MW(t)=[(1θt)1]n=(1θt)nM_W(t) = \left[(1-\theta t)^{-1}\right]^n = (1-\theta t)^{-n}

que es la FGM de una Γ(n,θ)\Gamma(n,\theta). Es decir:

la suma de n exponenciales i.i.d. de escala θ  es  Γ(n,θ)\boxed{\text{la suma de } n \text{ exponenciales i.i.d. de escala } \theta \ \text{ es } \ \Gamma(n,\theta)}

La suma no era exponencial, pero no por eso carecía de nombre: subió un escalón dentro de la misma familia. Es el parámetro de forma α\alpha el que cuenta cuántas exponenciales se sumaron, y esto explica su interpretación habitual: el tiempo de espera hasta el nn-ésimo evento de un proceso de Poisson.

Vale notar que este argumento también explica por qué la χ2\chi^2 es aditiva en los grados de libertad: sumar χ2\chi^2 es sumar Gammas de igual escala θ=2\theta=2, y eso suma los α\alpha.


7. El teorema central del límite

Las secciones anteriores permiten decir algo exacto sobre la distribución de una suma cuando se conoce la distribución de los sumandos. El teorema central del límite dice algo mucho más fuerte y mucho más útil: si los sumandos son suficientemente numerosos, deja de importar cómo se distribuían.

Enunciado

Sean X1,,XnX_1,\ldots,X_n variables aleatorias independientes e idénticamente distribuidas, con E(Xi)=μE(X_i)=\mu y V(Xi)=σ2V(X_i)=\sigma^2 finitas, cualquiera sea su distribución. Entonces la media muestral estandarizada converge en distribución a una normal estándar:

Xˉμσ/n  d  N(0,1)cuando n\frac{\bar{X}-\mu}{\sigma/\sqrt{n}} \ \xrightarrow{\ d\ }\ N(0,1) \qquad \text{cuando } n\to\infty

La hipótesis es mínima: independencia, idéntica distribución, y momentos de primer y segundo orden finitos. No se pide normalidad, ni simetría, ni continuidad. La distribución original puede ser discreta, asimétrica o de aspecto arbitrario.

μPoblación: una sola observaciónμMedia de n = 5μMedia de n = 30normal teórica
Teorema central del límite: la población es exponencial y no se parece en nada a una campana, pero el promedio muestral sí. Cada panel está en su propia escala; la línea punteada es la normal que predice el teorema.

La demostración por FGM

La demostración que sigue es la del curso y tiene el interés de mostrar de dónde sale la normalidad: aparece porque, al promediar, los términos de orden superior al segundo se desvanecen.

Se estandarizan las variables originales:

Zi=Xiμσ,E(Zi)=0,V(Zi)=1Z_i = \frac{X_i - \mu}{\sigma}, \qquad E(Z_i)=0, \quad V(Z_i)=1

Los ZiZ_i no son normales: son los XiX_i recentrados y reescalados, con la misma forma que tenían. Con esta definición, Xi=μ+σZiX_i = \mu + \sigma Z_i, y por lo tanto

Xˉ=μ+σni=1nZiY=Xˉμσ/n=1ni=1nZi\bar{X} = \mu + \frac{\sigma}{n}\sum_{i=1}^n Z_i \qquad\Longrightarrow\qquad Y = \frac{\bar{X}-\mu}{\sigma/\sqrt{n}} = \frac{1}{\sqrt{n}}\sum_{i=1}^n Z_i

Los ZiZ_i son i.i.d., así que por la propiedad de §2 la FGM de YY es la de un Zi/nZ_i/\sqrt{n} elevada a la nn:

MY(t)=[E ⁣(etZ/n)]nM_Y(t) = \left[E\!\left(e^{\,tZ/\sqrt{n}}\right)\right]^n

Se desarrolla la exponencial en serie y se toma esperanza término a término, usando E(Z)=0E(Z)=0 y E(Z2)=1E(Z^2)=1:

E ⁣(etZ/n)=1+tnE(Z)0+t22nE(Z2)1+O ⁣(n3/2)=1+t22n+O ⁣(n3/2)E\!\left(e^{tZ/\sqrt{n}}\right) = 1 + \frac{t}{\sqrt{n}}\underbrace{E(Z)}_{0} + \frac{t^2}{2n}\underbrace{E(Z^2)}_{1} + O\!\left(n^{-3/2}\right) = 1 + \frac{t^2}{2n} + O\!\left(n^{-3/2}\right)

Este es el corazón del argumento. El término de primer orden se anula porque las variables están centradas; el de segundo orden sobrevive con coeficiente t2/2t^2/2 porque están normalizadas; y los de orden tres en adelante llevan potencias de n3/2n^{-3/2} o menores, que al elevar a la nn se van a cero. Elevando:

MY(t)=(1+t22n+O ⁣(n3/2))n n et2/2M_Y(t) = \left(1 + \frac{t^2}{2n} + O\!\left(n^{-3/2}\right)\right)^n \ \xrightarrow[n\to\infty]{}\ e^{t^2/2}

usando limn(1+a/n)n=ea\lim_{n\to\infty}(1+a/n)^n = e^a. Y et2/2e^{t^2/2} es la FGM de la normal estándar. Como la convergencia de las FGM implica convergencia en distribución,

Xˉμσ/n  d  N(0,1)\boxed{\frac{\bar{X}-\mu}{\sigma/\sqrt{n}} \ \xrightarrow{\ d\ }\ N(0,1)}

Lo que la demostración deja ver es que solo los dos primeros momentos sobreviven al promediado. Toda la información sobre la forma particular de la distribución original —asimetría, curtosis, todo lo que vive en los momentos de tercer orden en adelante— se diluye. Por eso el límite es siempre el mismo.

Qué significa "nn suficientemente grande"

El teorema es asintótico y no dice a partir de qué nn la aproximación es aceptable. La regla operativa habitual, y la que usa el curso, es

n30n \geq 30

Es una convención, no un teorema. La velocidad de convergencia depende de cuán lejos esté la distribución original de la normal: para una población ya simétrica y unimodal la aproximación es buena con nn mucho menor, mientras que para una fuertemente asimétrica —o con una proporción pp muy cercana a 0 o a 1— puede hacer falta bastante más de 30.

Hay un caso en que el resultado es exacto para todo nn y no hay nada que aproximar: cuando la población ya es normal. Ahí la suma de normales es normal (§2) y Xˉ\bar{X} es exactamente N(μ,σ2/n)N(\mu,\sigma^2/n), aunque nn sea 4.

Un ejemplo

Una empresa de viajes registra el gasto por turista según categoría, con una distribución que no tiene forma reconocible:

CategoríaABCD
Gasto7001.2001.9003.300
Probabilidad22%31%18%8%

De esa distribución se obtienen E(X)1.209E(X) \approx 1.209 y σ2(X)760.670\sigma^2(X) \approx 760.670. Para un grupo de n=80n=80 turistas, el gasto total Y=i=180XiY = \sum_{i=1}^{80} X_i tiene

E(Y)=801.209=96.720,σ(Y)=80760.6706.803,6E(Y) = 80\cdot 1.209 = 96.720, \qquad \sigma(Y) = \sqrt{80\cdot 760.670} \approx 6.803{,}6

y por el teorema central del límite YY es aproximadamente N(96.720; 6.803,6)N(96.720;\ 6.803{,}6), de modo que P(Y>106.760)6,7%P(Y > 106.760) \approx 6{,}7\%.

Nada en el planteo requiere saber qué forma tiene la distribución del gasto individual —de hecho es discreta y con cuatro valores—. Basta con su media y su varianza. Esa es la utilidad práctica del teorema: convierte información parcial sobre una población en una distribución completa para el agregado.


Parte II · Distribuciones muestrales


8. Población, muestra y estimadores

Hasta aquí todo fue probabilidad: dada una distribución, se calcularon propiedades de las variables que la siguen. La estadística invierte el planteo. La distribución es lo desconocido y los datos son lo dado. Esta sección fija el vocabulario de esa inversión, que gobierna todo el resto del manual.

Población y muestra

La población es el conjunto completo sobre el que se quiere concluir, descripto por una variable aleatoria XX con cierta distribución. Una muestra aleatoria simple de tamaño nn es una elección al azar de nn observaciones de esa variable, X1,X2,,XnX_1, X_2, \ldots, X_n.

Antes de observarlas, las XiX_i son variables aleatorias; después de observarlas son números, y se anotan en minúscula, x1,,xnx_1,\ldots,x_n. La distinción parece pedante pero es la que permite hablar de la distribución de un estadístico: el azar está en el muestreo, no en la población, que es fija.

El supuesto de trabajo es que las XiX_i son independientes e idénticamente distribuidas (i.i.d.): cada extracción sigue la misma distribución que la población y no informa sobre las demás. Esto vale exactamente cuando el muestreo es con reposición o cuando la población es infinita. Si la población es finita y la muestra representa una fracción apreciable de ella, la independencia se pierde y hay que corregir; ese ajuste se trata en §27.

Vale la pena distinguir dos maneras en que una población lleva su probabilidad. Puede ser intrínseca al objeto —500 monedas donde la probabilidad de cara es una propiedad física de cada moneda— o extrínseca —una encuesta a 500 personas, donde la probabilidad de cada respuesta surge de la composición del grupo—. La matemática es la misma en los dos casos, pero la interpretación de lo que se está estimando no lo es.

Parámetros, estadísticos y estimadores

Un parámetro poblacional es una constante que caracteriza la distribución de la población: μ\mu, σ2\sigma^2, pp, λ\lambda, θ\theta. Es fijo y desconocido. Genéricamente se lo denota θ\theta.

Un estadístico muestral TT es cualquier función de los datos de la muestra, T=T(X1,,Xn)T = T(X_1,\ldots,X_n), que no dependa de parámetros desconocidos. Como es función de variables aleatorias, un estadístico es él mismo una variable aleatoria, y tiene su propia distribución: la distribución muestral.

Un estimador θ^\hat{\theta} es un estadístico usado para aproximar un parámetro. La media muestral Xˉ\bar{X} es un estimador de μ\mu; la proporción muestral p^\hat{p} lo es de pp; la varianza muestral S2S^2 lo es de σ2\sigma^2.

Esta última definición encierra el problema central de la Parte III. Nada impide proponer como estimador de μ\mu el promedio de la primera y la última observación, o directamente X1X_1: los tres son estadísticos y los tres apuntan a μ\mu. Lo que hace falta es un criterio para decidir cuál es mejor, y ese criterio se construye a partir de la distribución muestral de cada uno. De ahí que el orden sea este: primero las distribuciones muestrales (esta parte), después el juicio sobre los estimadores (la siguiente).


9. La media muestral

De todos los estadísticos, Xˉ=1niXi\bar{X} = \frac{1}{n}\sum_i X_i es el más importante, y su distribución muestral se conoce en detalle.

Media y varianza

Cualesquiera sean los XiX_i, con tal de que sean i.i.d. con E(Xi)=μE(X_i)=\mu y V(Xi)=σ2V(X_i)=\sigma^2:

E(Xˉ)=1ni=1nE(Xi)=nμn=μE(\bar{X}) = \frac{1}{n}\sum_{i=1}^n E(X_i) = \frac{n\mu}{n} = \mu V(Xˉ)=1n2i=1nV(Xi)=nσ2n2=σ2nV(\bar{X}) = \frac{1}{n^2}\sum_{i=1}^n V(X_i) = \frac{n\sigma^2}{n^2} = \frac{\sigma^2}{n}

El primer resultado dice que Xˉ\bar{X} está centrada en μ\mu: no tiene tendencia sistemática a sobreestimar ni a subestimar. El segundo dice que su dispersión disminuye con nn, y disminuye de una forma muy concreta: el desvío es σ/n\sigma/\sqrt{n}, no σ/n\sigma/n.

Esa cantidad, σ/n\sigma/\sqrt{n}, se llama error estándar de la media. Es el desvío del estimador, no el de la población, y la distinción importa: σ\sigma mide cuánto varían los individuos entre sí, mientras que σ/n\sigma/\sqrt{n} mide cuánto varía el promedio de una muestra a otra.

La presencia de la raíz tiene una consecuencia práctica que atraviesa todo el curso: para reducir a la mitad el error estándar hay que cuadruplicar el tamaño de la muestra. La precisión se compra a costo creciente.

Nótese que la varianza usó la independencia (los términos cruzados de la varianza de una suma se anulan) pero la esperanza no. E(Xˉ)=μE(\bar X) = \mu vale aun con datos dependientes; V(Xˉ)=σ2/nV(\bar X) = \sigma^2/n, no.

Distribución

En cuanto a la forma de la distribución de Xˉ\bar{X}, hay dos vías que llevan a la normal:

  • Si la población es normal, XiN(μ,σ2)X_i \sim N(\mu,\sigma^2), entonces XˉN(μ, σ2/n)\bar{X} \sim N(\mu,\ \sigma^2/n) exactamente, para cualquier nn. Sale de §2: la suma de normales es normal, y multiplicar por 1/n1/n preserva la normalidad.
  • Si la población no es normal, el teorema central del límite da la misma conclusión de manera aproximada, con la aproximación mejorando al crecer nn. La convención del curso es aceptarla desde n30n\geq 30.

El resultado es que en la enorme mayoría de las situaciones se puede trabajar con

Xˉμσ/nN(0,1)\frac{\bar{X}-\mu}{\sigma/\sqrt{n}} \sim N(0,1)

y esa expresión es el punto de partida de los intervalos de confianza para μ\mu (§22) y de los tests sobre μ\mu (§35).

El caso de una proporción

Cuando la población es dicotómica —cada individuo tiene o no tiene cierto atributo— se codifica Xi=1X_i = 1 si lo tiene y Xi=0X_i=0 si no, de modo que XiX_i \sim Bernoulli(p)(p) con E(Xi)=pE(X_i)=p y V(Xi)=pqV(X_i)=pq, donde q=1pq = 1-p.

La proporción muestral p^=1niXi\hat{p} = \frac{1}{n}\sum_i X_i es una media muestral, y por lo tanto hereda todo lo anterior sin cambios:

E(p^)=p,V(p^)=pqn,p^  N ⁣(p; pqn)E(\hat{p}) = p, \qquad V(\hat{p}) = \frac{pq}{n}, \qquad \hat{p} \ \approx\ N\!\left(p;\ \sqrt{\frac{pq}{n}}\right)

La aproximación normal necesita nn grande y, además, que pp no esté demasiado cerca de 0 ni de 1; el criterio usual pide que npnp y nqnq superen 5.

Hay una peculiaridad de las proporciones que conviene registrar desde ahora, porque explica varias diferencias entre los intervalos de proporciones y los de medias: la varianza pq/npq/n está determinada por el propio pp. No hay dos parámetros que estimar, sino uno solo que aparece en los dos lugares.

Ejemplo. El 90% de las piezas de un proceso son de buena calidad. En una muestra de n=64n=64 piezas,

p^N ⁣(0,90; 0,900,1064)=N(0,90; 0,0375)\hat{p} \sim N\!\left(0{,}90;\ \sqrt{\frac{0{,}90\cdot 0{,}10}{64}}\right) = N(0{,}90;\ 0{,}0375) P(p^0,847)=P ⁣(Z0,8470,900,0375)=P(Z1,41)=7,88%P(\hat{p} \leq 0{,}847) = P\!\left(Z \leq \frac{0{,}847-0{,}90}{0{,}0375}\right) = P(Z \leq -1{,}41) = 7{,}88\%

10. La varianza muestral

Estimar σ2\sigma^2 presenta una dificultad que estimar μ\mu no tiene. La definición poblacional es σ2=E[(Xμ)2]\sigma^2 = E[(X-\mu)^2], y su traducción muestral inmediata sería promediar (XiXˉ)2(X_i - \bar{X})^2. Pero ahí hay dos decisiones ocultas: si dividir por nn o por n1n-1, y si medir las desviaciones desde Xˉ\bar{X} o desde μ\mu. Las combinaciones dan tres estadísticos distintos, con propiedades distintas, y los tres aparecen en el curso.

La varianza insesgada S2S^2

S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1}\sum_{i=1}^n (X_i - \bar{X})^2

Es el estimador estándar. La razón del divisor n1n-1 se ve en la demostración de su esperanza, que vale para cualquier distribución poblacional. Se parte de la identidad algebraica (XiXˉ)2=Xi2nXˉ2\sum(X_i-\bar{X})^2 = \sum X_i^2 - n\bar{X}^2 y se toman esperanzas de cada término, usando E(X2)=μ2+σ2E(X^2) = \mu^2+\sigma^2 para las observaciones individuales y E(Xˉ2)=μ2+σ2/nE(\bar{X}^2) = \mu^2 + \sigma^2/n para la media muestral:

E ⁣[Xi2]=n(μ2+σ2),E ⁣[nXˉ2]=nμ2+σ2E\!\left[\sum X_i^2\right] = n(\mu^2+\sigma^2), \qquad E\!\left[n\bar{X}^2\right] = n\mu^2+\sigma^2 E ⁣[(XiXˉ)2]=nμ2+nσ2nμ2σ2=(n1)σ2E\!\left[\sum(X_i-\bar{X})^2\right] = n\mu^2+n\sigma^2 - n\mu^2 - \sigma^2 = (n-1)\,\sigma^2 E(S2)=σ2\boxed{E(S^2) = \sigma^2}

La suma de cuadrados de desviaciones tiene esperanza (n1)σ2(n-1)\sigma^2, no nσ2n\sigma^2. Dividir por n1n-1 es lo que compensa exactamente esa pérdida.

La interpretación de esa pérdida es que Xˉ\bar{X} está construida a partir de los mismos datos y por lo tanto está sistemáticamente más cerca de ellos que μ\mu. De hecho Xˉ\bar{X} es, por definición, el valor que minimiza (Xic)2\sum(X_i - c)^2 sobre todo cc; en particular (XiXˉ)2(Xiμ)2\sum(X_i-\bar{X})^2 \leq \sum(X_i-\mu)^2. Medir la dispersión desde Xˉ\bar{X} la subestima, y el divisor n1n-1 corrige esa subestimación.

Para población normal hay además un resultado sobre la distribución completa, no solo sobre la esperanza. Es la consecuencia de la relación de Cochran, que se demuestra en la sección siguiente:

(n1)S2σ2χn12\boxed{\frac{(n-1)S^2}{\sigma^2} \sim \chi^2_{n-1}}

De aquí sale todo lo que se sabe de S2S^2. Como E(χn12)=n1E(\chi^2_{n-1}) = n-1, se recupera E(S2)=σ2E(S^2)=\sigma^2; y como V(χn12)=2(n1)V(\chi^2_{n-1}) = 2(n-1),

V(S2)=(σ2n1)22(n1)=2σ4n1V(S^2) = \left(\frac{\sigma^2}{n-1}\right)^2\cdot 2(n-1) = \frac{2\sigma^4}{n-1}

La varianza sesgada Sn2S_n^2

Sn2=1ni=1n(XiXˉ)2=n1nS2S2=nn1Sn2S_n^2 = \frac{1}{n}\sum_{i=1}^n (X_i-\bar{X})^2 = \frac{n-1}{n}\,S^2 \qquad\Longleftrightarrow\qquad S^2 = \frac{n}{n-1}\,S_n^2

Es el promedio literal de los cuadrados. Su esperanza se sigue de la de S2S^2:

E(Sn2)=n1nσ2B(Sn2)=σ2nE(S_n^2) = \frac{n-1}{n}\,\sigma^2 \qquad\Longrightarrow\qquad B(S_n^2) = -\frac{\sigma^2}{n}

Subestima σ2\sigma^2, con un sesgo que se desvanece cuando nn crece. Pese a ello aparece con frecuencia, por dos razones: es el estimador de máxima verosimilitud de σ2\sigma^2 cuando μ\mu es desconocido (§19), y coincide con el estimador de momentos (§20).

En la práctica de cálculo el vínculo entre las dos versiones se usa constantemente, porque la fórmula abreviada

Sn2=1nXi2Xˉ2S_n^2 = \frac{1}{n}\sum X_i^2 - \bar{X}^2

evita restar la media en cada término. Se calcula Sn2S_n^2 con ella y se multiplica por n/(n1)n/(n-1) para obtener S2S^2.

Como nSn2=(n1)S2n\,S_n^2 = (n-1)S^2 —las dos expresiones son la misma suma de cuadrados—, para población normal se tiene igualmente

nSn2σ2χn12,V(Sn2)=2σ4(n1)n2\frac{n\,S_n^2}{\sigma^2} \sim \chi^2_{n-1}, \qquad V(S_n^2) = \frac{2\sigma^4(n-1)}{n^2}

La varianza centrada en μ\mu: Sn2S_n^{*2}

Sn2=1ni=1n(Xiμ)2S_n^{*2} = \frac{1}{n}\sum_{i=1}^n (X_i-\mu)^2

Esta versión mide las desviaciones respecto del verdadero μ\mu, lo que solo es posible si μ\mu es conocido —situación poco frecuente en la práctica, pero teóricamente esclarecedora. Su esperanza es inmediata: cada término tiene esperanza σ2\sigma^2 por definición de varianza, de modo que

E(Sn2)=1nnσ2=σ2E(S_n^{*2}) = \frac{1}{n}\cdot n\sigma^2 = \sigma^2

Es insesgada dividiendo por nn, sin corrección alguna. Esto confirma el diagnóstico: el problema del divisor no venía de dividir por nn sino de haber usado Xˉ\bar{X} en lugar de μ\mu.

Para población normal, cada término es Zi2Z_i^2 con Zi=(Xiμ)/σZ_i = (X_i-\mu)/\sigma, y la suma de nn cuadrados independientes es directamente una χn2\chi^2_n:

nSn2σ2=i=1nZi2χn2,V(Sn2)=2σ4n\frac{n\,S_n^{*2}}{\sigma^2} = \sum_{i=1}^n Z_i^2 \sim \chi^2_n, \qquad V(S_n^{*2}) = \frac{2\sigma^4}{n}

Aquí no se pierde ningún grado de libertad, porque no se estimó nada.

Comparación

S2S^2Sn2S_n^2Sn2S_n^{*2}
Divisorn1n-1nnnn
Centrada enXˉ\bar{X}Xˉ\bar{X}μ\mu (conocido)
E()E(\cdot)σ2\sigma^2n1nσ2\frac{n-1}{n}\sigma^2σ2\sigma^2
Sesgo0σ2/n-\sigma^2/n0
Distribución (pob. normal)(n1)S2σ2χn12\frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}nSn2σ2χn12\frac{nS_n^2}{\sigma^2}\sim\chi^2_{n-1}nSn2σ2χn2\frac{nS_n^{*2}}{\sigma^2}\sim\chi^2_{n}
Varianza2σ4n1\frac{2\sigma^4}{n-1}2σ4(n1)n2\frac{2\sigma^4(n-1)}{n^2}2σ4n\frac{2\sigma^4}{n}

Los grados de libertad de la última fila resumen la lógica del cuadro: son nn menos la cantidad de parámetros que hubo que estimar de la muestra. Con μ\mu conocido no se estima nada y quedan nn; con μ\mu estimado por Xˉ\bar{X} se pierde uno y quedan n1n-1.

Ejemplo. Sea una población normal con μ=50\mu=50 y σ=4\sigma=4, y muestras de n=10n=10. Para hallar P(12,16S219,33)P(12{,}16 \leq S^2 \leq 19{,}33) se transforma la desigualdad multiplicando por (n1)/σ2=9/16(n-1)/\sigma^2 = 9/16:

P ⁣(912,1616χ92919,3316)=P(6,84χ9210,87)=0,369P\!\left(\frac{9\cdot 12{,}16}{16} \leq \chi^2_9 \leq \frac{9\cdot 19{,}33}{16}\right) = P(6{,}84 \leq \chi^2_9 \leq 10{,}87) = 0{,}369

Nótese que la media poblacional μ=50\mu=50 no interviene: la distribución de S2S^2 depende de σ2\sigma^2 y de nn, no de μ\mu.


11. La relación de Cochran

Esta sección demuestra el resultado que se viene anticipando desde §4 y sobre el que descansan la tt de Student, la FF, el intervalo para la varianza y el análisis de la varianza. El argumento tiene dos etapas bien diferenciadas: una identidad algebraica que vale siempre, y una lectura probabilística que requiere normalidad.

La identidad

Para cualquier conjunto de números X1,,XnX_1,\ldots,X_n y cualquier constante μ\mu vale

i=1n(Xiμ)2=i=1n(XiXˉ)2+n(Xˉμ)2\sum_{i=1}^n (X_i-\mu)^2 = \sum_{i=1}^n (X_i-\bar{X})^2 + n(\bar{X}-\mu)^2

Se comprueba sumando y restando Xˉ\bar X dentro del cuadrado del miembro izquierdo, (Xiμ)=(XiXˉ)+(Xˉμ)(X_i-\mu) = (X_i-\bar{X}) + (\bar{X}-\mu), y desarrollando: el doble producto es 2(Xˉμ)(XiXˉ)2(\bar{X}-\mu)\sum(X_i-\bar{X}), y esa suma es cero por definición de media. Es álgebra pura, sin ninguna hipótesis distribucional.

Lo que dice la identidad es que la dispersión de los datos respecto de μ\mu se descompone en dos partes: la dispersión interna de los datos respecto de su propio promedio, más lo que ese promedio se corrió respecto de μ\mu.

La lectura probabilística

Se divide todo por σ2\sigma^2:

i=1n(Xiμ)2σ2(a)=(n1)S2σ2(b)+n(Xˉμ)2σ2(c)\underbrace{\sum_{i=1}^n \frac{(X_i-\mu)^2}{\sigma^2}}_{\text{(a)}} = \underbrace{\frac{(n-1)S^2}{\sigma^2}}_{\text{(b)}} + \underbrace{\frac{n(\bar{X}-\mu)^2}{\sigma^2}}_{\text{(c)}}

Ahora sí se supone población normal, XiN(μ,σ2)X_i \sim N(\mu,\sigma^2), y se identifican dos de los tres términos:

  • (a) es Zi2\sum Z_i^2 con Zi=(Xiμ)/σN(0,1)Z_i = (X_i-\mu)/\sigma \sim N(0,1) independientes, o sea χn2\chi^2_n.
  • (c) es (Xˉμσ/n)2\left(\dfrac{\bar{X}-\mu}{\sigma/\sqrt{n}}\right)^2, el cuadrado de una normal estándar, o sea χ12\chi^2_1.

Queda una identidad de la forma χn2=(b)+χ12\chi^2_n = (b) + \chi^2_1. El teorema de Cochran garantiza además que (b)(b) y (c)(c) son independientes —lo cual no es evidente, ya que ambos se construyen con los mismos datos, y es la parte técnica del teorema— y de ahí, por la aditividad de los grados de libertad vista en §4, se concluye

(n1)S2σ2χn12\boxed{\frac{(n-1)S^2}{\sigma^2} \sim \chi^2_{n-1}}

Qué se lleva de esto

Dos cosas, y las dos se usan constantemente.

La primera es el resultado en sí: la distribución exacta de la varianza muestral en poblaciones normales. De ahí salen V(S2)V(S^2), el intervalo de confianza para σ2\sigma^2 (§28) y el test correspondiente (§37).

La segunda es la independencia entre Xˉ\bar{X} y S2S^2, que la descomposición deja al descubierto. Es una propiedad particular de la normal —en general la media y la varianza muestrales están correlacionadas— y es la que permite construir la tt de Student, cuya definición exige que el numerador normal y el denominador χ2\chi^2 sean independientes.

Y una tercera lectura, más conceptual: aquí aparece por primera vez la idea de descomponer una variabilidad total en partes atribuibles a fuentes distintas, cada una con sus grados de libertad, sumando ambas cosas. Es exactamente el esquema que reaparece, a mayor escala, en el análisis de la varianza (§43).


12. La distribución tt de Student

Todo lo construido hasta acá para la media supone conocido σ\sigma, que es justamente lo que casi nunca ocurre. Reemplazarlo por SS parece inofensivo, pero tiene una consecuencia: SS también es una variable aleatoria, y al dividir por una cantidad que fluctúa el cociente acumula dos fuentes de azar. La distribución resultante ya no es normal.

Definición

Tn=ZVn/n,ZN(0,1),Vnχn2,independientesT_n = \frac{Z}{\sqrt{V_n/n}}, \qquad Z\sim N(0,1),\quad V_n\sim\chi^2_n, \quad \text{independientes}

La estructura a reconocer es: arriba una normal estándar, abajo la raíz de una χ2\chi^2 dividida por sus propios grados de libertad, y ambas independientes. Cada vez que aparezca esa forma, la distribución es una tt, y los grados de libertad son los de la χ2\chi^2 del denominador.

Por simetría de ZZ y positividad del denominador, E(Tn)=0E(T_n)=0 (para n>1n>1).

La estadística tt para la media

La derivación consiste en manipular el cociente hasta que tenga la forma de la definición. Se parte de (Xˉμ)/(S/n)(\bar{X}-\mu)/(S/\sqrt{n}) y se multiplica y divide por σ\sigma:

XˉμS/n=(Xˉμ)/(σ/n)S/σ=ZS2/σ2\frac{\bar{X}-\mu}{S/\sqrt{n}} = \frac{(\bar{X}-\mu)/(\sigma/\sqrt{n})}{S/\sigma} = \frac{Z}{\sqrt{S^2/\sigma^2}}

El numerador es normal estándar. Para el denominador se usa Cochran: como (n1)S2/σ2χn12(n-1)S^2/\sigma^2 \sim \chi^2_{n-1}, se tiene S2/σ2=χn12/(n1)S^2/\sigma^2 = \chi^2_{n-1}/(n-1), y la independencia entre Xˉ\bar X y S2S^2 —que Cochran también garantiza— completa el requisito de la definición:

Zχn12/(n1)=Tn1XˉμS/ntn1\frac{Z}{\sqrt{\chi^2_{n-1}/(n-1)}} = T_{n-1} \qquad\Longrightarrow\qquad \boxed{\frac{\bar{X}-\mu}{S/\sqrt{n}} \sim t_{n-1}}

Los grados de libertad son n1n-1, no nn: son los de la χ2\chi^2 del denominador, que perdió uno al estimar la media con Xˉ\bar{X}.

Forma y comportamiento

La tt es simétrica alrededor de cero y de aspecto acampanado, como la normal, pero con colas más pesadas. La razón está en el denominador aleatorio: cuando SS sale menor que σ\sigma, el cociente se infla, y esos casos producen valores extremos con más frecuencia que en una normal.

La consecuencia operativa es que, para el mismo nivel de confianza,

tα/2;n1>Zα/2t_{\alpha/2;\,n-1} > Z_{\alpha/2}

y por lo tanto todo intervalo construido con tt es más ancho que el correspondiente con ZZ. Ese ensanchamiento es el precio de no conocer σ\sigma: se paga en precisión lo que no se tiene en información.

Z ~ N(0,1)t con 3 g.l.−1,961,963,182−3,182Mismo 5% en las colas, umbral más lejos: 3,182 en vez de 1,96.
Las colas de la t son más gruesas porque el denominador S también es aleatorio. Por eso el umbral queda más lejos y el intervalo sale más ancho: ese es el precio de no conocer σ.

Al crecer los grados de libertad, SS estima cada vez mejor a σ\sigma, el denominador se estabiliza y la tt converge a la normal estándar. El cuadro siguiente muestra la velocidad de esa convergencia para el cuantil bilateral al 95%:

g.l.149153060120\infty
t0,025;vt_{0,025;\,v}12,7062,7762,2622,1312,0422,0001,9801,960

Con pocos grados de libertad la diferencia es enorme; a partir de 30 es de segundo orden, y a partir de 120 es prácticamente nula. Este cuadro justifica una práctica que reaparece varias veces: con muestras grandes se usa ZZ aunque σ\sigma sea desconocido, porque la corrección de la tt ya no cambia nada.

La relación t2=Ft^2 = F

De la definición se sigue de inmediato un resultado que se retomará en §45. Elevando al cuadrado,

Tv2=Z2χv2/v=χ12/1χv2/v=F1;vT_v^2 = \frac{Z^2}{\chi^2_v/v} = \frac{\chi^2_1/1}{\chi^2_v/v} = F_{1;\,v}

usando que Z2χ12Z^2\sim\chi^2_1 (§3). El cuadrado de una tt con vv grados de libertad es una FF con 11 y vv grados de libertad. No es una coincidencia numérica sino una consecuencia directa de cómo están definidas ambas.


13. La distribución FF de Fisher–Snedecor

La tt surgió de combinar una normal con una χ2\chi^2. La FF surge de combinar dos χ2\chi^2, y sirve para comparar dos varianzas.

Definición

Fn,m=χn2/nχm2/m,las dos χ2 independientesF_{n,m} = \frac{\chi^2_n/n}{\chi^2_m/m}, \qquad \text{las dos } \chi^2 \text{ independientes}

Cada χ2\chi^2 se divide por sus propios grados de libertad antes del cociente. Esa normalización es la que hace que el cociente tenga valor típico cercano a 1: como E(χn2/n)=1E(\chi^2_n/n) = 1, si las dos χ2\chi^2 miden lo mismo el cociente ronda la unidad.

El orden de los subíndices importa y no es intercambiable: el primero corresponde al numerador. De hecho, si FFn,mF\sim F_{n,m} entonces 1/FFm,n1/F \sim F_{m,n}, propiedad que se explota en §29 para leer las tablas.

Dónde aparece

Comparando varianzas de dos poblaciones normales independientes. Si XN(μ1,σ12)X\sim N(\mu_1,\sigma_1^2) e YN(μ2,σ22)Y\sim N(\mu_2,\sigma_2^2), con muestras de tamaños n1n_1 y n2n_2, Cochran da (ni1)Si2/σi2χni12(n_i-1)S_i^2/\sigma_i^2 \sim \chi^2_{n_i-1} para cada una, y el cociente normalizado es

S12/σ12S22/σ22=χn112/(n11)χn212/(n21)Fn11, n21\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} = \frac{\chi^2_{n_1-1}/(n_1-1)}{\chi^2_{n_2-1}/(n_2-1)} \sim F_{n_1-1,\ n_2-1}

Este es el pivote del intervalo de confianza para el cociente de varianzas (§29) y del test correspondiente (§38).

Calculando probabilidades de comparación entre dos χ2\chi^2. Un suceso del tipo {X>aY}\{X > a\,Y\} con Xχn12X\sim\chi^2_{n_1} e Yχn22Y\sim\chi^2_{n_2} independientes se reescribe dividiendo por los grados de libertad:

P(X>aY)=P ⁣(X/n1Y/n2>an2n1)=P ⁣(Fn1,n2>an2n1)P(X > a\,Y) = P\!\left(\frac{X/n_1}{Y/n_2} > a\,\frac{n_2}{n_1}\right) = P\!\left(F_{n_1,n_2} > a\,\frac{n_2}{n_1}\right)

Comparando varianzas explicadas y no explicadas. Esta es la aplicación del análisis de la varianza (§43), donde el numerador mide la variabilidad atribuible a un factor y el denominador la variabilidad residual.

Z ~ N(0,1)normal estándarelevar al cuadrado y sumar nχ²ₙ= Σ Zᵢ²t = Z / √(χ²ᵥ/v)una normal sobre una χ²F = (χ²ₙ/n) / (χ²ₘ/m)una χ² sobre otra χ²t²ᵥ = F₁,ᵥmedias con σ desconocidocomparación de varianzas · ANOVAvarianzas
Las tres distribuciones de la inferencia salen todas de la normal estándar.

Momentos y forma

E(Fn1,n2)=n2n22(n2>2),V(Fn1,n2)=2n22(n1+n22)n1(n22)2(n24)(n2>4)E(F_{n_1,n_2}) = \frac{n_2}{n_2-2}\quad (n_2>2), \qquad V(F_{n_1,n_2}) = \frac{2n_2^2(n_1+n_2-2)}{n_1(n_2-2)^2(n_2-4)}\quad (n_2>4)

La esperanza depende solo de los grados de libertad del denominador y tiende a 1 cuando n2n_2 crece, en línea con lo dicho más arriba.

La FF vive en (0,)(0,\infty) y es asimétrica hacia la derecha, como la χ2\chi^2. Esa asimetría tiene dos consecuencias que aparecerán más adelante: los intervalos basados en la FF no son simétricos, y las tablas se publican solo para la cola derecha, lo que obliga a la identidad de inversión de §29.


14. Cuadro de distribuciones muestrales

Este cuadro resume la Parte II. Es el repertorio completo de resultados que la inferencia va a usar: cada procedimiento de las partes IV y V se apoya en alguna de estas seis filas.

EstadísticoCondiciónDistribución
Xˉ\bar{X}población normal, cualquier nnN(μ; σ2/n)N(\mu;\ \sigma^2/n) exacta
Xˉ\bar{X}n30n\geq 30, población cualquieraN(μ; σ2/n)N(\mu;\ \sigma^2/n) por TCL
XˉμS/n\dfrac{\bar{X}-\mu}{S/\sqrt{n}}población normal, σ\sigma desconocidotn1t_{n-1}
(n1)S2σ2\dfrac{(n-1)S^2}{\sigma^2}población normalχn12\chi^2_{n-1}
p^\hat{p}n30n\geq 30, población dicotómicaN ⁣(p; pq/n)N\!\left(p;\ \sqrt{pq/n}\right) por TCL
S12/σ12S22/σ22\dfrac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}ambas poblaciones normales, independientesFn11, n21F_{n_1-1,\ n_2-1}

Conviene notar la asimetría entre las filas de la media y las de la varianza. Para Xˉ\bar{X} el teorema central del límite ofrece una salida cuando la población no es normal; para S2S^2 no hay tal salida. Los resultados de las filas tercera, cuarta y sexta descansan enteramente en la normalidad de la población, y no hay ningún teorema que los rescate con nn grande. Esto hace que la inferencia sobre varianzas sea sensiblemente más frágil que la inferencia sobre medias, un punto que se retoma en §28.

Ejemplo de uso. Sea una población normal con σ2=25\sigma^2=25 y muestras de n=24n=24; se pide P(Sn237)P(S_n^2 \leq 37), donde Sn2S_n^2 es la varianza sesgada. La cuarta fila se aplica a S2S^2, pero nSn2=(n1)S2n\,S_n^2 = (n-1)S^2, de modo que

P(Sn237)=P ⁣(χ232243725)=P(χ23235,52)=0,954P(S_n^2 \leq 37) = P\!\left(\chi^2_{23} \leq \frac{24\cdot 37}{25}\right) = P(\chi^2_{23} \leq 35{,}52) = 0{,}954

Parte III · Teoría de la estimación


15. Sesgo y error cuadrático medio

Un mismo parámetro admite muchos estimadores. Para μ\mu, por ejemplo, sirven Xˉ\bar{X}, el promedio de la primera y la última observación, la mediana muestral o directamente X1X_1. Hace falta un criterio para ordenarlos, y como los estimadores son variables aleatorias, el criterio tiene que ser una propiedad de su distribución.

Sesgo

B(θ^)=E(θ^)θB(\hat{\theta}) = E(\hat{\theta}) - \theta

Un estimador es insesgado cuando B(θ^)=0B(\hat{\theta})=0, es decir cuando su distribución muestral está centrada en el parámetro. No significa que acierte —una estimación puntual casi nunca coincide con θ\theta— sino que no yerra sistemáticamente en una dirección.

Error cuadrático medio

El sesgo por sí solo es insuficiente: un estimador puede estar bien centrado y ser tan disperso que resulte inútil. La medida que combina ambos aspectos es

ECM(θ^)=E ⁣[(θ^θ)2]\text{ECM}(\hat{\theta}) = E\!\left[(\hat{\theta}-\theta)^2\right]

que promedia el error al cuadrado. Su descomposición es el resultado central de esta sección. Desarrollando el cuadrado,

ECM(θ^)=E(θ^2)2θE(θ^)+θ2\text{ECM}(\hat{\theta}) = E(\hat{\theta}^2) - 2\theta E(\hat{\theta}) + \theta^2

y sumando y restando [E(θ^)]2[E(\hat\theta)]^2 para reconocer la varianza:

=E(θ^2)[E(θ^)]2V(θ^)+[E(θ^)]22θE(θ^)+θ2[E(θ^)θ]2= \underbrace{E(\hat{\theta}^2) - [E(\hat{\theta})]^2}_{V(\hat\theta)} + \underbrace{[E(\hat{\theta})]^2 - 2\theta E(\hat{\theta}) + \theta^2}_{[E(\hat\theta)-\theta]^2} ECM(θ^)=V(θ^)+[B(θ^)]2\boxed{\text{ECM}(\hat{\theta}) = V(\hat{\theta}) + \left[B(\hat{\theta})\right]^2}

El error total se descompone en dispersión más sesgo al cuadrado. Un estimador es bueno cuando ambos son chicos, y la descomposición hace explícito que puede convenir aceptar algo de sesgo a cambio de mucha menos varianza. Cuando el estimador es insesgado, el ECM se reduce a la varianza.

Un ejemplo comparativo

Sea XExpX\sim\text{Exp} con E(X)=θE(X)=\theta y V(X)=θ2V(X)=\theta^2, y considérense tres estimadores de θ\theta a partir de una muestra de tamaño nn.

Primero, θ^1=12(X1+Xn)\hat{\theta}_1 = \tfrac{1}{2}(X_1+X_n), el promedio de la primera y la última observación:

E(θ^1)=12(θ+θ)=θ(insesgado),V(θ^1)=14θ2+14θ2=12θ2E(\hat{\theta}_1) = \tfrac{1}{2}(\theta+\theta) = \theta \quad\text{(insesgado)}, \qquad V(\hat{\theta}_1) = \tfrac{1}{4}\theta^2+\tfrac{1}{4}\theta^2 = \tfrac{1}{2}\theta^2 ECM(θ^1)=12θ2\text{ECM}(\hat{\theta}_1) = \tfrac{1}{2}\theta^2

Segundo, θ^2=13(X1+2X2+Xn)\hat{\theta}_2 = \tfrac{1}{3}(X_1+2X_2+X_n), que pondera de manera arbitraria:

E(θ^2)=13(θ+2θ+θ)=43θB(θ^2)=θ3E(\hat{\theta}_2) = \tfrac{1}{3}(\theta+2\theta+\theta) = \tfrac{4}{3}\theta \quad\Longrightarrow\quad B(\hat{\theta}_2) = \tfrac{\theta}{3} V(θ^2)=19(θ2+4θ2+θ2)=23θ2ECM(θ^2)=θ29+6θ29=79θ2V(\hat{\theta}_2) = \tfrac{1}{9}(\theta^2+4\theta^2+\theta^2) = \tfrac{2}{3}\theta^2 \quad\Longrightarrow\quad \text{ECM}(\hat{\theta}_2) = \tfrac{\theta^2}{9}+\tfrac{6\theta^2}{9} = \tfrac{7}{9}\theta^2

Los coeficientes no suman 1, y de ahí el sesgo. Es peor que el primero en los dos frentes: 79θ2>12θ2\tfrac79\theta^2 > \tfrac12\theta^2.

Tercero, θ^3=Xˉ\hat{\theta}_3 = \bar{X}:

E(Xˉ)=θ,ECM(Xˉ)=V(Xˉ)=θ2nE(\bar{X}) = \theta, \qquad \text{ECM}(\bar{X}) = V(\bar{X}) = \frac{\theta^2}{n}

Para n3n\geq 3 este es el mejor de los tres, y la ventaja crece con nn. La razón es transparente: θ^1\hat\theta_1 descarta n2n-2 observaciones, y por eso su precisión no mejora aunque la muestra crezca. Usar todos los datos no es una preferencia estética; se traduce en un ECM menor.


16. Consistencia

Un requisito mínimo razonable para un estimador es que mejore al acumular datos: que con muestras cada vez más grandes se acerque al parámetro. Eso es la consistencia, y admite dos formulaciones de distinta fuerza.

Consistencia en probabilidad (débil)

θ^n es consistente    limnP ⁣(θ^nθ<ε)=1ε>0\hat{\theta}_n \text{ es consistente} \iff \lim_{n\to\infty} P\!\left(|\hat{\theta}_n-\theta| < \varepsilon\right) = 1 \qquad \forall\,\varepsilon>0

Fijada una tolerancia ε\varepsilon tan chica como se quiera, la probabilidad de caer dentro de ella tiende a 1. La distribución del estimador se concentra alrededor de θ\theta.

Consistencia en media cuadrática (fuerte)

θ^n es CMC    limnECM(θ^n)=0\hat{\theta}_n \text{ es CMC} \iff \lim_{n\to\infty}\text{ECM}(\hat{\theta}_n) = 0

Es una condición más exigente, y la implicación es CMC \Rightarrow consistencia en probabilidad —se prueba con la desigualdad de Chebyshev, que acota la probabilidad de desviarse mucho en términos del error cuadrático medio. La recíproca no vale.

La ventaja práctica de la versión fuerte es que se verifica fácilmente. Como ECM=V+B2\text{ECM} = V + B^2 y ambos términos son no negativos, que el ECM tienda a cero equivale a que los dos tiendan a cero por separado. De modo que alcanza con comprobar:

  1. que el estimador sea insesgado, o al menos asintóticamente insesgado (B0B\to 0);
  2. que su varianza tienda a cero.

Dos ejemplos que contrastan

El caso favorable: θ^=Xˉ\hat{\theta} = \bar{X} como estimador de μ\mu.

E(Xˉ)=μ  B=0V(Xˉ)=σ2n0E(\bar{X}) = \mu \ \Rightarrow\ B = 0 \qquad\qquad V(\bar{X}) = \frac{\sigma^2}{n} \longrightarrow 0

Ambas condiciones se cumplen, de modo que Xˉ\bar{X} es CMC y, por lo tanto, consistente en probabilidad. Es el resultado que legitima usar la media muestral: al crecer la muestra, converge a la media poblacional.

El caso desfavorable: θ^=12(X1+Xn)\hat{\theta} = \tfrac{1}{2}(X_1+X_n) con XN(μ,σ2)X\sim N(\mu,\sigma^2), el estimador que solo mira dos observaciones.

E(θ^)=μ  B=0V(θ^)=14σ2+14σ2=σ22E(\hat{\theta}) = \mu \ \Rightarrow\ B = 0 \qquad\qquad V(\hat{\theta}) = \tfrac{1}{4}\sigma^2+\tfrac{1}{4}\sigma^2 = \frac{\sigma^2}{2}

Es insesgado, pero su varianza no depende de nn y por lo tanto no tiende a cero. No es CMC.

Queda por ver si es consistente en probabilidad, ya que la implicación no vale al revés. Como cada XiX_i es normal, θ^N(μ; σ/2)\hat\theta \sim N(\mu;\ \sigma/\sqrt{2}), y esa distribución es la misma para todo nn. Entonces

limnP ⁣(θ^θ<ε)=P ⁣(Z<ε2σ)=A<1\lim_{n\to\infty} P\!\left(|\hat{\theta}-\theta|<\varepsilon\right) = P\!\left(|Z| < \frac{\varepsilon\sqrt{2}}{\sigma}\right) = A < 1

El área AA es un número fijo, menor que 1, que no depende de nn: el límite no puede llegar a 1. Tampoco es consistente en probabilidad.

El diagnóstico es el mismo que en §15. Un estimador que ignora la mayor parte de la muestra no puede mejorar cuando la muestra crece, porque no la está mirando. La consistencia formaliza esa intuición.


17. Suficiencia

Las propiedades anteriores juzgan a un estimador por su desempeño. La suficiencia plantea una pregunta distinta y previa: ¿cuánta de la información de la muestra hace falta retener?

Una muestra de tamaño 100 son 100 números. Si para estimar θ\theta alcanza con conocer su suma, entonces los 100 números pueden reducirse a uno solo sin perder nada relevante. Un estadístico con esa propiedad se llama suficiente.

Definición

T(X1,,Xn)T(X_1,\ldots,X_n) es estadístico suficiente para θ\theta si la distribución conjunta de la muestra, condicionada a T=tT=t, no depende de θ\theta.

Vale la pena traducir la definición, porque es la parte que suele quedar oscura. Condicionar a T=tT=t es preguntarse qué queda por saber una vez conocido el valor de TT. Si en ese resto ya no aparece θ\theta, entonces el resto no dice nada sobre θ\theta: toda la información sobre el parámetro quedó capturada por TT. Conocer los datos individuales, más allá de TT, es indistinguible de haber sorteado valores al azar con una regla que no involucra a θ\theta.

La función de verosimilitud

La herramienta para trabajar con esto es la verosimilitud, que reaparecerá en §19:

L(θ;x)=i=1nf(xi;θ)oi=1np(xi;θ)L(\theta;\,\mathbf{x}) = \prod_{i=1}^n f(x_i;\,\theta) \qquad\text{o}\qquad \prod_{i=1}^n p(x_i;\,\theta)

Es la densidad (o probabilidad) conjunta de la muestra, pero mirada como función de θ\theta con los datos fijos: cuán verosímil es cada valor del parámetro a la luz de lo que efectivamente ocurrió. La notación L(θ)L(\theta) omite los datos por comodidad, entendiendo que están fijos en los valores observados.

El teorema de factorización de Neyman

Verificar la definición directamente exigiría calcular una distribución condicional, lo cual es engorroso. El teorema de factorización lo reduce a mirar la forma de LL:

TT es suficiente para θ\theta si y solo si la verosimilitud se factoriza como L(x;θ)=h(T(x),θ)g(x)L(\mathbf{x};\,\theta) = h\big(T(\mathbf{x}),\,\theta\big)\cdot g(\mathbf{x}) donde hh depende de los datos solo a través de TT, y gg no depende de θ\theta.

En la práctica el procedimiento es mecánico: se escribe la productoria, se agrupa todo lo que contenga a θ\theta y se observa por qué combinación de los datos entra. Esa combinación es el estadístico suficiente.

Ejemplo 1 — Gamma, estimando θ\theta con α\alpha conocido.

L(x;θ)=i=1nxiα1exi/θΓ(α)θα=[1Γ(α)θα]ne1θxih(T,θ)(xi)α1g(x)L(\mathbf{x};\theta) = \prod_{i=1}^n \frac{x_i^{\alpha-1}e^{-x_i/\theta}}{\Gamma(\alpha)\theta^\alpha} = \underbrace{\left[\frac{1}{\Gamma(\alpha)\theta^\alpha}\right]^n e^{-\frac{1}{\theta}\sum x_i}}_{h(T,\theta)}\cdot\underbrace{\left(\prod x_i\right)^{\alpha-1}}_{g(\mathbf{x})}

El parámetro θ\theta entra en el exponente únicamente a través de xi\sum x_i. Por lo tanto T=XiT = \sum X_i es suficiente para θ\theta.

Ejemplo 2 — la misma Gamma, pero estimando α\alpha con θ\theta conocido. La factorización se reagrupa distinto:

L(x;α)=[Γ(α)θα]n(xi)α1h(T,α)exi/θg(x)L(\mathbf{x};\alpha) = \underbrace{\left[\Gamma(\alpha)\theta^\alpha\right]^{-n}\left(\prod x_i\right)^{\alpha-1}}_{h(T,\alpha)}\cdot\underbrace{e^{-\sum x_i/\theta}}_{g(\mathbf{x})}

Ahora α\alpha acompaña a xi\prod x_i, de modo que T=XiT = \prod X_i es suficiente para α\alpha. La comparación entre los dos ejemplos es instructiva: la suficiencia es relativa al parámetro que se estima, no una propiedad absoluta del estadístico. La misma distribución tiene un estadístico suficiente distinto para cada parámetro.

Ejemplo 3 — Poisson.

L(λ;x)=eλλxixi!=enλλxih(T,λ)1xi!g(x)L(\lambda;\mathbf{x}) = \prod \frac{e^{-\lambda}\lambda^{x_i}}{x_i!} = \underbrace{e^{-n\lambda}\lambda^{\sum x_i}}_{h(T,\lambda)}\cdot\underbrace{\frac{1}{\prod x_i!}}_{g(\mathbf{x})}

de donde T=XiT = \sum X_i es suficiente para λ\lambda: sumar todos los datos conserva toda la información disponible sobre λ\lambda. Como Xˉ=T/n\bar{X} = T/n es una función biunívoca de TT, también Xˉ\bar{X} es suficiente —cualquier transformación invertible de un estadístico suficiente lo es.

Ejemplo 4 — Geométrica, P(X=k)=(1p)k1pP(X=k) = (1-p)^{k-1}p:

L(p;x)=(1p)xi1p=pn(1p)xinh(T,p)1g(x)L(p;\mathbf{x}) = \prod (1-p)^{x_i-1}p = \underbrace{p^n(1-p)^{\sum x_i-n}}_{h(T,p)}\cdot\underbrace{1}_{g(\mathbf{x})}

y otra vez T=XiT=\sum X_i es suficiente. Aquí gg es constante, lo cual es perfectamente admisible.


18. Eficiencia y la cota de Cramér–Rao

Entre los estimadores insesgados, el criterio de comparación es la varianza: gana el menos disperso.

Eficiencia relativa

Para dos estimadores insesgados del mismo parámetro,

ef(θ^1,θ^2)=V(θ^2)V(θ^1)\text{ef}(\hat{\theta}_1,\hat{\theta}_2) = \frac{V(\hat{\theta}_2)}{V(\hat{\theta}_1)}

Un valor mayor que 1 indica que θ^1\hat\theta_1 es más eficiente. Es una comparación entre dos candidatos concretos y no dice nada sobre si alguno es el mejor posible.

Un estimador insesgado de varianza mínima (EIVM) es aquel que ningún otro estimador insesgado supera en varianza. Para identificarlo haría falta comparar contra todos los estimadores insesgados imaginables, cosa impracticable —salvo que exista una cota inferior conocida.

La cota de Cramér–Rao

Bajo tres condiciones de regularidad —que θ^\hat\theta sea insesgado, que el soporte de la distribución no dependa de θ\theta y que la densidad sea diferenciable respecto de θ\theta—, la varianza de cualquier estimador insesgado satisface

V(θ^)  1nE ⁣[(θlnf(x;θ))2]\boxed{V(\hat{\theta}) \ \geq\ \frac{1}{n\cdot E\!\left[\left(\dfrac{\partial}{\partial\theta}\ln f(x;\theta)\right)^2\right]}}

El denominador, I(θ)=E[(θlnf)2]I(\theta) = E\left[\left(\partial_\theta \ln f\right)^2\right], se llama información de Fisher y mide cuán sensible es la verosimilitud a cambios en θ\theta: si mover θ\theta apenas altera la densidad, los datos informan poco sobre él y la cota es alta.

La cota resuelve el problema práctico: si un estimador insesgado alcanza esa varianza, es necesariamente el EIVM, porque nada puede estar por debajo de la cota. Ya no hace falta compararlo con los demás.

La condición sobre el soporte no es un tecnicismo ocioso. Excluye casos como la uniforme en [0,θ][0,\theta], donde el rango de valores posibles depende del parámetro; ahí la cota no se aplica, y de hecho existen estimadores que la violarían.

Ejemplo — Poisson. Sea p(x;λ)=eλλx/x!p(x;\lambda) = e^{-\lambda}\lambda^x/x! y considérese λ^=Xˉ\hat\lambda = \bar{X}.

Primero se calcula la derivada del logaritmo:

lnp(x;λ)=λ+xlnλln(x!)λlnp=1+xλ\ln p(x;\lambda) = -\lambda + x\ln\lambda - \ln(x!) \qquad\Longrightarrow\qquad \frac{\partial}{\partial\lambda}\ln p = -1+\frac{x}{\lambda}

Luego su segundo momento, usando E(X)=λE(X)=\lambda y E(X2)=λ+λ2E(X^2)=\lambda+\lambda^2:

E ⁣[(1+Xλ)2]=12E(X)λ+E(X2)λ2=12+λ+λ2λ2=1λE\!\left[\left(-1+\frac{X}{\lambda}\right)^2\right] = 1 - \frac{2E(X)}{\lambda} + \frac{E(X^2)}{\lambda^2} = 1-2+\frac{\lambda+\lambda^2}{\lambda^2} = \frac{1}{\lambda}

de donde la cota vale

1n(1/λ)=λn\frac{1}{n\cdot(1/\lambda)} = \frac{\lambda}{n}

Y como en la Poisson V(X)=λV(X)=\lambda, la varianza de la media muestral es V(Xˉ)=λ/nV(\bar{X}) = \lambda/n, que coincide exactamente con la cota. Por lo tanto Xˉ\bar{X} es el estimador insesgado de varianza mínima de λ\lambda: ningún otro estimador insesgado puede hacerlo mejor.


19. Estimadores de máxima verosimilitud

Las secciones anteriores enseñan a juzgar estimadores, no a producirlos. El método de máxima verosimilitud es el procedimiento general para construirlos, y es el más usado en toda la estadística.

El principio

La idea es elegir el valor del parámetro que hace más probable lo que efectivamente se observó. Si una muestra particular sería muy improbable bajo θ=3\theta = 3 y bastante probable bajo θ=7\theta = 7, el método prefiere 7.

Formalmente, se maximiza la verosimilitud:

L(θ;x)=i=1nf(xi;θ)θ^MV=argmaxθL(θ;x)L(\theta;\mathbf{x}) = \prod_{i=1}^n f(x_i;\theta) \qquad\Longrightarrow\qquad \hat{\theta}_{\text{MV}} = \arg\max_\theta L(\theta;\mathbf{x})

La técnica

Maximizar una productoria es incómodo. Como el logaritmo es estrictamente creciente, maximizar lnL\ln L da el mismo argumento máximo, con la ventaja de que convierte productos en sumas:

lnL(θ;x)=i=1nlnf(xi;θ)θlnL(θ;x)=0\ln L(\theta;\mathbf{x}) = \sum_{i=1}^n \ln f(x_i;\theta) \qquad\Longrightarrow\qquad \frac{\partial}{\partial\theta}\ln L(\theta;\mathbf{x}) = 0

Esta ecuación se llama ecuación de verosimilitud. En rigor habría que verificar con la segunda derivada que el punto crítico es un máximo; en los casos del curso lo es.

Dos propiedades

Invarianza. Si θ^\hat\theta es el estimador de máxima verosimilitud de θ\theta, entonces ψ(θ^)\psi(\hat\theta) lo es de ψ(θ)\psi(\theta), para cualquier función ψ\psi. Es una comodidad considerable: obtenido σ^2\hat\sigma^2, el estimador de σ\sigma es simplemente σ^2\sqrt{\hat\sigma^2}, sin necesidad de rehacer la maximización. Esta propiedad no la comparten otros métodos —el insesgamiento, por ejemplo, no se conserva bajo transformaciones no lineales.

No necesariamente insesgado. El método optimiza verosimilitud, no centrado. El ejemplo 4 de abajo muestra un caso concreto en que el estimador resultante tiene sesgo.

Ejemplos

1. Poisson. p(x;λ)=eλλx/x!p(x;\lambda) = e^{-\lambda}\lambda^x/x!

L(λ;x)=enλλxi1xi!lnL=nλ+(xi)lnλln(xi!)L(\lambda;\mathbf{x}) = e^{-n\lambda}\lambda^{\sum x_i}\prod\frac{1}{x_i!} \qquad\Longrightarrow\qquad \ln L = -n\lambda + \left(\sum x_i\right)\ln\lambda - \sum\ln(x_i!) lnLλ=n+xiλ=0λ^MV=Xˉ\frac{\partial \ln L}{\partial\lambda} = -n+\frac{\sum x_i}{\lambda} = 0 \qquad\Longrightarrow\qquad \boxed{\hat{\lambda}_{\text{MV}} = \bar{X}}

2. Normal, estimando μ\mu con σ2\sigma^2 conocido.

lnL=nln(σ2π)12σ2(xiμ)2\ln L = -n\ln(\sigma\sqrt{2\pi}) - \frac{1}{2\sigma^2}\sum(x_i-\mu)^2 lnLμ=1σ2(xiμ)=0μ^MV=Xˉ\frac{\partial\ln L}{\partial\mu} = \frac{1}{\sigma^2}\sum(x_i-\mu) = 0 \qquad\Longrightarrow\qquad \boxed{\hat{\mu}_{\text{MV}} = \bar{X}}

Maximizar la verosimilitud equivale aquí a minimizar (xiμ)2\sum(x_i-\mu)^2, porque ese término entra restando. Esa conexión entre verosimilitud normal y mínimos cuadrados reaparece en la regresión (§47).

3. Normal, estimando σ2\sigma^2 con μ\mu conocido. Tratando σ2\sigma^2 como la variable:

lnL=n2ln(σ2)n2ln(2π)12σ2(xiμ)2\ln L = -\frac{n}{2}\ln(\sigma^2)-\frac{n}{2}\ln(2\pi)-\frac{1}{2\sigma^2}\sum(x_i-\mu)^2 lnLσ2=n2σ2+(xiμ)22(σ2)2=0σ^MV2=1n(xiμ)2=Sn2\frac{\partial\ln L}{\partial\sigma^2} = -\frac{n}{2\sigma^2}+\frac{\sum(x_i-\mu)^2}{2(\sigma^2)^2} = 0 \qquad\Longrightarrow\qquad \boxed{\hat{\sigma}^2_{\text{MV}} = \frac{1}{n}\sum(x_i-\mu)^2 = S_n^{*2}}

Es la varianza centrada en μ\mu de §10, que allí resultó insesgada.

4. Normal, estimando σ2\sigma^2 con μ\mu también desconocido. Ahora hay que maximizar en los dos parámetros a la vez. La ecuación para μ\mu da μ^=Xˉ\hat\mu = \bar{X} como en el ejemplo 2, y sustituyéndolo en la ecuación para σ2\sigma^2:

σ^MV2=1n(xixˉ)2=Sn2\hat{\sigma}^2_{\text{MV}} = \frac{1}{n}\sum(x_i-\bar{x})^2 = S_n^2

que es la varianza sesgada:

B(σ^MV2)=n1nσ2σ2=σ2n0B(\hat{\sigma}^2_{\text{MV}}) = \frac{n-1}{n}\sigma^2-\sigma^2 = -\frac{\sigma^2}{n} \neq 0

El contraste entre los ejemplos 3 y 4 es exactamente el de §10: con μ\mu conocido no se paga nada, con μ\mu estimado se paga un grado de libertad. El método de máxima verosimilitud no lo corrige por su cuenta.

5. Gamma, estimando θ\theta con α\alpha conocido.

lnL=nαlnθnlnΓ(α)+(α1)lnxixiθ\ln L = -n\alpha\ln\theta - n\ln\Gamma(\alpha)+(\alpha-1)\sum\ln x_i - \frac{\sum x_i}{\theta} lnLθ=nαθ+xiθ2=0θ^MV=Xˉα\frac{\partial\ln L}{\partial\theta} = -\frac{n\alpha}{\theta}+\frac{\sum x_i}{\theta^2} = 0 \qquad\Longrightarrow\qquad \boxed{\hat{\theta}_{\text{MV}} = \frac{\bar{X}}{\alpha}}

Es coherente con E(X)=αθE(X)=\alpha\theta: se despeja θ\theta igualando la media teórica a la muestral.

6. Uniforme en [0,θ][0,\theta] — el caso en que no se deriva. La densidad es 1/θ1/\theta dentro del intervalo y cero fuera, de modo que

L(θ;x)={(1/θ)nsi θmax{xi}0si θ<max{xi}L(\theta;\mathbf{x}) = \begin{cases} (1/\theta)^n & \text{si } \theta \geq \max\{x_i\} \\[2pt] 0 & \text{si } \theta < \max\{x_i\}\end{cases}

Aquí derivar no sirve: la función es discontinua en max{xi}\max\{x_i\} y no tiene puntos críticos interiores. Hay que razonar sobre su forma. Para θ\theta menor que el máximo observado la verosimilitud es cero —ningún θ\theta puede ser menor que un dato observado—; y a partir de ahí 1/θn1/\theta^n es decreciente. El máximo está entonces en el borde:

θ^MV=max{Xi}\boxed{\hat{\theta}_{\text{MV}} = \max\{X_i\}}

Es el ejemplo que muestra por qué la ecuación de verosimilitud es un atajo y no la definición del método. Cuando el soporte depende del parámetro —la misma condición que invalida la cota de Cramér–Rao en §18— hay que volver al principio y buscar el máximo directamente.


20. El método de los momentos

Es el método alternativo de construcción de estimadores, anterior al de máxima verosimilitud y considerablemente más simple.

El principio

Los momentos poblacionales son funciones de los parámetros: E(X)=μE(X) = \mu, E(X2)=σ2+μ2E(X^2) = \sigma^2+\mu^2, y así siguiendo. Los momentos muestrales son cantidades calculables:

m^k=1ni=1nXik\hat{m}_k = \frac{1}{n}\sum_{i=1}^n X_i^k

El método consiste en igualar unos con otros y despejar. Si hay un parámetro se usa una ecuación, si hay dos se usan dos:

E(Xk)=m^kE(X^k) = \hat{m}_k

Se empieza siempre por el momento de menor orden, y se sube solo si hace falta. El caso típico en que hay que subir es el de las distribuciones simétricas alrededor de cero: ahí E(X)=0E(X)=0 cualquiera sea el parámetro, la primera ecuación no contiene información y hay que ir al segundo momento.

Ejemplos

1. Uniforme en [0,α][0,\alpha]. Con E(X)=α/2E(X)=\alpha/2:

Xˉ=α2α^=2Xˉ\bar{X} = \frac{\alpha}{2} \qquad\Longrightarrow\qquad \boxed{\hat{\alpha} = 2\bar{X}}

Comparado con el estimador de máxima verosimilitud del ejemplo 6 anterior, α^MV=max{Xi}\hat\alpha_{\text{MV}} = \max\{X_i\}, se ve que los dos métodos pueden dar respuestas bien distintas. El de momentos es insesgado pero puede producir valores absurdos —si algún dato supera a 2Xˉ2\bar{X}, el estimador es incompatible con los propios datos—; el de máxima verosimilitud nunca es incompatible pero subestima sistemáticamente, porque el máximo muestral siempre queda por debajo del máximo poblacional.

2. Normal, estimando μ\mu y σ2\sigma^2. Con dos parámetros hacen falta dos ecuaciones.

k=1:E(X)=μ  μ^=Xˉk=1:\quad E(X)=\mu \ \Longrightarrow\ \hat{\mu} = \bar{X} k=2:E(X2)=σ2+μ2  1nXi2=σ^2+Xˉ2k=2:\quad E(X^2) = \sigma^2+\mu^2 \ \Longrightarrow\ \frac{1}{n}\sum X_i^2 = \hat{\sigma}^2+\bar{X}^2 σ^2=1nXi2Xˉ2=1n(XiXˉ)2=Sn2\hat{\sigma}^2 = \frac{1}{n}\sum X_i^2-\bar{X}^2 = \frac{1}{n}\sum(X_i-\bar{X})^2 = S_n^2

Coincide con el estimador de máxima verosimilitud del ejemplo 4, y hereda su sesgo.

3. Una densidad polinómica. Sea f(x;θ)=3x2θ3f(x;\theta) = \dfrac{3x^2}{\theta^3} en 0<x<θ0<x<\theta.

E(X)=0θx3x2θ3dx=3θ3θ44=3θ4θ^=4Xˉ3E(X) = \int_0^\theta x\cdot\frac{3x^2}{\theta^3}\,dx = \frac{3}{\theta^3}\cdot\frac{\theta^4}{4} = \frac{3\theta}{4} \qquad\Longrightarrow\qquad \boxed{\hat{\theta} = \frac{4\bar{X}}{3}}

4. Un caso simétrico, donde hay que subir de momento. Sea f(x;k)=34k3(k2x2)f(x;k) = \dfrac{3}{4k^3}(k^2-x^2) en k<x<k-k<x<k.

La densidad es par, de modo que E(X)=0E(X)=0 independientemente de kk: el primer momento no sirve. Se pasa al segundo:

E(X2)=kkx23(k2x2)4k3dx=34k3[k2x33x55]kk=34k34k515=k25E(X^2) = \int_{-k}^{k} x^2\cdot\frac{3(k^2-x^2)}{4k^3}\,dx = \frac{3}{4k^3}\left[\frac{k^2x^3}{3}-\frac{x^5}{5}\right]_{-k}^{k} = \frac{3}{4k^3}\cdot\frac{4k^5}{15} = \frac{k^2}{5} 1nXi2=k25k^=5nXi2\frac{1}{n}\sum X_i^2 = \frac{k^2}{5} \qquad\Longrightarrow\qquad \boxed{\hat{k} = \sqrt{\frac{5}{n}\sum X_i^2}}

Comparación entre los dos métodos

El método de los momentos es más simple —solo requiere integrar o sumar— pero suele producir estimadores menos eficientes, y en algunos casos francamente malos, como se vio en el ejemplo 1. El de máxima verosimilitud es computacionalmente más exigente pero tiene mejores propiedades asintóticas y la ventaja de la invarianza. Cuando ambos coinciden, como en el ejemplo 2, no hay nada que decidir.


Parte IV · Intervalos de confianza


21. Qué es un intervalo de confianza

Un estimador puntual entrega un número: Xˉ=36\bar{X}=36. Lo que no entrega es una medida de cuánto puede errar ese número. El intervalo de confianza agrega esa información, sustituyendo la afirmación puntual por un rango: "μ\mu está entre 33,2 y 38,8, con 98% de confianza".

Qué significa el nivel de confianza

El nivel de confianza NC=1αNC = 1-\alpha no es la probabilidad de que μ\mu pertenezca a ese intervalo concreto. Esa lectura, aunque tentadora, es incorrecta y vale la pena entender por qué.

μ\mu es un número fijo y desconocido, no una variable aleatoria: o está dentro del intervalo o no está, y no hay probabilidad involucrada en eso. Lo aleatorio es el intervalo, porque sus extremos se calculan a partir de la muestra, que sí es azarosa. Otra muestra daría otro intervalo.

La interpretación correcta es entonces frecuentista y se refiere al procedimiento, no al resultado: si se repitiera el muestreo indefinidamente y se construyera un intervalo cada vez, el 98% de esos intervalos contendría a μ\mu. Lo que tiene un 98% de probabilidad es el método, no este intervalo.

μ (fijo, desconocido)20 de 22 contienen a μ2 no lo contienen
Lo aleatorio es el intervalo, no μ. «95% de confianza» describe al procedimiento —qué proporción de intervalos atrapa a μ si se repite el muestreo—, no a este intervalo en particular.

La estructura común

Casi todos los intervalos del curso tienen la misma forma:

estimador puntualel centro ± cuantilZ o t × error estaˊndardesvıˊo del estimadorME = margen de error\underbrace{\text{estimador puntual}}_{\text{el centro}} \ \pm\ \underbrace{\underbrace{\text{cuantil}}_{Z \text{ o } t}\ \times\ \underbrace{\text{error estándar}}_{\text{desvío del estimador}}}_{ME \ = \ \text{margen de error}}

El estimador aporta la posición; el error estándar, la escala de la incertidumbre; el cuantil, cuánta de esa incertidumbre se decide cubrir.

Hay dos excepciones, y las dos por el mismo motivo. Los intervalos para σ2\sigma^2 y para σ12/σ22\sigma_1^2/\sigma_2^2 se apoyan en la χ2\chi^2 y la FF, que no son simétricas. Esos intervalos no se construyen sumando y restando sino dividiendo, y quedan asimétricos alrededor del estimador (§28 y §29).

De qué depende el margen de error

Si aumenta…el MEMEporque
el nivel de confianzaaumentacubrir más casos exige más ancho
el tamaño de muestra nndisminuyeel error estándar va con 1/n1/\sqrt{n}
la variabilidad de la poblaciónaumentamás ruido, menos precisión

De la segunda fila se desprende la relación que gobierna toda la planificación muestral: como ME1/nME \propto 1/\sqrt{n}, para reducir el margen a la mitad hay que cuadruplicar la muestra. La precisión tiene costo creciente.

Cómo se lee la conclusión

Cuando el intervalo es de una diferenciaμ1μ2\mu_1-\mu_2, p1p2p_1-p_2, μD\mu_D— el valor de referencia es el cero:

  • si el cero está dentro, la diferencia podría ser nula: no hay evidencia de diferencia;
  • si todo el intervalo es positivo, el primer parámetro es mayor; si todo es negativo, el segundo.

Cuando es de un cocienteσ12/σ22\sigma_1^2/\sigma_2^2— el valor de referencia es el uno, con la misma lógica: si el uno está dentro, los dos parámetros podrían ser iguales; si el intervalo entero queda a la derecha del uno, el numerador es el mayor.

Antes de dar por buena una conclusión conviene contrastarla con los datos muestrales, que apuntan en alguna dirección. Si S12=114S_1^2 = 114 y S22=16S_2^2 = 16, ninguna conclusión que afirme σ22>σ12\sigma_2^2 > \sigma_1^2 puede ser correcta: la muestra dice exactamente lo contrario. Este control elemental detecta la mayoría de los errores de despeje y de lectura de tablas.


22. Intervalo para la media

El caso básico

Del cuadro de §14, XˉN(μ, σ2/n)\bar{X}\sim N(\mu,\ \sigma^2/n) —exactamente si la población es normal, aproximadamente si n30n\geq 30. Estandarizando y despejando μ\mu del centro de la desigualdad P(Zα/2<Xˉμσ/n<Zα/2)=1αP(-Z_{\alpha/2} < \frac{\bar X - \mu}{\sigma/\sqrt n} < Z_{\alpha/2}) = 1-\alpha:

int/μ = Xˉ±Zα/2σn\text{int}/\mu \ = \ \bar{X} \pm Z_{\alpha/2}\,\frac{\sigma}{\sqrt{n}}

Esta fórmula supone σ\sigma conocido, que es la situación menos frecuente.

Cuando σ\sigma es desconocido

Se lo reemplaza por SS, y por lo visto en §12 el pivote deja de ser normal y pasa a ser una tt:

int/μ = Xˉ±tα/2;n1Sn\text{int}/\mu \ = \ \bar{X} \pm t_{\alpha/2;\,n-1}\,\frac{S}{\sqrt{n}}

Como tα/2;n1>Zα/2t_{\alpha/2;n-1} > Z_{\alpha/2}, el intervalo resulta más ancho. La pérdida de precisión es el costo de haber tenido que estimar también la dispersión.

El criterio para elegir entre uno y otro:

  • ZZ si σ\sigma es conocido, o si nn es grande (donde la tt ya es prácticamente normal);
  • tt si σ\sigma es desconocido y la población es normal, cualquiera sea nn.

Un ejemplo con sus variantes

Sea una muestra con Xˉ=980\bar{X}=980 y n=100n=100, al 95% de confianza.

(a) Con σ=150\sigma = 150 conocido y población infinita:

980±1,96150100=980±29,4=(950,6; 1.009,4)980 \pm 1{,}96\cdot\frac{150}{\sqrt{100}} = 980\pm 29{,}4 = (950{,}6\,;\ 1.009{,}4)

(b) Con σ\sigma desconocido, estimado por S=120S=120:

980±t0,025;99120100=980±1,984212=980±23,81980 \pm t_{0,025;\,99}\cdot\frac{120}{\sqrt{100}} = 980 \pm 1{,}9842\cdot 12 = 980\pm 23{,}81

Con 99 grados de libertad el cuantil tt es 1,9842 contra 1,96 de la normal: la diferencia es mínima, como anticipaba el cuadro de §12.

(c) Con población finita de N=1.500N = 1.500 (ver §27):

980±1,9842121.5001001.499=980±23,01980 \pm 1{,}9842\cdot 12\cdot\sqrt{\frac{1.500-100}{1.499}} = 980\pm 23{,}01

(d) Como cota inferior al 95%, repartiendo todo el α\alpha de un solo lado (ver §31):

980t0,05;9912=9801,660412=960,08980 - t_{0,05;\,99}\cdot 12 = 980 - 1{,}6604\cdot 12 = 960{,}08

(e) Con n=16n=16, población normal y σ=120\sigma=120 conocido:

980±1,9612016=980±58,8980\pm 1{,}96\cdot\frac{120}{\sqrt{16}} = 980\pm 58{,}8

Se usa ZZ pese a que n<30n<30, porque σ\sigma es conocido y la población normal.

(f) Con n=16n=16 y S=120S=120:

980±t0,025;1530=980±2,131430=980±63,94980 \pm t_{0,025;\,15}\cdot 30 = 980\pm 2{,}1314\cdot 30 = 980\pm 63{,}94

Comparando (e) con (f) se aísla el efecto de desconocer σ\sigma: el intervalo pasa de ±58,8\pm 58{,}8 a ±63,9\pm 63{,}9, casi un 9% más ancho. Comparando (b) con (f) se aísla el efecto del tamaño: con n=100n=100 el margen es 23,8 y con n=16n=16 es 63,9, en una relación cercana a 100/16=2,5\sqrt{100/16} = 2{,}5.


23. Intervalo para una proporción

Por lo visto en §9, con nn grande

p^  N ⁣(p; p(1p)n)\hat{p} \ \approx\ N\!\left(p;\ \sqrt{\frac{p(1-p)}{n}}\right)

Hay una dificultad menor: el error estándar depende de pp, que es justamente lo que se quiere estimar. La solución habitual es reemplazarlo por p^\hat{p} dentro de la raíz:

int/p = p^±Zα/2p^(1p^)n\text{int}/p \ = \ \hat{p} \pm Z_{\alpha/2}\sqrt{\frac{\hat{p}(1-\hat{p})}{n}}

Siempre se usa ZZ, nunca tt. La razón es la peculiaridad señalada en §9: la tt aparece cuando hay que estimar una varianza aparte de la media, lo que introduce una segunda fuente de azar. En una proporción no hay dos parámetros —la varianza pq/npq/n está determinada por el mismo pp— y por lo tanto no hay una segunda estimación que compensar.

Ejemplo. Con n=400n=400 y p^=7%\hat{p} = 7\%, al 95%:

0,07±1,960,070,93400=0,07±0,025=(4,5%; 9,5%)0{,}07 \pm 1{,}96\sqrt{\frac{0{,}07\cdot 0{,}93}{400}} = 0{,}07\pm 0{,}025 = (4{,}5\%\,;\ 9{,}5\%)

Determinación del tamaño de muestra

En proporciones el cálculo de nn tiene una particularidad útil. Partiendo de ME=Zα/2p(1p)/nME = Z_{\alpha/2}\sqrt{p(1-p)/n} y despejando,

n=(Zα/2ME)2p(1p)n = \left(\frac{Z_{\alpha/2}}{ME}\right)^2 p(1-p)

El problema es que nn depende de pp, desconocido antes de muestrear. La salida es tomar el peor caso: la función p(1p)p(1-p) alcanza su máximo en p=0,5p=0{,}5, donde vale 0,250{,}25. Usando ese valor se obtiene el nn más grande que podría hacer falta, y por lo tanto el margen queda garantizado sea cual sea el pp verdadero.

Ejemplo. Para un margen de error de 1% con 90% de confianza:

n=(1,6450,01)20,25=6.766n = \left(\frac{1{,}645}{0{,}01}\right)^2\cdot 0{,}25 = 6.766

El resultado se redondea siempre hacia arriba: un nn fraccionario no existe, y redondear hacia abajo dejaría el margen por encima del pedido.


24. Intervalo para la diferencia de medias

Comparar dos poblaciones es el problema aplicado más frecuente: dos sucursales, dos tratamientos, dos períodos. La construcción parte de que la diferencia de medias muestrales es ella misma una variable aleatoria, con distribución conocida.

Si las dos poblaciones son normales (o las muestras son grandes) y las muestras son independientes:

(Xˉ1Xˉ2)N ⁣(μ1μ2 ; σ12n1+σ22n2)(\bar{X}_1-\bar{X}_2) \sim N\!\left(\mu_1-\mu_2\ ;\ \sqrt{\frac{\sigma_1^2}{n_1}+\frac{\sigma_2^2}{n_2}}\right)

Las varianzas se suman aunque las medias se resten, por lo visto en §2: la constante 1-1 entra al cuadrado. Es un punto que conviene tener firme, porque la intuición sugiere lo contrario.

De ahí sale un esqueleto único:

(Xˉ1Xˉ2) ± (cuantil)×(error estaˊndar)(\bar{X}_1-\bar{X}_2) \ \pm\ (\text{cuantil}) \times (\text{error estándar})

y los tres casos que siguen no son tres fórmulas distintas sino tres maneras de completar ese esqueleto, según qué se sepa de σ1\sigma_1 y σ2\sigma_2.

Caso 1 — varianzas conocidas, o muestras grandes

int/μ1μ2 = (Xˉ1Xˉ2)±Zα/2σ12n1+σ22n2\text{int}/\mu_1-\mu_2 \ = \ (\bar{X}_1-\bar{X}_2) \pm Z_{\alpha/2}\sqrt{\frac{\sigma_1^2}{n_1}+\frac{\sigma_2^2}{n_2}}

Si las varianzas son desconocidas pero n1n_1 y n2n_2 son grandes, se reemplazan por S12S_1^2 y S22S_2^2 y se sigue usando ZZ.

Caso 2 — varianzas desconocidas pero iguales

Cuando se puede sostener que σ1=σ2\sigma_1 = \sigma_2, hay una sola varianza poblacional y conviene estimarla con las dos muestras juntas. Esa es la varianza ponderada o pooled:

Sp2=(n11)S12+(n21)S22n1+n22S_p^2 = \frac{(n_1-1)S_1^2+(n_2-1)S_2^2}{n_1+n_2-2}

Es un promedio de S12S_1^2 y S22S_2^2 pesado por los grados de libertad, de modo que la muestra más grande influye más. De ahí se sigue una comprobación inmediata: Sp2S_p^2 tiene que quedar entre S12S_1^2 y S22S_2^2, más cerca del correspondiente a la muestra mayor.

int/μ1μ2 = (Xˉ1Xˉ2)±tα/2;n1+n22 Sp1n1+1n2\text{int}/\mu_1-\mu_2 \ = \ (\bar{X}_1-\bar{X}_2) \pm t_{\alpha/2;\,n_1+n_2-2}\ S_p\sqrt{\frac{1}{n_1}+\frac{1}{n_2}}

Los grados de libertad son n1+n22n_1+n_2-2: se pierde uno por cada media estimada.

Caso 3 — varianzas desconocidas y distintas

Sin el supuesto de igualdad no se pueden juntar las muestras, y aparece un problema técnico: la suma de dos χ2\chi^2 de escalas distintas ya no es una χ2\chi^2, de modo que no hay una cantidad exacta de grados de libertad. La aproximación de Welch–Satterthwaite busca los grados de libertad de la χ2\chi^2 que mejor imita a esa suma:

ν=(S12n1+S22n2)2(S12/n1)2n11+(S22/n2)2n21\nu = \frac{\left(\dfrac{S_1^2}{n_1}+\dfrac{S_2^2}{n_2}\right)^2}{\dfrac{\left(S_1^2/n_1\right)^2}{n_1-1}+\dfrac{\left(S_2^2/n_2\right)^2}{n_2-1}}

que en general no es entero y se redondea. Como control, ν\nu siempre cae entre min(n11, n21)\min(n_1-1,\ n_2-1) y n1+n22n_1+n_2-2.

int/μ1μ2 = (Xˉ1Xˉ2)±tα/2;νS12n1+S22n2\text{int}/\mu_1-\mu_2 \ = \ (\bar{X}_1-\bar{X}_2) \pm t_{\alpha/2;\,\nu}\sqrt{\frac{S_1^2}{n_1}+\frac{S_2^2}{n_2}}

Nótese que el error estándar del caso 3 es idéntico al del caso 1. Lo único que cambia es el cuantil: tνt_\nu en lugar de ZZ. Y como tνZt_\nu\to Z al crecer ν\nu, el caso 1 es el caso 3 con muestras grandes.

Cómo se decide entre los casos

O bien el enunciado lo declara —"los desvíos poblacionales son iguales"— o bien hay que resolverlo con un test de cociente de varianzas (§38) hecho previamente. Ese es el orden lógico: primero se contrasta la igualdad de varianzas, y su resultado selecciona la fórmula.

Conviene tener presente que esa decisión rara vez invierte la conclusión final, aunque sí cambia los números. Y también que "no rechazar la igualdad de varianzas" no la demuestra: significa que los datos no alcanzan para distinguirlas. Usar SpS_p a continuación es una decisión pragmática —tratar como iguales lo que no se puede distinguir, ganando grados de libertad— y no la verificación de un supuesto.

Caso 1Caso 2Caso 3
Cuándoσ\sigma conocidos o n30n\geq 30σ\sigma desconocidos e igualesσ\sigma desconocidos y distintos
Error estándarS12n1+S22n2\sqrt{\frac{S_1^2}{n_1}+\frac{S_2^2}{n_2}}Sp1n1+1n2S_p\sqrt{\frac{1}{n_1}+\frac{1}{n_2}}S12n1+S22n2\sqrt{\frac{S_1^2}{n_1}+\frac{S_2^2}{n_2}}
CuantilZα/2Z_{\alpha/2}tα/2t_{\alpha/2}tα/2t_{\alpha/2}
Grados de libertadn1+n22n_1+n_2-2ν\nu (Welch)

Ejemplo del caso 3. Dos sucursales con políticas distintas, poblaciones normales, varianzas desconocidas y no comparables:

Sucursal 1Sucursal 2
nn1214
Xˉ\bar{X}8263
SS2615
S12n1=67612=56,333S22n2=22514=16,071\frac{S_1^2}{n_1} = \frac{676}{12} = 56{,}333 \qquad \frac{S_2^2}{n_2} = \frac{225}{14} = 16{,}071 ν=(56,333+16,071)256,333211+16,071213=5.242,4288,50+19,87=17,00  17\nu = \frac{(56{,}333+16{,}071)^2}{\dfrac{56{,}333^2}{11}+\dfrac{16{,}071^2}{13}} = \frac{5.242{,}4}{288{,}50+19{,}87} = 17{,}00 \ \to\ 17 int=(8263)±t0,025;1772,404=19±2,10988,509=19±17,95=(1,05; 36,95)\text{int} = (82-63) \pm t_{0,025;\,17}\sqrt{72{,}404} = 19 \pm 2{,}1098\cdot 8{,}509 = 19\pm 17{,}95 = (1{,}05\,;\ 36{,}95)

El intervalo no contiene al cero y queda enteramente positivo: hay evidencia de que la sucursal 1 tiene media mayor. Nótese lo justo del resultado —el extremo inferior es 1,05— lo que indica que con estas muestras la conclusión es sostenible pero no holgada.

Al calcular ν\nu hay tres detalles mecánicos que conviene cuidar: arriba y abajo van varianzas S2S^2 y no desvíos; el numerador va todo al cuadrado; y cada término del denominador se divide por sus propios grados de libertad.


25. Datos apareados

Toda la construcción anterior descansa en que las dos muestras sean independientes. Hay un diseño muy común en que no lo son: cuando las dos mediciones se toman sobre los mismos individuos. Producción antes y después de una capacitación, el mismo paciente con dos tratamientos, el mismo vendedor en dos semanas.

Si es la misma persona medida dos veces, Xˉ\bar{X} e Yˉ\bar{Y} están correlacionadas y V(XˉYˉ)V(Xˉ)+V(Yˉ)V(\bar{X}-\bar{Y}) \neq V(\bar{X})+V(\bar{Y}). Aplicar la fórmula de muestras independientes sobreestima el error y produce un intervalo demasiado ancho, perdiendo justamente la ventaja del diseño: que cada individuo funciona como su propio control, eliminando la variabilidad entre individuos.

La solución

Se colapsan las dos columnas en una:

Di=XiYiD_i = X_i - Y_i

y a partir de ahí el problema es un intervalo para la media de una sola variable:

int/μD = Dˉ±tα/2;n1SDn\text{int}/\mu_D \ = \ \bar{D} \pm t_{\alpha/2;\,n-1}\,\frac{S_D}{\sqrt{n}}

donde nn es la cantidad de pares, no de observaciones, y los grados de libertad son n1n-1.

Para el cálculo de SDS_D conviene la fórmula abreviada de §10, que evita restar la media en cada término:

SD2=[1nDi2Dˉ2]nn1S_D^2 = \left[\frac{1}{n}\sum D_i^2 - \bar{D}^2\right]\cdot\frac{n}{n-1}

donde el corchete es la varianza sesgada y el factor n/(n1)n/(n-1) la convierte en insesgada.

Ejemplo. Cinco operarios medidos antes y después:

Operario12345
XX (antes)3648405428
YY (después)3546375029
D=XYD = X-Y12341-1
Dˉ=95=1,8Di2=31\bar{D} = \frac{9}{5} = 1{,}8 \qquad \sum D_i^2 = 31 SD2=[3151,82]54=(6,23,24)1,25=3,7SD=1,9235S_D^2 = \left[\frac{31}{5}-1{,}8^2\right]\frac{5}{4} = (6{,}2-3{,}24)\cdot 1{,}25 = 3{,}7 \qquad S_D = 1{,}9235 int/μD=1,8±t0,025;41,92355=1,8±2,77640,8602=1,8±2,39=(0,59; 4,19)\text{int}/\mu_D = 1{,}8 \pm t_{0,025;\,4}\cdot\frac{1{,}9235}{\sqrt{5}} = 1{,}8\pm 2{,}7764\cdot 0{,}8602 = 1{,}8 \pm 2{,}39 = (-0{,}59\,;\ 4{,}19)

El cero está adentro: con estos datos no hay evidencia de que la capacitación haya cambiado la producción.


26. Intervalo para la diferencia de proporciones

Es la traducción directa de §24 al caso dicotómico. Con n1n_1 y n2n_2 grandes, cada proporción muestral es aproximadamente normal, y si las muestras son independientes su diferencia también lo es:

p^1p^2  N ⁣(p1p2 ; p1q1n1+p2q2n2)\hat{p}_1-\hat{p}_2 \ \approx\ N\!\left(p_1-p_2\ ;\ \sqrt{\frac{p_1q_1}{n_1}+\frac{p_2q_2}{n_2}}\right) int/p1p2 = (p^1p^2)±Zα/2p^1q^1n1+p^2q^2n2\text{int}/p_1-p_2 \ = \ (\hat{p}_1-\hat{p}_2)\pm Z_{\alpha/2}\sqrt{\frac{\hat{p}_1\hat{q}_1}{n_1}+\frac{\hat{p}_2\hat{q}_2}{n_2}}

Cada proporción entra con su propia estimación dentro de la raíz, ya que aquí no se supone que sean iguales. (En el test de §36 la situación cambia, y ese contraste es conceptualmente importante.)

Ejemplo. Conformidad con la atención en dos sucursales:

Sucursal 1Sucursal 2
nn7594
p^\hat{p}20%13%
int=(0,200,13)±1,960,20,875+0,130,8794=0,07±0,113=(4,3%; 18,3%)\text{int} = (0{,}20-0{,}13)\pm 1{,}96\sqrt{\frac{0{,}2\cdot 0{,}8}{75}+\frac{0{,}13\cdot 0{,}87}{94}} = 0{,}07\pm 0{,}113 = (-4{,}3\%\,;\ 18{,}3\%)

El cero está contenido: pese a que la primera sucursal muestra siete puntos más de conformidad, las muestras son demasiado chicas para afirmar que la diferencia sea real.


27. Poblaciones finitas

Todo lo anterior supone muestreo con reposición o población infinita, condiciones bajo las cuales las observaciones son independientes. Si la población tiene tamaño finito NN y se extrae sin reposición, cada observación que sale reduce la incertidumbre que queda, y el error estándar es menor de lo que indican las fórmulas. La corrección es multiplicar el desvío por el factor de corrección por población finita:

fc=NnN1fc = \sqrt{\frac{N-n}{N-1}}

Tres observaciones sobre su comportamiento:

  • si nn es chico frente a NN, fc1fc\approx 1 y no cambia nada; la regla práctica es aplicarlo cuando n/N>5%n/N > 5\%;
  • si n=Nn=N (censo), fc=0fc=0 y el desvío se anula, lo cual es correcto: medida toda la población no queda incertidumbre;
  • fc1fc \leq 1 siempre, de modo que achica el intervalo.

Dónde entra:

int/μ=Xˉ±Zα/2σnfc\text{int}/\mu = \bar{X}\pm Z_{\alpha/2}\,\frac{\sigma}{\sqrt{n}}\cdot fc int/μ1μ2=(Xˉ1Xˉ2)±Zα/2S12n1fc12+S22n2fc22\text{int}/\mu_1-\mu_2 = (\bar{X}_1-\bar{X}_2)\pm Z_{\alpha/2}\sqrt{\frac{S_1^2}{n_1}fc_1^2+\frac{S_2^2}{n_2}fc_2^2}

En el segundo caso aparece fc2fc^2 porque dentro de la raíz se trabaja con varianzas, no con desvíos: si el factor que multiplica al desvío es fcfc, el que multiplica a la varianza es fc2fc^2. Cada población lleva además su propio factor, con su NN y su nn.


28. Intervalo para la varianza

El pivote es el resultado de Cochran (§11):

(n1)S2σ2χn12\frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}

Se plantea la probabilidad de que esa cantidad caiga entre los dos cuantiles que dejan α/2\alpha/2 en cada cola,

P ⁣(χ1α2;n12<(n1)S2σ2<χα2;n12)=1αP\!\left(\chi^2_{1-\frac{\alpha}{2};\,n-1} < \frac{(n-1)S^2}{\sigma^2} < \chi^2_{\frac{\alpha}{2};\,n-1}\right) = 1-\alpha

y se despeja σ2\sigma^2 del centro. Como σ2\sigma^2 está en un denominador, al invertir se dan vuelta las desigualdades:

(n1)S2χα2;n12 < σ2 < (n1)S2χ1α2;n12\boxed{\frac{(n-1)S^2}{\chi^2_{\frac{\alpha}{2};\,n-1}} \ < \ \sigma^2 \ < \ \frac{(n-1)S^2}{\chi^2_{1-\frac{\alpha}{2};\,n-1}}}

El resultado es contraintuitivo y conviene fijarlo: el cuantil grande, el de cola derecha, va en el extremo inferior del intervalo, y el chico en el superior. Viene precisamente de que σ2\sigma^2 estaba dividiendo.

χ²₀,₉₇₅ = 5,63χ²₀,₀₂₅ = 26,1295%2,5%2,5%extremo INFERIOR de σ²extremo SUPERIOR de σ²
Los cuantiles se cruzan: el grande queda en el extremo inferior de σ² y el chico en el superior, porque σ² estaba dividiendo. El intervalo resultante no es simétrico alrededor de S².

Dos características a tener presentes:

  • El intervalo no es simétrico alrededor de S2S^2, porque la χ2\chi^2 no lo es. No tiene sentido escribirlo como "S2±S^2\pm algo".
  • El supuesto de normalidad de la población es aquí mucho más exigente que en los intervalos para la media. Como se señaló en §14, para Xˉ\bar{X} el teorema central del límite ofrece una salida cuando la población no es normal; para S2S^2 no la hay. Este intervalo es sensiblemente más frágil frente a apartamientos de la normalidad.

Si lo que se pide es un intervalo para σ\sigma y no para σ2\sigma^2, se extrae raíz cuadrada a los dos extremos una vez calculado el intervalo para la varianza.

Ejemplo. Con n=15n=15, Xˉ=24.000\bar{X} = 24.000 y S=4.900S = 4.900, al 95%:

(n1)S2=144.9002=336.140.000(n-1)S^2 = 14\cdot 4.900^2 = 336.140.000 336.140.000χ0,025;142<σ2<336.140.000χ0,975;142336.140.00026,119<σ2<336.140.0005,6287\frac{336.140.000}{\chi^2_{0,025;\,14}} < \sigma^2 < \frac{336.140.000}{\chi^2_{0,975;\,14}} \quad\Longrightarrow\quad \frac{336.140.000}{26{,}119} < \sigma^2 < \frac{336.140.000}{5{,}6287} 12.869.584<σ2<59.718.6633.587<σ<7.72812.869.584 < \sigma^2 < 59.718.663 \qquad\Longrightarrow\qquad 3.587 < \sigma < 7.728

El intervalo para σ\sigma va de 3.587 a 7.728, mientras que la estimación puntual era 4.900: está muy lejos del centro. Con 15 observaciones, la información sobre la variabilidad es escasa —el extremo superior más que duplica al inferior— y el intervalo lo hace visible de un modo que la estimación puntual no. Nótese también que la media muestral 24.000 no interviene en ningún paso.


29. Intervalo para el cociente de varianzas

Para comparar dos varianzas no se restan: se dividen. La razón no es de conveniencia sino de disponibilidad. La única distribución pivotal para dos varianzas es la FF, que por construcción es un cociente; no existe tabla para σ12σ22\sigma_1^2-\sigma_2^2. En este contexto, el uno cumple el papel que el cero cumple en las diferencias.

El pivote es el de §13:

S12/σ12S22/σ22Fn11;n21\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}\sim F_{n_1-1;\,n_2-1}

Despejando el cociente σ12/σ22\sigma_1^2/\sigma_2^2, que otra vez queda en un denominador y otra vez invierte las desigualdades:

S12/S22Fα2;n11,n21 < σ12σ22 < S12/S22F1α2;n11,n21\boxed{\frac{S_1^2/S_2^2}{F_{\frac{\alpha}{2};\,n_1-1,\,n_2-1}} \ < \ \frac{\sigma_1^2}{\sigma_2^2} \ < \ \frac{S_1^2/S_2^2}{F_{1-\frac{\alpha}{2};\,n_1-1,\,n_2-1}}}

Lectura. Si el intervalo entero cae a la derecha del 1, entonces σ12>σ22\sigma_1^2 > \sigma_2^2: el numerador corresponde a la población más variable. Si cae entero a la izquierda, lo contrario. Si contiene al 1, no hay evidencia de diferencia.

Dos ajustes según cómo venga el enunciado. Si da desvíos, hay que elevarlos al cuadrado antes de entrar a la fórmula, y si pide un intervalo para σ1/σ2\sigma_1/\sigma_2, hay que sacar raíz a los dos extremos al final. Si da una relación entre las varianzas —por ejemplo σ12=2σ22\sigma_1^2 = 2\sigma_2^2—, ese cociente no se cancela y entra como factor.

Ejemplo. Con n1=4n_1=4, n2=7n_2=7, S12=114,09S_1^2 = 114{,}09, S22=16,09S_2^2 = 16{,}09 y α=5%\alpha=5\%:

S12S22=7,0907\frac{S_1^2}{S_2^2} = 7{,}0907 7,0907F0,025;3,6<σ12σ22<7,0907F0,975;3,67,09076,5988<σ12σ22<7,09070,0679\frac{7{,}0907}{F_{0,025;\,3,6}} < \frac{\sigma_1^2}{\sigma_2^2} < \frac{7{,}0907}{F_{0,975;\,3,6}} \quad\Longrightarrow\quad \frac{7{,}0907}{6{,}5988} < \frac{\sigma_1^2}{\sigma_2^2} < \frac{7{,}0907}{0{,}0679} 1,075<σ12σ22<104,481{,}075 < \frac{\sigma_1^2}{\sigma_2^2} < 104{,}48

Todo el intervalo queda a la derecha del 1, de modo que σ12>σ22\sigma_1^2 > \sigma_2^2, en línea con lo que muestran las varianzas muestrales.

El ancho del intervalo es la parte más informativa de este resultado. Dice que la varianza de la primera población podría ser desde 1,07 hasta 104 veces la de la segunda: con n1=4n_1=4 y n2=7n_2=7 prácticamente no hay información sobre las varianzas. La asimetría es también llamativa —el estimador puntual, 7,09, está muy cerca del extremo inferior— y refleja la asimetría de la FF.

El cuantil F0,975;3,6=0,0679F_{0,975;\,3,6} = 0{,}0679 no figura en las tablas habituales y hay que obtenerlo con la identidad de la sección siguiente.


30. Inversión de grados de libertad en la FF

Las tablas de FF traen únicamente valores de la cola derecha: números grandes, mayores que 1. Pero los intervalos bilaterales y los tests de cola izquierda necesitan valores chicos, menores que 1, que no están tabulados. La identidad que resuelve el problema es

F1α;n,m=1Fα;m,n\boxed{F_{1-\alpha;\,n,m} = \frac{1}{F_{\alpha;\,m,n}}}

Cambian dos cosas simultáneamente: la probabilidad pasa de α\alpha a 1α1-\alpha, y se invierten los grados de libertad al mismo tiempo que se toma el recíproco. Invertir solo los grados de libertad, sin el recíproco, no sirve.

La justificación es la propiedad señalada en §13: si FFn,mF\sim F_{n,m}, entonces 1/F1/F es el mismo cociente dado vuelta, o sea 1/FFm,n1/F\sim F_{m,n}. Y "quedar por debajo de cc" para FF es lo mismo que "quedar por encima de 1/c1/c" para 1/F1/F; al pasar de una cola a la otra, la probabilidad pasa de α\alpha a 1α1-\alpha.

Ejemplo, el que se necesitaba en §29:

F0,975;3,6=1F0,025;6,3=114,7347=0,0679F_{0,975;\,3,6} = \frac{1}{F_{0,025;\,6,3}} = \frac{1}{14{,}7347} = 0{,}0679

Nótese el orden de los grados de libertad en el miembro derecho: 6,36,3, invertidos respecto del izquierdo.

Este es también el punto natural para reafirmar la convención de tablas introducida en §4, que rige para ZZ, tt, χ2\chi^2 y FF por igual: el subíndice indica el área a la derecha. El percentil 95 se busca con subíndice 0,05; un valor de cola izquierda al 0,5% se rotula F0,995F_{0,995} y no F0,005F_{0,005}; y a subíndice más chico corresponde valor más grande.


31. Cotas unilaterales y tamaño de muestra

Cotas unilaterales

Cuando el interés está en un solo lado —¿cuál es el máximo verosímil de σ\sigma?, ¿la media está por debajo de lo declarado?— no tiene sentido repartir α\alpha en dos colas. Va entero a la cola que interesa:

bilateral:  θ^±tα/2desvıˊocota superior:  θ^+tαdesvıˊocota inferior:  θ^tαdesvıˊo\text{bilateral: } \ \hat\theta \pm t_{\alpha/2}\cdot\text{desvío} \qquad \text{cota superior: } \ \hat\theta + t_{\alpha}\cdot\text{desvío} \qquad \text{cota inferior: } \ \hat\theta - t_{\alpha}\cdot\text{desvío}

Con el mismo α\alpha, la cota unilateral es más ajustada del lado que interesa, porque no se gasta la mitad del error en un extremo irrelevante. La contrapartida es que del otro lado no se afirma nada.

En los intervalos basados en χ2\chi^2 o FF el razonamiento es el mismo pero con el cuantil correspondiente. Por ejemplo, para una cota superior de σ2\sigma^2 al 1α1-\alpha:

σ2<(n1)S2χ1α;n12\sigma^2 < \frac{(n-1)S^2}{\chi^2_{1-\alpha;\,n-1}}

Con los datos de §28 y α=1%\alpha=1\%:  σ2<336.140.000/4,6604=72.126.468\ \sigma^2 < 336.140.000/4{,}6604 = 72.126.468, o sea σ<8.493\sigma < 8.493.

Determinación del tamaño de muestra

Se parte del margen de error deseado y se despeja nn:

ME=Zα/2σnn=(Zα/2σME)2ME = Z_{\alpha/2}\,\frac{\sigma}{\sqrt{n}} \qquad\Longrightarrow\qquad n = \left(\frac{Z_{\alpha/2}\cdot\sigma}{ME}\right)^2 (proporciones)n=(Zα/2ME)2p(1p)\text{(proporciones)}\qquad n = \left(\frac{Z_{\alpha/2}}{ME}\right)^2 p(1-p)

con las convenciones ya vistas en §23: usar p=0,5p=0{,}5 si no hay información previa, y redondear siempre hacia arriba.

La relación fundamental es ME1/nME\propto 1/\sqrt{n}, de donde reducir el margen a la mitad exige multiplicar nn por 4.

La misma ecuación puede despejarse en las otras dos direcciones, lo que da lugar a tres preguntas distintas sobre el mismo trío de cantidades.

Ejemplo. Con n=120n=120, Xˉ=36\bar{X}=36 y S=13S=13:

(a) El intervalo al 98%. Con Z0,01=2,33Z_{0,01}=2{,}33:

36±2,3313120=36±2,77=(33,23; 38,77)36 \pm 2{,}33\cdot\frac{13}{\sqrt{120}} = 36\pm 2{,}77 = (33{,}23\,;\ 38{,}77)

(b) Qué nn haría falta para reducir el margen a la mitad. Directamente por la relación anterior, n=4120=480n = 4\cdot 120 = 480.

(c) Con qué nivel de confianza se alcanzaría ese margen manteniendo n=120n=120. Ahora la incógnita es el cuantil:

1,3825=Zα/213120Zα/2=1,382512013=1,165α=0,2441{,}3825 = Z_{\alpha/2}\cdot\frac{13}{\sqrt{120}} \quad\Longrightarrow\quad Z_{\alpha/2} = \frac{1{,}3825\sqrt{120}}{13} = 1{,}165 \quad\Longrightarrow\quad \alpha = 0{,}244

es decir un nivel de confianza de apenas 75,6%. Las tres preguntas muestran el intercambio de fondo: con una muestra dada, precisión y confianza son bienes que compiten entre sí.


Parte V · Tests de hipótesis


32. El marco

Un test de hipótesis es una prueba por contradicción, organizada con presunción de inocencia. Se supone cierta una afirmación, se calcula qué tan improbable sería observar los datos obtenidos si esa afirmación fuera cierta, y si resulta demasiado improbable se la descarta.

Las dos hipótesis

H0:hipoˊtesis nulaHa (H1):hipoˊtesis alternativaH_0: \text{hipótesis nula} \qquad\qquad H_a \ (\text{o } H_1): \text{hipótesis alternativa}

H0H_0 siempre lleva la igualdad. Aun cuando el planteo del problema sugiera algo como σ1σ2\sigma_1\leq\sigma_2, se trabaja en el borde, σ1=σ2\sigma_1=\sigma_2: es el caso más desfavorable y el único que produce un número concreto.

Esa es exactamente la razón de la regla. Para calcular el estadístico hace falta un valor puntual del parámetro. La afirmación "μ<1000\mu<1000" no determina ninguna distribución en particular —hay infinitas—, mientras que "μ=1000\mu=1000" determina una. Toda la maquinaria se construye sobre ese número, y H0H_0 es quien lo aporta.

HaH_a es una desigualdad: recoge lo que se sospecha si H0H_0 no se cumple. Su dirección determina de qué lado queda la región de rechazo.

El estadístico de prueba

En todos los casos responde a la misma idea: cuántos desvíos estándar hay entre lo observado y lo que H0H_0 afirma.

estadıˊstico=estimadorvalor bajo H0desvıˊo del estimador\text{estadístico} = \frac{\text{estimador} - \text{valor bajo } H_0}{\text{desvío del estimador}}

Si H0H_0 es cierta, ese cociente sigue una distribución conocida —ZZ, tt, χ2\chi^2 o FF según el caso—, y esa es toda la información que hace falta para juzgar si el valor obtenido es raro o no.

La regla de decisión

Hay dos formas equivalentes de decidir, que nunca pueden dar resultados distintos:

VíaRegla
valor críticose rechaza H0H_0 si el estadístico cae en la región de rechazo
pp-valuese rechaza H0H_0 si p<αp < \alpha

La comparación es siempre contra el valor crítico correspondiente, nunca contra el estadístico calculado en otro punto del problema.

Una cola o dos

La forma de HaH_a decide dónde se ubica la región de rechazo:

HaH_aRegión de rechazoValor crítico
μ<μ0\mu<\mu_0cola izquierdaZα-Z_\alpha
μ>μ0\mu>\mu_0cola derecha+Zα+Z_\alpha
μμ0\mu\neq\mu_0las dos colas±Zα/2\pm Z_{\alpha/2}

En el test bilateral el nivel se reparte: α/2\alpha/2 de cada lado.

−ZαHa: μ < μ₀α entero de un ladoHa: μ > μ₀α entero de un lado−Zα/₂Zα/₂Ha: μ ≠ μ₀α/2 de cada lado
La forma de la hipótesis alternativa decide dónde va la región de rechazo.

"No se rechaza" no es "se acepta"

No rechazar H0H_0 significa que los datos no alcanzan para descartarla, no que sea verdadera. Es la diferencia entre "no culpable" e "inocente": un veredicto absolutorio no prueba la inocencia, prueba que la evidencia no fue suficiente.

Por eso la conclusión se redacta como "no hay evidencia suficiente para afirmar que…" y no como "queda demostrado que…". La asimetría es deliberada: el test está diseñado para controlar la probabilidad de rechazar una H0H_0 verdadera, y no ofrece ninguna garantía comparable en la otra dirección.


33. Errores de tipo I y de tipo II. Potencia

Toda decisión sobre H0H_0 puede fallar de dos maneras:

H0H_0 verdaderaH0H_0 falsa
Se rechaza H0H_0error de tipo I — probabilidad α\alphadecisión correcta — probabilidad 1β1-\beta
No se rechaza H0H_0decisión correctaerror de tipo II — probabilidad β\beta
α=P(rechazar H0H0 verdadera)β=P(no rechazar H0H0 falsa)\alpha = P(\text{rechazar }H_0 \mid H_0 \text{ verdadera}) \qquad \beta = P(\text{no rechazar }H_0\mid H_0\text{ falsa})

El error de tipo I

Es el nivel de significación, y lo elige quien hace el test: 1%, 5%, 10%. Geométricamente es el área de la región de rechazo bajo la distribución de H0H_0. En la analogía judicial, es la probabilidad de condenar a un inocente.

El error de tipo II

Aquí aparece una asimetría fundamental. Mientras que α\alpha se fija por decisión, β\beta no se puede calcular sin información adicional, y la razón es que "H0H_0 es falsa" no describe una única situación. Si H0H_0 dice μ=1000\mu=1000, su negación abarca μ=999\mu=999 y μ=500\mu=500, y el error de tipo II es completamente distinto en cada caso: una desviación grande es fácil de detectar y una chica no.

Para calcular β hace falta un valor concreto μa de la alternativa.\text{Para calcular }\beta\text{ hace falta un valor concreto } \mu_a \text{ de la alternativa.}

Con μa\mu_a dado, el cálculo es geométrico y se apoya en dos campanas: la de H0H_0, centrada en μ0\mu_0, y la de la alternativa, centrada en μa\mu_a. Ambas comparten un único punto de corte, el valor crítico Xˉc\bar{X}_c que separa aceptación de rechazo.

  • α\alpha es el área bajo la campana de H0H_0, del lado de rechazo.
  • β\beta es el área bajo la campana de HaH_a, del lado de aceptación.
H₀ : μ = μ₀Hₐ : μ = μₐμ₀μₐX̄cαβα vive bajo la campana de H₀,del lado de rechazoβ vive bajo la campana de Hₐ,del lado de aceptación
Los dos errores viven en campanas distintas y comparten un único punto de corte.

El procedimiento tiene entonces tres pasos:

  1. Traducir la regla de decisión a la escala de la variable. El test vive en escala ZZ o tt, pero β\beta se calcula en escala Xˉ\bar{X}:  Xˉc=μ0±(cuantil)Sn\ \bar{X}_c = \mu_0 \pm (\text{cuantil})\cdot\frac{S}{\sqrt{n}}, con el signo que corresponda a la dirección de HaH_a.
  2. Estandarizar ese mismo Xˉc\bar{X}_c contra μa\mu_a, no contra μ0\mu_0:  z=XˉcμaS/n\ z = \dfrac{\bar{X}_c-\mu_a}{S/\sqrt{n}}.
  3. Tomar el área del lado de aceptación, que es el opuesto al de α\alpha.

Los dos errores que arruinan el cálculo son estandarizar contra μ0\mu_0 en el segundo paso —lo que devuelve α\alpha— y tomar la cola equivocada en el tercero.

El intercambio, y la potencia

Con nn fijo, α\alpha y β\beta se mueven en direcciones opuestas: correr Xˉc\bar{X}_c para achicar uno agranda el otro. Es un intercambio inevitable, porque hay un solo punto de corte para dos áreas. La única forma de reducir ambos simultáneamente es aumentar nn, que angosta las dos campanas y las separa mejor.

Potencia=1β=P(rechazar H0H0 falsa)\text{Potencia} = 1-\beta = P(\text{rechazar }H_0\mid H_0\text{ falsa})

Es la capacidad del test de detectar un efecto que realmente existe. Crece con nn, con α\alpha, y con la distancia entre μ0\mu_0 y μa\mu_a.

Un test de baja potencia es engañoso: al no rechazar, invita a concluir que no hay efecto, cuando en realidad lo que ocurre es que el test no habría podido detectarlo aunque lo hubiera. Por eso conviene calcular β\beta cuando el resultado es "no se rechaza".


34. El pp-value

Definición

El pp-value es la probabilidad de obtener un resultado tan extremo o más que el observado, suponiendo que H0H_0 es cierta:

p=P(estadıˊstico maˊs extremo que el observadoH0)p = P(\text{estadístico más extremo que el observado}\mid H_0) p<α  se rechaza H0pα  no se rechazap<\alpha \ \Longrightarrow\ \text{se rechaza } H_0 \qquad\qquad p\geq\alpha \ \Longrightarrow\ \text{no se rechaza}

Cómo interpretarlo

La lectura más útil es esta: el pp-value es el α\alpha más chico con el que todavía se rechazaría. Decir p=0,08p=0{,}08 equivale a decir que con cualquier nivel de significación mayor que 0,08 se rechaza H0H_0, y con cualquiera menor no.

Eso lo hace más informativo que la respuesta binaria. En lugar de "se rechaza al 5%", indica exactamente cuán al borde está la decisión, y permite que cada lector aplique su propio umbral.

En tests bilaterales

Como lo "extremo" cuenta de los dos lados, el pp-value bilateral es el doble del área de una cola:

pbilateral=2P(estadıˊstico>observado)p_{\text{bilateral}} = 2\cdot P(\text{estadístico} > |\text{observado}|)

Cuando no está claro qué cola mirar, un procedimiento seguro es calcular las dos y quedarse con la que tiene sentido: la otra, al duplicarse, daría un valor mayor que 1.

Lo que el pp-value no es

No es la probabilidad de que H0H_0 sea cierta. Es una probabilidad calculada bajo el supuesto de que H0H_0 es cierta, lo cual es una afirmación de naturaleza distinta. Confundir P(datosH0)P(\text{datos}\mid H_0) con P(H0datos)P(H_0\mid\text{datos}) es el error de interpretación más extendido en toda la estadística aplicada.


35. Test para la media

H0:μ=μ0Ha:μ<μ0  o  μ>μ0  o  μμ0H_0:\mu=\mu_0 \qquad H_a: \mu<\mu_0 \ \text{ o }\ \mu>\mu_0 \ \text{ o }\ \mu\neq\mu_0 Ztest=Xˉμ0σ/nttest=Xˉμ0S/n  con n1 g.l.Z_{\text{test}} = \frac{\bar{X}-\mu_0}{\sigma/\sqrt{n}} \qquad\qquad t_{\text{test}} = \frac{\bar{X}-\mu_0}{S/\sqrt{n}}\ \ \text{con } n-1 \text{ g.l.}

El criterio de elección es el mismo que en §22: ZZ si σ\sigma es conocido o nn es grande, tt si σ\sigma es desconocido y la población es normal.

Conviene representar el problema con dos escalas alineadas: arriba la de Xˉ\bar{X}, con μ0\mu_0 en el centro y Xˉc\bar{X}_c en el corte; abajo la de ZZ, con 0 en el centro y ZcZ_c en el corte. Comparar en cualquiera de las dos es equivalente; la de ZZ es la que se lleva a la tabla, y la de Xˉ\bar{X} es la que se necesita para calcular β\beta.

Ejemplo. Un fabricante declara que sus envases contienen μ=1.000\mu=1.000 unidades; un cliente sospecha que es menos. Se toma una muestra de n=50n=50 con Xˉ=970\bar{X}=970 y S=80S=80, al 5%.

H0:μ=1.000Ha:μ<1.000H_0:\mu = 1.000 \qquad H_a:\mu<1.000 Ztest=9701.00080/50=3011,314=2,65Z_{\text{test}} = \frac{970-1.000}{80/\sqrt{50}} = \frac{-30}{11{,}314} = -2{,}65

El valor crítico de cola izquierda al 5% es Z0,05=1,645-Z_{0,05}=-1{,}645. Como 2,65<1,645-2{,}65 < -1{,}645, el estadístico cae en la región de rechazo: se rechaza H0H_0. El pp-value es P(Z<2,65)=0,004P(Z<-2{,}65)=0{,}004, muy inferior a 0,05, lo que confirma la decisión y muestra que no es ajustada.

El error de tipo II en este ejemplo. Supóngase que el contenido real fuera μa=980\mu_a = 980. Siguiendo los tres pasos de §33:

Xˉc=1.0001,64511,314=981,39\bar{X}_c = 1.000 - 1{,}645\cdot 11{,}314 = 981{,}39 z=981,3998011,314=0,123β=P(Z>0,123)=0,451z = \frac{981{,}39-980}{11{,}314} = 0{,}123 \qquad\Longrightarrow\qquad \beta = P(Z>0{,}123) = 0{,}451

La potencia es 1β=0,5491-\beta = 0{,}549. Es decir: si el contenido real fuera 980, este test lo detectaría apenas algo más de la mitad de las veces. Una desviación de 20 unidades sobre 1.000 es difícil de detectar con n=50n=50 y esta variabilidad.

Test para la diferencia de medias

Misma estructura, con el estimador y el error estándar de §24:

ttest=(Xˉ1Xˉ2)(μ1μ2)= 0 por H0Sp1n1+1n2t_{\text{test}} = \frac{(\bar{X}_1-\bar{X}_2)-\overbrace{(\mu_1-\mu_2)}^{=\ 0\ \text{por } H_0}}{S_p\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}}

El término (μ1μ2)(\mu_1-\mu_2) del numerador vale cero por H0H_0, y ese es precisamente el aporte de la hipótesis nula: convertir una expresión con un parámetro desconocido en un número calculable. Según el caso, el denominador es el del caso 1, 2 o 3 de §24.


36. Tests para proporciones

Una proporción

H0:p=p0Ztest=p^p0p0(1p0)nH_0: p = p_0 \qquad\qquad Z_{\text{test}} = \frac{\hat{p}-p_0}{\sqrt{\dfrac{p_0(1-p_0)}{n}}}

En el denominador va p0p_0, el valor postulado por H0H_0, y no p^\hat{p}. Esta es una diferencia con el intervalo de confianza de §23, y tiene explicación: allá no había ningún valor de referencia disponible y hubo que recurrir a p^\hat p; acá H0H_0 proporciona uno, y bajo H0H_0 ese es el valor correcto de la varianza.

Dos proporciones

H0:p1=p2    p1p2=0H_0: p_1 = p_2 \iff p_1-p_2 = 0 Ztest=p^1p^20p^0(1p^0)(1n1+1n2)conp^0=x1+x2n1+n2Z_{\text{test}} = \frac{\hat{p}_1-\hat{p}_2-0}{\sqrt{\hat{p}_0(1-\hat{p}_0)\left(\dfrac{1}{n_1}+\dfrac{1}{n_2}\right)}} \qquad \text{con}\quad \hat{p}_0 = \frac{x_1+x_2}{n_1+n_2}

La cantidad p^0\hat p_0 se llama proporción ponderada y es el punto conceptual del test. Bajo H0H_0 las dos proporciones poblacionales son iguales: hay una sola pp. Y si hay una sola, la mejor estimación de esa pp usa todos los datos disponibles, juntando los dos numeradores y los dos denominadores.

Es exactamente la misma idea que la varianza ponderada Sp2S_p^2 de §24: cuando la hipótesis afirma que un parámetro es común a las dos poblaciones, se lo estima con las dos muestras a la vez.

En el intervalo de confianza (§26) esto no ocurre, porque allí no se supone ninguna igualdad y cada proporción va con su propia estimación. La diferencia entre las dos fórmulas no es un descuido: refleja que el intervalo y el test parten de supuestos distintos.

Ejemplo. De 75 clientes de la sucursal 1, 15 se declaran conformes (20,0%); de 94 de la sucursal 2, 12 lo hacen (12,8%). ¿Hay diferencia, al 5%?

p^0=15+1275+94=27169=0,1598\hat{p}_0 = \frac{15+12}{75+94} = \frac{27}{169} = 0{,}1598 Ztest=0,2000,1280,15980,8402(175+194)=0,07230,0567=1,275Z_{\text{test}} = \frac{0{,}200-0{,}128}{\sqrt{0{,}1598\cdot 0{,}8402\left(\frac{1}{75}+\frac{1}{94}\right)}} = \frac{0{,}0723}{0{,}0567} = 1{,}275

Contra ±1,96\pm 1{,}96 el estadístico no llega a la región de rechazo: no se rechaza H0H_0. El pp-value bilateral es 2P(Z>1,275)=0,2022\cdot P(Z>1{,}275)=0{,}202.


37. Test para la varianza

H0:σ2=σ02χtest2=(n1)S2σ02  χn12  bajo H0H_0:\sigma^2=\sigma_0^2 \qquad\qquad \chi^2_{\text{test}} = \frac{(n-1)S^2}{\sigma_0^2} \ \sim\ \chi^2_{n-1}\ \text{ bajo } H_0

Tres observaciones:

  • Los grados de libertad son n1n-1 y no nn, porque S2S^2 ya consumió uno estimando la media (§11).
  • Como la χ2\chi^2 no es simétrica, en el test bilateral los dos valores críticos no son opuestos y hay que buscar χα/2;n12\chi^2_{\alpha/2;\,n-1} y χ1α/2;n12\chi^2_{1-\alpha/2;\,n-1} por separado.
  • Para el pp-value bilateral se calcula el área de la cola del lado donde cayó el estadístico y se duplica.

Ejemplo. Se sostiene que el desvío de un proceso es σ0=2,9\sigma_0 = 2{,}9. Una muestra de n=12n=12 da S=6,8S=6{,}8. ¿Hay evidencia de mayor variabilidad, al 5%?

H0:σ=2,9Ha:σ>2,9H_0:\sigma=2{,}9 \qquad H_a:\sigma>2{,}9 χtest2=116,822,92=508,648,41=60,48\chi^2_{\text{test}} = \frac{11\cdot 6{,}8^2}{2{,}9^2} = \frac{508{,}64}{8{,}41} = 60{,}48

El crítico de cola derecha es χ0,05;112=19,68\chi^2_{0,05;\,11} = 19{,}68. Como 60,4860{,}48 lo supera ampliamente, se rechaza H0H_0: hay evidencia fuerte de que la variabilidad real excede la declarada.


38. Test para el cociente de varianzas

H0:σ12=σ22Ha:σ12>σ22  o  σ12σ22H_0:\sigma_1^2=\sigma_2^2 \qquad H_a:\sigma_1^2>\sigma_2^2 \ \text{ o }\ \sigma_1^2\neq\sigma_2^2

El pivote general es el de §13, y aquí es donde la hipótesis nula hace su aporte más visible:

F=S12/σ12S22/σ22  bajo H0: σ12=σ22  Ftest=S12S22  Fn11;n21F = \frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} \ \xrightarrow{\ \text{bajo } H_0:\ \sigma_1^2=\sigma_2^2\ }\ F_{\text{test}} = \frac{S_1^2}{S_2^2}\ \sim\ F_{n_1-1;\,n_2-1}

Como H0H_0 afirma que las varianzas poblacionales son iguales, se cancelan, y el estadístico se reduce al cociente de las varianzas muestrales. Esa cancelación es literalmente el contenido de la hipótesis nula traducido a álgebra.

Una o dos colas:

  • Ha:σ12>σ22H_a:\sigma_1^2>\sigma_2^2 — una cola derecha, crítico Fα;n11,n21F_{\alpha;\,n_1-1,\,n_2-1}.
  • Ha:σ12<σ22H_a:\sigma_1^2<\sigma_2^2 — una cola izquierda; el crítico es menor que 1 y se obtiene invirtiendo (§30).
  • Ha:σ12σ22H_a:\sigma_1^2\neq\sigma_2^2 — dos colas, con α/2\alpha/2 de cada lado y dos críticos distintos.

Ejemplo. Dos poblaciones normales con muestras de n1=10n_1=10 y n2=12n_2=12, y desvíos muestrales S1=2,8S_1=2{,}8 y S2=1,7S_2=1{,}7. ¿Tienen la misma varianza? Al 5%, contra Ha:σ12>σ22H_a:\sigma_1^2>\sigma_2^2:

Ftest=2,821,72=7,842,89=2,713F_{\text{test}} = \frac{2{,}8^2}{1{,}7^2} = \frac{7{,}84}{2{,}89} = 2{,}713

El crítico es F0,05;9,11=2,896F_{0,05;\,9,11} = 2{,}896. Como 2,713<2,8962{,}713 < 2{,}896, no se rechaza H0H_0: pese a que la primera muestra es visiblemente más dispersa, la evidencia no alcanza al 5%. El pp-value es 0,0610{,}061, lo que muestra que la decisión es ajustada —al 10% se habría rechazado.

Para qué sirve este test. Además de responder la pregunta directa sobre variabilidad, es el paso previo que decide si en una comparación de medias corresponde el caso 2 de §24 (varianzas iguales, con SpS_p) o el caso 3 (Welch).


39. La dualidad entre intervalos y tests

Los intervalos de confianza y los tests de hipótesis se presentan como temas separados, pero son dos despejes de la misma desigualdad, y conviene verlo explícitamente porque permite usar cada uno para verificar al otro.

Tómese el caso del cociente de varianzas. El punto de partida es siempre el mismo enunciado probabilístico:

F1α2 < S12/S22σ12/σ22 < Fα2F_{1-\frac{\alpha}{2}} \ < \ \frac{S_1^2/S_2^2}{\sigma_1^2/\sigma_2^2} \ < \ F_{\frac{\alpha}{2}}
  • Despejando hacia el estadístico se supone H0H_0, que fija σ12/σ22=1\sigma_1^2/\sigma_2^2 = 1; el denominador se cancela y queda Ftest=S12/S22F_{\text{test}} = S_1^2/S_2^2 contra los valores críticos. Es el test de §38.
  • Despejando hacia el parámetro queda σ12/σ22\sigma_1^2/\sigma_2^2 solo en el centro, entre dos extremos calculables. Es el intervalo de §29.

De ahí la equivalencia formal:

1(rFα/2 ; rF1α/2)    F1α/2<r<Fα/2,r=S12S221 \in \left(\frac{r}{F_{\alpha/2}}\ ;\ \frac{r}{F_{1-\alpha/2}}\right) \iff F_{1-\alpha/2} < r < F_{\alpha/2}, \qquad r = \frac{S_1^2}{S_2^2}

El uno pertenece al intervalo exactamente cuando el estadístico cae fuera de la región de rechazo. Nunca pueden dar conclusiones distintas.

El mismo argumento vale para la media: el intervalo Xˉ±tα/2S/n\bar{X}\pm t_{\alpha/2}S/\sqrt{n} contiene a μ0\mu_0 si y solo si el test bilateral de H0:μ=μ0H_0:\mu=\mu_0 no rechaza al nivel α\alpha. Un intervalo de confianza al 1α1-\alpha es, visto así, el conjunto de todos los valores del parámetro que un test bilateral al nivel α\alpha no rechazaría.

Qué aporta cada uno

Si son equivalentes, cabe preguntarse por qué existen los dos. Responden preguntas distintas:

  • El test responde "¿es plausible este valor en particular?" y devuelve un veredicto binario más el pp-value.
  • El intervalo responde "¿qué valores son plausibles?" y devuelve un rango, es decir, infinitos tests de una sola vez y por el mismo trabajo.

En consecuencia, el intervalo muestra algo que el test oculta: el ancho. Un intervalo de (0,20; 3,99)(0{,}20;\ 3{,}99) para un cociente de varianzas dice que la primera podría ser desde un quinto hasta cuatro veces la segunda —o sea, que prácticamente no hay información—. El test, ante esos mismos datos, se limita a decir "no se rechaza", frase que se puede confundir fácilmente con evidencia de igualdad.

Esa distinción es la misma que se planteó en §32 y merece repetirse: no rechazar no prueba que los parámetros sean iguales; prueba que los datos no alcanzan para distinguirlos. El intervalo lo deja a la vista, el test no.

Como beneficio práctico, la dualidad ofrece una verificación gratuita: si el intervalo contiene al valor de H0H_0 pero el estadístico cae en zona de rechazo, hay un error de cálculo en alguno de los dos caminos.


Parte VI · Bondad de ajuste e independencia


40. El estadístico de Pearson

Todos los tests vistos hasta aquí contrastan hipótesis sobre un parámetro: μ\mu, pp, σ\sigma. Ahora la pregunta cambia de naturaleza y pasa a ser sobre la forma de la distribución entera: ¿estos datos se comportan como una uniforme? ¿como una Poisson? ¿como una normal?

H0:los datos siguen la distribucioˊDHa:no la siguenH_0: \text{los datos siguen la distribución } \mathcal{D} \qquad\qquad H_a: \text{no la siguen}

La idea

Se parten los datos en kk categorías. Cada una tiene una frecuencia observada nobsn_{obs} —la que se contó— y una frecuencia esperada nespn_{esp} —la que debería haber si H0H_0 fuera cierta—. Si H0H_0 es cierta, las dos columnas deberían parecerse. El test consiste en medir cuánto se apartan.

El estadístico

χ2=i=1k(nobsinespi)2nespi\chi^2 = \sum_{i=1}^{k}\frac{(n_{obs\,i}-n_{esp\,i})^2}{n_{esp\,i}}

Cada término se lee así: el numerador es la discrepancia de esa categoría, elevada al cuadrado para que las diferencias de signo opuesto no se cancelen; el denominador la relativiza, porque una diferencia de 5 sobre una frecuencia esperada de 6 es enorme y sobre una de 500 es despreciable.

Si el ajuste fuera perfecto el estadístico valdría cero, y crece a medida que las dos columnas se separan. De ahí una propiedad que conviene fijar:

La bondad de ajuste es siempre un test de cola derecha. Valores grandes indican mal ajuste, es decir evidencia contra H0H_0. Un valor chico nunca constituye evidencia en contra.

Bajo H0H_0, y con frecuencias esperadas suficientemente grandes, este estadístico se distribuye aproximadamente como una χ2\chi^2. El resultado es asintótico y proviene de que cada término se comporta como el cuadrado de una variable aproximadamente normal.

Las frecuencias esperadas

nespi=nPi\boxed{n_{esp\,i} = n\cdot P_i}

donde PiP_i es la probabilidad que la distribución de H0H_0 asigna a la categoría ii, y nn es el total de observaciones, n=nobsn=\sum n_{obs}, no la frecuencia observada de esa categoría.

De aquí surge un control que conviene hacer siempre: la columna de esperadas debe sumar exactamente lo mismo que la de observadas. Si no lo hace, hay un error en las PiP_i o en el nn, y no tiene sentido seguir.

Grados de libertad

g.l.=k1m\boxed{g.l. = k-1-m}
  • kk es el número de categorías.
  • Se resta 1 porque las frecuencias no son libres: deben sumar nn. Fijadas k1k-1, la última queda determinada.
  • Se resta mm, la cantidad de parámetros de la distribución que hubo que estimar a partir de la muestra.

La segunda resta merece explicación. Estimar un parámetro con los propios datos ajusta la distribución teórica hacia ellos, y hace que el ajuste luzca artificialmente bueno. Restar un grado de libertad por cada parámetro estimado es la penalización que compensa ese efecto: con menos grados de libertad, el valor crítico es menor y el test resulta más exigente.

Situaciónmmg.l.
Distribución totalmente especificada (λ\lambda dado, PiP_i dadas)0k1k-1
Poisson con λ\lambda estimado por Xˉ\bar{X}1k2k-2
Exponencial con λ\lambda estimado1k2k-2
Normal con μ\mu y σ\sigma estimados por Xˉ\bar{X} y SS2k3k-3

La condición sobre las frecuencias esperadas

La aproximación a la χ2\chi^2 requiere que ninguna categoría tenga frecuencia esperada menor que 5. Cuando alguna la tiene, el procedimiento estándar es agruparla con una categoría vecina, lo que reduce kk en uno y por lo tanto también los grados de libertad.

La razón es aritmética y se ve en la fórmula: una frecuencia esperada muy chica queda en el denominador de su término e infla su aporte desproporcionadamente. Una sola categoría casi vacía puede aportar la mayor parte del estadístico y llevar a rechazar H0H_0 aunque el resto del ajuste sea bueno. El ejemplo de la distribución normal en §41 muestra un caso donde esto invierte la conclusión.


41. Los casos concretos

Lo único que cambia entre un caso y otro es cómo se calculan las PiP_i. El estadístico, la cola derecha y el control de la suma son idénticos en los cuatro.

Caso A — Proporciones dadas o distribución uniforme

Es el más simple: el enunciado da directamente las PiP_i, o afirma que todas las categorías son igualmente probables.

H0:p1=p2==pk=1kHa:i,j / ij  pipjH_0: p_1=p_2=\cdots=p_k=\tfrac{1}{k} \qquad\qquad H_a: \exists\, i,j \ /\ i\neq j\ \wedge\ p_i\neq p_j

Conviene reparar en cómo se escribe HaH_a: no es "todas son distintas" sino "al menos dos difieren". Alcanza con que se rompa una sola igualdad para que H0H_0 sea falsa.

Si la distribución es uniforme, nesp=n/kn_{esp} = n/k en todas las categorías. Como no se estima ningún parámetro, m=0m=0 y los grados de libertad son k1k-1.

Ejemplo. Un producto se ofrece en tres marcas y se registra el consumo de cada una en 93 compras:

Marca 1Marca 2Marca 3Total
Observada39213393
PiP_i1/31/31/31/31/31/31
Esperada31313193
χ2=(3931)231+(2131)231+(3331)231=64+100+431=5,419\chi^2 = \frac{(39-31)^2}{31}+\frac{(21-31)^2}{31}+\frac{(33-31)^2}{31} = \frac{64+100+4}{31} = 5{,}419

Con k1=2k-1=2 grados de libertad, el crítico al 5% es χ0,05;22=5,992\chi^2_{0,05;\,2} = 5{,}992. Como 5,419<5,9925{,}419 < 5{,}992, no se rechaza: no hay evidencia de que alguna marca se consuma más que otra.

Ahora bien, al 10% el crítico baja a χ0,10;22=4,605\chi^2_{0,10;\,2} = 4{,}605 y la decisión se invierte: se rechaza. El pp-value es 0,06660{,}0666, y esto explica exactamente por qué la conclusión cambió: el nivel de significación cruzó ese umbral. Es un buen ejemplo de por qué informar el pp-value es preferible al veredicto binario.

Caso B — Poisson

P(x)=eλλxx!P(x) = \frac{e^{-\lambda}\lambda^x}{x!}

Si el enunciado da λ\lambda, no se estima nada y m=0m=0. Si no lo da, se lo estima con el promedio ponderado por las frecuencias,

λ^=Xˉ=1nixifi\hat\lambda = \bar{X} = \frac{1}{n}\sum_i x_i\,f_i

y entonces m=1m=1.

Como la Poisson tiene soporte infinito y las categorías son finitas, la última suele ser abierta —"3 o más", "5 o más"— y su probabilidad se calcula por complemento:

P(uˊltima)=1anterioresPiP(\text{última}) = 1-\sum_{\text{anteriores}} P_i

Esto garantiza que las PiP_i sumen exactamente 1 y que toda la cola quede cubierta.

Ejemplo. Número de fallas diarias registradas durante 60 días:

Fallas0123 o másTotal
Observada31159560
λ^=031+115+29+3560=4860=0,8\hat\lambda = \frac{0\cdot31+1\cdot15+2\cdot9+3\cdot5}{60} = \frac{48}{60} = 0{,}8 P(0)=e0,8=0,4493P(1)=0,8e0,8=0,3595P(2)=0,822e0,8=0,1438P(0)=e^{-0,8}=0{,}4493 \qquad P(1)=0{,}8\,e^{-0,8}=0{,}3595 \qquad P(2)=\frac{0{,}8^2}{2}e^{-0,8}=0{,}1438 P(3 o maˊs)=1(0,4493+0,3595+0,1438)=0,0474P(3\text{ o más}) = 1-(0{,}4493+0{,}3595+0{,}1438) = 0{,}0474
0123 o másTotal
Observada31159560
PiP_i0,44930,35950,14380,04741,0000
Esperada26,9621,578,632,8460,00

La columna de esperadas suma 60, igual que la de observadas.

3127,001521,6198,6252,83 o másfallasobservadasesperadas si fuera Poisson
El estadístico de Pearson mide, categoría por categoría, cuánto se separan las dos barras — relativizado por el tamaño de la esperada.
χ2=(3126,96)226,96+(1521,57)221,57+(98,63)28,63+(52,84)22,84=4,25\chi^2 = \frac{(31-26{,}96)^2}{26{,}96}+\frac{(15-21{,}57)^2}{21{,}57}+\frac{(9-8{,}63)^2}{8{,}63}+\frac{(5-2{,}84)^2}{2{,}84} = 4{,}25

Como λ\lambda se estimó de la muestra, m=1m=1 y los grados de libertad son k1m=411=2k-1-m = 4-1-1 = 2. El crítico al 5% es 5,9925{,}992, de modo que no se rechaza H0H_0: los datos son compatibles con una Poisson.

Variante instructiva: si el enunciado hubiera dado λ=0,8\lambda=0{,}8 en lugar de exigir estimarlo, el estadístico sería el mismo, 4,254{,}25, pero los grados de libertad serían k1=3k-1=3 y el crítico 7,8157{,}815. El test con el parámetro dado es menos exigente, porque no hubo que pagar la penalización por estimar. Comparar las dos versiones aísla con precisión el efecto de la estimación sobre el test.

Caso C — Normal

Aquí hay un paso adicional, porque la normal es continua y va de -\infty a ++\infty: hay que partirla en intervalos.

  1. Estimar los parámetros a partir de los datos agrupados, usando la marca de clase XiX_i —el punto medio de cada intervalo— y su frecuencia fif_i:
μ^=Xˉ=1nXifiσ^=S=1n1(XiXˉ)2fi\hat\mu = \bar{X} = \frac{1}{n}\sum X_i f_i \qquad \hat\sigma = S = \sqrt{\frac{1}{n-1}\sum (X_i-\bar{X})^2 f_i}
  1. Definir los intervalos, habitualmente de igual ancho.
  2. Calcular las PiP_i como el área de la normal en cada intervalo, estandarizando los límites y restando acumuladas:
Pi=Φ ⁣(LsupXˉS)Φ ⁣(LinfXˉS)P_i = \Phi\!\left(\frac{L_{sup}-\bar{X}}{S}\right)-\Phi\!\left(\frac{L_{inf}-\bar{X}}{S}\right)
  1. Como se estimaron dos parámetros, m=2m=2 y los grados de libertad son k3k-3.

Un detalle del tercer paso: el primer intervalo se integra desde -\infty y el último hasta ++\infty, aunque los datos vayan de 0 a 100. Las colas de la normal tienen que ir a algún lado; si se usan los límites literales, las PiP_i no suman 1 y las esperadas no suman nn.

Ejemplo. Calificaciones de 0 a 100 de 188 participantes, agrupadas en 6 intervalos de igual ancho. De los datos agrupados se obtienen μ^=57,71\hat\mu = 57{,}71 y σ^=13,94\hat\sigma = 13{,}94.

Intervalo[;16,67)[-\infty;\,16{,}67)[16,67;33,33)[16{,}67;\,33{,}33)[33,33;50)[33{,}33;\,50)[50;66,67)[50;\,66{,}67)[66,67;83,33)[66{,}67;\,83{,}33)[83,33;+)[83{,}33;\,+\infty)
Observada244197404
PiP_i0,00160,03850,25000,44970,22710,0330
Esperada0,317,2446,9984,5542,706,21
Aporte al χ2\chi^29,441,450,761,840,170,79
χ2=14,45\chi^2 = 14{,}45

Con k12=3k-1-2 = 3 grados de libertad, el crítico al 5% es 7,8157{,}815: se rechazaría H0H_0.

Pero conviene mirar la última fila antes de aceptar esa conclusión. La primera categoría tiene frecuencia esperada 0,31 y aporta 9,44 de los 14,45, es decir dos tercios del estadístico. Es exactamente la situación que la condición de §40 previene: una categoría casi vacía domina el resultado.

Agrupando las dos primeras categorías —observada 2+4=62+4=6, esperada 0,31+7,24=7,550{,}31+7{,}24=7{,}55— quedan k=5k=5 categorías y el estadístico cae a χ2=3,88\chi^2 = 3{,}88 con 512=25-1-2=2 grados de libertad, contra un crítico de 5,9925{,}992: ya no se rechaza. La conclusión del test se invierte por completo según se aplique o no la condición sobre las frecuencias esperadas, lo que muestra que no es un tecnicismo prescindible.

Caso D — Exponencial

Como la función de distribución acumulada tiene forma cerrada,

F(x)=1eλx,μ=1λF(x) = 1-e^{-\lambda x}, \qquad \mu = \frac{1}{\lambda}

las probabilidades salen directamente por diferencia de acumuladas:

Pi=F(Lsup)F(Linf)P_i = F(L_{sup})-F(L_{inf})

y la última categoría, por complemento, Puˊltima=1F(Linf)P_{\text{última}} = 1-F(L_{inf}).

Por ejemplo, si el tiempo medio entre eventos es 17 y el primer intervalo llega hasta 8:

P1=F(8)=1e8/17=0,3754P_1 = F(8) = 1-e^{-8/17} = 0{,}3754

El exponente lleva signo negativo; con signo positivo el resultado sería negativo, y una probabilidad no puede serlo.


42. Tablas de contingencia

La pregunta

Dadas dos variables categóricas medidas sobre los mismos individuos —tipo de cliente y cumplimiento de plazos, turno y productividad, medio publicitario y nivel de gasto—, ¿están relacionadas o son independientes?

H0:las dos variables son independientesHa:hay dependenciaH_0: \text{las dos variables son independientes} \qquad\qquad H_a: \text{hay dependencia}

La hipótesis nula es siempre la independencia, con el mismo espíritu que la presunción de inocencia: se supone que no hay relación y se le exige a los datos que demuestren lo contrario.

De dónde salen las frecuencias esperadas

Del propio significado de independencia. Si dos sucesos son independientes,

P(AB)=P(A)P(B)P(A\cap B) = P(A)\cdot P(B)

Estimando cada probabilidad marginal con los totales de la tabla —fif_i el total de la fila ii, cjc_j el de la columna jj, nn el total general—:

Eij=nP(AiBj)=nfincjn=ficjnE_{ij} = n\cdot P(A_i\cap B_j) = n\cdot\frac{f_i}{n}\cdot\frac{c_j}{n} = \boxed{\frac{f_i\cdot c_j}{n}}

es decir, (total de la fila) × (total de la columna) / (total general). La tabla de esperados es literalmente "cómo se vería la tabla si las variables fueran independientes".

De la construcción se sigue el control natural: la tabla de esperados debe tener los mismos totales marginales que la de observados, fila por fila y columna por columna.

El estadístico y los grados de libertad

χ2=ij(nobsijnespij)2nespij  χ(F1)(C1)2\chi^2 = \sum_i\sum_j \frac{(n_{obs\,ij}-n_{esp\,ij})^2}{n_{esp\,ij}} \ \sim\ \chi^2_{(F-1)(C-1)} g.l.=(#filas1)(#columnas1)\boxed{g.l. = (\#\text{filas}-1)(\#\text{columnas}-1)}

La fórmula de los grados de libertad sale del mismo razonamiento de siempre: una vez fijados los totales marginales, no todas las celdas son libres. En una tabla F×CF\times C se pueden elegir libremente las de un bloque de (F1)×(C1)(F-1)\times(C-1), y el resto queda determinado por las sumas.

El test es también de cola derecha, por el mismo motivo que la bondad de ajuste: solo los apartamientos grandes son evidencia contra H0H_0.

Ejemplo. Se registran 180 clientes corporativos según su rubro y si cumplen o no los plazos de pago:

CumpleNo cumpleTotal
Industrial503080
Comercial401050
Servicios252550
Total11565180

Las frecuencias esperadas bajo independencia, por ejemplo para la primera celda:

E11=80115180=51,11E_{11} = \frac{80\cdot 115}{180} = 51{,}11
EsperadosCumpleNo cumpleTotal
Industrial51,1128,8980
Comercial31,9418,0650
Servicios31,9418,0650
Total11565180

Los totales marginales coinciden con los observados, como debe ser.

χ2=(5051,11)251,11+(3028,89)228,89++(2518,06)218,06=9,87\chi^2 = \frac{(50-51{,}11)^2}{51{,}11}+\frac{(30-28{,}89)^2}{28{,}89}+\cdots+\frac{(25-18{,}06)^2}{18{,}06} = 9{,}87

Con (31)(21)=2(3-1)(2-1)=2 grados de libertad y crítico χ0,05;22=5,992\chi^2_{0,05;\,2}=5{,}992: como 9,87>5,999{,}87 > 5{,}99, se rechaza la independencia. El pp-value es 0,00720{,}0072, de modo que la conclusión se sostiene incluso al 1%.

Residuos estandarizados

El estadístico dice si hay dependencia, pero no dónde está. Para localizarla se miran los residuos celda por celda:

rij=nobsijnespijnespijr_{ij} = \frac{n_{obs\,ij}-n_{esp\,ij}}{\sqrt{n_{esp\,ij}}}

Las celdas con residuo grande en valor absoluto son las que más se apartan de la independencia, y el signo indica la dirección: positivo significa que hay más casos de los que corresponderían al azar.

En el ejemplo:

ResiduosCumpleNo cumple
Industrial0,16-0{,}160,210{,}21
Comercial1,431{,}431,90-1{,}90
Servicios1,23-1{,}231,631{,}63

La dependencia no está repartida de manera uniforme. Los clientes industriales se comportan prácticamente como predice la independencia; la relación proviene de los otros dos rubros, que se apartan en direcciones opuestas: los comerciales cumplen más de lo esperado y los de servicios menos. Esa lectura es la que convierte un rechazo en una conclusión sustantiva.

Diferencia con la bondad de ajuste

Bondad de ajusteIndependencia
Compara contrauna distribución teóricala tabla que habría bajo independencia
Los esperados salen denPin\cdot P_i, con PiP_i del modelolos propios totales marginales
Grados de libertadk1mk-1-m(F1)(C1)(F-1)(C-1)

El estadístico es el mismo y la cola es la misma; lo que cambia es el origen de las frecuencias esperadas. En la bondad de ajuste vienen de un modelo externo; en la independencia, de los propios datos.


Parte VII · Análisis de la varianza


43. ANOVA de un factor

La pregunta

Comparar kk medias simultáneamente: ¿los cuatro vendedores venden lo mismo? ¿los tres fertilizantes rinden igual? Los grupos que se comparan se llaman tratamientos, y son los niveles del factor bajo estudio.

H0:μ1=μ2==μkHa:al menos dos difierenH_0: \mu_1=\mu_2=\cdots=\mu_k \qquad\qquad H_a: \text{al menos dos difieren}

Igual que en §41, HaH_a nunca es "todas son distintas": alcanza con que se rompa una igualdad.

Por qué no se hacen tests tt de a pares

La alternativa ingenua sería comparar todos los pares con tests tt. El problema es la acumulación del error de tipo I. Con k=4k=4 tratamientos hay 6 pares, y si cada test se hace al 5%, la probabilidad de que al menos uno dé un falso positivo es

10,95626%1-0{,}95^6 \approx 26\%

Uno de cada cuatro estudios "encontraría" una diferencia inexistente. El análisis de la varianza responde la misma pregunta con un solo test al nivel α\alpha deseado.

El modelo

Yij=μ+τjμj+εij,εijN(0;σ2)Y_{ij} = \underbrace{\mu+\tau_j}_{\mu_j}+\varepsilon_{ij}, \qquad \varepsilon_{ij}\sim N(0;\sigma^2)

Cada observación se explica por una media global μ\mu, más el efecto del tratamiento τj\tau_j al que pertenece, más un error aleatorio. Bajo H0H_0 todos los τj\tau_j valen cero, y entonces todas las observaciones provienen de la misma distribución.

Los supuestos son tres: normalidad de los errores, igual varianza σ2\sigma^2 en todos los grupos (homocedasticidad) e independencia. El segundo es el que suele fallar en la práctica.

Notación

El punto reemplaza al índice sobre el que se sumó:

Yˉ=1NjiYij  (media general)Yˉj=1njiYij  (media del tratamiento j)\bar{Y}_{\cdot\cdot} = \frac{1}{N}\sum_j\sum_i Y_{ij} \ \ \text{(media general)} \qquad \bar{Y}_{\cdot j} = \frac{1}{n_j}\sum_i Y_{ij}\ \ \text{(media del tratamiento } j)

con N=jnjN = \sum_j n_j el total de observaciones y kk la cantidad de tratamientos. Los grupos no necesitan tener el mismo tamaño.

La descomposición

Es el corazón del método, y arranca de una identidad que consiste en sumar y restar la misma cantidad:

YijYˉ=(YˉjYˉ)entre grupos+(YijYˉj)dentro del grupoY_{ij}-\bar{Y}_{\cdot\cdot} = \underbrace{(\bar{Y}_{\cdot j}-\bar{Y}_{\cdot\cdot})}_{\text{entre grupos}}+\underbrace{(Y_{ij}-\bar{Y}_{\cdot j})}_{\text{dentro del grupo}}

El apartamiento de una observación respecto de la media general se parte en dos: cuánto se aparta su grupo del total, y cuánto se aparta ella de su propio grupo. Elevando al cuadrado y sumando sobre todo i,ji,j, el doble producto se anula —por la misma razón que en §11: la suma de desviaciones respecto de una media es cero— y queda la expresión fundamental del análisis de la varianza:

ji(YijYˉ)2=ji(YˉjYˉ)2+ji(YijYˉj)2\sum_j\sum_i (Y_{ij}-\bar{Y}_{\cdot\cdot})^2 = \sum_j\sum_i(\bar{Y}_{\cdot j}-\bar{Y}_{\cdot\cdot})^2+\sum_j\sum_i(Y_{ij}-\bar{Y}_{\cdot j})^2 STC=SCTR+SCE\boxed{STC = SCTR + SCE}
TérminoNombreQué mide
STCSTCSuma Total de Cuadradosla variabilidad total de los datos
SCTRSCTRSuma de Cuadrados de TRatamientoscuánto se separan entre sí las medias de los grupos
SCESCESuma de Cuadrados del Errorcuánto varían los datos dentro de cada grupo

En una frase: la variabilidad total se parte en la que el tratamiento explica y la que no. Si la primera es grande respecto de la segunda, el tratamiento importa.

media generalT1T2T3Mucha dispersión dentro de cada grupoF ≈ 1 → no se rechaza H₀media generalT1T2T3Poca dispersión dentro de cada grupoF grande → se rechaza H₀
ANOVA compara la variabilidad entre grupos contra la variabilidad dentro de cada grupo. Medias de grupo parecidas llevan a conclusiones opuestas según cuánto ruido interno haya.

Es la misma estructura de la relación de Cochran (§11), ahora con kk grupos en lugar de uno.

Las distribuciones y el estadístico

Dividiendo cada término por σ2\sigma^2, los tres son χ2\chi^2:

STCσ2χN12SCTRσ2χk12SCEσ2χNk2\frac{STC}{\sigma^2}\sim\chi^2_{N-1} \qquad \frac{SCTR}{\sigma^2}\sim\chi^2_{k-1} \qquad \frac{SCE}{\sigma^2}\sim\chi^2_{N-k}

y los grados de libertad se descomponen igual que las sumas: N1=(k1)+(Nk)N-1 = (k-1)+(N-k).

Los cuadrados medios son las sumas divididas por sus grados de libertad —es decir, varianzas—, y su cociente es el estadístico:

CMTR=SCTRk1CME=SCENkFtest=CMTRCME  Fk1;NkCMTR = \frac{SCTR}{k-1} \qquad CME = \frac{SCE}{N-k} \qquad \boxed{F_{\text{test}} = \frac{CMTR}{CME}\ \sim\ F_{k-1;\,N-k}}

Por qué el test es de cola derecha. El CMECME estima σ2\sigma^2 haya o no efecto de tratamiento: mide la variabilidad interna de los grupos, que no depende de dónde estén centrados. El CMTRCMTR, en cambio, estima σ2\sigma^2 más el efecto de los tratamientos. Si H0H_0 es cierta los dos estiman lo mismo y el cociente ronda 1; si hay efecto, el numerador crece. Solo los valores grandes constituyen evidencia en contra.

Como corolario, un F<1F<1 indica que las medias de los grupos están más juntas de lo que la variabilidad interna haría esperar, lo cual es una señal clara de ausencia de efecto.

La tabla ANOVA

FuenteS.C.G.L.C.M.FF
TratamientosSCTRSCTRk1k-1SCTR/(k1)SCTR/(k-1)CMTR/CMECMTR/CME
ErrorSCESCENkN-kSCE/(Nk)SCE/(N-k)
TotalSTCSTCN1N-1

Las columnas de sumas de cuadrados y de grados de libertad tienen que sumar el total. Esa propiedad permite completar cualquier casillero faltante y sirve como verificación del resto.

Fórmulas de cálculo

En la práctica no se calculan las desviaciones una por una. Con Tj=iYijT_{\cdot j} = \sum_i Y_{ij} el total del tratamiento jj y TT_{\cdot\cdot} el total general:

STC=ijYij2T2NSCTR=jTj2njT2NSTC = \sum_{\forall ij} Y_{ij}^2 - \frac{T_{\cdot\cdot}^2}{N} \qquad\qquad SCTR = \sum_{\forall j}\frac{T_{\cdot j}^2}{n_j}-\frac{T_{\cdot\cdot}^2}{N} SCE=STCSCTR(no hace falta calcularla aparte)SCE = STC-SCTR \quad (\text{no hace falta calcularla aparte})

El término T2/NT_{\cdot\cdot}^2/N es el mismo en las dos fórmulas y se calcula una sola vez. Dos controles inmediatos: STC>0STC>0 siempre, por ser una suma de cuadrados, y 0SCTRSTC0\leq SCTR\leq STC, por ser una parte del total.

Ejemplo. Cuatro vendedores, con distinta cantidad de observaciones cada uno:

V1V_1V2V_2V3V_3V4V_4
1232
5112
223
34
TjT_{\cdot j}115114
njn_j4342

Con k=4k=4, N=13N=13, T=31T_{\cdot\cdot}=31 y Yij2=91\sum\sum Y_{ij}^2 = 91:

STC=9131213=9173,92=17,08STC = 91-\frac{31^2}{13} = 91-73{,}92 = 17{,}08 SCTR=1124+523+1124+42273,92=76,8373,92=2,91SCTR = \frac{11^2}{4}+\frac{5^2}{3}+\frac{11^2}{4}+\frac{4^2}{2}-73{,}92 = 76{,}83-73{,}92 = 2{,}91 SCE=17,082,91=14,17SCE = 17{,}08-2{,}91 = 14{,}17
FuenteS.C.G.L.C.M.FF
Tratamientos2,9130,970,62
Error14,1791,57
Total17,0812

El crítico es F0,05;3,9=3,86F_{0,05;\,3,9} = 3{,}86. Como 0,62<3,860{,}62 < 3{,}86, no se rechaza H0H_0: no hay evidencia de que los vendedores difieran.

El valor del estadístico dice algo más que "no se rechaza". Al ser menor que 1, indica que las medias de los cuatro vendedores están más próximas entre sí de lo que la variabilidad de cada uno haría esperar: la dispersión interna de cada vendedor supera holgadamente a la que hay entre ellos.


44. ANOVA de dos factores

La pregunta

Ahora intervienen dos factores simultáneamente —por ejemplo método de venta y zona geográfica— y se quiere conocer el efecto de cada uno y si se potencian entre sí.

Yijk=μ+αi+βj+(αβ)ij+εijkY_{ijk} = \mu+\alpha_i+\beta_j+(\alpha\beta)_{ij}+\varepsilon_{ijk}

Con aa niveles del factor A, bb niveles del factor B y nn repeticiones por celda, el total es N=abnN = a\cdot b\cdot n.

Las tres hipótesis

H01:todos los niveles del factor A tienen la misma mediaH_{01}: \text{todos los niveles del factor A tienen la misma media} H02:todos los niveles del factor B tienen la misma mediaH_{02}: \text{todos los niveles del factor B tienen la misma media} H03:no hay interaccioˊn entre A y BH_{03}: \text{no hay interacción entre A y B}

Qué es la interacción. Es el efecto que no se explica sumando los efectos por separado: que un método funcione bien en una zona y mal en otra. Sin interacción, el mejor método es el mejor en todas las zonas y basta con nombrarlo; con interacción, la respuesta correcta es "depende".

La tabla

FuenteG.L.FF
Factor Aa1a-1CMA/CMECM_A/CM_E
Factor Bb1b-1CMB/CMECM_B/CM_E
Interacción A×B(a1)(b1)(a-1)(b-1)CMAB/CMECM_{AB}/CM_E
Errorab(n1)ab(n-1)
TotalN1=abn1N-1 = abn-1

Los tres estadísticos FF se dividen por el mismo CMECM_E. Y de nuevo, las columnas de sumas de cuadrados y de grados de libertad deben sumar el total, lo que permite despejar casilleros faltantes.

El orden de los tests

Primero se contrasta la interaccioˊn.\textbf{Primero se contrasta la interacción.}

Este orden no es una convención sino una necesidad lógica:

  • Si la interacción es significativa (se rechaza H03H_{03}), los efectos principales no se pueden interpretar por separado. Afirmar "el método A es el mejor" carece de sentido si depende de la zona. La conclusión es que ambos factores actúan conjuntamente, y los dos tests restantes pierden interés.
  • Si la interacción no es significativa, recién entonces tiene sentido examinar cada factor por su cuenta con su propio FF.

Ejemplo. Tres métodos de venta, dos zonas, dos repeticiones por celda: a=3a=3, b=2b=2, n=2n=2, N=12N=12.

FuenteS.C.G.L.C.M.FF
Método24,67212,3331,75
Zona3,0013,007,73
Interacción6,0023,007,73
Error2,3360,389
Total36,0011

Las columnas cierran: 24,67+3+6+2,33=3624{,}67+3+6+2{,}33 = 36 y 2+1+2+6=112+1+2+6 = 11.

Siguiendo el orden correcto, se contrasta primero la interacción: F=7,73F = 7{,}73 contra F0,05;2,6=5,14F_{0,05;\,2,6}=5{,}14. Como lo supera, hay interacción, y por lo tanto los efectos de método y zona no pueden interpretarse aisladamente, aunque los dos den significativos. La conclusión sustantiva es que el método más conveniente depende de la zona.


45. La relación entre tt, FF y ANOVA

Cuando hay solo dos tratamientos (k=2k=2), el análisis de la varianza y el test tt de diferencia de medias son el mismo test. La relación exacta ya apareció en §12:

tv2=F1;v\boxed{t^2_{\,v} = F_{1;\,v}}

y sale directamente de la definición de la tt:

Tv=Zχv2/vTv2=Z2χv2/v=χ12/1χv2/v=F1;vT_v = \frac{Z}{\sqrt{\chi^2_v/v}} \quad\Longrightarrow\quad T_v^2 = \frac{Z^2}{\chi^2_v/v} = \frac{\chi^2_1/1}{\chi^2_v/v} = F_{1;\,v}

usando Z2χ12Z^2\sim\chi^2_1 de §3. Con k=2k=2 los grados de libertad calzan: k1=1k-1=1 y Nk=n1+n22N-k = n_1+n_2-2.

Un ejemplo que lo verifica

Dos tratamientos con las siguientes observaciones:

Tratamiento 1Tratamiento 2
4, 5, 3, 6, 53, 4, 4, 5
n1=5n_1=5, T1=23T_1=23n2=4n_2=4, T2=16T_2=16

Por la vía del ANOVA. Con N=9N=9, T=39T_{\cdot\cdot}=39 y Yij2=177\sum\sum Y_{ij}^2 = 177:

STC=1773929=177169=8STC = 177-\frac{39^2}{9} = 177-169 = 8 SCTR=2325+1624169=105,8+64169=0,8SCE=80,8=7,2SCTR = \frac{23^2}{5}+\frac{16^2}{4}-169 = 105{,}8+64-169 = 0{,}8 \qquad SCE = 8-0{,}8 = 7{,}2 CMTR=0,81=0,8CME=7,27=1,0286Ftest=0,81,0286=0,7778CMTR = \frac{0{,}8}{1} = 0{,}8 \qquad CME = \frac{7{,}2}{7} = 1{,}0286 \qquad F_{\text{test}} = \frac{0{,}8}{1{,}0286} = 0{,}7778

Contra F0,05;1,7=5,591F_{0,05;\,1,7} = 5{,}591, no se rechaza H0H_0.

Por la vía del test tt. Las medias son Xˉ=4,6\bar{X}=4{,}6 y Yˉ=4\bar{Y}=4. Calculando las varianzas con la fórmula abreviada de §10:

S1,n2=11154,62=1,04  S12=1,0454=1,30S_{1,n}^2 = \frac{111}{5}-4{,}6^2 = 1{,}04 \ \Rightarrow\ S_1^2 = 1{,}04\cdot\frac{5}{4} = 1{,}30 S2,n2=66442=0,50  S22=0,5043=0,6667S_{2,n}^2 = \frac{66}{4}-4^2 = 0{,}50 \ \Rightarrow\ S_2^2 = 0{,}50\cdot\frac{4}{3} = 0{,}6667 Sp2=41,30+30,66677=7,27=1,0286S_p^2 = \frac{4\cdot 1{,}30+3\cdot 0{,}6667}{7} = \frac{7{,}2}{7} = 1{,}0286 ttest=(4,64)01,028615+14=0,60,6803=0,8819t_{\text{test}} = \frac{(4{,}6-4)-0}{\sqrt{1{,}0286}\sqrt{\frac{1}{5}+\frac{1}{4}}} = \frac{0{,}6}{0{,}6803} = 0{,}8819

Contra ±t0,025;7=±2,365\pm t_{0,025;\,7} = \pm 2{,}365, tampoco se rechaza.

La verificación. Las dos vías coinciden en tres puntos, no solo en el veredicto:

(0,8819)2=0,7777=FtestSp2=1,0286=CMEp-value=0,4071 en ambos(0{,}8819)^2 = 0{,}7777 = F_{\text{test}} \qquad\qquad S_p^2 = 1{,}0286 = CME \qquad\qquad p\text{-value} = 0{,}4071 \ \text{en ambos}

La coincidencia Sp2=CMES_p^2 = CME no es casual y explica por qué los dos tests son el mismo: la varianza ponderada de §24 y el cuadrado medio del error de §43 son la misma cantidad —la variabilidad interna de los grupos, estimada juntando toda la información disponible—, escrita con dos notaciones distintas.

Que ambos caminos deban dar exactamente lo mismo proporciona una verificación gratuita cuando un problema con dos grupos se resuelve por las dos vías: si no coinciden, hay un error de cálculo en alguna de ellas.

Para el intervalo de confianza correspondiente, con los mismos datos:

int/μ1μ2=0,6±2,3650,6803=0,6±1,61=(1,01; 2,21)\text{int}/\mu_1-\mu_2 = 0{,}6 \pm 2{,}365\cdot 0{,}6803 = 0{,}6\pm 1{,}61 = (-1{,}01\,;\ 2{,}21)

que contiene al cero, en línea con los dos tests, como garantizaba la dualidad de §39.


Parte VIII · Regresión lineal


46. El modelo

Con la regresión cambia la pregunta. Hasta aquí se comparaban grupos —¿son distintas estas medias?—; ahora se estudia cómo una variable se mueve con otra: ¿cómo cambia yy cuando cambia xx?

y=β0+β1xparte determinıˊsticay^+εparte aleatoriay = \underbrace{\beta_0+\beta_1 x}_{\substack{\text{parte determinística}\\ \hat{y}}}+\underbrace{\varepsilon}_{\text{parte aleatoria}}
  • y^=β0+β1x\hat{y} = \beta_0+\beta_1 x es lo que el modelo predice: la recta.
  • ε\varepsilon es lo que el modelo no explica: el residuo.
  • β1\beta_1 es la pendiente, cuánto cambia yy por cada unidad que aumenta xx. Es el parámetro de interés.
  • β0\beta_0 es la ordenada al origen, el valor de yy cuando x=0x=0. Con frecuencia carece de interpretación sustantiva, porque x=0x=0 queda fuera del rango de los datos.

La variable xx se llama explicativa o independiente, e yy respuesta o dependiente. Los papeles no son intercambiables: la recta de yy sobre xx no es la misma que la de xx sobre yy.

Los supuestos

εN(0;σ2)\varepsilon\sim N(0;\sigma^2)

Esta línea condensa cuatro condiciones:

  1. E(ε)=0E(\varepsilon)=0 — el modelo no está sistemáticamente corrido. De aquí se sigue, tomando esperanzas en la ecuación del modelo, que Yˉ=β0+β1Xˉ\bar{Y} = \beta_0+\beta_1\bar{X}: la recta pasa por el punto de medias (Xˉ,Yˉ)(\bar{X},\bar{Y}).
  2. Varianza constante σ2\sigma^2 — la dispersión alrededor de la recta es la misma para todo xx. Se llama homocedasticidad, y se visualiza como campanas de Gauss del mismo ancho apoyadas sobre cada punto de la recta. Si la nube se abre en abanico a medida que crece xx, hay heterocedasticidad y el modelo pierde confiabilidad.
  3. Normalidad de los errores.
  4. Independencia entre los errores.
El residuo es verticalMínimos cuadrados elige la recta que minimizala suma de esas distancias al cuadradoxyHomocedasticidadTodas las campanas tienen el mismo ancho.Si se abren en abanico, el modelo no es confiable
Los dos supuestos que sostienen la regresión por mínimos cuadrados.

El plan de trabajo

1. Hallar β0 y β1(el modelo)2. Juzgar si el modelo es bueno(R2, error tıˊpico)\textbf{1. Hallar } \beta_0 \textbf{ y } \beta_1 \quad(\text{el modelo}) \qquad\qquad \textbf{2. Juzgar si el modelo es bueno} \quad(R^2,\ \text{error típico})

Las dos secciones siguientes se ocupan de cada paso.


47. Estimación por mínimos cuadrados

El criterio

Cada residuo es la distancia vertical entre el dato y la recta:

εi=Yiβ0β1xi\varepsilon_i = Y_i-\beta_0-\beta_1 x_i

Se buscan los coeficientes que cumplan dos condiciones:

iεi=0iεi2=mıˊnimo\sum_i \varepsilon_i = 0 \qquad\wedge\qquad \sum_i \varepsilon_i^2 = \text{mínimo}

La primera condición por sí sola no determina la recta: hay infinitas rectas cuyos errores se compensan. Es la segunda la que fija una. Y hay tres razones para elevar al cuadrado en lugar de tomar valor absoluto: evita que los errores positivos y negativos se cancelen, penaliza más los errores grandes, y produce una función derivable, lo que permite resolver el problema analíticamente. Este último punto es el decisivo.

La derivación

Se define

g(β0,β1)=i(Yiβ0β1xi)2g(\beta_0,\beta_1) = \sum_i (Y_i-\beta_0-\beta_1 x_i)^2

y se anulan las derivadas parciales:

gβ0=i2(Yiβ0β1xi)(1)=0\frac{\partial g}{\partial\beta_0} = \sum_i 2(Y_i-\beta_0-\beta_1x_i)(-1) = 0 gβ1=i2(Yiβ0β1xi)(xi)=0\frac{\partial g}{\partial\beta_1} = \sum_i 2(Y_i-\beta_0-\beta_1x_i)(-x_i) = 0

Simplificando el 2 y distribuyendo las sumatorias se obtienen las ecuaciones normales:

nβ0+β1ixi=iYiβ0ixi+β1ixi2=ixiYi\boxed{\begin{aligned} n\,\beta_0+\beta_1\sum_i x_i &= \sum_i Y_i \\ \beta_0\sum_i x_i+\beta_1\sum_i x_i^2 &= \sum_i x_iY_i\end{aligned}}

Es un sistema lineal de 2×22\times 2 que se resuelve por sustitución. Todo lo que hace falta calcular son cuatro sumas: x\sum x, y\sum y, x2\sum x^2 y xy\sum xy. Obsérvese que el coeficiente de β1\beta_1 en la segunda ecuación es xi2\sum x_i^2, la suma de los cuadrados, y no (xi)2(\sum x_i)^2.

Nótese también que la primera ecuación, dividida por nn, es exactamente Yˉ=β0+β1Xˉ\bar{Y} = \beta_0+\beta_1\bar{X}: la condición de que la recta pase por el punto de medias no es un supuesto adicional sino una consecuencia del criterio.

La vía de la covarianza

Resolviendo el sistema en general se llega a fórmulas cerradas:

β1=σxyσx2=ρσyσxβ0=Yˉβ1Xˉ\boxed{\beta_1 = \frac{\sigma_{xy}}{\sigma_x^2} = \rho\,\frac{\sigma_y}{\sigma_x}} \qquad\qquad \boxed{\beta_0 = \bar{Y}-\beta_1\bar{X}}

con

σxy=Cov(x,y)=E(XY)E(X)E(Y)=1nxiyiXˉYˉ\sigma_{xy} = \text{Cov}(x,y) = E(XY)-E(X)E(Y) = \frac{1}{n}\sum x_iy_i-\bar{X}\bar{Y} ρ=Cov(x,y)σ(x)σ(y),1ρ1\rho = \frac{\text{Cov}(x,y)}{\sigma(x)\,\sigma(y)}, \qquad -1\leq\rho\leq 1

Sobre el factor n/(n1)n/(n-1). Las expresiones de σx2\sigma_x^2, σy2\sigma_y^2 y σxy\sigma_{xy} calculadas como "media de productos menos producto de medias" dan las versiones sesgadas; multiplicarlas por n/(n1)n/(n-1) las convierte en insesgadas. Como en β1=σxy/σx2\beta_1 = \sigma_{xy}/\sigma_x^2 el factor aparece arriba y abajo, se cancela, y β1\beta_1 da lo mismo con cualquiera de las dos convenciones. Lo mismo ocurre con ρ\rho. Donde sí importa es en el error típico de §48, y en cualquier caso conviene ser consistente.

Las dos vías —resolver el sistema de ecuaciones normales, o usar ρσy/σx\rho\,\sigma_y/\sigma_x— conducen exactamente a la misma recta, de modo que calcular por ambas es una verificación disponible sin costo.

Interpretación de ρ\rho

  • El signo indica la dirección de la relación. ρ\rho y β1\beta_1 tienen siempre el mismo signo, porque los desvíos son positivos.
  • La magnitud indica el grado de alineación: ρ|\rho| cerca de 1 significa puntos casi sobre una recta; cerca de 0, una nube sin dirección.
  • ρ\rho mide relación lineal únicamente. Puede dar cercano a cero ante una relación fortísima pero curva —una parábola simétrica, por ejemplo, tiene ρ=0\rho = 0.
  • Correlación no implica causalidad. Una asociación estadística puede deberse a que xx influya sobre yy, a que yy influya sobre xx, a una tercera variable que afecte a ambas, o al azar.

Un ejemplo completo

Sean cuatro observaciones:

xx1235
yy4123

Las sumas necesarias son n=4n=4, x=11\sum x = 11, y=10\sum y = 10, xy=27\sum xy = 27, x2=39\sum x^2 = 39.

Por las ecuaciones normales:

{4β0+11β1=1011β0+39β1=27\begin{cases} 4\beta_0+11\beta_1 = 10 \\ 11\beta_0+39\beta_1 = 27\end{cases}

De la primera, β0=(1011β1)/4\beta_0 = (10-11\beta_1)/4. Sustituyendo en la segunda y despejando:

35β1=2β1=235=0,0571β0=9335=2,657135\beta_1 = -2 \quad\Longrightarrow\quad \beta_1 = -\frac{2}{35} = -0{,}0571 \qquad \beta_0 = \frac{93}{35} = 2{,}6571

Por la vía de la covarianza. Con Xˉ=2,75\bar{X}=2{,}75, Yˉ=2,5\bar{Y}=2{,}5 y XY=27/4=6,75\overline{XY} = 27/4 = 6{,}75, y aplicando el factor n/(n1)=4/3n/(n-1) = 4/3 para obtener las versiones insesgadas:

σxy=(6,752,752,5)43=0,12543=0,1667\sigma_{xy} = (6{,}75-2{,}75\cdot 2{,}5)\cdot\tfrac{4}{3} = -0{,}125\cdot\tfrac43 = -0{,}1667 σx2=(3942,752)43=2,9167σy2=(3042,52)43=1,6667\sigma_x^2 = \left(\tfrac{39}{4}-2{,}75^2\right)\tfrac43 = 2{,}9167 \qquad \sigma_y^2 = \left(\tfrac{30}{4}-2{,}5^2\right)\tfrac43 = 1{,}6667 ρ=0,16672,91671,6667=0,16672,2048=0,0756\rho = \frac{-0{,}1667}{\sqrt{2{,}9167}\sqrt{1{,}6667}} = \frac{-0{,}1667}{2{,}2048} = -0{,}0756 β1=ρσyσx=0,07561,29101,7078=0,0571β0=2,5(0,0571)(2,75)=2,6571\beta_1 = \rho\,\frac{\sigma_y}{\sigma_x} = -0{,}0756\cdot\frac{1{,}2910}{1{,}7078} = -0{,}0571 \qquad \beta_0 = 2{,}5-(-0{,}0571)(2{,}75) = 2{,}6571

Los dos caminos coinciden hasta la última cifra, como debía ocurrir. La recta ajustada es

y^=2,65710,0571x\hat{y} = 2{,}6571-0{,}0571\,x

y la correlación, 0,0756-0{,}0756, es prácticamente nula: la pendiente negativa existe pero es despreciable frente a la dispersión de los datos. La sección siguiente cuantifica exactamente cuán poco explica este modelo.


48. Bondad del ajuste: R2R^2 y error típico

La descomposición de la varianza

Partiendo de Y=β0+β1X+εY = \beta_0+\beta_1X+\varepsilon y tomando varianzas —con β0\beta_0 constante, de modo que σ2(β0)=0\sigma^2(\beta_0)=0, y xx independiente de ε\varepsilon por los supuestos de §46:

σ2(Y)=β12σ2(X)+σ2(ε)\sigma^2(Y) = \beta_1^2\,\sigma^2(X)+\sigma^2(\varepsilon)

La variabilidad de yy se parte en dos: la que proviene de la variabilidad de xx transmitida por la pendiente, y la que proviene del error. Dividiendo todo por σ2(y)\sigma^2(y) para expresarlo en proporciones:

1=[β1σ(x)σ(y)]2lo que el modelo explica+σ2(ε)σ2(y)lo que queda sin explicar1 = \underbrace{\left[\beta_1\frac{\sigma(x)}{\sigma(y)}\right]^2}_{\text{lo que el modelo explica}}+\underbrace{\frac{\sigma^2(\varepsilon)}{\sigma^2(y)}}_{\text{lo que queda sin explicar}}

Es la misma lógica de la descomposición del ANOVA (§43): variabilidad total igual a variabilidad explicada más variabilidad residual.

El coeficiente de determinación

R2=[β1σ(x)σ(y)]2=ρ2\boxed{R^2 = \left[\beta_1\frac{\sigma(x)}{\sigma(y)}\right]^2 = \rho^2}

Es la proporción de la variabilidad de yy que el modelo explica. Un R2=0,87R^2 = 0{,}87 significa que el 87% de la variación observada en yy queda explicada por xx, y el 13% restante es ruido.

  • 0R210\leq R^2\leq 1 siempre, por ser a la vez un cuadrado y una proporción.
  • R2=1R^2=1: ajuste perfecto, todos los puntos sobre la recta.
  • R2=0R^2=0: la recta no aporta nada; predecir con Yˉ\bar{Y} sería igual de bueno.

La identidad R2=ρ2R^2=\rho^2 tiene una consecuencia que conviene tener presente al interpretar correlaciones: elevar al cuadrado castiga fuertemente los valores intermedios. Una correlación de 0,5, que suena apreciable, corresponde a un R2R^2 de apenas 0,25. En el ejemplo de §47, ρ=0,0756\rho = -0{,}0756 da

R2=(0,0756)2=0,0057=0,57%R^2 = (-0{,}0756)^2 = 0{,}0057 = 0{,}57\%

El modelo explica poco más de medio punto porcentual de la variabilidad de yy: prácticamente nada.

El error típico

Del complemento de la descomposición se despeja la dispersión de los residuos:

1R2=σ2(ε)σ2(y)σ(ε)=[(1R2)σy2]n1n21-R^2 = \frac{\sigma^2(\varepsilon)}{\sigma^2(y)} \quad\Longrightarrow\quad \boxed{\sigma(\varepsilon) = \sqrt{\left[(1-R^2)\,\sigma_y^2\right]\frac{n-1}{n-2}}}

El factor n1n2\frac{n-1}{n-2} es la corrección por grados de libertad. La varianza de los residuos debe dividirse por n2n-2 y no por n1n-1, porque se estimaron dos parámetros, β0\beta_0 y β1\beta_1. Es la misma lógica del n1n-1 en S2S^2 (§10), aplicada dos veces: partiendo de una expresión que ya venía dividida por n1n-1, el factor la reajusta a n2n-2.

El error típico es una medida del ancho de la banda alrededor de la recta, y viene expresado en las unidades de yy. Eso lo hace más interpretable que el R2R^2 a la hora de predecir: dice cuánto se equivoca típicamente el modelo, en la misma escala en que se mide la respuesta.

Con los datos del ejemplo de §47:

σ(ε)=(10,0057)1,666732=2,4857=1,577\sigma(\varepsilon) = \sqrt{(1-0{,}0057)\cdot 1{,}6667\cdot\frac{3}{2}} = \sqrt{2{,}4857} = 1{,}577

Los valores de yy van de 1 a 4, con media 2,5, y el modelo se equivoca típicamente en 1,58 unidades. Las dos medidas concuerdan: el modelo no sirve para predecir.


49. El enfoque matricial y geométrico

Es la misma estimación, reescrita de manera que se generalice a regresión múltiple —varias variables explicativas— y que exhiba el significado geométrico del método de mínimos cuadrados.

Planteo

Cada observación es una ecuación:

β0+β1xi+εi=Yi\beta_0+\beta_1x_i+\varepsilon_i = Y_i

Apilando las nn ecuaciones:

[1x11x21xn]X[β0β1]B=[Y1Y2Yn]Y[ε1ε2εn]εo seaY=XB+ε\underbrace{\begin{bmatrix} 1 & x_1 \\ 1 & x_2 \\ \vdots & \vdots \\ 1 & x_n\end{bmatrix}}_{X}\underbrace{\begin{bmatrix}\beta_0\\\beta_1\end{bmatrix}}_{B} = \underbrace{\begin{bmatrix}Y_1\\Y_2\\\vdots\\Y_n\end{bmatrix}}_{Y}-\underbrace{\begin{bmatrix}\varepsilon_1\\\varepsilon_2\\\vdots\\\varepsilon_n\end{bmatrix}}_{\varepsilon} \qquad\text{o sea}\qquad Y = XB+\varepsilon

La primera columna de XX es de unos: es la que multiplica a β0\beta_0. Agregar variables explicativas consiste simplemente en agregar columnas.

La condición de ortogonalidad y el despeje

La condición que caracteriza a la solución de mínimos cuadrados es que el vector de errores sea ortogonal al espacio de los modelos:

XBε    Xtε=0XB\perp\varepsilon \iff X^t\varepsilon = 0

Con eso, el despeje es directo:

Xt(XB)=Xt(Yε)=XtYXtε=0X^t(XB) = X^t(Y-\varepsilon) = X^tY-\underbrace{X^t\varepsilon}_{=0} (XtX)B=XtYB=(XtX)1XtY(X^tX)B = X^tY \quad\Longrightarrow\quad \boxed{B = (X^tX)^{-1}X^tY}

Una sola fórmula devuelve todos los coeficientes de golpe, sirva para una variable explicativa o para veinte. Multiplicando explícitamente en el caso de dos parámetros se recuperan las ecuaciones normales de §47: XtXX^tX contiene nn, xi\sum x_i y xi2\sum x_i^2, y XtYX^tY contiene Yi\sum Y_i y xiYi\sum x_iY_i.

La interpretación geométrica

Escribiendo el producto por columnas:

XB=β0[111]V1+β1[x1x2xn]V2XB = \beta_0\underbrace{\begin{bmatrix}1\\1\\\vdots\\1\end{bmatrix}}_{\vec{V}_1}+\beta_1\underbrace{\begin{bmatrix}x_1\\x_2\\\vdots\\x_n\end{bmatrix}}_{\vec{V}_2}
  • V1\vec{V}_1 y V2\vec{V}_2 generan un plano dentro de Rn\mathbb{R}^n —en general, un subespacio—: el conjunto de todos los vectores alcanzables por el modelo.
  • YY es un vector que en general no pertenece a ese plano; si perteneciera, el ajuste sería perfecto.
  • XBXB es el punto del plano más cercano a YY, y ε\varepsilon es el vector que los une, perpendicular al plano.
Minimizar εi2 = minimizar ε = proyectar ortogonalmente Y sobre el espacio de los modelos\text{Minimizar } \sum\varepsilon_i^2 \ = \ \text{minimizar } \|\varepsilon\| \ = \ \text{proyectar ortogonalmente } Y \text{ sobre el espacio de los modelos}
espacio de los modelos(todo lo que la recta puede explicar)0Ylos datosXBel ajusteεel errorMinimizar Σεᵢ² es proyectar Y ortogonalmente sobre el plano
La condición Xᵗε = 0 no es un truco algebraico: dice que el error es perpendicular a todo lo que el modelo podría explicar.

Ese es el significado profundo del método: la recta de regresión es la proyección ortogonal de los datos sobre el espacio de los modelos posibles. Y la condición Xtε=0X^t\varepsilon = 0 deja de ser un artificio algebraico: dice que el error es perpendicular a todo lo que el modelo puede explicar. Si no lo fuera, quedaría en el error una componente aprovechable, y el ajuste no sería óptimo.


50. Modelos no lineales linealizables

La idea de fondo del tema no es "trazar una recta" sino transformar los datos hasta que la relación se vuelva lineal, ajustar allí, y volver. Los mínimos cuadrados resuelven bien el problema lineal; cuando la relación no lo es, no se cambia de herramienta sino de escala.

El caso potencial

y=axb ln lny=lna+blnxy = a\cdot x^b \qquad\xrightarrow{\ \ln\ }\qquad \ln y = \ln a+b\ln x

Con el cambio de variables v=lnyv=\ln y, u=lnxu=\ln x:

v=lnaa+bbuv = \underbrace{\ln a}_{a'}+\underbrace{b}_{b'}\,u

Se corre una regresión lineal común de vv contra uu y se deshace la transformación:

a=eab=ba = e^{a'} \qquad b = b'

Obsérvese que el exponente bb se lee directamente como la pendiente, mientras que la constante aa requiere exponenciar.

Las transformaciones habituales

ModeloTransformaciónRegresión lineal de…
Potencial y=axby = a\,x^blogaritmo en ambaslny\ln y contra lnx\ln x
Exponencial y=aebxy = a\,e^{bx}logaritmo en yylny\ln y contra xx
Logarítmico y=a+blnxy = a+b\ln xlogaritmo en xxyy contra lnx\ln x
Hiperbólico y=a+b/xy = a+b/xinversa en xxyy contra 1/x1/x

Cómo se elige

Se ajustan varios modelos y se compara el R2R^2: gana el que explique más. En la práctica conviene mirar primero el diagrama de dispersión, cuya forma sugiere la familia adecuada, probar las transformaciones plausibles y quedarse con el mejor ajuste.

Ejemplo. Cinco observaciones, comparando el modelo lineal contra el potencial:

xx32542
yy2010392813

El modelo lineal ajustado es y^=6,7059+8,9706x\hat{y} = -6{,}7059+8{,}9706\,x, con residuos

xx32542
y^\hat{y}20,2111,2438,1529,1811,24
yy^y-\hat{y}0,21-0{,}211,24-1{,}240,850{,}851,18-1{,}181,761{,}76

cuya suma es cero, como corresponde. Con yˉ=22\bar{y}=22:

SCT=(yiyˉ)2=554SCE=ei2=6,794R2=16,794554=0,9877SCT = \sum(y_i-\bar{y})^2 = 554 \qquad SCE = \sum e_i^2 = 6{,}794 \qquad R^2 = 1-\frac{6{,}794}{554} = 0{,}9877

El modelo potencial, ajustado sobre lny\ln y contra lnx\ln x, da y^=4,5524x1,3285\hat{y} = 4{,}5524\,x^{1,3285} con R2=0,9709R^2 = 0{,}9709 en la escala transformada.

Comparando directamente, 0,9877>0,97090{,}9877 > 0{,}9709 y gana el modelo lineal, que explica el 98,8% de la variabilidad.

Una sutileza sobre esa comparación. El R2R^2 de un modelo transformado mide el ajuste en la escala transformada: cuán bien lny\ln y se explica por lnx\ln x, no cuán bien yy se explica por xx. Para comparar en igualdad de condiciones habría que volver a la escala original y recalcular. En este mismo ejemplo, el R2R^2 del modelo potencial medido sobre yy resulta 0,99040{,}9904, con lo que la comparación se invierte y el potencial pasaría a ganar. La diferencia es menor y no cambia la conclusión práctica —ambos modelos ajustan muy bien—, pero conviene saber que la comparación directa de R2R^2 entre escalas distintas tiene esa limitación.

Además del R2R^2, vale examinar los residuos: si conservan un patrón sistemático —crecen con xx, o dibujan una curva—, el modelo elegido no es el adecuado por más alto que sea el coeficiente de determinación. Y en ningún caso conviene extrapolar fuera del rango de xx observado: la forma funcional se eligió por cómo describe los datos disponibles, y nada garantiza que siga valiendo afuera.


Apéndices


A. Distribuciones utilizadas en el curso

Discretas

Distribuciónp(x)p(x)E(X)E(X)V(X)V(X)MX(t)M_X(t)
Bernoulli(p)(p)pxq1xp^x q^{1-x}, x{0,1}x\in\{0,1\}pppqpqq+petq+pe^t
Binomial(n,p)(n,p)(nx)pxqnx\binom{n}{x}p^xq^{n-x}npnpnpqnpq(q+pet)n(q+pe^t)^n
Poisson(λ)(\lambda)eλλxx!\dfrac{e^{-\lambda}\lambda^x}{x!}λ\lambdaλ\lambdaeλ(et1)e^{\lambda(e^t-1)}
Geométrica(p)(p)qx1pq^{x-1}p, x1x\geq 11/p1/pq/p2q/p^2pet1qet\dfrac{pe^t}{1-qe^t}

Continuas

Distribuciónf(x)f(x)E(X)E(X)V(X)V(X)MX(t)M_X(t)
Uniforme(a,b)(a,b)1ba\dfrac{1}{b-a}a+b2\dfrac{a+b}{2}(ba)212\dfrac{(b-a)^2}{12}etbetat(ba)\dfrac{e^{tb}-e^{ta}}{t(b-a)}
Exponencial(λ)(\lambda)λeλx\lambda e^{-\lambda x}1/λ1/\lambda1/λ21/\lambda^2λλt\dfrac{\lambda}{\lambda-t}
Normal(μ,σ2)(\mu,\sigma^2)1σ2πe(xμ)22σ2\dfrac{1}{\sigma\sqrt{2\pi}}e^{-\frac{(x-\mu)^2}{2\sigma^2}}μ\muσ2\sigma^2eμt+σ2t2/2e^{\mu t+\sigma^2t^2/2}
Gamma(α,θ)(\alpha,\theta)xα1ex/θΓ(α)θα\dfrac{x^{\alpha-1}e^{-x/\theta}}{\Gamma(\alpha)\theta^\alpha}αθ\alpha\thetaαθ2\alpha\theta^2(1θt)α(1-\theta t)^{-\alpha}
χn2\chi^2_nΓ(n/2,2)\Gamma(n/2,\,2)nn2n2n(12t)n/2(1-2t)^{-n/2}
tvt_vZχv2/v\dfrac{Z}{\sqrt{\chi^2_v/v}}00 (v>1v>1)vv2\dfrac{v}{v-2} (v>2v>2)no existe
Fn,mF_{n,m}χn2/nχm2/m\dfrac{\chi^2_n/n}{\chi^2_m/m}mm2\dfrac{m}{m-2} (m>2m>2)ver §13no existe

Relaciones entre ellas

Z2χ12i=1nZi2χn2χn2Γ ⁣(n2,2)Exp(λ)Γ(1,1/λ)Z^2 \sim \chi^2_1 \qquad \sum_{i=1}^n Z_i^2\sim\chi^2_n \qquad \chi^2_n\sim\Gamma\!\left(\tfrac n2,\,2\right) \qquad \text{Exp}(\lambda)\sim\Gamma(1,\,1/\lambda) i=1nExp(θ)Γ(n,θ)tv2=F1;vtvvN(0,1)1Fn,mFm,n\sum_{i=1}^n\text{Exp}(\theta)\sim\Gamma(n,\theta) \qquad t_v^2 = F_{1;v} \qquad t_v\xrightarrow[v\to\infty]{} N(0,1) \qquad \frac{1}{F_{n,m}}\sim F_{m,n}

B. Lectura de tablas

La convención. En todas las tablas del curso —ZZ, tt, χ2\chi^2, FF— el subíndice indica el área a la derecha:

P(χn2>χα;n2)=αP(\chi^2_n > \chi^2_{\alpha;\,n}) = \alpha

De donde: el percentil 95 se busca con subíndice 0,050{,}05; un valor de cola izquierda al 2,5%2{,}5\% se rotula con subíndice 0,9750{,}975; y a subíndice más chico corresponde un valor más grande de la variable.

Simetría. La ZZ y la tt son simétricas alrededor de cero, de modo que las tablas traen solo valores positivos y los negativos se obtienen espejando:

P(Tv<t)=P(Tv>t)Z1α=ZαP(T_v < -t) = P(T_v > t) \qquad\qquad Z_{1-\alpha} = -Z_\alpha

Asimetría. La χ2\chi^2 y la FF no son simétricas, y por lo tanto en un test bilateral los dos valores críticos deben buscarse por separado; no son opuestos ni recíprocos entre sí.

Inversión en la FF. Como las tablas de FF traen solo la cola derecha, los valores menores que 1 se obtienen con

F1α;n,m=1Fα;m,nF_{1-\alpha;\,n,m} = \frac{1}{F_{\alpha;\,m,n}}

invirtiendo simultáneamente la probabilidad, los grados de libertad y la fracción (§30).

Algunos valores frecuentes.

NCNC90%95%98%99%
Zα/2Z_{\alpha/2} (bilateral)1,6451,9602,3262,576
ZαZ_\alpha (unilateral)1,2821,6452,0542,326

C. Símbolos

SímboloSignificado
μ, σ2, p, λ, θ\mu,\ \sigma^2,\ p,\ \lambda,\ \thetaparámetros poblacionales (fijos, desconocidos)
Xˉ, S2, p^\bar{X},\ S^2,\ \hat{p}estadísticos muestrales (aleatorios, calculables)
θ^\hat{\theta}estimador genérico de θ\theta
B(θ^)B(\hat\theta)sesgo, E(θ^)θE(\hat\theta)-\theta
nn / NNtamaño de la muestra / de la población
α\alphanivel de significación; probabilidad de error de tipo I
β\betaprobabilidad de error de tipo II
1α1-\alphanivel de confianza
1β1-\betapotencia del test
MEMEmargen de error
fcfcfactor de corrección por población finita
Sp2S_p^2varianza ponderada (pooled)
ν\nugrados de libertad de Welch–Satterthwaite
ρ\rhocoeficiente de correlación
R2R^2coeficiente de determinación
Φ(z)\Phi(z)función de distribución acumulada de la N(0,1)N(0,1)
Γ(α)\Gamma(\alpha)función Gamma
L(θ)L(\theta)función de verosimilitud
Yˉj\bar{Y}_{\cdot j}media del tratamiento jj (el punto reemplaza al índice sumado)
STC, SCTR, SCESTC,\ SCTR,\ SCEsumas de cuadrados: total, de tratamientos, del error
CMTR, CMECMTR,\ CMEcuadrados medios de tratamientos y del error