Capítulo 8

Esperança

A esperança associa à distribuição de uma variável um valor central, obtido por uma média ponderada. No caso discreto, os pesos são probabilidades; no contínuo, o cálculo é feito por integração contra a densidade. Se \(X\) é discreta e assume valores no conjunto enumerável \(C\), então

\begin{align} \mathbf{E}[X]=\sum _{x \in C} x \P (X=x) \label{eq:espdiscr} \tag{8.1} \end{align}

Se \(X\) tem densidade \(f_X\), a fórmula correspondente é

\begin{align} \mathbf{E}[X]=\int _{-\infty }^{\infty } x f_{X}(x) d x \label{eq:espcont} \tag{8.2} \end{align}

As propriedades da esperança permitem calcular médias de funções de uma ou várias variáveis e fundamentam o estudo da variância, da covariância e da correlação. O condicionamento oferece uma forma de decompor esses cálculos; os momentos e suas funções geradoras reúnem outras informações sobre a distribuição.

8.1 Definição e propriedades fundamentais

As fórmulas de esperança já foram apresentadas. Estudaremos agora propriedades que permitem calcular médias sem determinar uma nova distribuição a cada passo. A linearidade, as variáveis indicadoras e a fórmula das caudas serão os primeiros recursos para esse cálculo.

Definição 8.1
Se \(X\) é discreta, com valores \(x_1,x_2,\ldots \), definimos
\[ \mathbf{E}[X]=\sum _i x_i\P (X=x_i), \]
desde que a soma seja absolutamente convergente. Se \(X\) possui densidade \(f_X\), definimos
\[ \mathbf{E}[X]=\int _{-\infty }^{\infty }x f_X(x)\, dx, \]
desde que \(\int _{-\infty }^{\infty }|x|f_X(x)\, dx\lt \infty \). Nos dois casos dizemos que \(X\) é integrável quando \(\mathbf{E}[|X|]\lt \infty \).
Se a distribuição é mista, calculamos separadamente a contribuição das massas pontuais e a da densidade. Assim, se \(X\) assume valores \(x_i\) com massas \(p_i\) e tem também uma parte contínua de densidade \(f\), então

\[ \mathbf{E}[g(X)]=\sum _i g(x_i)p_i+\int _{-\infty }^{\infty }g(x)f(x)\, dx, \]

sempre que a soma e a integral convergirem absolutamente.

Proposição 8.1 (Propriedades básicas)
Para variáveis integráveis \(X,Y\) e constantes \(a,b\), valem:
  1. \(\mathbf{E}[aX+bY]=a\mathbf{E}[X]+b\mathbf{E}[Y]\);

  2. se \(X\leq Y\), então \(\mathbf{E}[X]\leq \mathbf{E}[Y]\);

  3. \(|\mathbf{E}[X]|\leq \mathbf{E}[|X|]\);

  4. para todo evento \(A\), \(\mathbf{E}[\mathbb {1}_A]=\P (A)\).

Teorema 8.2 (Fórmula das caudas)
Se \(X\geq 0\), então

\begin{equation} \label{eq:calda} \mathbf{E}[X]=\int _0^\infty \P (X\gt t)\, dt. \tag{8.3} \end{equation}

Se, além disso, \(X\) assume valores inteiros não negativos,

\begin{equation} \label{eq:espdiscreta2} \mathbf{E}[X]=\sum _{k=1}^{\infty }\P (X\geq k). \tag{8.4} \end{equation}

Demonstração

A ideia é a mesma nos casos discreto e contínuo: um valor \(x\geq 0\) pode ser medido pelo comprimento do intervalo que fica abaixo dele,

\[ x=\int _0^\infty \mathbb {1}_{\{ t\lt x\} }\, dt. \]

Se \(X\) é discreta, com valores não negativos \(x_i\) e probabilidades \(p_i\), então

\[ \begin{aligned} \mathbf{E}[X] & =\sum _i x_i p_i =\sum _i p_i\int _0^{x_i}dt\\ & =\int _0^\infty \sum _{i:x_i\gt t}p_i\, dt =\int _0^\infty \P (X\gt t)\, dt. \end{aligned} \]

Se \(X\) possui densidade \(f_X\), então

\[ \begin{aligned} \mathbf{E}[X] & =\int _0^\infty x f_X(x)\, dx =\int _0^\infty \int _0^x f_X(x)\, dt\, dx\\ & =\int _0^\infty \int _t^\infty f_X(x)\, dx\, dt =\int _0^\infty \P (X\gt t)\, dt. \end{aligned} \]

Como os integrandos são não negativos, a troca da ordem de integração não cria problemas de cancelamento.

Finalmente, se \(X\) assume valores inteiros não negativos, então para \(k-1\leq t\lt k\) vale \(\P (X\gt t)=\P (X\geq k)\). Particionando a integral em intervalos unitários,

\[ \int _0^\infty \P (X\gt t)\, dt =\sum _{k=1}^\infty \P (X\geq k), \]

o que prova a segunda fórmula.

A interpretação é geométrica: em vez de somar os valores de \(X\) diretamente, podemos somar suas “camadas”. Para cada altura \(t\), contamos a probabilidade de a variável ultrapassar esse nível. No caso inteiro, essas camadas são os níveis \(1,2,\ldots \); no caso contínuo, elas variam continuamente com \(t\).

8.2 Esperança de funções de vetores aleatórios

Sejam \(X,Y\) variáveis aleatórias e \(g:\mathbb R^2\to \mathbb R\). Para calcular a média de \(g(X,Y)\), poderíamos determinar primeiro sua distribuição. Esse passo, porém, não é necessário: podemos obter \(\mathbf{E}[g(X,Y)]\) diretamente da distribuição conjunta, atribuindo a cada par \((x,y)\) o valor \(g(x,y)\) e usando como peso a probabilidade ou a densidade conjunta.

Teorema 8.3 (Esperança de uma função de um vetor aleatório)
Seja \(g:\mathbb R^2\to \mathbb R\).
  1. Se \(X,Y\) são discretas e

    \[ \sum _x\sum _y |g(x,y)|\P (X=x,Y=y)\lt \infty , \]

    então

    \[ \mathbf{E}[g(X,Y)] =\sum _x\sum _y g(x,y)\P (X=x,Y=y). \]
  2. Se \((X,Y)\) possui densidade conjunta \(f_{XY}\) e

    \[ \iint _{\mathbb R^2}|g(x,y)|f_{XY}(x,y)\, dx\, dy\lt \infty , \]

    então

    \[ \mathbf{E}[g(X,Y)] =\iint _{\mathbb R^2}g(x,y)f_{XY}(x,y)\, dx\, dy. \]

Demonstração

No caso discreto, agrupe os pares \((x,y)\) segundo o valor \(z=g(x,y)\). Se \(Z=g(X,Y)\), então

\[ \P (Z=z)=\sum _{(x,y):g(x,y)=z}\P (X=x,Y=y). \]

Logo,

\[ \begin{aligned} \mathbf{E}[Z] & =\sum _z z\P (Z=z)\\ & =\sum _z z\sum _{(x,y):g(x,y)=z}\P (X=x,Y=y)\\ & =\sum _x\sum _y g(x,y)\P (X=x,Y=y). \end{aligned} \]

A convergência absoluta garante que o reagrupamento das somas não altera o resultado.

No caso contínuo, suponha primeiro \(g\geq 0\). Pela fórmula das caudas,

\[ \mathbf{E}[g(X,Y)] =\int _0^\infty \P (g(X,Y)\gt t)\, dt. \]

Como

\[ \P (g(X,Y)\gt t) =\iint _{\{ (x,y):g(x,y)\gt t\} } f_{XY}(x,y)\, dx\, dy, \]

trocando a ordem de integração obtemos

\[ \begin{aligned} \mathbf{E}[g(X,Y)] & =\iint _{\mathbb R^2} \left(\int _0^{g(x,y)}dt\right)f_{XY}(x,y)\, dx\, dy\\ & =\iint _{\mathbb R^2}g(x,y)f_{XY}(x,y)\, dx\, dy. \end{aligned} \]

Para uma função que assume ambos os sinais, escreva \(g=g^+-g^-\) e aplique o caso não negativo às duas parcelas. A hipótese de integrabilidade garante que ambas sejam finitas.

Para uma única variável, a mesma regra fica:

Teorema 8.4
Se \(g(X)\) é integrável, então

\begin{equation} \label{eq:expfunc1} \mathbf{E}[g(X)]= \begin{cases} \displaystyle \sum _i g(x_i)\P (X=x_i),& X\text{ discreta},\\[6pt] \displaystyle \int _{-\infty }^{\infty }g(x)f_X(x)\, dx,& X\text{ com densidade}. \end{cases} \tag{8.5} \end{equation}

A Tabela 8.1 resume os casos especiais mais importantes de 8.5.

Discreto $X$$\E[g(X)]=\dsum_{i} g\left(t_{i}\right) \P\left(X=t_{i}\right)$
Absolutamente Contínuo $X$$\E[g(X)]=\dint_{-\infty}^{\infty} g(x) f_{X}(x) d x$

Tabela 8.1 Fórmulas computacionais para \(\mathbf{E}[g(X)]\)

Exemplo 8.1

Um acidente ocorre em um ponto \( X \), que é distribuído uniformemente ao longo de uma estrada de comprimento \( L \). No momento do acidente, uma ambulância está no ponto \( Y \), que também é distribuído uniformemente ao longo da mesma estrada. Suponha que \( X \) e \( Y \) sejam variáveis independentes. A tarefa é determinar a distância esperada entre a ambulância e o local do acidente.

Sol Para resolver o problema, precisamos encontrar \( \mathbf{E}[|X - Y|] \), que representa a distância esperada entre os pontos \( X \) e \( Y \). Como \( X \) e \( Y \) são independentes e uniformemente distribuídos, a função densidade conjunta é:

\[ f(x, y) = \frac{1}{L^2}, \quad 0 \lt x \lt L, \quad 0 \lt y \lt L. \]

De acordo com o Teorema 8.3, podemos expressar a distância esperada como:

\[ \mathbf{E}[|X - Y|] = \frac{1}{L^2} \int _0^L \int _0^L |x - y| \, dy \, dx. \]

Vamos calcular a integral interna primeiro:

\[ \int _0^L |x - y| \, dy = \int _0^x (x - y) \, dy + \int _x^L (y - x) \, dy. \]

Resolvendo cada uma das integrais separadamente, temos:

\[ \int _0^x (x - y) \, dy = \left[ xy - \frac{y^2}{2} \right]_0^x = \frac{x^2}{2}, \]
\[ \int _x^L (y - x) \, dy = \left[ \frac{y^2}{2} - xy \right]_x^L = \frac{L^2}{2} - \frac{x^2}{2} - x(L - x). \]

Somando os resultados:

\[ \int _0^L |x - y| \, dy = \frac{x^2}{2} + \frac{L^2}{2} - \frac{x^2}{2} - x(L - x) = \frac{L^2}{2} + x^2 - xL. \]

Agora, substituímos na integral externa para encontrar \( \mathbf{E}[|X - Y|] \):

\[ \mathbf{E}[|X - Y|] = \frac{1}{L^2} \int _0^L \left( \frac{L^2}{2} + x^2 - xL \right) dx. \]

Calculando a integral:

\[ \mathbf{E}[|X - Y|] = \frac{1}{L^2} \left[ \frac{L^2x}{2} + \frac{x^3}{3} - \frac{Lx^2}{2} \right]_0^L = \frac{L}{3}. \]

Portanto, a distância esperada entre a ambulância e o local do acidente é:

\[ \mathbf{E}[|X - Y|] = \frac{L}{3}. \]

Funções de variáveis aleatórias independentes

Quando \(X\) e \(Y\) são independentes, a distribuição conjunta fatora. Isso permite calcular uma esperança por somas ou integrais sucessivas usando apenas as distribuições marginais.

Teorema 8.5
Sejam \(X\) e \(Y\) independentes e \(h:\mathbb {R}^2\to \mathbb {R}\) não negativa ou integrável. No caso discreto,
\[ \mathbf{E}[h(X,Y)]=\sum _x\sum _y h(x,y)p_X(x)p_Y(y). \]
Se \(X\) e \(Y\) têm densidades,

\begin{equation} \label{eq:expprod3} \mathbf{E}[h(X,Y)] =\int _{-\infty }^{\infty }\int _{-\infty }^{\infty } h(x,y)f_X(x)f_Y(y)\, dx\, dy. \tag{8.6} \end{equation}

Demonstração

Pela independência, a distribuição conjunta fatora. No caso discreto,

\[ \P (X=x,Y=y)=p_X(x)p_Y(y), \]

e, portanto, o Teorema 8.3 fornece imediatamente

\[ \mathbf{E}[h(X,Y)] =\sum _x\sum _y h(x,y)p_X(x)p_Y(y). \]

No caso contínuo, a independência equivale a

\[ f_{XY}(x,y)=f_X(x)f_Y(y). \]

Substituindo essa fatoração na fórmula do mesmo teorema,

\[ \mathbf{E}[h(X,Y)] =\int _{-\infty }^{\infty }\int _{-\infty }^{\infty } h(x,y)f_X(x)f_Y(y)\, dx\, dy. \]

A hipótese de não negatividade ou integrabilidade é justamente a que garante a validade das somas ou integrais iteradas utilizadas acima.

Em particular, a esperança do produto de funções de variáveis aleatórias independentes é o produto de suas esperanças.

Corolário 8.6
Sejam \(X, Y\) independentes e sejam \(g_{1}, g_{2}\) funções integráveis. Então,

\begin{equation} \mathbf{E}\left[g_{1}(X) g_{2}(Y)\right]=\mathbf{E}\left[g_{1}(X)\right] \mathbf{E}\left[g_{2}(Y)\right] \tag{8.7} \end{equation}

Demonstração

Aplique o teorema anterior a \(h(x,y)=g_1(x)g_2(y)\). Tanto no caso discreto quanto no contínuo, a soma ou integral iterada fatora no produto de duas expressões:

\[ \mathbf{E}[g_1(X)g_2(Y)] =\mathbf{E}[g_1(X)]\, \mathbf{E}[g_2(Y)]. \]

Corolário 8.7
Sejam \(X, Y\) independentes. Então,

\begin{equation} \mathbf{E}\left[XY\right]=\mathbf{E}\left[X\right] \mathbf{E}\left[Y\right] \tag{8.8} \end{equation}

A diferença \(\mathbf{E}[XY]-\mathbf{E}[X]\mathbf{E}[Y]\) é denominada covariância. Ela mede associação linear; covariância nula, por si só, não implica independência.

Exemplo 8.2 (Caminhada aleatória no plano)

Considere uma partícula inicialmente localizada em um ponto dado no plano. Suponha que a partícula execute uma sequência de passos, todos de mesmo comprimento, mas em direções escolhidas de forma completamente aleatória. Especificamente, após cada passo, a nova posição da partícula é alcançada a uma distância de exatamente uma unidade da posição anterior, sendo o ângulo do movimento uniformemente distribuído no intervalo \((0, 2\pi )\), como ilustrado na Figura 8.1. Determine o valor esperado do quadrado da distância da partícula à origem após \(n\) passos.

Figura 8.1 Caminhada aleatória no plano

Figura 8.1 Caminhada aleatória no plano

Sol Se \(\left(X_i, Y_i\right)\) representa, em coordenadas retangulares, a mudança de posição no \(i\)-ésimo passo, com \(i=1, \ldots , n\), então temos:

\[ \begin{aligned} X_i & = \cos \theta _i, \\ Y_i & = \sin \theta _i, \end{aligned} \]

onde \(\theta _i\), para \(i=1, \ldots , n\), é, por hipótese, uma variável aleatória independente e uniformemente distribuída no intervalo \((0, 2\pi )\). Como a posição da partícula após \(n\) passos tem coordenadas retangulares \(\left(\sum _{i=1}^n X_i, \sum _{i=1}^n Y_i\right)\), o quadrado da distância \(D^2\) em relação à origem é dado por:

\[ \begin{aligned} D^2 & = \left(\sum _{i=1}^n X_i\right)^2 + \left(\sum _{i=1}^n Y_i\right)^2 \\ & = \sum _{i=1}^n \left(X_i^2 + Y_i^2\right) + \sum _{i \neq j} \left(X_i X_j + Y_i Y_j\right) \\ & = n + \sum _{i \neq j} \left(\cos \theta _i \cos \theta _j + \sin \theta _i \sin \theta _j\right), \end{aligned} \]

onde usamos o fato de que \(\cos ^2 \theta _i + \sin ^2 \theta _i = 1\).

Ao calcular as esperanças, utilizamos a independência de \(\theta _i\) e \(\theta _j\) para \(i \neq j\), além das seguintes propriedades de integração sobre o intervalo \((0, 2\pi )\):

\[ \begin{aligned} 2\pi \mathbf{E}\left[\cos \theta _i\right] & = \int _0^{2\pi } \cos u \, du = \sin (2\pi ) - \sin (0) = 0, \\ 2\pi \mathbf{E}\left[\sin \theta _i\right] & = \int _0^{2\pi } \sin u \, du = \cos (0) - \cos (2\pi ) = 0. \end{aligned} \]

Portanto, obtemos o resultado:

\[ \mathbf{E}[D^2] = n. \]

Exemplo 8.3 (Número Esperado de Pareamentos)

Suponha que \( N \) pessoas joguem seus chapéus no centro de uma sala. Os chapéus são misturados aleatoriamente, e cada pessoa seleciona um chapéu ao acaso. Qual é o número esperado de pessoas que recuperam o próprio chapéu?

Sol Vamos definir a variável aleatória \( X \) como o número de pessoas que selecionam seus próprios chapéus. Podemos expressar \( X \) como a soma de variáveis indicadoras individuais:

\[ X = X_1 + X_2 + \cdots + X_N, \]

onde, para cada \( i = 1, 2, \dots , N \),

\[ X_i = \begin{cases} 1 & \text{se a pessoa } i \text{ selecionar o próprio chapéu}, \\ 0 & \text{caso contrário}. \end{cases} \]

Cada variável \( X_i \) indica o evento de a pessoa \( i \) recuperar seu próprio chapéu. A probabilidade desse evento é

\[ \P [X_i = 1] = \frac{1}{N}, \]

pois há \( N \) chapéus igualmente prováveis, e apenas um deles pertence à pessoa \( i \).

Assim, o valor esperado de \( X_i \) é

\[ \mathbf{E}[X_i] = 0 \times \P [X_i = 0] + 1 \times \P [X_i = 1] = \frac{1}{N}. \]

Embora as variáveis \( X_i \) não sejam independentes (porque a seleção de chapéus por uma pessoa afeta as opções disponíveis para as outras), a linearidade da esperança matemática não requer independência. Portanto, podemos somar os valores esperados individuais:

\[ \mathbf{E}[X] = \mathbf{E}[X_1] + \mathbf{E}[X_2] + \cdots + \mathbf{E}[X_N] = N \times \frac{1}{N} = 1. \]

Portanto, o número esperado de pessoas que recuperam seus próprios chapéus é 1.

Este problema é conhecido como o "problema dos chapéus" ou "problema das cartas desordenadas" e é um exemplo clássico em probabilidade. Ele ilustra a utilidade da linearidade da esperança matemática mesmo quando os eventos não são independentes.

Exemplo 8.4 (Problema do Colecionador de Cupons)

Suponha que existam \( N \) tipos diferentes de cupons de desconto, e que cada vez que alguém recolhe um cupom, este tenha igual probabilidade de ser qualquer um dos \( N \) tipos. Determine o número esperado de cupons que alguém precisa acumular antes de conseguir um conjunto completo que contenha pelo menos um de cada tipo.

Sol

Seja \( X \) o número total de cupons acumulados até que se obtenha pelo menos um de cada tipo. Vamos calcular \( \mathbf{E}[X] \) decompondo \( X \) como a soma de variáveis aleatórias \( X_i \), onde \( X_i \) representa o número de cupons necessários para passar de possuir \( i - 1 \) tipos distintos para possuir \( i \) tipos distintos de cupons.

Assim, temos:

\[ X = X_1 + X_2 + \cdots + X_N \]

Inicialmente, não temos nenhum cupom, então o primeiro cupom sempre será de um novo tipo. Portanto, \( X_1 = 1 \).

Para \( i \geq 2 \), suponha que já tenhamos \( i - 1 \) tipos distintos de cupons. A probabilidade de que o próximo cupom seja de um tipo novo é:

\[ p_i = \frac{N - (i - 1)}{N} = \frac{N - i + 1}{N} \]

Logo, \( X_i \) é uma variável aleatória geométrica com parâmetro \( p_i \). A esperança matemática de uma variável geométrica é dada por \( \mathbf{E}[X_i] = \frac{1}{p_i} \), portanto:

\[ \mathbf{E}[X_i] = \frac{N}{N - i + 1} \]

O número esperado total de cupons necessários é a soma das esperanças individuais:

\[ \mathbf{E}[X] = \sum _{i=1}^{N} \mathbf{E}[X_i] = \sum _{i=1}^{N} \frac{N}{N - i + 1} \]

Para simplificar a soma, realizamos a substituição \( k = N - i + 1 \), o que implica \( i = N - k + 1 \). Quando \( i = 1 \), \( k = N \); quando \( i = N \), \( k = 1 \). Assim, a soma torna-se:

\[ \mathbf{E}[X] = \sum _{k=1}^{N} \frac{N}{k} =N\sum _{k=1}^{N}\frac1k =N\left(1 + \frac{1}{2} + \frac{1}{3} + \cdots + \frac{1}{N}\right). \]

8.3 Variância e covariância

Duas variáveis com a mesma média podem apresentar dispersões muito diferentes. A variância descreve essa diferença por meio do desvio quadrático médio em torno da esperança. Para estudar a variação conjunta de duas variáveis, introduziremos também a covariância.

Definição 8.2
Se \(X\) é uma variável aleatória com média \(\mu \), então a variância de \(X\), representada por \(\operatorname {Var}(X)\), é definida como
\[ \operatorname {Var}(X)=\mathbf{E}\left[(X-\mu )^2\right] \]

Quanto maior a variância, maior tende a ser a dispersão. Sua raiz quadrada é o desvio padrão, expresso na mesma unidade de \(X\), e por isso mais fácil de interpretar diretamente.

Ilustração: Variância e covariância

Uma fórmula alternativa para \(\operatorname {Var}(X)\) é deduzida a seguir:

\begin{align*} \operatorname {Var}(X) & =\mathbf{E}\left[(X-\mathbf{E}[X])^2\right] \\ & =\mathbf{E}\left[X^2-2 X \mathbf{E}[X]+\mathbf{E}[X]^2\right] \\ & =\mathbf{E}\left[X^2\right]-2 \mathbf{E}[X] \mathbf{E}[X]+\mathbf{E}[X]^2 \\ & =\mathbf{E}\left[X^2\right]-2 \mathbf{E}[X]^2+\mathbf{E}[X]^2 \\ & =\mathbf{E}\left[X^2\right]-\mathbf{E}[X]^2 \end{align*}

Exemplo 8.5

Considere cinco lançamentos de uma moeda honesta. Seja \(H\) o número de caras. Calcule \(\mathbf{E}[H]\) e \(\operatorname {Var}(H)\). Lembramos que

\[ \P (H=0)=\dfrac {1}{2}^5=\dfrac {1}{32} \]
\[ \P (H=1)= \binom {5}{1}\dfrac {1}{2}^5=\dfrac {5}{32} \]
\[ \P (H=2)= \binom {5}{2}\dfrac {1}{2}^5=\dfrac {10}{32} \]
\[ \P (H=3)= \binom {5}{3}\dfrac {1}{2}^5=\dfrac {10}{32} \]
\[ \P (H=4)= \binom {5}{4}\dfrac {1}{2}^5=\dfrac {5}{32} \]
\[ \P (H=5)= \binom {5}{5}\dfrac {1}{2}^5=\dfrac {1}{32} \]

Logo a esperança é

\[ \mathbf{E}[H]= 1\dfrac {5}{32}+2\dfrac {10}{32}+3\dfrac {10}{32}+4\dfrac {5}{32}+5\dfrac {1}{32}=\dfrac {80}{32}=\dfrac {5}{2} \]

Para o calculo da variância começaremos calculando

\[ \mathbf{E}[H^2]= 1\dfrac {5}{32}+4\dfrac {10}{32}+9\dfrac {10}{32}+16\dfrac {5}{32}+25\dfrac {1}{32}=\dfrac {15}{2} \]

Logo a variância é

\[ \operatorname {Var}(H)=\dfrac {15}{2} - \dfrac {25}{4}=\dfrac {5}{4} \]

A variância trata de uma variável; para duas variáveis, a covariância descreve como seus desvios em relação às médias variam em conjunto. Ela mede associação linear, não independência.

A covariância pode assumir valores positivos, negativos ou zero:

  • Um valor positivo indica que as duas variáveis tendem a aumentar juntas.

  • Um valor negativo indica que uma variável tende a aumentar quando a outra diminui.

  • Um valor próximo de zero indica que não há uma relação linear clara entre as duas variáveis.

Ilustração: Variância e covariância

Figura 8.2 a) Covariância positiva

Ilustração: Variância e covariância

Figura 8.3 b) Não correlacionadas

Ilustração: Variância e covariância

Figura 8.4 c) Covariância negativa

Definição 8.3
A covariância entre \(X\) e \(Y\), representada por \(\operatorname {Cov}(X,Y)\), é
\[ \operatorname {Cov}(X, Y)=\mathbf{E}[(X-\mathbf{E}[X])(Y-\mathbf{E}[Y])] \]
Expandindo o lado direito da definição anterior, vemos que

\[ \begin{aligned} \operatorname {Cov}(X, Y) & =\mathbf{E}[X Y-\mathbf{E}[X] Y-X \mathbf{E}[Y]+\mathbf{E}[Y] \mathbf{E}[X]] \\ & =\mathbf{E}[X Y]-\mathbf{E}[X] \mathbf{E}[Y]-\mathbf{E}[X] \mathbf{E}[Y]+\mathbf{E}[X] \mathbf{E}[Y] \\ & =\mathbf{E}[X Y]-\mathbf{E}[X] \mathbf{E}[Y] \end{aligned} \]

Se \(X\) e \(Y\) são independentes, então \(\operatorname {Cov}(X,Y)=0\). A recíproca é falsa. Para ver isso, seja \(X\) tal que

\[ \P (X=0)=\P (X=1)=\P (X=-1)=\frac{1}{3} \]

e definindo-se

\[ Y= \begin{cases} 0 & \text{ se } X \neq 0 \\ 1 & \text{ se } X=0\end{cases} \]

Como \(XY=0\), temos \(\mathbf{E}[XY]=0\); além disso, \(\mathbf{E}[X]=0\). Logo,

\[ \operatorname {Cov}(X, Y)=\mathbf{E}[X Y]-\mathbf{E}[X] \mathbf{E}[Y]=0 \]

Entretanto, \(X\) e \(Y\) são claramente dependentes. A proposição a seguir lista algumas propriedades da covariância.

Proposição 8.8
  1. \(\operatorname {Cov}(X, Y)=\operatorname {Cov}(Y, X)\)

  2. \(\operatorname {Cov}(X, X)=\operatorname {Var}(X)\)

  3. \(\operatorname {Cov}(a X, Y)=a \operatorname {Cov}(X, Y)\)

  4. \(\operatorname {Cov}\left(\sum _{i=1}^n X_i, \sum _{j=1}^m Y_j\right)=\sum _{i=1}^n \sum _{j=1}^m \operatorname {Cov}\left(X_i, Y_j\right)\)

Demonstração

As proposições 1 e 2resultam imediatamente da definição da covariância, e a proposição 3é deixada como exercício para o leitor. Para demonstrar a proposição 4 , que diz que a operação de cálculo da covariância é aditiva (como é a operação de cálculo do valor esperado), suponha que \(\mu _i=\mathbf{E}\left[X_i\right]\) e \(v_j=\mathbf{E}\left[Y_j\right]\). Então,

\[ \mathbf{E}\left[\sum _{i=1}^n X_i\right]=\sum _{i=1}^n \mu _i, \quad \mathbf{E}\left[\sum _{j=1}^m Y_j\right]=\sum _{j=1}^m v_j \]

e

\begin{align} \operatorname {Cov}\left(\sum _{i=1}^n X_i, \sum _{j=1}^m Y_j\right) & =\mathbf{E}\left[\left(\sum _{i=1}^n X_i-\sum _{i=1}^n \mu _i\right)\left(\sum _{j=1}^m Y_j-\sum _{j=1}^m v_j\right)\right] \tag{8.9} \\ & =\mathbf{E}\left[\sum _{i=1}^n\left(X_i-\mu _i\right) \sum _{j=1}^m\left(Y_j-v_j\right)\right] \tag{8.10} \\ & =\mathbf{E}\left[\sum _{i=1}^n \sum _{j=1}^m\left(X_i-\mu _i\right)\left(Y_j-v_j\right)\right] \tag{8.11} \\ & =\sum _{i=1}^n \sum _{j=1}^m \mathbf{E}\left[\left(X_i-\mu _i\right)\left(Y_j-v_j\right)\right] \tag{8.12} \end{align}

onde a última igualdade é obtida porque o valor esperado da soma de variáveis aleatórias é igual à soma de seus valores esperados.

Tomando \(Y_j=X_j\) nas propriedades 2 e 4 da Proposição 8.8, obtemos

\[ \operatorname {Var}\left(\sum _{i=1}^{n} X_{i}\right)=\operatorname {Cov}\left(\sum _{i=1}^{n} X_{i}, \sum _{j=1}^{n} X_{j}\right) \]
\[ \begin{aligned} & =\sum _{i=1}^{n} \sum _{j=1}^{n} \operatorname {Cov}\left(X_{i}, X_{j}\right) \\ & =\sum _{i=1}^{n} \operatorname {Var}\left(X_{i}\right)+\sum \sum _{i \neq j} \operatorname {Cov}\left(X_{i}, X_{j}\right) \end{aligned} \]

Como cada par de índices \(i, j, i \neq j\), aparece duas vezes no somatório duplo, a fórmula anterior é equivalente a

\begin{equation*} \operatorname {Var}\left(\sum _{i=1}^{n} X_{i}\right)=\sum _{i=1}^{n} \operatorname {Var}\left(X_{i}\right)+2 \sum _{i\lt j} \operatorname {Cov}\left(X_{i}, X_{j}\right) \label{eq:876} \end{equation*}

Se \(X_{1}, \ldots , X_{n}\) são independentes por pares, no sentido de \(X_{i}\) e \(X_{j}\) serem independentes para \(i \neq j\), então a Equação 8.3 reduz-se para

\[ \operatorname {Var}\left(\sum _{i=1}^{n} X_{i}\right)=\sum _{i=1}^{n} \operatorname {Var}\left(X_{i}\right) \]

Exemplo 8.6

Calcule a variância de uma variável aleatória binomial \(X\) com parâmetros \(n\) e \(p\).

Sol Como tal variável aleatória representa o número de sucessos em \(n\) tentativas independentes quando cada tentativa tem a mesma probabilidade de sucesso \(p\), podemos escrever

\[ X=X_{1}+\ldots +X_{n} \]

onde \(X_{i}\) representa variáveis independentes de Bernoulli tais que

\[ X_{i}= \begin{cases} 1 & \text{ se a } i \text{-ésima tentativa é um sucesso } \\ 0 & \text{ caso contrário }\end{cases} \]

Com isso, da Equação 8.3, obtemos

\[ \operatorname {Var}(X)=\operatorname {Var}\left(X_{1}\right)+\ldots +\operatorname {Var}\left(X_{n}\right) \]

Mas

\[ \begin{aligned} \operatorname {Var}\left(X_{i}\right) & =\mathbf{E}\left[X_{i}^{2}\right]-\left(\mathbf{E}\left[X_{i}\right]\right)^{2} \\ & =\mathbf{E}\left[X_{i}\right]-\left(\mathbf{E}\left[X_{i}\right]\right)^{2} \quad \text{ já que } X_{i}^{2}=X_{i} \\ & =p-p^{2} \end{aligned} \]

Logo,

\[ \operatorname {Var}(X)=n p(1-p) \]

Exemplo 8.7

Sejam \(X_{1}, \ldots , X_{n}\) variáveis aleatórias independentes identicamente distribuídas com valor esperado \(\mu \) e variância \(\sigma ^{2}\), e suponha que \(\bar{X}=\sum _{i=1}^{n} X_{i} / n\) seja a média amostral. As grandezas \(X_{i}-\bar{X}, i=1, \ldots , n\), são chamadas de desvios, e elas são iguais às diferenças entre os valores individuais dos dados e a média amostral. A variável aleatória

\[ S^{2}=\sum _{i=1}^{n} \frac{\left(X_{i}-\bar{X}\right)^{2}}{n-1} \]

é chamada de variância amostral. Determine

  1. \(\operatorname {Var}(\bar{X})\) e

  2. \(\mathbf{E}\left[S^{2}\right]\).

Sol 1

\[ \begin{aligned} \operatorname {Var}(\bar{X}) & =\left(\frac{1}{n}\right)^{2} \operatorname {Var}\left(\sum _{i=1}^{n} X_{i}\right) \\ & =\left(\frac{1}{n}\right)^{2} \sum _{i=1}^{n} \operatorname {Var}\left(X_{i}\right) \quad \text{ pela independência } \\ & =\frac{\sigma ^{2}}{n} \end{aligned} \]

2 Começamos com a seguinte identidade algébrica:

\[ \begin{aligned} (n-1) S^{2} & =\sum _{i=1}^{n}\left(X_{i}-\mu +\mu -\bar{X}\right)^{2} \\ & =\sum _{i=1}^{n}\left(X_{i}-\mu \right)^{2}+\sum _{i=1}^{n}(\bar{X}-\mu )^{2}-2(\bar{X}-\mu ) \sum _{i=1}^{n}\left(X_{i}-\mu \right) \\ & =\sum _{i=1}^{n}\left(X_{i}-\mu \right)^{2}+n(\bar{X}-\mu )^{2}-2(\bar{X}-\mu ) n(\bar{X}-\mu ) \\ & =\sum _{i=1}^{n}\left(X_{i}-\mu \right)^{2}-n(\bar{X}-\mu )^{2} \end{aligned} \]

Calculando a esperança da equação anterior, obtemos

\[ \begin{aligned} (n-1) \mathbf{E}\left[S^{2}\right] & =\sum _{i=1}^{n} \mathbf{E}\left[\left(X_{i}-\mu \right)^{2}\right]-n \mathbf{E}\left[(\bar{X}-\mu )^{2}\right] \\ & =n \sigma ^{2}-n \operatorname {Var}(\bar{X}) \\ & =(n-1) \sigma ^{2} \end{aligned} \]

onde usamos o item 1 e o fato de que \(\mathbf{E}[\bar X]=\mu \). Dividindo por \(n-1\), concluímos que \(\mathbf{E}[S^2]=\sigma ^2\): a variância amostral é um estimador não viesado da variância da população.

Exemplo 8.8 (Modelo Multinomial)

Considere \( m \) tentativas independentes, em que cada uma pode resultar em um dos \( r \) possíveis desfechos, com probabilidades associadas \( p_1, p_2, \ldots , p_r \), satisfazendo \( \sum _{i=1}^{r} p_i = 1 \). Definimos \( N_i \), para \( i = 1, \ldots , r \), como a quantidade de tentativas que resultam no desfecho \( i \). Nessas condições, as variáveis \( N_1, N_2, \ldots , N_r \) seguem uma distribuição multinomial, dada por:

\[ \P \left(N_1 = n_1, N_2 = n_2, \ldots , N_r = n_r\right) = \frac{m!}{n_1! \, n_2! \, \ldots \, n_r!} p_1^{n_1} p_2^{n_2} \cdots p_r^{n_r}, \]

onde \( \sum _{i=1}^{r} n_i = m \). Agora, calcule a covariância entre \( N_i \) e \( N_j \).

Sol Podemos começar observando que, para \( i \neq j \), é razoável supor que, à medida que \( N_i \) aumenta, \( N_j \) tende a diminuir. Assim, é intuitivo concluir que essas variáveis apresentam uma covariância negativa. Vamos calcular sua covariância usando a Proposição 8.8 e as representações

\[ N_{i}=\sum _{k=1}^{m} I_{i}(k) \quad \text{ e } \quad N_{j}=\sum _{k=1}^{m} I_{j}(k) \]

onde

\[ \begin{aligned} & I_{i}(k)= \begin{cases} 1 & \text{ se a tentativa } k \text{ levar ao resultado } i \\ 0 & \text{ caso contrário }\end{cases}\\ & I_{j}(k)= \begin{cases} 1 & \text{ se a tentativa } k \text{ levar ao resultado } j \\ 0 & \text{ caso contrário }\end{cases}\end{aligned} \]

Da Proposição 8.8, temos

\[ \operatorname {Cov}\left(N_{i}, N_{j}\right)=\sum _{\ell =1}^{m} \sum _{k=1}^{m} \operatorname {Cov}\left(I_{i}(k), I_{j}(\ell )\right) \]

Agora, por um lado, quando \(k \neq \ell \),

\[ \operatorname {Cov}\left(I_{i}(k), I_{j}(\ell )\right)=0 \]

pois o resultado da tentativa \(k\) é independente do resultado da tentativa \(\ell \). Por outro lado,

\[ \begin{aligned} \operatorname {Cov}\left(I_{i}(\ell ), I_{j}(\ell )\right) & =\mathbf{E}\left[I_{i}(\ell ) I_{j}(\ell )\right]-\mathbf{E}\left[I_{i}(\ell )\right] \mathbf{E}\left[I_{j}(\ell )\right] \\ & =0-p_{i} p_{j}=-p_{i} p_{j} \end{aligned} \]

onde a equação usa o fato de que \(I_{i}(\ell ) I_{j}(\ell )=0\), já que a tentativa \(\ell \) não pode levar simultaneamente aos resultados \(i \mathbf{E}j\). Com isso, obtemos

\[ \operatorname {Cov}\left(N_{i}, N_{j}\right)=-m p_{i} p_{j} \]

o que está de acordo com nossa intuição de que as variáveis \(N_{i}\) e \(N_{j}\) são negativamente correlacionados.

Exemplo 8.9

Considere \( X \) e \( Y \) definidos como:

\[ X = \cos \Theta , \quad Y = \sin \Theta , \]

onde \( \Theta \) é uma variável aleatória uniformemente distribuída no intervalo \( (0, 2\pi ) \).

  1. Mostre que \( X \) e \( Y \) são não-correlacionadas.

  2. Mostre que \( X \) e \( Y \) não são independentes.

\( X \) e \( Y \) são não-correlacionadas.

Sabemos que

\[ f_\Theta (\theta ) = \begin{cases} \frac{1}{2\pi }, & 0 \lt \theta \lt 2\pi , \\ 0, & \text{caso contrário.} \end{cases} \]

Então:

\[ \mathbf{E}[X] = \int _{-\infty }^{\infty } x f_X(x) \, dx = \int _{0}^{2\pi } \cos \theta f_\Theta (\theta ) \, d\theta = \frac{1}{2\pi } \int _{0}^{2\pi } \cos \theta \, d\theta = 0. \]

De forma semelhante:

\[ \mathbf{E}[Y] = \frac{1}{2\pi } \int _{0}^{2\pi } \sin \theta \, d\theta = 0. \]

Agora, calculemos \( \mathbf{E}[XY] \):

\[ \mathbf{E}[XY] = \frac{1}{2\pi } \int _{0}^{2\pi } \cos \theta \sin \theta \, d\theta = \frac{1}{4\pi } \int _{0}^{2\pi } \sin (2\theta ) \, d\theta = 0. \]

Portanto, como \( \mathbf{E}[XY] = \mathbf{E}[X]\mathbf{E}[Y] \), concluímos que \( X \) e \( Y \) são não-correlacionadas.

\( X \) e \( Y \) não são independentes.

Calculando:

\[ \mathbf{E}[X^2] = \frac{1}{2\pi } \int _{0}^{2\pi } \cos ^2 \theta \, d\theta = \frac{1}{4\pi } \int _{0}^{2\pi } (1 + \cos (2\theta )) \, d\theta = \frac{1}{2}. \]

De forma semelhante:

\[ \mathbf{E}[Y^2] = \frac{1}{2\pi } \int _{0}^{2\pi } \sin ^2 \theta \, d\theta = \frac{1}{4\pi } \int _{0}^{2\pi } (1 - \cos (2\theta )) \, d\theta = \frac{1}{2}. \]

Por fim:

\[ \mathbf{E}[X^2Y^2] = \frac{1}{2\pi } \int _{0}^{2\pi } \cos ^2 \theta \sin ^2 \theta \, d\theta = \frac{1}{16\pi } \int _{0}^{2\pi } (1 - \cos (4\theta )) \, d\theta = \frac{1}{8}. \]

Logo:

\[ \mathbf{E}[X^2Y^2] = \frac{1}{8} \neq \frac{1}{4} = \mathbf{E}[X^2]\mathbf{E}[Y^2]. \]

Isso implica que \( X \) e \( Y \) não são independentes.

Dois resultados relacionam a esperança e a mediana a problemas de predição. Suponhamos que se queira escolher uma constante real \(c\) para representar o valor de uma variável aleatória \(X\). Se o critério é minimizar o erro absoluto médio, isto é, a média de \(|X-c|\), uma mediana é um preditor ótimo (veja a definição adiante). Se o critério é minimizar o erro quadrático médio \(\mathbf{E}(X-c)^2\), o melhor preditor é a média:

Proposição 8.9
Seja \(X\) uma variável aleatória com \(\mathbf{E}[X^2]\lt \infty \) e \(\mu =\mathbf{E}[X]\). Então \(\mu \) minimiza o erro quadrático médio:
\[ \operatorname {Var}X=\mathbf{E}(X-\mu )^2=\min _{c \in \mathbb {R}} \mathbf{E}(X-c)^2 . \]

Demonstração

\((X-c)^2=(X-\mu +\mu -c)^2=(X-\mu )^2+2(\mu -c)(X-\mu )+(\mu -c)^2\), logo (pela linearidade da esperança)

\[ \begin{aligned} \mathbf{E}(X-c)^2= & \mathbf{E}(X-\mu )^2+2(\mu -c)(\mathbf{E}[X]-\mu )+ \\ & +(\mu -c)^2=\operatorname {Var}X+(\mu -c)^2 . \end{aligned} \]

Logo\(\mathbf{E}(X-c)^2 \geq \mathbf{E}(X-\mu )^2, \forall c \in \mathbb {R}\).

Proposição 8.10
Seja \(X\) integrável e seja \(m\) uma mediana de \(X\). Então \(m\) minimiza o erro absoluto médio:
\[ \mathbf{E}|X-m|=\min _{c \in \mathbb {R}} \mathbf{E}|X-c| . \]

Por definição, \(m\) é uma mediana de \(X\) se \(\P (X \geq m) \geq 1 / 2\) e \(\P (X \leq m) \geq 1 / 2\).

8.3.1 Correlação

A covariância depende das unidades em que as variáveis são medidas. Para obter uma medida normalizada de associação linear, dividimos a covariância pelo produto dos desvios padrão. O coeficiente de correlação assim definido varia entre -1 e 1.

Definição 8.4
A correlação das duas variáveis aleatórias \(X\) e \(Y\), representada por \(\rho (X, Y)\), é definida, desde que \(\operatorname {Var}(X)\) e \(\operatorname {Var}(Y)\) sejam positivas, como
\[ \rho (X, Y)=\frac{\operatorname {Cov}(X, Y)}{\sqrt{\operatorname {Var}(X) \operatorname {Var}(Y)}} \]
Pode-se mostrar que

Proposição 8.11

\begin{equation} -1 \leq \rho (X, Y) \leq 1 \label{eq:356} \tag{8.13} \end{equation}

Demonstração

Para demonstrar a Equação 8.13, suponha que \(X\) e \(Y\) tenham variâncias dadas por \(\sigma _{x}^{2}\) e \(\sigma _{y}^{2}\), respectivamente. Então, por um lado,

\[ \begin{aligned} 0 & \leq \operatorname {Var}\left(\frac{X}{\sigma _{x}}+\frac{Y}{\sigma _{y}}\right) \\ & =\frac{\operatorname {Var}(X)}{\sigma _{x}^{2}}+\frac{\operatorname {Var}(Y)}{\sigma _{y}^{2}}+\frac{2 \operatorname {Cov}(X, Y)}{\sigma _{x} \sigma _{y}} \\ & =2[1+\rho (X, Y)] \end{aligned} \]

o que implica que

\[ -1 \leq \rho (X, Y) \]

Por outro lado,

\[ \begin{aligned} 0 & \leq \operatorname {Var}\left(\frac{X}{\sigma _{x}}-\frac{Y}{\sigma _{y}}\right) \\ & =\frac{\operatorname {Var}(X)}{\sigma _{x}^{2}}+\frac{\operatorname {Var}Y}{\left(-\sigma _{y}\right)^{2}}-\frac{2 \operatorname {Cov}(X, Y)}{\sigma _{x} \sigma _{y}} \\ & =2[1-\rho (X, Y)] \end{aligned} \]

o que implica que

\[ \rho (X, Y) \leq 1 \]

o que completa a demonstração da Equação 8.13.

De fato, como \(\operatorname {Var}(Z)=0\) implica que \(Z\) é constante com probabilidade 1, a igualdade ocorre exatamente quando \(Y=a+bX\) com probabilidade 1: temos \(\rho (X,Y)=1\) se \(b\gt 0\) e \(\rho (X,Y)=-1\) se \(b\lt 0\).

A correlação mede associação linear. Valores próximos de \(1\) ou \(-1\) indicam forte alinhamento linear; o sinal indica a direção. Já \(\rho (X,Y)=0\) significa apenas que as variáveis são não correlacionadas. Não significa independência nem ausência de relação: o exemplo anterior tem covariância zero e, ainda assim, dependência entre \(X\) e \(Y\).

8.4 Esperança condicional

A esperança depende da informação que temos. Considere dois dados independentes: \(X\) é a soma dos resultados e \(Y\) é o resultado do primeiro dado. Antes de observar qualquer dado,

\[ \mathbf{E}[X]=7. \]

Se descobrimos que \(Y=5\), então

\[ X=5+\text{resultado do segundo dado}, \qquad \mathbf{E}[X\mid Y=5]=8{,}5. \]

A variável \(X\) não mudou; mudou a informação disponível sobre ela.

A esperança condicional é a média calculada com a informação adicional: condicionamos a distribuição de \(X\) ao valor \(Y=y\) e, em seguida, calculamos a esperança com essa distribuição.

Definição 8.5
  • Se \(X\) e \(Y\) são conjuntamente discretas, para \(p_Y(y)\gt 0\),

    \[ \mathbf{E}[X\mid Y=y] =\sum _x x\, p_{X\mid Y}(x\mid y). \]
  • Se \(X\) e \(Y\) são conjuntamente contínuas, para \(f_Y(y)\gt 0\),

    \[ \mathbf{E}[X\mid Y=y] =\int _{-\infty }^{\infty } x\, f_{X\mid Y}(x\mid y)\, dx. \]
Há uma distinção importante. Para \(y\) fixado, \(\mathbf{E}[X\mid Y=y]\) é um número. Se deixamos \(y\) variar, obtemos uma função

\[ \varphi (y)=\mathbf{E}[X\mid Y=y]. \]

No exemplo dos dados, \(\varphi (y)=y+3{,}5\). Antes de observar \(Y\), portanto, \(\varphi (Y)\) ainda é aleatória; essa variável será denotada por

\[ \mathbf{E}[X\mid Y]. \]

Em resumo: \(\mathbf{E}[X\mid Y=y]\) é uma média para uma informação já conhecida; \(\mathbf{E}[X\mid Y]\) registra qual média será usada quando \(Y\) for observado.

No caso contínuo, por exemplo,

\[ \mathbf{E}[Y\mid X=x] =\int _{-\infty }^{\infty } y\, f_{Y\mid X}(y\mid x)\, dy. \]

Esse número é o centro da distribuição condicional de \(Y\) para o valor observado \(X=x\). À medida que \(x\) varia, esses centros formam a função

\[ \varphi (x)=\mathbf{E}[Y\mid X=x], \]

frequentemente chamada de linha de regressão; veja a Figura 8.5.

Figura 8.5 Linha de regressão

Figura 8.5 Linha de regressão

Exemplo 8.10

Seja

\[ f_{X Y}(x, y)= \begin{cases} 1 & 0\lt |y|\lt x\lt 1 \\ 0 & \text{ caso contrário }\end{cases} \]

Determine \(\mathbf{E}( X \mid Y )\) e \(\mathbf{E}( Y \mid X )\).

Sol Como a Figura 8.6 mostra, \(f_{X Y}(x, y)=1\) na área sombreada e zero em outros lugares. Portanto,

\[ f_{X}(x)=\int _{-x}^{x} f_{X Y}(x, y) d y=2 x \quad 0\lt x\lt 1 \]

e

\[ f_{Y}(y)=\int _{|y|}^{1} 1 d x=1-|y| \quad |y|\lt 1 \]

Isso dá

\[ f_{X\mid Y}(x\mid y)=\frac{1}{1-|y|}, \qquad |y|\lt x\lt 1, \]

e

\[ f_{Y\mid X}(y\mid x)=\frac{1}{2x}, \qquad -x\lt y\lt x. \]

Portanto,

\[ \mathbf{E}[X\mid Y=y] =\int _{|y|}^{1}\frac{x}{1-|y|}\, dx =\frac{1+|y|}{2}, \qquad |y|\lt 1, \]

enquanto, por simetria,

\[ \mathbf{E}[Y\mid X=x] =\int _{-x}^{x}\frac{y}{2x}\, dy=0, \qquad 0\lt x\lt 1. \]

Logo,

\[ \mathbf{E}[X\mid Y]=\frac{1+|Y|}{2}, \qquad \mathbf{E}[Y\mid X]=0. \]

Se \(Y\) não traz informação sobre \(X\), a média também não deve mudar.

Proposição 8.12
Se \(X\) e \(Y\) são independentes, então
\[ \mathbf{E}[X\mid Y]=\mathbf{E}[X]. \]
Mais geralmente,
\[ \mathbf{E}[g(X)\mid Y]=\mathbf{E}[g(X)] \]
sempre que as esperanças existirem.

Demonstração

A independência implica que a distribuição condicional de \(X\) dado \(Y=y\) coincide com a distribuição marginal de \(X\): no caso discreto, \(p_{X\mid Y}(x\mid y)=p_X(x)\), e no contínuo, \(f_{X\mid Y}(x\mid y)=f_X(x)\). Substituindo na definição de esperança condicional obtemos o resultado.

Exemplo 8.11

Se \(X\) e \(Y\) são variáveis aleatórias binomiais independentes com parâmetros \(n\) e \(p\) idênticos, calcule o valor esperado condicional de \(X\) dado que \(X+Y=m\).

Sol Vamos primeiro calcular a função de probabilidade condicional de \(X\) dado que \(X+Y=m\). Para \(k \leq \min (n, m)\),

\[ \begin{aligned} \P (X=k \mid X+Y=m) & =\frac{\P (X=k, X+Y=m)}{\P (X+Y=m)} \\ & =\frac{\P (X=k, Y=m-k)}{\P (X+Y=m)} \\ & =\frac{\P (X=k) \P (Y=m-k)}{\P (X+Y=m)} \\ & =\frac{\binom {n}{k} p^{k}(1-p)^{n-k}\binom {n}{m-k} p^{m-k}(1-p)^{n-m+k}}{\binom {2 n}{m} p^{m}(1-p)^{2 n-m}} \\ & =\frac{\binom {n}{k}\binom {n}{m-k} }{\binom {2 n }{m}} \end{aligned} \]

onde usamos o fato de que \(X+Y\) é uma variável aleatória binomial com parâmetros \(2 n\) e \(p\). Com isso, a distribuição condicional de \(X\) dado que \(X+Y=m\) é hipergeométrica. Mais precisamente, trata-se de uma hipergeométrica com população \(2n\), \(n\) elementos de um dos tipos e amostra de tamanho \(m\). Assim, pela fórmula da esperança da hipergeométrica, obtemos

\[ \mathbf{E}[X \mid X+Y=m]=\frac{m}{2}. \]

Exemplo 8.12

Suponha que a densidade conjunta de \(X\) e \(Y\) seja dada por

\[ f(x, y)=\frac{e^{-x / y} e^{-y}}{y} \quad 0\lt x\lt \infty , 0\lt y\lt \infty \]

Calcule \(\mathbf{E}[X \mid Y=y]\).

Sol Começamos calculando a densidade condicional

\[ \begin{aligned} f_{X \mid Y}(x \mid y)& =\frac{f_{XY}(x, y)}{f_{Y}(y)} \\ & =\frac{f_{XY}(x,y)}{\int _{-\infty }^{\infty }f_{XY}(u,y)\, du} \\ & =\frac{(1 / y) e^{-x / y} e^{-y}}{\int _{0}^{\infty }(1 / y) e^{-x / y} e^{-y} d x} \\ & =\frac{(1 / y) e^{-x / y}}{\int _{0}^{\infty }(1 / y) e^{-x / y} d x} \\ & =\frac{1}{y} e^{-x / y} \end{aligned} \]

Com isso, a distribuição condicional de \(X\), dado que \(Y=y\), é uma distribuição exponencial com média \(y\). Assim,

\[ \mathbf{E}[X \mid Y=y]=\int _{0}^{\infty } \frac{x}{y} e^{-x / y} d x=y \]

Uma vez fixado \(Y=y\), calculamos com a distribuição condicional exatamente como calcularíamos com qualquer outra distribuição. Em particular,

\[ \mathbf{E}[g(X)\mid Y=y] = \begin{cases} \sum _x g(x)\, p_{X\mid Y}(x\mid y), & \text{caso discreto},\\[4pt] \int _{-\infty }^{\infty } g(x)\, f_{X\mid Y}(x\mid y)\, dx, & \text{caso contínuo}, \end{cases} \]

e a linearidade continua válida. No caso contínuo, embora \(\P (Y=y)=0\), a densidade condicional fornece a regra correta; não estamos dividindo por \(\P (Y=y)\).

8.4.1 Esperança condicional como variável aleatória

A distinção apresentada no exemplo inicial pode ser formalizada da seguinte maneira.

Definição 8.6
A esperança condicional \(\mathbf{E}[X\mid Y]\) é a variável aleatória \(\varphi (Y)\), em que
\[ \varphi (y)=\mathbf{E}[X\mid Y=y]. \]
Para cada informação possível \(Y=y\), consideramos a média correspondente. A lei da esperança total relaciona essas médias condicionais à média original.

Proposição 8.13
Se \(X\) é integrável, então

\begin{equation} \mathbf{E}[X]=\mathbf{E}[\mathbf{E}[X \mid Y]]. \label{prop:expcond} \tag{8.14} \end{equation}

Demonstração

No caso contínuo, substituímos a densidade condicional:

\[ \begin{aligned} \mathbf{E}[\mathbf{E}[X\mid Y]] & =\int _{-\infty }^{\infty } \left[\int _{-\infty }^{\infty } x\, \frac{f_{X,Y}(x,y)}{f_Y(y)}\, dx\right]f_Y(y)\, dy\\ & =\int _{-\infty }^{\infty }x \left[\int _{-\infty }^{\infty }f_{X,Y}(x,y)\, dy\right]dx\\ & =\int _{-\infty }^{\infty }x f_X(x)\, dx=\mathbf{E}[X]. \end{aligned} \]

A integrabilidade de \(X\) justifica a troca da ordem de integração. No caso discreto, o mesmo cálculo é feito trocando integrais por somas.

Se \(Y\) é uma variável aleatória discreta, então a Equação 8.14 diz que

\begin{equation} \mathbf{E}[X]=\sum _{y} \mathbf{E}[X \mid Y=y] \P (Y=y) \tag{8.15} \end{equation}

Por outro lado, se \(Y\) é contínua com densidade \(f_{Y}(y)\), a Equação 8.14 diz que

\begin{equation} \mathbf{E}[X]=\int _{-\infty }^{\infty } \mathbf{E}[X \mid Y=y] f_{Y}(y) d y \tag{8.16} \end{equation}

A identidade (8.14) é chamada de lei da esperança total. Ela calcula a média global ponderando as médias condicionais pela distribuição de \(Y\). Em muitos problemas, fixar \(Y\) simplifica o cálculo da média condicional; os exemplos seguintes mostram como usar essa decomposição.

Exemplo 8.13

Em um experimento, um ratinho é colocado em um labirinto com três portas. A primeira porta conduz a um túnel que o leva à saída após 12 minutos. A segunda porta leva a um túnel que o fará retornar ao labirinto após 36 minutos. Já a terceira porta conduz a um túnel que também o faz retornar ao labirinto, mas após 48 minutos. Supondo que o ratinho escolha qualquer uma das portas com igual probabilidade, qual é o tempo esperado até que ele consiga sair do labirinto?

Sol Seja \( X \) o tempo (em minutos) até que o ratinho alcance a saída, e seja \( Y \) a porta escolhida inicialmente. O tempo esperado \( \mathbf{E}[X] \) pode ser expresso como:

\[ \begin{aligned} \mathbf{E}[X] & =\mathbf{E}[X\mid Y=1]\P (Y=1)+\mathbf{E}[X\mid Y=2]\P (Y=2)\\ & \quad +\mathbf{E}[X\mid Y=3]\P (Y=3). \end{aligned} \]

Como as portas são escolhidas com igual probabilidade, temos:

\[ \mathbf{E}[X] = \frac{1}{3} \left( \mathbf{E}[X \mid Y=1] + \mathbf{E}[X \mid Y=2] + \mathbf{E}[X \mid Y=3] \right). \]

Agora, analisamos cada caso condicionado à escolha da porta inicial:

\begin{align} \mathbf{E}[X \mid Y=1] & = 12, \nonumber \\ \mathbf{E}[X \mid Y=2] & = 36 + \mathbf{E}[X], \nonumber \\ \mathbf{E}[X \mid Y=3] & = 48 + \mathbf{E}[X]. \label{eq:368} \tag{8.17} \end{align}

A justificativa para as equações acima é a seguinte: se o ratinho escolher a primeira porta, ele sairá do labirinto em exatamente 12 minutos, logo \( \mathbf{E}[X \mid Y=1] = 12 \). Se escolher a segunda porta, gastará 36 minutos no túnel antes de retornar ao labirinto, e então o problema será idêntico ao inicial, com um tempo esperado adicional \( \mathbf{E}[X] \). Portanto, \( \mathbf{E}[X \mid Y=2] = 36 + \mathbf{E}[X] \). Um raciocínio semelhante aplica-se à terceira porta, resultando em \( \mathbf{E}[X \mid Y=3] = 48 + \mathbf{E}[X] \).

Substituindo essas expressões na equação para \( \mathbf{E}[X] \), obtemos:

\[ \mathbf{E}[X] = \frac{1}{3} \left( 12 + (36 + \mathbf{E}[X]) + (48 + \mathbf{E}[X]) \right). \]

Simplificando:

\[ \mathbf{E}[X] = \frac{1}{3} \left( 96 + 2\mathbf{E}[X] \right). \]

Multiplicando ambos os lados por 3 e isolando \( \mathbf{E}[X] \), temos:

\[ 3\mathbf{E}[X] = 96 + 2\mathbf{E}[X] \quad \implies \quad \mathbf{E}[X] = 96. \]

Portanto, o tempo esperado para que o ratinho saia do labirinto é de 96 minutos.

Exemplo 8.14 (Esperança da soma de um número aleatório de v.a.)

Considere uma cafeteria onde o número de clientes que entram em um determinado dia é uma variável aleatória com média igual a \(70\). Suponha também que os valores gastos pelos clientes sejam variáveis aleatórias independentes, com uma média comum de \(R\$ 60,00\). Além disso, assuma que os gastos de cada cliente são independentes do número total de clientes que entram na cafeteria. Qual é o valor esperado do total gasto na cafeteria em um dia?

Sol

Seja \(N\) o número de clientes que entram na cafeteria e \(X_i\) o valor gasto pelo \(i\)-ésimo cliente. O gasto total no dia pode ser expresso como \(\sum _{i=1}^{N} X_i\). Calculamos a expectativa da soma da seguinte forma:

\[ \mathbf{E}\left[\sum _{i=1}^{N} X_i\right] = \mathbf{E}\left[\mathbf{E}\left[\sum _{i=1}^{N} X_i \mid N = n\right]\right]. \]

Por outro lado:

\[ \mathbf{E}\left[\sum _{i=1}^{N} X_i \mid N = n\right] = \mathbf{E}\left[\sum _{i=1}^{n} X_i \mid N = n\right]. \]

Devido à independência entre \(X_i\) e \(N\), temos:

\[ \mathbf{E}\left[\sum _{i=1}^{n} X_i \mid N = n\right] = \mathbf{E}\left[\sum _{i=1}^{n} X_i\right]. \]

Como as variáveis \(X_i\) são independentes e identicamente distribuídas, segue que:

\[ \mathbf{E}\left[\sum _{i=1}^{n} X_i\right] = n \mathbf{E}[X], \quad \text{onde } \mathbf{E}[X] = \mathbf{E}[X_i]. \]

Assim, concluímos que:

\[ \mathbf{E}\left[\sum _{i=1}^{N} X_i \mid N\right] = N \mathbf{E}[X]. \]

Logo:

\[ \mathbf{E}\left[\sum _{i=1}^{N} X_i\right] = \mathbf{E}[N \mathbf{E}[X]] = \mathbf{E}[N] \mathbf{E}[X]. \]

No contexto do exemplo, temos \(\mathbf{E}[N] = 70\) e \(\mathbf{E}[X] = 60\). Portanto, a quantidade esperada de dinheiro gasto na cafeteria em um dia é:

\[ 70 \times R\$ 60,00 = R\$ 4.200,00. \]

Exemplo 8.15

O tempo necessário para descarregar um trem que transporta cereais é distribuído uniformemente entre \( a \) e \( b \) horas, isto é, \( T \sim U(a, b) \), quando não há interrupções. No entanto, a grua utilizada na descarga é pouco confiável e está sujeita a avarias que ocorrem de acordo com uma distribuição de Poisson com média de \( \lambda \) avarias por hora. Cada vez que a grua falha, são necessárias \( d \) horas para consertá-la. Nosso objetivo é determinar o tempo médio real de descarga do trem, considerando todas essas condições.

Sol Seja \( T_R \) o tempo real de descarga do trem, cujo valor esperado \( \mathbf{E}(T_R) \) desejamos encontrar. Observamos que \( T_R \) depende do tempo de descarga sem interrupções \( T \) e do número de avarias \( N_T \) que ocorrem durante esse período. O número de avarias \( N_T \) segue uma distribuição de Poisson com parâmetro \( \lambda T \), ou seja, \( N_T \sim \text{Poisson}(\lambda T) \).

Para calcular \( \mathbf{E}(T_R) \), utilizamos a propriedade da esperança condicional:

\[ \mathbf{E}(T_R) = \mathbf{E}[\mathbf{E}(T_R \mid T)]. \]

Primeiro, determinamos \( \mathbf{E}(T_R \mid T) \). Dado que o tempo de descarga sem interrupções é \( T \) e ocorrem \( N_T = n \) avarias, o tempo real de descarga é:

\[ T_R = T + n d. \]

Assim, a esperança condicional é:

\[ \mathbf{E}(T_R \mid T) = \sum _{n=0}^{\infty } (T + n d) \cdot \P (N_T = n). \]

Podemos separar a soma em duas partes:

\[ \mathbf{E}(T_R \mid T) = T \sum _{n=0}^{\infty } \P (N_T = n) + d \sum _{n=0}^{\infty } n \P (N_T = n). \]

Sabemos que:

  • \(\sum _{n=0}^{\infty } \P (N_T = n) = 1\), pois é a soma das probabilidades de todas as possíveis quantidades de avarias.

  • \(\mathbf{E}[N_T \mid T] = \sum _{n=0}^{\infty } n \P (N_T = n) = \lambda T\), já que \( N_T \) é Poisson com média \( \lambda T \).

Portanto:

\[ \mathbf{E}(T_R \mid T) = T \cdot 1 + d \cdot \lambda T = T (1 + d \lambda ). \]

Agora, calculamos \( \mathbf{E}(T_R) \):

\[ \mathbf{E}(T_R) = \mathbf{E}[\mathbf{E}(T_R \mid T)] = \mathbf{E}[T (1 + d \lambda )] = (1 + d \lambda ) \mathbf{E}(T). \]

Como \( T \) é uma variável aleatória uniforme em \( [a, b] \), seu valor esperado é:

\[ \mathbf{E}(T) = \frac{a + b}{2}. \]

Substituindo, obtemos o tempo médio real de descarga:

\[ \mathbf{E}(T_R) = \frac{(a + b)(1 + d \lambda )}{2}. \]

O tempo médio real de descarga do trem é o tempo médio sem interrupções, \( \frac{a + b}{2} \), ajustado pelo fator \( (1 + d \lambda ) \), que representa o impacto médio das avarias da grua no processo de descarga.

Exemplo 8.16

Três máquinas estão nas posições \(0\), \(1\) e \(2\) metros de uma linha. A cada chamado, qualquer uma delas pode falhar com probabilidade \(1/3\), independentemente da máquina atendida no chamado anterior. Um trabalhador compara duas estratégias:

  1. permanecer na máquina que acabou de reparar até o próximo chamado;

  2. retornar sempre à posição central, \(1\), depois de cada reparo.

Se \(X\) é a distância percorrida entre dois chamados consecutivos, qual estratégia produz a menor distância média?

Estratégia 1 Sejam \(I\) e \(J\) as posições das máquinas nos dois chamados. Elas são independentes e uniformes em \(\{ 0,1,2\} \), e \(X=|I-J|\). Portanto,

\[ \mathbf{E}_1[X]=\frac{1}{9}\sum _{i=0}^{2}\sum _{j=0}^{2}|i-j| =\frac{8}{9}\text{ metro}. \]

Estratégia 2 Entre dois chamados, o trabalhador vai da posição central até a máquina \(J\) e retorna ao centro; assim, \(X=2|J-1|\). Logo,

\[ \mathbf{E}_2[X]=\frac{1}{3}(2+0+2)=\frac{4}{3}\text{ metro}. \]

Nesse modelo, a estratégia 1 é melhor: ela reduz a distância média de \(4/3\) para \(8/9\) de metro por intervalo entre chamados.

Exemplo 8.17 (Variância da distribuição geométrica)

Considere uma sequência de tentativas independentes, nas quais cada tentativa possui uma probabilidade de sucesso \( p \). Denotemos por \( N \) o momento em que ocorre o primeiro sucesso. O objetivo é determinar a variância de \( N \), ou seja, \( \operatorname {Var}(N) \), sendo \(N\) uma geométrica.

Sol Para abordar a questão, consideremos uma variável indicadora \( Y \) definida da seguinte forma:

  • \( Y = 1 \) se a primeira tentativa resultar em sucesso (neste caso, \( N = 1 \)),

  • \( Y = 0 \) caso contrário (neste caso, \( N \) será maior ou igual a 2).

A variância de \( N \) pode ser expressa pela seguinte fórmula:

\[ \operatorname {Var}(N) = \mathbf{E}[N^{2}] - (\mathbf{E}[N])^{2}. \]

Para calcular \( \mathbf{E}[N^{2}] \), utilizamos a lei da esperança condicional:

\[ \mathbf{E}[N^{2}] = \mathbf{E}[\mathbf{E}[N^{2} \mid Y]]. \]

Agora, vamos considerar os dois casos possíveis para \( Y \):

  1. Caso em que \( Y = 1 \) (a primeira tentativa é um sucesso): - Neste caso, temos \( N = 1 \), logo:

    \[ \mathbf{E}[N^{2} \mid Y=1] = 1^{2} = 1. \]
  2. Caso em que \( Y = 0 \) (a primeira tentativa é um fracasso): Se a primeira tentativa falhar, já se passou uma tentativa sem sucesso. O número total de tentativas necessárias para o primeiro sucesso será igual a 1 (a tentativa falha) mais o número de tentativas adicionais necessárias até o primeiro sucesso, que também segue a mesma distribuição que \( N \). Assim, podemos expressar \( N \) como:

    \[ N = 1 + N', \]

    onde \( N' \) é a variável aleatória que conta o número de tentativas até o primeiro sucesso após a primeira tentativa fracassada. Portanto, temos:

    \[ \mathbf{E}[N^{2} \mid Y=0] = \mathbf{E}[(1 + N)^{2}]. \]

Com isso,

\[ \begin{aligned} \mathbf{E}\left[N^{2}\right] & =\mathbf{E}\left[N^{2} \mid Y=1\right] \P (Y=1)+\mathbf{E}\left[N^{2} \mid Y=0\right] \P (Y=0) \\ & =p+(1-p) \mathbf{E}\left[(1+N)^{2}\right] \\ & =1+(1-p) \mathbf{E}\left[2 N+N^{2}\right] \end{aligned} \]

Como \(\mathbf{E}[N]=1 / p\) temos que

\[ \mathbf{E}\left[N^{2}\right]=1+\frac{2(1-p)}{p}+(1-p) \mathbf{E}\left[N^{2}\right] \]

ou

\[ \mathbf{E}\left[N^{2}\right]=\frac{2-p}{p^{2}} \]

Consequentemente,

\[ \begin{aligned} \operatorname {Var}(N) & =\mathbf{E}\left[N^{2}\right]-(\mathbf{E}[N])^{2} \\ & =\frac{2-p}{p^{2}}-\left(\frac{1}{p}\right)^{2} \\ & =\frac{1-p}{p^{2}} \end{aligned} \]

Exemplo 8.18 (Problema das Paradas de Ônibus)

O número de pessoas que embarcaram num ônibus é uma variável aleatória de Poisson com média \( \mu = 5 \). Um ônibus passa por \( N = 10 \) pontos, e cada passageiro tem a mesma probabilidade de descer em qualquer um dos \( N \) pontos, independentemente de onde os outros passageiros descem. Calcule o número esperado de paradas que o ônibus fará antes que todos os passageiros desembarquem.

Sol Seja \( X \) o número de pessoas esperando no ponto de ônibus. Assim, \( X \sim \text{Poisson}(5) \). Seja \( Y \) o número de pontos nos quais o ônibus para para desembarcar passageiros. (\( X \) e \( Y \) são variáveis aleatórias.)

\[ \mathbf{E}[Y] = \sum _{k=0}^\infty \mathbf{E}[Y \mid X = k] \P (X = k) \]

A função de probabilidade de \(X\) é

\[ \P (X = k) = e^{-5} \frac{5^k}{k!}. \]

Seja \( Y_i \) uma variável aleatória indicadora, onde \( Y_i = 1 \) se o ônibus para no \( i \)-ésimo ponto, e \( Y_i = 0 \) caso contrário.

\[ \mathbf{E}[Y \mid X = k] = \mathbf{E}[Y_1 + Y_2 + \dots + Y_{10} \mid X = k] \]
\[ \mathbf{E}[Y_i \mid X = k] = 1 - \left(1 - \frac{1}{10}\right)^k \]

Pela linearidade da esperança:

\[ \mathbf{E}[Y \mid X = k] = 10 \cdot \left(1 - \left(1 - \frac{1}{10}\right)^k\right). \]

Finalmente, juntando tudo:

\begin{align} \mathbf{E}[Y] & = \sum _{k=0}^\infty \left( 10 \cdot \left(1 - \left(1 - \frac{1}{10}\right)^k\right) \cdot e^{-5} \frac{5^k}{k!} \right) \tag{8.18}\\ & =10 e^{-5} \left(\sum _{k=0}^\infty \frac{5^k}{k!} -\sum _{k=0}^\infty \left( \left( \frac{9}{10}\right)^k \cdot \frac{5^k}{k!} \right)\right) \tag{8.19}\\ & =10 - 10 e^{-5} \sum _{k=0}^\infty \frac{ \left( \frac{9}{2} \right)^k }{ k! } \tag{8.20}\\ & = 10-10 e^{-5} e^{ \frac{9}{2} }=10-\frac{10}{\sqrt{e}} \tag{8.21} \end{align}

Variância condicional

Definição 8.7 (Variância Condicional)
A variância condicional de \(X\), dado \(Y=y\), é
\[ \begin{aligned} \operatorname {Var}(X \mid Y = y) & = \mathbf{E}\bigl[(X-\mathbf{E}[X\mid Y=y])^2\mid Y=y\bigr]\\ & = \mathbf{E}[X^2\mid Y=y]-(\mathbf{E}[X\mid Y=y])^2, \end{aligned} \]
supondo a existência das esperanças envolvidas.
Definição 8.8 (Covariância Condicional)
A covariância condicional entre \(X\) e \(Y\), dado \(Z=z\), é
\[ \operatorname {Cov}(X,Y\mid Z=z) =\mathbf{E}[XY\mid Z=z]-\mathbf{E}[X\mid Z=z]\mathbf{E}[Y\mid Z=z], \]
supondo a existência das esperanças envolvidas.
Como ocorre com a esperança condicional, \(\operatorname {Var}(X\mid Y)\) e \(\operatorname {Cov}(X,Y\mid Z)\) são funções das variáveis usadas no condicionamento e, portanto, também são variáveis aleatórias.

Proposição 8.14 (Lei da variância total)
Para variáveis aleatórias \(X\) e \(Y\), com \(\mathbf{E}[X^2]\lt \infty \),

\begin{equation} \label{eq:vt1} \operatorname {Var}(X) = \mathbf{E}[\operatorname {Var}(X \mid Y)] + \operatorname {Var}(\mathbf{E}[X \mid Y]). \tag{8.22} \end{equation}

Podemos provar que essa fórmula é válida começando pela definição de variância e utilizando a fórmula da expectativa condicional duas vezes:

\begin{align*} \operatorname {Var}(X) & =\mathbf{E}[X^2]-\mathbf{E}[X]^2\\ & =\mathbf{E}[\mathbf{E}(X^2\mid Y)]-\mathbf{E}[\mathbf{E}(X\mid Y)]^2\\ & =\mathbf{E}\! \left[\mathbf{E}(X^2\mid Y)-\mathbf{E}(X\mid Y)^2\right] +\mathbf{E}[\mathbf{E}(X\mid Y)^2]-\mathbf{E}[\mathbf{E}(X\mid Y)]^2\\ & =\mathbf{E}[\operatorname {Var}(X\mid Y)]+\operatorname {Var}(\mathbf{E}[X\mid Y]). \end{align*}

Na equação intermediária, adicionamos e subtraímos o termo necessário para reorganizar como expectativa e variância.

Exemplo 8.19

Seja \( N \) o número de clientes que visitam uma determinada cafeteria em um dia. Suponha que conhecemos \( \mathbf{E}[N] \) e \( \operatorname {Var}(N) \). Seja \( X_i \) o valor médio que o \( i \)-ésimo cliente gasta. Admitimos que os \( X_i \)’s são independentes entre si e também independentes de \( N \). Assumimos ainda que possuem a mesma média e variância:

\[ \mathbf{E}[X_i] = \mathbf{E}[X], \quad \operatorname {Var}(X_i) = \operatorname {Var}(X). \]

Seja \( Y \) o total de vendas da loja, ou seja,

\[ Y = \sum _{i=1}^N X_i. \]

Determine \( \mathbf{E}[Y] \) e \( \operatorname {Var}(Y) \).

Sol Para encontrar \( \mathbf{E}[Y] \), não podemos utilizar diretamente a linearidade da expectativa, pois \( N \) é aleatório. No entanto, condicionado a \( N = n \), podemos aplicar a linearidade e encontrar \( \mathbf{E}[Y \mid N = n] \). Assim, utilizamos a lei da expectativa iterada:

\[ \mathbf{E}[Y] = \mathbf{E}[\mathbf{E}[Y \mid N]] \quad \text{(lei da expectativa iterada)}. \]

Substituímos \( Y \) pela soma condicional:

\[ \mathbf{E}[Y] = \mathbf{E}\left[ \mathbf{E}\left[ \sum _{i=1}^N X_i \mid N \right] \right]. \]

Pela linearidade da expectativa:

\[ \mathbf{E}[Y] = \mathbf{E}\left[ \sum _{i=1}^N \mathbf{E}[X_i \mid N] \right]. \]

Como \( X_i \)’s são independentes de \( N \):

\[ \mathbf{E}[Y] = \mathbf{E}\left[ \sum _{i=1}^N \mathbf{E}[X_i] \right]. \]

Substituímos \( \mathbf{E}[X_i] = \mathbf{E}[X] \):

\[ \mathbf{E}[Y] = \mathbf{E}\left[ N \cdot \mathbf{E}[X] \right]. \]

Como \( \mathbf{E}[X] \) é constante:

\[ \mathbf{E}[Y] = \mathbf{E}[X] \cdot \mathbf{E}[N]. \]

Para encontrar \( \operatorname {Var}(Y) \), utilizamos a lei da variância total:

\[ \operatorname {Var}(Y) = \mathbf{E}[\operatorname {Var}(Y \mid N)] + \operatorname {Var}(\mathbf{E}[Y \mid N]). \]

Sabemos que:

\[ \operatorname {Var}(Y) = \mathbf{E}[N \cdot \operatorname {Var}(X)] + \operatorname {Var}(N \cdot \mathbf{E}[X]). \]

Calculando os termos:

\[ \operatorname {Var}(Y) = \mathbf{E}[N] \cdot \operatorname {Var}(X) + (\mathbf{E}[X])^2 \cdot \operatorname {Var}(N). \]

Portanto:

\[ \operatorname {Var}(Y) = \mathbf{E}[N] \cdot \operatorname {Var}(X) + (\mathbf{E}[X])^2 \cdot \operatorname {Var}(N). \]

Exemplo 8.20

Uma máquina em uma fábrica produz chips de computador. Cada chip possui uma probabilidade \(\theta \) de ser defeituoso, e os chips são produzidos de forma independente, ou seja, a probabilidade de um chip ser defeituoso não depende do status dos outros chips. Suponha que a máquina produza 100 chips por dia. Toda manhã, quando a máquina é ligada, há um valor diferente de \(\theta \). De fato, \(\theta \) é uma variável aleatória que segue uma distribuição Beta(1,4). Se \(Y\) representa o número de defeituosos produzidos em um dia escolhido aleatoriamente, qual é o valor esperado de \(Y\)?

Sol Não precisamos calcular a função de probabilidade de \(Y\). Como \(Y\mid \theta \sim \operatorname {Bin}(100,\theta )\), usamos

\[ \mathbf{E}(Y) = \mathbf{E}[\mathbf{E}(Y \mid \theta )] = \mathbf{E}[100\theta ] = 20, \]

pois o valor esperado de \(\theta \) é \(1/5\).

Qual é o desvio padrão do número de defeituosos produzidos em um dia escolhido aleatoriamente? Usando a fórmula para a variância, temos:

\begin{align*} \operatorname {Var}(Y) & = \mathbf{E}[\operatorname {Var}(Y \mid \theta )] + \operatorname {Var}(\mathbf{E}[Y \mid \theta ]) \\ & = \mathbf{E}[100\theta (1 - \theta )] + \operatorname {Var}(100\theta ) \\ & = 100\mathbf{E}(\theta ) - 100\mathbf{E}(\theta ^2) + 10,000\operatorname {Var}(\theta ) \\ & = 100\mathbf{E}(\theta ) - 100[\operatorname {Var}(\theta ) + \mathbf{E}(\theta )^2] + 10,000\operatorname {Var}(\theta ) \\ & = 20 - 100\left(\frac{2}{75} + \frac{1}{25}\right) + 10,000\frac{2}{75} \\ & = 280. \end{align*}

Portanto, o desvio padrão do número de defeituosos é aproximadamente \(16.7\).

8.5 Momentos

A média e a variância envolvem \(X\) e \(X^2\). Os momentos estendem esse estudo a outras potências e descrevem, quando existem, diferentes aspectos da forma de uma distribuição.

Definição 8.9

Seja \( X \) uma variável aleatória. Para \( k = 1, 2, \dots \), o momento de ordem \( k \) da variável \( X \) é definido como:

\[ m_k=\mathbf{E}[X^k], \]

desde que esta quantidade seja finita. O momento de ordem \( 1 \), \( \mathbf{E}[X] \), é a média da variável aleatória.

Se \(X\) é integrável e \(\mu =\mathbf{E}[X]\), definimos o momento central de ordem \(k\) como

\[ \mathbf{E}[(X - \mu )^k], \]

desde que essa quantidade também exista. Este momento descreve a dispersão e outras propriedades da variável ao redor de sua média.

De forma semelhante, o momento absoluto de ordem \( k \) é dado por:

\[ \mathbf{E}[|X|^k]. \]
A existência dos momentos depende da convergência da integral. Em particular, operações do tipo \( \infty - \infty \) tornam o momento indefinido.

Exemplo 8.21 (Momentos de uma Distribuição Gama)

Considere \( X \sim \text{Gama}(\alpha , \beta ) \). Vamos calcular os momentos de ordem \( k \) desta variável.

\[ \mathbf{E}[X^k] = \int _0^\infty x^k \frac{\beta ^\alpha }{\Gamma (\alpha )} x^{\alpha -1} e^{-\beta x} dx. \]

Simplificando:

\[ \mathbf{E}[X^k] = \frac{\beta ^\alpha }{\Gamma (\alpha )} \int _0^\infty x^{k+\alpha -1} e^{-\beta x} dx. \]

Utilizando a definição da função Gama:

\[ \mathbf{E}[X^k] = \frac{\beta ^\alpha }{\Gamma (\alpha )} \frac{\Gamma (k+\alpha )}{\beta ^{k+\alpha }} = \frac{\Gamma (k+\alpha )}{\Gamma (\alpha ) \beta ^k}. \]

Escrevendo o resultado como produto de fatores sucessivos e usando a propriedade

que

\[ \Gamma (\alpha +1) = \alpha \, \Gamma (\alpha ) , \]

temos:

\[ \mathbf{E}[X^k] = \frac{\alpha (\alpha +1)\cdots (\alpha +k-1)}{\beta ^k}. \]

Se \( \alpha = 1 \), \( X \) segue uma distribuição Exponencial com parâmetro \( \beta \). Nesse caso:

\[ \mathbf{E}[X^k] = \frac{k!}{\beta ^k}. \]

Assim, os momentos podem ser obtidos de forma simples para este caso específico.

Exemplo 8.22 (Momentos da Distribuição Normal)

Seja a função densidade de probabilidade da variável aleatória normal dada por:

\begin{equation} f(x) = \frac{1}{\sigma \sqrt{2\pi }} e^{- \frac{x^2}{2\sigma ^2}}, \label{eq:normal_pdf} \tag{8.23} \end{equation}

onde a média é \(0\) e \(\sigma ^2\gt 0\) é a variância.

Os momentos da distribuição normal são definidos como:

\[ \mathbf{E}[X^n] = \int _{-\infty }^\infty x^n f(x) \, dx, \]

onde \(f(x)\) é a densidade fornecida em (8.23).

Mostraremos que os momentos de ordem \(n\) da variável normal são:

\begin{equation} \mathbf{E}[X^n] = \begin{cases} 0, & \text{se } n = 2k + 1, \\ 1 \cdot 3 \cdot \dotsb \cdot (n - 1) \sigma ^n, & \text{se } n = 2k. \end{cases} \label{eq:even_odd_moments} \tag{8.24} \end{equation}

Os momentos de ordem ímpar (\(n = 2k + 1\)) são iguais a zero devido à simetria da distribuição normal em torno da média zero. Como \(f(-x) = f(x)\) e \(x^{2k+1}\) é uma função ímpar, a integral sobre todo o eixo real é zero:

\[ \mathbf{E}[X^{2k+1}] = \int _{-\infty }^\infty x^{2k+1} f(x) \, dx = 0. \]

Para os momentos pares, é mais simples usar uma recorrência por integração por partes. A normalização da densidade equivale à identidade

\begin{equation} \int _{-\infty }^{\infty }e^{-x^2/(2\sigma ^2)}\, dx =\sigma \sqrt{2\pi }. \label{eq:gaussian_integral} \tag{8.25} \end{equation}

Para \(k\geq 1\), tome \(u=x^{2k-1}\) e \(dv=x e^{-x^2/(2\sigma ^2)}\, dx\). Como \(v=-\sigma ^2e^{-x^2/(2\sigma ^2)}\) e o termo de fronteira é zero,

\[ \mathbf{E}[X^{2k}]=(2k-1)\sigma ^2\mathbf{E}[X^{2k-2}]. \]

Partindo de \(\mathbf{E}[X^0]=1\), a recorrência fornece

\begin{equation} \mathbf{E}[X^{2k}]=(2k-1)(2k-3)\cdots 3\cdot 1\, \sigma ^{2k} =(2k-1)!!\, \sigma ^{2k}. \label{eq:even_moments} \tag{8.26} \end{equation}

Isso confirma a segunda parte de (8.24).

8.6 Funções geradoras de momento

A função geradora de momentos reúne os momentos em uma única função e permite recuperá-los por derivação. Além disso, transforma o estudo de somas de variáveis independentes no cálculo de produtos de funções geradoras.

Definição 8.10

A função geradora de momentos de \(X\) é

\[ \mathrm{M}_X(t)=\mathbf{E}[e^{tX}], \]

desde que essa esperança seja finita para todo \(t\) em algum intervalo \((-h,h)\), com \(h\gt 0\).

O nome vem de sua primeira propriedade: derivando em \(t=0\), recuperamos os momentos,

\[ \mathbf{E}[X^n]=M_X^{(n)}(0). \]

Além disso, quando existe em um intervalo ao redor de zero, \(M_X\) determina a distribuição de \(X\). Para somas de variáveis independentes, a função geradora da soma é o produto das funções geradoras individuais. Essas duas propriedades tornam a ferramenta especialmente eficiente para identificar distribuições de somas.

As fórmulas de cálculo seguem diretamente da definição de esperança:

\[ \mathrm{M}_X (t) = \mathbb {E}\! \left[e ^{tX}\right] = \begin{cases} \sum _i e ^{t x_i} p (x_i) & \text{se $ X $ é discreto} \\ \int _{-\infty }^{\infty } e ^{t x} f_X(x) \, dx & \text{se $ X $ tem densidade.} \end{cases} \]

Exemplo 8.23
A distribuição degenerada de probabilidade é a distribuição de uma variável aleatória constante. Se \(X=c\) com probabilidade \(1\), então
\[ M_X(t)=e^{ct}. \]

Exemplo 8.24
A função geradora de momentos de uma variável aleatória discreta \( X \) de Bernoulli com parâmetro \( p \) pode ser calculada lembrando que \( X \) assume valores \( 0 \) e \( 1 \), com as respectivas probabilidades \( \P (X=0)=1-p \) e \( \P (X=1)=p \). Assim, temos:
\begin{align*} M_X(t) = \mathbf{E}[e^{tX}] = \sum _{x} e^{tx} \P (X=x)\\ & = e^{t \cdot 0}(1 - p) + e^{t \cdot 1}p\\ & = (1 - p) + p e^t \end{align*}

Teorema 8.15

Se \(X\) possui função geradora de momentos em um intervalo aberto que contém zero, então

\[ \mathbf{E}\left(X^{n}\right)=\mathrm{M}_{X}^{(n)}(0)=\left.{\frac{d^{n}\mathrm{M}_{X}}{dt^{n}}}\right|_{t=0}. \]

Demonstração
\[ \mathrm{M}_{X}^{(n)}(t)=\frac{d^n}{dt^n}\mathbf{E}\left(e^{tX}\right)=\mathbf{E}\left(\frac{d^n}{dt^n}e^{tX}\right) = \mathbf{E}\left(X^ne^{tX}\right). \]

Avaliando em \(t=0\), obtemos

\[ \mathbf{E}\left(X^{n}\right)=\mathrm{M}_{X}^{(n)}(0)=\left.{\frac{d^{n}\mathrm{M}_{X}}{dt^{n}}}\right|_{t=0} \]

Exemplo 8.25 (Distribuição binomial com parâmetros \(n\) e \(p\))

Se \(X\) é uma variável aleatória binomial com parâmetros \(n\) e \(p\), então

\[ \begin{aligned} \mathrm{M}(t) & =\mathbf{E}\left[e^{t X}\right] \\ & =\sum _{k=0}^{n} e^{t k}\left(\begin{array}{l} n \\ k \end{array}\right) p^{k}(1-p)^{n-k} \\ & =\sum _{k=0}^{n}\left(\begin{array}{l} n \\ k \end{array}\right)\left(p e^{t}\right)^{k}(1-p)^{n-k} \\ & =\left(p e^{t}+1-p\right)^{n} \end{aligned} \]

onde a última igualdade resulta do teorema binomial. Calculando a derivada, obtemos

\[ \mathrm{M}^{\prime }(t)=n\left(p e^{t}+1-p\right)^{n-1} p e^{t} \]

Assim,

\[ \mathbf{E}[X]=\mathrm{M}^{\prime }(0)=n p \]

Calculando a derivada segunda, obtemos

\[ \mathrm{M}^{\prime \prime }(t)=n(n-1)\left(p e^{t}+1-p\right)^{n-2}\left(p e^{t}\right)^{2}+n\left(p e^{t}+1-p\right)^{n-1} p e^{t} \]

então

\[ \mathbf{E}\left[X^{2}\right]=\mathrm{M}^{\prime \prime }(0)=n(n-1) p^{2}+n p \]

A variância de \(X\) é dada por

\[ \begin{aligned} \operatorname {Var}(X) & =\mathbf{E}\left[X^{2}\right]-(\mathbf{E}[X])^{2} \\ & =n(n-1) p^{2}+n p-n^{2} p^{2} \\ & =n p(1-p) \end{aligned} \]

o que verifica o resultado obtido anteriormente.

Exemplo 8.26 (Distribuição de Poisson com média \(\lambda \))

Se \(X\) é uma variável aleatória de Poisson com parâmetro \(\lambda \), então

\[ \begin{aligned} \mathrm{M}(t) & =\mathbf{E}\left[e^{t X}\right] \\ & =\sum _{n=0}^{\infty } \frac{e^{t n} e^{-\lambda } \lambda ^{n}}{n !} \\ & =e^{-\lambda } \sum _{n=0}^{\infty } \frac{\left(\lambda e^{t}\right)^{n}}{n !} \\ & =e^{-\lambda } e^{\lambda e^{t}} \\ & =e^{ \lambda \left(e^{t}-1\right) } \end{aligned} \]

Calculando a derivada, obtemos

\[ \begin{aligned} & \mathrm{M}^{\prime }(t)=\lambda e^{t} e^{ \lambda \left(e^{t}-1\right) } \\ & \mathrm{M}^{\prime \prime }(t)=\left(\lambda e^{t}\right)^{2} e^{ \lambda \left(e^{t}-1\right) }+\lambda e^{t} e^{ \lambda \left(e^{t}-1\right) } \end{aligned} \]

Assim,

\[ \begin{aligned} \mathbf{E}[X] & =\mathrm{M}^{\prime }(0)=\lambda \\ \mathbf{E}\left[X^{2}\right] & =\mathrm{M}^{\prime \prime }(0)=\lambda ^{2}+\lambda \\ \operatorname {Var}(X) & =\mathbf{E}\left[X^{2}\right]-(\mathbf{E}[X])^{2} \\ & =\lambda \end{aligned} \]

Portanto, a média e a variância de uma variável aleatória de Poisson são iguais a \(\lambda \).

Exemplo 8.27 (Distribuição exponencial com parâmetro \(\lambda \))
\[ \begin{aligned} \mathrm{M}(t) & =\mathbf{E}\left[e^{t X}\right] \\ & =\int _{0}^{\infty } e^{t x} \lambda e^{-\lambda x} d x \\ & =\lambda \int _{0}^{\infty } e^{-(\lambda -t) x} d x \\ & =\frac{\lambda }{\lambda -t} \quad \text{ para } t\lt \lambda \end{aligned} \]

Observamos dessa dedução que, para a distribuição exponencial, \(\mathrm{M}(t)\) é definida apenas para valores de \(t\) menores que \(\lambda \). Calculando a derivada de \(\mathrm{M}(t)\), obtemos

\[ \mathrm{M}^{\prime }(t)=\frac{\lambda }{(\lambda -t)^{2}} \quad \mathrm{M}^{\prime \prime }(t)=\frac{2 \lambda }{(\lambda -t)^{3}} \]

Portanto,

\[ \mathbf{E}[X]=\mathrm{M}^{\prime }(0)=\frac{1}{\lambda } \quad \mathbf{E}\left[X^{2}\right]=\mathrm{M}^{\prime \prime }(0)=\frac{2}{\lambda ^{2}} \]

A variância de \(X\) é dada por

\[ \begin{aligned} \operatorname {Var}(X) & =\mathbf{E}\left[X^{2}\right]-(\mathbf{E}[X])^{2} \\ & =\frac{1}{\lambda ^{2}} \end{aligned} \]

Teorema 8.16
Se a função geradora de momentos é finita em algum intervalo aberto que contém \(0\), ela determina de forma única a distribuição de probabilidade.

O teorema anterior afirma que, se duas variáveis aleatórias \( X \) e \( Y \) têm a mesma função geradora de momento, isto é, \( M_X(t) = M_Y(t) \) para todos os \( t \) em um intervalo ao redor de \( 0 \), então elas têm a mesma distribuição de probabilidade. Assim por exemplo uma variável \(X\) tal que \(M_X(t)=e^{ \lambda \left(e^{t}-1\right) }\) é uma variável de Poisson de taxa \(\lambda \).

Teorema 8.17
Se \(X \) e \(Y \) são variáveis aleatórias independentes com função geradora de momento \(\mathrm{M}_X (t) \) e \(\mathrm{M}_Y (t) \) respectivamente, então \(\mathrm{M}_{X + Y} (t) \), a função geradora de momento \(X + Y \) é dada por
\[ \mathrm{M}_{X + Y} (t)= \mathrm{M}_X (t) \mathrm{M}_Y (t). \]

Demonstração
\begin{align*} \mathrm{M}_{X + Y} (t) & = \mathbb {E}\! \left[e ^{t (X + Y)}\right] \\ & = \mathbb {E}\! \left[e ^{t X} e ^{t Y}\right] \\ & = \mathbb {E}\! \left[e ^{t X}\right] \mathbb {E}\! \left[e ^{t Y}\right] \\ & = \mathrm{M}_X (t) \mathrm{M}_Y (t). \end{align*}

Exemplo 8.28

A função geradora de momentos de uma variável aleatória binomial também pode ser deduzida a partir da função geradora de uma Bernoulli. Se \( X \sim \operatorname {Bin}(n,p) \), então \( X \) é a soma de \( n \) variáveis independentes \( X_1, X_2, \ldots , X_n \), onde cada \( X_i \sim \operatorname {Bernoulli}(p) \).

Assim, temos:

\[ X = \sum _{i=1}^n X_i \]

Logo, a função geradora de momentos de \( X \sim \operatorname {Bin}(n,p) \) é:

\[ M_X(t) = \left(M_{X_i}(t)\right)^n \]

Substituímos \( M_{X_i}(t) = 1 - p + p e^t \):

\[ M_X(t) = \left(1 - p + p e^t\right)^n \]

Teorema 8.18 (Função geradora de momento da variável aleatória normal)
Seja \(\zeta \sim N(\mu , \sigma ^2)\). Então, a função geradora de momento de \(\zeta \) é dada por:
\[ M_\zeta (t) = e^{\mu t + \frac{\sigma ^2 t^2}{2}}. \]

Demonstração

A função geradora de momento \(M_\zeta (t)\) é definida como:

\[ M_\zeta (t) = \mathbf{E}[e^{t \zeta }] = \int _{-\infty }^{\infty } e^{t x} f_\zeta (x) \, dx, \]

onde \(f_\zeta (x)\) é a função densidade de probabilidade da distribuição normal:

\[ f_\zeta (x) = \frac{1}{\sqrt{2\pi \sigma ^2}} e^{- \frac{(x - \mu )^2}{2 \sigma ^2}}. \]

Substituindo \(f_\zeta (x)\) na expressão de \(M_\zeta (t)\):

\[ M_\zeta (t) = \int _{-\infty }^{\infty } e^{t x} \frac{1}{\sqrt{2\pi \sigma ^2}} e^{- \frac{(x - \mu )^2}{2 \sigma ^2}} \, dx = \frac{1}{\sqrt{2\pi \sigma ^2}} \int _{-\infty }^{\infty } e^{t x - \frac{(x - \mu )^2}{2 \sigma ^2}} \, dx. \]

Agora, combinamos os expoentes:

\[ e^{t x - \frac{(x - \mu )^2}{2 \sigma ^2}} = e^{-\frac{1}{2 \sigma ^2} \left( (x - \mu )^2 - 2 \sigma ^2 t x \right)}. \]

Expansão do quadrado e rearranjo dos termos:

\begin{align*} (x - \mu )^2 - 2 \sigma ^2 t x & = x^2 - 2 \mu x + \mu ^2 - 2 \sigma ^2 t x \\ & = x^2 - 2 (\mu + \sigma ^2 t) x + \mu ^2. \end{align*}

Completando o quadrado:

\begin{align*} x^2 - 2 (\mu + \sigma ^2 t) x + \mu ^2 & = \left( x - (\mu + \sigma ^2 t) \right)^2 - (\mu + \sigma ^2 t)^2 + \mu ^2 \\ & = \left( x - (\mu + \sigma ^2 t) \right)^2 - [ (\mu + \sigma ^2 t)^2 - \mu ^2 ]. \end{align*}

Calculando \( (\mu + \sigma ^2 t)^2 - \mu ^2 \):

\begin{align*} (\mu + \sigma ^2 t)^2 - \mu ^2 & = \mu ^2 + 2 \mu \sigma ^2 t + \sigma ^4 t^2 - \mu ^2 \\ & = 2 \mu \sigma ^2 t + \sigma ^4 t^2. \end{align*}

Portanto, o expoente torna-se:

\begin{align*} t x - \frac{(x - \mu )^2}{2 \sigma ^2} & = -\frac{1}{2 \sigma ^2} \left( (x - \mu )^2 - 2 \sigma ^2 t x \right) \\ & = -\frac{1}{2 \sigma ^2} \left( \left( x - (\mu + \sigma ^2 t) \right)^2 - 2 \mu \sigma ^2 t - \sigma ^4 t^2 \right) \\ & = -\frac{ \left( x - (\mu + \sigma ^2 t) \right)^2 }{2 \sigma ^2} + \mu t + \frac{\sigma ^2 t^2}{2}. \end{align*}

Substituindo de volta na integral:

\[ M_\zeta (t) = \frac{1}{\sqrt{2\pi \sigma ^2}} e^{\mu t + \frac{\sigma ^2 t^2}{2}} \int _{-\infty }^{\infty } e^{- \frac{ \left( x - (\mu + \sigma ^2 t) \right)^2 }{2 \sigma ^2}} \, dx. \]

Reconhecemos que a integral é a integral da função densidade de uma distribuição normal com média \(\mu + \sigma ^2 t\) e variância \(\sigma ^2\), portanto:

\[ \int _{-\infty }^{\infty } e^{- \frac{ \left( x - (\mu + \sigma ^2 t) \right)^2 }{2 \sigma ^2}} \, dx = \sqrt{2\pi \sigma ^2}. \]

Assim, simplificando:

\[ M_\zeta (t) = e^{\mu t + \frac{\sigma ^2 t^2}{2}}. \]

Teorema 8.19 (Soma de Variáveis Aleatórias Normais Independentes)
Sejam \(\zeta _1 \sim \mathcal{N}(\mu _1, \sigma _1^2)\) e \(\zeta _2 \sim \mathcal{N}(\mu _2, \sigma _2^2)\) duas variáveis aleatórias independentes com distribuições normais. Então, a soma \(\zeta = \zeta _1 + \zeta _2\) é também uma variável aleatória normal, isto é,
\[ \zeta \sim \mathcal{N}(\mu _1 + \mu _2, \sigma _1^2 + \sigma _2^2). \]
Em outras palavras, a soma de variáveis aleatórias normais independentes é uma variável normal cuja média é a soma das médias e cuja variância é a soma das variâncias.

Demonstração

Para demonstrar que \(\zeta = \zeta _1 + \zeta _2\) segue uma distribuição normal com média \(\mu = \mu _1 + \mu _2\) e variância \(\sigma ^2 = \sigma _1^2 + \sigma _2^2\), utilizaremos a propriedade da função geradora de momento. A função geradora de momento de uma variável aleatória \(\zeta \) é definida por

\[ M_\zeta (t) = \mathbf{E}[e^{t\zeta }]. \]

Primeiramente, lembramos que a função geradora de momento de uma variável normal \(\zeta _i \sim \mathcal{N}(\mu _i, \sigma _i^2)\) é dada por

\[ M_{\zeta _i}(t) = \exp \left( \mu _i t + \frac{\sigma _i^2 t^2}{2} \right). \]

Como \(\zeta _1\) e \(\zeta _2\) são independentes, a função geradora de momento da soma \(\zeta = \zeta _1 + \zeta _2\) é o produto das FGMs individuais:

\[ M_{\zeta }(t) = M_{\zeta _1 + \zeta _2}(t) = M_{\zeta _1}(t) \cdot M_{\zeta _2}(t). \]

Substituindo as expressões das FGMs:

\begin{align*} M_{\zeta }(t) & = \exp \left( \mu _1 t + \frac{\sigma _1^2 t^2}{2} \right) \cdot \exp \left( \mu _2 t + \frac{\sigma _2^2 t^2}{2} \right) \\ & = \exp \left( \mu _1 t + \mu _2 t + \frac{\sigma _1^2 t^2}{2} + \frac{\sigma _2^2 t^2}{2} \right) \\ & = \exp \left( (\mu _1 + \mu _2) t + \frac{ (\sigma _1^2 + \sigma _2^2) t^2 }{2} \right). \end{align*}

Observamos que \(M_{\zeta }(t)\) é a função geradora de momento de uma variável normal com média \(\mu = \mu _1 + \mu _2\) e variância \(\sigma ^2 = \sigma _1^2 + \sigma _2^2\), pois a função geradora de momento de uma variável normal \(\mathcal{N}(\mu , \sigma ^2)\) é

\[ M_{\zeta }(t) = \exp \left( \mu t + \frac{\sigma ^2 t^2}{2} \right). \]

Como as funções geradoras são finitas em um intervalo ao redor de zero e coincidem nesse intervalo, o teorema de unicidade permite concluir que \(\zeta \) segue uma distribuição normal com os parâmetros desejados:

\[ \zeta \sim \mathcal{N}(\mu _1 + \mu _2, \sigma _1^2 + \sigma _2^2). \]

A soma de variáveis normais independentes permanece na família normal, com média igual à soma das médias e variância igual à soma das variâncias. Assim, a combinação de erros normais independentes pode ser estudada por meio de uma única distribuição normal, como no exemplo seguinte.

Exemplo 8.29

Suponha que duas máquinas produzam peças com dimensões que seguem distribuições normais independentes: a primeira com média \(\mu _1 = 10\) cm e desvio padrão \(\sigma _1 = 0{,}2\) cm, e a segunda com média \(\mu _2 = 15\) cm e desvio padrão \(\sigma _2 = 0{,}3\) cm. A soma das dimensões das peças produzidas por ambas as máquinas será uma variável normal com média \(\mu = 10 + 15 = 25\) cm e desvio padrão \(\sigma = \sqrt{0{,}2^2 + 0{,}3^2} \approx 0{,}3606\) cm.

\multicolumn{1}{|c|}{ Distribuição }Função geradora de momento $\M_X(t)$
Degenerada $\delta_a$$e^{t a}$
Bernoulli $\P(X=1)=p$$1-p+p e^t$
Geométrica $(1-p)^{k-1} p$$\frac{p}{1-(1-p) e^t}, t<-\ln (1-p)$
Binomial $B(n, p)$$\left(1-p+p e^t\right)^n$
Binomial negativa $\mathrm{NB}(r, p)$$\left(\frac{p}{1-e^t+p e^t}\right)^r, t<-\ln (1-p)$
Poisson Pois( $\lambda)$$e^{\lambda\left(e^t-1\right)}$
Uniforme (contínua) $\mathrm{U}(a, b)$$\frac{e^{t b}-e^{t a}}{t(b-a)}$
Uniforme (discreta) $\mathrm{DU}(a, b)$$\frac{e^{a t}-e^{(b+1) t}}{(b-a+1)\left(1-e^t\right)}$
Normal $N\left(\mu, \sigma^2\right)$$e^{t \mu+\frac{1}{2} \sigma^2 t^2}$
Gama $\operatorname{Gama}(\alpha,\beta)$ (taxa)$\left(\frac{\beta}{\beta-t}\right)^{\alpha},\ t<\beta$
Exponencial $\operatorname{Exp}(\lambda)$$\left(1-t \lambda^{-1}\right)^{-1}, t<\lambda$

8.7 Exemplos integradores

A força da esperança aparece com mais clareza quando a distribuição completa da variável de interesse é difícil, mas sua decomposição em partes simples é fácil. Indicadores resolvem contagens combinatórias; variância e covariância organizam fontes de ruído; e modelos mistos surgem naturalmente em aplicações.

Exemplo 8.30 (Pontos fixos de uma permutação aleatória)
Escolha uniformemente uma permutação \(\pi \) de \(\{ 1,\ldots ,n\} \), e seja \(X\) o número de pontos que permanecem em sua posição:
\[ X=\# \{ i:\pi (i)=i\} . \]
Defina \(I_i=\mathbb {1}_{\{ \pi (i)=i\} }\). Então
\[ X=\sum _{i=1}^n I_i. \]
Para cada \(i\),
\[ \P (\pi (i)=i)=\frac1n. \]
Pela linearidade,
\[ \mathbf{E}[X]=\sum _{i=1}^n \mathbf{E}[I_i] =n\cdot \frac1n =1. \]
O resultado independe de \(n\). As indicadoras não são independentes, mas a linearidade da esperança não precisa dessa hipótese.

Exemplo 8.31 (Número esperado de arestas e de triângulos)

Em \(G(n,p)\), seja \(M\) o número total de arestas. Se \(I_e\) indica a presença da aresta \(e\),

\[ M=\sum _{e\in \binom {[n]}2} I_e, \]

e portanto

\[ \mathbf{E}[M]=\binom n2 p. \]

Para triângulos, seja \(T\) a quantidade de subconjuntos de três vértices que formam um triângulo. Se \(J_A\) indica que as três arestas do conjunto \(A\in \binom {[n]}3\) estão presentes,

\[ T=\sum _{A\in \binom {[n]}3}J_A. \]

Como \(\mathbf{E}[J_A]=p^3\),

\[ \mathbf{E}[T]=\binom n3 p^3. \]

A distribuição de \(T\) é bem menos simples que a de \(M\), mas sua média continua saindo em uma linha.

Exemplo 8.32 (Dois sensores e uma fonte comum de ruído)
Dois sensores medem a mesma grandeza \(\theta \). Suponha que
\[ X=\theta +B+\varepsilon _1, \qquad Y=\theta +B+\varepsilon _2, \]
onde \(B,\varepsilon _1,\varepsilon _2\) têm média zero, são independentes,
\[ \operatorname {Var}(B)=\tau ^2, \qquad \operatorname {Var}(\varepsilon _1)=\operatorname {Var}(\varepsilon _2)=\sigma ^2. \]
Então
\[ \mathbf{E}[X]=\mathbf{E}[Y]=\theta , \]
mas os erros dos sensores não são independentes, pois ambos contêm \(B\). De fato,
\[ \operatorname {Cov}(X,Y)=\tau ^2 \]
e
\[ \operatorname {Corr}(X,Y)=\frac{\tau ^2}{\tau ^2+\sigma ^2}. \]
A correlação mede, nesse modelo, a parcela da variabilidade causada por uma fonte comum.

Exemplo 8.33 (Diversificação de uma carteira)
Se \(X\) e \(Y\) são os retornos de dois ativos e uma fração \(a\) do capital é aplicada no primeiro, o retorno da carteira é
\[ R=aX+(1-a)Y. \]
Pela linearidade,
\[ \mathbf{E}[R]=a\mathbf{E}[X]+(1-a)\mathbf{E}[Y], \]
enquanto
\[ \operatorname {Var}(R) =a^2\operatorname {Var}(X)+(1-a)^2\operatorname {Var}(Y) +2a(1-a)\operatorname {Cov}(X,Y). \]
A última parcela mostra por que diversificação não significa apenas possuir muitos ativos: o efeito depende de como seus retornos variam juntos.

Exemplo 8.34 (Contagem com detecção imperfeita)
Suponha que existam \(N\) objetos numa região e que cada um seja detectado, independentemente, com probabilidade \(p\). Se \(D\) é o número de detecções verdadeiras,
\[ D\sim \operatorname {Bin}(N,p). \]
Admita ainda que o procedimento produza um número \(F\) de falsos positivos, independente de \(D\), com distribuição \(\operatorname {Poisson}(\lambda )\). A contagem observacaoervada é
\[ Y=D+F. \]
Então
\[ \mathbf{E}[Y]=Np+\lambda , \qquad \operatorname {Var}(Y)=Np(1-p)+\lambda . \]
O modelo separa duas fontes de erro: objetos reais que deixam de ser detectados e objetos inexistentes acrescentados pelo procedimento.

Exemplo 8.35 (Seguro com franquia: uma variável naturalmente mista)
Se \(X\geq 0\) representa o valor de um prejuízo e o contrato possui franquia \(d\gt 0\), a seguradora paga
\[ Y=(X-d)^+=\max \{ X-d,0\} . \]
Mesmo que \(X\) tenha densidade, \(Y\) não é puramente contínua. Há uma massa em zero:
\[ \P (Y=0)=\P (X\leq d)=F_X(d), \]
pois todos os prejuízos abaixo da franquia produzem o mesmo pagamento. Para \(y\gt 0\),
\[ f_Y(y)=f_X(y+d). \]
Assim,
\[ \mathbf{E}[Y] =\int _d^\infty (x-d)f_X(x)\, dx. \]
Usando a fórmula pela cauda,
\[ \mathbf{E}[Y] =\int _d^\infty \P (X\gt t)\, dt. \]
Se \(X\sim \operatorname {Exp}(\lambda )\), segue que
\[ \mathbf{E}[Y]=\frac{e^{-\lambda d}}{\lambda }. \]
A franquia produz, portanto, uma distribuição mista de maneira completamente natural e prepara a formulação unificada da esperança.

8.8 Uma visão unificada da esperança

Até aqui, calculamos esperança por duas fórmulas que parecem pertencer a mundos diferentes. Para uma variável aleatória discreta, somamos valores ponderados por probabilidades; para uma variável com densidade, integramos valores ponderados pela densidade:

\[ \mathbf{E}[X]=\sum _x x\, \P (X=x), \qquad \mathbf{E}[X]=\int _{-\infty }^{\infty }x f_X(x)\, dx. \]

Essas fórmulas atendem à maior parte dos problemas estudados. Há, porém, variáveis cuja distribuição possui uma parte discreta e uma parte contínua. O estudo desses casos conduz a uma definição que reúne as duas formas de calcular a esperança.

Em vez de partir da forma da distribuição de \(X\), consideramos os eventos em que \(X\) assume determinados valores. Essa abordagem conduz à integral de Lebesgue com respeito à probabilidade. Sem desenvolver uma teoria geral de integração, apresentaremos a construção que unifica os cálculos de esperança utilizados no capítulo.

Quando soma e integral aparecem juntas

Considere o tempo \(X\), em milissegundos, necessário para responder a uma requisição. Com probabilidade \(1/4\), a resposta vem de um cache e leva exatamente \(1\) ms. Nos demais \(3/4\) dos casos, a requisição é processada pelo servidor e o tempo é uniforme no intervalo \([2,6]\).

A distribuição de \(X\) não é discreta: ela assume um contínuo de valores entre \(2\) e \(6\). Também não é puramente contínua, porque

\[ \P (X=1)=\frac14. \]

A parte contínua tem densidade

\[ f(x)=\frac{3}{16}\, \mathbb {1}_{[2,6]}(x), \]

pois sua massa total deve ser \(3/4\). O valor esperado é, portanto,

\[ \begin{aligned} \mathbf{E}[X] & =1\cdot \frac14+\int _2^6 x\, \frac{3}{16}\, dx\\ & =\frac14+3 =\frac{13}{4}. \end{aligned} \]

A soma registra a contribuição do átomo em \(1\), e a integral, a da parte contínua. Para justificar o uso conjunto dessas duas operações, convém examinar a definição de esperança no espaço amostral.

Não é necessária uma definição especial para distribuições mistas. A soma e a integral usuais são formas de uma mesma operação: integrar a variável aleatória em relação à probabilidade do espaço amostral.

Para chegar a essa fórmula, começaremos pelo objeto mais simples possível.

Indicadoras e variáveis simples

Se \(A\) é um evento, sua função indicadora vale \(1\) quando \(A\) ocorre e \(0\) caso contrário. Assim,

\[ \mathbb {1}_A(\omega )= \begin{cases} 1, & \omega \in A,\\ 0, & \omega \notin A. \end{cases} \]

A esperança de \(\mathbb {1}_A\) já foi usada várias vezes neste capítulo:

\[ \mathbf{E}[\mathbb {1}_A]=\P (A). \]

Essa identidade relaciona eventos e esperanças: a indicadora associa uma variável aleatória ao evento, e sua esperança é a probabilidade desse evento.

Agora suponha que \(X\) assuma apenas os valores \(a_1,\ldots ,a_n\). Se

\[ A_i=\{ \omega :X(\omega )=a_i\} , \]

então os eventos \(A_1,\ldots ,A_n\) formam uma partição do espaço amostral e podemos escrever

\[ X=\sum _{i=1}^n a_i\mathbb {1}_{A_i}. \]

Uma variável dessa forma é chamada variável aleatória simples. Para ela, a definição natural é

\begin{equation} \label{eq:esperanca-simples-unificada} \mathbf{E}[X] =\sum _{i=1}^n a_i\P (A_i). \tag{8.27} \end{equation}

É exatamente a média ponderada que já conhecemos. O ponto novo é que o peso não está associado, em primeiro lugar, a um ponto da reta: ele está associado a um conjunto de resultados \(A_i\subseteq \Omega \).

Essa formulação permite aproximar variáveis gerais por variáveis simples, sem distinguir, a cada etapa, entre distribuições discretas, contínuas ou mistas.

Riemann e Lebesgue: duas maneiras de organizar a aproximação

A integral de Riemann, familiar do cálculo, aproxima a área sob uma curva dividindo o eixo horizontal. Em cada pequeno intervalo do domínio, escolhemos uma altura e construímos um retângulo. Refinar a partição significa tornar os intervalos cada vez menores.

A construção de Lebesgue pode ser vista de outra maneira. Em vez de organizar a aproximação principalmente por onde estamos no domínio, organizamos os pontos de acordo com os valores assumidos pela função. Escolhemos níveis \(y_0\lt y_1\lt \cdots \lt y_m\) e agrupamos os pontos para os quais a função cai em cada faixa de alturas. Esses grupos podem ser bastante irregulares no domínio; o que importa é o tamanho que a probabilidade atribui a cada um deles.

Figura 8.7 Duas maneiras de organizar uma aproximação. Em Riemann, refinamos principalmente o domínio; na construção de Lebesgue, aproximamos a função por níveis e medimos os conjuntos que caem em cada faixa.

Figura 8.7 Duas maneiras de organizar uma aproximação. Em Riemann, refinamos principalmente o domínio; na construção de Lebesgue, aproximamos a função por níveis e medimos os conjuntos que caem em cada faixa.

No contexto probabilístico, os pesos dessas faixas são dados pelas suas probabilidades. Se uma aproximação de \(X\) assume os valores \(a_1,\ldots ,a_n\) nos eventos \(A_1,\ldots ,A_n\), sua contribuição média é

\[ a_1\P (A_1)+\cdots +a_n\P (A_n). \]

Ou seja, a soma de Lebesgue para a esperança já apareceu na Equação (8.27). O que muda ao passar para uma variável geral é que refinamos essas faixas de valores e tomamos um limite.

Há uma diferença conceitual importante em relação ao cálculo usual. O espaço \(\Omega \) pode nem sequer ser um intervalo da reta. Pode ser um conjunto de sequências, trajetórias, configurações ou qualquer outro espaço amostral. Ainda assim, faz sentido perguntar qual é a probabilidade do conjunto em que \(X\) fica entre dois níveis. É essa possibilidade que torna a integral com respeito a \(\P \) tão adequada à probabilidade.

De variáveis simples a variáveis gerais

Suponha primeiro que \(X\geq 0\). Podemos construir variáveis simples

\[ X_1\leq X_2\leq \cdots \leq X \]

que se aproximam de \(X\) por baixo e cujos degraus ficam progressivamente mais finos. Escrevemos

\[ X_n\uparrow X. \]

Cada \(X_n\) possui uma esperança definida pela soma (8.27). A ideia de Lebesgue é definir

\begin{equation} \label{eq:esperanca-nao-negativa-unificada} \mathbf{E}[X]=\lim _{n\to \infty }\mathbf{E}[X_n]. \tag{8.28} \end{equation}

Para uma variável não negativa, esse limite pode ser finito ou infinito. A teoria garante que o valor obtido não depende da sequência particular de degraus usada para aproximar \(X\), desde que a aproximação crescente seja feita da maneira adequada.

É útil comparar esse procedimento com uma imagem conhecida. Na integral de Riemann, aproximamos uma curva por retângulos cada vez mais estreitos. Aqui, aproximamos uma variável aleatória por funções em degraus cada vez mais precisas. Em ambos os casos, a quantidade procurada surge como limite de objetos elementares; o que muda é a forma de organizar esses objetos.

Para uma variável que pode assumir valores positivos e negativos, separamos as duas partes:

\[ X^+=\max \{ X,0\} , \qquad X^-=\max \{ -X,0\} . \]

Então

\[ X=X^+-X^-, \qquad |X|=X^++X^-. \]

Se \(\mathbf{E}[X^+]\) e \(\mathbf{E}[X^-]\) são finitas — de modo equivalente, se \(\mathbf{E}[|X|]\lt \infty \) — dizemos que \(X\) é integrável e definimos

\begin{equation} \label{eq:esperanca-lebesgue-unificada} \boxed { \mathbf{E}[X]=\int _\Omega X\, d\P =\mathbf{E}[X^+]-\mathbf{E}[X^-]. } \tag{8.29} \end{equation}

A notação \(\int _\Omega X\, d\P \) enfatiza que estamos integrando os valores de \(X\) usando a probabilidade como regra para pesar conjuntos do espaço amostral. É essa a integral de Lebesgue que aparece naturalmente na teoria da probabilidade.

Essa definição inclui tanto as somas quanto as integrais em \(dx\). Quando conhecemos a distribuição de \(X\), podemos expressá-la nas formas concretas utilizadas ao longo do capítulo.

Uma fórmula, três regimes

No caso discreto, os eventos

\[ A_x=\{ \omega :X(\omega )=x\} \]

particionam o espaço amostral. Aplicando a definição para variáveis simples — e depois passando ao limite quando há infinitos valores possíveis — obtemos

\[ \int _\Omega X\, d\P =\sum _x x\, \P (X=x). \]

A soma usual é, portanto, a expressão da integral quando a distribuição está concentrada em pontos.

Se \(X\) possui densidade \(f_X\), a probabilidade é distribuída ao longo da reta segundo essa densidade. Nesse caso,

\[ \int _\Omega X\, d\P =\int _{-\infty }^{\infty }x f_X(x)\, dx. \]

É a fórmula contínua que usamos desde o início do capítulo.

Finalmente, considere uma distribuição mista regular com átomos \(x_1,x_2,\ldots \), de massas

\[ p_i=\P (X=x_i), \]

e uma parte contínua descrita por uma densidade \(f\). A massa total satisfaz

\[ \sum _i p_i+\int _{-\infty }^{\infty }f(x)\, dx=1, \]

e a mesma integral abstrata fornece

\begin{equation} \label{eq:esperanca-mista-unificada} \boxed { \mathbf{E}[X] =\sum _i x_i p_i +\int _{-\infty }^{\infty }x f(x)\, dx, } \tag{8.30} \end{equation}

sempre que as contribuições envolvidas forem integráveis. A fórmula usada no exemplo do cache aparece, portanto, sem que precisemos criar uma nova noção de esperança para o caso misto.

Podemos resumir a situação assim:

\[ \begin{array}{ccl} \text{discreta} & \Longrightarrow & \displaystyle \mathbf{E}[X]=\sum _x x\, \P (X=x),\\[10pt] \text{com densidade} & \Longrightarrow & \displaystyle \mathbf{E}[X]=\int _{-\infty }^{\infty }x f_X(x)\, dx,\\[10pt] \text{mista regular} & \Longrightarrow & \displaystyle \mathbf{E}[X]=\sum _i x_i p_i+ \int _{-\infty }^{\infty }x f(x)\, dx. \end{array} \]

As três linhas são manifestações da mesma identidade:

\[ \boxed {\displaystyle \mathbf{E}[X]=\int _\Omega X\, d\P .} \]

Nos cálculos, usamos a forma mais conveniente: uma soma, uma integral ordinária ou uma combinação das duas. A definição unificada mostra que todas expressam a mesma construção: aproximar a variável por variáveis simples, ponderar os conjuntos correspondentes por suas probabilidades e passar ao limite.

Resumo do capítulo
Esperança é calculada por soma ou integral, conforme o modelo. Linearidade, indicadores, condicionamento e funções geradoras convertem problemas longos em cálculos organizados. A formulação unificada \(\mathbf{E}[X]=\int _\Omega X\, d\P \) mostra que os casos discreto, contínuo e misto pertencem à mesma construção.

8.9 Exercícios

Exercício 8.1 (Cálculo direto)
Uma variável \(X\) assume os valores \(-2,0,1,4\) com probabilidades \(0{,}1,0{,}3,0{,}4,0{,}2\). Calcule \(\mathbf{E}[X]\), \(\mathbf{E}[X^2]\), \(\operatorname {Var}(X)\) e \(\mathbf{E}[(X-1)^2]\).
Exercício 8.2 (Indicadores)
Sete cartas são retiradas sem reposição de um baralho comum. Usando variáveis indicadoras, determine o número esperado de ases e o número esperado de naipes representados na mão.
Exercício 8.3 (Função de uma variável)
Se \(X\) tem densidade \(3x^2\) em \((0,1)\), calcule \(\mathbf{E}[X]\), \(\operatorname {Var}(X)\), \(\mathbf{E}[\log X]\) e \(\mathbf{E}[1/X]\).
Exercício 8.4 (Esperança condicional)
Uma urna é escolhida ao acaso: a primeira contém \(2\) bolas vermelhas e \(4\) azuis; a segunda, \(5\) vermelhas e \(1\) azul. Retiram-se duas bolas sem reposição da urna escolhida. Seja \(X\) o número de vermelhas. Calcule \(\mathbf{E}[X\mid \text{urna}]\) e use a esperança total para obter \(\mathbf{E}[X]\).
Exercício 8.5 (Função geradora de momentos)
Se \(X\sim \operatorname {Poisson}(\lambda )\), derive sua função geradora de momentos e use derivadas em \(0\) para recuperar \(\mathbf{E}[X]\) e \(\operatorname {Var}(X)\).