Capítulo 7

Valor Esperado

Uma distribuição contém toda a informação probabilística sobre uma variável, mas frequentemente precisamos resumi-la. A esperança realiza a redução mais elementar: associa à variável uma média ponderada de seus valores ou, geometricamente, o centro de massa de sua distribuição. Como todo resumo, ela é útil justamente porque esquece quase tudo.

Considere, para motivar a definição, uma variável simples

\[ X=\sum _{k=1}^na_k\cdot \mathbb {1}_{A_k}, \]

com \(A_1,A_2,\ldots ,A_n\) disjuntos. Então a média ponderada \(m(X)\) dos valores que \(X\) assume é

\[ m(X)=\sum _{k=1}^na_k\, \P (A_k)=\int X\d\P . \]

Isso conduz à definição geral.

Definição 7.1 (Valor Esperado ou Esperança)
Se \(\xi \) é uma variável aleatória definida em \((\Omega , \mathcal{F}, \P )\), seu valor esperado, esperança ou média é definido como
\[ \mathbf{E}[ \xi ] := \displaystyle \int _\Omega \xi d\P \]

Usaremos aqui a mesma nomenclatura das integrais de Lebesgue. Diremos que \(X\) é integrável se \(\mathbf{E}|X|\lt \infty \), o que equivale a \(\mathbf{E}[X^+]\lt \infty \) e \(\mathbf{E}[X^-]\lt \infty \). Mais geralmente, a esperança de \(X\) está bem definida, possivelmente como \(+\infty \) ou \(-\infty \), se ao menos uma das quantidades \(\mathbf{E}[X^+]\) e \(\mathbf{E}[X^-]\) for finita; nesse caso, dizemos que \(X\) é quase integrável.

A definição recupera imediatamente o cálculo para variáveis simples.

Exemplo 7.2 (Variáveis Aleatórias Simples)

Seja \(X\) uma variável aleatória dada por

\[ X=\sum _{k=1}^na_k\cdot \mathbb {1}_{A_k}, \]

com \(A_1,A_2,\ldots ,A_n\) disjuntos. Então

\[ \mathbf{E}[X]=\int X\d\P =\sum _{k=1}^na_k\, \P (A_k). \]

Se, além disso, os valores \(a_1,\ldots ,a_n\in \mathbb {R}\) são distintos, então, para cada \(k=1,\ldots ,n\), \(A_k=X^{-1}(\{ a_k\} )=\{ X=a_k\} \), e

\[ \mathbf{E}[X]=\sum _{k=1}^na_k\, \P (X=a_k). \]

O caso particular das indicadoras estabelece uma ligação direta entre esperança e probabilidade.

Exemplo 7.3 (A Esperança da Função Indicadora)
Seja \(\mathbb {1}_A\) a indicadora de um evento \(A\in \mathcal{F}\). Como \(\mathbb {1}_A\) é uma variável aleatória simples, seu valor esperado é dado por
\[ \mathbf{E}[\mathbb {1}_A]=\P (A). \]

Definida pela integral de Lebesgue, a esperança herda as propriedades seguintes.

Teorema 7.4
Suponha que \(\xi ,\eta \) sejam variáveis aleatórias integráveis. Então
  1. (Linearidade) \(\mathbf{E}[a\xi + b\eta ] = a\mathbf{E}[ \xi ] + b\mathbf{E}[ \eta ]\) para quaisquer números reais \(a, b\).

  2. Se \(X\equiv b\in \mathbb {R}\), constante, então \(\mathbf{E}[X] = b\) (escrevemos também que \(\mathbf{E}[b]=b\)).

  3. Se \(\xi \geq 0\) então \(\mathbf{E}[ \xi ] \geq 0\).

  4. (Monotonicidade) Se \(\xi \geq \eta \) então \(\mathbf{E}[ \xi ] \geq \mathbf{E}[ \eta ]\).

  5. (Desigualdade triangular) \(\left\lvert \mathbf{E}[\xi ]\right\rvert \leq \mathbf{E}[\left\lvert \xi \right\rvert ]\)

  6. Se \(0\leq \xi _n\uparrow \xi \), então \(\mathbf{E}[\xi ]=\lim _{n\to \infty }\mathbf{E}[\xi _n]\), admitindo-se o valor \(+\infty \).

Demonstração

Como \(\mathbf{E}[\xi ]=\int _\Omega \xi \, \d\P \), a linearidade para funções integráveis, a positividade, a monotonicidade, a desigualdade triangular e a convergência monótona são exatamente as propriedades da integral de Lebesgue demonstradas no capítulo anterior. Para explicitar o único ponto específico de uma probabilidade, se \(X\equiv b\), então \(X=b\mathbb {1}_\Omega \) e

\[ \mathbf{E}[b]=b\, \P (\Omega )=b. \]

Exemplo 7.5

Suponha que uma esfera seja colorida de modo que \(90\% \) de sua área seja vermelha e \(10\% \) seja azul, com a região vermelha mensurável. Fixe um cubo inscrito e escolha ao acaso uma rotação do cubo segundo a probabilidade uniforme — a medida de Haar normalizada — em \(SO(3)\). Para cada vértice \(v_i\) do cubo, sua imagem pela rotação é então uniformemente distribuída na esfera.

Seja \(\xi _i\) a indicadora de que o \(i\)-ésimo vértice cai na região vermelha. Então \(\mathbf{E}[\xi _i]=0{,}9\) para todo \(i\) e \(N=\xi _1+\cdots +\xi _8\) é o número de vértices vermelhos. Por linearidade da esperança,

\[ \mathbf{E}[N]=\sum _{i=1}^8\mathbf{E}[\xi _i]=8\cdot 0{,}9=7{,}2. \]

Se toda rotação tivesse no máximo sete vértices vermelhos, teríamos \(N\leq 7\) quase certamente e, portanto, \(\mathbf{E}[N]\leq 7\), uma contradição. Logo existe uma rotação para a qual os oito vértices estão em pontos vermelhos da esfera.

Esse é um exemplo da utilização de técnicas probabilísticas para provar fatos determinísticos. Observe que não exigimos que as variáveis \(\xi _i\) sejam independentes.

Temos também a seguinte caracterização do operador esperança.

Teorema 7.6 (Caracterização da Esperança)
A esperança é o único operador linear \(T:\L ^1(\Omega ,\mathcal{F},\P )\to \mathbb {R}\) que satisfaz:
  • continuidade na norma de \(\L ^1\): se \(\| \xi _n-\xi \| _1\to 0\), então \(T(\xi _n)\to T(\xi )\);

  • relação com a probabilidade: \(T(\mathbb {1}_A)=\P (A)\) para todo \(A\in \mathcal{F}\).

Demonstração

O operador \(\xi \mapsto \int _\Omega \xi \, \d\P \) é linear, \(|\mathbf{E}[\xi ]|\leq \| \xi \| _1\) e \(\mathbf{E}[\mathbb {1}_A]=\P (A)\); portanto, possui as propriedades anunciadas.

Reciprocamente, seja \(T\) um operador com essas propriedades. Se \(s=\sum _{j=1}^m a_j\mathbb {1}_{A_j}\) é simples, a linearidade e a condição sobre indicadoras dão

\[ T(s)=\sum _{j=1}^m a_j\P (A_j)=\mathbf{E}[s]. \]

As funções simples são densas em \(\L ^1\): para \(\xi \in \L ^1\), escolha simples \(s_n\) com \(\| s_n-\xi \| _1\to 0\). Pela continuidade de \(T\) e pela estimativa \(|\mathbf{E}[s_n-\xi ]|\leq \| s_n-\xi \| _1\),

\[ T(\xi )=\lim _nT(s_n)=\lim _n\mathbf{E}[s_n]=\mathbf{E}[\xi ]. \]

Isso prova a unicidade.

Fixaremos agora a terminologia para propriedades que valem fora de um evento de probabilidade zero.

Definição 7.7

Dado um espaço de probabilidade \((\Omega , \mathcal{F}, \P )\), diremos que uma afirmativa \(\mathbb A\) ocorre quase certamente se

\[ \P (\{ \omega \in \Omega :\omega \mbox{ satisfaz a afirmativa }\mathbb A\} )=1. \]

Denotaremos isso por “\(\mathbb A\) ocorre q.c.”.

Em particular, dadas duas variáveis aleatórias \(X,Y\) definidas em \(\Omega \), temos que \( X=Y\ q.c., \) se \(\P (X=Y)=1\). Ou ainda que \(X\leq Y\ q.c\) se \(\P (X\leq Y)=1\).

Integrais de Lebesgue ignoram eventos de medida nula, e isso é mostrado no seguinte resultado.

Proposição 7.8
Dadas variáveis aleatórias \(X\) e \(Y\), vale que
  1. Se \(X=0\ q.c\) então \(\mathbf{E}[X]=0\);

  2. Se \(X=Y\ q.c\) e \(X\) é integrável ou \(\mathbf{E}[X]=\pm \infty \), então \(\mathbf{E}[Y]=\mathbf{E}[X]\);

  3. Se \(X\leq Y\ q.c.\) e \(Y\) é integrável, então \(\mathbf{E}[X]\leq \mathbf{E}[Y]\) (\(\mathbf{E}[X]\) pode ser \(-\infty \)) .

  4. Se \(X\geq 0\) e \(\mathbf{E}[X]=0\), então \(X=0\ q.c.\).

Demonstração
  1. Como \(X^+=X^-=0\) quase certamente, ambas as integrais são nulas e, portanto, \(\mathbf{E}[X]=0\).

  2. Da igualdade quase certa seguem \(X^+=Y^+\) e \(X^-=Y^-\) quase certamente. As integrais das partes positiva e negativa coincidem; logo a existência e o valor da esperança de \(Y\) são os mesmos que os de \(X\).

  3. Defina

    \[ X^*=X\mathbb {1}_{\{ X\leq Y\} }+Y\mathbb {1}_{\{ X\gt Y\} }. \]

    Então \(X^*=X\) quase certamente e \(X^*\leq Y\) em todo ponto. Além disso, \((X^*)^+\leq Y^+\), de modo que a parte positiva de \(X^*\) é integrável. Por monotonicidade, \(\mathbf{E}[X]=\mathbf{E}[X^*]\leq \mathbf{E}[Y]\), admitindo-se o valor \(-\infty \).

  4. Dado \(\epsilon \gt 0\), defina \(Y_\epsilon =\epsilon \mathbb {1}_{\{ X\gt \epsilon \} }\) e observe que \(Y_\epsilon \leq X\) para todo \(\epsilon \gt 0\). Segue que

    \[ \epsilon \P (X\gt \epsilon )=\mathbf{E}[Y_\epsilon ]\leq \mathbf{E}[X]=0, \]

    e portanto \(\P (X\gt \epsilon )=0\) para todo \(\epsilon \gt 0\).

    Como \(\{ X\gt 0\} =\bigcup _{n\geq 1}\{ X\gt 1/n\} \), concluímos que \(\P (X\gt 0)=0\). Como \(X\geq 0\), segue que \(X=0\) quase certamente.

7.1 Calculando a Esperança

A esperança depende apenas da distribuição da variável. Demonstraremos esse fato seguindo novamente a construção em três passos: funções simples, funções não negativas e funções integráveis.

Tome agora uma variável aleatória \(X\) qualquer, e \(\phi :\mathbb {R}\to \mathbb {R}\) uma função mensurável e simples e não-negativa, dada por

\[ \phi (x)=\sum _{k=1}^na_k\mathbb {1}_{A_k}(x), \]

\(A_1,\ldots ,A_n\in \mathcal{B}(\mathbb {R})\) disjuntos.

Temos assim que

\[ \phi (X)=\sum _{k=1}^na_k\mathbb {1}_{A_k}(X)=\sum _{k=1}^na_k\mathbb {1}_{X\in A_k}, \]

que é uma variável aleatória simples.

Segue que

\[ \mathbf{E}[\phi (X)]=\sum _{k=1}^na_k\P (X\in A_k)=\sum _{k=1}^na_k\P _X(A_k)=\int _{\mathbb {R}}\phi (x)\d\P _X(x). \]

Dada agora uma função \(\varphi :\mathbb {R}\to \mathbb {R}\) mensurável e não negativa, tome uma sequencia não-decrescente de funções simples e mensuráveis \(\phi _n:\mathbb {R}\to \mathbb {R}, n\geq 1\), não-negativas e tais que \( \phi _n(x)\uparrow \varphi (x), \) para todo \(x\in \mathbb {R}\).

Pelos mesmos argumentos anteriores, \(\phi _n(X), n\geq 1\) é uma sequência de variáveis aleatórias simples e não-negativas, tais que \(\phi _n(X)\uparrow \varphi (X)\).

Segue do Teorema da Convergência Monótona, que

\[ \mathbf{E}[\varphi (X)]=\lim \limits _{n\to \infty }\mathbf{E}[\phi _n(X)]=\lim \limits _{n\to \infty }\int _{\mathbb {R}}\phi _n(x)\d\P _X(x)=\int _{\mathbb {R}}\varphi (x)\d\P _X(x). \]

Dada agora uma função \(\varphi :\mathbb {R}\to \mathbb {R}\) mensurável, podemos escrever \(\varphi =\varphi ^+-\varphi ^-\), e aplicando o que descobrimos até agora, vemos que

\[ \mathbf{E}[\varphi (X)]=\mathbf{E}[\varphi ^+(X)]-\mathbf{E}[\varphi ^-(X)] =\int _{\mathbb {R}}\varphi ^+\, \d\P _X-\int _{\mathbb {R}}\varphi ^-\, \d\P _X =\int _{\mathbb {R}}\varphi \, \d\P _X. \]

Com isso mostramos que

Teorema 7.9 (Teorema da Mudança de Variáveis)

Dada uma variável aleatória \(X\) definida em um espaço de probabilidade \((\Omega , \mathcal{F}, \P )\) com distribuição \(\P _X\), e uma função mensurável \(\varphi :\mathbb {R}\to \mathbb {R}\), então

\[ \mathbf{E}[\varphi (X)]=\int _{\mathbb {R}}\varphi (x)\d\P _X(x). \]

Ou seja, se qualquer um dos lados da equação acima estiver bem definido, o outro também está e a igualdade vale.

Em particular

\[ \mathbf{E}[X]=\int _{\mathbb {R}}x\d\P _X(x) \]

Demonstração

Para uma função simples não negativa \(\varphi =\sum _{k=1}^m a_k\mathbb {1}_{A_k}\), a definição da distribuição induzida dá

\[ \mathbf{E}[\varphi (X)] =\sum _{k=1}^m a_k\P (X\in A_k) =\sum _{k=1}^m a_k\P _X(A_k) =\int _{\mathbb {R}}\varphi \, \d\P _X. \]

Se \(\varphi \geq 0\) é mensurável, escolha funções simples \(\varphi _n\uparrow \varphi \) e aplique a Convergência Monótona aos dois lados. Para uma função mensurável arbitrária, aplique o caso não negativo a \(\varphi ^+\) e \(\varphi ^-\). Isso também mostra que um lado está bem definido exatamente quando o outro está. A escolha \(\varphi (x)=x\) fornece a última fórmula.

Uma consequência direta do resultado anterior é a seguinte.

Corolário 7.10 (Distribuição determina a esperança)
Se \(\xi \) é integrável e \(\xi \overset {\mathrm d}{=}\eta \), então \(\eta \) é integrável e \(\mathbf{E}[\xi ]=\mathbf{E}[\eta ]\).

Demonstração

As distribuições induzidas são iguais. Aplicando o Teorema 7.9 às funções \(x\mapsto |x|\) e \(x\mapsto x\), obtemos, respectivamente, a integrabilidade de \(\eta \) e a igualdade das esperanças.

A dependência apenas da distribuição explica as fórmulas usuais para variáveis discretas e absolutamente contínuas. Vamos deduzi-las.

7.1.1 Variáveis Aleatórias Discretas

Uma variável aleatória discreta concentra sua distribuição num conjunto enumerável de valores. Assim, existe um conjunto \(S=\{ x_1,x_2,\ldots \} \) tal que \(\P (X\in S)=1\).

Com isso, temos que a distribuição \(\P _X\) é totalmente definida pelos valores de \(\P (\{ x_k\} )=\P (X=x_k)\).

De fato, para qualquer \(A\in \mathcal{B}(\mathbb {R})\)

\[ \P _X(A)=\sum _{k: x_k\in A} \P _X(\{ x_k\} ). \]

Perceba também que

\[ X=\sum _{k=1}^\infty x_k\, \mathbb {1}_{A_k}, \]

onde \(A_k=\{ X=x_k\} \in \mathcal{F}\).

Comecemos pelo caso \(X\geq 0\), com \(x_k\geq 0\) para todo \(k\geq 1\). As variáveis

\[ X_n=\sum _{k=1}^n x_k\, \mathbb {1}_{A_k}, \]

são simples e portanto

\[ \mathbf{E}[X_n]=\sum _{k=1}^n x_k\, \P (A_k)=\sum _{k=1}^n x_k\, \P (X=x_k). \]

Além disso, temos que \(X_n\uparrow X\) e o Teorema da Convergência Monótona nos diz que

\[ \mathbf{E}[X]=\lim \limits _{n\to \infty }\mathbf{E}[X_n]=\sum _{k=1}^\infty x_k\, \P (X=x_k). \]

O caso com sinal será obtido separando as partes positiva e negativa.

Proposição 7.11
Para uma variável aleatória discreta \(X\) não negativa ou integrável, assumindo valores em \(\{ x_1,x_2,\ldots \} \), temos

\begin{equation} \label{exp-simples} \mathbf{E}[X] = \sum _{k=1}^\infty x_k\, \P (X=x_k), \tag{7.1}\end{equation}

de modo que a série à direita é absolutamente convergente sempre que \(X\) for integrável.

Demonstração

Se \(X\geq 0\), as variáveis simples \(X_n=\sum _{k=1}^n x_k\mathbb {1}_{\{ X=x_k\} }\) crescem para \(X\) quase certamente; a Convergência Monótona fornece a fórmula. Se \(X\) é integrável, aplique esse caso a \(X^+\) e \(X^-\) e subtraia. Além disso, aplicá-lo a \(|X|\) mostra que

\[ \sum _{k=1}^\infty |x_k|\P (X=x_k)=\mathbf{E}|X|\lt \infty . \]

7.1.2 Variáveis Absolutamente Contínuas

Vamos recordar que uma variável aleatória é absolutamente contínua se existe uma função mensurável \(f:\mathbb {R}\to \mathbb {R}^+\), conhecida como função densidade de probabilidade de \(X\) (ou simplesmente densidade de \(X\)) tal que

\[ \P _X(A)=\P (X\in A)=\int _Af(x)\d{\mu }, \]

onde a integral à direita é a integral de Lebesgue (feita em relação à medida de Lebesgue da reta).

Para calcular \(\mathbf{E}[\varphi (X)]\), precisamos primeiro avaliar

\[ \int _{\mathbb {R}}\varphi (x)\d\P _X(x). \]

Para isso, tome primeiro uma função simples

\[ \phi (x)=\sum _{k=1}^n a_k\mathbb {1}_{A_k}, \]

e note que

\begin{align*} \int _{\mathbb {R}}\phi (x)\d\P _X(x) & =\sum _{k=1}^n a_k\P _X(A_k) \\ & =\sum _{k=1}^n a_k\int _{A_k}f(x)\d{\mu } \\ & =\sum _{k=1}^n a_k\int _{\mathbb {R}}\mathbb {1}_{A_k}(x)f(x)\d{\mu } \\ & =\int _{\mathbb {R}}\sum _{k=1}^n a_k\mathbb {1}_{A_k}(x)f(x)\d{\mu } \\ & =\int _{\mathbb {R}}\phi (x)f(x)\d x. \end{align*}

Tomando uma sequência de funções simples \(\phi _n, n\geq 1\) não negativas, com \(\phi _n\uparrow \varphi \geq 0\), concluímos pelo Teorema da Convergência Monótona que

\[ \int _{\mathbb {R}}\varphi (x)\d\P _X(x)=\lim _n\int _{\mathbb {R}}\phi _n(x)\d\P _X(x)=\lim _n\int _{\mathbb {R}}\phi _n(x)f(x)\d x=\int _{\mathbb {R}}\varphi (x)f(x)\d x. \]

E separando uma função mensurável \(\varphi \) em parte positiva e negativa, concluímos o seguinte resultado.

Proposição 7.12
Para uma variável aleatória absolutamente contínua \(X\) com função densidade de probabilidade \(f:\mathbb {R}\to \mathbb {R}^+\) e uma função mensurável \(\varphi :\mathbb {R}\to \mathbb {R}\), vale

\begin{equation} \mathbf{E}[\varphi (X)]=\int _{\mathbb {R}}\varphi (x)f(x)\d x, \tag{7.2} \end{equation}

onde um lado da equação está bem definido se, e somente se, o outro também está.

Demonstração

Pelo Teorema 7.9, \(\mathbf{E}[\varphi (X)]=\int _{\mathbb {R}}\varphi \, \d\P _X\). Para funções simples não negativas, a identidade \(\int \varphi \, \d\P _X=\int \varphi f\, \d\lambda \) segue diretamente de \(\P _X(A)=\int _Af\, \d\lambda \). A aproximação monótona estende a identidade a toda \(\varphi \geq 0\) mensurável; a decomposição em partes positiva e negativa conclui o caso geral.

7.2 Funções de Vetores Aleatórios

O mesmo princípio vale em dimensão maior. Dado um vetor aleatório \(X=(X_1,\ldots ,X_n)\) e uma função mensurável \(\varphi :\mathbb {R}^n\to \mathbb {R}\), queremos calcular \(\mathbf{E}[\varphi (X)]\) usando apenas a distribuição conjunta de \(X\).

Vamos olhar primeiro para a distribuição \(\P _X\) do vetor aleatório \(X\). Lembre-se que, de modo análogo a variáveis aleatórias, \(\P _X\) é uma medida de probabilidade em \((\mathbb {R}^n,\mathcal{B}(\mathbb {R}^n))\) dada por

\[ \P _X(A)=\P ((X_1,\ldots ,X_n)\in A), \]

para \(A\in \mathcal{B}(\mathbb {R}^n)\).

De posse da distribuição \(\P _X\) podemos recuperar as distribuições marginais das variáveis \(X_k\), fazendo

\begin{align*} \P _{X_k}(B) & =\P (X_k\in B) \\ & =\P (X_k\in B;X_{j}\in \mathbb {R};j\neq k) \\ & =\P ((X_1,\ldots ,X_n)\in \mathbb {R}^{k-1}\times B\times \mathbb {R}^{n-k}) \\ & =\P _X(\mathbb {R}^{k-1}\times B\times \mathbb {R}^{n-k}). \end{align*}

A relação entre \(\P _X\) e as marginais \(\P _{X_k}\) pode ser complicada, e em geral precisamos de informações adicionais sobre o vetor para descrevê-la com mais precisão. Uma situação em que essa relação assume uma forma simples é aquela em que \(X_1,\ldots ,X_n\) são independentes. Deixaremos os detalhes para a lista de exercícios.

O argumento do Teorema 7.9 fornece sua versão vetorial.

Teorema 7.13
Dado um vetor aleatório \(X=(X_1,\ldots ,X_n)\) definido em um espaço de probabilidade \((\Omega , \mathcal{F}, \P )\) com distribuição \(\P _X\), e uma função mensurável \(\varphi :\mathbb {R}^n\to \mathbb {R}\), então
\[ \mathbf{E}[\varphi (X_1,\ldots ,X_n)]=\int _{\mathbb {R}^n}\varphi (x_1,\ldots ,x_n)\d\P _X(x_1,\ldots ,x_n). \]
Ou seja, se qualquer um dos lados da equação acima estiver bem definido, o outro também está e a igualdade vale.

Demonstração

O argumento é o mesmo do Teorema 7.9, agora para a medida imagem \(\P _X\) em \(\mathbb {R}^n\). Para \(\varphi =\sum _{j=1}^m a_j\mathbb {1}_{A_j}\) simples e não negativa,

\[ \mathbf{E}[\varphi (X)] =\sum _{j=1}^m a_j\P (X\in A_j) =\sum _{j=1}^m a_j\P _X(A_j) =\int _{\mathbb {R}^n}\varphi \, \d\P _X. \]

A Convergência Monótona trata funções não negativas, e a decomposição em partes positiva e negativa trata o caso geral.

No caso em que as variáveis \(X_1,\ldots ,X_n\) são discretas, assumindo valores em conjuntos enumeráveis \(S_1,\ldots ,S_n\), o vetor também é discreto e assume valores em \(S_1\times \cdots \times S_n\). A variável \(\varphi (X_1,\ldots ,X_n)\) assume o valor \(\varphi (x_1,\ldots ,x_n)\) no evento \(\{ X_1=x_1,\ldots ,X_n=x_n\} \).

Vale então o seguinte resultado.

Proposição 7.14
Dadas variáveis aleatórias \(X_1,\ldots , X_n\) discretas assumindo valores em \(S_1,\ldots ,S_n\), respectivamente, e uma função mensurável \(\varphi :\mathbb {R}^n\to \mathbb {R}\), então
\[ \mathbf{E}[\varphi (X_1,\ldots ,X_n)]=\sum _{x_1\in S_1}\cdots \sum _{x_n\in S_n}\varphi (x_1,\ldots ,x_n)\, \P (X_1=x_1,\ldots ,X_n=x_n), \]
sempre que um dos lados estiver bem definido.

Demonstração

Aplique o Teorema 7.13 à distribuição discreta do vetor \(X\). Sua massa no ponto \((x_1,\ldots ,x_n)\) é precisamente \(\P (X_1=x_1,\ldots ,X_n=x_n)\). A fórmula segue diretamente para funções não negativas por aproximação monótona das somas finitas e, depois, para funções com sinal pela decomposição positiva e negativa.

O caso onde \(X_1,\ldots ,X_n\) são absolutamente contínuas é um pouco mais complicado, pois não garante que o vetor \(X\) seja absolutamente contínuo. Ou seja, a existência de densidades \(f_1,\ldots ,f_n:\mathbb {R}\to \mathbb {R}\) não garante a existência de uma função densidade \(f:\mathbb {R}^n\to \mathbb {R}^+\) tal que

\begin{align*} \P _X(A) & =\P ((X_1,\ldots ,X_n)\in A) \\ & =\int _Af(x_1,\ldots ,x_n)\, \d\lambda _n(x_1,\ldots ,x_n) \\ & =\int _{\mathbb {R}}\cdots \int _{\mathbb {R}} \mathbb {1}_A(x_1,\ldots ,x_n)f(x_1,\ldots ,x_n) \, \d x_1\cdots \d x_n, \end{align*}

para \(A\in \mathcal{B}(\mathbb {R}^n)\), onde \(\lambda _n\) é a medida de Lebesgue em \(\mathbb {R}^n\).

Observação 7.15
Quando \(X=(X_1,\ldots ,X_n)\) é um vetor aleatório absolutamente contínuo, também é usual dizer que as variáveis \(X_1,\ldots ,X_n\) são conjuntamente absolutamente contínuas.

Não vamos entrar em maiores detalhes sobre esse tipo de vetor, mas podemos mostrar que

Proposição 7.16
Para um vetor aleatório absolutamente contínuo \(X\) com função densidade de probabilidade \(f:\mathbb {R}^n\to \mathbb {R}^+\) e uma função mensurável \(\varphi :\mathbb {R}^n\to \mathbb {R}\), vale

\begin{equation} \mathbf{E}[\varphi (X)]=\int _{\mathbb {R}}\cdots \int _{\mathbb {R}} \varphi (x_1,\ldots ,x_n)f(x_1,\ldots ,x_n)\d x_1\cdots \d x_n, \tag{7.3} \end{equation}

onde um lado da equação está bem definido se, e somente se, o outro também está.

Demonstração

Como \(\P _X(A)=\int _A f\, \d\lambda _n\), a mesma prova do caso unidimensional dá

\[ \int _{\mathbb {R}^n}\varphi \, \d\P _X =\int _{\mathbb {R}^n}\varphi (x)f(x)\, \d\lambda _n(x) \]

primeiro para funções simples não negativas, depois para funções mensuráveis não negativas e, por fim, para funções com sinal. Combine essa identidade com o Teorema 7.13.

7.3 Variância, Covariância e Momentos de uma Variável Aleatória

A esperança localiza o centro de uma distribuição, mas não informa como a massa se espalha ao redor dele. O exemplo seguinte torna visível essa perda.

Exemplo 7.17

Tome \(X\) e \(Y\) variáveis aleatórias discretas tais que

\[ \P (X=-1)=\P (X=1)=\frac{1}{2}, \]

e

\[ \P (Y=-100)=\P (Y=-50)=\P (Y=50)=\P (Y=100)=\frac14. \]

Calculando, encontramos que \(\mathbf{E}[X]=\mathbf{E}[Y]=0\), mas a variável aleatória \(Y\) assume valores muito mais dispersos em torno da média.

A variância mede essa dispersão por meio da distância quadrática à média. Os momentos e a covariância ampliam a mesma ideia.

Definição 7.18 (Momentos, variância e covariância)
Se \(\xi \) é uma variável aleatória em \((\Omega ,\mathcal{F},\P )\):
  • Dado \(n\in \mathbb {N}\) e \(\xi \in \L ^n(\P )\),

    \[ m_k:=\mathbf{E}[\xi ^k], \qquad M_k:=\mathbf{E}[|\xi |^k], \qquad k=1,\dots ,n, \]

    são denominados, respectivamente, o \(k\)-ésimo momento e o \(k\)-ésimo momento absoluto de \(\xi \).

  • Se \(\xi \in \L ^2(\P )\), então

    \[ \operatorname {Var}[\xi ]:=\mathbf{E}[(\xi -\mathbf{E}[\xi ])^2] \]

    é a variância de \(\xi \). O número \(\sigma :=\sqrt{\operatorname {Var}[\xi ]}\) é denominado desvio padrão de \(\xi \).

  • Se \(\xi ,\eta \in \L ^2(\P )\), definimos a covariância por

    \[ \operatorname {Cov}[\xi ,\eta ]:=\mathbf{E}\left[(\xi -\mathbf{E}[\xi ])(\eta -\mathbf{E}[\eta ])\right] \]

    As variáveis \(\xi \) e \(\eta \) são ditas não correlacionadas se \(\operatorname {Cov}[\xi ,\eta ]=0\).

  • Se \(\xi \) e \(\eta \) não são quase certamente constantes, seu coeficiente de correlação é

    \[ \rho (\xi ,\eta )= \frac{\operatorname {Cov}(\xi ,\eta )}{\sigma _\xi \sigma _\eta }. \]

A expressão da variância deve ser lida como uma distância quadrática média à esperança. Para cada resultado \(\omega \), o desvio \(\xi (\omega )-\mathbf{E}[\xi ]\) indica quanto o valor observado ficou acima ou abaixo do centro. Se simplesmente fizéssemos a média desses desvios, os positivos e negativos se cancelariam. Ao elevá-los ao quadrado, todos passam a contribuir positivamente e os afastamentos maiores recebem peso maior.

Assim, variância pequena significa que a distribuição está fortemente concentrada em torno da média, enquanto variância grande indica maior dispersão. Como o quadrado também eleva ao quadrado a unidade de medida, o desvio padrão \(\sqrt{\operatorname {Var}[\xi ]}\) costuma ser mais fácil de interpretar: ele mede a dispersão na mesma unidade de \(\xi \).

Proposição 7.19 (Propriedades da Variância e Covariância)
Dadas \(\xi ,\eta \in \L ^2(\P )\), temos:
  1. \(\operatorname {Var}[\xi ]\geq 0\)

  2. \(\operatorname {Var}[\xi ] = \mathbf{E}[\xi ^2] - \mathbf{E}[\xi ]^2\).

  3. \(\operatorname {Var}[\xi ] = 0 \Longleftrightarrow \xi = \mathbf{E}[\xi ]\) quase certamente.

  4. A aplicação \(f : \mathbb {R}\to \mathbb {R}\), \(x \longmapsto \mathbf{E}[(\xi - x)^2 ]\) tem um mínimo em \(\mathbf{E}[\xi ]\) com \(f(\mathbf{E}[\xi ]) = \operatorname {Var}[\xi ]\).

  5. \(\operatorname {Var}[a\xi +b]=a^2\operatorname {Var}[\xi ]\) para \(a,b\in \mathbb {R}\).

  6. \(\operatorname {Cov}[\xi ,\eta ]=\mathbf{E}[\xi \eta ]-\mathbf{E}[\xi ]\mathbf{E}[\eta ]\).

  7. \(\operatorname {Var}[\xi +\eta ]=\operatorname {Var}[\xi ]+\operatorname {Var}[\eta ]+2\operatorname {Cov}[\xi ,\eta ]\).

  8. \(\operatorname {Cov}[\xi ,\xi ]=\operatorname {Var}[\xi ]\).

Demonstração
  1. Segue da definição, pois \((\xi -\mathbf{E}[\xi ])^2\geq 0\).

  2. Segue da linearidade da esperança. De fato

    \begin{align*} \operatorname {Var}[\xi ]& =\mathbf{E}[(\xi -\mathbf{E}[\xi ])^2]\\ & =\mathbf{E}[\xi ^2]-2\mathbf{E}[\xi ]^2+\mathbf{E}[\xi ]^2\\ & =\mathbf{E}[\xi ^2]-\mathbf{E}[\xi ]^2. \end{align*}
  3. Se \(\operatorname {Var}[\xi ]=0\), a variável não negativa \((\xi -\mathbf{E}[\xi ])^2\) tem esperança nula; logo é nula quase certamente. A recíproca é imediata.

  4. A identidade

    \[ \mathbf{E}[(\xi -x)^2] =\operatorname {Var}[\xi ]+(x-\mathbf{E}[\xi ])^2 \]

    mostra que o mínimo é atingido em \(x=\mathbf{E}[\xi ]\) e vale \(\operatorname {Var}[\xi ]\).

  5. Como \(a\xi +b-\mathbf{E}[a\xi +b]=a(\xi -\mathbf{E}[\xi ])\), temos \(\operatorname {Var}[a\xi +b]=a^2\operatorname {Var}[\xi ]\).

  6. Segue da linearidade da esperança que

    \begin{align*} \operatorname {Cov}[\xi ,\eta ]& =\mathbf{E}[(\xi -\mathbf{E}[\xi ])(\eta -\mathbf{E}[\eta ])]\\ & =\mathbf{E}[\xi \eta ]-\mathbf{E}[\xi ]\mathbf{E}[\eta ]. \end{align*}
  7. Segue da linearidade da esperança e dos itens anteriores que

    \begin{align*} \operatorname {Var}(\xi +\eta ) & =\mathbf{E}[\xi ^2]+\mathbf{E}[\eta ^2]+2\mathbf{E}[\xi \eta ] -\mathbf{E}[\xi ]^2-\mathbf{E}[\eta ]^2-2\mathbf{E}[\xi ]\mathbf{E}[\eta ]\\ & =\operatorname {Var}[\xi ]+\operatorname {Var}[\eta ]+2\operatorname {Cov}[\xi ,\eta ]. \end{align*}
  8. Segue direto da definição.

O item 4 nos fornece uma descrição geométrica: imagine que queremos minimizar o erro quadrático médio de uma estimativa \(x\) da variável \(X\). Nesse caso a estimativa que minimiza esse erro é a esperança e a variância é o menor valor do erro quadrático médio.

Exemplo 7.20

Seja \(X\in \L ^2(\P )\) com \(\operatorname {Var}[X]\gt 0\) e seja \(Y=aX+b\), com \(a\neq 0\). Temos então \(\mathbf{E}[Y]=a\mathbf{E}[X]+b\) e \(\operatorname {Var}[Y]=a^2\operatorname {Var}[X]\).

Da mesma forma temos que \(\operatorname {Cov}[X,Y]=\mathbf{E}[(X-\mathbf{E}[X])(aX+b-(a\mathbf{E}[X]+b))]=a\operatorname {Var}[X].\)

Segue que

\[ \rho (X,Y)=\frac{a\operatorname {Var}[X]}{\sqrt{a^2(\operatorname {Var}[X])^2}}=\operatorname {sinal}(a)=\begin{cases} 1;& a\gt 0\\ -1;& a\lt 0\end{cases}. \]

A covariância a correlação servem para medir o “nível de correlação” entre as variáveis. Nesse exemplo vimos que se \(Y=aX+b\) então \(\operatorname {Cov}[X,Y]\) tem o mesmo sinal de \(a\) e \(\rho (X,Y)\) é \(1\) ou \(-1\), de acordo com o sinal de \(a\).

Teorema 7.21 (Independência e produto de esperanças)
Sejam \(\xi ,\eta \) variáveis aleatórias independentes e integráveis. Então \(\xi \eta \) é integrável e
\[ \mathbf{E}[\xi \eta ]=\mathbf{E}[\xi ]\mathbf{E}[\eta ]. \]
Em particular, se \(\xi ,\eta \in \L ^2(\P )\), então elas não são correlacionadas.

Demonstração

Assuma primeiro que \(\xi \) e \(\eta \) sejam simples, com valores \(x_1,\ldots ,x_n\) e \(y_1,\ldots ,y_m\). Então

\begin{align*} \mathbf{E}[\xi \eta ] & = \sum _{i=1}^n \sum _{j=1}^m x_iy_j\P [\xi =x_i,\eta =y_j] \\ & = \sum _{i=1}^n \sum _{j=1}^m x_iy_j\P [\xi =x_i]\P [\eta =y_j]\quad \mbox{ (pela independência)} \\ & = \left(\sum _{i=1}^n x_i\P [\xi =x_i]\right) \left(\sum _{j=1}^m y_j\P [\eta =y_j]\right) \\ & =\mathbf{E}[\xi ]\mathbf{E}[\eta ]. \end{align*}

Se \(\xi ,\eta \geq 0\), escolha funções simples \(\xi _n\uparrow \xi \) e \(\eta _n\uparrow \eta \), obtidas por transformações mensuráveis separadas. A independência é preservada e \(\xi _n\eta _n\uparrow \xi \eta \). Pela Convergência Monótona,

\[ \mathbf{E}[\xi \eta ] =\lim _n\mathbf{E}[\xi _n\eta _n] =\lim _n\mathbf{E}[\xi _n]\mathbf{E}[\eta _n] =\mathbf{E}[\xi ]\mathbf{E}[\eta ]. \]

Aplicando esse caso a \(|\xi |\) e \(|\eta |\), obtemos \(\mathbf{E}|\xi \eta |=\mathbf{E}|\xi |\, \mathbf{E}|\eta |\lt \infty \). Por fim, decomponha \(\xi \) e \(\eta \) em partes positiva e negativa e use a linearidade. Se ambas pertencem a \(\L ^2\), a fórmula da covariância dá \(\operatorname {Cov}[\xi ,\eta ]=0\).

Vimos assim que variáveis aleatórias independentes têm covariância nula, quando possuem segundo momento finito. A recíproca não é verdadeira, como mostra o Exercício 7.20, ao final do capítulo.

Uma outra consequência importante é sobre a variância da soma de variáveis independentes.

Corolário 7.22
Se \(X_1,\ldots ,X_n\in \L ^2(\P )\) são variáveis aleatórias independentes, então
\[ \operatorname {Var}[X_1+\cdots +X_n]=\operatorname {Var}[X_1]+\cdots +\operatorname {Var}[X_n]. \]

Demonstração

Para \(n=2\) temos

\[ \operatorname {Var}[X_1+X_2]=\operatorname {Var}[X_1]+\operatorname {Var}[X_2]+2\operatorname {Cov}[X_1,X_2]=\operatorname {Var}[X_1]+\operatorname {Var}[X_2]. \]

Os demais casos seguem por indução, pois \(X_1+\cdots +X_{n-1}\) é independente de \(X_n\).

Proposição 7.23
A aplicação \(\operatorname {Cov}: \L ^2 (\P ) \times \L ^2(\P ) \to \mathbb {R}\) é uma forma simétrica bilinear positiva semidefinida e \(\operatorname {Cov}[\xi , \eta ] = 0\) se \(\eta \) é constante quase certamente.

Demonstração

Se \(\widetilde X=X-\mathbf{E}[X]\) e \(\widetilde Y=Y-\mathbf{E}[Y]\), então \(\operatorname {Cov}[X,Y]=\mathbf{E}[\widetilde X\widetilde Y]\). A linearidade em cada entrada e a simetria seguem da linearidade da esperança e do produto. Além disso,

\[ \operatorname {Cov}[X,X]=\mathbf{E}[\widetilde X^2]=\operatorname {Var}[X]\geq 0, \]

de modo que a forma é positiva semidefinida. Se \(Y=c\) quase certamente, então \(\widetilde Y=0\) quase certamente e \(\operatorname {Cov}[X,Y]=0\).

Proposição 7.24 (Desigualdade de Cauchy–Schwarz)
Se \(\xi , \eta \in \L ^2 (\P )\), então
\[ \operatorname {Cov}[\xi , \eta ]^2\leq \operatorname {Var}[\xi ]\operatorname {Var}[\eta ]. \]
A igualdade é válida se, e somente se, existirem \(a, b, c \in \mathbb {R}\), não todas nulas, e tais que \(a\xi + b\eta + c = 0\) q.c.

Demonstração

A desigualdade de Cauchy-Schwarz é verdadeira para qualquer forma bilinear positiva semidefinita e, portanto, em particular para a covariância. Ainda assim, faremos uma demonstração aqui para deixar o texto mais completo e auto-contido.

Se \(\operatorname {Var}[\eta ]=0\), então \(\eta \) é constante quase certamente e ambos os lados da desigualdade são zero. Além disso, \(\eta -\mathbf{E}[\eta ]=0\) já fornece a dependência afim anunciada.

Suponha agora \(\operatorname {Var}[\eta ]\gt 0\) e ponha \(\theta =-\operatorname {Cov}[\xi ,\eta ]/\operatorname {Var}[\eta ]\).

Temos assim \(\theta \operatorname {Var}[\eta ]=-\operatorname {Cov}[\xi ,\eta ]\), e portanto

\begin{align*} 0 & \leq \operatorname {Var}[\xi + \theta \eta ]\operatorname {Var}[\eta ]\\ & = (\operatorname {Var}[\xi ] + 2\theta \operatorname {Cov}[\xi , \eta ] + \theta ^2 \operatorname {Var}[\eta ]) \operatorname {Var}[\eta ]\\ & = \operatorname {Var}[\xi ]\operatorname {Var}[\eta ] - \operatorname {Cov}[\xi , \eta ]^2. \end{align*}

A igualdade ocorre se, e somente se, \(\operatorname {Var}[\xi +\theta \eta ]=0\), isto é, se \(\xi +\theta \eta \) é constante quase certamente. Isso equivale à existência de \(a,b,c\in \mathbb {R}\), não todos nulos, tais que \(a\xi +b\eta +c=0\) quase certamente. A recíproca também segue dessa caracterização, trocando as variáveis se necessário.

Corolário 7.25
Dadas variáveis não constantes \(X,Y\in \L ^2(\P )\), então
\[ |\rho (X,Y)|\leq 1, \]
com igualdade se, e somente se, existirem constantes \(a,b,c\in \mathbb {R}\), não todas nulas, tais que \(aX+bY+c=0\) quase certamente.

Demonstração

Divida a desigualdade de Cauchy–Schwarz por \(\operatorname {Var}[X]\operatorname {Var}[Y]\gt 0\) e use sua caracterização do caso de igualdade.

7.4 Integração com respeito à Distribuição

Uma função de distribuição determina uma probabilidade em \(\mathbb {R}\). Integrar em relação a essa probabilidade conduz às integrais de Lebesgue–Stieltjes; aqui, elas serão sobretudo uma linguagem para calcular esperanças sem retornar ao espaço amostral.

Proposição 7.26 (Medida de Lebesgue–Stieltjes)
Dada uma função de distribuição \(F\) em \(\mathbb {R}\), existe uma única probabilidade \(\P _F\) em \((\mathbb {R},\mathcal{B}(\mathbb {R}))\) tal que
\[ \P _F((a,b])=F(b)-F(a) \]
para todo \(a\lt b\).

Demonstração

Pela Proposição 6.15, existe uma variável aleatória \(X\) cuja função de distribuição é \(F\). Sua distribuição \(\P _X\) satisfaz

\[ \P _X((a,b])=\P (a\lt X\leq b)=F(b)-F(a), \]

o que prova a existência. Se duas probabilidades possuem essa propriedade, elas coincidem no \(\pi \)-sistema dos intervalos \((-\infty ,b]\) (tomando o limite \(a\to -\infty \)) e, pelo teorema de unicidade de medidas, coincidem em \(\mathcal{B}(\mathbb {R})\).

Definição 7.27 (Integração com respeito à distribuição)
Dada \(F\) uma função de distribuição em \(\mathbb {R}\). Para toda função \(g\in \L ^1(\P _F)\) definimos a integral de \(g\) com respeito a \(F\)
\[ \mathbf{E}_F[g]:=\displaystyle \int _{\mathbb {R}} g(x)dF(x) \]
onde estamos considerando \(g\) como uma variável aleatória no espaço de probabilidade \((\mathbb {R},\mathcal{B}(\mathbb {R}),\P _F)\).

Proposição 7.28
Se \((p_i)_{i\geq 1}\) são números não negativos com \(\sum _i p_i=1\) e
\[ F(t)=\sum _{i\geq 1}p_i\mathbb {1}_{\{ t_i\leq t\} }, \]
então, para toda função mensurável \(g\geq 0\),
\[ \mathbf{E}_F[g]=\displaystyle \int _{\mathbb {R}} gdF=\sum _i p_i g(t_i). \]

Demonstração

Primeiro suponha que \(g=\sum _{j=1}^m b_j\mathbb {1}_{B_j}\) é simples e não negativa. Então

\begin{align} \mathbf{E}_F[g] & = \sum _{j=1}^m b_j \P _F(B_j) = \sum _{j=1}^m b_j \sum _i p_i \mathbb {1}_{B_j}(t_i) \tag{7.4} \\ & =\sum _i p_i \sum _{j=1}^m b_j \mathbb {1}_{B_j}(t_i) \tag{7.5} \\ & =\sum _i p_i g(t_i) \tag{7.6} \end{align}

Para \(g\geq 0\) mensurável, tome funções simples \(g_n\uparrow g\) e aplique duas vezes o Teorema da Convergência Monótona:

\[ \mathbf{E}_F[g]=\lim \limits _{n\to \infty } \mathbf{E}_F[g_n]=\lim \limits _{n\to \infty }\sum _i p_i g_n(t_i)=\sum _i p_i g(t_i) \]

Proposição 7.29
Suponha que \(F\) é absolutamente contínua com densidade \(f\). Então, para toda função mensurável \(g\geq 0\),
\[ \mathbf{E}_F[g]=\displaystyle \int _{\mathbb {R}} g dF=\displaystyle \int _{-\infty }^\infty g(x)f(x)dx \]

Demonstração

Primeiro suponha que \(g=\sum _{j=1}^m b_j\mathbb {1}_{B_j}\) é simples e não negativa. Então

\begin{align} \mathbf{E}_F[g] & = \sum _{j=1}^m b_j \P _F(B_j) = \sum _{j=1}^m b_j\int _{B_j}f(x)\, \d x \tag{7.7} \\ & =\sum _{j=1}^m b_j\int _{-\infty }^\infty f(x)\mathbb {1}_{B_j}(x)\, \d x \tag{7.8} \\ & =\int _{-\infty }^\infty f(x)\left[\sum _{j=1}^m b_j\mathbb {1}_{B_j}(x)\right]\, \d x \tag{7.9} \\ & =\int _{-\infty }^\infty f(x) g(x)dx \tag{7.10} \end{align}

Para \(g\geq 0\) mensurável, aproxime \(g\) por funções simples não negativas e use o Teorema da Convergência Monótona dos dois lados.

Utilizando as Proposições 7.28 e 7.29 podemos integrar com respeito a uma distribuição que seja combinação de uma discreta e uma absolutamente contínua.

Teorema 7.30 (Mudança de Variáveis)
Dada uma variável aleatória \(\xi \) e sua função de distribuição \(F_\xi \), então
\[ \mathbf{E}[ \xi ] = \displaystyle \int _{\mathbb {R}} x\ dF_\xi (x) \]
e de modo mais geral,
\[ \mathbf{E}[g(\xi )] = \displaystyle \int _{\mathbb {R}} g(x)\, dF_\xi (x) \]
para toda função mensurável \(g:\mathbb {R}\to \mathbb {R}\), sempre que qualquer um dos lados esteja bem definido.

Demonstração

A medida de Lebesgue–Stieltjes \(\P _{F_\xi }\) é a distribuição \(\P _\xi \), pois ambas têm função de distribuição \(F_\xi \). Portanto, o Teorema 7.9

\[ \mathbf{E}[g(\xi )] =\int _{\mathbb {R}} g\, \d\P _\xi =\int _{\mathbb {R}} g(x)\, \d F_\xi (x). \]

Tomando \(g(x)=x\), obtemos a primeira identidade.

Exemplo 7.31

Se \(\xi \sim \mathcal{N}(0;1)\) então \(\mathbf{E}(\xi ) = 0\).

De fato,

\[ \mathbf{E}[\xi ] =\frac{1}{\sqrt{2\pi }}\int _{-\infty }^{\infty } x\, \mathrm e^{-x^2/2}\, \d x =0, \]

pois o integrando é uma função ímpar e integrável.

Exemplo 7.32
Se \(\xi \sim \operatorname {Exp}(\lambda )\) então
\[ \mathbf{E}[\xi ^n] =\int _0^\infty x^n\lambda \mathrm e^{-\lambda x}\, \d x =\frac{n!}{\lambda ^n}, \]
onde a última igualdade segue por \(n\) integrações por partes.

7.5 Desigualdades de Markov e Chebyshev

As desigualdades de Markov e Chebyshev convertem informação sobre momentos em controle das caudas de uma distribuição. São estimativas simples e universais: pedem pouco, e por isso também prometem pouco.

Teorema 7.33 (Desigualdade de Markov)

Dada uma variável aleatória \( \xi \geq 0 \), vale que

\begin{equation} \label{desig_markov} \P (\xi \geq t)\leq \frac{\mathbf{E}[\xi ]}{t} \quad \text{para todo }t\gt 0. \tag{7.11} \end{equation}

Em particular, dada uma variável aleatória \(\xi \) qualquer

\[ \P (|\xi |\geq t)\leq \frac{\mathbf{E}|\xi |}{t}. \]

Demonstração

Começamos definindo \( \eta : = t \mathbb {1}_{\{ \xi \geq t \} } \), e observando que \( \eta \leq \xi \) pontualmente.

Assim sendo temos

\[ \mathbf{E}[\xi ]\geq \mathbf{E}[\eta ]=\mathbf{E}[t\mathbb {1}_{\{ \xi \geq t\} }] =t\P (\xi \geq t), \]

concluindo o resultado.

A simplicidade da cota tem um preço: ela pode estar longe do valor exato. Aplicar Markov a outras funções da variável permite refiná-la.

Teorema 7.34 (Desigualdade de Chebyshev)

Dadas uma variável aleatória \(\xi \geq 0\) e uma constante \(p\gt 0\), vale

\begin{equation} \label{desigualdade_chevychev} \P (\xi \geq t)\leq \frac{\mathbf{E}[\xi ^p]}{t^p} \quad \text{para todo }t\gt 0. \tag{7.12} \end{equation}

Em particular

\[ \P (|\xi |\geq t)\leq \frac{\mathbf{E}[|\xi |^p]}{t^p}, \]

para uma variável aleatória \(\xi \) qualquer.

Demonstração

Basta reduzir o enunciado à desigualdade de Markov: \( \P (\xi \geq t) = \P (\xi ^p \geq t ^p) \leq \dfrac {\mathbf{E}[ \xi ^p]} {t ^p} \), pela desigualdade de Markov.

Para que a cota seja informativa, precisamos de \(\xi \in \L ^p(\P )\). Ainda assim, ela evidencia um fato mais forte sobre a cauda.

Se \(X\in \L ^p(\P )\) para todo \(p\gt 0\), então \(t^p\P (|X|\gt t)\to 0\) para cada \(p\gt 0\): basta aplicar a desigualdade com um expoente \(q\gt p\).

Assim, nessa forma da desigualdade, exigimos um momento de ordem \(p\) de \(\xi \), mas obtemos um controle mais forte para a cauda.

Uma formulação ainda mais flexível é obtida substituindo a potência por uma função não decrescente.

Teorema 7.35 (Desigualdade de Markov estendida)
Se \(\varphi :[0,\infty )\to [0,\infty )\) é não decrescente, \(\xi \) é uma variável aleatória e \(t\geq 0\) satisfaz \(\varphi (t)\gt 0\), então
\[ \P (|\xi |\geq t) \leq \frac{\mathbf{E}[\varphi (|\xi |)]}{\varphi (t)}. \]

Demonstração

No evento \(\{ |\xi |\geq t\} \), a monotonicidade dá \(\varphi (|\xi |)\geq \varphi (t)\). Assim,

\[ \varphi (t)\mathbb {1}_{\{ |\xi |\geq t\} } \leq \varphi (|\xi |). \]

Tomando esperanças e dividindo por \(\varphi (t)\gt 0\), obtemos o resultado.

Outra aplicação interessante da desigualdade de Markov é no estudo de como os valores de uma variável aleatória se dispersam ao redor da média, e como os diversos momentos centrais, e em particular a variância, informam esse comportamento.

O corolário abaixo é geralmente apresentado na literatura como sendo a própria desigualdade de Chebyshev, e trata exatamente deste assunto.

Corolário 7.36 (Variância)
Suponha que \(\xi \) tenha média \(\mu \) e variância \(0\lt \sigma ^2\lt \infty \). Então

\begin{equation} \P (| \xi - \mu | \geq t \sigma ) \leq \frac1{t ^2} \text{ para qualquer } t\gt 0, \tag{7.13} \end{equation}

ou ainda

\begin{equation} \P (| \xi - \mu | \geq t ) \leq \frac{\sigma ^2}{t ^2} \text{ para qualquer } t\gt 0. \tag{7.14} \end{equation}

Demonstração

Use a desigualdade de Chebyshev para a variável aleatória \(|\xi -\mu |\geq 0\), com expoente \(p=2\). Como \(\mathbf{E}|\xi -\mu |^2=\sigma ^2\),

\[ \P (| \xi - \mu | \geq t \sigma ) \leq \frac{\sigma ^2}{(t \sigma ) ^2} = \frac1{t ^2}. \]

Exemplo 7.37
Dada uma variável aleatória \( \xi \) com variância \(0\lt \sigma ^2\lt \infty \) e média \(\mu \in \mathbb {R}\), então
\[ \P (\mu -\sqrt{2}\cdot \sigma \lt \xi \lt \mu +\sqrt{2}\cdot \sigma )=1-\P (|\xi -\mu |\geq \sqrt{2}\cdot \sigma )\geq 1-\frac{1}{2}=\frac{1}{2}. \]
Ou seja, \(\xi \) está a uma distância menor que \( \sqrt{2} \cdot \sigma \) de sua média, com probabilidade \( \geq \frac{1}{2} \).

Exemplo 7.38

Considere o experimento de lançar uma moeda de maneira sequencial e independente. Para cada \(n\geq 1\), defina \(X_n\) como a indicadora de que observamos cara no \(n\)-ésimo lançamento. Suponha que em um lançamento da moeda, a probabilidade de observar cara é \(p\in (0,1)\).

Com isso temos que as variáveis \(X_1, X_2,\ldots \) são independentes com \(\mathbf{E}[X_n]=p\) e \(\operatorname {Var}[X_n]=p(1-p)\).

Queremos medir a proporção de caras observadas em \(n\) lançamentos, e para isso definiremos \(S_n=X_1+\cdots +X_n\). Isto é, \(S_n\) é o total de caras observadas em \(n\) lançamentos.

Segue assim que

\[ \mathbf{E}[S_n]=n\, p, \]

e, como \(X_1,\ldots ,X_n\) são independentes,

\[ \operatorname {Var}(S_n)=n\, p(1-p). \]

Tome agora \(\epsilon \gt 0\) pequeno e note que

\[ \P \left(\left|\frac{S_n}{n}-p\right|\gt \epsilon \right) =\P (|S_n-np|\gt n\epsilon ) \leq \frac{\operatorname {Var}(S_n)}{n^2\epsilon ^2} =\frac{p(1-p)}{n\epsilon ^2}. \]

Concluímos assim que

\[ \P \left(\left|\frac{S_n}{n}-p\right|\gt \epsilon \right)\rightarrow 0, \]

quando \(n\to \infty \), para todo \(\epsilon \gt 0\).

7.6 Desigualdade Maximal de Kolmogorov

Para somas de variáveis independentes, não basta controlar apenas o valor final: muitas vezes queremos saber se alguma soma parcial se afastou demais da origem. A desigualdade maximal de Kolmogorov fornece esse controle sem pagar um fator adicional pelo número de instantes observados.

Teorema 7.39

Seja \( (\xi _n) _{n \ge 1} \) uma sequência de variáveis aleatórias independentes, definidas no mesmo espaço de probabilidade, com esperança \(0\) e variância finita. Seja \(S_n = \sum _{k = 1} ^n \xi _k \). Então para \( \lambda \gt 0 \),

\[ \displaystyle \P \left(\max _{1 \le k \le n} \big| S_k \big| \ge \lambda \right) \le \frac{\operatorname {Var}(S_n)}{\lambda ^2} \]

Demonstração

Comece observando que o evento \( \{ \max _{1 \le k \le n} | S_k | \ge \lambda \} \) é a união disjunta dos eventos

\[ A_k = \{ | S_k | \ge \lambda , | S_j | \lt \lambda \text{ para } j \lt k \} ,\ k = 1, \ldots , n. \]

Observe também que, para cada \(k=1,\ldots ,n\), temos \(S_n-S_k=\xi _{k+1}+\cdots +\xi _n\), que é independente da \(\sigma \)-álgebra gerada por \(\xi _1,\ldots ,\xi _k\). Em particular, é independente de \(S_k\mathbb {1}_{A_k}\).

Além disso, \(\mathbf{E}[S_n-S_k]=0\) e, pela independência,

\[ \mathbf{E}[S_k(S_n-S_k)\mathbb {1}_{A_k}] =\mathbf{E}[S_k\mathbb {1}_{A_k}]\, \mathbf{E}[S_n-S_k]=0. \]

Além disso, dentro do evento \(A_k\) vale que \(\lambda ^{-2}S_k^2\geq 1\), de modo que \(\mathbb {1}_{A_k}\leq \lambda ^{-2}S_k^2\mathbb {1}_{A_k} \), e

\begin{align*} \P (A_k) & \leq \lambda ^{-2}\mathbf{E}[S_k^2\mathbb {1}_{A_k}] \\ & \leq \lambda ^{-2} \mathbf{E}[(S_k^2+(S_n-S_k)^2)\mathbb {1}_{A_k}] \\ & = \lambda ^{-2} \mathbf{E}[(S_k+S_n-S_k)^2\mathbb {1}_{A_k}], \end{align*}

onde a última igualdade decorre do termo misto nulo calculado acima.

Portanto,

\[ \P (A_k)\leq \lambda ^{-2}\mathbf{E}[S_n^2\mathbb {1}_{A_k}]. \]

Somando sobre os eventos disjuntos \(A_k\), encontramos

\[ \P \left(\max _{1\leq k\leq n}|S_k|\geq \lambda \right) \leq \lambda ^{-2} \mathbf{E}\left[S_n^2\mathbb {1}_{\{ \max _{1\leq k\leq n}|S_k|\geq \lambda \} }\right] \leq \lambda ^{-2}\mathbf{E}[S_n^2]. \]

O resultado é concluído quando vemos que \(\operatorname {Var}(S_n)=\mathbf{E}[S_n^2]-\mathbf{E}[S_n]^2=\mathbf{E}[S_n^2]\).

7.7 Desigualdade de Jensen, Hölder e Minkowski

Nesta seção apresentaremos três desigualdades fundamentais. A desigualdade de Jensen relaciona funções convexas e esperança; as desigualdades de Hölder e Minkowski controlam produtos e somas em espaços \(L^p\). Antes, recordaremos alguns conceitos de análise real.

Definição 7.40

Uma função \(\varphi :\mathbb {R}\to \mathbb {R}\) é convexa se para todo \(a,b\in \mathbb {R}\) e \(\alpha \in [0,1]\) vale que

\[ \varphi (\alpha \, a+(1-\alpha )b)\leq \alpha \varphi (a)+(1-\alpha )\varphi (b). \]

Geometricamente, isso se traduz como o gráfico da função, no intervalo \([a,b]\), estar abaixo da reta secante ao gráfico nos pontos \((a,\varphi (a))\) e \((b,\varphi (b))\).

Funções como \(|x|\), \(x^2\) e \(e^{\lambda x}\) são exemplos clássicos de funções convexas.

Um resultado importante sobre funções convexas, e que utilizaremos na demonstração do resultado principal, é o seguinte.

Proposição 7.41
Se \(\varphi :\mathbb {R}\to \mathbb {R}\) é convexa, então, dado \(t_0\in \mathbb {R}\), o mapa
\[ t\mapsto \frac{\varphi (t) - \varphi (t_0)}{t-t_0}, \]
definido em \(\mathbb {R}\setminus \{ t_0\} \), é não decrescente.

Demonstração

Se \(t_0\lt s\lt t\), escreva \(s=\alpha t+(1-\alpha )t_0\), com \(\alpha =(s-t_0)/(t-t_0)\). Pela convexidade,

\[ \frac{\varphi (s)-\varphi (t_0)}{s-t_0} \leq \frac{\varphi (t)-\varphi (t_0)}{t-t_0}. \]

O caso \(s\lt t\lt t_0\) é obtido escrevendo \(t\) como combinação convexa de \(s\) e \(t_0\). Finalmente, se \(s\lt t_0\lt t\), escreva \(t_0\) como combinação convexa de \(s\) e \(t\); a desigualdade resultante é

\[ \frac{\varphi (s)-\varphi (t_0)}{s-t_0} \leq \frac{\varphi (t)-\varphi (t_0)}{t-t_0}. \]

Isso cobre todas as posições possíveis.

Proposição 7.42 (Desigualdade de Jensen)
Se \(\xi \) é integrável e \(\varphi :\mathbb {R}\to \mathbb {R}\) é convexa, então \(\mathbf{E}[\varphi (\xi )]\) está bem definida em \((-\infty ,\infty ]\) e
\[ \varphi (\mathbf{E}[\xi ])\leq \mathbf{E}[\varphi (\xi )]. \]

Demonstração

Ponha \(t_0=\mathbf{E}[\xi ]\). Pela proposição anterior, existe \(m\in \mathbb {R}\) entre as inclinações secantes à esquerda e à direita de \(t_0\). Assim,

\[ \varphi (t)\geq \varphi (t_0)+m(t-t_0) \qquad \text{para todo }t\in \mathbb {R}. \]

Essa reta de suporte mostra também que a parte negativa de \(\varphi (\xi )\) é dominada por uma função integrável; logo sua esperança está bem definida. Tomando esperanças na desigualdade,

\[ \mathbf{E}[\varphi (\xi )] \geq \varphi (t_0)+m(\mathbf{E}[\xi ]-t_0) =\varphi (\mathbf{E}[\xi ]). \]

Terminamos com uma aplicação bastante importante da desigualdade de Jensen.

Exemplo 7.43

Seja \(X\) uma variável aleatória e sejam \(0\lt p\lt q\). Vamos mostrar que \(X\in \L ^q(\P )\) implica \(X\in \L ^p(\P )\).

Como \(q/p\gt 1\), a função \(\varphi (x)=x^{q/p}\) é convexa em \([0,\infty )\). Não podemos aplicar Jensen diretamente a \(|X|^p\), pois sua integrabilidade é precisamente o que queremos provar. Para \(M\gt 0\), defina

\[ Y_M=|X|^p\wedge M. \]

A variável \(Y_M\) é limitada e, portanto, integrável. Pela desigualdade de Jensen,

\[ \mathbf{E}[Y_M]^{q/p}\leq \mathbf{E}[Y_M^{q/p}]\leq \mathbf{E}[|X|^q]. \]

Portanto,

\[ \mathbf{E}[Y_M]\leq \mathbf{E}[|X|^q]^{p/q}. \]

Como \(Y_M\uparrow |X|^p\) quando \(M\to \infty \), o Teorema da Convergência Monótona fornece

\[ \mathbf{E}[|X|^p]\leq \mathbf{E}[|X|^q]^{p/q}\lt \infty . \]

Logo \(X\in \L ^p(\P )\).

Proposição 7.44 (Desigualdade de Hölder)
Se \(p,q\in [1,\infty ]\) são expoentes conjugados, \(1/p+1/q=1\), \(\xi \in \L ^p(\P )\) e \(\eta \in \L ^q(\P )\), então
\[ \mathbf{E}[|\xi \eta |]\leq \| \xi \| _p\| \eta \| _q. \]

Demonstração

Nos casos \((p,q)=(1,\infty )\) e \((\infty ,1)\), a desigualdade segue diretamente de \(|\xi \eta |\leq \| \eta \| _\infty |\xi |\) e de sua versão simétrica. Suponha \(1\lt p,q\lt \infty \). Se uma das normas é zero, o resultado é imediato. Caso contrário, ponha \(U=|\xi |/\| \xi \| _p\) e \(V=|\eta |/\| \eta \| _q\). Pela desigualdade de Young, \(uv\leq u^p/p+v^q/q\), temos

\[ \mathbf{E}[UV]\leq \frac1p\mathbf{E}[U^p]+\frac1q\mathbf{E}[V^q] =\frac1p+\frac1q=1. \]

Multiplicando pelas duas normas, obtemos a conclusão.

Proposição 7.45 (Desigualdade de Minkowski)
Se \(f,g\in \L ^p(\P )\) e \(1\leq p\leq \infty \), então
\[ \| f+g\| _p\leq \| f\| _p+\| g\| _p. \]

Demonstração

Para \(p=1\), integre \(|f+g|\leq |f|+|g|\). Para \(p=\infty \), tome o supremo essencial nessa mesma desigualdade. Suponha \(1\lt p\lt \infty \). A estimativa \(|f+g|^p\leq 2^{p-1}(|f|^p+|g|^p)\) mostra primeiro que \(f+g\in \L ^p\). Se \(\| f+g\| _p=0\), não há o que provar. Caso contrário, Hölder, com conjugado \(q=p/(p-1)\), fornece

\begin{align*} \| f+g\| _p^p & \leq \int _\Omega |f|\, |f+g|^{p-1}\, \d\P +\int _\Omega |g|\, |f+g|^{p-1}\, \d\P \\ & \leq (\| f\| _p+\| g\| _p) \bigl\| |f+g|^{p-1}\bigr\| _q\\ & =(\| f\| _p+\| g\| _p)\| f+g\| _p^{p-1}. \end{align*}

Dividindo pelo último fator, obtemos a desigualdade.

7.8 ↯Funções Geradoras de Probabilidade

Considere uma variável aleatória \( \xi \), tomando valores nos naturais. Seja \( p_r = \P (\xi = r) \).

Definição 7.46 (Função Geradora de Probabilidade)
A função geradora de probabilidade de \( \xi \) é definida como
\[ p(z)=\mathbf{E}[z^\xi ] =\sum _{r=0}^\infty \P (\xi =r)z^r =p_0+p_1z+p_2z^2+\cdots , \qquad |z|\leq 1. \]

Observamos que função geradora de probabilidade é uma série de potência e converge absolutamente para \( | z | \leq 1 \), pois

\[ | p (z) | \leq \sum _r p_r | z ^r | \leq \sum _r p_r = 1. \]

A função geradora reúne as probabilidades nos coeficientes de uma série. Sua utilidade aparece quando operações sobre variáveis se traduzem em operações algébricas sobre essas funções.

Exemplo 7.47
Considere um dado justo. Então \( p_r = 1/6 \) para \( r = 1, \cdots , 6 \). assim
\[ p (z) = \mathbf{E}[z ^\xi ] = \frac{1}{6} (z + z ^2 + \cdots + z ^6) = \frac{1}{6} z \left(\frac{1 - z ^6}{1 - z} \right). \]

Exemplo 7.48

Neste exemplo, calculamos a função geradora de probabilidade para a distribuição de Poisson de parâmetro \(\alpha \). Com base na definição, temos:

\begin{align} p(z) & =\sum \limits _{j=0}^\infty \frac{e^{-\alpha } \alpha ^j}{j!} \ z^j \tag{7.15} \\ & =\sum \limits _{j=0}^\infty \frac{e^{-\alpha } (\alpha z)^j}{j!} \tag{7.16} \\ & =\frac{e^{-\alpha }}{e^{- \alpha z}} \sum \limits _{j=0}^\infty \frac{e^{-\alpha z} (\alpha z)^j}{j!} \tag{7.17} \\ & =e^{\alpha (z-1)} \tag{7.18}\end{align}

Teorema 7.49
A distribuição de \( \xi \) é determinada exclusivamente pela sua função geradora de probabilidade.

Demonstração

No interior do intervalo de convergência, podemos diferenciar a série termo a termo. Assim,

\[ \left. \frac{d^n}{dz ^n} p (z) \right| _{z = 0} = n! p_n. \]

Logo \(p_n=p^{(n)}(0)/n!\) para todo \(n\geq 0\), e recuperamos toda a distribuição.

Teorema 7.50 (Lema de Abel)
\[ \mathbf{E}[\xi ]=\lim _{z\uparrow 1}p'(z), \]
admitindo-se o valor \(+\infty \). Se \(p'\) possui extensão contínua a \(1\), então \(\mathbf{E}[\xi ]=p'(1)\).

Demonstração

Para \(0\lt z\lt 1\), a diferenciação termo a termo dá

\[ p'(z)=\sum _{r=1}^\infty rp_rz^{r-1}. \]

Quando \(z\uparrow 1\), cada parcela cresce para \(rp_r\). Pelo Teorema da Convergência Monótona aplicado à medida de contagem em \(\mathbb {N}\),

\[ \lim _{z\uparrow 1}p'(z) =\sum _{r=1}^\infty rp_r =\mathbf{E}[\xi ]. \]

A última afirmação é imediata da continuidade em \(1\).

Teorema 7.51
\[ \mathbf{E}[\xi (\xi -1)]=\lim _{z\uparrow 1}p''(z), \]
admitindo-se o valor \(+\infty \).

Demonstração

Para \(0\lt z\lt 1\),

\[ p''(z)=\sum _{r=2}^\infty r(r-1)p_rz^{r-2}. \]

As parcelas são não negativas e crescem quando \(z\uparrow 1\). A Convergência Monótona fornece

\[ \lim _{z\uparrow 1}p''(z) =\sum _{r=2}^\infty r(r-1)p_r =\mathbf{E}[\xi (\xi -1)]. \]

Exemplo 7.52
Considere a distribuição de Poisson. Então
\[ p_r = \P (\xi = r) = \frac{1}{r!} \lambda ^r e ^{- \lambda }. \]
Então
\[ p (z) = \mathbf{E}[z ^\xi ] = \sum _0 ^\infty z ^r \frac{1}{r!} \lambda ^re ^{- \lambda } = e ^{\lambda z} e ^{- \lambda } = e ^{\lambda (z - 1)}. \]
Temos
\[ \mathbf{E}[\xi ] = \left. \frac{d}{d z} e ^{\lambda (z - 1)} \right| _{z = 1} = \lambda , \]
e
\[ \mathbf{E}[\xi (\xi - 1)] = \left. \frac{d ^2}{dz ^2} e ^{\lambda (z - 1)} \right| _{z = 1} = \lambda ^2 \]
assim
\[ \operatorname {Var}(\xi ) = \mathbf{E}[\xi ^2] - \mathbf{E}[\xi ] ^2 = \lambda ^2 + \lambda - \lambda ^2 = \lambda . \]

Teorema 7.53
Suponha que \( \xi _1, \xi _2, \cdots , \xi _n \) sejam variáveis aleatórias independentes com funções geradoras de probabilidade \( p_1, p_2, \cdots , p_n \). Então, a função geradora de probabilidade de \( \xi _1 + \xi _2 + \cdots + \xi _n \) é \( p_1 (z) p_2 (z) \cdots p_n (z) \).

Demonstração
\[ \mathbf{E}[z ^{\xi _1 + \cdots + \xi _n}] = \mathbf{E}[z ^{\xi _1} \cdots z ^{\xi _n}] = \mathbf{E}[z ^{\xi _1}] \cdots \mathbf{E}[z ^{\xi _n }] = p_1 (z) \cdots p_n (z). \]

Exemplo 7.54

Se \( \xi \) e \( \eta \) forem variáveis aleatórias de Poisson independentes com parâmetros \( \lambda , \mu \) respectivamente, então

\[ \mathbf{E}[t ^{\xi + \eta }] = \mathbf{E}[t ^\xi ] \mathbf{E}[t ^\eta ] = e ^{\lambda (t - 1)} e ^{\mu (t - 1)} = e ^{(\lambda + \mu ) (t - 1)} \]

Portanto, \( \xi + \eta \sim \P (\lambda + \mu ) \).

Também podemos fazê-lo diretamente:

\[ \P (\xi + \eta = r) = \sum _{i = 0} ^r \P (\xi = i, \eta = r - i) = \sum _{i = 0} ^r \P (\xi = i) \P (\eta = r - i), \]

mas é muito mais complicado.

Somas de um número aleatório de termos

As funções geradoras também permitem estudar somas cujo número de parcelas é aleatório. Numa seguradora, por exemplo, tanto o número de pedidos de indenização quanto o valor de cada pedido podem variar. A soma reúne as duas fontes de aleatoriedade.

Exemplo 7.55

Sejam \(\xi _1,\xi _2,\ldots \) variáveis aleatórias independentes, identicamente distribuídas e com valores em \(\mathbb {N}\), com função geradora \(p(z)=\mathbf{E}[z^{\xi _1}]\). Seja \(N\), também com valores em \(\mathbb {N}\), independente de todas as \(\xi _i\) e com função geradora \(h\). Para \(S=\xi _1+\cdots +\xi _N\) (com \(S=0\) quando \(N=0\)), temos

\begin{align*} \mathbf{E}[z ^{S}] & = \mathbf{E}[z ^{\xi _1 + \cdots + \xi _N}] \\ & = \mathbf{E}_N [\underbrace{\mathbf{E}_{\xi _i} [z ^{\xi _1 + \ldots + \xi _N} \mid N]} _{\text{assumindo fixo} N}] \\ & = \sum _{n = 0} ^\infty \P (N = n) \mathbf{E}[z ^{\xi _1 + \xi _2 + \cdots + \xi _n}] \\ & = \sum _{n = 0} ^\infty \P (N = n) \mathbf{E}[z ^{\xi _1}] \mathbf{E}[z ^{\xi _2}] \cdots \mathbf{E}[z ^{\xi _n}] \\ & = \sum _{n = 0} ^\infty \P (N = n) (\mathbf{E}[z ^{\xi _1}]) ^n \\ & = \sum _{n = 0} ^\infty \P (N = n) p (z) ^n \\ & = h (p (z)) \end{align*}

como \( h (x) = \sum _{n = 0} ^\infty \P (N = n) x ^n \).

assim

\begin{align*} \mathbf{E}[S] & = \left. \frac{d}{d z} h (p (z)) \right| _{z = 1} \\ & = h ’(p (1)) p’ (1) \\ & = \mathbf{E}[N] \mathbf{E}[\xi _1] \end{align*}

Para calcular a variância, use o fato de que

\[ \mathbf{E}[S (S - 1)] = \left. \frac{d ^2}{d z ^2} h (p (z)) \right| _{z = 1}. \]

Se \(N\) e \(\xi _1\) possuem segundos momentos finitos, a diferenciação em \(z=1\) fornece

\[ \operatorname {Var}(S) =\mathbf{E}[N]\operatorname {Var}(\xi _1)+\mathbf{E}[\xi _1]^2\operatorname {Var}(N). \]

7.9 ↯Processos de Ramificação

Originalmente, processos de ramificações foram considerados por Galton e Watson nos anos de 1870 quando estes procuravam um modelo quantitativo para o fenômeno do desaparecimento de sobrenomes, mesmo no cenário de uma população crescente. O modelo é construído sob a suposição de que cada homem em uma dada família tem a probabilidade \({p_k}\) de ter \({k}\) filhos e que o sobrenome de família é passado aos filhos, então desejamos determinar a probabilidade que após \({n}\) gerações um indivíduo não tenha descendentes homens.

Vamos fazer perguntas como o número esperado de indivíduos em uma geração específica e a probabilidade de extinção.

Considere \( \xi _0, \xi _1, \cdots \), onde \( \xi _n \) é o número de indivíduos na geração \( n \)-ésima. Assumimos o seguinte:

  1. \( \xi _0 = 1 \)

  2. Cada indivíduo vive por uma unidade de tempo e produz \( k \) descendentes com probabilidade \( p_k \).

  3. Os números de descendentes de indivíduos distintos e de gerações distintas são independentes. Assim,

    \[ \xi _{n + 1} = \eta _1 ^n + \eta _2 ^n + \cdots + \eta _{\xi _n} ^n, \]

    onde as variáveis \(\eta _i^n\) são independentes, identicamente distribuídas como \(\xi _1\) e independentes da história até a geração \(n\).

Figura 7.1 Realização de um processo de ramificação; esquema baseado em [ 14 ] .

Figura 7.1 Realização de um processo de ramificação; esquema baseado em [14].

A função geradora transforma a recorrência do processo de ramificação numa relação de composição. Seja \( F (z) \) a função geradora de probabilidade de \( \eta _i ^n \). Então

\[ F (z) = \mathbf{E}[z ^{\eta _i ^n}] = \mathbf{E}[z ^{\xi _1}] = \sum _{k = 0} ^\infty p_k z ^k. \]

Definimos

\[ F_n(z)=\mathbf{E}[z^{\xi _n}],\qquad F_0(z)=z. \]

O principal teorema dos processos de ramificação que provaremos nesta seção é

Teorema 7.56
Para \(0\leq z\leq 1\),
\[ F_{n+1}(z)=F_n(F(z))=F(F_n(z))=F^{\circ (n+1)}(z). \]

Demonstração

Condicionando no tamanho da geração \(n\) e usando a independência das descendências,

\begin{align*} F_{n+1}(z) & =\sum _{k=0}^\infty \P (\xi _n=k) \mathbf{E}\! \left[z^{\eta _1^n+\cdots +\eta _k^n}\mid \xi _n=k\right]\\ & =\sum _{k=0}^\infty \P (\xi _n=k)F(z)^k =F_n(F(z)). \end{align*}

Como \(F_0\) é a identidade, a recorrência mostra por indução que \(F_n=F^{\circ n}\). Portanto, \(F_n\circ F=F^{\circ (n+1)}=F\circ F_n\).

Teorema 7.57
Suponha que
\[ \mathbf{E}[\xi _1] = \sum k p_k = \mu \]
e
\[ \operatorname {Var}(\xi _1)=\sum _{k=0}^\infty (k-\mu )^2p_k=\sigma ^2\lt \infty . \]
Então
\[ \mathbf{E}[\xi _n]=\mu ^n,\qquad \operatorname {Var}(\xi _n)=\sigma ^2\mu ^{n-1} (1+\mu +\cdots +\mu ^{n-1}). \]

Demonstração

Condicionalmente a \(\xi _{n-1}=k\), a variável \(\xi _n\) é soma de \(k\) cópias independentes de \(\xi _1\). Logo sua média condicional é \(k\mu \) e sua variância condicional é \(k\sigma ^2\). Em particular,

\[ \mathbf{E}[\xi _n]=\mu \, \mathbf{E}[\xi _{n-1}], \]

e a condição inicial \(\xi _0=1\) dá \(\mathbf{E}[\xi _n]=\mu ^n\).

Usando \(\mathbf{E}[\xi _n^2\mid \xi _{n-1}=k] =k\sigma ^2+k^2\mu ^2\) e somando sobre \(k\), obtemos

\[ \mathbf{E}[\xi _n^2] =\sigma ^2\mathbf{E}[\xi _{n-1}] +\mu ^2\mathbf{E}[\xi _{n-1}^2]. \]

Portanto, escrevendo \(V_n=\operatorname {Var}(\xi _n)\),

\[ V_n=\mu ^2V_{n-1}+\sigma ^2\mu ^{n-1}, \qquad V_0=0. \]

Uma indução nessa recorrência fornece

\[ V_n=\sigma ^2\mu ^{n-1}(1+\mu +\cdots +\mu ^{n-1}). \]

Probabilidade de Extinção

Considere \(A_n=\{ \xi _n=0\} \), o evento de que a população já esteja extinta na \(n\)-ésima geração. Seja \(q\) a probabilidade de extinção eventual e

\[ A=\bigcup _{n=1}^\infty A_n =\{ \text{a extinção ocorre eventualmente}\} . \]

Como \( A_1 \subseteq A_2 \subseteq A_3 \subseteq \cdots \), sabemos que

\[ q = \P (A) = \lim _{n \to \infty } \P (A_n) = \lim _{n \to \infty } \P (\xi _n = 0). \]

Como

\[ \P (\xi _n=0)=F_n(0), \]

e \(F\) é contínua em \([0,1]\), temos

\[ F (q) = F \left(\lim _{n \to \infty } F_n (0) \right) = \lim _{n \to \infty } F (F_n (0)) = \lim _{n \to \infty } F_{n + 1} (0) = q. \]

assim

\[ F (q) = q. \]

Alternativamente, usando a lei da probabilidade total

\[ q = \sum _k \P (\xi _1 = k) \P (\text{extinção} \mid \xi _1 = k) = \sum _k p_k q ^k = F (q), \]

onde a segunda igualdade vem do fato de que, para que toda a população se extingua, cada população individual deve se extinguir.

Isso significa que para encontrar a probabilidade de extinção, precisamos encontrar um ponto fixo de \( F \).

Teorema 7.58
A probabilidade de extinção \(q\) é a menor solução em \([0,1]\) da equação \(F(s)=s\). Escreva \(\mu =\mathbf{E}[\xi _1]\).
  1. Se \(\mu \leq 1\) e \(\P (\xi _1=1)\lt 1\), então \(q=1\).

  2. Se \(\mu \gt 1\), então \(q\lt 1\).

  3. No caso degenerado \(\P (\xi _1=1)=1\), temos \(q=0\).

Demonstração

Já vimos que \(F(q)=q\). Se \(\alpha \in [0,1]\) é qualquer outro ponto fixo, então \(F_0(0)=0\leq \alpha \) e, pela monotonicidade de \(F\), \(F_{n+1}(0)=F(F_n(0))\leq F(\alpha )=\alpha \). Portanto,

\[ q=\lim _{n\to \infty }F_n(0)\leq \alpha , \]

e \(q\) é o menor ponto fixo.

A função \(G(s)=F(s)-s\) é convexa, \(G(1)=0\) e \(F'(1-)=\mu \). Se \(\mu \leq 1\), a convexidade dá, para \(s\lt 1\),

\[ \frac{F(1)-F(s)}{1-s}\leq F'(1-)=\mu \leq 1, \]

de modo que \(F(s)\geq s\). Se houvesse igualdade para algum \(s\lt 1\), a convexidade e a igualdade das inclinações forçariam \(F(t)=t\) em \([s,1]\); pela identidade de séries de potências, isso significaria \(F(t)=t\) em todo \((-1,1)\), isto é, \(\P (\xi _1=1)=1\). Fora desse caso degenerado, não há ponto fixo abaixo de \(1\), e portanto \(q=1\).

Se \(\mu \gt 1\), então \(G'(1-)\gt 0\) e, consequentemente, \(G(s)\lt 0\) para \(s\lt 1\) suficientemente próximo de \(1\). Como \(G(0)=F(0)\geq 0\), a continuidade fornece um ponto fixo em \([0,1)\); logo o menor deles satisfaz \(q\lt 1\). Finalmente, no caso degenerado \(\P (\xi _1=1)=1\), temos \(F(s)=s\) para todo \(s\); cada indivíduo tem exatamente um descendente e a população nunca se extingue, de modo que \(q=0\).

7.10 ↯Funções Geradoras de Momento

Definição 7.59

A função geradora de momentos de \(\xi \) é

\[ M_\xi (t)=\mathbf{E}[\mathrm e^{t\xi }], \]

desde que essa esperança seja finita para todo \(t\) em algum intervalo \((-h,h)\), com \(h\gt 0\).

Para variáveis discretas ou absolutamente contínuas temos que

\[ M_\xi (t)=\mathbf{E}[\mathrm e^{t\xi }]=\begin{cases} \sum _i \mathrm e^{t x_i} p(x_i) & \text{se $\xi $ é discreta},\\ \int _{\mathbb {R}} \mathrm e^{t x} f(x)\, \d x & \text{se $\xi $ é absolutamente contínua}. \end{cases} \]

Exemplo 7.60
A distribuição degenerada de probabilidade é a distribuição associada a uma variável aleatória discreta exibindo certeza do resultado. Se \(\xi \) for um variável aleatório degenerada, então \(\xi = c \) com probabilidade \(1 \). A função geradora de momento da variável aleatória degenerada é particularmente simples:
\[ \sum _{x_i = c} e ^{x_i t} = e ^{c t}. \]

Teorema 7.61
Se \(M_\xi \) é finita em \((-h,h)\), então é infinitamente diferenciável nesse intervalo e, para \(n\geq 1\) e \(|t|\lt h\),
\[ M_{\xi }^{(n)}(t)=\frac{d^n}{dt^n}\mathbb {E}\left(e^{t\xi }\right)=\mathbb {E}\left(\frac{d^n}{dt^n}e^{t\xi }\right) = \mathbb {E}\left(\xi ^ne^{t\xi }\right). \]

Demonstração

Fixe \(t\) com \(|t|\lt h\) e escolha \(\delta \gt 0\) tal que \(|t|+2\delta \lt h\). Existe \(C_{n,\delta }\) tal que \(|x|^n\leq C_{n,\delta }\mathrm e^{\delta |x|}\). Para \(s\) numa vizinhança suficientemente pequena de \(t\),

\[ |x|^n\mathrm e^{sx} \leq C_{n,\delta } \bigl(\mathrm e^{(t+2\delta )x} +\mathrm e^{(t-2\delta )x}\bigr). \]

O lado direito é integrável pela hipótese sobre \(M_\xi \). O teorema de diferenciação sob o sinal de integral, obtido da Convergência Dominada, pode então ser aplicado sucessivamente e fornece a fórmula.

Teorema 7.62
Se \(\xi \) e \(\eta \) são independentes e suas funções geradoras de momentos são finitas num intervalo comum em torno de \(0\), então
\[ M_{\xi +\eta }(t)=M_\xi (t)M_\eta (t) \]
nesse intervalo.

Demonstração
\begin{align*} M_{\xi + \eta } (t) & = \mathbb {E}\! \left[e ^{t (\xi + \eta )}\right] \\ & = \mathbb {E}\! \left[e ^{t \xi } e ^{t \eta }\right] \\ & = \mathbb {E}\! \left[e ^{t \xi }\right] \mathbb {E}\! \left[e ^{t \eta }\right] \\ & = M_\xi (t) M_\eta (t). \end{align*}

Teorema 7.63
A função geradora de momento determina de forma única a distribuição de probabilidade.

Demonstração

Suponha que duas distribuições \(\mu \) e \(\nu \) tenham a mesma função geradora num intervalo \((-h,h)\). Para \(z\in \mathbb C\) com \(|\operatorname {Re}z|\lt h\), as funções

\[ L_\mu (z)=\int _{\mathbb {R}} \mathrm e^{zx}\, \d\mu (x), \qquad L_\nu (z)=\int _{\mathbb {R}} \mathrm e^{zx}\, \d\nu (x) \]

são analíticas. A justificativa é a mesma dominação exponencial usada no teorema anterior. Como coincidem no intervalo real \((-h,h)\), o teorema da identidade para funções analíticas mostra que coincidem em toda a faixa \(|\operatorname {Re}z|\lt h\). Em particular, \(L_\mu (it)=L_\nu (it)\) para todo \(t\in \mathbb {R}\): as funções características são iguais. Pelo Teorema da Unicidade de Fourier (Teorema 12.13), \(\mu =\nu \).

Teorema 7.64 (FGM da distribuição normal)
Se \(\zeta \sim \mathcal N(\mu ,\sigma ^2)\), então
\[ M_\zeta (t)=\exp \left(\mu t+\frac{\sigma ^2t^2}{2}\right). \]

Demonstração
\begin{align*} M_\zeta (t) & = \mathbb {E}\! \left[e ^{t \zeta }\right] \\ & = \frac{1}{\sqrt{2 \pi \sigma ^2}} \int _{- \infty } ^{\infty } e ^{t x} e ^{- (x- \mu ) ^2 / (2 \sigma ^2)} \, dx \\ & = \frac{1}{\sqrt{2 \pi \sigma ^2}} \int _{- \infty } ^{\infty } \exp \left(\frac{- (x ^2 - 2 \mu x + \mu ^2 - 2 \sigma ^2 t x)}{2 \sigma ^2} \right) \, dx \end{align*}

Completando o quadrado:

\begin{align*} x ^2 - 2 \mu x + \mu ^2 -2 \sigma ^2 t x & = x ^2 - 2 (\mu + \sigma ^2 t) x + \mu ^2 \\ & = (x - (\mu + \sigma ^2 t)) ^2 - (\mu + \sigma ^2 t) ^2 + \mu ^2 \\ & = (x - (\mu + \sigma ^2 t)) ^2 - \sigma ^4 t ^2 - 2 \mu \sigma ^2 t. \end{align*}

Então voltando ao cálculo da função geradora de momento

\begin{align*} M_\zeta (t) & = \frac{1}{\sqrt{2\pi \sigma ^2}} \int _{-\infty }^{\infty } \exp \left( \frac{-\left( (x - (\mu + \sigma ^2 t))^2 - \sigma ^4 t^2 - 2 \mu \sigma ^2 t \right)}{2\sigma ^2} \right)\, dx \\ & = \frac{1}{\sqrt{2\pi \sigma ^2}} \exp \left( \frac{\sigma ^4 t^2 + 2 \mu \sigma ^2 t}{2 \sigma ^2} \right) \int _{-\infty }^{\infty } \exp \left( \frac{ -(x - (\mu + \sigma ^2 t))^2}{2\sigma ^2} \right) \, dx \\ & = \exp \left( \frac{\sigma ^4 t^2 + 2 \mu \sigma ^2 t}{2 \sigma ^2} \right) \\ & = \exp \left( \mu t + \sigma ^2 t^2/2 \right) \end{align*}

Teorema 7.65
Se \(\zeta _1 \sim \mathcal{N} (\mu _1, \sigma _1 ^2) \), e \(\zeta _2 \sim \mathcal{N} (\mu _2, \sigma _2 ^2) \) e \(\zeta _1 \) e \(\zeta _2 \) são independentes, então \(\zeta _1 + \zeta _2 \sim \mathcal{N} (\mu _1 + \mu _2, \sigma _1 ^2 + \sigma _2 ^2) \). Ou seja, a soma de variáveis aleatórias normais independentes é uma variável aleatória normal cuja média é a soma dos médias e cuja variância é a soma das variâncias.

Demonstração

Calculamos a função geradora de momento da soma usando o teorema sobre somas de variáveis aleatórias independentes.

\begin{align*} M_{\zeta _1 + \zeta _2} (t) & = M_{\zeta _1} (t) M_{\zeta _2} (t) \\ & = \exp (\mu _1 t + \sigma _1 ^2 t ^2/2) \exp (\mu _2 t + \sigma _2 ^2 t ^2/2) \\ & = \exp ((\mu _1 + \mu _2) t + (\sigma _1 ^2 + \sigma _2 ^2) t ^2/2) \end{align*}

Essa é a função geradora de momentos de \(\mathcal N(\mu _1+\mu _2,\sigma _1^2+\sigma _2^2)\); pela unicidade, as distribuições coincidem.

7.11 ↯Entropia

Informação

Gostaríamos de desenvolver uma medida da informação que obtemos de observar a ocorrência de um evento de probabilidade \( p \). Nossa primeira redução será ignorar quaisquer características específicas do evento e apenas observar se ou não aconteceu. Assim, pensamos no evento como a observação de um símbolo cuja probabilidade de ocorrência é \( p \).

A abordagem que vamos adotar é axiomática: Queremos que a medida de informação \( I (p) \) tenha as seguintes propriedades

Definição 7.66 (Informação)

Uma medida de informação é uma função \(I:(0,1]\to [0,\infty )\) com as seguintes propriedades:

  1. A informação é uma quantidade não negativa: \( I (p) \ge 0 \).

  2. Se um evento tiver probabilidade 1, não obtemos informações da ocorrência do evento: \( I (1) = 0 \).

  3. Se ocorrerem dois eventos independentes (cuja probabilidade conjunta é o produto de suas probabilidades individuais), então a informação que obtemos ao observar os eventos é a soma das duas informações: \( I (p_1 \cdot p_2) = I (p_1) + I (p_2). \) (Esta é a propriedade fundamental)

  4. A medida de informação depende continuamente da probabilidade.

Essas propriedades determinam a forma de \(I\). De fato, defina \(J(x)=I(\mathrm e^{-x})\) para \(x\geq 0\). Então \(J\) é contínua, não negativa e

\[ J(x+y)=I(\mathrm e^{-x}\mathrm e^{-y})=J(x)+J(y). \]

A equação aditiva contínua em \([0,\infty )\) implica \(J(x)=cx\) para alguma constante \(c\geq 0\). Logo

\[ I(p)=-c\log p. \]

Se a informação não for identicamente nula, então \(c\gt 0\) e podemos escolher uma base \(b\gt 1\) de modo que

\[ I(p)=\log _b(1/p)=-\log _b p. \]

A escolha da base determina apenas a unidade de informação.

Normalmente, pensamos em termos de \( \log _2 (p) \).

Exemplo 7.67

Por exemplo, lançar uma moeda justa uma vez nos dará eventos \( H \) e \( T \) com probabilidade \( 1/2 \) e, portanto, um único lançamento de uma moeda nos dá \( - \log _2 (1/2) = 1 \) bit de informação.

Lançando uma moeda justa \( n \) vezes temos \( - \log _2 ((1/2) ^n) = \log _2 (2 ^n) = n \cdot \log _2 (2) = n \) bits de informação.

Assim, obtemos que \( n \) lançamentos de uma moeda justa nos fornece \( n \) bits de informação, e leva \( n \) dígitos binários para especificar. Que estas duas medidas são as mesmas nos assegura que fizemos uma boa escolha de definição de informação.

Entropia

Suponha agora que temos \( n \) símbolos \( \{ a_1, a_2, \ldots , a_n \} \) e que alguma fonte está nos fornecendo um fluxo desses símbolos. Suponha ainda que a fonte emite os símbolos com probabilidades \( \{ p_1, p_2, \ldots , p_n \} \), respectivamente. Por enquanto, também assumiremos que os símbolos são emitidos de forma independente

Qual é a quantidade média de informação que obtemos de cada símbolo que vemos no fluxo?

O que realmente queremos aqui é uma média ponderada. Se observarmos o símbolo \( a_i \), nós obteremos \( \log (1 / p_i) \) informação dessa observação particular. A longo prazo, digamos \( N \) de observações, veremos aproximadamente \( N \cdot p_i \) ocorrências do símbolo \( a_i \). Assim, após \( N \) observações obteremos a informação total \( I \) de

\[ I = \sum _{i = 1} ^{n} (N \cdot p_i) \cdot \log (1 / p_i). \]

Mas, então, a média de informações que obtemos por símbolo observado será

\begin{align*} I / N & = (1 / N) \sum _{i = 1} ^{n} (N \cdot p_i) \cdot \log (1 / p_i) \\ & = \sum _{i = 1} ^{n} p_i \cdot \log (1 / p_i) \end{align*}

Adotamos a convenção de que \( 0 \cdot \log (1 / 0) \) vale \(0\), correspondente ao limite da expressão quando a probabilidade tende a zero.

Isso nos leva a seguinte definição.

Definição 7.68

Seja uma distribuição de probabilidade \( P = \{ p_1, p_2, \ldots , p_n \} \). Definimos entropia da distribuição \( P \) por:

\[ H (P) = \sum _{i = 1} ^{n} p_i \cdot \log (1 / p_i). \]

Para uma variável discreta \(X\) com \(\P (X=a_i)=p_i\), escreva \(p(a_i)=p_i\). Então essa definição pode ser escrita como

\[ H(X)=\mathbf{E}\! \left[\log \frac1{p(X)}\right]. \]

Há uma noção análoga para uma distribuição absolutamente contínua com densidade \(f\), chamada entropia diferencial:

\[ h(f)=\int _{\mathbb {R}} f(x)\log \frac1{f(x)}\, \d x, \]

quando a integral está bem definida. Apesar da semelhança formal, a entropia diferencial pode ser negativa e muda sob transformações de escala; por isso não deve ser confundida com a entropia discreta.

Em outras palavras, a entropia de uma distribuição de probabilidade é o valor esperado da informação da distribuição.

Teorema 7.69 (Desigualdade de Gibbs)

Considere as distribuições de probabilidade, \( P = \{ p_1, p_2, \ldots , p_n \} \) e \( Q = \{ q_1, q_2, \ldots , q_n \} \), onde \( p_i, q_i \ge 0 \) e \( \sum _i p_i = \sum _i q_i = 1 \). Então

\[ -\sum p_i \log q_i \geq -\sum p_i \log p_i \]

com as convenções \(0\log 0=0\) e \(-p_i\log q_i=+\infty \) se \(p_i\gt 0=q_i\). A igualdade ocorre se, e somente se, \(p_i=q_i\) para todo \(i\).

Demonstração

Se existe \(i\) com \(p_i\gt 0=q_i\), o lado esquerdo é infinito e a desigualdade é imediata. Caso contrário, omitimos os índices com \(p_i=0\) e usamos \(\log x\leq x-1\):

\begin{align*} \sum _{i:p_i\gt 0}p_i\log \left(\frac{q_i}{p_i}\right) & \leq \sum _{i:p_i\gt 0}p_i\left(\frac{q_i}{p_i}-1\right)\\ & =\sum _{i:p_i\gt 0}q_i-1\leq 0. \end{align*}

Isso equivale à desigualdade anunciada. A igualdade em \(\log x\leq x-1\) ocorre apenas quando \(x=1\); portanto, ela exige \(q_i=p_i\) para todo índice com \(p_i\gt 0\). Como ambas as famílias somam \(1\), também não pode haver massa de \(Q\) fora desse suporte, e \(p_i=q_i\) para todo \(i\).

A desigualdade de Gibbs permite identificar a distribuição de maior entropia entre \(n\) resultados possíveis. Para uma distribuição \( P = \{ p_1, p_2, \ldots , p_n \} \), temos

\begin{align*} H (P) - \log (n) & = \sum _{i = 1} ^n p_i \log (1 / p_i) - \log (n) \\ & = \sum _{i = 1} ^n p_i \log (1 / p_i) - \log (n) \sum _{i = 1} ^n p_i \\ & = \sum _{i = 1} ^n p_i \log (1 / p_i) - \sum _{i = 1} ^n p_i \log (n) \\ & = \sum _{i = 1} ^n p_i (\log (1 / p_i) - \log (n)) \\ & = \sum _{i = 1} ^n p_i (\log (1 / p_i) + \log (1 / n)) \\ & = \sum _{i = 1} ^n p_i \log \left(\frac{1 / n}{p_i} \right) \\ & \le 0, \end{align*}

com igualdade somente quando \( p_i = \frac{1}{n} \) para todos \( i \). A distribuição uniforme maximiza, portanto, a informação média por observação: sem resultados favorecidos, a surpresa fica mais bem distribuída.

Exercício 7.1

Seja \(X\) uma variável aleatória discreta com valores distintos \(x_1,x_2,\ldots \). Suponha que

\[ \sum _{k=1}^{\infty }|x_k|\P (X=x_k)\lt \infty . \]

Prove, a partir da definição da integral de Lebesgue, que

\begin{equation} \mathbf{E}[X]=\sum _{k=1}^{\infty }x_k\P (X=x_k). \label{simple_expectation} \tag{7.19} \end{equation}

Ver solução
Escreva \(X^+=\sum _kx_k^+\mathbb {1}_{\{ X=x_k\} }\) e \(X^-=\sum _kx_k^-\mathbb {1}_{\{ X=x_k\} }\). Por Convergência Monótona, \(\mathbf{E}[X^\pm ]=\sum _kx_k^\pm \P (X=x_k)\). A hipótese torna ambas as somas finitas; subtraindo-as resulta a fórmula pedida.
Exercício 7.2

Construa variáveis aleatórias \(X,Y:[0,1]\to \mathbb {R}\), no espaço com medida de Lebesgue, tais que

\[ \P (X\gt Y)\gt \frac12, \qquad \mathbf{E}[X]\lt \mathbf{E}[Y]. \]

Calcule explicitamente as duas probabilidades e as duas esperanças.

Ver solução
Em \([0,1]\), ponha \((X,Y)=(1,0)\) em \([0,3/4]\) e \((X,Y)=(0,4)\) em \((3/4,1]\). Então \(\P (X\gt Y)=3/4\), enquanto \(\mathbf{E}[X]=3/4\lt 1=\mathbf{E}[Y]\).
Exercício 7.3

Prove que, para toda função boreliana \(g:\mathbb {R}\to \mathbb {R}\),

\[ \xi \overset {\mathrm d}=\eta \quad \Longrightarrow \quad g(\xi )\overset {\mathrm d}=g(\eta ). \]

Compare com os casos concretos \(g(x)=x^+\) e \(g(x)=x^-\) estudados no Capítulo 6.

Ver solução
Para todo boreliano \(B\),
\[ \P (g(\xi )\in B)=\P (\xi \in g^{-1}(B)) =\P (\eta \in g^{-1}(B))=\P (g(\eta )\in B), \]
pois \(g^{-1}(B)\) é boreliano. Isso prova a afirmação para qualquer transformação boreliana e contém, em particular, os exemplos do Capítulo 6.
Exercício 7.4

Seja \(X_1,X_2,\ldots \) uma sequência de variáveis aleatórias mutuamente independentes. Prove que as \(\sigma \)-álgebras

\[ \sigma (X_1,X_3,X_5,\ldots ) \quad \text{e}\quad \sigma (X_2,X_4,X_6,\ldots ) \]

são independentes.

Ver solução
Eventos que dependem de finitas coordenadas ímpares são independentes de eventos que dependem de finitas coordenadas pares. Essas duas famílias de cilindros são \(\pi \)-sistemas e geram as \(\sigma \)-álgebras exibidas. Duas aplicações do Teorema \(\pi \)–\(\lambda \) estendem a identidade de produto às \(\sigma \)-álgebras geradas.
Exercício 7.5

Sejam \(X_1,X_2,\ldots \) variáveis aleatórias i.i.d., com média \(\mu \) e variância \(\sigma ^2\lt \infty \). Seja \(N\) uma variável aleatória com valores em \(\mathbb {N}_0\), independente da sequência, com

\[ \mathbf{E}[N]=m, \qquad \operatorname {Var}(N)=v\lt \infty . \]

Defina

\[ S=\sum _{i=1}^{N}X_i =\sum _{i=1}^{\infty }X_i\mathbb {1}_{\{ N\geq i\} }, \]

com a convenção de que a soma vazia vale zero. Calcule \(\mathbf{E}[S]\) e \(\operatorname {Var}(S)\).

Ver solução
Decomponha pela partição \(\{ N=n\} \), lembrando que \(N\) é independente da sequência. Para cada \(n\) fixo, \(\mathbf{E}[X_1+\cdots +X_n]=n\mu \) e \(\mathbf{E}[(X_1+\cdots +X_n)^2]=n\sigma ^2+n^2\mu ^2\). Somando,
\[ \mathbf{E}[S]=\sum _{n\geq 0}\P (N=n)\, n\mu =m\mu , \qquad \mathbf{E}[S^2]=\sum _{n\geq 0}\P (N=n)\bigl(n\sigma ^2+n^2\mu ^2\bigr) =\sigma ^2\mathbf{E}[N]+\mu ^2\mathbf{E}[N^2]. \]
Portanto
\[ \operatorname {Var}(S)=\sigma ^2m+\mu ^2\bigl(\mathbf{E}[N^2]-m^2\bigr)=m\sigma ^2+v\mu ^2 . \]
Exercício 7.6

Prove a desigualdade de Cauchy–Schwarz: se \(X,Y\in L^2(\P )\), então

\[ |\mathbf{E}[XY]|\leq \sqrt{\mathbf{E}[X^2]\mathbf{E}[Y^2]}. \]

Prove também que há igualdade se, e somente se, \(X\) e \(Y\) são linearmente dependentes como elementos de \(L^2(\P )\).

Ver solução
Para todo \(t\in \mathbb {R}\), \(0\leq \mathbf{E}[(X-tY)^2]=\mathbf{E}[X^2]-2t\mathbf{E}[XY]+t^2\mathbf{E}[Y^2]\). Se \(\mathbf{E}[Y^2]\gt 0\), o discriminante não pode ser positivo, o que dá a desigualdade; o caso \(Y=0\) é imediato. Há igualdade exatamente quando o mínimo quadrático é zero, isto é, quando \(X=(\mathbf{E}[XY]/\mathbf{E}[Y^2])Y\) quase certamente. Incluindo o caso nulo, isso equivale à dependência linear em \(L^2\).
Exercício 7.7

Sejam \(X\) e \(Z\) variáveis aleatórias independentes, ambas com distribuição normal padrão. Para \(a,b\in \mathbb {R}\), não ambos nulos, defina

\[ Y=aX+bZ. \]
  1. Calcule \(\operatorname {Corr}(X,Y)\).

  2. Verifique diretamente que \(|\operatorname {Corr}(X,Y)|\leq 1\).

  3. Determine as condições necessárias e suficientes sobre \(a\) e \(b\) para que \(\operatorname {Corr}(X,Y)=1\).

  4. Faça o mesmo para \(\operatorname {Corr}(X,Y)=-1\).

Ver solução
\(\operatorname {Cov}(X,Y)=a\), \(\operatorname {Var}(X)=1\) e \(\operatorname {Var}(Y)=a^2+b^2\), logo
\[ \operatorname {Corr}(X,Y)=\frac{a}{\sqrt{a^2+b^2}}. \]
Seu módulo é no máximo um porque \(a^2\leq a^2+b^2\). A correlação é \(1\) se, e somente se, \(b=0\) e \(a\gt 0\); é \(-1\) se, e somente se, \(b=0\) e \(a\lt 0\).
Exercício 7.8 (title=Problema do Pareamento)

 Suponha que \(n\geq 2\) pessoas deixem seus chapéus no vestiário e, ao final, os chapéus sejam devolvidos segundo uma permutação uniforme. Seja \(X\) o número de pessoas que recebem o próprio chapéu. Calcule \(\mathbf{E}[X]\) e \(\operatorname {Var}(X)\).

Ver solução
Escreva \(X=\sum _{i=1}^nI_i\), onde \(I_i\) indica um ponto fixo. Então \(\mathbf{E}I_i=1/n\) e, para \(i\neq j\), \(\mathbf{E}[I_iI_j]=1/[n(n-1)]\). Assim
\[ \mathbf{E}X=1, \qquad \operatorname {Var}X=n\frac1n\left(1-\frac1n\right) +n(n-1)\left(\frac1{n(n-1)}-\frac1{n^2}\right)=1. \]
Exercício 7.9

Seja \(X\) uma variável aleatória real. Prove que

\[ \mathbf{E}|X|=\infty \quad \Longrightarrow \quad \sum _{n=0}^{\infty }\P (|X|\gt n)=\infty . \]

Mostre, de fato, as desigualdades que relacionam a série acima com \(\mathbf{E}|X|\).

Ver solução
Ponha \(Z=|X|\). Pontualmente, o número de inteiros \(n\geq 1\) com \(n\lt Z\) é \(\lceil Z\rceil -1\leq Z\) e o número de inteiros \(n\geq 0\) com \(n\lt Z\) é \(\lceil Z\rceil \geq Z\), isto é,
\[ \sum _{n\geq 1}\mathbb {1}_{\{ Z\gt n\} }\leq Z\leq \sum _{n\geq 0}\mathbb {1}_{\{ Z\gt n\} } . \]
Tomando esperanças e trocando soma com esperança pela Convergência Monótona (os termos são não negativos),
\[ \sum _{n=1}^\infty \P (Z\gt n) \leq \mathbf{E}Z \leq \sum _{n=0}^\infty \P (Z\gt n). \]
Se \(\mathbf{E}|X|=\infty \), a desigualdade da direita força a divergência da série que começa em \(n=0\).
Exercício 7.10

Seja \(X\) uma variável aleatória real. Prove que, para todo \(\varepsilon \gt 0\), existe uma variável aleatória limitada \(X_\varepsilon \) tal que

\[ \P (X\neq X_\varepsilon )\lt \varepsilon . \]

Faça a construção por truncamento e indique uma cota determinística para \(|X_\varepsilon |\).

Ver solução
Como \(\{ |X|\gt M\} \downarrow \varnothing \), escolha \(M\) com \(\P (|X|\gt M)\lt \varepsilon \) e defina \(X_\varepsilon =(-M)\vee (X\wedge M)\). Então \(|X_\varepsilon |\leq M\) e \(X_\varepsilon =X\) em \(\{ |X|\leq M\} \), de modo que \(\P (X\neq X_\varepsilon )\lt \varepsilon \).
Exercício 7.11

Coletor de cupons. Cada pacote contém, de maneira independente, uma figurinha escolhida uniformemente entre \(n\) tipos. Determine o número esperado de pacotes necessários para obter ao menos uma figurinha de cada tipo.

Ver solução
Depois de obter \(k\) tipos, a probabilidade de o pacote seguinte trazer um tipo novo é \((n-k)/n\). O tempo de espera correspondente é geométrico de média \(n/(n-k)\). Somando para \(k=0,\ldots ,n-1\),
\[ \mathbf{E}T=\sum _{k=0}^{n-1}\frac{n}{n-k} =n\sum _{j=1}^n\frac1j=nH_n. \]
Exercício 7.12

Seja \(X\) uma variável aleatória com valores em \(\mathbb {N}_0\) e segundo momento finito. Sua função geradora de probabilidades é

\[ G_X(s)=\mathbf{E}[s^X]=\sum _{i=0}^{\infty }\P (X=i)s^i, \qquad 0\leq s\leq 1. \]

Justifique as derivações em \(s=1\) pela esquerda e prove que

\[ \operatorname {Var}(X)=G_X''(1)+G_X'(1)-G_X'(1)^2. \]
Ver solução
Para \(0\lt s\lt 1\), derive termo a termo. Quando \(s\uparrow 1\), os termos são não negativos e a Convergência Monótona dá \(G_X'(1-)=\mathbf{E}X\) e \(G_X''(1-)=\mathbf{E}[X(X-1)]\); ambos são finitos pela hipótese de segundo momento. Como \(\mathbf{E}[X^2]=\mathbf{E}[X(X-1)]+\mathbf{E}X\), subtraímos \((\mathbf{E}X)^2\) e obtemos a fórmula.

Desigualdades

Exercício
Exercício 7.13

Uma moeda justa é lançada independentemente \(n\) vezes, e \(S_n\) denota o número de caras. Use a desigualdade de Chebyshev para provar que, para todo \(\varepsilon \gt 0\),

\[ \lim _{n\to \infty } \P \left(\left|\frac{S_n}{n}-\frac12\right|\lt \varepsilon \right)=1. \]
Ver solução
\(\mathbf{E}(S_n/n)=1/2\) e \(\operatorname {Var}(S_n/n)=1/(4n)\). Portanto, por Chebyshev,
\[ \P \left(\left|S_n/n-1/2\right|\geq \varepsilon \right) \leq \frac{1}{4n\varepsilon ^2}\longrightarrow 0. \]
Exercício 7.14

Dígitos binários e função geradora exponencial. Para \(\omega \in [0,1)\), seja \(d_k(\omega )\in \{ 0,1\} \) o \(k\)-ésimo dígito de sua expansão binária; nos racionais diádicos, escolha a expansão que termina em zeros. Defina

\[ z_k(\omega )=2d_k(\omega )-1, \qquad s_n(\omega )=\sum _{k=1}^{n}z_k(\omega ). \]

Com respeito à medida de Lebesgue, prove que

\begin{equation} M_n(t):=\int _0^1e^{t s_n(\omega )}\, \d\omega =\left(\frac{e^t+e^{-t}}2\right)^n, \qquad t\in \mathbb {R}. \label{ex1a} \tag{7.20} \end{equation}

Diferenciando em \(t=0\), conclua que

\[ \int _0^1s_n(\omega )\, \d\omega =0, \qquad \int _0^1s_n(\omega )^2\, \d\omega =n. \]

Dica. Divida \([0,1)\) nos intervalos diádicos \([k/2^n,(k+1)/2^n)\), \(0\leq k\lt 2^n\).

Ver solução
Nos \(2^n\) intervalos diádicos, os vetores \((d_1,\ldots ,d_n)\) percorrem \(\{ 0,1\} ^n\) com pesos \(2^{-n}\) (os extremos não importam). Assim
\[ M_n(t)=2^{-n}\sum _{z_1,\ldots ,z_n\in \{ -1,1\} } e^{t(z_1+\cdots +z_n)} =\left(\frac{e^t+e^{-t}}2\right)^n. \]
Como a soma é finita, podemos derivar: \(M_n'(0)=0\) e \(M_n''(0)=n\), que são, respectivamente, as duas integrais pedidas.
Exercício 7.15

Cota exponencial para os dígitos binários. Com a notação do exercício anterior, prove que, para todo \(\varepsilon \gt 0\),

\begin{equation} \P \left(\left|\frac{s_n}{n}\right|\geq \varepsilon \right) \leq 2e^{-n\varepsilon ^2/2}. \label{eq:exp-ineq-sn} \tag{7.21} \end{equation}

Dica. Use (7.20), o argumento exponencial de Markov e

\[ \frac{e^x+e^{-x}}2\leq e^{x^2/2}, \qquad x\in \mathbb {R}. \]
Ver solução
Para \(t\gt 0\), Markov e (7.20) dão
\[ \P (s_n\geq n\varepsilon ) \leq e^{-tn\varepsilon }M_n(t) \leq \exp \{ n(t^2/2-t\varepsilon )\} . \]
O mínimo ocorre em \(t=\varepsilon \) e vale \(e^{-n\varepsilon ^2/2}\). Aplique o mesmo argumento a \(-s_n\) e use a subaditividade.
Exercício 7.16

Demonstração probabilística do Teorema de Weierstrass. Se \(f:[0,1]\to \mathbb {R}\) é contínua, use a desigualdade de Chebyshev e a continuidade uniforme de \(f\) para provar que

\[ \sum _{k=0}^{n} f\left(\frac{k}{n}\right) \binom nk x^k(1-x)^{n-k} \longrightarrow f(x) \]

uniformemente em \(x\in [0,1]\).

Dica. Para cada \(x\), tome \(S_n\sim \operatorname {Binomial}(n,x)\) e escreva o polinômio acima como \(\mathbf{E}[f(S_n/n)]\). Separe os eventos \(\{ |S_n/n-x|\lt \delta \} \) e \(\{ |S_n/n-x|\geq \delta \} \) usando uma escolha de \(\delta \) que não dependa de \(x\).

Ver solução
Se \(S_n\sim \operatorname {Binomial}(n,x)\), o polinômio é \(B_nf(x)=\mathbf{E}[f(S_n/n)]\). Dado \(\varepsilon \gt 0\), a continuidade uniforme fornece \(\delta \gt 0\) tal que \(|u-x|\lt \delta \) implica \(|f(u)-f(x)|\lt \varepsilon \). Se \(M=\| f\| _\infty \), então, uniformemente em \(x\),
\[ |B_nf(x)-f(x)| \leq \varepsilon +2M\P (|S_n/n-x|\geq \delta ) \leq \varepsilon +\frac{M}{2n\delta ^2}, \]
pois \(\operatorname {Var}(S_n/n)=x(1-x)/n\leq 1/(4n)\). Tome \(n\to \infty \) e depois \(\varepsilon \downarrow 0\).
Exercício 7.17

Otimalidade da desigualdade de Chebyshev. Fixe \(t\geq 1\), \(\mu \in \mathbb {R}\) e \(\sigma \gt 0\). Construa uma variável aleatória \(X\) com média \(\mu \) e variância \(\sigma ^2\) tal que

\[ \P (|X-\mu |\geq t\sigma )=\frac1{t^2}. \]
Ver solução
Defina \(X=\mu +t\sigma \) e \(X=\mu -t\sigma \), cada um com probabilidade \(1/(2t^2)\), e \(X=\mu \) com probabilidade \(1-1/t^2\). Por simetria, \(\mathbf{E}X=\mu \); além disso, \(\operatorname {Var}X=t^2\sigma ^2(1/t^2)=\sigma ^2\), e o evento indicado ocorre exatamente nos dois valores extremos.
Exercício 7.18

Seja \(X\) uma variável aleatória não negativa com \(\mathbf{E}[X]\lt \infty \), e defina \(X_n=X\wedge n\).

  1. Dê um exemplo para o qual \(\mathbf{E}[X^2]=\infty \).

  2. Prove que, para todo \(p\gt 2\),

    \[ \sum _{n=1}^{\infty }n^{-p}\mathbf{E}[X_n^2]\lt \infty . \]
  3. Prove que a conclusão continua válida no caso-limite \(p=2\).

    Dica para o último item. Para cada \(x\geq 0\), estime \(\sum _{n\geq 1}n^{-2}(x\wedge n)^2\) separando os índices \(n\leq x\) e \(n\gt x\).

Ver solução
Um exemplo é \(\P (X=k)=\zeta (3)^{-1}k^{-3}\), \(k\geq 1\): o primeiro momento é finito e o segundo diverge. Para \(p\gt 2\), \((X\wedge n)^2\leq nX\), logo
\[ \sum _n n^{-p}\mathbf{E}[X_n^2] \leq \mathbf{E}X\sum _n n^{1-p}\lt \infty . \]
Para \(p=2\), troque soma e esperança pela Convergência Monótona (os termos são não negativos) e use a separação sugerida: com uma constante universal \(C\),
\[ \sum _{n\geq 1}\frac{(x\wedge n)^2}{n^2} \leq \lfloor x\rfloor +x^2\sum _{n\gt x}n^{-2} \leq C(1+x). \]
Integrando, a soma continua finita porque \(X\in L^1\).
Exercício 7.19

Sejam \(X_1,\ldots ,X_n\) variáveis aleatórias reais independentes e \(S_k=X_1+\cdots +X_k\). Prove a desigualdade de Etemadi: para todo \(t\gt 0\),

\[ \P \left(\max _{1\leq k\leq n}|S_k|\geq t\right) \leq 3\max _{1\leq k\leq n}\P (|S_k|\geq t/3). \]

Dica. Para \(r\gt 0\), considere os eventos disjuntos de primeira passagem

\[ A_j= \left\{ \max _{1\leq k\lt j}|S_k|\lt 3r,\ |S_j|\geq 3r \right\} , \qquad j=1,\ldots ,n. \]

Use a independência de \(A_j\) e \(S_n-S_j\) e trate separadamente o caso em que \(\max _k\P (|S_k|\geq r)\gt 1/3\).

Ver solução
Ponha \(p=\max _{k\leq n}\P (|S_k|\geq r)\). Se \(p\geq 1/3\), a cota é trivial. Suponha \(p\lt 1/3\). Pela desigualdade triangular,
\[ \P (|S_n-S_j|\gt 2r) \leq \P (|S_n|\gt r)+\P (|S_j|\gt r)\leq 2p. \]
Como \(A_j\) depende de \(X_1,\ldots ,X_j\) e é independente de \(S_n-S_j\),
\[ (1-2p)\sum _j\P (A_j) \leq \sum _j\P (A_j,|S_n-S_j|\leq 2r) \leq \P (|S_n|\geq r)\leq p. \]
Assim \(\P (\max _{k\leq n}|S_k|\geq 3r)=\sum _j\P (A_j)\leq 3p\). Tome \(r=t/3\).
Exercício 7.20

Dê um exemplo de variáveis aleatórias limitadas e dependentes \(X\) e \(Y\) tais que \(\operatorname {Cov}(X,Y)=0\). Calcule a covariância e mostre diretamente que as variáveis não são independentes.

Dica. Tome uma variável \(X\) centrada e procure \(Y\) que seja nula sempre que \(X\neq 0\).

Ver solução
Num espaço equiprovável de três pontos, tome \(X=-1,0,1\) e \(Y=\mathbb {1}_{\{ X=0\} }\). Então \(\mathbf{E}X=0\) e \(XY=0\) sempre, logo \(\operatorname {Cov}(X,Y)=0\). As variáveis são dependentes, pois \(\P (Y=1)=1/3\), mas \(\P (Y=1\mid X=0)=1\). Ambas são limitadas.