Valor Esperado
Uma distribuição contém toda a informação probabilística sobre uma variável, mas frequentemente precisamos resumi-la. A esperança realiza a redução mais elementar: associa à variável uma média ponderada de seus valores ou, geometricamente, o centro de massa de sua distribuição. Como todo resumo, ela é útil justamente porque esquece quase tudo.
Considere, para motivar a definição, uma variável simples
com \(A_1,A_2,\ldots ,A_n\) disjuntos. Então a média ponderada \(m(X)\) dos valores que \(X\) assume é
Isso conduz à definição geral.
Usaremos aqui a mesma nomenclatura das integrais de Lebesgue. Diremos que \(X\) é integrável se \(\mathbf{E}|X|\lt \infty \), o que equivale a \(\mathbf{E}[X^+]\lt \infty \) e \(\mathbf{E}[X^-]\lt \infty \). Mais geralmente, a esperança de \(X\) está bem definida, possivelmente como \(+\infty \) ou \(-\infty \), se ao menos uma das quantidades \(\mathbf{E}[X^+]\) e \(\mathbf{E}[X^-]\) for finita; nesse caso, dizemos que \(X\) é quase integrável.
A definição recupera imediatamente o cálculo para variáveis simples.
Seja \(X\) uma variável aleatória dada por
com \(A_1,A_2,\ldots ,A_n\) disjuntos. Então
Se, além disso, os valores \(a_1,\ldots ,a_n\in \mathbb {R}\) são distintos, então, para cada \(k=1,\ldots ,n\), \(A_k=X^{-1}(\{ a_k\} )=\{ X=a_k\} \), e
O caso particular das indicadoras estabelece uma ligação direta entre esperança e probabilidade.
Definida pela integral de Lebesgue, a esperança herda as propriedades seguintes.
(Linearidade) \(\mathbf{E}[a\xi + b\eta ] = a\mathbf{E}[ \xi ] + b\mathbf{E}[ \eta ]\) para quaisquer números reais \(a, b\).
Se \(X\equiv b\in \mathbb {R}\), constante, então \(\mathbf{E}[X] = b\) (escrevemos também que \(\mathbf{E}[b]=b\)).
Se \(\xi \geq 0\) então \(\mathbf{E}[ \xi ] \geq 0\).
(Monotonicidade) Se \(\xi \geq \eta \) então \(\mathbf{E}[ \xi ] \geq \mathbf{E}[ \eta ]\).
(Desigualdade triangular) \(\left\lvert \mathbf{E}[\xi ]\right\rvert \leq \mathbf{E}[\left\lvert \xi \right\rvert ]\)
Se \(0\leq \xi _n\uparrow \xi \), então \(\mathbf{E}[\xi ]=\lim _{n\to \infty }\mathbf{E}[\xi _n]\), admitindo-se o valor \(+\infty \).
Como \(\mathbf{E}[\xi ]=\int _\Omega \xi \, \d\P \), a linearidade para funções integráveis, a positividade, a monotonicidade, a desigualdade triangular e a convergência monótona são exatamente as propriedades da integral de Lebesgue demonstradas no capítulo anterior. Para explicitar o único ponto específico de uma probabilidade, se \(X\equiv b\), então \(X=b\mathbb {1}_\Omega \) e
Suponha que uma esfera seja colorida de modo que \(90\% \) de sua área seja vermelha e \(10\% \) seja azul, com a região vermelha mensurável. Fixe um cubo inscrito e escolha ao acaso uma rotação do cubo segundo a probabilidade uniforme — a medida de Haar normalizada — em \(SO(3)\). Para cada vértice \(v_i\) do cubo, sua imagem pela rotação é então uniformemente distribuída na esfera.
Seja \(\xi _i\) a indicadora de que o \(i\)-ésimo vértice cai na região vermelha. Então \(\mathbf{E}[\xi _i]=0{,}9\) para todo \(i\) e \(N=\xi _1+\cdots +\xi _8\) é o número de vértices vermelhos. Por linearidade da esperança,
Se toda rotação tivesse no máximo sete vértices vermelhos, teríamos \(N\leq 7\) quase certamente e, portanto, \(\mathbf{E}[N]\leq 7\), uma contradição. Logo existe uma rotação para a qual os oito vértices estão em pontos vermelhos da esfera.
Esse é um exemplo da utilização de técnicas probabilísticas para provar fatos determinísticos. Observe que não exigimos que as variáveis \(\xi _i\) sejam independentes.
Temos também a seguinte caracterização do operador esperança.
continuidade na norma de \(\L ^1\): se \(\| \xi _n-\xi \| _1\to 0\), então \(T(\xi _n)\to T(\xi )\);
relação com a probabilidade: \(T(\mathbb {1}_A)=\P (A)\) para todo \(A\in \mathcal{F}\).
O operador \(\xi \mapsto \int _\Omega \xi \, \d\P \) é linear, \(|\mathbf{E}[\xi ]|\leq \| \xi \| _1\) e \(\mathbf{E}[\mathbb {1}_A]=\P (A)\); portanto, possui as propriedades anunciadas.
Reciprocamente, seja \(T\) um operador com essas propriedades. Se \(s=\sum _{j=1}^m a_j\mathbb {1}_{A_j}\) é simples, a linearidade e a condição sobre indicadoras dão
As funções simples são densas em \(\L ^1\): para \(\xi \in \L ^1\), escolha simples \(s_n\) com \(\| s_n-\xi \| _1\to 0\). Pela continuidade de \(T\) e pela estimativa \(|\mathbf{E}[s_n-\xi ]|\leq \| s_n-\xi \| _1\),
Isso prova a unicidade.
Fixaremos agora a terminologia para propriedades que valem fora de um evento de probabilidade zero.
Dado um espaço de probabilidade \((\Omega , \mathcal{F}, \P )\), diremos que uma afirmativa \(\mathbb A\) ocorre quase certamente se
Denotaremos isso por “\(\mathbb A\) ocorre q.c.”.
Em particular, dadas duas variáveis aleatórias \(X,Y\) definidas em \(\Omega \), temos que \( X=Y\ q.c., \) se \(\P (X=Y)=1\). Ou ainda que \(X\leq Y\ q.c\) se \(\P (X\leq Y)=1\).
Integrais de Lebesgue ignoram eventos de medida nula, e isso é mostrado no seguinte resultado.
Se \(X=0\ q.c\) então \(\mathbf{E}[X]=0\);
Se \(X=Y\ q.c\) e \(X\) é integrável ou \(\mathbf{E}[X]=\pm \infty \), então \(\mathbf{E}[Y]=\mathbf{E}[X]\);
Se \(X\leq Y\ q.c.\) e \(Y\) é integrável, então \(\mathbf{E}[X]\leq \mathbf{E}[Y]\) (\(\mathbf{E}[X]\) pode ser \(-\infty \)) .
Se \(X\geq 0\) e \(\mathbf{E}[X]=0\), então \(X=0\ q.c.\).
Como \(X^+=X^-=0\) quase certamente, ambas as integrais são nulas e, portanto, \(\mathbf{E}[X]=0\).
Da igualdade quase certa seguem \(X^+=Y^+\) e \(X^-=Y^-\) quase certamente. As integrais das partes positiva e negativa coincidem; logo a existência e o valor da esperança de \(Y\) são os mesmos que os de \(X\).
Defina
\[ X^*=X\mathbb {1}_{\{ X\leq Y\} }+Y\mathbb {1}_{\{ X\gt Y\} }. \]Então \(X^*=X\) quase certamente e \(X^*\leq Y\) em todo ponto. Além disso, \((X^*)^+\leq Y^+\), de modo que a parte positiva de \(X^*\) é integrável. Por monotonicidade, \(\mathbf{E}[X]=\mathbf{E}[X^*]\leq \mathbf{E}[Y]\), admitindo-se o valor \(-\infty \).
Dado \(\epsilon \gt 0\), defina \(Y_\epsilon =\epsilon \mathbb {1}_{\{ X\gt \epsilon \} }\) e observe que \(Y_\epsilon \leq X\) para todo \(\epsilon \gt 0\). Segue que
\[ \epsilon \P (X\gt \epsilon )=\mathbf{E}[Y_\epsilon ]\leq \mathbf{E}[X]=0, \]e portanto \(\P (X\gt \epsilon )=0\) para todo \(\epsilon \gt 0\).
Como \(\{ X\gt 0\} =\bigcup _{n\geq 1}\{ X\gt 1/n\} \), concluímos que \(\P (X\gt 0)=0\). Como \(X\geq 0\), segue que \(X=0\) quase certamente.
7.1 Calculando a Esperança
A esperança depende apenas da distribuição da variável. Demonstraremos esse fato seguindo novamente a construção em três passos: funções simples, funções não negativas e funções integráveis.
Tome agora uma variável aleatória \(X\) qualquer, e \(\phi :\mathbb {R}\to \mathbb {R}\) uma função mensurável e simples e não-negativa, dada por
\(A_1,\ldots ,A_n\in \mathcal{B}(\mathbb {R})\) disjuntos.
Temos assim que
que é uma variável aleatória simples.
Segue que
Dada agora uma função \(\varphi :\mathbb {R}\to \mathbb {R}\) mensurável e não negativa, tome uma sequencia não-decrescente de funções simples e mensuráveis \(\phi _n:\mathbb {R}\to \mathbb {R}, n\geq 1\), não-negativas e tais que \( \phi _n(x)\uparrow \varphi (x), \) para todo \(x\in \mathbb {R}\).
Pelos mesmos argumentos anteriores, \(\phi _n(X), n\geq 1\) é uma sequência de variáveis aleatórias simples e não-negativas, tais que \(\phi _n(X)\uparrow \varphi (X)\).
Segue do Teorema da Convergência Monótona, que
Dada agora uma função \(\varphi :\mathbb {R}\to \mathbb {R}\) mensurável, podemos escrever \(\varphi =\varphi ^+-\varphi ^-\), e aplicando o que descobrimos até agora, vemos que
Com isso mostramos que
Dada uma variável aleatória \(X\) definida em um espaço de probabilidade \((\Omega , \mathcal{F}, \P )\) com distribuição \(\P _X\), e uma função mensurável \(\varphi :\mathbb {R}\to \mathbb {R}\), então
Ou seja, se qualquer um dos lados da equação acima estiver bem definido, o outro também está e a igualdade vale.
Em particular
Para uma função simples não negativa \(\varphi =\sum _{k=1}^m a_k\mathbb {1}_{A_k}\), a definição da distribuição induzida dá
Se \(\varphi \geq 0\) é mensurável, escolha funções simples \(\varphi _n\uparrow \varphi \) e aplique a Convergência Monótona aos dois lados. Para uma função mensurável arbitrária, aplique o caso não negativo a \(\varphi ^+\) e \(\varphi ^-\). Isso também mostra que um lado está bem definido exatamente quando o outro está. A escolha \(\varphi (x)=x\) fornece a última fórmula.
Uma consequência direta do resultado anterior é a seguinte.
As distribuições induzidas são iguais. Aplicando o Teorema 7.9 às funções \(x\mapsto |x|\) e \(x\mapsto x\), obtemos, respectivamente, a integrabilidade de \(\eta \) e a igualdade das esperanças.
A dependência apenas da distribuição explica as fórmulas usuais para variáveis discretas e absolutamente contínuas. Vamos deduzi-las.
7.1.1 Variáveis Aleatórias Discretas
Uma variável aleatória discreta concentra sua distribuição num conjunto enumerável de valores. Assim, existe um conjunto \(S=\{ x_1,x_2,\ldots \} \) tal que \(\P (X\in S)=1\).
Com isso, temos que a distribuição \(\P _X\) é totalmente definida pelos valores de \(\P (\{ x_k\} )=\P (X=x_k)\).
De fato, para qualquer \(A\in \mathcal{B}(\mathbb {R})\)
Perceba também que
onde \(A_k=\{ X=x_k\} \in \mathcal{F}\).
Comecemos pelo caso \(X\geq 0\), com \(x_k\geq 0\) para todo \(k\geq 1\). As variáveis
são simples e portanto
Além disso, temos que \(X_n\uparrow X\) e o Teorema da Convergência Monótona nos diz que
O caso com sinal será obtido separando as partes positiva e negativa.
Se \(X\geq 0\), as variáveis simples \(X_n=\sum _{k=1}^n x_k\mathbb {1}_{\{ X=x_k\} }\) crescem para \(X\) quase certamente; a Convergência Monótona fornece a fórmula. Se \(X\) é integrável, aplique esse caso a \(X^+\) e \(X^-\) e subtraia. Além disso, aplicá-lo a \(|X|\) mostra que
7.1.2 Variáveis Absolutamente Contínuas
Vamos recordar que uma variável aleatória é absolutamente contínua se existe uma função mensurável \(f:\mathbb {R}\to \mathbb {R}^+\), conhecida como função densidade de probabilidade de \(X\) (ou simplesmente densidade de \(X\)) tal que
onde a integral à direita é a integral de Lebesgue (feita em relação à medida de Lebesgue da reta).
Para calcular \(\mathbf{E}[\varphi (X)]\), precisamos primeiro avaliar
Para isso, tome primeiro uma função simples
e note que
Tomando uma sequência de funções simples \(\phi _n, n\geq 1\) não negativas, com \(\phi _n\uparrow \varphi \geq 0\), concluímos pelo Teorema da Convergência Monótona que
E separando uma função mensurável \(\varphi \) em parte positiva e negativa, concluímos o seguinte resultado.
Pelo Teorema 7.9, \(\mathbf{E}[\varphi (X)]=\int _{\mathbb {R}}\varphi \, \d\P _X\). Para funções simples não negativas, a identidade \(\int \varphi \, \d\P _X=\int \varphi f\, \d\lambda \) segue diretamente de \(\P _X(A)=\int _Af\, \d\lambda \). A aproximação monótona estende a identidade a toda \(\varphi \geq 0\) mensurável; a decomposição em partes positiva e negativa conclui o caso geral.
7.2 Funções de Vetores Aleatórios
O mesmo princípio vale em dimensão maior. Dado um vetor aleatório \(X=(X_1,\ldots ,X_n)\) e uma função mensurável \(\varphi :\mathbb {R}^n\to \mathbb {R}\), queremos calcular \(\mathbf{E}[\varphi (X)]\) usando apenas a distribuição conjunta de \(X\).
Vamos olhar primeiro para a distribuição \(\P _X\) do vetor aleatório \(X\). Lembre-se que, de modo análogo a variáveis aleatórias, \(\P _X\) é uma medida de probabilidade em \((\mathbb {R}^n,\mathcal{B}(\mathbb {R}^n))\) dada por
para \(A\in \mathcal{B}(\mathbb {R}^n)\).
De posse da distribuição \(\P _X\) podemos recuperar as distribuições marginais das variáveis \(X_k\), fazendo
A relação entre \(\P _X\) e as marginais \(\P _{X_k}\) pode ser complicada, e em geral precisamos de informações adicionais sobre o vetor para descrevê-la com mais precisão. Uma situação em que essa relação assume uma forma simples é aquela em que \(X_1,\ldots ,X_n\) são independentes. Deixaremos os detalhes para a lista de exercícios.
O argumento do Teorema 7.9 fornece sua versão vetorial.
O argumento é o mesmo do Teorema 7.9, agora para a medida imagem \(\P _X\) em \(\mathbb {R}^n\). Para \(\varphi =\sum _{j=1}^m a_j\mathbb {1}_{A_j}\) simples e não negativa,
A Convergência Monótona trata funções não negativas, e a decomposição em partes positiva e negativa trata o caso geral.
No caso em que as variáveis \(X_1,\ldots ,X_n\) são discretas, assumindo valores em conjuntos enumeráveis \(S_1,\ldots ,S_n\), o vetor também é discreto e assume valores em \(S_1\times \cdots \times S_n\). A variável \(\varphi (X_1,\ldots ,X_n)\) assume o valor \(\varphi (x_1,\ldots ,x_n)\) no evento \(\{ X_1=x_1,\ldots ,X_n=x_n\} \).
Vale então o seguinte resultado.
Aplique o Teorema 7.13 à distribuição discreta do vetor \(X\). Sua massa no ponto \((x_1,\ldots ,x_n)\) é precisamente \(\P (X_1=x_1,\ldots ,X_n=x_n)\). A fórmula segue diretamente para funções não negativas por aproximação monótona das somas finitas e, depois, para funções com sinal pela decomposição positiva e negativa.
O caso onde \(X_1,\ldots ,X_n\) são absolutamente contínuas é um pouco mais complicado, pois não garante que o vetor \(X\) seja absolutamente contínuo. Ou seja, a existência de densidades \(f_1,\ldots ,f_n:\mathbb {R}\to \mathbb {R}\) não garante a existência de uma função densidade \(f:\mathbb {R}^n\to \mathbb {R}^+\) tal que
para \(A\in \mathcal{B}(\mathbb {R}^n)\), onde \(\lambda _n\) é a medida de Lebesgue em \(\mathbb {R}^n\).
Não vamos entrar em maiores detalhes sobre esse tipo de vetor, mas podemos mostrar que
Como \(\P _X(A)=\int _A f\, \d\lambda _n\), a mesma prova do caso unidimensional dá
primeiro para funções simples não negativas, depois para funções mensuráveis não negativas e, por fim, para funções com sinal. Combine essa identidade com o Teorema 7.13.
7.3 Variância, Covariância e Momentos de uma Variável Aleatória
A esperança localiza o centro de uma distribuição, mas não informa como a massa se espalha ao redor dele. O exemplo seguinte torna visível essa perda.
Tome \(X\) e \(Y\) variáveis aleatórias discretas tais que
e
Calculando, encontramos que \(\mathbf{E}[X]=\mathbf{E}[Y]=0\), mas a variável aleatória \(Y\) assume valores muito mais dispersos em torno da média.
A variância mede essa dispersão por meio da distância quadrática à média. Os momentos e a covariância ampliam a mesma ideia.
Dado \(n\in \mathbb {N}\) e \(\xi \in \L ^n(\P )\),
\[ m_k:=\mathbf{E}[\xi ^k], \qquad M_k:=\mathbf{E}[|\xi |^k], \qquad k=1,\dots ,n, \]são denominados, respectivamente, o \(k\)-ésimo momento e o \(k\)-ésimo momento absoluto de \(\xi \).
Se \(\xi \in \L ^2(\P )\), então
\[ \operatorname {Var}[\xi ]:=\mathbf{E}[(\xi -\mathbf{E}[\xi ])^2] \]é a variância de \(\xi \). O número \(\sigma :=\sqrt{\operatorname {Var}[\xi ]}\) é denominado desvio padrão de \(\xi \).
Se \(\xi ,\eta \in \L ^2(\P )\), definimos a covariância por
\[ \operatorname {Cov}[\xi ,\eta ]:=\mathbf{E}\left[(\xi -\mathbf{E}[\xi ])(\eta -\mathbf{E}[\eta ])\right] \]As variáveis \(\xi \) e \(\eta \) são ditas não correlacionadas se \(\operatorname {Cov}[\xi ,\eta ]=0\).
Se \(\xi \) e \(\eta \) não são quase certamente constantes, seu coeficiente de correlação é
\[ \rho (\xi ,\eta )= \frac{\operatorname {Cov}(\xi ,\eta )}{\sigma _\xi \sigma _\eta }. \]
A expressão da variância deve ser lida como uma distância quadrática média à esperança. Para cada resultado \(\omega \), o desvio \(\xi (\omega )-\mathbf{E}[\xi ]\) indica quanto o valor observado ficou acima ou abaixo do centro. Se simplesmente fizéssemos a média desses desvios, os positivos e negativos se cancelariam. Ao elevá-los ao quadrado, todos passam a contribuir positivamente e os afastamentos maiores recebem peso maior.
Assim, variância pequena significa que a distribuição está fortemente concentrada em torno da média, enquanto variância grande indica maior dispersão. Como o quadrado também eleva ao quadrado a unidade de medida, o desvio padrão \(\sqrt{\operatorname {Var}[\xi ]}\) costuma ser mais fácil de interpretar: ele mede a dispersão na mesma unidade de \(\xi \).
\(\operatorname {Var}[\xi ]\geq 0\)
\(\operatorname {Var}[\xi ] = \mathbf{E}[\xi ^2] - \mathbf{E}[\xi ]^2\).
\(\operatorname {Var}[\xi ] = 0 \Longleftrightarrow \xi = \mathbf{E}[\xi ]\) quase certamente.
A aplicação \(f : \mathbb {R}\to \mathbb {R}\), \(x \longmapsto \mathbf{E}[(\xi - x)^2 ]\) tem um mínimo em \(\mathbf{E}[\xi ]\) com \(f(\mathbf{E}[\xi ]) = \operatorname {Var}[\xi ]\).
\(\operatorname {Var}[a\xi +b]=a^2\operatorname {Var}[\xi ]\) para \(a,b\in \mathbb {R}\).
\(\operatorname {Cov}[\xi ,\eta ]=\mathbf{E}[\xi \eta ]-\mathbf{E}[\xi ]\mathbf{E}[\eta ]\).
\(\operatorname {Var}[\xi +\eta ]=\operatorname {Var}[\xi ]+\operatorname {Var}[\eta ]+2\operatorname {Cov}[\xi ,\eta ]\).
\(\operatorname {Cov}[\xi ,\xi ]=\operatorname {Var}[\xi ]\).
Segue da definição, pois \((\xi -\mathbf{E}[\xi ])^2\geq 0\).
Segue da linearidade da esperança. De fato
\begin{align*} \operatorname {Var}[\xi ]& =\mathbf{E}[(\xi -\mathbf{E}[\xi ])^2]\\ & =\mathbf{E}[\xi ^2]-2\mathbf{E}[\xi ]^2+\mathbf{E}[\xi ]^2\\ & =\mathbf{E}[\xi ^2]-\mathbf{E}[\xi ]^2. \end{align*}Se \(\operatorname {Var}[\xi ]=0\), a variável não negativa \((\xi -\mathbf{E}[\xi ])^2\) tem esperança nula; logo é nula quase certamente. A recíproca é imediata.
A identidade
\[ \mathbf{E}[(\xi -x)^2] =\operatorname {Var}[\xi ]+(x-\mathbf{E}[\xi ])^2 \]mostra que o mínimo é atingido em \(x=\mathbf{E}[\xi ]\) e vale \(\operatorname {Var}[\xi ]\).
Como \(a\xi +b-\mathbf{E}[a\xi +b]=a(\xi -\mathbf{E}[\xi ])\), temos \(\operatorname {Var}[a\xi +b]=a^2\operatorname {Var}[\xi ]\).
Segue da linearidade da esperança que
\begin{align*} \operatorname {Cov}[\xi ,\eta ]& =\mathbf{E}[(\xi -\mathbf{E}[\xi ])(\eta -\mathbf{E}[\eta ])]\\ & =\mathbf{E}[\xi \eta ]-\mathbf{E}[\xi ]\mathbf{E}[\eta ]. \end{align*}Segue da linearidade da esperança e dos itens anteriores que
\begin{align*} \operatorname {Var}(\xi +\eta ) & =\mathbf{E}[\xi ^2]+\mathbf{E}[\eta ^2]+2\mathbf{E}[\xi \eta ] -\mathbf{E}[\xi ]^2-\mathbf{E}[\eta ]^2-2\mathbf{E}[\xi ]\mathbf{E}[\eta ]\\ & =\operatorname {Var}[\xi ]+\operatorname {Var}[\eta ]+2\operatorname {Cov}[\xi ,\eta ]. \end{align*}Segue direto da definição.
O item 4 nos fornece uma descrição geométrica: imagine que queremos minimizar o erro quadrático médio de uma estimativa \(x\) da variável \(X\). Nesse caso a estimativa que minimiza esse erro é a esperança e a variância é o menor valor do erro quadrático médio.
Seja \(X\in \L ^2(\P )\) com \(\operatorname {Var}[X]\gt 0\) e seja \(Y=aX+b\), com \(a\neq 0\). Temos então \(\mathbf{E}[Y]=a\mathbf{E}[X]+b\) e \(\operatorname {Var}[Y]=a^2\operatorname {Var}[X]\).
Da mesma forma temos que \(\operatorname {Cov}[X,Y]=\mathbf{E}[(X-\mathbf{E}[X])(aX+b-(a\mathbf{E}[X]+b))]=a\operatorname {Var}[X].\)
Segue que
A covariância a correlação servem para medir o “nível de correlação” entre as variáveis. Nesse exemplo vimos que se \(Y=aX+b\) então \(\operatorname {Cov}[X,Y]\) tem o mesmo sinal de \(a\) e \(\rho (X,Y)\) é \(1\) ou \(-1\), de acordo com o sinal de \(a\).
Assuma primeiro que \(\xi \) e \(\eta \) sejam simples, com valores \(x_1,\ldots ,x_n\) e \(y_1,\ldots ,y_m\). Então
Se \(\xi ,\eta \geq 0\), escolha funções simples \(\xi _n\uparrow \xi \) e \(\eta _n\uparrow \eta \), obtidas por transformações mensuráveis separadas. A independência é preservada e \(\xi _n\eta _n\uparrow \xi \eta \). Pela Convergência Monótona,
Aplicando esse caso a \(|\xi |\) e \(|\eta |\), obtemos \(\mathbf{E}|\xi \eta |=\mathbf{E}|\xi |\, \mathbf{E}|\eta |\lt \infty \). Por fim, decomponha \(\xi \) e \(\eta \) em partes positiva e negativa e use a linearidade. Se ambas pertencem a \(\L ^2\), a fórmula da covariância dá \(\operatorname {Cov}[\xi ,\eta ]=0\).
Vimos assim que variáveis aleatórias independentes têm covariância nula, quando possuem segundo momento finito. A recíproca não é verdadeira, como mostra o Exercício 7.20, ao final do capítulo.
Uma outra consequência importante é sobre a variância da soma de variáveis independentes.
Para \(n=2\) temos
Os demais casos seguem por indução, pois \(X_1+\cdots +X_{n-1}\) é independente de \(X_n\).
Se \(\widetilde X=X-\mathbf{E}[X]\) e \(\widetilde Y=Y-\mathbf{E}[Y]\), então \(\operatorname {Cov}[X,Y]=\mathbf{E}[\widetilde X\widetilde Y]\). A linearidade em cada entrada e a simetria seguem da linearidade da esperança e do produto. Além disso,
de modo que a forma é positiva semidefinida. Se \(Y=c\) quase certamente, então \(\widetilde Y=0\) quase certamente e \(\operatorname {Cov}[X,Y]=0\).
A desigualdade de Cauchy-Schwarz é verdadeira para qualquer forma bilinear positiva semidefinita e, portanto, em particular para a covariância. Ainda assim, faremos uma demonstração aqui para deixar o texto mais completo e auto-contido.
Se \(\operatorname {Var}[\eta ]=0\), então \(\eta \) é constante quase certamente e ambos os lados da desigualdade são zero. Além disso, \(\eta -\mathbf{E}[\eta ]=0\) já fornece a dependência afim anunciada.
Suponha agora \(\operatorname {Var}[\eta ]\gt 0\) e ponha \(\theta =-\operatorname {Cov}[\xi ,\eta ]/\operatorname {Var}[\eta ]\).
Temos assim \(\theta \operatorname {Var}[\eta ]=-\operatorname {Cov}[\xi ,\eta ]\), e portanto
A igualdade ocorre se, e somente se, \(\operatorname {Var}[\xi +\theta \eta ]=0\), isto é, se \(\xi +\theta \eta \) é constante quase certamente. Isso equivale à existência de \(a,b,c\in \mathbb {R}\), não todos nulos, tais que \(a\xi +b\eta +c=0\) quase certamente. A recíproca também segue dessa caracterização, trocando as variáveis se necessário.
Divida a desigualdade de Cauchy–Schwarz por \(\operatorname {Var}[X]\operatorname {Var}[Y]\gt 0\) e use sua caracterização do caso de igualdade.
7.4 Integração com respeito à Distribuição
Uma função de distribuição determina uma probabilidade em \(\mathbb {R}\). Integrar em relação a essa probabilidade conduz às integrais de Lebesgue–Stieltjes; aqui, elas serão sobretudo uma linguagem para calcular esperanças sem retornar ao espaço amostral.
Pela Proposição 6.15, existe uma variável aleatória \(X\) cuja função de distribuição é \(F\). Sua distribuição \(\P _X\) satisfaz
o que prova a existência. Se duas probabilidades possuem essa propriedade, elas coincidem no \(\pi \)-sistema dos intervalos \((-\infty ,b]\) (tomando o limite \(a\to -\infty \)) e, pelo teorema de unicidade de medidas, coincidem em \(\mathcal{B}(\mathbb {R})\).
Primeiro suponha que \(g=\sum _{j=1}^m b_j\mathbb {1}_{B_j}\) é simples e não negativa. Então
Para \(g\geq 0\) mensurável, tome funções simples \(g_n\uparrow g\) e aplique duas vezes o Teorema da Convergência Monótona:
Primeiro suponha que \(g=\sum _{j=1}^m b_j\mathbb {1}_{B_j}\) é simples e não negativa. Então
Para \(g\geq 0\) mensurável, aproxime \(g\) por funções simples não negativas e use o Teorema da Convergência Monótona dos dois lados.
Utilizando as Proposições 7.28 e 7.29 podemos integrar com respeito a uma distribuição que seja combinação de uma discreta e uma absolutamente contínua.
A medida de Lebesgue–Stieltjes \(\P _{F_\xi }\) é a distribuição \(\P _\xi \), pois ambas têm função de distribuição \(F_\xi \). Portanto, o Teorema 7.9 dá
Tomando \(g(x)=x\), obtemos a primeira identidade.
Se \(\xi \sim \mathcal{N}(0;1)\) então \(\mathbf{E}(\xi ) = 0\).
De fato,
pois o integrando é uma função ímpar e integrável.
7.5 Desigualdades de Markov e Chebyshev
As desigualdades de Markov e Chebyshev convertem informação sobre momentos em controle das caudas de uma distribuição. São estimativas simples e universais: pedem pouco, e por isso também prometem pouco.
Dada uma variável aleatória \( \xi \geq 0 \), vale que
Em particular, dada uma variável aleatória \(\xi \) qualquer
Começamos definindo \( \eta : = t \mathbb {1}_{\{ \xi \geq t \} } \), e observando que \( \eta \leq \xi \) pontualmente.
Assim sendo temos
concluindo o resultado.
A simplicidade da cota tem um preço: ela pode estar longe do valor exato. Aplicar Markov a outras funções da variável permite refiná-la.
Dadas uma variável aleatória \(\xi \geq 0\) e uma constante \(p\gt 0\), vale
Em particular
para uma variável aleatória \(\xi \) qualquer.
Basta reduzir o enunciado à desigualdade de Markov: \( \P (\xi \geq t) = \P (\xi ^p \geq t ^p) \leq \dfrac {\mathbf{E}[ \xi ^p]} {t ^p} \), pela desigualdade de Markov.
Para que a cota seja informativa, precisamos de \(\xi \in \L ^p(\P )\). Ainda assim, ela evidencia um fato mais forte sobre a cauda.
Se \(X\in \L ^p(\P )\) para todo \(p\gt 0\), então \(t^p\P (|X|\gt t)\to 0\) para cada \(p\gt 0\): basta aplicar a desigualdade com um expoente \(q\gt p\).
Assim, nessa forma da desigualdade, exigimos um momento de ordem \(p\) de \(\xi \), mas obtemos um controle mais forte para a cauda.
Uma formulação ainda mais flexível é obtida substituindo a potência por uma função não decrescente.
No evento \(\{ |\xi |\geq t\} \), a monotonicidade dá \(\varphi (|\xi |)\geq \varphi (t)\). Assim,
Tomando esperanças e dividindo por \(\varphi (t)\gt 0\), obtemos o resultado.
Outra aplicação interessante da desigualdade de Markov é no estudo de como os valores de uma variável aleatória se dispersam ao redor da média, e como os diversos momentos centrais, e em particular a variância, informam esse comportamento.
O corolário abaixo é geralmente apresentado na literatura como sendo a própria desigualdade de Chebyshev, e trata exatamente deste assunto.
Use a desigualdade de Chebyshev para a variável aleatória \(|\xi -\mu |\geq 0\), com expoente \(p=2\). Como \(\mathbf{E}|\xi -\mu |^2=\sigma ^2\),
Considere o experimento de lançar uma moeda de maneira sequencial e independente. Para cada \(n\geq 1\), defina \(X_n\) como a indicadora de que observamos cara no \(n\)-ésimo lançamento. Suponha que em um lançamento da moeda, a probabilidade de observar cara é \(p\in (0,1)\).
Com isso temos que as variáveis \(X_1, X_2,\ldots \) são independentes com \(\mathbf{E}[X_n]=p\) e \(\operatorname {Var}[X_n]=p(1-p)\).
Queremos medir a proporção de caras observadas em \(n\) lançamentos, e para isso definiremos \(S_n=X_1+\cdots +X_n\). Isto é, \(S_n\) é o total de caras observadas em \(n\) lançamentos.
Segue assim que
e, como \(X_1,\ldots ,X_n\) são independentes,
Tome agora \(\epsilon \gt 0\) pequeno e note que
Concluímos assim que
quando \(n\to \infty \), para todo \(\epsilon \gt 0\).
7.6 Desigualdade Maximal de Kolmogorov
Para somas de variáveis independentes, não basta controlar apenas o valor final: muitas vezes queremos saber se alguma soma parcial se afastou demais da origem. A desigualdade maximal de Kolmogorov fornece esse controle sem pagar um fator adicional pelo número de instantes observados.
Seja \( (\xi _n) _{n \ge 1} \) uma sequência de variáveis aleatórias independentes, definidas no mesmo espaço de probabilidade, com esperança \(0\) e variância finita. Seja \(S_n = \sum _{k = 1} ^n \xi _k \). Então para \( \lambda \gt 0 \),
Comece observando que o evento \( \{ \max _{1 \le k \le n} | S_k | \ge \lambda \} \) é a união disjunta dos eventos
Observe também que, para cada \(k=1,\ldots ,n\), temos \(S_n-S_k=\xi _{k+1}+\cdots +\xi _n\), que é independente da \(\sigma \)-álgebra gerada por \(\xi _1,\ldots ,\xi _k\). Em particular, é independente de \(S_k\mathbb {1}_{A_k}\).
Além disso, \(\mathbf{E}[S_n-S_k]=0\) e, pela independência,
Além disso, dentro do evento \(A_k\) vale que \(\lambda ^{-2}S_k^2\geq 1\), de modo que \(\mathbb {1}_{A_k}\leq \lambda ^{-2}S_k^2\mathbb {1}_{A_k} \), e
onde a última igualdade decorre do termo misto nulo calculado acima.
Portanto,
Somando sobre os eventos disjuntos \(A_k\), encontramos
O resultado é concluído quando vemos que \(\operatorname {Var}(S_n)=\mathbf{E}[S_n^2]-\mathbf{E}[S_n]^2=\mathbf{E}[S_n^2]\).
7.7 Desigualdade de Jensen, Hölder e Minkowski
Nesta seção apresentaremos três desigualdades fundamentais. A desigualdade de Jensen relaciona funções convexas e esperança; as desigualdades de Hölder e Minkowski controlam produtos e somas em espaços \(L^p\). Antes, recordaremos alguns conceitos de análise real.
Uma função \(\varphi :\mathbb {R}\to \mathbb {R}\) é convexa se para todo \(a,b\in \mathbb {R}\) e \(\alpha \in [0,1]\) vale que
Geometricamente, isso se traduz como o gráfico da função, no intervalo \([a,b]\), estar abaixo da reta secante ao gráfico nos pontos \((a,\varphi (a))\) e \((b,\varphi (b))\).
Funções como \(|x|\), \(x^2\) e \(e^{\lambda x}\) são exemplos clássicos de funções convexas.
Um resultado importante sobre funções convexas, e que utilizaremos na demonstração do resultado principal, é o seguinte.
Se \(t_0\lt s\lt t\), escreva \(s=\alpha t+(1-\alpha )t_0\), com \(\alpha =(s-t_0)/(t-t_0)\). Pela convexidade,
O caso \(s\lt t\lt t_0\) é obtido escrevendo \(t\) como combinação convexa de \(s\) e \(t_0\). Finalmente, se \(s\lt t_0\lt t\), escreva \(t_0\) como combinação convexa de \(s\) e \(t\); a desigualdade resultante é
Isso cobre todas as posições possíveis.
Ponha \(t_0=\mathbf{E}[\xi ]\). Pela proposição anterior, existe \(m\in \mathbb {R}\) entre as inclinações secantes à esquerda e à direita de \(t_0\). Assim,
Essa reta de suporte mostra também que a parte negativa de \(\varphi (\xi )\) é dominada por uma função integrável; logo sua esperança está bem definida. Tomando esperanças na desigualdade,
Terminamos com uma aplicação bastante importante da desigualdade de Jensen.
Seja \(X\) uma variável aleatória e sejam \(0\lt p\lt q\). Vamos mostrar que \(X\in \L ^q(\P )\) implica \(X\in \L ^p(\P )\).
Como \(q/p\gt 1\), a função \(\varphi (x)=x^{q/p}\) é convexa em \([0,\infty )\). Não podemos aplicar Jensen diretamente a \(|X|^p\), pois sua integrabilidade é precisamente o que queremos provar. Para \(M\gt 0\), defina
A variável \(Y_M\) é limitada e, portanto, integrável. Pela desigualdade de Jensen,
Portanto,
Como \(Y_M\uparrow |X|^p\) quando \(M\to \infty \), o Teorema da Convergência Monótona fornece
Logo \(X\in \L ^p(\P )\).
Nos casos \((p,q)=(1,\infty )\) e \((\infty ,1)\), a desigualdade segue diretamente de \(|\xi \eta |\leq \| \eta \| _\infty |\xi |\) e de sua versão simétrica. Suponha \(1\lt p,q\lt \infty \). Se uma das normas é zero, o resultado é imediato. Caso contrário, ponha \(U=|\xi |/\| \xi \| _p\) e \(V=|\eta |/\| \eta \| _q\). Pela desigualdade de Young, \(uv\leq u^p/p+v^q/q\), temos
Multiplicando pelas duas normas, obtemos a conclusão.
Para \(p=1\), integre \(|f+g|\leq |f|+|g|\). Para \(p=\infty \), tome o supremo essencial nessa mesma desigualdade. Suponha \(1\lt p\lt \infty \). A estimativa \(|f+g|^p\leq 2^{p-1}(|f|^p+|g|^p)\) mostra primeiro que \(f+g\in \L ^p\). Se \(\| f+g\| _p=0\), não há o que provar. Caso contrário, Hölder, com conjugado \(q=p/(p-1)\), fornece
Dividindo pelo último fator, obtemos a desigualdade.
7.8 ↯Funções Geradoras de Probabilidade
Considere uma variável aleatória \( \xi \), tomando valores nos naturais. Seja \( p_r = \P (\xi = r) \).
Observamos que função geradora de probabilidade é uma série de potência e converge absolutamente para \( | z | \leq 1 \), pois
A função geradora reúne as probabilidades nos coeficientes de uma série. Sua utilidade aparece quando operações sobre variáveis se traduzem em operações algébricas sobre essas funções.
Neste exemplo, calculamos a função geradora de probabilidade para a distribuição de Poisson de parâmetro \(\alpha \). Com base na definição, temos:
No interior do intervalo de convergência, podemos diferenciar a série termo a termo. Assim,
Logo \(p_n=p^{(n)}(0)/n!\) para todo \(n\geq 0\), e recuperamos toda a distribuição.
Para \(0\lt z\lt 1\), a diferenciação termo a termo dá
Quando \(z\uparrow 1\), cada parcela cresce para \(rp_r\). Pelo Teorema da Convergência Monótona aplicado à medida de contagem em \(\mathbb {N}\),
A última afirmação é imediata da continuidade em \(1\).
Para \(0\lt z\lt 1\),
As parcelas são não negativas e crescem quando \(z\uparrow 1\). A Convergência Monótona fornece
Se \( \xi \) e \( \eta \) forem variáveis aleatórias de Poisson independentes com parâmetros \( \lambda , \mu \) respectivamente, então
Portanto, \( \xi + \eta \sim \P (\lambda + \mu ) \).
Também podemos fazê-lo diretamente:
mas é muito mais complicado.
Somas de um número aleatório de termos
As funções geradoras também permitem estudar somas cujo número de parcelas é aleatório. Numa seguradora, por exemplo, tanto o número de pedidos de indenização quanto o valor de cada pedido podem variar. A soma reúne as duas fontes de aleatoriedade.
Sejam \(\xi _1,\xi _2,\ldots \) variáveis aleatórias independentes, identicamente distribuídas e com valores em \(\mathbb {N}\), com função geradora \(p(z)=\mathbf{E}[z^{\xi _1}]\). Seja \(N\), também com valores em \(\mathbb {N}\), independente de todas as \(\xi _i\) e com função geradora \(h\). Para \(S=\xi _1+\cdots +\xi _N\) (com \(S=0\) quando \(N=0\)), temos
como \( h (x) = \sum _{n = 0} ^\infty \P (N = n) x ^n \).
assim
Para calcular a variância, use o fato de que
Se \(N\) e \(\xi _1\) possuem segundos momentos finitos, a diferenciação em \(z=1\) fornece
7.9 ↯Processos de Ramificação
Originalmente, processos de ramificações foram considerados por Galton e Watson nos anos de 1870 quando estes procuravam um modelo quantitativo para o fenômeno do desaparecimento de sobrenomes, mesmo no cenário de uma população crescente. O modelo é construído sob a suposição de que cada homem em uma dada família tem a probabilidade \({p_k}\) de ter \({k}\) filhos e que o sobrenome de família é passado aos filhos, então desejamos determinar a probabilidade que após \({n}\) gerações um indivíduo não tenha descendentes homens.
Vamos fazer perguntas como o número esperado de indivíduos em uma geração específica e a probabilidade de extinção.
Considere \( \xi _0, \xi _1, \cdots \), onde \( \xi _n \) é o número de indivíduos na geração \( n \)-ésima. Assumimos o seguinte:
\( \xi _0 = 1 \)
Cada indivíduo vive por uma unidade de tempo e produz \( k \) descendentes com probabilidade \( p_k \).
Os números de descendentes de indivíduos distintos e de gerações distintas são independentes. Assim,
\[ \xi _{n + 1} = \eta _1 ^n + \eta _2 ^n + \cdots + \eta _{\xi _n} ^n, \]onde as variáveis \(\eta _i^n\) são independentes, identicamente distribuídas como \(\xi _1\) e independentes da história até a geração \(n\).
A função geradora transforma a recorrência do processo de ramificação numa relação de composição. Seja \( F (z) \) a função geradora de probabilidade de \( \eta _i ^n \). Então
Definimos
O principal teorema dos processos de ramificação que provaremos nesta seção é
Condicionando no tamanho da geração \(n\) e usando a independência das descendências,
Como \(F_0\) é a identidade, a recorrência mostra por indução que \(F_n=F^{\circ n}\). Portanto, \(F_n\circ F=F^{\circ (n+1)}=F\circ F_n\).
Condicionalmente a \(\xi _{n-1}=k\), a variável \(\xi _n\) é soma de \(k\) cópias independentes de \(\xi _1\). Logo sua média condicional é \(k\mu \) e sua variância condicional é \(k\sigma ^2\). Em particular,
e a condição inicial \(\xi _0=1\) dá \(\mathbf{E}[\xi _n]=\mu ^n\).
Usando \(\mathbf{E}[\xi _n^2\mid \xi _{n-1}=k] =k\sigma ^2+k^2\mu ^2\) e somando sobre \(k\), obtemos
Portanto, escrevendo \(V_n=\operatorname {Var}(\xi _n)\),
Uma indução nessa recorrência fornece
Probabilidade de Extinção
Considere \(A_n=\{ \xi _n=0\} \), o evento de que a população já esteja extinta na \(n\)-ésima geração. Seja \(q\) a probabilidade de extinção eventual e
Como \( A_1 \subseteq A_2 \subseteq A_3 \subseteq \cdots \), sabemos que
Como
e \(F\) é contínua em \([0,1]\), temos
assim
Alternativamente, usando a lei da probabilidade total
onde a segunda igualdade vem do fato de que, para que toda a população se extingua, cada população individual deve se extinguir.
Isso significa que para encontrar a probabilidade de extinção, precisamos encontrar um ponto fixo de \( F \).
Se \(\mu \leq 1\) e \(\P (\xi _1=1)\lt 1\), então \(q=1\).
Se \(\mu \gt 1\), então \(q\lt 1\).
No caso degenerado \(\P (\xi _1=1)=1\), temos \(q=0\).
Já vimos que \(F(q)=q\). Se \(\alpha \in [0,1]\) é qualquer outro ponto fixo, então \(F_0(0)=0\leq \alpha \) e, pela monotonicidade de \(F\), \(F_{n+1}(0)=F(F_n(0))\leq F(\alpha )=\alpha \). Portanto,
e \(q\) é o menor ponto fixo.
A função \(G(s)=F(s)-s\) é convexa, \(G(1)=0\) e \(F'(1-)=\mu \). Se \(\mu \leq 1\), a convexidade dá, para \(s\lt 1\),
de modo que \(F(s)\geq s\). Se houvesse igualdade para algum \(s\lt 1\), a convexidade e a igualdade das inclinações forçariam \(F(t)=t\) em \([s,1]\); pela identidade de séries de potências, isso significaria \(F(t)=t\) em todo \((-1,1)\), isto é, \(\P (\xi _1=1)=1\). Fora desse caso degenerado, não há ponto fixo abaixo de \(1\), e portanto \(q=1\).
Se \(\mu \gt 1\), então \(G'(1-)\gt 0\) e, consequentemente, \(G(s)\lt 0\) para \(s\lt 1\) suficientemente próximo de \(1\). Como \(G(0)=F(0)\geq 0\), a continuidade fornece um ponto fixo em \([0,1)\); logo o menor deles satisfaz \(q\lt 1\). Finalmente, no caso degenerado \(\P (\xi _1=1)=1\), temos \(F(s)=s\) para todo \(s\); cada indivíduo tem exatamente um descendente e a população nunca se extingue, de modo que \(q=0\).
7.10 ↯Funções Geradoras de Momento
A função geradora de momentos de \(\xi \) é
desde que essa esperança seja finita para todo \(t\) em algum intervalo \((-h,h)\), com \(h\gt 0\).
Para variáveis discretas ou absolutamente contínuas temos que
Fixe \(t\) com \(|t|\lt h\) e escolha \(\delta \gt 0\) tal que \(|t|+2\delta \lt h\). Existe \(C_{n,\delta }\) tal que \(|x|^n\leq C_{n,\delta }\mathrm e^{\delta |x|}\). Para \(s\) numa vizinhança suficientemente pequena de \(t\),
O lado direito é integrável pela hipótese sobre \(M_\xi \). O teorema de diferenciação sob o sinal de integral, obtido da Convergência Dominada, pode então ser aplicado sucessivamente e fornece a fórmula.
Suponha que duas distribuições \(\mu \) e \(\nu \) tenham a mesma função geradora num intervalo \((-h,h)\). Para \(z\in \mathbb C\) com \(|\operatorname {Re}z|\lt h\), as funções
são analíticas. A justificativa é a mesma dominação exponencial usada no teorema anterior. Como coincidem no intervalo real \((-h,h)\), o teorema da identidade para funções analíticas mostra que coincidem em toda a faixa \(|\operatorname {Re}z|\lt h\). Em particular, \(L_\mu (it)=L_\nu (it)\) para todo \(t\in \mathbb {R}\): as funções características são iguais. Pelo Teorema da Unicidade de Fourier (Teorema 12.13), \(\mu =\nu \).
Completando o quadrado:
Então voltando ao cálculo da função geradora de momento
Calculamos a função geradora de momento da soma usando o teorema sobre somas de variáveis aleatórias independentes.
Essa é a função geradora de momentos de \(\mathcal N(\mu _1+\mu _2,\sigma _1^2+\sigma _2^2)\); pela unicidade, as distribuições coincidem.
7.11 ↯Entropia
Informação
Gostaríamos de desenvolver uma medida da informação que obtemos de observar a ocorrência de um evento de probabilidade \( p \). Nossa primeira redução será ignorar quaisquer características específicas do evento e apenas observar se ou não aconteceu. Assim, pensamos no evento como a observação de um símbolo cuja probabilidade de ocorrência é \( p \).
A abordagem que vamos adotar é axiomática: Queremos que a medida de informação \( I (p) \) tenha as seguintes propriedades
Uma medida de informação é uma função \(I:(0,1]\to [0,\infty )\) com as seguintes propriedades:
A informação é uma quantidade não negativa: \( I (p) \ge 0 \).
Se um evento tiver probabilidade 1, não obtemos informações da ocorrência do evento: \( I (1) = 0 \).
Se ocorrerem dois eventos independentes (cuja probabilidade conjunta é o produto de suas probabilidades individuais), então a informação que obtemos ao observar os eventos é a soma das duas informações: \( I (p_1 \cdot p_2) = I (p_1) + I (p_2). \) (Esta é a propriedade fundamental)
A medida de informação depende continuamente da probabilidade.
Essas propriedades determinam a forma de \(I\). De fato, defina \(J(x)=I(\mathrm e^{-x})\) para \(x\geq 0\). Então \(J\) é contínua, não negativa e
A equação aditiva contínua em \([0,\infty )\) implica \(J(x)=cx\) para alguma constante \(c\geq 0\). Logo
Se a informação não for identicamente nula, então \(c\gt 0\) e podemos escolher uma base \(b\gt 1\) de modo que
A escolha da base determina apenas a unidade de informação.
Normalmente, pensamos em termos de \( \log _2 (p) \).
Por exemplo, lançar uma moeda justa uma vez nos dará eventos \( H \) e \( T \) com probabilidade \( 1/2 \) e, portanto, um único lançamento de uma moeda nos dá \( - \log _2 (1/2) = 1 \) bit de informação.
Lançando uma moeda justa \( n \) vezes temos \( - \log _2 ((1/2) ^n) = \log _2 (2 ^n) = n \cdot \log _2 (2) = n \) bits de informação.
Assim, obtemos que \( n \) lançamentos de uma moeda justa nos fornece \( n \) bits de informação, e leva \( n \) dígitos binários para especificar. Que estas duas medidas são as mesmas nos assegura que fizemos uma boa escolha de definição de informação.
Entropia
Suponha agora que temos \( n \) símbolos \( \{ a_1, a_2, \ldots , a_n \} \) e que alguma fonte está nos fornecendo um fluxo desses símbolos. Suponha ainda que a fonte emite os símbolos com probabilidades \( \{ p_1, p_2, \ldots , p_n \} \), respectivamente. Por enquanto, também assumiremos que os símbolos são emitidos de forma independente
Qual é a quantidade média de informação que obtemos de cada símbolo que vemos no fluxo?
O que realmente queremos aqui é uma média ponderada. Se observarmos o símbolo \( a_i \), nós obteremos \( \log (1 / p_i) \) informação dessa observação particular. A longo prazo, digamos \( N \) de observações, veremos aproximadamente \( N \cdot p_i \) ocorrências do símbolo \( a_i \). Assim, após \( N \) observações obteremos a informação total \( I \) de
Mas, então, a média de informações que obtemos por símbolo observado será
Adotamos a convenção de que \( 0 \cdot \log (1 / 0) \) vale \(0\), correspondente ao limite da expressão quando a probabilidade tende a zero.
Isso nos leva a seguinte definição.
Seja uma distribuição de probabilidade \( P = \{ p_1, p_2, \ldots , p_n \} \). Definimos entropia da distribuição \( P \) por:
Para uma variável discreta \(X\) com \(\P (X=a_i)=p_i\), escreva \(p(a_i)=p_i\). Então essa definição pode ser escrita como
Há uma noção análoga para uma distribuição absolutamente contínua com densidade \(f\), chamada entropia diferencial:
quando a integral está bem definida. Apesar da semelhança formal, a entropia diferencial pode ser negativa e muda sob transformações de escala; por isso não deve ser confundida com a entropia discreta.
Em outras palavras, a entropia de uma distribuição de probabilidade é o valor esperado da informação da distribuição.
Considere as distribuições de probabilidade, \( P = \{ p_1, p_2, \ldots , p_n \} \) e \( Q = \{ q_1, q_2, \ldots , q_n \} \), onde \( p_i, q_i \ge 0 \) e \( \sum _i p_i = \sum _i q_i = 1 \). Então
com as convenções \(0\log 0=0\) e \(-p_i\log q_i=+\infty \) se \(p_i\gt 0=q_i\). A igualdade ocorre se, e somente se, \(p_i=q_i\) para todo \(i\).
Se existe \(i\) com \(p_i\gt 0=q_i\), o lado esquerdo é infinito e a desigualdade é imediata. Caso contrário, omitimos os índices com \(p_i=0\) e usamos \(\log x\leq x-1\):
Isso equivale à desigualdade anunciada. A igualdade em \(\log x\leq x-1\) ocorre apenas quando \(x=1\); portanto, ela exige \(q_i=p_i\) para todo índice com \(p_i\gt 0\). Como ambas as famílias somam \(1\), também não pode haver massa de \(Q\) fora desse suporte, e \(p_i=q_i\) para todo \(i\).
A desigualdade de Gibbs permite identificar a distribuição de maior entropia entre \(n\) resultados possíveis. Para uma distribuição \( P = \{ p_1, p_2, \ldots , p_n \} \), temos
com igualdade somente quando \( p_i = \frac{1}{n} \) para todos \( i \). A distribuição uniforme maximiza, portanto, a informação média por observação: sem resultados favorecidos, a surpresa fica mais bem distribuída.
Seja \(X\) uma variável aleatória discreta com valores distintos \(x_1,x_2,\ldots \). Suponha que Prove, a partir da definição da integral de Lebesgue, que
Construa variáveis aleatórias \(X,Y:[0,1]\to \mathbb {R}\), no espaço com medida de Lebesgue, tais que Calcule explicitamente as duas probabilidades e as duas esperanças. Prove que, para toda função boreliana \(g:\mathbb {R}\to \mathbb {R}\), Compare com os casos concretos \(g(x)=x^+\) e \(g(x)=x^-\) estudados no Capítulo 6. Seja \(X_1,X_2,\ldots \) uma sequência de variáveis aleatórias mutuamente independentes. Prove que as \(\sigma \)-álgebras são independentes. Sejam \(X_1,X_2,\ldots \) variáveis aleatórias i.i.d., com média \(\mu \) e variância \(\sigma ^2\lt \infty \). Seja \(N\) uma variável aleatória com valores em \(\mathbb {N}_0\), independente da sequência, com Defina com a convenção de que a soma vazia vale zero. Calcule \(\mathbf{E}[S]\) e \(\operatorname {Var}(S)\). Prove a desigualdade de Cauchy–Schwarz: se \(X,Y\in L^2(\P )\), então Prove também que há igualdade se, e somente se, \(X\) e \(Y\) são linearmente dependentes como elementos de \(L^2(\P )\). Sejam \(X\) e \(Z\) variáveis aleatórias independentes, ambas com distribuição normal padrão. Para \(a,b\in \mathbb {R}\), não ambos nulos, defina Calcule \(\operatorname {Corr}(X,Y)\). Verifique diretamente que \(|\operatorname {Corr}(X,Y)|\leq 1\). Determine as condições necessárias e suficientes sobre \(a\) e \(b\) para que \(\operatorname {Corr}(X,Y)=1\). Faça o mesmo para \(\operatorname {Corr}(X,Y)=-1\). Suponha que \(n\geq 2\) pessoas deixem seus chapéus no vestiário e, ao final, os chapéus sejam devolvidos segundo uma permutação uniforme. Seja \(X\) o número de pessoas que recebem o próprio chapéu. Calcule \(\mathbf{E}[X]\) e \(\operatorname {Var}(X)\). Seja \(X\) uma variável aleatória real. Prove que Mostre, de fato, as desigualdades que relacionam a série acima com \(\mathbf{E}|X|\). Seja \(X\) uma variável aleatória real. Prove que, para todo \(\varepsilon \gt 0\), existe uma variável aleatória limitada \(X_\varepsilon \) tal que Faça a construção por truncamento e indique uma cota determinística para \(|X_\varepsilon |\). Coletor de cupons. Cada pacote contém, de maneira independente, uma figurinha escolhida uniformemente entre \(n\) tipos. Determine o número esperado de pacotes necessários para obter ao menos uma figurinha de cada tipo. Seja \(X\) uma variável aleatória com valores em \(\mathbb {N}_0\) e segundo momento finito. Sua função geradora de probabilidades é Justifique as derivações em \(s=1\) pela esquerda e prove que Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Desigualdades
Uma moeda justa é lançada independentemente \(n\) vezes, e \(S_n\) denota o número de caras. Use a desigualdade de Chebyshev para provar que, para todo \(\varepsilon \gt 0\),
Ver solução
Dígitos binários e função geradora exponencial. Para \(\omega \in [0,1)\), seja \(d_k(\omega )\in \{ 0,1\} \) o \(k\)-ésimo dígito de sua expansão binária; nos racionais diádicos, escolha a expansão que termina em zeros. Defina
Com respeito à medida de Lebesgue, prove que
Diferenciando em \(t=0\), conclua que
Dica. Divida \([0,1)\) nos intervalos diádicos \([k/2^n,(k+1)/2^n)\), \(0\leq k\lt 2^n\).
Ver solução
Cota exponencial para os dígitos binários. Com a notação do exercício anterior, prove que, para todo \(\varepsilon \gt 0\),
Dica. Use (7.20), o argumento exponencial de Markov e
Ver solução
Demonstração probabilística do Teorema de Weierstrass. Se \(f:[0,1]\to \mathbb {R}\) é contínua, use a desigualdade de Chebyshev e a continuidade uniforme de \(f\) para provar que
uniformemente em \(x\in [0,1]\).
Dica. Para cada \(x\), tome \(S_n\sim \operatorname {Binomial}(n,x)\) e escreva o polinômio acima como \(\mathbf{E}[f(S_n/n)]\). Separe os eventos \(\{ |S_n/n-x|\lt \delta \} \) e \(\{ |S_n/n-x|\geq \delta \} \) usando uma escolha de \(\delta \) que não dependa de \(x\).
Ver solução
Otimalidade da desigualdade de Chebyshev. Fixe \(t\geq 1\), \(\mu \in \mathbb {R}\) e \(\sigma \gt 0\). Construa uma variável aleatória \(X\) com média \(\mu \) e variância \(\sigma ^2\) tal que
Ver solução
Seja \(X\) uma variável aleatória não negativa com \(\mathbf{E}[X]\lt \infty \), e defina \(X_n=X\wedge n\).
Dê um exemplo para o qual \(\mathbf{E}[X^2]=\infty \).
Prove que, para todo \(p\gt 2\),
\[ \sum _{n=1}^{\infty }n^{-p}\mathbf{E}[X_n^2]\lt \infty . \]Prove que a conclusão continua válida no caso-limite \(p=2\).
Dica para o último item. Para cada \(x\geq 0\), estime \(\sum _{n\geq 1}n^{-2}(x\wedge n)^2\) separando os índices \(n\leq x\) e \(n\gt x\).
Ver solução
Sejam \(X_1,\ldots ,X_n\) variáveis aleatórias reais independentes e \(S_k=X_1+\cdots +X_k\). Prove a desigualdade de Etemadi: para todo \(t\gt 0\),
Dica. Para \(r\gt 0\), considere os eventos disjuntos de primeira passagem
Use a independência de \(A_j\) e \(S_n-S_j\) e trate separadamente o caso em que \(\max _k\P (|S_k|\geq r)\gt 1/3\).
Ver solução
Dê um exemplo de variáveis aleatórias limitadas e dependentes \(X\) e \(Y\) tais que \(\operatorname {Cov}(X,Y)=0\). Calcule a covariância e mostre diretamente que as variáveis não são independentes.
Dica. Tome uma variável \(X\) centrada e procure \(Y\) que seja nula sempre que \(X\neq 0\).