Esperança Condicional
Uma sub-\(\sigma \)-álgebra \(\mathcal{G}\subseteq \mathcal{F}\) representa informação parcial: determina quais eventos a informação disponível permite distinguir. Se \(\xi \) é integrável, queremos substituí-la por uma variável \(\eta \) que use apenas essa informação e preserve as médias sobre os eventos observáveis. Isso significa exigir
A variável \(\eta \) pode ser vista como uma versão desfocada de \(\xi \): não reproduz todos os seus valores, mas conserva a integral sobre cada evento de \(\mathcal{G}\). Em \(\L ^2\), veremos que ela é também a melhor aproximação de \(\xi \) baseada em \(\mathcal{G}\), no sentido do erro quadrático médio.
\(\eta \) é \(\mathcal{G}\)-mensurável;
para todo \(G\in \mathcal{G}\),
\[ \int _G\xi \, d\P =\int _G\eta \, d\P . \]
Primeiro verificaremos que essas condições determinam a esperança condicional a menos de conjuntos de probabilidade zero.
Suponha que \(\eta \) e \(\eta '\) satisfaçam as propriedades da esperança condicional. Pela segunda propriedade da definição,
Logo, \(\int _A(\eta -\eta ')\, d\P =0\) para todo \(A\in \mathcal{G}\). Para \(\varepsilon \gt 0\), considere \(A_\varepsilon =\{ \eta -\eta '\gt \varepsilon \} \in \mathcal{G}\). Então
Portanto, \(\P (A_\varepsilon )=0\) para todo \(\varepsilon \gt 0\). Como
a subaditividade enumerável implica
Da mesma forma, trocando \(\eta \) e \(\eta '\), obtemos \(\P (\eta '-\eta \gt 0)=0\). Logo, \(\eta =\eta '\) quase certamente.
A existência geral será demonstrada na seção seguinte. Antes disso, vejamos como construir a variável condicional quando a informação disponível é dada por uma partição.
Seja \(G\) um evento tal que \(0\lt \P (G)\lt 1\) e seja \(\mathcal{G}=\sigma (G)=\{ \emptyset ,G,G^c,\Omega \} \). Então,
onde \(\mathbf{E}[\xi \mid G]=\mathbf{E}[\xi \mathbb {1}_G]/\P (G)\). A variável aleatória definida acima é uma esperança condicional.
A variável \( \eta \) é \( \mathcal{G}\)-mensurável, porque \( \{ \omega : \eta (\omega ) \in B \} \) está em \( \mathcal{G}\) para todo conjunto de Borel \( B \) em \( \mathbb {R}\).
Pela definição das médias condicionadas aos eventos,
e
As identidades para \(\emptyset \) e \(\Omega \) seguem dessas duas por aditividade. Logo, a igualdade das integrais vale para todo elemento de \(\mathcal{G}\).
A mesma construção vale para uma partição enumerável: em cada parte, tomamos a média correspondente.
Considere \((\Omega ,\mathcal{F},\P )\) e uma variável aleatória integrável \(\xi \). Seja \(\mathcal P=\{ A_k:k\geq 1\} \) uma partição enumerável de \(\Omega \), com \(\P (A_k)\gt 0\) para todo \(k\), e seja \(\sigma (\mathcal P)\) a \(\sigma \)-álgebra por ela gerada.
Então uma versão da esperança condicional é constante em cada elemento da partição e dada por
A Figura 14.1 ilustra essa construção no caso unidimensional.
14.1 Existência e unicidade da esperança condicional
14.1.1 Existência em \(\L ^2\)
Em \(\L ^2\), a existência tem uma interpretação geométrica: condicionar é projetar sobre o subespaço das variáveis \(\mathcal{G}\)-mensuráveis.
No espaço de Hilbert \(\L ^2(\Omega , \mathcal{F}, \P )\), a norma é
Ela é induzida pelo produto interno
Seja \((X_n)\) uma sequência em \(\L ^2(\Omega ,\mathcal{G},\P )\) que converge em \(\L ^2\) para \(X\in \L ^2(\Omega ,\mathcal{F},\P )\). Escolha uma subsequência \((X_{n_k})\) tal que
Para todo \(\varepsilon \gt 0\), a desigualdade de Markov dá
Pelo primeiro lema de Borel–Cantelli, \(X_{n_k}\to X\) quase certamente. Como cada \(X_{n_k}\) é \(\mathcal{G}\)-mensurável, a variável \(\widetilde X=\limsup _kX_{n_k}\) também é \(\mathcal{G}\)-mensurável e satisfaz \(\widetilde X=X\) quase certamente. Assim, a classe de equivalência de \(X\) pertence a \(\L ^2(\Omega ,\mathcal{G},\P )\), que é, portanto, fechada.
Ponha \(\eta =P_{\mathcal{G}}\xi \). Por definição, \(\eta \in \L ^2(\Omega ,\mathcal{G},\P )\) e, portanto, possui uma versão \(\mathcal{G}\)-mensurável e integrável.
Para \(G\in \mathcal{G}\), a indicadora \(\mathbb {1}_G\) pertence a \(\L ^2(\Omega ,\mathcal{G},\P )\). Como \(\xi -\eta \) é ortogonal a esse subespaço,
Logo, \(\eta \) satisfaz a definição de \(\mathbf{E}[\xi \mid \mathcal{G}]\). A unicidade quase certa segue do Teorema 14.2.
14.1.2 Existência em \(\L ^1\)
Para variáveis apenas integráveis, não podemos recorrer diretamente à geometria de \(\L ^2\). O Teorema de Radon–Nikodým substitui a projeção e fornece a construção em \(\L ^1\).
Suponha primeiro \(\xi \geq 0\). No espaço mensurável \((\Omega ,\mathcal{G})\), considere as medidas finitas
A medida \(\nu \) é finita porque \(\xi \) é integrável, e \(\nu \ll \mu \): se \(\P (A)=0\), então \(\int _A\xi \, d\P =0\). Pelo Teorema de Radon–Nikodým, existe uma função \(\mathcal{G}\)-mensurável \(f\geq 0\) tal que
Além disso, \(\int f\, d\P =\nu (\Omega )=\mathbf{E}\xi \lt \infty \). Portanto, \(f\) é integrável e satisfaz as duas propriedades da esperança condicional.
Para \(\xi \) arbitrária, escreva \(\xi =\xi ^+-\xi ^-\). Pelo caso não negativo, existem
A variável \(\eta =\eta _+-\eta _-\) é \(\mathcal{G}\)-mensurável e integrável. Para todo \(A\in \mathcal{G}\),
Isso prova a existência. A unicidade é o conteúdo do Teorema 14.2.
Os casos extremos esclarecem o papel da informação; a partição permite ver os casos intermediários.
Para a \(\sigma \)-álgebra trivial \(\mathcal{G}=\{ \emptyset ,\Omega \} \), toda variável \(\mathcal{G}\)-mensurável é constante quase certamente. Nesse caso,
\[ \mathbf{E}[\xi \mid \mathcal{G}]=\mathbf{E}\xi . \]Com efeito, para \(A=\Omega \),
\[ \displaystyle \int _A (\mathbf{E}\xi ) \ d \P = \displaystyle \int _A \xi \ d \P \]e ambos os lados são iguais a \(\mathbf{E}\xi \); para \(A=\emptyset \), ambos são zero.
Para a informação completa \(\mathcal{G}=\mathcal{F}\),
\[ \mathbf{E}[\xi | \mathcal{G}] = \xi . \]A própria variável \(\xi \) satisfaz as duas condições da definição: com toda a informação, não resta nada a estimar.
Suponha que \(\Omega =\bigsqcup _{k\geq 1}\Omega _k\) seja uma partição enumerável com \(\P (\Omega _k)\gt 0\), e tome \(\mathcal{G}=\sigma (\Omega _1,\Omega _2,\ldots )\). Então,
\[ \mathbf{E}[\xi \mid \mathcal{G}](\omega ) =\sum _{k\geq 1}\frac{\mathbf{E}[\xi \mathbb {1}_{\Omega _k}]}{\P (\Omega _k)} \mathbb {1}_{\Omega _k}(\omega ). \]Essa função é \(\mathcal{G}\)-mensurável. Se \(A=\bigsqcup _{k\in I}\Omega _k\in \mathcal{G}\), a aditividade da integral mostra que sua integral em \(A\) é
\[ \sum _{k\in I}\mathbf{E}[\xi \mathbb {1}_{\Omega _k}] =\int _A\xi \, d\P , \]verificando a segunda condição da definição.
14.2 Esperança Condicional em Relação a uma Variável Aleatória
Observar uma variável aleatória significa conhecer os eventos que ela permite distinguir. Por isso, condicionar em uma variável é condicionar na \(\sigma \)-álgebra por ela gerada.
Suponha que \(\eta \) tome os valores \(y_1,\ldots ,y_n\), todos com probabilidade positiva. Então \(\sigma (\eta )=\sigma (\Omega _1,\ldots ,\Omega _n)\), onde \(\Omega _k=\{ \eta =y_k\} \). Logo,
14.3 Propriedades da Esperança Condicional
As propriedades seguintes decorrem das duas condições da definição e da unicidade quase certa. Em cada caso, a estratégia será verificar a mensurabilidade e a igualdade das integrais nos eventos de \(\mathcal{G}\).
A variável \(a\mathbf{E}[\xi \mid \mathcal{G}]+b\mathbf{E}[\eta \mid \mathcal{G}]\) é \(\mathcal{G}\)-mensurável e integrável. Além disso, para todo \(A\in \mathcal{G}\),
Portanto, ela satisfaz a definição de \(\mathbf{E}[a\xi +b\eta \mid \mathcal{G}]\); a unicidade quase certa conclui a prova.
A Proposição anterior fornece a linearidade. A existência, a integrabilidade e a \(\mathcal{G}\)-mensurabilidade da imagem seguem do Teorema 14.8 e da definição.
A esperança associa um número a cada variável integrável: é um funcional linear. A esperança condicional associa outra variável aleatória, mensurável em relação à informação disponível: é um operador linear.
Para todo \(A\in \mathcal{G}\),
Ponha \(Z=\mathbf{E}[\eta \mid \mathcal{G}]-\mathbf{E}[\xi \mid \mathcal{G}]\). A variável \(Z\) é \(\mathcal{G}\)-mensurável e \(\int _AZ\, d\P \geq 0\) para todo \(A\in \mathcal{G}\). Se \(\{ Z\lt 0\} \) tivesse probabilidade positiva, algum conjunto \(\{ Z\leq -1/m\} \) também teria probabilidade positiva, e a integral de \(Z\) nesse conjunto seria estritamente negativa, uma contradição. Logo, \(Z\geq 0\) quase certamente.
Como \(\xi \leq |\xi |\) e \(-\xi \leq |\xi |\), a monotonicidade e a linearidade dão
As duas desigualdades equivalem à conclusão.
Uma função convexa real é o supremo de uma família enumerável de minorantes afins. Para ver isso, escolha uma reta de suporte em cada ponto racional. Se \(q_k\in \mathbb Q\) converge para \(x\), a convexidade mantém limitadas as inclinações dessas retas em qualquer intervalo compacto que contenha \(x\) no interior; pela continuidade de \(\varphi \), os valores das retas em \(x\) convergem para \(\varphi (x)\). Logo o supremo enumerável dessas retas coincide com \(\varphi \) em todo ponto.
Escreva os minorantes como \(\ell _j(x)=a_jx+b_j\). Pela linearidade e pela monotonicidade da esperança condicional,
para todo \(j\). Tomando o supremo sobre \(j\), obtemos a desigualdade.
A convergência dominada também admite uma versão condicional.
Como \(|\xi |\leq \eta \) quase certamente, \(\xi \) é integrável. Defina
Então \(0\leq Z_n\leq 2\eta \) e \(Z_n\downarrow 0\) quase certamente. Pela linearidade, pelo corolário da monotonicidade e pela própria monotonicidade,
Pela monotonicidade, e modificando todas as versões numa única união enumerável de conjuntos nulos, podemos escolher \(W_n=\mathbf{E}[Z_n\mid \mathcal{G}]\) de modo que \(W_n\downarrow W\) quase certamente, com \(W\geq 0\). Para todo \(n\),
Pelo Teorema da Convergência Dominada, \(\mathbf{E}Z_n\to 0\). Logo, \(\mathbf{E}W=0\) e \(W=0\) quase certamente. A estimativa anterior conclui a prova.
Um fator já conhecido a partir de \(\mathcal{G}\) pode ser retirado da esperança condicional, sob as condições de integrabilidade do enunciado seguinte.
Primeiro suponha que \(\xi =\mathbb {1}_B\) para algum \(B\in \mathcal{G}\). Para todo \(A\in \mathcal{G}\),
Por linearidade, a identidade vale quando \(\xi \) é \(\mathcal{G}\)-mensurável simples.
Suponha agora \(\xi \geq 0\) e \(\eta \geq 0\). Tome funções simples \(\mathcal{G}\)-mensuráveis \(\xi _n\uparrow \xi \). A identidade já provada para \(\xi _n\) e o Teorema da Convergência Monótona, aplicado aos dois lados, dão, para todo \(A\in \mathcal{G}\),
Aplicando esse caso a \(|\xi |\) e \(|\eta |\), com \(A=\Omega \), obtemos
Como \(|\mathbf{E}[\eta \mid \mathcal{G}]|\leq \mathbf{E}[|\eta |\mid \mathcal{G}]\), o produto \(\xi \mathbf{E}[\eta \mid \mathcal{G}]\) é integrável. Finalmente, decompondo \(\xi \) e \(\eta \) em partes positiva e negativa e usando a linearidade, a identidade integral vale para toda \(A\in \mathcal{G}\). Como \(\xi \mathbf{E}[\eta \mid \mathcal{G}]\) é \(\mathcal{G}\)-mensurável, esse produto é uma versão de \(\mathbf{E}[\xi \eta \mid \mathcal{G}]\).
Usaremos essa propriedade no estudo de martingalas, ao separar o que já é conhecido da informação que ainda será observada.
14.4 Esperança Condicional como Projeção
As identidades seguintes descrevem o condicionamento sucessivo em duas informações encaixadas. Em qualquer ordem, a informação menos detalhada determina o resultado final.
\(\mathbf{E}[\mathbf{E}[\xi \mid \mathcal{G}_1]\mid \mathcal{G}_2]=\mathbf{E}[\xi \mid \mathcal{G}_1]\);
\(\mathbf{E}[\mathbf{E}[\xi \mid \mathcal{G}_2]\mid \mathcal{G}_1]=\mathbf{E}[\xi \mid \mathcal{G}_1]\),
Seja \(\mathcal{G}_1\subseteq \mathcal{G}_2\).
A variável \(\eta =\mathbf{E}[\xi \mid \mathcal{G}_1]\) é \(\mathcal{G}_1\)-mensurável e, portanto, também é \(\mathcal{G}_2\)-mensurável. Como uma variável integrável mensurável em relação à álgebra condicionante é sua própria esperança condicional,
\[ \mathbf{E}[\eta | \mathcal{G}_2] = \eta \]Mostraremos que \(\mathbf{E}[\xi \mid \mathcal{G}_1]\) é a esperança condicional de \(\mathbf{E}[\xi \mid \mathcal{G}_2]\) dada \(\mathcal{G}_1\).
Por definição, \(\mathbf{E}[\xi \mid \mathcal{G}_1]\) é \(\mathcal{G}_1\)-mensurável.
Para \( A \in \mathcal{G}_1 \), queremos mostrar que
\begin{equation} \label{cond_proj_2} \int _A\mathbf{E}[\xi \mid \mathcal{G}_1]\, d\P =\int _A\mathbf{E}[\xi \mid \mathcal{G}_2]\, d\P . \tag{14.1} \end{equation}Como \(A\in \mathcal{G}_1\subseteq \mathcal{G}_2\), a definição de esperança condicional mostra que ambos os lados de (14.1) são iguais a
\[ \displaystyle \int _A \xi \ d \P . \]
Isso prova o segundo item.
Aplique o primeiro item da proposição com \(\mathcal{G}_1=\mathcal{G}_2=\mathcal{G}\).
Portanto, a esperança condicional \(P:\xi \mapsto \mathbf{E}[\xi \mid \mathcal{G}]\) é uma projeção linear: \(P^2=P\). Sua imagem é \(\L ^1(\Omega ,\mathcal{G},\P )\), o subespaço das classes que possuem representante \(\mathcal{G}\)-mensurável.
Em \(\L ^2\), essa projeção é ortogonal: o erro não tem componente em nenhuma direção representada por uma variável baseada na informação de \(\mathcal{G}\).
Como \(\zeta \in \L ^2\) e \(\xi \in \L ^2\), os produtos envolvidos são integráveis. Pela Proposição 14.18,
Tomando esperanças e usando a definição de esperança condicional no evento \(\Omega \), obtemos
que é a identidade desejada.
Ponha \(Z=\mathbf{E}[\xi \mid \mathcal{G}]\) e \(\zeta =Z-\eta \in \L ^2(\Omega ,\mathcal{G},\P )\). Então
Pela Proposição 14.21, o produto cruzado tem esperança zero. Portanto, a identidade de Pitágoras dá
que é (14.2).
O termo melhor tem aqui um sentido preciso: entre os estimadores quadrado-integráveis que usam apenas a informação de \(\mathcal{G}\), a esperança condicional minimiza o erro quadrático médio.
Nos cálculos condicionais com variáveis normais, a seguinte independência será útil.
A densidade conjunta de \((X,Y)\) é
Faça a mudança linear
cuja inversa é \(x=(s+d)/2\), \(y=(s-d)/2\) e cujo jacobiano inverso tem módulo \(1/2\). Como
a densidade conjunta de \((S,D)\) é
Ela fatora no produto de duas densidades \(N(0,2)\), o que prova simultaneamente as distribuições marginais e a independência.
Seja \(\mathcal G=\sigma (A_1,\ldots ,A_m)\), onde \(A_1,\ldots ,A_m\) formam uma partição mensurável de \(\Omega \) e \(\P (A_j)\gt 0\) para todo \(j\). Se \(X\in L^1\), prove que Se \(Y\) assume os valores distintos \(y_1,y_2,\ldots \) e \(\P (Y=y_j)\gt 0\), prove que, para \(X\in L^1\), Explique como a fórmula deve ser interpretada nos valores \(y\) que têm probabilidade zero. Seja \(X\in L^1\) e seja \(\mathcal G\subseteq \mathcal F\) uma \(\sigma \)-álgebra independente de \(\sigma (X)\). Prove que Sejam \(\mathcal G_1\subseteq \mathcal G_2\subseteq \mathcal F\) e \(X\in L^1\). Prove a propriedade da torre Dê um exemplo mostrando que, em geral, \(\mathbf{E}[\mathbf{E}[X\mid \mathcal G_1]\mid \mathcal G_2]\) não recupera \(X\). Sejam \(X_1,\ldots ,X_n\) variáveis de Bernoulli i.i.d. de parâmetro \(p\) e \(S_n=X_1+\cdots +X_n\). Use a simetria entre as coordenadas para provar que Seja \(X\in L^2\) e \(\mathcal G\subseteq \mathcal F\). Prove a decomposição da variância onde Prove que a esperança condicional é uma contração: se \(X\in L^1\), então \(\| \mathbf{E}[X\mid \mathcal G]\| _1\leq \| X\| _1\); se \(X\in L^2\), então \(\| \mathbf{E}[X\mid \mathcal G]\| _2\leq \| X\| _2\). Indique em cada item se você está usando Jensen condicional ou a interpretação como projeção. Sejam \(X\) e \(Y\) independentes, ambos com distribuição \(N(0,1)\), e ponha \(S=X+Y\). Prove que Dica. Mostre que \(X-S/2=(X-Y)/2\) é independente de \(S\). Calcule o erro quadrático médio de \(S/2\) como estimador de \(X\) e compare-o com o erro do estimador constante \(0\). Seja \(A\in \mathcal F\), com \(0\lt \P (A)\lt 1\), e \(\mathcal G=\sigma (A)\). Para \(X\in L^1\), prove que Use essa fórmula para calcular uma esperança condicional concreta de sua escolha num espaço amostral finito. Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução
Ver solução