Capítulo 14

Esperança Condicional

Uma sub-\(\sigma \)-álgebra \(\mathcal{G}\subseteq \mathcal{F}\) representa informação parcial: determina quais eventos a informação disponível permite distinguir. Se \(\xi \) é integrável, queremos substituí-la por uma variável \(\eta \) que use apenas essa informação e preserve as médias sobre os eventos observáveis. Isso significa exigir

\[ \int _G\xi \, d\P =\int _G\eta \, d\P \qquad \text{para todo }G\in \mathcal{G}. \]

A variável \(\eta \) pode ser vista como uma versão desfocada de \(\xi \): não reproduz todos os seus valores, mas conserva a integral sobre cada evento de \(\mathcal{G}\). Em \(\L ^2\), veremos que ela é também a melhor aproximação de \(\xi \) baseada em \(\mathcal{G}\), no sentido do erro quadrático médio.

Definição 14.1
Seja \((\Omega ,\mathcal{F},\P )\) um espaço de probabilidade, seja \(\xi \) integrável e seja \(\mathcal{G}\subseteq \mathcal{F}\) uma sub-\(\sigma \)-álgebra. Uma esperança condicional de \(\xi \) dada \(\mathcal{G}\), denotada por \(\mathbf{E}[\xi \mid \mathcal{G}]\), é uma variável aleatória integrável \(\eta \) tal que:
  1. \(\eta \) é \(\mathcal{G}\)-mensurável;

  2. para todo \(G\in \mathcal{G}\),

    \[ \int _G\xi \, d\P =\int _G\eta \, d\P . \]

Primeiro verificaremos que essas condições determinam a esperança condicional a menos de conjuntos de probabilidade zero.

Teorema 14.2
A esperança condicional de uma variável aleatória integrável \(\xi \), se existir, é única quase certamente.

Demonstração

Suponha que \(\eta \) e \(\eta '\) satisfaçam as propriedades da esperança condicional. Pela segunda propriedade da definição,

\[ \displaystyle \int _A \eta \ d \P = \displaystyle \int _A \eta '\ d \P \text{ para todo } A \in \mathcal{G}. \]

Logo, \(\int _A(\eta -\eta ')\, d\P =0\) para todo \(A\in \mathcal{G}\). Para \(\varepsilon \gt 0\), considere \(A_\varepsilon =\{ \eta -\eta '\gt \varepsilon \} \in \mathcal{G}\). Então

\[ 0 = \displaystyle \int _{A_\epsilon } (\eta -\eta ') \ d \P \geq \P (A_\epsilon ) \cdot \epsilon . \]

Portanto, \(\P (A_\varepsilon )=0\) para todo \(\varepsilon \gt 0\). Como

\[ \{ \eta -\eta '\gt 0\} =\bigcup _{n=1}^\infty A_{1/n}, \]

a subaditividade enumerável implica

\[ \P (\eta -\eta '\gt 0) = 0. \]

Da mesma forma, trocando \(\eta \) e \(\eta '\), obtemos \(\P (\eta '-\eta \gt 0)=0\). Logo, \(\eta =\eta '\) quase certamente.

A existência geral será demonstrada na seção seguinte. Antes disso, vejamos como construir a variável condicional quando a informação disponível é dada por uma partição.

Exemplo 14.3

Seja \(G\) um evento tal que \(0\lt \P (G)\lt 1\) e seja \(\mathcal{G}=\sigma (G)=\{ \emptyset ,G,G^c,\Omega \} \). Então,

\[ \mathbf{E}[\xi | \mathcal{G}] (\omega ) = \left\{ \begin{array}{ll} \mathbf{E}[\xi | G], & \text{ se } \omega \in G \\ \mathbf{E}[\xi | G ^c], & \text{ se } \omega \in G ^c. \end{array} \right\} = \eta (\omega ) \]

onde \(\mathbf{E}[\xi \mid G]=\mathbf{E}[\xi \mathbb {1}_G]/\P (G)\). A variável aleatória definida acima é uma esperança condicional.

Demonstração

A variável \( \eta \) é \( \mathcal{G}\)-mensurável, porque \( \{ \omega : \eta (\omega ) \in B \} \) está em \( \mathcal{G}\) para todo conjunto de Borel \( B \) em \( \mathbb {R}\).

Pela definição das médias condicionadas aos eventos,

\[ \displaystyle \int _G \xi \ d \P = \displaystyle \int _G \eta \ d \P \]

e

\[ \displaystyle \int _{G ^c} \xi \ d \P = \displaystyle \int _{G ^c} \eta \ d \P . \]

As identidades para \(\emptyset \) e \(\Omega \) seguem dessas duas por aditividade. Logo, a igualdade das integrais vale para todo elemento de \(\mathcal{G}\).

A mesma construção vale para uma partição enumerável: em cada parte, tomamos a média correspondente.

Exemplo 14.4

Considere \((\Omega ,\mathcal{F},\P )\) e uma variável aleatória integrável \(\xi \). Seja \(\mathcal P=\{ A_k:k\geq 1\} \) uma partição enumerável de \(\Omega \), com \(\P (A_k)\gt 0\) para todo \(k\), e seja \(\sigma (\mathcal P)\) a \(\sigma \)-álgebra por ela gerada.

Então uma versão da esperança condicional é constante em cada elemento da partição e dada por

\[ \mathbf{E}[\xi \mid \sigma (\mathcal P)] =\sum _{k\geq 1}\mathbf{E}[\xi \mid A_k]\mathbb {1}_{A_k}. \]

A Figura 14.1 ilustra essa construção no caso unidimensional.

Heurística 14.5
Suponha que \(\xi \) seja o saldo de uma conta no fim do dia, mas que a informação disponível revele apenas a faixa em que ele caiu. A esperança condicional atribui, em cada faixa, a média compatível com a informação observada. Ela não recupera o saldo exato nem altera a média em qualquer união de faixas conhecidas. Faz médias, não adivinhações.

Figura 14.1 No espaço [0,1] com medida de Lebesgue, as esperanças condicionais de xi (x)=x^2 dadas pelas partições em quartos e em metades são as médias de xi em cada átomo.

Figura 14.1 No espaço \([0,1]\) com medida de Lebesgue, as esperanças condicionais de \(\xi (x)=x^2\) dadas pelas partições em quartos e em metades são as médias de \(\xi \) em cada átomo.

14.1 Existência e unicidade da esperança condicional

14.1.1 Existência em \(\L ^2\)

Em \(\L ^2\), a existência tem uma interpretação geométrica: condicionar é projetar sobre o subespaço das variáveis \(\mathcal{G}\)-mensuráveis.

No espaço de Hilbert \(\L ^2(\Omega , \mathcal{F}, \P )\), a norma é

\[ \| \xi \| _2 = (\mathbf{E}[ \xi ^2]) ^{1/2}. \]

Ela é induzida pelo produto interno

\[ \langle \xi , \eta \rangle = \mathbf{E}[ \xi \eta ]. \]

Lema 14.6
\(\L ^2(\Omega ,\mathcal{G},\P )\) é um subespaço fechado de \(\L ^2(\Omega ,\mathcal{F},\P )\).

Demonstração

Seja \((X_n)\) uma sequência em \(\L ^2(\Omega ,\mathcal{G},\P )\) que converge em \(\L ^2\) para \(X\in \L ^2(\Omega ,\mathcal{F},\P )\). Escolha uma subsequência \((X_{n_k})\) tal que

\[ \left\lVert X_{n_k}-X\right\rVert _2^2\leq 2^{-k}. \]

Para todo \(\varepsilon \gt 0\), a desigualdade de Markov dá

\[ \sum _{k=1}^\infty \P (|X_{n_k}-X|\gt \varepsilon ) \leq \frac1{\varepsilon ^2}\sum _{k=1}^\infty \left\lVert X_{n_k}-X\right\rVert _2^2\lt \infty . \]

Pelo primeiro lema de Borel–Cantelli, \(X_{n_k}\to X\) quase certamente. Como cada \(X_{n_k}\) é \(\mathcal{G}\)-mensurável, a variável \(\widetilde X=\limsup _kX_{n_k}\) também é \(\mathcal{G}\)-mensurável e satisfaz \(\widetilde X=X\) quase certamente. Assim, a classe de equivalência de \(X\) pertence a \(\L ^2(\Omega ,\mathcal{G},\P )\), que é, portanto, fechada.

Ilustração: Existência em \(\L ^2\)

Teorema 14.7 (Esperança condicional como projeção em \(\L ^2\))
Seja \((\Omega ,\mathcal{F},\P )\) um espaço de probabilidade e seja \(\mathcal{G}\subseteq \mathcal{F}\) uma sub-\(\sigma \)-álgebra. Seja
\[ P_{\mathcal{G}}:\L ^2(\Omega ,\mathcal{F},\P )\longrightarrow \L ^2(\Omega ,\mathcal{G},\P ) \]
a projeção ortogonal, cuja existência é garantida pelo Lema 14.6. Então, para qualquer \(\xi \in \L ^2(\Omega ,\mathcal{F},\P )\),
\[ \mathbf{E}[\xi \mid \mathcal{G}]=P_{\mathcal{G}}\xi \]
quase certamente.

Demonstração

Ponha \(\eta =P_{\mathcal{G}}\xi \). Por definição, \(\eta \in \L ^2(\Omega ,\mathcal{G},\P )\) e, portanto, possui uma versão \(\mathcal{G}\)-mensurável e integrável.

Para \(G\in \mathcal{G}\), a indicadora \(\mathbb {1}_G\) pertence a \(\L ^2(\Omega ,\mathcal{G},\P )\). Como \(\xi -\eta \) é ortogonal a esse subespaço,

\[ 0=\langle \xi -\eta ,\mathbb {1}_G\rangle =\int _G\xi \, d\P -\int _G\eta \, d\P . \]

Logo, \(\eta \) satisfaz a definição de \(\mathbf{E}[\xi \mid \mathcal{G}]\). A unicidade quase certa segue do Teorema 14.2.

14.1.2 Existência em \(\L ^1\)

Para variáveis apenas integráveis, não podemos recorrer diretamente à geometria de \(\L ^2\). O Teorema de Radon–Nikodým substitui a projeção e fornece a construção em \(\L ^1\).

Teorema 14.8
A esperança condicional de uma variável aleatória integrável \(\xi \) existe e é única quase certamente.

Demonstração

Suponha primeiro \(\xi \geq 0\). No espaço mensurável \((\Omega ,\mathcal{G})\), considere as medidas finitas

\[ \mu =\P |_{\mathcal{G}}, \qquad \nu (A)=\int _A\xi \, d\P , \quad A\in \mathcal{G}. \]

A medida \(\nu \) é finita porque \(\xi \) é integrável, e \(\nu \ll \mu \): se \(\P (A)=0\), então \(\int _A\xi \, d\P =0\). Pelo Teorema de Radon–Nikodým, existe uma função \(\mathcal{G}\)-mensurável \(f\geq 0\) tal que

\[ \nu (A)=\int _A f\, d\P \qquad \text{para todo }A\in \mathcal{G}. \]

Além disso, \(\int f\, d\P =\nu (\Omega )=\mathbf{E}\xi \lt \infty \). Portanto, \(f\) é integrável e satisfaz as duas propriedades da esperança condicional.

Para \(\xi \) arbitrária, escreva \(\xi =\xi ^+-\xi ^-\). Pelo caso não negativo, existem

\begin{align*} \eta _+& =\mathbf{E}[\xi ^+\mid \mathcal{G}],\\ \eta _-& =\mathbf{E}[\xi ^-\mid \mathcal{G}]. \end{align*}

A variável \(\eta =\eta _+-\eta _-\) é \(\mathcal{G}\)-mensurável e integrável. Para todo \(A\in \mathcal{G}\),

\[ \int _A\eta \, d\P =\int _A\eta _+\, d\P -\int _A\eta _-\, d\P =\int _A\xi ^+\, d\P -\int _A\xi ^-\, d\P =\int _A\xi \, d\P . \]

Isso prova a existência. A unicidade é o conteúdo do Teorema 14.2.

Os casos extremos esclarecem o papel da informação; a partição permite ver os casos intermediários.

Exemplo 14.9
  1. Para a \(\sigma \)-álgebra trivial \(\mathcal{G}=\{ \emptyset ,\Omega \} \), toda variável \(\mathcal{G}\)-mensurável é constante quase certamente. Nesse caso,

    \[ \mathbf{E}[\xi \mid \mathcal{G}]=\mathbf{E}\xi . \]

    Com efeito, para \(A=\Omega \),

    \[ \displaystyle \int _A (\mathbf{E}\xi ) \ d \P = \displaystyle \int _A \xi \ d \P \]

    e ambos os lados são iguais a \(\mathbf{E}\xi \); para \(A=\emptyset \), ambos são zero.

  2. Para a informação completa \(\mathcal{G}=\mathcal{F}\),

    \[ \mathbf{E}[\xi | \mathcal{G}] = \xi . \]

    A própria variável \(\xi \) satisfaz as duas condições da definição: com toda a informação, não resta nada a estimar.

  3. Suponha que \(\Omega =\bigsqcup _{k\geq 1}\Omega _k\) seja uma partição enumerável com \(\P (\Omega _k)\gt 0\), e tome \(\mathcal{G}=\sigma (\Omega _1,\Omega _2,\ldots )\). Então,

    \[ \mathbf{E}[\xi \mid \mathcal{G}](\omega ) =\sum _{k\geq 1}\frac{\mathbf{E}[\xi \mathbb {1}_{\Omega _k}]}{\P (\Omega _k)} \mathbb {1}_{\Omega _k}(\omega ). \]

    Essa função é \(\mathcal{G}\)-mensurável. Se \(A=\bigsqcup _{k\in I}\Omega _k\in \mathcal{G}\), a aditividade da integral mostra que sua integral em \(A\) é

    \[ \sum _{k\in I}\mathbf{E}[\xi \mathbb {1}_{\Omega _k}] =\int _A\xi \, d\P , \]

    verificando a segunda condição da definição.

14.2 Esperança Condicional em Relação a uma Variável Aleatória

Observar uma variável aleatória significa conhecer os eventos que ela permite distinguir. Por isso, condicionar em uma variável é condicionar na \(\sigma \)-álgebra por ela gerada.

Definição 14.10
Dadas duas variáveis aleatórias \(\xi \) e \(\eta \), com \(\xi \) integrável, definimos
\[ \mathbf{E}[\xi \mid \eta ]:=\mathbf{E}[\xi \mid \sigma (\eta )], \]
onde
\[ \sigma (\eta )=\{ \eta ^{-1}(B):B\in \mathcal B(\mathbb {R})\} . \]

Exemplo 14.11

Suponha que \(\eta \) tome os valores \(y_1,\ldots ,y_n\), todos com probabilidade positiva. Então \(\sigma (\eta )=\sigma (\Omega _1,\ldots ,\Omega _n)\), onde \(\Omega _k=\{ \eta =y_k\} \). Logo,

\[ \mathbf{E}[\xi \mid \eta ](\omega )=\mathbf{E}[\xi \mid \eta =y_k] \qquad \text{para }\omega \in \Omega _k. \]

14.3 Propriedades da Esperança Condicional

As propriedades seguintes decorrem das duas condições da definição e da unicidade quase certa. Em cada caso, a estratégia será verificar a mensurabilidade e a igualdade das integrais nos eventos de \(\mathcal{G}\).

Proposição 14.12 (Linearidade)
Se \(\xi \) e \(\eta \) são integráveis e \(a,b\in \mathbb {R}\), então
\[ \mathbf{E}[a\xi +b\eta \mid \mathcal{G}] =a\mathbf{E}[\xi \mid \mathcal{G}]+b\mathbf{E}[\eta \mid \mathcal{G}] \]
quase certamente.

Demonstração

A variável \(a\mathbf{E}[\xi \mid \mathcal{G}]+b\mathbf{E}[\eta \mid \mathcal{G}]\) é \(\mathcal{G}\)-mensurável e integrável. Além disso, para todo \(A\in \mathcal{G}\),

\begin{align*} \int _A\bigl(a\mathbf{E}[\xi \mid \mathcal{G}]+b\mathbf{E}[\eta \mid \mathcal{G}]\bigr)\, \d\P & =a\int _A\mathbf{E}[\xi \mid \mathcal{G}]\, \d\P +b\int _A\mathbf{E}[\eta \mid \mathcal{G}]\, \d\P \\ & =a\int _A\xi \, \d\P +b\int _A\eta \, \d\P \\ & =\int _A(a\xi +b\eta )\, \d\P . \end{align*}

Portanto, ela satisfaz a definição de \(\mathbf{E}[a\xi +b\eta \mid \mathcal{G}]\); a unicidade quase certa conclui a prova.

Corolário 14.13
A aplicação \(X\mapsto \mathbf{E}[X\mid \mathcal{G}]\) é um operador linear de \(\L ^1(\Omega ,\mathcal{F},\P )\) em \(\L ^1(\Omega ,\mathcal{G},\P )\).

Demonstração

A Proposição anterior fornece a linearidade. A existência, a integrabilidade e a \(\mathcal{G}\)-mensurabilidade da imagem seguem do Teorema 14.8 e da definição.

A esperança associa um número a cada variável integrável: é um funcional linear. A esperança condicional associa outra variável aleatória, mensurável em relação à informação disponível: é um operador linear.

Proposição 14.14 (Monotonicidade)
Se \(\xi \) e \(\eta \) são integráveis e \(\xi \leq \eta \) quase certamente, então
\[ \mathbf{E}[\xi \mid \mathcal{G}]\leq \mathbf{E}[\eta \mid \mathcal{G}] \]
quase certamente.

Demonstração

Para todo \(A\in \mathcal{G}\),

\begin{align*} \displaystyle \int _A \mathbf{E}[\xi | \mathcal{G}] \ d \P & = \displaystyle \int _A \xi \ d \P \\ & \leq \displaystyle \int _A \eta \ d \P \\ & = \displaystyle \int _A \mathbf{E}[\eta | \mathcal{G}] \ d \P \end{align*}

Ponha \(Z=\mathbf{E}[\eta \mid \mathcal{G}]-\mathbf{E}[\xi \mid \mathcal{G}]\). A variável \(Z\) é \(\mathcal{G}\)-mensurável e \(\int _AZ\, d\P \geq 0\) para todo \(A\in \mathcal{G}\). Se \(\{ Z\lt 0\} \) tivesse probabilidade positiva, algum conjunto \(\{ Z\leq -1/m\} \) também teria probabilidade positiva, e a integral de \(Z\) nesse conjunto seria estritamente negativa, uma contradição. Logo, \(Z\geq 0\) quase certamente.

Corolário 14.15
Se \(\xi \) é integrável, então
\[ \big|\mathbf{E}[\xi \mid \mathcal{G}]\big|\leq \mathbf{E}[|\xi |\mid \mathcal{G}] \]
quase certamente.

Demonstração

Como \(\xi \leq |\xi |\) e \(-\xi \leq |\xi |\), a monotonicidade e a linearidade dão

\[ \mathbf{E}[\xi \mid \mathcal{G}]\leq \mathbf{E}[|\xi |\mid \mathcal{G}], \qquad -\mathbf{E}[\xi \mid \mathcal{G}]\leq \mathbf{E}[|\xi |\mid \mathcal{G}]. \]

As duas desigualdades equivalem à conclusão.

Teorema 14.16 (Jensen condicional)
Se \(Y\in L^1\) e \(\varphi :\mathbb R\to \mathbb R\) é convexa, com \(\varphi (Y)\in L^1\), então
\[ \varphi \bigl(\mathbf{E}[Y\mid \mathcal{G}]\bigr) \leq \mathbf{E}[\varphi (Y)\mid \mathcal{G}] \]
quase certamente.

Demonstração

Uma função convexa real é o supremo de uma família enumerável de minorantes afins. Para ver isso, escolha uma reta de suporte em cada ponto racional. Se \(q_k\in \mathbb Q\) converge para \(x\), a convexidade mantém limitadas as inclinações dessas retas em qualquer intervalo compacto que contenha \(x\) no interior; pela continuidade de \(\varphi \), os valores das retas em \(x\) convergem para \(\varphi (x)\). Logo o supremo enumerável dessas retas coincide com \(\varphi \) em todo ponto.

Escreva os minorantes como \(\ell _j(x)=a_jx+b_j\). Pela linearidade e pela monotonicidade da esperança condicional,

\[ \ell _j\bigl(\mathbf{E}[Y\mid \mathcal{G}]\bigr) =\mathbf{E}[\ell _j(Y)\mid \mathcal{G}] \leq \mathbf{E}[\varphi (Y)\mid \mathcal{G}] \]

para todo \(j\). Tomando o supremo sobre \(j\), obtemos a desigualdade.

A convergência dominada também admite uma versão condicional.

Teorema 14.17 (Teorema da Convergência Dominada)
Suponha que \(\xi _n\to \xi \) quase certamente e que \(|\xi _n|\leq \eta \) quase certamente para todo \(n\), onde \(\eta \) é integrável. Então,
\[ \mathbf{E}[\xi _n\mid \mathcal{G}]\longrightarrow \mathbf{E}[\xi \mid \mathcal{G}] \qquad \text{quase certamente.} \]

Demonstração

Como \(|\xi |\leq \eta \) quase certamente, \(\xi \) é integrável. Defina

\[ Z_n=\sup _{k\geq n}|\xi _k-\xi |. \]

Então \(0\leq Z_n\leq 2\eta \) e \(Z_n\downarrow 0\) quase certamente. Pela linearidade, pelo corolário da monotonicidade e pela própria monotonicidade,

\begin{align*} \big|\mathbf{E}[\xi _n\mid \mathcal{G}]-\mathbf{E}[\xi \mid \mathcal{G}]\big| & =\big|\mathbf{E}[\xi _n-\xi \mid \mathcal{G}]\big|\\ & \leq \mathbf{E}[|\xi _n-\xi |\mid \mathcal{G}]\\ & \leq \mathbf{E}[Z_n\mid \mathcal{G}]. \end{align*}

Pela monotonicidade, e modificando todas as versões numa única união enumerável de conjuntos nulos, podemos escolher \(W_n=\mathbf{E}[Z_n\mid \mathcal{G}]\) de modo que \(W_n\downarrow W\) quase certamente, com \(W\geq 0\). Para todo \(n\),

\[ 0\leq \mathbf{E}W\leq \mathbf{E}W_n=\mathbf{E}Z_n. \]

Pelo Teorema da Convergência Dominada, \(\mathbf{E}Z_n\to 0\). Logo, \(\mathbf{E}W=0\) e \(W=0\) quase certamente. A estimativa anterior conclui a prova.

Um fator já conhecido a partir de \(\mathcal{G}\) pode ser retirado da esperança condicional, sob as condições de integrabilidade do enunciado seguinte.

Proposição 14.18 (Retirada do que é conhecido)
Se \(\eta \) é integrável, \(\xi \) é \(\mathcal{G}\)-mensurável e \(\xi \eta \) é integrável, então
\[ \mathbf{E}[\xi \eta \mid \mathcal{G}]=\xi \mathbf{E}[\eta \mid \mathcal{G}] \]
quase certamente.

Demonstração

Primeiro suponha que \(\xi =\mathbb {1}_B\) para algum \(B\in \mathcal{G}\). Para todo \(A\in \mathcal{G}\),

\[ \int _A\xi \mathbf{E}[\eta \mid \mathcal{G}]\, d\P =\int _{A\cap B}\mathbf{E}[\eta \mid \mathcal{G}]\, d\P =\int _{A\cap B}\eta \, d\P =\int _A\xi \eta \, d\P . \]

Por linearidade, a identidade vale quando \(\xi \) é \(\mathcal{G}\)-mensurável simples.

Suponha agora \(\xi \geq 0\) e \(\eta \geq 0\). Tome funções simples \(\mathcal{G}\)-mensuráveis \(\xi _n\uparrow \xi \). A identidade já provada para \(\xi _n\) e o Teorema da Convergência Monótona, aplicado aos dois lados, dão, para todo \(A\in \mathcal{G}\),

\[ \int _A\xi \mathbf{E}[\eta \mid \mathcal{G}]\, d\P =\int _A\xi \eta \, d\P . \]

Aplicando esse caso a \(|\xi |\) e \(|\eta |\), com \(A=\Omega \), obtemos

\[ \mathbf{E}\bigl[|\xi |\mathbf{E}(|\eta |\mid \mathcal{G})\bigr] =\mathbf{E}[|\xi |\, |\eta |]\lt \infty . \]

Como \(|\mathbf{E}[\eta \mid \mathcal{G}]|\leq \mathbf{E}[|\eta |\mid \mathcal{G}]\), o produto \(\xi \mathbf{E}[\eta \mid \mathcal{G}]\) é integrável. Finalmente, decompondo \(\xi \) e \(\eta \) em partes positiva e negativa e usando a linearidade, a identidade integral vale para toda \(A\in \mathcal{G}\). Como \(\xi \mathbf{E}[\eta \mid \mathcal{G}]\) é \(\mathcal{G}\)-mensurável, esse produto é uma versão de \(\mathbf{E}[\xi \eta \mid \mathcal{G}]\).

Usaremos essa propriedade no estudo de martingalas, ao separar o que já é conhecido da informação que ainda será observada.

14.4 Esperança Condicional como Projeção

As identidades seguintes descrevem o condicionamento sucessivo em duas informações encaixadas. Em qualquer ordem, a informação menos detalhada determina o resultado final.

Proposição 14.19 (Suavização/Elevação)
Se \(\xi \) é integrável e \(\mathcal{G}_1\subseteq \mathcal{G}_2\subseteq \mathcal{F}\), então
  1. \(\mathbf{E}[\mathbf{E}[\xi \mid \mathcal{G}_1]\mid \mathcal{G}_2]=\mathbf{E}[\xi \mid \mathcal{G}_1]\);

  2. \(\mathbf{E}[\mathbf{E}[\xi \mid \mathcal{G}_2]\mid \mathcal{G}_1]=\mathbf{E}[\xi \mid \mathcal{G}_1]\),

quase certamente.

Demonstração

Seja \(\mathcal{G}_1\subseteq \mathcal{G}_2\).

  1. A variável \(\eta =\mathbf{E}[\xi \mid \mathcal{G}_1]\) é \(\mathcal{G}_1\)-mensurável e, portanto, também é \(\mathcal{G}_2\)-mensurável. Como uma variável integrável mensurável em relação à álgebra condicionante é sua própria esperança condicional,

    \[ \mathbf{E}[\eta | \mathcal{G}_2] = \eta \]
  2. Mostraremos que \(\mathbf{E}[\xi \mid \mathcal{G}_1]\) é a esperança condicional de \(\mathbf{E}[\xi \mid \mathcal{G}_2]\) dada \(\mathcal{G}_1\).

    1. Por definição, \(\mathbf{E}[\xi \mid \mathcal{G}_1]\) é \(\mathcal{G}_1\)-mensurável.

    2. Para \( A \in \mathcal{G}_1 \), queremos mostrar que

      \begin{equation} \label{cond_proj_2} \int _A\mathbf{E}[\xi \mid \mathcal{G}_1]\, d\P =\int _A\mathbf{E}[\xi \mid \mathcal{G}_2]\, d\P . \tag{14.1} \end{equation}

      Como \(A\in \mathcal{G}_1\subseteq \mathcal{G}_2\), a definição de esperança condicional mostra que ambos os lados de (14.1) são iguais a

      \[ \displaystyle \int _A \xi \ d \P . \]

    Isso prova o segundo item.

Corolário 14.20
Se \(\xi \) é integrável, então
\[ \mathbf{E}[\mathbf{E}[\xi \mid \mathcal{G}]\mid \mathcal{G}]=\mathbf{E}[\xi \mid \mathcal{G}] \]
quase certamente.

Demonstração

Aplique o primeiro item da proposição com \(\mathcal{G}_1=\mathcal{G}_2=\mathcal{G}\).

Portanto, a esperança condicional \(P:\xi \mapsto \mathbf{E}[\xi \mid \mathcal{G}]\) é uma projeção linear: \(P^2=P\). Sua imagem é \(\L ^1(\Omega ,\mathcal{G},\P )\), o subespaço das classes que possuem representante \(\mathcal{G}\)-mensurável.

Em \(\L ^2\), essa projeção é ortogonal: o erro não tem componente em nenhuma direção representada por uma variável baseada na informação de \(\mathcal{G}\).

Proposição 14.21 (Ortogonalidade)
Se \(\xi \in \L ^2(\Omega ,\mathcal{F},\P )\), então
\[ \xi -\mathbf{E}[\xi \mid \mathcal{G}]\perp \L ^2(\Omega ,\mathcal{G},\P ). \]
Isto é, para todo \(\zeta \in \L ^2(\Omega ,\mathcal{G},\P )\),
\[ \mathbf{E}\! \left[\zeta \bigl(\xi -\mathbf{E}[\xi \mid \mathcal{G}]\bigr)\right]=0. \]

Demonstração

Como \(\zeta \in \L ^2\) e \(\xi \in \L ^2\), os produtos envolvidos são integráveis. Pela Proposição 14.18,

\[ \mathbf{E}[\zeta \xi \mid \mathcal{G}] =\zeta \mathbf{E}[\xi \mid \mathcal{G}]. \]

Tomando esperanças e usando a definição de esperança condicional no evento \(\Omega \), obtemos

\[ \mathbf{E}[\zeta \xi ] =\mathbf{E}\! \left[\zeta \mathbf{E}[\xi \mid \mathcal{G}]\right], \]

que é a identidade desejada.

Teorema 14.22 (A esperança condicional é o melhor estimador)
Se \(\xi \in \L ^2(\Omega ,\mathcal{F},\P )\), então, para toda \(\eta \in \L ^2(\Omega ,\mathcal{G},\P )\),

\begin{equation} \label{cond_exp_MELHOR} \mathbf{E}\! \left[\bigl(\xi -\mathbf{E}[\xi \mid \mathcal{G}]\bigr)^2\right] \leq \mathbf{E}[(\xi -\eta )^2]. \tag{14.2} \end{equation}

Demonstração

Ponha \(Z=\mathbf{E}[\xi \mid \mathcal{G}]\) e \(\zeta =Z-\eta \in \L ^2(\Omega ,\mathcal{G},\P )\). Então

\[ \xi -\eta =(\xi -Z)+\zeta . \]

Pela Proposição 14.21, o produto cruzado tem esperança zero. Portanto, a identidade de Pitágoras dá

\begin{align*} \mathbf{E}[(\xi -\eta )^2] & =\mathbf{E}[(\xi -Z)^2]+\mathbf{E}[\zeta ^2] +2\mathbf{E}[\zeta (\xi -Z)]\\ & =\mathbf{E}[(\xi -Z)^2]+\mathbf{E}[\zeta ^2]\\ & \geq \mathbf{E}[(\xi -Z)^2], \end{align*}

que é (14.2).

O termo melhor tem aqui um sentido preciso: entre os estimadores quadrado-integráveis que usam apenas a informação de \(\mathcal{G}\), a esperança condicional minimiza o erro quadrático médio.

Corolário 14.23
Em \(\L ^2(\Omega ,\mathcal{F},\P )\), a aplicação \(\xi \mapsto \mathbf{E}[\xi \mid \mathcal{G}]\) é a projeção ortogonal sobre o subespaço \(\L ^2(\Omega ,\mathcal{G},\P )\).

Demonstração

A imagem é \(\mathcal{G}\)-mensurável, e a Proposição 14.21 mostra que o erro é ortogonal ao subespaço. Essas duas propriedades caracterizam unicamente a projeção ortogonal, em acordo com o Teorema 14.7.

Nos cálculos condicionais com variáveis normais, a seguinte independência será útil.

Proposição 14.24 (Soma e diferença de normais independentes)
Se \(X\) e \(Y\) são independentes, ambos com distribuição \(N(0,1)\), então
\[ S=X+Y \qquad \text{e}\qquad D=X-Y \]
são independentes e ambos têm distribuição \(N(0,2)\).

Demonstração

A densidade conjunta de \((X,Y)\) é

\[ \frac1{2\pi }\exp \left\{ -\frac{x^2+y^2}{2}\right\} . \]

Faça a mudança linear

\[ s=x+y,\qquad d=x-y, \]

cuja inversa é \(x=(s+d)/2\), \(y=(s-d)/2\) e cujo jacobiano inverso tem módulo \(1/2\). Como

\[ x^2+y^2=\frac{s^2+d^2}{2}, \]

a densidade conjunta de \((S,D)\) é

\[ \frac1{4\pi }\exp \left\{ -\frac{s^2+d^2}{4}\right\} = \left(\frac1{\sqrt{4\pi }}e^{-s^2/4}\right) \left(\frac1{\sqrt{4\pi }}e^{-d^2/4}\right). \]

Ela fatora no produto de duas densidades \(N(0,2)\), o que prova simultaneamente as distribuições marginais e a independência.

Exercício 14.1

Seja \(\mathcal G=\sigma (A_1,\ldots ,A_m)\), onde \(A_1,\ldots ,A_m\) formam uma partição mensurável de \(\Omega \) e \(\P (A_j)\gt 0\) para todo \(j\). Se \(X\in L^1\), prove que

\[ \mathbf{E}[X\mid \mathcal G] =\sum _{j=1}^{m} \frac{\mathbf{E}[X\mathbb {1}_{A_j}]}{\P (A_j)} \mathbb {1}_{A_j} \qquad \text{quase certamente}. \]
Ver solução
O lado direito é \(\mathcal G\)-mensurável. Se \(G\in \mathcal G\), então \(G\) é união de algumas células \(A_j\), e a integral do lado direito sobre \(G\) é
\[ \sum _{A_j\subseteq G} \frac{\mathbf{E}[X\mathbb {1}_{A_j}]}{\P (A_j)}\P (A_j) =\mathbf{E}[X\mathbb {1}_G]. \]
Isso caracteriza a esperança condicional.
Exercício 14.2

Se \(Y\) assume os valores distintos \(y_1,y_2,\ldots \) e \(\P (Y=y_j)\gt 0\), prove que, para \(X\in L^1\),

\[ \mathbf{E}[X\mid Y] =g(Y), \qquad g(y_j)=\mathbf{E}[X\mid Y=y_j]. \]

Explique como a fórmula deve ser interpretada nos valores \(y\) que têm probabilidade zero.

Ver solução
\(g(Y)\) é \(\sigma (Y)\)-mensurável. Para cada átomo \(\{ Y=y_j\} \),
\[ \int _{\{ Y=y_j\} }g(Y)\, \d P =g(y_j)\P (Y=y_j)=\mathbf{E}[X\mathbb {1}_{\{ Y=y_j\} }]. \]
Somando átomos obtemos a identidade para todo evento de \(\sigma (Y)\). Nos valores que \(Y\) assume com probabilidade zero, \(g\) pode ser definida arbitrariamente, pois isso não altera \(g(Y)\) quase certamente.
Exercício 14.3

Seja \(X\in L^1\) e seja \(\mathcal G\subseteq \mathcal F\) uma \(\sigma \)-álgebra independente de \(\sigma (X)\). Prove que

\[ \mathbf{E}[X\mid \mathcal G]=\mathbf{E}[X] \qquad \text{quase certamente}. \]
Ver solução
A constante \(\mathbf{E}X\) é \(\mathcal G\)-mensurável. Para \(G\in \mathcal G\), a independência de \(G\) e \(X\) (primeiro para simples e depois por aproximação) dá \(\mathbf{E}[X\mathbb {1}_G]=\mathbf{E}X\, \P (G)=\int _G\mathbf{E}X\, \d P\). A caracterização da esperança condicional conclui.
Exercício 14.4

Sejam \(\mathcal G_1\subseteq \mathcal G_2\subseteq \mathcal F\) e \(X\in L^1\). Prove a propriedade da torre

\[ \mathbf{E}\bigl[\mathbf{E}[X\mid \mathcal G_2]\mid \mathcal G_1\bigr] =\mathbf{E}[X\mid \mathcal G_1]. \]

Dê um exemplo mostrando que, em geral, \(\mathbf{E}[\mathbf{E}[X\mid \mathcal G_1]\mid \mathcal G_2]\) não recupera \(X\).

Ver solução
\(Y=\mathbf{E}[X\mid \mathcal G_2]\) é integrável. Para \(G\in \mathcal G_1\subseteq \mathcal G_2\), \(\int _GY\, \d P=\int _GX\, \d P\); logo \(\mathbf{E}[Y\mid \mathcal G_1]=\mathbf{E}[X\mid \mathcal G_1]\). Para a recíproca, tome \(\mathcal G_1=\{ \varnothing ,\Omega \} \), \(\mathcal G_2=\sigma (X)\) e \(X\) integrável não constante. Então \(\mathbf{E}[\mathbf{E}[X\mid \mathcal G_1]\mid \mathcal G_2]=\mathbf{E}X\neq X\).
Exercício 14.5

Sejam \(X_1,\ldots ,X_n\) variáveis de Bernoulli i.i.d. de parâmetro \(p\) e \(S_n=X_1+\cdots +X_n\). Use a simetria entre as coordenadas para provar que

\[ \mathbf{E}[X_k\mid S_n]=\frac{S_n}{n} \qquad \text{quase certamente}, \quad k=1,\ldots ,n. \]
Ver solução
Condicionado a \(S_n=m\), todas as configurações com \(m\) sucessos têm a mesma probabilidade. Por simetria, \(\P (X_k=1\mid S_n=m)=m/n\); portanto \(\mathbf{E}[X_k\mid S_n=m]=m/n\). Equivalentemente, as \(n\) esperanças condicionais são iguais e sua soma é \(\mathbf{E}[S_n\mid S_n]=S_n\).
Exercício 14.6

Seja \(X\in L^2\) e \(\mathcal G\subseteq \mathcal F\). Prove a decomposição da variância

\[ \operatorname {Var}(X) =\mathbf{E}[\operatorname {Var}(X\mid \mathcal G)] +\operatorname {Var}(\mathbf{E}[X\mid \mathcal G]), \]

onde

\[ \operatorname {Var}(X\mid \mathcal G) =\mathbf{E}\bigl[(X-\mathbf{E}[X\mid \mathcal G])^2\mid \mathcal G\bigr]. \]
Ver solução
Ponha \(M=\mathbf{E}[X\mid \mathcal G]\). Como \(X-\mathbf{E}X=(X-M)+(M-\mathbf{E}X)\), ao elevar ao quadrado o termo cruzado tem esperança zero: \(\mathbf{E}[(X-M)(M-\mathbf{E}X)]=\mathbf{E}[(M-\mathbf{E}X)\mathbf{E}[X-M\mid \mathcal G]]=0\). Logo \(\operatorname {Var}X=\mathbf{E}[(X-M)^2]+\mathbf{E}[(M-\mathbf{E}X)^2]\), que são os dois termos exibidos.
Exercício 14.7

Prove que a esperança condicional é uma contração:

  1. se \(X\in L^1\), então \(\| \mathbf{E}[X\mid \mathcal G]\| _1\leq \| X\| _1\);

  2. se \(X\in L^2\), então \(\| \mathbf{E}[X\mid \mathcal G]\| _2\leq \| X\| _2\). Indique em cada item se você está usando Jensen condicional ou a interpretação como projeção.

Ver solução
Em \(L^1\) bastam a linearidade e a positividade da esperança condicional: de \(\mathbf{E}[X\mid \mathcal G]=\mathbf{E}[X^+\mid \mathcal G]-\mathbf{E}[X^-\mid \mathcal G]\), com as duas parcelas não negativas, segue
\[ \bigl|\mathbf{E}[X\mid \mathcal G]\bigr| \leq \mathbf{E}[X^+\mid \mathcal G]+\mathbf{E}[X^-\mid \mathcal G] =\mathbf{E}[|X|\mid \mathcal G], \]
e integrando obtemos \(\| \mathbf{E}[X\mid \mathcal G]\| _1\leq \| X\| _1\). (É a desigualdade de Jensen condicional aplicada a \(|\cdot |\), aqui obtida diretamente.) Em \(L^2\) usa-se a interpretação como projeção: como \(\mathbf{E}[\cdot \mid \mathcal G]\) é a projeção ortogonal sobre \(L^2(\mathcal G)\), a decomposição \(X=\mathbf{E}[X\mid \mathcal G]+\bigl(X-\mathbf{E}[X\mid \mathcal G]\bigr)\) é ortogonal e o teorema de Pitágoras dá
\[ \| X\| _2^2=\bigl\| \mathbf{E}[X\mid \mathcal G]\bigr\| _2^2 +\bigl\| X-\mathbf{E}[X\mid \mathcal G]\bigr\| _2^2 \geq \bigl\| \mathbf{E}[X\mid \mathcal G]\bigr\| _2^2 . \]
Exercício 14.8

Sejam \(X\) e \(Y\) independentes, ambos com distribuição \(N(0,1)\), e ponha \(S=X+Y\).

  1. Prove que

    \[ \mathbf{E}[X\mid S]=\frac S2. \]

    Dica. Mostre que \(X-S/2=(X-Y)/2\) é independente de \(S\).

  2. Calcule o erro quadrático médio de \(S/2\) como estimador de \(X\) e compare-o com o erro do estimador constante \(0\).

Ver solução
Ponha \(U=X-Y\) e \(V=X+Y=S\). Como \(X\) e \(Y\) são independentes e normais padrão, a densidade conjunta de \((X,Y)\) é
\[ f_{X,Y}(x,y)=\frac1{2\pi }\exp \! \left\{ -\frac{x^2+y^2}{2}\right\} . \]
A transformação inversa é
\[ x=\frac{u+v}{2},\qquad y=\frac{v-u}{2}, \]
cujo jacobiano tem módulo \(1/2\). Além disso, \(x^2+y^2=(u^2+v^2)/2\). Pela fórmula de mudança de variáveis,
\[ f_{U,V}(u,v) =\frac1{4\pi }\exp \! \left\{ -\frac{u^2+v^2}{4}\right\} =\left(\frac1{\sqrt{4\pi }}e^{-u^2/4}\right) \left(\frac1{\sqrt{4\pi }}e^{-v^2/4}\right). \]
Portanto \(U\) e \(V\) são independentes, ambos com distribuição \(N(0,2)\). Em particular, \((X-Y)/2=U/2\) é independente de \(S=V\) e tem média zero. Como
\[ X=\frac S2+\frac{X-Y}{2}, \]
segue que
\[ \mathbf{E}[X\mid S]=\frac S2. \]
Finalmente,
\[ \mathbf{E}[(X-S/2)^2] =\operatorname {Var}\! \left(\frac{X-Y}{2}\right) =\frac14\bigl(\operatorname {Var}X+\operatorname {Var}Y\bigr)=\frac12, \]
enquanto o estimador constante \(0\) tem erro quadrático \(\mathbf{E}[X^2]=1\).
Exercício 14.9

Seja \(A\in \mathcal F\), com \(0\lt \P (A)\lt 1\), e \(\mathcal G=\sigma (A)\). Para \(X\in L^1\), prove que

\[ \mathbf{E}[X\mid \mathcal G] =\mathbf{E}[X\mid A]\mathbb {1}_A +\mathbf{E}[X\mid A^c]\mathbb {1}_{A^c}. \]

Use essa fórmula para calcular uma esperança condicional concreta de sua escolha num espaço amostral finito.

Ver solução
As variáveis \(\mathcal G\)-mensuráveis são constantes em \(A\) e em \(A^c\). Impor a igualdade das integrais sobre esses dois átomos determina as constantes como \(\mathbf{E}[X\mid A]\) e \(\mathbf{E}[X\mid A^c]\). Por exemplo, em \(\Omega =\{ 1,2,3,4\} \) equiprovável, tome \(A=\{ 1,2\} \) e \(X(1),\ldots ,X(4)=(1,3,0,2)\). Então \(\mathbf{E}[X\mid \sigma (A)]=2\mathbb {1}_A+1\mathbb {1}_{A^c}\).