Capítulo 8

Medida Produto

Para estudar duas ou mais grandezas simultaneamente, precisamos medir subconjuntos de um produto de espaços. A medida produto realiza essa construção, e os teoremas de Tonelli e Fubini mostram quando uma integral em várias variáveis pode ser calculada por integrais sucessivas. A ordem de integração parece apenas tipográfica; sem as hipóteses corretas, não é.

Definição 8.1
Dados \((\Omega _1,\mathcal{F}_1)\) e \((\Omega _2,\mathcal{F}_2)\) espaços mensuráveis, definimos a \(\sigma \)-álgebra produto \(\mathcal{F}_1 \otimes \mathcal{F}_2\) como a \(\sigma \)-álgebra gerada pela coleção dos retângulos mensuráveis:
\begin{align*} \mathcal{F}_1 \otimes \mathcal{F}_2 = \sigma \left\langle \{ A \times B: A \in \mathcal{F}_1, B \in \mathcal{F}_2 \} \right\rangle \end{align*}

Figura 8.1 Retângulo mensurável em mathcalF_1otimes mathcalF_2.

Figura 8.1 Retângulo mensurável em \(\mathcal{F}_1\otimes \mathcal{F}_2\).

Nesse caso também diremos que o produto dos espaços mensuráveis \((\Omega _1, \mathcal{F}_1)\) e \((\Omega _2, \mathcal{F}_2)\) é o espaço mensurável \((\Omega _1 \times \Omega _2, \mathcal{F}_1 \otimes \mathcal{F}_2) .\)

As projeções oferecem outra descrição da \(\sigma \)-álgebra produto. Ao produto cartesiano \(\Omega _1 \times \Omega _2\) dos conjuntos \(\Omega _1\) e \(\Omega _2\) associamos as aplicações

\[ \pi _1\colon \Omega _1\times \Omega _2\longrightarrow \Omega _1, \qquad \pi _2\colon \Omega _1\times \Omega _2\longrightarrow \Omega _2. \]

Podemos fazer uso dessas aplicações para construir a \(\sigma \)-álgebra produto. Dados dois espaços mensuráveis \((\Omega _1, \mathcal{F}_1)\) e \((\Omega _2, \mathcal{F}_2)\), podemos formar uma coleção de subconjuntos em \(\Omega _1 \times \Omega _2\) puxando de \(\mathcal{F}_1 : \)

\[ \pi _1^*(\mathcal{F}_1):=\{ \pi _1^{-1}(E):E\in \mathcal{F}_1\} =\{ E\times \Omega _2:E\in \mathcal{F}_1\} . \]

A família \(\pi _1^*(\mathcal{F}_1)\) é uma \(\sigma \)-álgebra, pois a imagem inversa preserva complementos e uniões enumeráveis.

Podemos fazer a mesma construção para a projeção no segundo espaço.

Teorema 8.2 (Produto finito de \(\sigma \)-álgebras)
A \(\sigma \)-álgebra produto é a \(\sigma \)-álgebra gerada pelas imagens inversas das duas projeções:
\[ \mathcal{F}_1\otimes \mathcal{F}_2 =\sigma \langle \pi _1^*(\mathcal{F}_1)\cup \pi _2^*(\mathcal{F}_2)\rangle . \]

Demonstração

Para \(A\in \mathcal{F}_1\) e \(B\in \mathcal{F}_2\),

\[ A\times B =\pi _1^{-1}(A)\cap \pi _2^{-1}(B). \]

Logo todo retângulo mensurável pertence à \(\sigma \)-álgebra do lado direito. Reciprocamente, \(\pi _1^{-1}(A)=A\times \Omega _2\) e \(\pi _2^{-1}(B)=\Omega _1\times B\) são retângulos mensuráveis. Portanto, cada uma das duas famílias geradoras está contida em \(\mathcal{F}_1\otimes \mathcal{F}_2\), o que prova as duas inclusões.

Suponha que \(E \subset \Omega _1 \times \Omega _2 .\) Dado \(x \in \Omega _1\) e \(y \in \Omega _2\) , definimos a \(x\)-seção \(E^x \subset \Omega _2\) e a \(y\)-seção \(E^y \subset \Omega _1\) de \(E\) como

\[ E^y = \{ x \in \Omega _1 : (x, y) \in E\} \]
\[ E^x = \{ y \in \Omega _2 : (x, y) \in E\} \]

Conforme indicado na próxima proposição, todas as seções de um conjunto mensurável são mensuráveis.

Proposição 8.3

Se \((\Omega _1, \mathcal{F}_1)\) e \((\Omega _2, \mathcal{F}_2)\) são espaços mensuráveis e \(E \in \mathcal{F}_1 \otimes \mathcal{F}_2\), então \(E^x \in \mathcal{F}_2\) para todo \(x \in \Omega _1\) e \(E^y \in \mathcal{F}_1\) para todo \(y \in \Omega _2 .\)

Demonstração

Provaremos apenas para a seção \(E^y\); a demonstração para a seção \( E ^x \) é análoga.

Considere a família \(\mathcal{M}= \lbrace E \in \mathcal{F}_1 \otimes \mathcal{F}_2: E^y \in \mathcal{F}_1 \rbrace .\) Mostraremos que \(\mathcal{M}\) é uma \(\sigma \)-álgebra contendo os retângulos mensuráveis e logo deve ser \(\mathcal{F}_1 \otimes \mathcal{F}_2\), e isso é suficiente para demonstrar a proposição.

  • Suponha que \(E = A \times B\) é um retângulo mensurável. Então \(E^y=A\) quando \(y\in B\) e \(E^y=\emptyset \) quando \(y\notin B\). Em ambos os casos \(E^y \in \mathcal{F}_1\), logo \(E \in \mathcal{M} .\)

  • \(\emptyset ^y = \lbrace x \in \Omega _1: (x,y) \in \emptyset \rbrace = \emptyset \in \mathcal{F}_1\), assim \(\mathcal{M}\) contém \(\emptyset .\)

  • Se \(E_1, E_2, \dotsc \in \mathcal{M}\), então \((\bigcup E_n)^y = \bigcup E_n^y \in \mathcal{F}_1 .\) Logo \(\mathcal{M}\) é fechado em relação a união enumerável.

  • Se \(E \in \mathcal{M}\), e \(F = E^{\mathsf c}\), então \(F^y = \lbrace x \in \Omega _1: (x,y) \notin E \rbrace = \Omega _1 \setminus E^y \in \mathcal{F}_1 .\) Logo \(\mathcal{M}\) é fechada sob complementação.

Proposição 8.4
Suponha que \(\mathbb {R}^m\), \(\mathbb {R}^n\) estejam equipados com suas \(\sigma \)-álgebras Borel \(\mathcal{B}(\mathbb {R}^m), \mathcal{B}(\mathbb {R}^n)\) e seja \(\mathbb {R}^{m + n} = \mathbb {R}^m \times \mathbb {R}^n .\) Então
\[ \mathcal{B}(\mathbb {R}^{m + n}) = \mathcal{B}(\mathbb {R}^m) \otimes \mathcal{B}(\mathbb {R}^n). \]

Demonstração

Cada retângulo \(A\times B\), com \(A\in \mathcal{B}(\mathbb {R}^m)\) e \(B\in \mathcal{B}(\mathbb {R}^n)\), é boreliano em \(\mathbb {R}^{m+n}\), pois

\[ A\times B=\pi _1^{-1}(A)\cap \pi _2^{-1}(B) \]

e as projeções coordenadas são contínuas. Isso prova \(\mathcal{B}(\mathbb {R}^m)\otimes \mathcal{B}(\mathbb {R}^n)\subseteq \mathcal{B}(\mathbb {R}^{m+n})\).

Na direção contrária, escolha bases enumeráveis de abertos em \(\mathbb {R}^m\) e \(\mathbb {R}^n\). Os produtos de elementos dessas bases formam uma base enumerável da topologia de \(\mathbb {R}^{m+n}\). Todo aberto de \(\mathbb {R}^{m+n}\) é, portanto, união enumerável desses retângulos e pertence a \(\mathcal{B}(\mathbb {R}^m)\otimes \mathcal{B}(\mathbb {R}^n)\). Como os abertos geram a \(\sigma \)-álgebra de Borel, segue a inclusão oposta.

Suponha que \((\Omega _1, \mathcal{F}_1)\) e \((\Omega _2, \mathcal{F}_2)\) sejam espaços mensuráveis. A interseção de retângulos mensuráveis é um retângulo mensurável

\[ (A \times B) \cap (C \times D) = (A \cap C) \times (B \cap D), \]

e o complemento de um retângulo mensurável é uma união finita de retângulos

\[ (A \times B)^c = (A^c \times B) \cup (A \times B^c) \cup (A^c \times B^c). \]

Assim, a família de uniões finitas de retângulos mensuráveis em \(\Omega _1 \times \Omega _2\) forma uma álgebra, que denotamos por \(\mathcal{F}_0 .\) Esta álgebra não é, em geral, uma \(\sigma \)-álgebra, mas gera a mesma \(\sigma \)-álgebra produto que os retângulos mensuráveis.

Teorema 8.5 (Existência da medida produto)

Dados espaços de medida \(\sigma \)-finitos \((\Omega _1,\mathcal{F}_1,\mu _1)\) e \((\Omega _2,\mathcal{F}_2,\mu _2)\), existe uma única medida \(\mu \) em \(\mathcal{F}_1\otimes \mathcal{F}_2\) satisfazendo

\[ \mu (A\times B)=\mu _1(A)\mu _2(B), \qquad A\in \mathcal{F}_1,\ B\in \mathcal{F}_2. \]

Diremos que \(\mu \) é a medida produto de \(\mu _1\) e \(\mu _2 .\) E será denotada por \(\mu _1 \otimes \mu _2 .\)

Demonstração

Seja \(\mathcal F_0\) a álgebra das uniões finitas disjuntas de retângulos mensuráveis. Para \(E\in \mathcal F_0\), defina

\[ \mu _0(E):=\int _{\Omega _1}\mu _2(E^x)\, \d\mu _1(x). \]

Como \(E\) é união finita de retângulos, a função \(x\mapsto \mu _2(E^x)\) é mensurável e simples; em particular, a definição faz sentido. Para um retângulo,

\[ \mu _0(A\times B) =\int _{\Omega _1}\mathbb {1}_A(x)\mu _2(B)\, \d\mu _1(x) =\mu _1(A)\mu _2(B). \]

Se \((E_k)\) é uma sequência disjunta em \(\mathcal F_0\) cuja união \(E\) ainda pertence a \(\mathcal F_0\), então, para cada \(x\), as seções \(E_k^x\) são disjuntas e \(E^x=\bigcup _kE_k^x\). Pela aditividade de \(\mu _2\) e pela Convergência Monótona,

\[ \mu _0(E) =\int \sum _{k=1}^\infty \mu _2(E_k^x)\, \d\mu _1(x) =\sum _{k=1}^\infty \mu _0(E_k). \]

Logo \(\mu _0\) é uma pré-medida, e o Teorema de Extensão de Carathéodory fornece uma medida \(\mu \) em \(\sigma \langle \mathcal F_0\rangle =\mathcal{F}_1\otimes \mathcal{F}_2\).

Para a unicidade, escolha \(U_j\uparrow \Omega _1\) e \(V_j\uparrow \Omega _2\) com \(\mu _1(U_j),\mu _2(V_j)\lt \infty \). Os retângulos \(U_j\times V_j\) crescem para o espaço produto e têm medida finita. Assim, o segundo caso do Teorema de Unicidade de Medidas 2.14, aplicado ao \(\pi \)-sistema dos retângulos, mostra que a extensão é única.

Corolário 8.6 (Produto finito de medidas)
Sejam \((\Omega _j,\mathcal{F}_j,\mu _j)\), \(1\leq j\leq n\), espaços de medida \(\sigma \)-finitos. Existe uma única medida \(\sigma \)-finita
\[ \mu _1\otimes \cdots \otimes \mu _n \]
na \(\sigma \)-álgebra produto \(\mathcal{F}_1\otimes \cdots \otimes \mathcal{F}_n\), definida por iteração, tal que
\[ (\mu _1\otimes \cdots \otimes \mu _n) (A_1\times \cdots \times A_n) =\prod _{j=1}^n\mu _j(A_j) \]
para todo retângulo mensurável \(A_1\times \cdots \times A_n\). Sob a identificação natural dos produtos cartesianos, essa medida não depende da parentização dos fatores.

Demonstração

Itere o teorema anterior. O produto de duas medidas \(\sigma \)-finitas é \(\sigma \)-finito, pois produtos dos conjuntos de uma exaustão por conjuntos de medida finita fornecem uma exaustão do espaço produto. Assim a construção pode ser repetida um número finito de vezes.

As diferentes parentizações produzem medidas na mesma \(\sigma \)-álgebra: todas as \(\sigma \)-álgebras iteradas são geradas pelos retângulos \(A_1\times \cdots \times A_n\). Além disso, todas as medidas obtidas atribuem a cada retângulo o valor \(\prod _j\mu _j(A_j)\). A unicidade no \(\pi \)-sistema dos retângulos, usando a \(\sigma \)-finitude, mostra que essas medidas coincidem.

Teorema 8.7 (Mensurabilidade de Funções com Variável Fixa)

Sejam \((\Omega _1 \times \Omega _2, \mathcal{F}_1 \otimes \mathcal{F}_2)\) e \((Z, \mathcal{M})\) espaços mensuráveis.

Se \(f\colon \Omega _1 \times \Omega _2 \to Z\) é mensurável, então as funções \(f^y\colon \Omega _1 \to Z\), \(f^x\colon \Omega _2 \to Z\) obtidas fixando uma variável também são mensuráveis.

Demonstração

Provaremos apenas para \(f^y .\) Seja \(I^y\colon \Omega _1 \to \Omega _1 \times \Omega _2\) a aplicação de inclusão \(I^y(x) = (x,y) .\) Dado \(E \in \mathcal{F}_1 \otimes \mathcal{F}_2\), por 8.3 \((I^y)^{-1}(E) = E^y \in \mathcal{F}_1\), logo \(I^y\) é uma função mensurável. Mas \(f^y = f \circ I^y .\)

8.1 Áreas de Seções Transversais

Um conjunto no espaço produto pode ser examinado fixando uma coordenada. As medidas dessas seções desempenham o papel abstrato de áreas transversais e serão o integrando na fórmula da medida produto.

Teorema 8.8 (Mensurabilidade das áreas das seções)
Sejam \((\Omega _1, \mathcal{F}_1, \mu )\), \((\Omega _2, \mathcal{F}_2, \nu )\) espaços de medida \(\sigma \)-finitos. Se \(E \in \mathcal{F}_1 \otimes \mathcal{F}_2\),
  • \(\nu (E^x)\) é uma função mensurável de \(x \in \Omega _1 .\)

  • \(\mu (E^y)\) é uma função mensurável de \(y \in \Omega _2 .\)

Demonstração

Provaremos a mensurabilidade de \(y\mapsto \mu (E^y)\); a outra afirmação segue trocando os fatores. Suponha primeiro que \(\mu (\Omega _1)\lt \infty \) e ponha

\[ \mathcal{M} = \lbrace E \in \mathcal{F}_1 \otimes \mathcal{F}_2: \mu (E^y) \text{ é uma função mensurável de }y \rbrace \, . \]

\(\mathcal{M}\) é igual à \(\mathcal{F}_1 \otimes \mathcal{F}_2\), pois:

  • Se \(E=A\times B\) é um retângulo mensurável, então \(\mu (E^y)=\mu (A)\mathbb {1}_B(y)\), que é mensurável. Se \(E\) é uma união finita disjunta de retângulos mensuráveis \(E_j\), então \(\mu (E^y)=\sum _j\mu (E_j^y)\), que também é mensurável.

    Então \(\mathcal{M}\) contém a álgebra das uniões finita disjuntas de retângulos mensuráveis.

  • Se \(E_n\) são conjuntos crescentes em \(\mathcal M\), então \(\mu \bigl((\bigcup _n E_n)^y\bigr) = \mu (\bigcup _n E_n^y) = \lim \limits _{n\to \infty } \mu (E_n^y)\) é mensurável, e logo \(\bigcup _n E_n \in \mathcal{M} .\)

    De modo análogo, se \(E_n\) são conjuntos decrescentes em \(\mathcal M\), então a continuidade por cima dá

    \[ \mu \bigl((\bigcap _nE_n)^y\bigr) =\lim _n\mu (E_n^y). \]

    Aqui se usa a finitude de \(\mu (\Omega _1)\).

  • Assim \(\mathcal{M}\) é uma classe monótona contendo a álgebra das uniões finitas de retângulos mensuráveis. Pelo Teorema da Classe Monótona (1.29), \(\mathcal{M} =\mathcal{F}_1 \otimes \mathcal{F}_2 .\)

No caso \(\sigma \)-finito, escolha \(\Omega _{1,n}\uparrow \Omega _1\) com \(\mu (\Omega _{1,n})\lt \infty \) e reaplique o argumento à medida finita \(\mu _n(F)=\mu (F\cap \Omega _{1,n})\). Então

\[ \mu (E^y)=\lim _{n\to \infty }\mu _n(E^y), \]

que é mensurável como limite de funções mensuráveis.

8.2 Integrais Iteradas

Construímos a medida produto por extensão de Carathéodory e sabemos quanto ela vale nos retângulos. As seções permitem agora calculá-la em conjuntos mensuráveis gerais por uma fórmula integral explícita.

Teorema 8.9 (Fórmula integral da medida produto)
Sejam \((\Omega _1, \mathcal{F}_1, \mu )\) e \((\Omega _2, \mathcal{F}_2, \nu )\) espaços de medida \(\sigma \)-finitos. Para todo \(E\in \mathcal{F}_1\otimes \mathcal{F}_2\),
\[ (\mu \otimes \nu )(E) = \displaystyle \int _{x \in \Omega _1} \underbrace{\displaystyle \int _{y \in \Omega _2} \mathbb {1}_{E} \d\nu } _{\nu (E^x)} \ \d\mu = \displaystyle \int _{y \in \Omega _2} \underbrace{\displaystyle \int _{x \in \Omega _1} \mathbb {1}_{E} \d\mu } _{\mu (E^y)} \d\nu \, . \]

Demonstração

Denote por \(\lambda _1(E)\) a primeira integral iterada e por \(\lambda _2(E)\) a segunda. Essas integrais existem pelo Teorema 8.8. As medidas \(\lambda _1\) e \(\lambda _2\) são \(\sigma \)-aditivas pelo Teorema da Convergência Monótona logo ambas são medidas em \(\mathcal{F}_1 \otimes \mathcal{F}_2 .\) Mais ainda se \(E = A \times B\), então expandindo as duas integrais temos \(\lambda _1(E) = \mu (A) \nu (B) = \lambda _2(E) .\)

As três medidas são \(\sigma \)-finitas e coincidem no \(\pi \)-sistema dos retângulos. Pelo Teorema de Unicidade de Medidas 2.14, \(\lambda _1=\lambda _2=\mu \otimes \nu \) em toda \(\mathcal{F}_1\otimes \mathcal{F}_2\).

Teorema 8.10 (Tonelli)
Sejam \((\Omega _1,\mathcal{F}_1,\mu )\) e \((\Omega _2,\mathcal{F}_2,\nu )\) espaços de medida \(\sigma \)-finitos.
  1. Se \(f\colon \Omega _1\times \Omega _2\to [0,\infty ]\) é \(\mathcal{F}_1\otimes \mathcal{F}_2\)-mensurável, então as funções

    \[ x\longmapsto \int _{\Omega _2}f(x,y)\, \d\nu (y), \qquad y\longmapsto \int _{\Omega _1}f(x,y)\, \d\mu (x) \]

    são mensuráveis e

    \[ \int _{\Omega _1\times \Omega _2}f\, \d(\mu \otimes \nu ) = \int _{\Omega _1}\left(\int _{\Omega _2}f(x,y)\, \d\nu (y)\right)\d\mu (x) = \int _{\Omega _2}\left(\int _{\Omega _1}f(x,y)\, \d\mu (x)\right)\d\nu (y), \]

    com valores em \([0,\infty ]\).

  2. Se \(g\colon \Omega _1\times \Omega _2\to \mathbb {R}\) é mensurável, então \(g\) é \(\mu \otimes \nu \)-integrável se e somente se

    \[ \int _{\Omega _1} \left(\int _{\Omega _2}|g(x,y)|\, \d\nu (y)\right)\d\mu (x)\lt \infty . \]

    Equivalentemente, a mesma condição pode ser escrita com a ordem das integrais invertida.

Demonstração

Para funções simples não negativas, a mensurabilidade das integrais parciais segue do Teorema 8.8, e as igualdades seguem da linearidade e do Teorema 8.9. Para \(f\geq 0\) mensurável, tome funções simples \(s_n\uparrow f\). As integrais parciais de \(s_n\) crescem para as integrais parciais de \(f\); logo estas são mensuráveis. Aplicando a Convergência Monótona no espaço produto e em cada integral iterada, obtemos as duas igualdades do primeiro item.

Aplicando o primeiro item a \(|g|\), temos

\[ \int _{\Omega _1\times \Omega _2}|g|\, \d(\mu \otimes \nu ) = \int _{\Omega _1} \left(\int _{\Omega _2}|g(x,y)|\, \d\nu (y)\right)\d\mu (x), \]

e analogamente na ordem inversa. Portanto, qualquer uma dessas quantidades é finita se e somente se \(g\) é integrável.

Teorema 8.11 (Fubini)
Sejam \((\Omega _1, \mathcal{F}_1, \mu )\) e \((\Omega _2, \mathcal{F}_2, \nu )\) espaços de medida \(\sigma \)-finitos. Se \(\xi \colon \Omega _1\times \Omega _2\to \mathbb {R}\) é \(\mu \otimes \nu \)-integrável, então as seções são integráveis quase em toda parte e
\[ \displaystyle \int _{\Omega _1 \times \Omega _2} \xi \, d(\mu \otimes \nu ) = \displaystyle \int _{x \in \Omega _1} \Biggl[ \displaystyle \int _{y \in \Omega _2} \xi (x,y) \d\nu \Biggr] d\mu = \displaystyle \int _{y \in \Omega _2} \Biggl[ \displaystyle \int _{x \in \Omega _1} \xi (x,y) \d\mu \Biggr] \d\nu \, . \]

Demonstração

Aplique Tonelli a \(|\xi |\). Como

\[ \int _{\Omega _1\times \Omega _2}|\xi |\, \d(\mu \otimes \nu )\lt \infty , \]

as integrais de \(|\xi |\) nas seções são finitas quase em toda parte; portanto as seções de \(\xi \) são integráveis fora de conjuntos nulos. Aplicando Tonelli a \(\xi ^+\) e \(\xi ^-\) e subtraindo as duas identidades, obtemos a primeira integral iterada. O mesmo argumento na ordem inversa fornece a segunda.

Corolário 8.12 (Representação por camadas)
Se \((E,\mathcal E,\mu )\) é um espaço de medida \(\sigma \)-finito, \(f:E\to [0,\infty ]\) é mensurável e \(r\gt 0\), então
\[ \int _E f^r\, \d\mu = r\int _0^\infty t^{r-1}\mu (f\gt t)\, \d t, \]
com a igualdade entendida em \([0,\infty ]\). Em particular,
\[ \int _E f\, \d\mu =\int _0^\infty \mu (f\gt t)\, \d t, \]
e, se \(0\leq f\leq 1\), a integral externa pode ser restrita a \([0,1]\).

Demonstração

Para todo \(x\in E\),

\[ f(x)^r=\int _0^\infty r t^{r-1}\mathbb {1}_{\{ f(x)\gt t\} }\, \d t. \]

O conjunto \(\{ (x,t):f(x)\gt t\} \) é mensurável, pois

\[ \{ (x,t):f(x)\gt t\} =\bigcup _{q\in \mathbb Q_{\gt 0}}\{ f\gt q\} \times (0,q). \]

Logo o integrando no lado direito é mensurável e não negativo. Tonelli permite integrar primeiro em \(x\) ou em \(t\), produzindo a fórmula.

Resumidamente, se uma integral dupla é absolutamente convergente, então é válido mudar a ordem de integração.

Exemplo 8.13

Se \( \xi \) não é não-negativa, a hipótese de convergência absoluta é crucial para mudar a ordem de integração.

Um contraexemplo elementar é a sequência duplamente indexada \(a_{m,n}=(-m)^n/n!\), para \(m\geq 1\) e \(n\geq 0\). Somando primeiro em \(n\), obtemos \(\sum _{n\geq 0}a_{m,n}=e^{-m}\) e, portanto,

\[ \sum _{m\geq 1}\sum _{n\geq 0}a_{m,n} =\sum _{m\geq 1}e^{-m}=\frac1{e-1}. \]

Para cada \(n\) fixo, entretanto, os termos \(a_{m,n}\) nem sequer tendem a zero quando \(m\to \infty \), de modo que a soma na ordem inversa não existe. A série dupla não é absolutamente convergente.

8.3 Distribuição Conjunta

A medida produto volta agora à probabilidade. Para um vetor aleatório, a distribuição conjunta registra simultaneamente as coordenadas e, ao contrário das marginais isoladas, conserva a dependência entre elas.

Definição 8.14 (Distribuição conjunta)
Se \(\xi =(\xi _1,\ldots ,\xi _n)\) for um vetor aleatório definido em \((\Omega ,\mathcal{F},\P )\), então \(\xi \) induz uma medida de probabilidade \(\P _\xi \) em \(\mathbb {R}^n\), dada, para \(A\in \mathcal{B}(\mathbb {R}^n)\), por

\begin{equation} \label{eq:distribuicao-conjunta} \P _\xi (A)=\P (\xi ^{-1}(A))=\P (\xi \in A). \tag{8.1} \end{equation}

Essa medida é denominada distribuição conjunta de \(\xi \).

Definição 8.15 (Função de Distribuição Conjunta)

Se \(\xi =(\xi _1,\ldots ,\xi _n)\) for um vetor aleatório, sua função de distribuição conjunta é

\[ F_\xi (x_1,\ldots ,x_n) =\P (\xi _1\leq x_1,\ldots ,\xi _n\leq x_n). \]

A partir da definição da independência vemos que a função de distribuição conjunta fatora como o produto de funções de distribuição.

\[ F _{(\xi _1, \ldots , \xi _n)} (x_1, \ldots , x_n) = F_{\xi _1} (x_1) \times \cdots \times F_{\xi _n} (x_n), \]

Teorema 8.16
As variáveis aleatórias \(\xi _1,\ldots ,\xi _n\) são independentes se e somente se sua distribuição conjunta satisfaz
\[ \P _\xi =\P _{\xi _1}\otimes \cdots \otimes \P _{\xi _n}. \]

Demonstração

Se as variáveis são independentes, então, para quaisquer \(A_k\in \mathcal{B}(\mathbb {R})\),

\[ \P _\xi (A_1\times \cdots \times A_n) =\P (\xi _1\in A_1,\ldots ,\xi _n\in A_n) =\prod _{k=1}^n\P _{\xi _k}(A_k). \]

As duas probabilidades coincidem no \(\pi \)-sistema dos retângulos; pelo Teorema de Unicidade de Medidas 2.14, coincidem em toda \(\mathcal{B}(\mathbb {R}^n)\).

Reciprocamente, se a distribuição conjunta é a medida produto, a mesma identidade vale para todo retângulo boreliano. Essa identidade é exatamente a definição de independência de \(\xi _1,\ldots ,\xi _n\).

Assim, a independência equivale a dizer que a lei conjunta é o produto das leis marginais; as variáveis não precisam estar originalmente definidas num espaço produto.

8.4 Extensão de Kolmogorov em \({\mathbb {R}}^{\mathbb {N}}\)

Para construir conjuntamente uma sequência de variáveis aleatórias, precisamos de um espaço no qual todas possam ser observadas. Passamos, por isso, dos produtos finitos aos produtos infinitos, que também servirão de espaço amostral para processos estocásticos.

Nessa seção nos concentraremos na construção de medidas no espaço \({\mathbb {R}}^{\mathbb {N}}\), onde todas as ideias centrais são apresentadas. Posteriormente, na Seção 8.8, o argumento que apresentaremos será generalizado para produtos mais gerais.

Para provar o Teorema de Extensão de Kolmogorov, seguiremos os passos de Bochner[10, 2]. Antes de entrarmos diretamente nos espaços produto, apresentaremos algumas definições e resultados que preparam essa construção.

Considere então um conjunto \(\Omega \) e uma sequência crescente \(\{ \mathcal{F}_n\} _{n=1}^\infty \) de \(\sigma \)-álgebras em \(\Omega .\) E para cada \(n\), seja \(\mu _n\) uma medida de probabilidade na \(\sigma \)-álgebra \(\mathcal{F}_n .\)

Definição 8.17
Diremos que a sequência \(\{ (\mathcal{F}_n, \mu _n)\} _{n=1}^\infty \) é Kolmogorov consistente se sempre que \(m\leq n\) temos \(\mathcal{F}_m \subset \mathcal{F}_n\) e \(\mu _n |_{\mathcal{F}_m} = \mu _m .\)

Dado \(\mathcal A= \bigcup _{n=1}^\infty \mathcal{F}_n\), uma extensão da sequência de probabilidades \(\{ \mu _n\} _{n=1}^\infty \) é uma medida \(\mu \) em \(\sigma \langle \mathcal{A}\rangle \) satisfazendo \(\mu _n=\mu |_{\mathcal{F}_n} .\)

Teorema 8.18 (Extensão de Bochner)
Dado \(\{ (\mathcal{F}_n, \mu _n)\} _{n=1}^\infty \) uma sequência Kolmogorov consistente. Suponha que existe uma classe compacta \(\mathcal{K}\subseteq \bigcup _{n=1}^\infty \mathcal{F}_n\) de \(\Omega \) tal que
\[ \mu _n (A) = \sup \{ \mu _n (C): C \in \mathcal K\cap \mathcal{F}_n \text{ e } C \subset A\} . \]
Então existe uma única extensão de Kolmogorov para a \(\sigma \)-álgebra \( \sigma \langle \bigcup _{n=1}^\infty \mathcal{F}_n\rangle .\)

Demonstração

Defina \(\mu \) na álgebra \(\mathcal A=\bigcup _{n=1}^\infty \mathcal{F}_n\) por \(\mu (E)=\mu _n(E)\) para \(E\in \mathcal{F}_n .\) A condição de consistência de Kolmogorov garante que \(\mu \) está bem definida. Também é simples ver que \(\mu (\emptyset )=0\) e \(\mu (\Omega )=1 .\)

A aditividade finita de \(\mu \) é direta. Se \(A_i\in \mathcal A\), para \(i=1,\ldots ,r\), existe \(m\) tal que \(A_i\in \mathcal{F}_m\) para todos esses índices; basta então usar a aditividade de \(\mu _m\).

Para concluir a demonstração, observamos que se \(A\in \mathcal A\), então existe \(n\) tal que \(A\in \mathcal{F}_n\) e

\begin{align*} \mu (A) & =\mu _n(A) \\ & =\sup \{ \mu (C): C \in \mathcal K\cap \mathcal{F}_n \text{ e } C \subset A\} \\ & \leq \sup \{ \mu (C): C \in \mathcal K\text{ e } C \subset A\} \\ & \leq \mu (A). \end{align*}

Assim, pelo Teorema de Extensão Compacta 2.29, \(\mu \) é uma pré-medida. O Teorema de Extensão de Carathéodory fornece então uma extensão a uma probabilidade em \(\sigma \langle \mathcal A\rangle \); como a pré-medida é finita, essa extensão é única.

Com essas ferramentas, voltamos à construção de medidas de probabilidade em

\[ {\mathbb {R}}^{\mathbb {N}} = \{ (\omega _1, \omega _2, \dots ): \omega _i \in \mathbb {R}, i\in \mathbb {N}\} . \]

Figura 8.2 Representação visual de ℝ^N.

Figura 8.2 Representação visual de \({\mathbb {R}}^{\mathbb {N}}\).

O primeiro passo é eleger uma \(\sigma \)-álgebra onde definiremos nossa medida. Considere a classe dos cilindros retangulares de dimensão finita:

Definição 8.19
Definimos
\[ \mathcal C =\left\{ \left\{ \omega :\omega _i\in (a_i,b_i]\text{ para } i=1,\ldots ,k\right\} :k\in \mathbb {N},\ -\infty \leq a_i\lt b_i\leq \infty \right\} . \]
A \(\sigma \)-álgebra produto em \({\mathbb {R}}^{\mathbb {N}}\) é
\[ \mathcal{B}(\mathbb {R})^{\otimes \mathbb {N}}:=\sigma \langle \mathcal C\rangle . \]

Figura 8.3 Representação visual de um cilindro em ℝ^N. Em azul um ponto do cilindro.

Figura 8.3 Representação visual de um cilindro em \({\mathbb {R}}^{\mathbb {N}}\). Em azul um ponto do cilindro.

Observação 8.20

Esta é, de fato, a \(\sigma \)-álgebra com a qual trabalhamos intuitivamente nos cursos mais básicos de probabilidade. Lembre, por exemplo, que quando queremos estudar o “lançamento de infinitas moedas", sempre descrevemos os eventos de interesse a partir de eventos que dependem do resultado de finitos lançamentos. Mesmo eventos do tipo \(A=\{ \text{observamos cara infinitas vezes}\} \) é escrito como

\[ A=\bigcap _{k=1}^\infty \bigcup _{n=k}^\infty A_n, \]

com \(A_n=\{ \text{observamos cara na } n\text{-ésima jogada}\} .\)

Para aplicar o Teorema 8.18, fixaremos uma notação para os cilindros. Dado \(B\subset \mathbb {R}^n\), denotaremos por \(B\times \mathbb {R}^{\mathbb {N}-n}\) o conjunto:

\[ B\times \mathbb {R}^{\mathbb {N}-n}:=\{ (\omega _1, \omega _2, \dots ) \text{ tais que } (\omega _1,\dots ,\omega _n)\in B\} \]

Se \(A\in \mathcal C\), então existem \(n\in \mathbb {N}\) e \(B\in \mathcal{B}(\mathbb {R}^n)\) tais que \(A=B\times \mathbb {R}^{\mathbb {N}-n}\).

Considere agora a sequência encaixante de \(\sigma \)-álgebras:

\[ \mathcal{F}_n=\{ A\times \mathbb {R}^{\mathbb {N}-n}:A\in \mathcal{B}(\mathbb {R}^n)\} . \]

Se \(m\lt n\) e \(B\in \mathcal{B}(\mathbb {R}^m)\), então

\[ B\times \mathbb {R}^{\mathbb {N}-m}=(B\times \mathbb {R}^{n-m})\times \mathbb {R}^{\mathbb {N}-n}\in \mathcal{F}_n, \]

de modo que \(\mathcal{F}_m\subset \mathcal{F}_n\), e \(\mathcal A=\bigcup _{n=1}^\infty \mathcal{F}_n\) é uma álgebra, com \(\mathcal C\subseteq \mathcal A .\)

Proposição 8.21
\(\sigma \langle \mathcal A\rangle =\sigma \langle \mathcal C\rangle .\)

Demonstração

Como \(\mathcal C\subset \mathcal A\), temos imediatamente \(\sigma \langle \mathcal C\rangle \subset \sigma \langle \mathcal A\rangle .\) Para ver a inclusão contrária, dado \(n\geq 1\), faça \(\mathcal{G}_n=\{ A\in \mathcal{B}(\mathbb {R}^n):A\times \mathbb {R}^{\mathbb {N}-n}\in \sigma \langle \mathcal C\rangle \} \). Como \(\mathcal{G}_n\) é uma \(\sigma \)-álgebra contendo os retângulos do tipo

\[ \prod _{k=1}^n(a_k,b_k]\subset \mathbb {R}^n, \]

então \(\mathcal{G}_n=\mathcal{B}(\mathbb {R}^n) .\) Segue que \(\mathcal{F}_n\subseteq \sigma \langle \mathcal C\rangle \) para todo \(n\geq 1\) e

\[ \sigma \langle \mathcal A\rangle \subseteq \sigma \langle \mathcal C\rangle . \]

Teorema 8.22 (Extensão de Kolmogorov em \({\mathbb {R}}^{\mathbb {N}}\))
Dadas medidas de probabilidade \(\P _n\) em \((\mathbb {R}^n,\mathcal{B}(\mathbb {R}^n))\) tais que
\[ \P _{n + 1} ((a_1, b_1] \times \dots \times (a_n, b_n] \times \mathbb {R}) = \P _n ((a_1, b_1] \times \dots \times (a_n, b_n]), \]
para todo \(n\geq 1\) e todos os intervalos indicados, existe uma única medida de probabilidade \(\P \) em \(({\mathbb {R}}^{\mathbb {N}},\mathcal{B}(\mathbb {R})^{\otimes \mathbb {N}})\) com
\[ \P \{ \omega : \omega _i \in (a_i, b_i], 1 \leq i \leq n\} = \P _n ((a_1, b_1] \times \dots \times (a_n, b_n]). \]

Demonstração

Para começar, dado \(n\geq 1\) defina a medida de probabilidade \(Q_n\) em \((\mathbb {R}^n,\mathcal{B}(\mathbb {R}^n))\) por

\[ Q_n(A)=\P _{n+1}(A\times \mathbb {R}). \]

Como \(Q_n\) coincide com \(\P _n\) no \(\pi \)-sistema dos retângulos \(\prod _{k=1}^n(a_k,b_k]\), o Teorema de Unicidade de Medidas 2.14 mostra que ambas coincidem em toda \(\mathcal{B}(\mathbb {R}^n)\). Logo, para todo \(n\geq 1\) e \(A\in \mathcal{B}(\mathbb {R}^n)\),

\[ \P _{n+1}(A\times \mathbb {R})=\P _n(A), \]

e por indução

\[ \P _{n+m}(A\times \mathbb {R}^m)=\P _n(A). \]

Com a notação introduzida anteriormente, defina a medida \(\mu _n\) em \(({\mathbb {R}}^{\mathbb {N}},\mathcal{F}_n)\) por

\[ \mu _n(B\times \mathbb {R}^{\mathbb {N}-n})=\P _n(B). \]

Se \(m\lt n\) e \(D\in \mathcal{B}(\mathbb {R}^m)\), então

\[ \mu _n(D\times \mathbb {R}^{\mathbb {N}-m}) =\P _n(D\times \mathbb {R}^{n-m}) =\P _m(D) =\mu _m(D\times \mathbb {R}^{\mathbb {N}-m}). \]

Concluímos que \(\{ (\mathcal{F}_n,\mu _n)\} _{n\geq 1}\) é Kolmogorov consistente.

Considere agora as classes de cilindros

\[ \mathcal{K}_n=\{ K\times \mathbb {R}^{\mathbb {N}-n}, K \in \mathcal{B}(\mathbb {R}^n) \text{ compacto } \} \quad \text{ e } \quad \mathcal{K}=\bigcup _{n\geq 1}\mathcal K_n . \]

Observe que, se \(C\in \mathcal K_n\) e \(D\in \mathcal K_m\), com \(m\lt n\), então \(C\cap D\in \mathcal K_n\).

Afirmamos que classe \(\mathcal{K}\) é compacta, o que provaremos no lema a seguir.

Dado agora um conjunto \(A \in \mathcal A \) então \(A=D\times \mathbb {R}^{\mathbb {N}-n}\) com \(D \in \mathcal{B}(\mathbb {R}^n)\), para algum \(n\geq 1\). Pela regularidade interior das probabilidades de Borel em \(\mathbb {R}^n\), para todo \(\varepsilon \gt 0\) existe um compacto \(K\subseteq D\) tal que

\[ \mu _n\bigl(A\setminus (K\times \mathbb {R}^{\mathbb {N}-n})\bigr) =\P _n(D\setminus K)\lt \varepsilon . \]

Em particular,

\[ \mu _n(A)\leq \mu _n(K\times \mathbb {R}^{\mathbb {N}-n})+\varepsilon . \]

Consequentemente

\[ \mu _n(A) = \sup \{ \mu _n(C): C \in \mathcal K\cap \mathcal{F}_n\text{ e } C \subset A\} . \]

e o teorema segue do Teorema 8.18.

Dado \(A\in \mathcal A\) não vazio, definimos \(\dim (A):=\min \{ n\geq 1: A\in \mathcal{F}_n\} \), e \(\dim ({\mathbb {R}}^{\mathbb {N}})=0\).

Se \(A_1,A_2\in \mathcal A\) e \(A_1\cap A_2\neq \varnothing \), então \(\dim (A_1\cap A_2)\leq \max \{ \dim (A_1),\dim (A_2)\} \). De fato, se \(m\lt n\) e \(A_1=B_1\times \mathbb {R}^{\mathbb {N}-m}\), \(A_2=B_2\times \mathbb {R}^{\mathbb {N}-n}\), então

\[ (B_1\times \mathbb {R}^{\mathbb {N}-m})\cap (B_2\times \mathbb {R}^{\mathbb {N}-n})=((B_1\times \mathbb {R}^{n-m})\cap B_2)\times \mathbb {R}^{\mathbb {N}-n}\in \mathcal{F}_n. \]

Lema 8.23
A classe \(\mathcal{K}\) definida na demonstração anterior como
\[ \mathcal{K}_n=\{ K\times \mathbb {R}^{\mathbb {N}-n}, K \in \mathcal{B}(\mathbb {R}^n) \text{ compacto } \} \quad \text{ e } \quad \mathcal{K}=\bigcup _{n\geq 1}\mathcal K_n . \]
é compacta.

Demonstração

Considere uma sequência \((C_i)_{i\geq 1}\) em \(\mathcal K\) e suponha que

\[ B_m:=\bigcap _{i=1}^m C_i\neq \varnothing \qquad \text{para todo }m\geq 1. \]

Para cada \(i\), escolha \(r_i\) tal que \(C_i\in \mathcal K_{r_i}\) e defina \(d_m=\max \{ r_1,\ldots ,r_m\} \). Como os cilindros de menor nível são fechados e algum dos cilindros que formam \(B_m\) tem base compacta em \(\mathbb {R}^{d_m}\), existe um compacto não vazio \(L_m\subseteq \mathbb {R}^{d_m}\) tal que

\[ B_m=L_m\times \mathbb {R}^{\mathbb {N}-d_m}. \]

A sequência \((d_m)_{m\geq 1}\) é não decrescente. Distinguimos os mesmos dois casos sugeridos pelos níveis dos cilindros.

Se \((d_m)\) é limitada, existe \(d\) e existe \(m_0\) tais que \(d_m=d\) para \(m\geq m_0\). Nesse caso os compactos não vazios \(L_m\subseteq \mathbb {R}^d\) são decrescentes. A compacidade de \(L_{m_0}\) implica \(\bigcap _{m\geq m_0}L_m\neq \varnothing \), e portanto

\[ \bigcap _{i=1}^\infty C_i =\bigcap _{m=m_0}^\infty B_m =\left(\bigcap _{m=m_0}^\infty L_m\right)\times \mathbb {R}^{\mathbb {N}-d} \neq \varnothing . \]

Suponha agora que \(d_m\to \infty \). Escolha \(x^{(m)}\in B_m\) para cada \(m\). Fixada a coordenada \(j\), tome \(m_j\) tal que \(d_{m_j}\geq j\). Para \(m\geq m_j\), temos \(x^{(m)}\in B_m\subseteq B_{m_j}\); assim, a \(j\)-ésima coordenada de \(x^{(m)}\) pertence, a partir de \(m_j\), à projeção compacta \(\pi _j(L_{m_j})\). Extraímos sucessivamente uma subsequência na qual a primeira coordenada converge, depois uma subsequência desta na qual a segunda coordenada converge, e assim por diante. O procedimento diagonal fornece uma subsequência \((y^{(\ell )})_{\ell \geq 1}\) de \((x^{(m)})_{m\geq 1}\) que converge coordenada a coordenada para algum \(y\in {\mathbb {R}}^{\mathbb {N}}\).

Fixe \(p\geq 1\). A partir de certo índice, \(y^{(\ell )}\in B_p\). Escrevendo \(B_p=L_p\times \mathbb {R}^{\mathbb {N}-d_p}\), as primeiras \(d_p\) coordenadas de \(y^{(\ell )}\) convergem para as de \(y\). Como \(L_p\) é fechado, \(y\in B_p\). Isso vale para todo \(p\), logo

\[ y\in \bigcap _{p=1}^\infty B_p =\bigcap _{i=1}^\infty C_i. \]

Em ambos os casos, a propriedade da interseção finita implica que a interseção enumerável é não vazia. Pela contrapositiva, \(\mathcal K\) é uma classe compacta.

8.5 Existência de Variáveis Aleatórias Independentes

O produto de medidas não apenas descreve independência: ele permite construí-la. As projeções coordenadas do espaço produto terão as leis prescritas e serão independentes por definição da medida.

Teorema 8.24
Dadas probabilidades \( \P _1, \ldots , \P _n \) em \( \mathbb {R}\), então existem variáveis aleatórias independentes \( \xi _1, \ldots , \xi _n \) com distribuições \( \P _1, \ldots , \P _n .\)

Demonstração

Considere o espaço de probabilidade

\[ (\Omega ,\mathcal{F},\P ) =(\mathbb {R}^n,\mathcal{B}(\mathbb {R}^n),\P _1\otimes \cdots \otimes \P _n) \]

e defina \(\xi _k(x_1,\ldots ,x_n)=x_k\). As projeções coordenadas são mensuráveis. Para \(A_1,\ldots ,A_n\in \mathcal{B}(\mathbb {R})\),

\[ \P (\xi _1\in A_1,\ldots ,\xi _n\in A_n) =(\P _1\otimes \cdots \otimes \P _n)(A_1\times \cdots \times A_n) =\prod _{k=1}^n\P _k(A_k). \]

Logo \(\xi _1,\ldots ,\xi _n\) são independentes e a distribuição de \(\xi _k\) é \(\P _k\).

Podemos generalizar o resultado anterior para sequências de variáveis aleatórias i.i.d.

Teorema 8.25 (Sequências de variáveis i.i.d.)
Seja \(F\) uma distribuição em \(\mathbb {R}\), então existe uma sequência de variáveis aleatórias independentes \( \xi _1, \ldots , \xi _n, \ldots \) com distribuição \(F .\)

Demonstração

Para cada \(n\geq 1\), seja \(\P _n=F^{\otimes n}\) em \(\mathbb {R}^n\). Essas probabilidades são consistentes, pois

\[ \P _{n+1}(A\times \mathbb {R})=F^{\otimes n}(A)F(\mathbb {R})=\P _n(A) \]

para todo \(A\in \mathcal{B}(\mathbb {R}^n)\). Pelo Teorema de Extensão de Kolmogorov, existe uma probabilidade \(\P \) em \(({\mathbb {R}}^{\mathbb {N}},\mathcal{B}(\mathbb {R})^{\otimes \mathbb {N}})\) com essas marginais. Defina \(\xi _k(\omega )=\omega _k\). As projeções são mensuráveis e, para \(A_1,\ldots ,A_n\in \mathcal{B}(\mathbb {R})\),

\[ \P (\xi _1\in A_1,\ldots ,\xi _n\in A_n) =\prod _{k=1}^nF(A_k). \]

Logo as coordenadas são independentes e cada uma tem distribuição \(F\).

Agora vamos traduzir a teoria desenvolvida até aqui para densidades. Uma função mensurável \(f\colon \mathbb {R}\to [0,\infty )\) é uma densidade de \(\xi \) se

\[ \P (\xi \in A)=\int _Af(x)\, \d x \qquad \text{para todo }A\in \mathcal{B}(\mathbb {R}). \]

Necessariamente \(\int _{\mathbb {R}} f\, \d x=1\), e a densidade é determinada apenas quase em toda parte. Do mesmo modo, uma densidade conjunta de \(\xi =(\xi _1,\ldots ,\xi _n)\) é uma função mensurável \(\mathbf f\colon \mathbb {R}^n\to [0,\infty )\) tal que

\[ \P (\xi \in A)=\int _A\mathbf f(x)\, \d x \qquad \text{para todo }A\in \mathcal{B}(\mathbb {R}^n). \]

Teorema 8.26
Sejam \(\xi _1,\ldots ,\xi _n\) variáveis aleatórias com densidades marginais \(f_1,\ldots ,f_n\) e densidade conjunta \(\mathbf f\). Então \(\xi _1,\ldots ,\xi _n\) são independentes se e somente se
\[ \mathbf f(x_1,\ldots ,x_n)=\prod _{i=1}^nf_i(x_i) \]
para quase todo \((x_1,\ldots ,x_n)\in \mathbb {R}^n\).
Para passar de identidades de integrais a identidades pontuais entre densidades, usaremos a seguinte ferramenta de análise real.
Teorema 8.27 (Teorema de Diferenciação de Lebesgue)
Se \(f\in L^1(\mathbb {R})\), então
\[ \lim _{\epsilon \downarrow 0} \frac1\epsilon \int _x^{x+\epsilon }f(y)\, \d y=f(x) \]
para quase todo \(x\in \mathbb {R}\).

Demonstração

É o caso \(n=1\) da versão multidimensional enunciada a seguir.

Teorema 8.28 (Diferenciação de Lebesgue em \(\mathbb {R}^n\))
Se \(f\in L^1(\mathbb {R}^n)\) e \(Q_\epsilon (x)=\prod _{i=1}^n[x_i,x_i+\epsilon ]\), então
\[ \lim _{\epsilon \downarrow 0} \frac1{\epsilon ^n}\int _{Q_\epsilon (x)}f(y)\, \d y=f(x) \]
para quase todo \(x\in \mathbb {R}^n\).

Demonstração

A prova analítica parte da desigualdade maximal fraca \((1,1)\) de Hardy–Littlewood. Para \(g\in C_c(\mathbb {R}^n)\), a média sobre \(Q_\epsilon (x)\) converge uniformemente a \(g(x)\) em compactos. Dado \(f\in L^1\), aproxime-o em \(L^1\) por tais funções \(g\). A desigualdade maximal controla, por uma constante vezes \(\| f-g\| _1/t\), a medida do conjunto onde o limite superior das médias de \(|f-g|\) excede \(t\). Fazendo primeiro \(\| f-g\| _1\to 0\) e depois \(t\downarrow 0\), obtém-se a convergência quase em toda parte. Essa ferramenta clássica, cuja prova completa pertence à análise real, pode ser consultada em [17].

Prova do Teorema 8.26

Suponha primeiro que as variáveis sejam independentes. Para \(x=(x_1,\ldots ,x_n)\) e \(\epsilon \gt 0\), a independência dá

\begin{align*} \frac1{\epsilon ^n}\int _{Q_\epsilon (x)}\mathbf f(y)\, \d y & =\frac1{\epsilon ^n} \prod _{i=1}^n\P (x_i\leq \xi _i\leq x_i+\epsilon )\\ & =\prod _{i=1}^n \left(\frac1\epsilon \int _{x_i}^{x_i+\epsilon }f_i(y_i)\, \d y_i\right). \end{align*}

Pelos dois teoremas de diferenciação, o lado esquerdo converge a \(\mathbf f(x)\) para quase todo \(x\), e cada fator do lado direito converge a \(f_i(x_i)\) fora de um conjunto nulo. Pelo Teorema de Fubini, a união dos conjuntos excepcionais coordenados ainda tem medida de Lebesgue nula em \(\mathbb {R}^n\). Logo \(\mathbf f(x)=\prod _i f_i(x_i)\) quase em toda parte.

Reciprocamente, suponha essa fatoração. Para \(A_1,\ldots ,A_n\in \mathcal{B}(\mathbb {R})\), Fubini–Tonelli fornece

\begin{align*} \P (\xi _1\in A_1,\ldots ,\xi _n\in A_n) & =\int _{A_1\times \cdots \times A_n}\prod _{i=1}^nf_i(x_i)\, \d x\\ & =\prod _{i=1}^n\int _{A_i}f_i(x_i)\, \d x_i =\prod _{i=1}^n\P (\xi _i\in A_i). \end{align*}

Essa é a definição de independência.

Vejamos alguns exemplos.

Exemplo 8.29 (Distribuição Uniforme)
Sejam \( \xi \) e \( \eta \) variáveis aleatórias independentes, distribuídas uniformemente em \( [0,1] .\) Assim, a densidade de \( \xi \) e \( \eta \) é dada pela função de densidade
\[ f (x) = \left\{ \begin{array}{ll} 1, & x \in [0,1] \\ 0, & \text{ caso contrário.} \end{array} \right. \]
Portanto, a densidade conjunta de \( \xi \) e \( \eta \) é
\[ \varphi (x, y) = \left\{ \begin{array}{ll} 1, & \text{ se } (x, y) \in [0,1] \times [0,1] \\ 0, & \text{ caso contrário.} \end{array} \right. \]

Exemplo 8.30 (Distribuição Gaussiana em \(\mathbb {R}^n\))

Também denominada de distribuição normal multivariada. A densidade de cada coordenada \( \xi _k \) é dada pela gaussiana padrão unidimensional

\[ f (x) = \frac1{\sqrt{2 \pi }} e ^{- x ^2/2}, x \in \mathbb {R} \]

e as coordenadas são independentes, então a densidade de \( (\xi _1, \ldots , \xi _n) \) é

\[ \varphi (x_1,\ldots ,x_n) =\frac1{(2\pi )^{n/2}}\exp \left(-\frac{\| x\| ^2}{2}\right), \]

onde \(\| x\| ^2=x_1^2+\cdots +x_n^2\).

Faremos agora uma demonstração alternativa da afirmação de que para variáveis independentes a esperança do produto é o produto das esperanças. Compare essa demonstração com a demonstração do Teorema 7.21.

Teorema 8.31
Sejam \(\xi , \eta \in \L ^1 (\P )\) independentes. Então \((\xi \eta ) \in \L ^1 (\P )\) e
\[ \mathbf{E}[\xi \eta ] = \mathbf{E}[ \xi ] \times \mathbf{E}[ \eta ]. \]

Demonstração

A distribuição conjunta de \((\xi ,\eta )\) é \(\P _\xi \otimes \P _\eta \). Por Tonelli,

\[ \mathbf{E}|\xi \eta | =\int _{\mathbb {R}^2}|xy|\, \d(\P _\xi \otimes \P _\eta )(x,y) =\left(\int _{\mathbb {R}}|x|\, \d\P _\xi (x)\right) \left(\int _{\mathbb {R}}|y|\, \d\P _\eta (y)\right)\lt \infty . \]

Portanto \(\xi \eta \) é integrável e Fubini pode ser aplicado:

\[ \mathbf{E}[\xi \eta ] =\int _{\mathbb {R}^2}xy\, \d(\P _\xi \otimes \P _\eta )(x,y) =\left(\int _{\mathbb {R}} x\, \d\P _\xi (x)\right) \left(\int _{\mathbb {R}} y\, \d\P _\eta (y)\right) =\mathbf{E}[\xi ]\mathbf{E}[\eta ]. \]

8.6 Convolução e Soma de Variáveis Aleatórias Independentes

Se conhecemos apenas as distribuições de \(\xi \) e \(\eta \), a distribuição de \(\xi +\eta \) não está determinada, embora sua esperança esteja, quando existe. Para ver isso, tome uma variável simétrica \(\xi \), isto é, \(\xi \stackrel d=-\xi \). Um exemplo é o resultado de uma moeda honesta, com cara representada por \(1\) e coroa por \(-1\).

As somas \(\xi +\xi \) e \(\xi +(-\xi )\) têm parcelas com as mesmas distribuições, mas a primeira é \(2\xi \) e a segunda é identicamente nula. Portanto, é preciso conhecer a distribuição conjunta dos somandos. Sob independência, ela é o produto das marginais e podemos calcular a lei da soma.

Teorema 8.32
Se \(\xi \) e \(\eta \) são variáveis aleatórias independentes com funções de distribuição \(F\) e \(G\), respectivamente, então a função de distribuição de \(\xi +\eta \) é
\[ H(z)=\int _{\mathbb {R}} F(z-y)\, \d G(y) =\int _{\mathbb {R}} G(z-x)\, \d F(x). \]

Demonstração

Pela independência, a distribuição conjunta de \((\xi ,\eta )\) é \(\P _\xi \otimes \P _\eta \). Tonelli aplicado à indicadora do semiplano \(\{ (x,y):x+y\leq z\} \) dá

\begin{align*} H(z) & =\int _{\mathbb {R}^2}\mathbb {1}_{\{ x+y\leq z\} }\, \d(\P _\xi \otimes \P _\eta )(x,y)\\ & =\int _{\mathbb {R}}\left(\int _{\mathbb {R}}\mathbb {1}_{\{ x\leq z-y\} }\, \d\P _\xi (x)\right) \d\P _\eta (y)\\ & =\int _{\mathbb {R}} F(z-y)\, \d\P _\eta (y) =\int _{\mathbb {R}} F(z-y)\, \d G(y). \end{align*}

Trocando a ordem de integração, obtemos \(H(z)=\int _{\mathbb {R}} G(z-x)\, \d F(x)\).

Corolário 8.33
Se \(\xi \) e \(\eta \) são independentes e têm densidades \(f\) e \(g\), respectivamente, então \(\xi +\eta \) tem densidade
\[ h(z)=\int _{\mathbb {R}} f(z-y)g(y)\, \d y. \]
A integral anterior é denotada por \(h=f\star g\) e é conhecida como convolução de \(f\) e \(g\).

Demonstração

A função \(h\) é mensurável e não negativa, por Tonelli. Para todo \(A\in \mathcal{B}(\mathbb {R})\), novamente por Tonelli e pela mudança de variável \(z=x+y\),

\begin{align*} \int _Ah(z)\, \d z & =\int _{\mathbb {R}}\int _{\mathbb {R}}\mathbb {1}_A(z)f(z-y)g(y)\, \d z\, \d y\\ & =\int _{\mathbb {R}}\int _{\mathbb {R}}\mathbb {1}_A(x+y)f(x)g(y)\, \d x\, \d y\\ & =\P (\xi +\eta \in A). \end{align*}

Logo \(h\) é uma densidade de \(\xi +\eta \). Tomando \(A=\mathbb {R}\), vemos também que \(\int _{\mathbb {R}} h=1\).

Exemplo 8.34
Sejam \(\xi \) e \(\eta \) variáveis aleatórias uniformes independentes em \([0,1]\). A densidade de \(\xi +\eta \) é
\[ h(x)=\int _{\mathbb {R}}\mathbb {1}_{[0,1]}(x-y)\mathbb {1}_{[0,1]}(y)\, \d y. \]
O integrando vale \(1\) exatamente quando \(\max (0,x-1)\leq y\leq \min (1,x)\). Portanto,
\[ h(x)= \begin{cases} x, & 0\leq x\leq 1,\\ 2-x, & 1\lt x\leq 2,\\ 0, & \text{caso contrário}. \end{cases} \]

A convolução também permite suavizar funções. Veremos como usá-la para aproximar funções contínuas por funções suaves.

Definição 8.35 (Funções Teste)

Uma função é dita função teste ou suave de suporte compacto, denotada por \(f\in C ^\infty _c ( \mathbb {R})\) se \(f\) é de classe \(C^\infty \) e seu suporte

\[ \operatorname {supp}(f) :=\overline{\{ x\in \mathbb {R}:f(x)\neq 0\} } =\overline{f^{-1}(\mathbb {R}\setminus \{ 0\} )}. \]

é um conjunto compacto.

Para começar, estabelecemos a existência de uma função teste em \( [- 1,1] .\)

Lema 8.36
A função
\begin{align*} f (x) = \begin{cases} e ^\frac {-1} {1-x ^2} & \left\lvert x\right\rvert \lt 1 \\ 0 & \left\lvert x\right\rvert \geq 1 \end{cases}\end{align*}
pertence a \(C_c^\infty (\mathbb {R})\) e tem suporte \([-1,1]\).

Demonstração

No intervalo \((-1,1)\), a função é suave. Uma indução usando as regras do produto e da cadeia mostra que, para cada \(m\geq 0\), existem um polinômio \(P_m\) e um inteiro \(N_m\geq 0\) tais que

\[ f^{(m)}(x) =\frac{P_m(x)}{(1-x^2)^{N_m}} \exp \left(-\frac1{1-x^2}\right), \qquad |x|\lt 1. \]

Para todo \(N\geq 0\), \(t^{-N}e^{-1/t}\to 0\) quando \(t\downarrow 0\). Tomando \(t=1-x^2\), concluímos que \(f^{(m)}(x)\to 0\) quando \(x\to \pm 1\) pelo interior. Como \(f\) é identicamente nula fora \([-1,1]\), todas as derivadas se prolongam continuamente por zero nos dois extremos. Logo \(f\in C_c^\infty (\mathbb {R})\); como \(f\gt 0\) em \((-1,1)\), seu suporte é \([-1,1]\).

Normalizando a função do lema anterior por sua integral, obtemos uma função \(\rho \geq 0\) em \(C_c^\infty (\mathbb {R})\), com suporte em \([-1,1]\) e integral igual a \(1\).

Lema 8.37
Seja \(\rho \geq 0\) uma função em \(C_c^\infty (\mathbb {R})\), com suporte em \([-1,1]\) e \(\int _{\mathbb {R}}\rho =1\). Se \(f\colon \mathbb {R}\to \mathbb {R}\) é contínua, defina
\[ f_n(x)=n\int _{-n}^n\rho (n(x-y))f(y)\, \d y. \]
Então \(f_n\in C_c^\infty (\mathbb {R})\),
\[ f_n^{(m)}(x) =n^{m+1}\int _{-n}^n\rho ^{(m)}(n(x-y))f(y)\, \d y, \]
e \(f_n\to f\) uniformemente em conjuntos compactos. Se \(f\) é limitada, então \(\| f_n\| _\infty \leq \| f\| _\infty \).

Demonstração

Ponha \(\rho _n(u)=n\rho (nu)\). Seu suporte está contido em \([-1/n,1/n]\), e

\[ f_n(x)=\int _{-n}^n\rho _n(x-y)f(y)\, \d y. \]

Daí \(\operatorname {supp}(f_n)\subseteq [-n-1/n,n+1/n]\). Como \(f\) é integrável em intervalos compactos, a Convergência Dominada permite diferenciar sob o sinal de integral, para cada \(n\) fixo. Iterando,

\[ f_n^{(m)}(x) =\int _{-n}^n\rho _n^{(m)}(x-y)f(y)\, \d y =n^{m+1}\int _{-n}^n\rho ^{(m)}(n(x-y))f(y)\, \d y. \]

O mesmo argumento mostra que essas derivadas são contínuas; portanto \(f_n\in C_c^\infty (\mathbb {R})\).

Seja \(K\subset \mathbb {R}\) compacto. A função \(f\) é uniformemente contínua no compacto \(\{ y:d(y,K)\leq 1\} \). Dado \(\varepsilon \gt 0\), escolha \(\delta \gt 0\) tal que \(|f(y)-f(x)|\lt \varepsilon \) quando \(x\in K\), \(d(y,K)\leq 1\) e \(|x-y|\lt \delta \). Para \(n\) suficientemente grande, \(1/n\lt \delta \) e \([x-1/n,x+1/n]\subset [-n,n]\) para todo \(x\in K\). Usando \(\int \rho _n=1\), obtemos, uniformemente em \(x\in K\),

\[ |f_n(x)-f(x)| \leq \int \rho _n(x-y)|f(y)-f(x)|\, \d y \leq \varepsilon . \]

Por fim, se \(f\) é limitada,

\[ |f_n(x)| \leq \| f\| _\infty \int _{-n}^n\rho _n(x-y)\, \d y \leq \| f\| _\infty , \]

o que conclui a prova.

8.6.1 Testando Convergência com Funções Suaves

Lema 8.38
Sejam \((\xi _n)_{n\geq 1}\) e \(\xi \) variáveis aleatórias reais. Então \(\xi _n\xrightarrow {d}\xi \) se e somente se
\[ \lim _{n\to \infty }\mathbf{E}[f(\xi _n)]=\mathbf{E}[f(\xi )] \]
para toda \(f\in C_c^\infty (\mathbb {R})\).

Demonstração

Se \(\xi _n\xrightarrow d\xi \) e \(F_n,F\) são as respectivas funções de distribuição, então \(F_n(t)\to F(t)\) em todo ponto de continuidade de \(F\), portanto quase em toda parte. Para \(f\in C_c^\infty (\mathbb {R})\),

\[ f(x)=-\int _x^\infty f'(t)\, \d t. \]

Por Fubini,

\[ \mathbf{E}[f(\xi _n)]=-\int _{\mathbb {R}} f'(t)F_n(t)\, \d t. \]

Como \(|F_n|\leq 1\) e \(f'\) tem suporte compacto, a Convergência Dominada dá \(\mathbf{E}[f(\xi _n)]\to \mathbf{E}[f(\xi )]\).

Reciprocamente, suponha a convergência das esperanças para toda função teste. Primeiro obteremos controle uniforme das caudas. Para \(R\gt 0\), escolha \(\psi _R\in C_c^\infty (\mathbb {R})\) tal que

\[ \mathbb {1}_{[-R/2,R/2]}\leq \psi _R\leq \mathbb {1}_{[-R,R]}. \]

Então

\[ \limsup _{n\to \infty }\P (|\xi _n|\gt R) \leq 1-\mathbf{E}[\psi _R(\xi )] \leq \P (|\xi |\gt R/2). \]

O último termo tende a zero quando \(R\to \infty \).

Seja agora \(g\) uma função contínua limitada e ponha \(M=\| g\| _\infty \). O caso \(M=0\) é trivial. Dado \(\varepsilon \gt 0\), escolha \(R\) de modo que

\[ \P (|\xi |\gt R)\lt \frac{\varepsilon }{16M}, \qquad \P (|\xi _n|\gt R)\lt \frac{\varepsilon }{16M} \]

para todo \(n\) suficientemente grande. Pelo lema dos molificadores, existe \(g_k\in C_c^\infty (\mathbb {R})\) com \(\| g_k\| _\infty \leq M\) e \(\sup _{|x|\leq R}|g_k(x)-g(x)|\lt \varepsilon /8\) para \(k\) grande. Fixado tal \(k\) e tomando depois \(n\) grande,

\begin{align*} |\mathbf{E}[g(\xi _n)]-\mathbf{E}[g(\xi )]| & \leq \mathbf{E}|g-g_k|(\xi _n) +|\mathbf{E}[g_k(\xi _n)]-\mathbf{E}[g_k(\xi )]| +\mathbf{E}|g_k-g|(\xi )\\ & \lt \varepsilon . \end{align*}

Logo as esperanças convergem para toda \(g\) contínua e limitada.

Por fim, seja \(x\) um ponto de continuidade de \(F\). Para \(\delta \gt 0\), escolha funções contínuas \(g_\delta ^-,g_\delta ^+\colon \mathbb {R}\to [0,1]\) com

\[ g_\delta ^-\leq \mathbb {1}_{(-\infty ,x]} \leq g_\delta ^+, \]

tais que \(g_\delta ^-=1\) em \((-\infty ,x-\delta ]\) e zero em \([x,\infty )\), enquanto \(g_\delta ^+=1\) em \((-\infty ,x]\) e zero em \([x+\delta ,\infty )\). A convergência já provada para funções contínuas limitadas implica

\[ \mathbf{E}[g_\delta ^-(\xi )] \leq \liminf _nF_n(x) \leq \limsup _nF_n(x) \leq \mathbf{E}[g_\delta ^+(\xi )]. \]

Fazendo \(\delta \downarrow 0\) e usando a continuidade de \(F\) em \(x\), os extremos convergem a \(F(x)\). Portanto \(F_n(x)\to F(x)\) e \(\xi _n\xrightarrow d\xi \).

8.7 Aplicações

Encerramos o capítulo com duas aplicações em que a estrutura produto é menos visível, mas decisiva: simetrias de sequências independentes e passagem ao limite em distribuições.

8.7.1 Lei \(0-1\) de Hewitt-Savage

Definição 8.39
Uma bijeção \(\pi \colon \mathbb {N}\to \mathbb {N}\) é uma permutação finita se existe \(N_0\) tal que \(\pi (n)=n\) para todo \(n\gt N_0\).

Se \(\xi =(\xi _1,\xi _2,\ldots )\) é uma sequência de variáveis aleatórias, escrevemos

\[ T_\pi \xi =(\xi _{\pi (1)},\xi _{\pi (2)},\ldots ). \]

Um evento \(A=\{ \xi \in B\} \in \sigma (\xi _1,\xi _2,\ldots )\) é simétrico se \(\{ \xi \in B\} =\{ T_\pi \xi \in B\} \) para toda permutação finita \(\pi \). Os eventos simétricos formam a \(\sigma \)-álgebra permutável \(\mathcal E\).

Teorema 8.40 (Lei \(0\)–\(1\) de Hewitt–Savage)
Se \((\xi _n)_{n\geq 1}\) é uma sequência de variáveis aleatórias independentes e identicamente distribuídas, então
\[ \P (A)\in \{ 0,1\} \qquad \text{para todo }A\in \mathcal E. \]

Demonstração

Fixe \(A\in \mathcal E\) e \(\varepsilon \gt 0\). A álgebra dos eventos que dependem de um número finito de coordenadas gera \(\sigma (\xi _1,\xi _2,\ldots )\). Pelo Lema 2.13, existe um evento \(C\in \sigma (\xi _1,\ldots ,\xi _n)\) tal que

\[ \P (A\mathbin {\triangle }C)\lt \varepsilon \]

para algum \(n\). Seja \(\pi \) a permutação que troca os blocos \(\{ 1,\ldots ,n\} \) e \(\{ n+1,\ldots ,2n\} \) e fixa os demais índices, e ponha \(C'=\{ T_\pi \xi \in D\} \) quando \(C=\{ \xi \in D\} \).

Como a sequência é i.i.d., sua lei é invariante por \(\pi \); como \(A\) é simétrico,

\[ \P (A\mathbin {\triangle }C') =\P (A\mathbin {\triangle }C)\lt \varepsilon \quad \text{e}\quad \P (C')=\P (C). \]

Além disso, \(C\) depende das primeiras \(n\) coordenadas e \(C'\) das \(n\) coordenadas seguintes, logo são independentes. Portanto

\[ \P (C\cap C')=\P (C)^2. \]

Como

\[ \P \bigl(A\mathbin {\triangle }(C\cap C')\bigr) \leq \P (A\mathbin {\triangle }C) +\P (A\mathbin {\triangle }C')\lt 2\varepsilon , \]

temos \(|\P (A)-\P (C)^2|\lt 2\varepsilon \) e \(|\P (C)-\P (A)|\lt \varepsilon \). Fazendo \(\varepsilon \downarrow 0\), obtemos \(\P (A)=\P (A)^2\), isto é, \(\P (A)\in \{ 0,1\} \).

8.7.2 Passeios Aleatórios

Se \((\xi _i)_{i\geq 1}\) é uma sequência de vetores aleatórios i.i.d. em \(\mathbb {R}^d\), então

\[ S_n = \sum _{i=1}^n \xi _i \]

é um passeio aleatório em \(\mathbb {R}^d\).

Teorema 8.41

Se \(S_n\) é um passeio aleatório em \(\mathbb {R}\), então, quase certamente, exatamente uma das seguintes alternativas ocorre:

  • \(S_n=0\) para todo \(n\);

  • \(S_n\to \infty \);

  • \(S_n\to -\infty \);

  • \(\liminf _nS_n=-\infty \) e \(\limsup _nS_n=\infty \).

Demonstração

Uma permutação finita dos incrementos não altera \(S_n\) para todo \(n\) suficientemente grande. Logo os eventos \(\{ \limsup _nS_n\leq t\} \) e \(\{ \liminf _nS_n\leq t\} \) são simétricos. Pela Lei \(0\)–\(1\) de Hewitt–Savage, as variáveis aleatórias estendidas

\[ L=\limsup _nS_n,\qquad \ell =\liminf _nS_n \]

são constantes quase certamente; denote essas constantes também por \(L,\ell \in [-\infty ,\infty ]\).

Considere o passeio deslocado \(S_n'=\xi _2+\cdots +\xi _{n+1}\). Ele tem a mesma lei que \((S_n)\), de modo que \(\limsup _nS_n'=L\) e \(\liminf _nS_n'=\ell \) quase certamente. Como \(S_{n+1}=\xi _1+S_n'\), se \(L\) é finito então \(L=\xi _1+L\), e se \(\ell \) é finito então \(\ell =\xi _1+\ell \). Em qualquer desses casos, \(\xi _1=0\) quase certamente e, pela distribuição idêntica, \(S_n=0\) para todo \(n\) quase certamente.

Fora desse caso degenerado, \(L\) e \(\ell \) pertencem a \(\{ -\infty ,\infty \} \). Como \(\ell \leq L\), restam somente \((\ell ,L)=(\infty ,\infty )\), \((-\infty ,-\infty )\) ou \((-\infty ,\infty )\), que correspondem às três alternativas restantes.

8.8 ↯Extensão de Kolmogorov geral

Nesta seção generalizamos o Teorema de Extensão de Kolmogorov para produtos arbitrários. Queremos construir uma medida no espaço

\[ \Omega _{A}:=\prod _{\alpha \in A}\Omega _{\alpha } \]

associado a uma família de espaços \(\{ (\Omega _\alpha ,\mathcal B_\alpha )\} _{\alpha \in A}\), todos não vazios. Seus elementos são \(x_A=(x_\alpha )_{\alpha \in A}\).

De modo correspondente, temos as aplicações de projeção nas coordenadas \(\pi _{\beta }:\Omega _{A}\rightarrow \Omega _{\beta }\), que leva \(x_{A}\) para \(x_{\beta } .\) Também podemos definir a composta de tais aplicações de projeção de coordenadas.

Por exemplo, dados \(B\subset A\), podemos definir a projeção parcial \(\pi _{B}:\Omega _{A}\rightarrow \Omega _{B}\) de modo natural. Mais geralmente se \(C\subset B\subset A\), podemos definir \(\pi _{C\leftarrow B}:\Omega _{B}\rightarrow \Omega _{C} .\) Então temos as leis de composição

\[ \pi _{D\leftarrow C}\circ \pi _{C\leftarrow B}=\pi _{D\leftarrow B} \]

se \(D\subset C\subset B\subset A .\)

Podemos definir a \(\sigma \)-álgebra puxada por cada coordenada:

\[ \pi _{\beta }^{*}(\mathcal B_\beta ) :=\{ \pi _{\beta }^{-1}(E):E\in \mathcal B_\beta \} , \]

e então a \(\sigma \)-álgebra produto

\[ \mathcal B_A=\bigotimes _{\beta \in A}\mathcal B_\beta :=\sigma \left\langle \bigcup _{\beta \in A}\pi _\beta ^*(\mathcal B_\beta ) \right\rangle . \]

Esta é a menor \(\sigma \)-álgebra que torna mensuráveis todas as projeções \(\pi _\beta \) e, mais geralmente, todas as projeções \(\pi _B\) para \(B\) finito.

Todo evento do produto depende, de fato, de no máximo uma quantidade enumerável de coordenadas. Para justificar essa afirmação, considere

\[ \mathcal M = \left\{ \pi _B^{-1}(E_B): B\subset A\text{ enumerável},\ E_B\in \mathcal B_B \right\} . \]

A família \(\mathcal M\) contém os cilindros coordenados que geram \(\mathcal B_A\) e é fechada por complementos. Se \(E_n=\pi _{B_n}^{-1}(D_n)\in \mathcal M\), então \(B=\bigcup _nB_n\) é enumerável. Escrevendo \(\rho _n:\Omega _B\to \Omega _{B_n}\) para a projeção natural,

\[ E_n =\pi _B^{-1}\bigl(\rho _n^{-1}(D_n)\bigr), \]

e, portanto,

\[ \bigcup _nE_n = \pi _B^{-1} \left(\bigcup _n\rho _n^{-1}(D_n)\right)\in \mathcal M. \]

Logo \(\mathcal M\) é uma \(\sigma \)-álgebra e \(\mathcal B_A\subseteq \mathcal M\). A inclusão oposta vale porque cada \(\pi _B\) é mensurável para a \(\sigma \)-álgebra produto. Assim \(\mathcal M=\mathcal B_A\).

Em particular, se \(E\in \mathcal B_A\), existem um conjunto enumerável \(B\subset A\) e \(E_B\in \mathcal B_B\) tais que \(E=\pi _B^{-1}(E_B)\). Se \(f\colon \Omega _A\to [0,\infty ]\) é mensurável, aplique esse fato aos eventos \(\{ f\gt q\} \), \(q\in \mathbb Q_{\geq 0}\), e tome a união dos conjuntos de coordenadas assim obtidos. Há, portanto, um único conjunto enumerável \(B\subset A\) que determina simultaneamente todos esses eventos. Se dois pontos de \(\Omega _A\) têm a mesma projeção em \(\Omega _B\), eles pertencem aos mesmos eventos \(\{ f\gt q\} \) para todo racional \(q\geq 0\) e, por isso, têm o mesmo valor de \(f\). Como os fatores são não vazios, \(\pi _B\) é sobrejetora; podemos então definir \(f_B:\Omega _B\to [0,\infty ]\) por \(f_B(\pi _B(x))=f(x)\). As pré-imagens \(\{ f_B\gt q\} \) são mensuráveis para todo \(q\in \mathbb Q_{\geq 0}\), logo \(f_B\) é mensurável e

\[ f=f_B\circ \pi _B. \]

As projeções coordenadas tornam-se, assim, uma família de variáveis aleatórias definida num único espaço mensurável. Se \(\mu _A\) é uma probabilidade em \(\mathcal B_A\), sua marginal em \(\Omega _B\), para \(B\subset A\), é

\[ \mu _B(E_B):=(\pi _B)_*\mu _A(E_B) =\mu _A(\pi _B^{-1}(E_B)), \]

para \(E_B\in \mathcal B_B\). Essas marginais satisfazem

\[ (\pi _{C\leftarrow B})_*\mu _B=\mu _C \]

sempre que \(C\subset B\subset A\).

Teorema 8.42 (Extensão de Kolmogorov)
Seja \(\{ (\Omega _\alpha ,\mathcal B_\alpha )\} _{\alpha \in A}\) uma família de espaços de Borel Hausdorff não vazios. Para cada subconjunto finito \(B\subset A\), seja \(\mu _B\) uma probabilidade interiormente regular em \(\Omega _B\), equipado com a topologia produto. Suponha que
\[ (\pi _{C\leftarrow B})_*\mu _B=\mu _C \]
sempre que \(C\subset B\subset A\), com \(B\) e \(C\) finitos. Então existe uma única probabilidade \(\mu _A\) em \(\mathcal B_A\) que satisfaz \((\pi _B)_*\mu _A=\mu _B\) para todo \(B\subset A\) finito.

Demonstração

Seja \(\mathcal A_0\) a álgebra dos cilindros de dimensão finita:

\[ \mathcal A_0 =\{ \pi _B^{-1}(E):B\subset A\text{ finito}, E\in \mathcal B_B\} . \]

Defina

\[ \mu _0(\pi _B^{-1}(E)):=\mu _B(E). \]

Essa definição independe da representação. De fato, duas representações podem ser levadas ao conjunto finito comum de coordenadas \(D=B\cup C\), e a compatibilidade das marginais mostra que ambas recebem o mesmo valor. Pelo mesmo procedimento de levar uma coleção finita de cilindros a um conjunto comum de coordenadas, vemos que \(\mu _0\) é uma probabilidade finitamente aditiva em \(\mathcal A_0\).

Considere a família de cilindros com base compacta

\[ \mathcal K =\{ \pi _B^{-1}(K):B\subset A\text{ finito}, K\subset \Omega _B\text{ compacto}\} . \]

A regularidade interior de cada \(\mu _B\) dá, para \(E=\pi _B^{-1}(E_B)\in \mathcal A_0\),

\[ \mu _0(E) =\sup \{ \mu _0(C):C\in \mathcal K,\ C\subset E\} . \]

Verifiquemos cuidadosamente que \(\mathcal K\) é uma classe compacta. Se \(C_n=\pi _{B_n}^{-1}(K_n)\) possui a propriedade da interseção finita, ponha \(J=\bigcup _nB_n\), que é enumerável. Para cada \(\alpha \in J\), escolha um índice \(n(\alpha )\) com \(\alpha \in B_{n(\alpha )}\) e defina

\[ L_\alpha =\pi _{\{ \alpha \} \leftarrow B_{n(\alpha )}}(K_{n(\alpha )}). \]

Cada \(L_\alpha \) é compacto e não vazio. Pelo Teorema de Tychonoff, \(L=\prod _{\alpha \in J}L_\alpha \) é compacto. Para cada \(n\), o conjunto

\[ D_n =\{ x\in L:\pi _{B_n\leftarrow J}(x)\in K_n\} \]

é fechado em \(L\), pois \(K_n\) é compacto e \(\Omega _{B_n}\) é Hausdorff. A família \((D_n)\) tem a propriedade da interseção finita: para uma coleção finita de índices, acrescente também, para cada coordenada que ela envolve, os cilindros \(C_{n(\alpha )}\); a propriedade da interseção finita dos \(C_n\) fornece as coordenadas necessárias em \(L\), e as demais podem ser escolhidas arbitrariamente. Pela compacidade de \(L\), \(\bigcap _nD_n\neq \emptyset \). Estendendo um ponto dessa interseção às coordenadas de \(A\setminus J\), obtemos

\[ \bigcap _{n=1}^\infty C_n\neq \emptyset . \]

Portanto \(\mathcal K\) é uma classe compacta.

Este é o ponto decisivo da construção: a classe compacta converte uma interseção enumerável vazia de aproximantes numa interseção finita já vazia. Assim, a aditividade finita de \(\mu _0\) basta para controlar sua continuidade no vazio.

O Teorema de Extensão Compacta 2.29 transforma agora a aditividade finita de \(\mu _0\) em continuidade no vazio e, portanto, em \(\sigma \)-aditividade na álgebra \(\mathcal A_0\): \(\mu _0\) é uma pré-medida. O Teorema de Extensão de Carathéodory fornece uma extensão a \(\sigma \langle \mathcal A_0\rangle =\mathcal B_A\). Como \(\mu _0(\Omega _A)=1\), a extensão é única. Por construção, suas marginais finitas são exatamente as probabilidades \(\mu _B\).

Proposição 8.43 (Fórmula das caudas)
Se \(X\) é uma variável aleatória não negativa, sem hipótese de integrabilidade, então
\[ \mathbf{E}[X]=\int _0^\infty \P (X\gt t)\, \d t, \]
com a igualdade entendida em \([0,\infty ]\).

Demonstração

Para cada \(\omega \),

\[ X(\omega )=\int _0^\infty \mathbb {1}_{\{ X(\omega )\gt t\} }\, \d t. \]

O integrando é não negativo. Pelo Teorema de Tonelli,

\[ \mathbf{E}X =\int _0^\infty \mathbf{E}[\mathbb {1}_{\{ X\gt t\} }] \, \d t =\int _0^\infty \P (X\gt t)\, \d t. \]

Produto

Seja \(E\subseteq \Omega _1\times \Omega _2\). Para \(x\in \Omega _1\), defina a \(x\)-seção de \(E\) por

\[ E^x=\{ y\in \Omega _2:(x,y)\in E\} . \]

Exercício 8.1

Sejam \(E,F\subseteq \Omega _1\times \Omega _2\) e \(x\in \Omega _1\). Prove que

  1. \((E\cap F)^x=E^x\cap F^x\);

  2. \((E^c)^x=(E^x)^c\), tomando os complementos, respectivamente, em \(\Omega _1\times \Omega _2\) e em \(\Omega _2\);

  3. \((\bigcup _{n\geq 1}E_n)^x=\bigcup _{n\geq 1}E_n^x\).

Ver solução
Cada identidade segue testando um ponto \(y\): por exemplo, \(y\in (E\cap F)^x\) se, e somente se, \((x,y)\in E\) e \((x,y)\in F\), isto é, \(y\in E^x\cap F^x\). O mesmo argumento, trocando “e” por complemento ou por “existe \(n\)”, prova as outras duas.
Exercício 8.2

Se \((\Omega _1,\mathcal F_1,\mu _1)\) e \((\Omega _2,\mathcal F_2,\mu _2)\) são espaços de medida \(\sigma \)-finitos, prove que a medida produto \(\mu _1\otimes \mu _2\) também é \(\sigma \)-finita. Construa explicitamente uma exaustão do espaço produto por retângulos de medida finita.

Ver solução
Escolha \(A_n\uparrow \Omega _1\) e \(B_m\uparrow \Omega _2\) com \(\mu _1(A_n),\mu _2(B_m)\lt \infty \). Os retângulos \(A_n\times B_m\) cobrem o produto e têm medida \(\mu _1(A_n)\mu _2(B_m)\lt \infty \). Enumerando os pares \((n,m)\) obtemos uma cobertura enumerável por conjuntos de medida finita.
Exercício 8.3

Prove que, para todo inteiro \(d\geq 1\),

\[ \mathcal B(\mathbb {R}^d) =\bigotimes _{i=1}^{d}\mathcal B(\mathbb {R}). \]

Faça as duas inclusões: use a continuidade das projeções numa direção e uma base enumerável de retângulos abertos na outra.

Ver solução
As projeções coordenadas são contínuas; portanto seus cilindros borelianos são borelianos e \(\bigotimes _i\mathcal B(\mathbb {R})\subseteq \mathcal B(\mathbb {R}^d)\). Reciprocamente, retângulos abertos com extremos racionais pertencem ao produto de \(\sigma \)-álgebras e formam uma base enumerável de \(\mathbb {R}^d\). Todo aberto é união de uma subfamília dessa base, logo pertence ao produto; portanto ele contém a \(\sigma \)-álgebra boreliana.
Exercício 8.4

Uma prova alternativa da existência da medida produto. Sejam \(\mu _1\) e \(\mu _2\) probabilidades borelianas em \(\mathbb {R}^m\) e \(\mathbb {R}^n\), respectivamente. Na álgebra das uniões finitas disjuntas de retângulos borelianos, considere a função finitamente aditiva determinada por

\[ \mu _0(A\times B)=\mu _1(A)\mu _2(B). \]

Use a regularidade interior das probabilidades borelianas e a classe dos compactos de \(\mathbb {R}^{m+n}\) para verificar as hipóteses do Teorema de Extensão Compacta. Conclua, pelo Teorema de Carathéodory, a existência de \(\mu _1\otimes \mu _2\).

Ver solução
Refinamentos por retângulos mostram primeiro que \(\mu _0\) é bem definida e finitamente aditiva. Se \(E=\bigsqcup _{j=1}^rA_j\times B_j\), a regularidade interior permite escolher compactos \(K_j\subseteq A_j\), \(L_j\subseteq B_j\) com perda total arbitrariamente pequena; \(K=\bigcup _jK_j\times L_j\) é compacto, está em \(E\) e aproxima \(\mu _0(E)\) por dentro. Os compactos de \(\mathbb {R}^{m+n}\) formam uma classe compacta. O Teorema de Extensão Compacta dá a pré-medida, e Carathéodory a estende à \(\mathcal B(\mathbb {R}^{m+n})\), preservando \(\mu (A\times B)=\mu _1(A)\mu _2(B)\).
Exercício 8.5

Construção quantílica de uma sequência i.i.d. O teorema de existência de sequências i.i.d. deste capítulo garante que, dada uma função de distribuição \(F\) em \(\mathbb {R}\), existe uma sequência infinita de variáveis independentes com essa distribuição. Dê uma construção alternativa e explícita usando uma sequência de uniformes e a inversa generalizada de \(F\).

Ver solução
Em \(((0,1)^{\mathbb {N}},\lambda ^{\otimes \mathbb {N}})\), sejam \(U_j\) as projeções e defina \(\xi _j=F^{-1}(U_j)\), onde \(F^{-1}(u)=\inf \{ x:F(x)\geq u\} \). As projeções são i.i.d. uniformes; transformações coordenada a coordenada preservam a independência, e a construção por quantis dá função de distribuição \(F\) a cada \(\xi _j\). Assim obtemos diretamente uma construção alternativa ao argumento de existência do texto.
Exercício 8.6

Sejam \(\xi \) e \(\eta \) independentes, com

\[ f_\xi (x)=\alpha e^{-\alpha x}\mathbb {1}_{[0,\infty )}(x), \qquad \alpha \gt 0, \]

e \(\eta \sim \operatorname U(0,1)\). Determine a densidade de \(Z=\xi +\eta \), apresentando-a separadamente nos intervalos \(z\lt 0\), \(0\leq z\lt 1\) e \(z\geq 1\).

Ver solução
Pela convolução,
\[ f_Z(z)=\int _0^1\alpha e^{-\alpha (z-y)} \mathbb {1}_{\{ y\leq z\} }\, \d y. \]
Logo
\[ f_Z(z)= \begin{cases} 0, & z\lt 0,\\ 1-e^{-\alpha z}, & 0\leq z\lt 1,\\ e^{-\alpha (z-1)}-e^{-\alpha z}, & z\geq 1. \end{cases} \]
Exercício 8.7

Independência probabilística e independência linear. Seja \(V\) um espaço vetorial de dimensão finita sobre um corpo finito \(\mathbb F_q\), seja \(\xi \) uniforme em \(V\) e seja

\[ \langle \cdot ,\cdot \rangle :V\times V\to \mathbb F_q \]

uma forma bilinear não degenerada. Dados vetores não nulos \(v_1,\ldots ,v_n\in V\), prove que as variáveis aleatórias

\[ \langle \xi ,v_1\rangle ,\ldots ,\langle \xi ,v_n\rangle \]

são independentes se, e somente se, \(v_1,\ldots ,v_n\) são linearmente independentes.

Dica. Estude a imagem da transformação linear

\[ T:V\to \mathbb F_q^n, \qquad T(x)=(\langle x,v_1\rangle ,\ldots ,\langle x,v_n\rangle ). \]
Ver solução
Como \(\xi \) é uniforme, \(T(\xi )\) é uniforme em \(\operatorname {Im}T\). Suas coordenadas são independentes e uniformes em \(\mathbb F_q\) exatamente quando \(\operatorname {Im}T=\mathbb F_q^n\), isto é, quando \(T\) é sobrejetora. Pela não degenerescência da forma, uma relação entre os funcionais \(x\mapsto \langle x,v_i\rangle \) equivale à mesma relação linear entre os \(v_i\). Assim \(\operatorname {rank}T=n\) se, e somente se, \(v_1,\ldots ,v_n\) são linearmente independentes.
Exercício 8.8

Distribuição do produto. Sejam \(\xi \) e \(\eta \) variáveis aleatórias independentes e estritamente positivas, com funções de distribuição \(F\) e \(G\), respectivamente.

  1. Se \(H\) é a função de distribuição de \(\xi \eta \), prove que, para \(z\gt 0\),

    \[ H(z)=\int _{(0,\infty )}F\! \left(\frac zy\right)\, \d G(y). \]
  2. Aplique a fórmula quando \(\xi \) e \(\eta \) são independentes e uniformes em \((0,1)\). Determine a função de distribuição e uma densidade de \(\xi \eta \).

Ver solução
Condicionando em \(\eta =y\) e usando a independência,
\[ \P (\xi \eta \leq z)=\int \P (\xi \leq z/y)\, \d G(y) =\int F(z/y)\, \d G(y). \]
No caso uniforme, para \(0\lt z\lt 1\),
\[ H(z)=\int _0^z1\, \d y+\int _z^1\frac zy\, \d y =z(1-\log z). \]
Além disso, \(H(z)=0\) para \(z\leq 0\) e \(H(z)=1\) para \(z\geq 1\); derivando no intervalo \((0,1)\), obtemos a densidade \(h(z)=-\log z\) ali e zero fora dele.
Exercício 8.9

Infinitas moedas e o intervalo unitário. Considere

\[ \Omega =\{ 0,1\} ^{\mathbb {N}},\qquad \Phi (\omega )=\sum _{k=1}^{\infty }\frac{\omega _k}{2^k}, \]

com a \(\sigma \)-álgebra produto e a probabilidade produto de moedas justas. Seja \(E\) o conjunto das sequências que são eventualmente iguais a \(1\).

  1. Prove que \(E\) é enumerável e tem probabilidade zero.

  2. Prove que a restrição \(\Phi :\Omega \setminus E\to [0,1)\) é uma bijeção e que sua inversa tem coordenadas

    \[ d_k(x)=\lfloor 2^kx\rfloor -2\lfloor 2^{k-1}x\rfloor , \qquad x\in [0,1). \]

    Conclua que a bijeção e sua inversa são mensuráveis.

  3. Mostre, primeiro nos intervalos diádicos, que a imagem da medida produto por \(\Phi \) é a medida de Lebesgue. Conclua que os dois espaços são isomorfos como espaços de probabilidade depois de retirar conjuntos nulos.

Ver solução

Para cada instante a partir do qual todos os dígitos valem \(1\), há apenas finitos prefixos; logo \(E\) é enumerável. Cada sequência tem probabilidade zero, portanto \(\P (E)=0\).

As únicas ambiguidades da expansão binária são as expansões que terminam em zeros e as correspondentes que terminam em uns. Retirar \(E\) escolhe a primeira convenção e elimina também a expansão de \(1\), produzindo uma bijeção sobre \([0,1)\). A fórmula dos \(d_k\) fornece seus dígitos e mostra que a inversa é mensurável; a mensurabilidade de \(\Phi \) segue das somas parciais.

Fixados os primeiros \(n\) dígitos, o cilindro tem probabilidade \(2^{-n}\) e, fora de \(E\), corresponde ao intervalo diádico semiaberto de comprimento \(2^{-n}\). A igualdade das medidas nesses intervalos estende-se à \(\sigma \)-álgebra de Borel pelo teorema da classe monótona. Assim \(\Phi \) preserva medida e é um isomorfismo bimensurável módulo os conjuntos nulos \(E\) e \(\{ 1\} \).

Exercício 8.10

Uma identidade de janelas deslizantes. Seja \(X\) uma variável aleatória real e fixe \(a\gt 0\). Use Tonelli para provar que

\[ \int _{\mathbb {R}}\P (x\lt X\lt x+a)\, \d x=a. \]
Ver solução
Por Tonelli,
\[ \int _{\mathbb {R}}\P (x\lt X\lt x+a)\, \d x =\mathbf{E}\! \left[\int _{\mathbb {R}} \mathbb {1}_{\{ x\lt X\lt x+a\} }\, \d x\right]. \]
Para \(X(\omega )=y\), a condição equivale a \(y-a\lt x\lt y\); esse intervalo tem comprimento \(a\). A variável dentro da esperança é, portanto, identicamente igual a \(a\).