Capítulo 2

Medidas de Probabilidade

No capítulo anterior vimos por que nem todo subconjunto pode receber uma probabilidade. Agora invertemos a pergunta: dada uma atribuição de massa em uma família simples de conjuntos, quando ela determina uma medida de probabilidade?

O caminho passa por três níveis. Começaremos com probabilidades finitamente aditivas, identificaremos as condições que as transformam em pré-medidas e usaremos o Teorema de Extensão de Carathéodory para obter medidas nas \(\sigma \)-álgebras geradas. A dificuldade não está em distribuir massa finitamente; começa quando os limites entram em cena.

Ao final, aplicaremos esse mecanismo à construção de modelos fundamentais, entre eles a medida de Lebesgue e o espaço de infinitos lançamentos de uma moeda.

Definição 2.1 (Probabilidade Finitamente Aditiva)
Se \(\mathcal{\mathcal{F}}_0\) é uma álgebra em \(\Omega \), então \(\P :\mathcal{\mathcal{F}}_0\rightarrow [0,1]\) é dita uma probabilidade finitamente aditiva ou atribuição de probabilidade em \(\mathcal{\mathcal{F}}_0\) se
  1. \(\P [\Omega ]=1\)

  2. \(\P [A\cup B]=\P [A]+\P [B]\) para todos os conjuntos \(A, B\in \mathcal{\mathcal{F}}_0\) disjuntos.

A aditividade finita é o primeiro nível da construção. Em uma álgebra, podemos exigir também aditividade enumerável sempre que a união ainda pertença à álgebra.

Definição 2.2 (Pré-Medida de Probabilidade)

Se \(\mathcal{\mathcal{F}}_0\) é uma álgebra em \(\Omega \), então \(\P :\mathcal{\mathcal{F}}_0\rightarrow [0,1]\) é dita uma pré-medida de probabilidade em \(\mathcal{\mathcal{F}}_0\) se

  1. \(\P (\Omega )=1\)

  2. \(\P \bigl( \bigcup _{k=1}^\infty A_k \bigr)=\sum _{k=1}^\infty \P (A_k)\) para todos conjuntos disjuntos \(A_1, A_2,\ldots \in \mathcal{\mathcal{F}}_0\) tais que \(\bigcup _{k=1}^\infty A_k \in \mathcal{\mathcal{F}}_0 .\)

Definição 2.3
Uma medida em \((\Omega , \mathcal{F})\) é uma aplicação \(\mu : \mathcal{F}\rightarrow [0, + \infty ]\) que satisfaz:
  1. \(\mu (\varnothing )=0\)

  2. para toda sequência de eventos disjuntos \(A_1, A_2, \ldots \in \mathcal{F}\), temos que

    \[ \mu \left( \bigcup _{n=1}^\infty A_n \right) = \sum _{n=1}^\infty \mu (A_n). \]

    Essa propriedade é denominada de \(\sigma -\textbf{{aditividade}} .\)

Se nas Definições 2.1 e 2.2 removermos a hipótese \(\P (\Omega )=1\), obtemos uma medida finitamente aditiva e uma pré-medida, respectivamente. No caso geral, quando permitimos valores em \([0,\infty ]\), incluímos na definição de pré-medida a condição \(\mu _0(\varnothing )=0\). Para pré-medidas de probabilidade essa condição é automática.

Definição 2.4

Se \(\P \) é uma medida em \((\Omega , \mathcal{F})\) tal que \(\P (\Omega ) = 1\), então \(\P \) é denominada de medida de probabilidade.

Nesse caso a tripla \((\Omega , \mathcal{F}, \P )\) é denominada de espaço de probabilidade.

A definição é abstrata, mas inclui os experimentos aleatórios mais familiares: lançamentos de moedas e dados, sorteios em urnas e muitos outros. Em cada caso, o que muda é o espaço amostral e a família de eventos; a medida de probabilidade é a regra que atribui massa a esses eventos.

A representação seguinte explicita os três ingredientes do modelo: o espaço amostral \(\Omega \), a \(\sigma \)-álgebra \(\mathcal{F}\) e a medida \(\P \).

Figura 2.1 Relação entre o espaço amostral, σ -álgebra e a medida de probabilidade.

Figura 2.1 Relação entre o espaço amostral, \(\sigma \)-álgebra e a medida de probabilidade.

Definição 2.5 (Medidas Finitas e \(\sigma \)-finitas)
Dado \((\Omega , \mathcal{F},\mu )\) um espaço de medida.
  1. Se \(\mu (\Omega )\lt \infty \) então \(\mu \) é dita medida finita;

  2. Se \(\mu (\Omega )=\infty \) então \(\mu \) é dita medida infinita;

  3. Se existem conjuntos em \(\mathcal{F}\) \(A_1,A_2,\ldots \) tais que \(\Omega = \bigcup _{k=1}^\infty A_k\) e \(\mu (A_k)\lt \infty \) então \(\mu \) é dita medida \(\sigma \)-finita

Note que toda medida de probabilidade é \( \sigma \)-finita.

Exemplo 2.6 (Espaços de Probabilidade Discretos)

Seja \(\Omega \) um conjunto enumerável, isto é, finito ou infinito enumerável. Seja \(\mathcal{F}\) o conjunto de todos os subconjuntos de \(\Omega \) e seja uma função \(p:\Omega \to [0,1]\) satisfazendo \(\sum _{\omega \in \Omega } p(\omega )=1 .\) Definimos então

\[ \P (A)=\sum _{\omega \in A} p(\omega ) \text{ com } p(\omega )\geq 0 \text{ e } \sum _{\omega \in \Omega } p(\omega )=1. \]

Esta é a medida de probabilidade mais geral que podemos construir neste espaço.

Quando \(\Omega \) é um conjunto finito, e \(p (\omega ) = \dfrac {1}{|\Omega |}\) onde \(| \Omega |\) denota o número de pontos em \(\Omega \), temos o que se denomina espaço de probabilidade finito equiprovável.

Muitos modelos dos cursos introdutórios são casos particulares dessa construção.

Exemplo 2.7
Seja \(\Omega =\mathbb {N}\cup \{ 0\} \) e dado \(\lambda \gt 0\) e definida \(p:\Omega \to [0,1]\) por
\[ p(k)=e^{-\lambda }\frac{\lambda ^k}{k!}. \]
Como
\[ \sum _{k=0}^\infty p(k)=e^{-\lambda }\sum _{k=0}^\infty \frac{\lambda ^k}{k!}=e^{-\lambda }\cdot e^\lambda =1, \]
a medida
\[ \P (A)=\sum _{k\in A} p(k), \]
é uma medida de probabilidade em \((\Omega ,\mathcal P(\Omega )) .\)

Exemplo 2.8 (Lançamento de Moedas)

Vamos considerar o experimento de lançar \(n\) moedas. Representando coroa por 0 e cara por 1, podemos definir o espaço amostral por

\[ \Omega =\{ 0, 1\} ^n=\{ \omega =(a_1, a_2, \ldots , a_n): a_k\in \{ 0, 1\} , k=1, \ldots , n\} . \]

Dado \(\omega =(a_1, a_2, \ldots , a_n)\in \Omega \), defina \(N(\omega )=a_1+\cdots +a_n\) (\(N(w)\) representa o total de 1’ s em \(\omega \))

Fixe agora \(q\in (0, 1)\) e defina

\[ p(\omega )=q^{N(\omega )}(1-q)^{n-N(\omega )}. \]

Fica como exercício mostrar que

\[ \sum _{\omega \in \Omega } p(\omega )=1, \]

e portanto pode ser usada para definir um espaço de probabilidade.

As primeiras consequências da definição serão usadas ao longo de todo o texto.

Proposição 2.9 (Propriedades da Probabilidade)
  1. \(\P (A^\mathsf c) = 1 - \P (A) .\)

  2. \(A \subseteq B\) implica \(\P (A) \leq \P (B) .\) (monotonicidade)

  3. Dados eventos \(A\) e \(B\) então \(\P (A \cup B) \leq \P (A) + \P (B)\) (sub-aditividade)

  4. \( \P \left( \bigcup _{n=1}^\infty A_n \right) \leq \sum _{n=1}^\infty \P (A_n)\) (\(\sigma \)-sub-aditividade)

  5. \(\P [A\cup B] = \P [A]+\P [B]-\P [A\cap B]\); (Inclusão-exclusão)

  6. \(\P (A\triangle B)\geq \max \left\{ \P (A-B),\P (B-A) \right\} \)

Demonstração
  1. \(\Omega = A \cup A^\mathsf c.\) Logo, \(\P (\Omega ) = \P (A) + \P (A^\mathsf c) .\) Agora basta utilizar que \(\P (\Omega ) = 1 .\)

  2. Use a decomposição \(B = A \cup (B \setminus A) .\)

  3. Note que \(A \cup B\) pode ser escrito como \(A \cup (B \setminus A) .\) Logo, pela monotonicidade da probabilidade, temos que \(\P (A \cup B) = \P (A) + \P (B \setminus A) \leq \P (A) + \P (B) .\)

  4. Defina \(B_1=A_1\) e \(B_n=A_n\setminus \bigcup _{k=1}^{n-1}A_k\) para \(n\geq 2\). Os eventos \(B_n\) são disjuntos, \(B_n\subseteq A_n\) e \(\bigcup _nB_n=\bigcup _nA_n\). Pela \(\sigma \)-aditividade e pela monotonicidade,

    \[ \P \Bigl(\bigcup _{n=1}^\infty A_n\Bigr) =\sum _{n=1}^\infty \P (B_n) \leq \sum _{n=1}^\infty \P (A_n). \]
  5. A decomposição disjunta \(A\cup B=(A\setminus B)\, \dot\cup \, (B\setminus A)\, \dot\cup \, (A\cap B)\) e as decomposições correspondentes de \(A\) e \(B\) fornecem

    \[ \P (A\cup B)=\P (A)+\P (B)-\P (A\cap B). \]
  6. Como \(A\triangle B=(A\setminus B)\, \dot\cup \, (B\setminus A)\),

    \[ \P (A\triangle B)=\P (A\setminus B)+\P (B\setminus A), \]

    e essa soma é maior ou igual a cada uma das duas parcelas.

2.1 Continuidade das Medidas de Probabilidade

A \(\sigma \)-aditividade também pode ser lida como compatibilidade com limites de sequências monótonas de eventos. Essa forma de continuidade será uma de nossas ferramentas principais.

Teorema 2.10 (Continuidade da Probabilidade)
Dado uma sequência de eventos \(A_1, A_2, \ldots \in \mathcal{F}.\) Então
  1. Se \(A_n \uparrow A\), então \(\P (A_n) \uparrow \P (A)\) quando \(n \rightarrow \infty .\)

  2. Se \(A_n \downarrow A\), então \(\P (A_n) \downarrow \P (A)\) quando \(n \rightarrow \infty .\)

Demonstração

Comecemos pela continuidade por baixo. Dada uma sequência crescente \(A_1\subseteq A_2\subseteq \cdots \), defina \(B_1=A_1\) e, para \(k\geq 2\), \(B_k=A_k\setminus A_{k-1}\).

Os conjuntos \(B_n\) são disjuntos e \(\bigcup _{k=1}^jB_k=A_j\) para todo \(j\geq 1\). Além disso,

\[ A=\bigcup _{k=1}^\infty B_k. \]

Portanto, pela aditividade finita e pela \(\sigma \)-aditividade,

\[ \P (A_n)=\sum _{k=1}^n\P (B_k) \uparrow \sum _{k=1}^\infty \P (B_k)=\P (A). \]

Para a continuidade por cima, se \(A_n\downarrow A\), então \(A_n^{\mathsf c}\uparrow A^{\mathsf c}\). Pela primeira parte,

\[ \P (A_n)=1-\P (A_n^{\mathsf c}) \downarrow 1-\P (A^{\mathsf c})=\P (A). \]

Teorema 2.11

Dado \(A_1, A_2, \ldots \) uma sequência de eventos. Então

  1. \(\P ( \lim \inf A_n) \leq \lim \inf \P (A_n) \leq \lim \sup \P (A_n) \leq \P (\lim \sup A_n) .\)

  2. Se \(A_n \rightarrow A\) então \(\P (A_n) \rightarrow \P (A)\) quando \(n \rightarrow \infty .\)

Demonstração

Defina

\[ B_n=\bigcap _{m=n}^{\infty }A_m \quad \text{e}\quad C_n=\bigcup _{m=n}^{\infty }A_m. \]

Então \(B_n\uparrow \liminf _nA_n\), \(C_n\downarrow \limsup _nA_n\) e \(B_n\subseteq A_n\subseteq C_n\). Pela monotonicidade e pela continuidade da probabilidade,

\[ \P (B_n)\leq \P (A_n)\leq \P (C_n), \]

e

\[ \P (B_n)\longrightarrow \P (\liminf _nA_n), \qquad \P (C_n)\longrightarrow \P (\limsup _nA_n). \]

Tomando limite inferior e limite superior na primeira desigualdade, obtemos

\[ \P (\liminf _nA_n)\leq \liminf _n\P (A_n) \leq \limsup _n\P (A_n)\leq \P (\limsup _nA_n). \]

Se \(A_n\to A\), então \(\liminf _nA_n=\limsup _nA_n=A\), e as desigualdades anteriores implicam \(\P (A_n)\to \P (A)\).

Teorema 2.12 (Caracterizações da \(\sigma \)-aditividade)
Dado \(\P :\mathcal{\mathcal{F}}_0\rightarrow [0,1]\) uma probabilidade finitamente aditiva numa álgebra \(\mathcal{\mathcal{F}}_0 .\) Então as seguintes afirmações são equivalentes
  1. \(\P \) é uma pré-medida de probabilidade;

  2. \(\P \) é contínua por baixo. Isto é dados \(A_1, A_2, \ldots \in \mathcal{\mathcal{F}}_0\) e \(A_n\uparrow A\in \mathcal{\mathcal{F}}_0\) então \(\P (A_n)\uparrow \P (A)\);

  3. \(\P \) é contínua por cima. Isto é dados \(A_1, A_2, \ldots \in \mathcal{\mathcal{F}}_0\) e \(A_n\downarrow A\in \mathcal{\mathcal{F}}_0\) então \(\P (A_n)\downarrow \P (A)\);

  4. Contínua por cima em \(\varnothing .\) Isto é dados \(A_1, A_2, \ldots \in \mathcal{\mathcal{F}}_0\) e \(A_n\downarrow \varnothing \) então \(\P (A_n)\downarrow 0 .\)

Demonstração

Já provamos que 1. \(\Longrightarrow \) 2. e é imediato que 3. \(\Longrightarrow \) 4.

( 4. \(\Longrightarrow \) 3.) Suponha que \(\P \) é contínua por cima em \(\varnothing \) e que \(A_1, A_2, \ldots \in \mathcal{\mathcal{F}}_0\) e \(A_n\downarrow A\in \mathcal{\mathcal{F}}_0 .\)

\begin{align*} A_n\downarrow A & \Longrightarrow A_n-A \downarrow \varnothing \\ & \Longrightarrow \P [A_n]-\P [A] = \P [A_n-A] \downarrow 0,\, \, \text{pelo item 4.} \\ & \Longrightarrow \P [A_n] \downarrow \P [A] \\ \end{align*}

( 2. \(\Longleftrightarrow \) 3.) Para provar esse fato basta observar que \(A_n\uparrow A \Longleftrightarrow A_n^\mathsf c\downarrow A^\mathsf c\) e que \(\P [A] = 1- \P [A^\mathsf c] .\)

( 2. \(\Longrightarrow \) 1.) Suponha que \(A_1,A_2,\ldots \) sejam disjuntos em \(\mathcal F_0\) e que \(A=\bigcup _{k=1}^\infty A_k\in \mathcal F_0\). Os conjuntos \(S_n=\bigcup _{k=1}^nA_k\) pertencem à álgebra e satisfazem \(S_n\uparrow A\). Pela continuidade por baixo e pela aditividade finita,

\[ \P (A)=\lim _{n\to \infty }\P (S_n) =\lim _{n\to \infty }\sum _{k=1}^n\P (A_k) =\sum _{k=1}^\infty \P (A_k). \]

Logo \(\P \) é uma pré-medida de probabilidade.

Lema 2.13 (Aproximação por uma álgebra)
Seja \((\Omega ,\mathcal{F},\P )\) um espaço de probabilidade e seja \(\mathcal A\subseteq \mathcal{F}\) uma álgebra tal que \(\sigma \langle \mathcal A\rangle =\mathcal{F}\). Para todo \(E\in \mathcal{F}\) e todo \(\varepsilon \gt 0\), existe \(A\in \mathcal A\) tal que
\[ \P (E\mathbin {\triangle }A)\lt \varepsilon . \]

Demonstração

Considere a família

\[ \mathcal M =\left\{ E\in \mathcal{F}: \text{ para todo }\varepsilon \gt 0\text{ existe }A\in \mathcal A \text{ com }\P (E\mathbin {\triangle }A)\lt \varepsilon \right\} . \]

Claramente \(\mathcal A\subseteq \mathcal M\). Se \(E\in \mathcal M\) e \(A\in \mathcal A\) aproxima \(E\), então

\[ E^{\mathsf c}\mathbin {\triangle }A^{\mathsf c} =E\mathbin {\triangle }A, \]

logo \(\mathcal M\) é fechada por complementos.

Se \(E_1,E_2,\ldots \in \mathcal M\) e \(E=\bigcup _{j\geq 1}E_j\), ponha \(E^{(N)}=\bigcup _{j=1}^NE_j\). Pela continuidade por baixo, \(\P (E\setminus E^{(N)})\to 0\). Dado \(\varepsilon \gt 0\), escolha \(N\) tal que \(\P (E\setminus E^{(N)})\lt \varepsilon /2\) e, para \(1\leq j\leq N\), escolha \(A_j\in \mathcal A\) com

\[ \P (E_j\mathbin {\triangle }A_j)\lt \frac{\varepsilon }{2N}. \]

Como \(A=\bigcup _{j=1}^NA_j\in \mathcal A\),

\[ E\mathbin {\triangle }A \subseteq (E\setminus E^{(N)}) \cup \bigcup _{j=1}^N(E_j\mathbin {\triangle }A_j), \]

e, portanto, \(\P (E\mathbin {\triangle }A)\lt \varepsilon \). Assim \(\mathcal M\) é uma \(\sigma \)-álgebra que contém \(\mathcal A\). Consequentemente, \(\mathcal{F}=\sigma \langle \mathcal A\rangle \subseteq \mathcal M\).

Teorema 2.14 (Unicidade de Medidas)
Dado \(\mathcal P\) uma família de subconjuntos de \(\Omega .\) Se \(\mu \) e \(\nu \) são duas medidas em \((\Omega ,\sigma \langle \mathcal P\rangle )\) que concordam em \(\mathcal P\), e \(\mathcal P\) é um \(\pi \)-sistema, então elas concordam em toda a \(\sigma \)-álgebra gerada desde que valha uma das condições seguintes:
  1. \(\mu \) e \(\nu \) são medidas de probabilidade;

  2. existem \(D_n\in \mathcal P\) tais que \(D_n\uparrow \Omega \) e \(\mu (D_n)=\nu (D_n)\lt \infty \) para todo \(n\).

Demonstração

No caso de probabilidades, defina

\[ \mathcal G:=\{ A\in \sigma \langle \mathcal P\rangle : \mu (A)=\nu (A)\} . \]

Como \(\mu (\Omega )=\nu (\Omega )=1\), a classe \(\mathcal G\) contém \(\Omega \). Se \(A\in \mathcal G\), então \(\mu (A^{\mathsf c})=1-\mu (A)=1-\nu (A)=\nu (A^{\mathsf c})\). Finalmente, se \(A_1,A_2,\ldots \in \mathcal G\) são disjuntos, a \(\sigma \)-aditividade de ambas as medidas mostra que sua união pertence a \(\mathcal G\). Portanto \(\mathcal G\) é um \(\lambda \)-sistema que contém \(\mathcal P\). Pelo Teorema \(\pi \)–\(\lambda \) de Dynkin, \(\sigma \langle \mathcal P\rangle \subseteq \mathcal G\).

No segundo caso, fixe \(n\) e considere as medidas finitas \(\mu _n(A)=\mu (A\cap D_n)\) e \(\nu _n(A)=\nu (A\cap D_n)\). Elas têm a mesma massa total e concordam em \(\mathcal P\), pois \(A\cap D_n\in \mathcal P\). A demonstração do parágrafo anterior vale para medidas finitas com a mesma massa total (se essa massa for positiva, basta normalizá-las; se for nula, ambas são identicamente nulas). Assim \(\mu (A\cap D_n)=\nu (A\cap D_n)\) para todo \(A\in \sigma \langle \mathcal P\rangle \). Como \(D_n\uparrow \Omega \), a continuidade por baixo fornece \(\mu (A)=\nu (A)\).

Definição 2.15 (Medida nula e \(\mu \)-negligenciável)

Dado \((\Omega ,\mathcal{F}, \mu )\) um espaço de medida. Então

  1. Um conjunto \(A\in \mathcal{F}\) é dito de medida nula se \(\mu (A)=0 .\)

  2. Um conjunto \(A\in \mathcal{P}(\Omega )\) é dito \(\mu \)-negligenciável se existe um conjunto \(\mu \)- nulo \(B\in \mathcal{F}\) tal que \(A\subset B .\)

Definição 2.16 (Espaços Completos)
Um espaço de medida \((\Omega , \mathcal{F}, \mu )\) é dito completo se todos os conjuntos \(\mu \)-negligenciáveis pertencem à \(\mathcal{F}.\)

Todo espaço de medida pode ser completado.

Teorema 2.17 (O completamento \((\Omega , \bar{\mathcal{F}},\bar\mu )\))

Sejam \((\Omega ,\mathcal{F}, \mu )\) um espaço de medida e \(\mathcal N_\mu \) a família dos conjuntos \(\mu \)-negligenciáveis.

Então

  1. \(\bar{\mathcal{F}}:= \sigma \langle \mathcal{F}, \mathcal N_\mu \rangle = \{ F\cup N: F\in \mathcal{F}, N\in \mathcal N_\mu \} \);

  2. A função \(\bar\mu \) em \(\bar{\mathcal{F}}\) definida por \(\bar\mu (F\cup N)= \mu (F)\) para \(F\in \mathcal{F}\) e \(N\in \mathcal N_\mu \) é a única extensão de \(\mu \) para uma medida em \((\Omega , \bar{\mathcal{F}})\);

  3. O espaço de medida \((\Omega , \bar{\mathcal{F}}, \bar\mu )\) é completo.

A tripla \((\Omega , \bar{\mathcal{F}}, \bar\mu )\) é denominada completamento de \((\Omega , \mathcal{F}, \mu ) .\)

Demonstração

A família \(\mathcal N_\mu \) é um \(\sigma \)-ideal: todo subconjunto de um conjunto negligenciável é negligenciável e, se \(N_j\subseteq Z_j\in \mathcal{F}\) com \(\mu (Z_j)=0\), então \(\bigcup _jN_j\subseteq \bigcup _jZ_j\) e \(\mu (\bigcup _jZ_j)=0\).

Seja \(\mathcal C=\{ F\cup N:F\in \mathcal{F},\ N\in \mathcal N_\mu \} \). Essa classe contém \(\mathcal{F}\) e \(\mathcal N_\mu \) e é fechada por uniões enumeráveis. Para verificar complementos, escreva \(N\subseteq Z\in \mathcal{F}\) com \(\mu (Z)=0\); então

\[ (F\cup N)^{\mathsf c} =(F^{\mathsf c}\setminus Z) \cup \bigl(F^{\mathsf c}\cap (Z\setminus N)\bigr), \]

onde o primeiro conjunto pertence a \(\mathcal{F}\) e o segundo é negligenciável. Logo \(\mathcal C\) é uma \(\sigma \)-álgebra e, pela minimalidade da \(\sigma \)-álgebra gerada, \(\bar{\mathcal{F}}=\sigma \langle \mathcal{F},\mathcal N_\mu \rangle =\mathcal C\).

A definição de \(\bar\mu \) independe da representação. De fato, se \(F\cup N=G\cup M\), com \(N\) e \(M\) negligenciáveis, então \(F\setminus G\subseteq M\) e \(G\setminus F\subseteq N\). Esses dois conjuntos têm medida zero, e portanto \(\mu (F)=\mu (G)\).

Para provar a \(\sigma \)-aditividade, sejam \(E_j=F_j\cup N_j\) disjuntos. As interseções \(F_i\cap F_j\), \(i\ne j\), são negligenciáveis. Defina \(G_1=F_1\) e \(G_j=F_j\setminus \bigcup _{i\lt j}F_i\) para \(j\geq 2\). Então os \(G_j\) são disjuntos, \(\mu (G_j)=\mu (F_j)\), e \(\bigcup _jE_j\) difere de \(\bigcup _jG_j\) apenas por um conjunto negligenciável. Consequentemente,

\[ \bar\mu \Bigl(\bigcup _jE_j\Bigr) =\mu \Bigl(\bigcup _jG_j\Bigr) =\sum _j\mu (G_j)=\sum _j\bar\mu (E_j). \]

Além disso, \(\bar\mu (F)=\mu (F)\) para \(F\in \mathcal{F}\).

Se \(E=F\cup N\in \bar{\mathcal{F}}\) e \(\bar\mu (E)=0\), então \(\mu (F)=0\); logo todo subconjunto de \(E\) é negligenciável e pertence a \(\bar{\mathcal{F}}\). Assim o espaço completado é completo. Por fim, qualquer extensão de \(\mu \) a \(\bar{\mathcal{F}}\) deve atribuir medida zero a cada \(N\in \mathcal N_\mu \) e, portanto, deve atribuir a \(F\cup N\) o valor \(\mu (F)\). Isso prova a unicidade.

2.2 Teorema de Extensão de Carathéodory

O Teorema de Extensão de Carathéodory transforma uma pré-medida definida numa álgebra \(\mathcal F_0\) em uma medida na \(\sigma \)-álgebra gerada por ela. É a ponte que permite começar com comprimentos de intervalos e terminar com a medida de Lebesgue nos borelianos.

Seguiremos a construção em três etapas: associar uma medida exterior à função inicial, identificar os conjuntos mensuráveis para essa medida exterior e restringi-la a eles. A exposição será feita para probabilidades e medidas finitas; o caso \(\sigma \)-finito exige apenas os cuidados indicados nos enunciados.

2.2.1 Medidas Exteriores

Partimos de uma função de conjuntos \(\P \) definida apenas em uma família \(\mathcal A\). Para atribuir um custo a um conjunto arbitrário, cobrimo-lo por elementos de \(\mathcal A\) e tomamos o menor custo total possível. A fórmula funciona para quase toda função não negativa; as hipóteses de aditividade entram depois, quando queremos recuperar a função original e obter uma medida.

Definição 2.18 (Função Exterior Induzida)

Considere \( \mathcal{A} \) uma família qualquer de subconjuntos de um espaço \( \Omega \), e \( \P \colon \mathcal{A} \to [0, \infty ] \) ser uma função de conjunto não-negativa. Suponha \( \varnothing \in \mathcal{A} \) e \( \P (\varnothing ) = 0 .\)

A função exterior induzida por \( \P \) é a função:

\[ \P ^* (E) = \inf \Bigl\{ \sum _{n = 1} ^\infty \P (A_n) \mid A_1, A_2, \dotsc \in \mathcal{A} \text{ cobrem } E \Bigr\} \, , \]

definida para todos os conjuntos \( E \subseteq \Omega .\)

Figura 2.2 Medida externa

Figura 2.2 Medida externa

Figura 2.3 Os intervalos (a_1,b_1],ldots ,(a_8,b_8] cobrem U. A extremidade esquerda é aberta e a direita é fechada.

Figura 2.3 Os intervalos \((a_1,b_1],\ldots ,(a_8,b_8]\) cobrem \(U\). A extremidade esquerda é aberta e a direita é fechada.

As propriedades básicas de \( \P ^* \) motivam a definição seguinte.

Definição 2.19 (Medida Exterior)
Uma função \( \mathbf{Q}\colon \mathcal{P}(\Omega ) \to [0, \infty ] \) é uma medida exterior se:
  1. \( \mathbf{Q}(\varnothing ) = 0 .\)

  2. Monotonicidade \( \mathbf{Q}(E) \leq \mathbf{Q}(F) \) quando \( E \subseteq F \subseteq \Omega .\)

  3. Subaditividade enumerável Se \( E_1, E_2, \dotsc \subseteq \Omega \), então \( \mathbf{Q}(\bigcup _n E_n) \leq \sum _n \mathbf{Q}(E_n) .\)

Teorema 2.20 (Propriedades da Função Exterior Induzida)
A função exterior induzida \( \P ^* \) é uma medida exterior satisfazendo \( \P ^* (A) \leq \P (A) \) para todo \( A \in \mathcal{A} .\)

Demonstração

A cobertura vazia dá \(\P ^*(\varnothing )=0\), e toda cobertura de um conjunto também cobre seus subconjuntos, o que prova a monotonicidade. Para \(A\in \mathcal A\), o próprio conjunto \(A\) é uma cobertura admissível; logo \(\P ^*(A)\leq \P (A)\).

A propriedade 3 é demonstrada por argumentos de aproximação. Se \(\sum _n\P ^*(E_n)=+\infty \), a desigualdade é automática. Suponha, portanto, que essa soma seja finita. Seja \( \varepsilon \gt 0 .\) Para cada \( E_n \), pela definição de \( \P ^* \), existem conjuntos \( \{ A_{n, m} \} _m \subseteq \mathcal{A} \) cobrindo \( E_n \), com

\[ \sum _m \P (A_{n, m}) \leq \P ^* (E_n) + \frac{\varepsilon }{2 ^n} . \]

Todos os conjuntos \( A_{n, m} \) juntos cobrem \( \bigcup _n E_n \), então temos

\[ \P ^* (\bigcup _n E_n) \leq \sum _{n, m} \P (A_{n, m}) = \sum _n \sum _m \P (A_{n, m}) \leq \sum _n \P ^* (E_n) + \varepsilon \, . \]

Como \( \varepsilon \gt 0 \) é arbitrário, temos \( \P ^* (\bigcup _n E_n) \leq \sum _n \P ^* (E_n) .\)

Precisamos agora identificar um domínio no qual \( \mathbf{Q}= \P ^* \) seja \(\sigma \)-aditiva. Em geral, precisaremos restringir o domínio, mas isso não basta: a família resultante deve ser uma \(\sigma \)-álgebra suficientemente ampla para o modelo que queremos construir.

O critério de Carathéodory fornece essa escolha de domínio para \( \mathbf{Q}\):

Definição 2.21 (Conjuntos Mensuráveis para a Medida Exterior)

Seja \( \mathbf{Q}\colon \mathcal{P}(\Omega ) \to [0, \infty ] \) uma medida exterior. Então

\[ \mathcal{M} = \{ B \in \mathcal{P}(\Omega ) \mid \mathbf{Q}(B \cap E) + \mathbf{Q}(B^{\mathsf c} \cap E) = \mathbf{Q}(E) \quad \text{ para todo } E \subseteq \Omega \} \]

é a família de conjuntos mensuráveis para a medida exterior \( \mathbf{Q} .\)

Aplicando a subaditividade de \( \mathbf{Q}\), a seguinte definição é equivalente:

\[ \mathcal{M} = \{ B \in \mathcal{P}(\Omega ) \mid \mathbf{Q}(B \cap E) + \mathbf{Q}(B^{\mathsf c} \cap E) \leq \mathbf{Q}(E) \quad \text{ para todo } E \subseteq \Omega \} \ . \]

Heurística 2.22 (<span class=)
">

Suponha que \( \mathbf{Q} ^{*} \) seja uma medida externa finita em \( \Omega \)

Podemos definir uma "medida interna" \( \mathbf{Q} _* \) em \( \Omega \) por

\[ \mathbf{Q}_* (A) = \mathbf{Q}^* (\Omega ) - \mathbf{Q}^* (A ^\mathsf c) \]

Se a medida externa \( \mathbf{Q}^* \), for induzida a partir de uma medida \(\sigma \)-aditiva definida em alguma álgebra de conjuntos de \( \Omega \), então um subconjunto de \( \Omega \) será mensurável no sentido de Carathéodory se e somente se sua medida externa e medida interna concordarem, veja o Exercício 2.2.

A partir deste ponto de vista, a construção da medida (bem como da \( \sigma \)-álgebra de conjuntos mensuráveis) é apenas uma generalização da construção natural da integral de Riemann em \( \mathbb {R}\) - você tenta aproximar a área de um conjunto limitado \( E \) usando retângulos finitos e o conjunto é "mensurável no sentido de Riemann" se a melhor aproximação externa de sua área concorda com a melhor aproximação interna de sua área.

O ponto fundamental aqui é que o conceito de área interna é redundante e poderia ser definido em termos da área externa, como feito acima. Se a função é limitada, considere um retângulo contendo o conjunto abaixo dessa função e defina a medida interna como a medida externa do complemento do conjunto em relação a este retângulo.

Ilustração: Medidas Exteriores

A construção de Carathéodory não exige que \( \mathbf{Q}^* \) seja finita. O argumento acima serve como motivação; a definição, porém, alcança também o caso geral.

A denominação “conjunto mensurável” é justificada pelo seguinte resultado sobre \( \mathcal{M}\):

Teorema 2.23
A família \( \mathcal{M} \) é uma \(\sigma \)-álgebra.

Demonstração

É imediato a partir da definição que \( \mathcal{M} \) é fechado em relação ao complementar, e que \( \varnothing \in \mathcal{M} .\) Primeiro demostramos que \( \mathcal{M} \) é fechado sob interseções finitas e, portanto, sob união finita. Considere \( A, B \in \mathcal{M} \) então:

\begin{align} & \mathbf{Q}\bigl((A \cap B) \cap E \bigr) + \mathbf{Q}\bigl((A \cap B)^{\mathsf c} \cap E \bigr) \tag{2.1} \\ & = \mathbf{Q}(A \cap B \cap E) + \mathbf{Q}\bigl( (A^{\mathsf c} \cap B \cap E) \cup (A \cap B^{\mathsf c} \cap E) \cup (A^{\mathsf c} \cap B^{\mathsf c} \cap E) \bigr) \tag{2.2} \\ & \leq \mathbf{Q}(A \cap B \cap E) + \mathbf{Q}(A^{\mathsf c} \cap B \cap E) + \mathbf{Q}(A \cap B^{\mathsf c} \cap E) + \mathbf{Q}(A^{\mathsf c} \cap B^{\mathsf c} \cap E) \tag{2.3} \\ & = \mathbf{Q}(B \cap E) + \mathbf{Q}(B^{\mathsf c} \cap E) \, , \quad \textrm{pela definição de } A \in \mathcal{M} \tag{2.4} \\ & = \mathbf{Q}(E) \, , \mspace {147mu} \textrm{pela definição de } B \in \mathcal{M} \, . \tag{2.5} \end{align}

Portanto, \( A \cap B \in \mathcal{M} .\)

Agora temos que demostrar que se \( B_1, B_2, \dotsc \in \mathcal{M} \), então \( \bigcup _n B_n \in \mathcal{M} .\) Podemos assumir que os conjuntos \( B_n \) são disjuntos, caso contrário, considere em vez \( B'_n = B_n \setminus (B_1 \cup \dotsb \cup B_{n-1}) .\)

Para conveniência de notação, seja:

\[ D_N = \bigcup _{n = 1} ^N B_n \in \mathcal{M} \, , \quad D_N \uparrow D_\infty = \bigcup _{n = 1} ^\infty B_n \, . \]

Precisamos também do seguinte fato

\begin{equation*} \mathbf{Q}\biggl(\bigcup _{n = 1} ^N B_n \cap E \biggr) = \sum _{n = 1} ^N \mathbf{Q}(B_n \cap E) \, , \quad \text{para todo $ E \subseteq \Omega $ e $ N = 1, 2, \dotsc .$} \end{equation*}

que pode ser demonstrado por indução direta. O caso inicial \( N = 1 \) é trivial. Para \( N\gt 1 \),

\begin{align} \mathbf{Q}(D_N \cap E) & = \mathbf{Q}\bigl(D_{N-1} \cap (D_N \cap E) \bigr) + \mathbf{Q}\bigl(D_{N-1}^{\mathsf c} \cap (D_N \cap E) \bigr) \tag{2.6} \\ & = \mathbf{Q}(D_{N-1} \cap E) + \mathbf{Q}(B_N \cap E) \tag{2.7} \\ & = \sum _{n = 1} ^N \mathbf{Q}(B_n \cap E) \, , \quad \text{por hipótese de indução.} \tag{2.8} \end{align}

Assim

\begin{align} \mathbf{Q}(E) & = \mathbf{Q}(D_N \cap E) + \mathbf{Q}(D_N^{\mathsf c} \cap E) \tag{2.9} \\ & = \sum _{n = 1} ^N \mathbf{Q}(B_n \cap E) + \mathbf{Q}(D_N^{\mathsf c} \cap E) \tag{2.10} \\ & \geq \sum _{n = 1} ^N \mathbf{Q}(B_n \cap E) + \mathbf{Q}(D_\infty ^{\mathsf c} \cap E) \, , \quad \text{por monotonicidade.} \tag{2.11} \end{align}

Tomando \( N \to \infty \), obtemos

\[ \mathbf{Q}(E) \geq \sum _{n = 1} ^{\infty } \mathbf{Q}(B_n \cap E) + \mathbf{Q}(D_\infty ^{\mathsf c} \cap E) \geq \mathbf{Q}(D_\infty \cap E) + \mathbf{Q}(D_\infty ^{\mathsf c} \cap E) \ . \]

Mas isso implica \( D_\infty = \bigcup _{n = 1} ^{\infty } B_n \in \mathcal{M} .\)

Teorema 2.24 (Aditividade Enumerável da Medida Exterior)
Dado uma medida exterior \( \mathbf{Q}\), então \( \mathbf{Q}\) é \(\sigma \)-aditiva em \( \mathcal{M} .\) Isso é, se \( B_1, B_2, \dotsc \in \mathcal{M} \) forem disjuntos, então \( \mathbf{Q}(\bigcup _n B_n) = \sum _n \mathbf{Q}(B_n) .\)

Demonstração

O caso finito \( \mathbf{Q}(\bigcup _{n = 1} ^N B_n) = \sum _{n = 1} ^N \mathbf{Q}(B_n) \) já foi provado, bastando substituir \( E = \Omega \) na equação.

Por monotonicidade, \( \sum _{n = 1} ^N \mathbf{Q}(B_n) \leq \mathbf{Q}(\bigcup _{n = 1} ^\infty B_n) .\) Fazendo \( N \to \infty \) temos \( \sum _{n = 1} ^{\infty } \mathbf{Q}(B_n) \leq \mathbf{Q}(\bigcup _{n = 1} ^\infty B_n) .\)

A desigualdade na outra direção está implícita na subaditividade.

Resumimos o que obtivemos até agora

Corolário 2.25 (Teorema de Carathéodory)
Se \( \mathbf{Q}\) for uma medida exterior (2.19), então a restrição de \( \mathbf{Q}\) para os conjuntos mensuráveis \(\mathcal{M} \) (2.21) produz uma medida em \( \mathcal{M} .\)

Demonstração

Pelo Teorema 2.23, \(\mathcal M\) é uma \(\sigma \)-álgebra. Pelo Teorema 2.24, a restrição de \(\mathbf Q\) a \(\mathcal M\) é \(\sigma \)-aditiva; como \(\mathbf Q(\varnothing )=0\), essa restrição é uma medida.

2.2.2 Definindo uma Medida por Extensão

A medida exterior já está definida em todos os subconjuntos de \(\Omega \), mas não é aditiva em todos eles. O critério de Carathéodory seleciona exatamente a \(\sigma \)-álgebra na qual essa aditividade reaparece.

Teorema 2.26 (Teorema de Extensão de Carathéodory)
Seja \(\mu _0:\mathcal F_0\to [0,+\infty ]\) uma pré-medida numa álgebra \(\mathcal F_0\) de subconjuntos de \(\Omega \). Então existe uma medida \(\mu \) em \(\sigma \langle \mathcal F_0\rangle \) cuja restrição a \(\mathcal F_0\) é \(\mu _0\). Se \(\mu _0\) é \(\sigma \)-finita, isto é, se existem \(D_n\in \mathcal F_0\) tais que \(\Omega =\bigcup _{n\geq 1}D_n\) e \(\mu _0(D_n)\lt \infty \), essa extensão é única. Em particular, toda pré-medida de probabilidade possui uma única extensão para uma medida de probabilidade em \(\sigma \langle \mathcal F_0\rangle \).

Demonstração

Considere a medida exterior \(\mu ^*\) induzida por \(\mu _0\). A prova tem três passos.

1. Os conjuntos da álgebra inicial são mensuráveis para \(\mu ^*\). Fixe \(A\in \mathcal F_0\) e \(E\subseteq \Omega \). Pela subaditividade de \(\mu ^*\), sempre temos

\[ \mu ^*(E)\leq \mu ^*(E\cap A)+\mu ^*(E\cap A^\mathsf c). \]

Para obter a desigualdade inversa, se \(\mu ^*(E)=+\infty \) não há nada a provar. Suponha, então, que \(\mu ^*(E)\lt \infty \). Dado \(\varepsilon \gt 0\), escolha \(B_1,B_2,\dotsc \in \mathcal F_0\) que cubram \(E\) e satisfaçam

\[ \sum _n\mu _0(B_n)\leq \mu ^*(E)+\varepsilon . \]

As famílias \((A\cap B_n)_n\) e \((A^\mathsf c\cap B_n)_n\) cobrem, respectivamente, \(A\cap E\) e \(A^\mathsf c\cap E\). Além disso, todos esses conjuntos pertencem a \(\mathcal F_0\). Para todo \(C\in \mathcal F_0\), a cobertura formada pelo próprio \(C\) mostra, diretamente da definição de \(\mu ^*\), que \(\mu ^*(C)\leq \mu _0(C)\). Portanto, sem usar ainda a igualdade que será provada no passo seguinte,

\begin{align} \mu ^* (A \cap E) + \mu ^* (A^{\mathsf c} \cap E) & \leq \mu ^* \Bigl(A \cap \bigcup _n B_n \Bigr) + \mu ^* \Bigl(A^{\mathsf c} \cap \bigcup _n B_n \Bigr) \tag{2.12} \\ & \leq \sum _n \mu ^* (A \cap B_n) + \sum _n \mu ^* (A^{\mathsf c} \cap B_n) \tag{2.13} \\ & \leq \sum _n \mu _0 (A \cap B_n) + \sum _n \mu _0 (A^{\mathsf c} \cap B_n) \tag{2.14} \\ & = \sum _n \mu _0 (B_n) \, , \quad \text{pela aditividade finita de $\mu _0$,} \tag{2.15} \\ & \leq \mu ^* (E) + \varepsilon \, . \tag{2.16} \end{align}

Como \(\varepsilon \) é arbitrário, obtemos a desigualdade inversa e, assim, \(A\) satisfaz o critério de Carathéodory. Logo \(\mathcal F_0\) está contida na \(\sigma \)-álgebra \(\mathcal M\) dos conjuntos mensuráveis para \(\mu ^*\); como \(\mathcal M\) é uma \(\sigma \)-álgebra,

\[ \sigma \langle \mathcal F_0\rangle \subseteq \mathcal M. \]

Consequentemente, \(\mu ^*\) restrita a \(\sigma \langle \mathcal F_0\rangle \) já é uma medida.

2. A medida construída prolonga \(\mu _0\). Fixe \(A\in \mathcal F_0\) e considere uma cobertura arbitrária de \(A\) por \(B_1,B_2,\dotsc \in \mathcal F_0\). Disjuntifique essa cobertura dentro de \(A\), definindo

\[ G_1=A\cap B_1 \quad \text{e}\quad G_n=(A\cap B_n)\setminus \bigcup _{j=1}^{n-1}B_j,\qquad n\geq 2. \]

Os conjuntos \(G_n\) pertencem a \(\mathcal F_0\), são disjuntos, têm união \(A\) e satisfazem \(G_n\subseteq B_n\). Como \(\mu _0\) é uma pré-medida e a união \(A\) pertence a \(\mathcal F_0\),

\[ \mu _0(A)=\sum _n\mu _0(G_n)\leq \sum _n\mu _0(B_n). \]

Tomando o ínfimo sobre todas as coberturas, obtemos \(\mu _0(A)\leq \mu ^*(A)\). A cobertura \((A,\varnothing ,\varnothing ,\ldots )\) fornece a desigualdade contrária. Portanto \(\mu ^*(A)=\mu _0(A)\) em \(\mathcal F_0\), e a medida do passo 1 é a extensão procurada.

3. Unicidade no caso \(\sigma \)-finito. Substituindo \(D_n\) por \(H_n=\bigcup _{j=1}^nD_j\), podemos supor que \(H_n\uparrow \Omega \) e \(\mu _0(H_n)\lt \infty \) para todo \(n\). Se \(\mu \) e \(\nu \) são duas extensões, fixe \(n\) e defina, para \(E\in \sigma \langle \mathcal F_0\rangle \),

\[ \mu _n(E)=\mu (E\cap H_n), \qquad \nu _n(E)=\nu (E\cap H_n). \]

Essas são medidas finitas com a mesma massa total \(\mu _0(H_n)\). Elas concordam em \(\mathcal F_0\), pois, para \(A\in \mathcal F_0\), também \(A\cap H_n\in \mathcal F_0\) e

\[ \mu _n(A)=\mu _0(A\cap H_n)=\nu _n(A). \]

Pelo Teorema 2.14, \(\mu _n\) e \(\nu _n\) concordam em toda \(\sigma \langle \mathcal F_0\rangle \). Portanto, para cada \(E\in \sigma \langle \mathcal F_0\rangle \),

\[ \mu (E\cap H_n)=\nu (E\cap H_n),\qquad n\geq 1. \]

Como \(E\cap H_n\uparrow E\), a continuidade por baixo fornece \(\mu (E)=\nu (E)\). No caso de uma pré-medida de probabilidade, basta tomar \(H_1=\Omega \); além disso, a extensão construída tem massa total \(\mu (\Omega )=\mu _0(\Omega )=1\).

2.3 Classes Compactas

Para mostrar que uma função finitamente aditiva é uma pré-medida, precisamos controlar uma condição enumerável. A noção de classe compacta foi concebida precisamente para realizar essa passagem: uma interseção enumerável vazia de conjuntos da classe já é detectada por uma subfamília finita. Depois de aproximarmos os conjuntos da álgebra por elementos da classe compacta, a aditividade finita basta para controlar os erros dessa subfamília finita. Assim, obtemos continuidade no vazio, portanto uma pré-medida, e só então aplicamos o Teorema de Extensão de Carathéodory. A classe compacta é, desse modo, o mecanismo que torna verificável a hipótese necessária para a extensão, e não uma simples reformulação daquele teorema.

Definição 2.27 (Classe Compacta)

Dizemos que uma família \(\mathcal K\subseteq \mathcal{P}(\Omega )\) é uma classe compacta se, para toda sequência \((C_n)_{n\geq 1}\) de elementos de \(\mathcal K\) tal que

\[ \bigcap _{n=1}^\infty C_n=\varnothing , \]

existe \(m\in \mathbb {N}\) para o qual \(C_1\cap \dots \cap C_m=\varnothing \).

Equivalentemente, toda subfamília enumerável de \(\mathcal K\) com interseção vazia possui uma subfamília finita com interseção vazia.

Adicionar \(\varnothing \) a uma classe compacta preserva essa propriedade. Por isso, quando for conveniente, suporemos sem perda de generalidade que \(\varnothing \in \mathcal K\).

Exemplo 2.28

A família dos conjuntos compactos de um espaço métrico é uma classe compacta. De fato, suponha, por contradição, que \((C_n)_{n\geq 1}\) seja uma sequência de compactos para a qual toda interseção finita seja não vazia. Defina

\[ B_n=\bigcap _{j=1}^n C_j \]

e escolha \(x_n\in B_n\). Como \(x_n\in C_1\) para todo \(n\) e \(C_1\) é compacto, a sequência possui uma subsequência \((x_{n_\ell })_{\ell \geq 1}\) que converge para algum \(x\in C_1\). Fixado \(r\geq 1\), temos \(x_{n_\ell }\in C_r\) sempre que \(n_\ell \geq r\). Como \(C_r\) é fechado, \(x\in C_r\). Portanto \(x\in \bigcap _{r\geq 1}C_r\), uma contradição.

O mesmo resultado vale, mais geralmente, em qualquer espaço topológico de Hausdorff, sem que o espaço ambiente precise ser compacto. Com efeito, seja \((C_n)_{n\geq 1}\) uma sequência de compactos tal que

\[ \bigcap _{n\geq 1}C_n=\varnothing . \]

Se \(C_1=\varnothing \), a conclusão é imediata. Caso contrário, fixe \(C_1\). Num espaço de Hausdorff, cada compacto \(C_n\) é fechado; logo

\[ \{ C_1\setminus C_n:n\geq 2\} \]

é uma cobertura por abertos relativos do compacto \(C_1\). Extraindo uma subcobertura finita, existem \(n_1,\ldots ,n_k\geq 2\) tais que

\[ C_1=\bigcup _{j=1}^k(C_1\setminus C_{n_j}). \]

Consequentemente,

\[ C_1\cap C_{n_1}\cap \cdots \cap C_{n_k}=\varnothing . \]

O conjunto \(C_1\) deve ser incluído nessa subfamília finita. É a compacidade de \(C_1\), e não a do espaço ambiente, que produz a subcobertura finita.

A estabilidade das classes compactas sob essas duas operações é tratada no Exercício 2.19, ao final do capítulo.

Teorema 2.29 (Teorema de Extensão Compacta)

Seja \(\mu :\mathcal{F}_0\to [0,+\infty ]\) uma função finitamente aditiva numa álgebra \(\mathcal{F}_0\) de subconjuntos de \(\Omega \), com \(\mu (\varnothing )=0\), e seja \(\mathcal K\subseteq \mathcal{P}(\Omega )\) uma classe compacta que contém \(\varnothing \). Suponha que, para cada \(A\in \mathcal{F}_0\) e cada \(\varepsilon \gt 0\), existam \(C\in \mathcal K\) e \(B\in \mathcal{F}_0\) tais que

\begin{equation} B\subseteq C\subseteq A \quad \text{e}\quad \mu (A\setminus B)\lt \varepsilon . \label{eq:aproximacao-classe-compacta} \tag{2.17} \end{equation}

Então \(\mu \) é uma pré-medida em \(\mathcal{F}_0\).

Em particular, se \(\mathcal K\subseteq \mathcal{F}_0\) e \(\mu (\Omega )\lt \infty \), basta supor que, para cada \(A\in \mathcal{F}_0\),

\begin{equation} \mu (A)=\sup \{ \mu (C):C\in \mathcal K\text{ e }C\subseteq A\} . \label{eq:regularidade-classe-compacta} \tag{2.18} \end{equation}

Demonstração

Comecemos pela hipótese (2.17), que não exige que \(\mu \) seja finita. Seja \((A_n)_{n\geq 1}\) uma sequência em \(\mathcal{F}_0\) tal que \(A_n\downarrow \varnothing \), e fixe \(\varepsilon \gt 0\). Para cada \(n\), escolha \(C_n\in \mathcal K\) e \(B_n\in \mathcal{F}_0\) de modo que

\[ B_n\subseteq C_n\subseteq A_n \quad \text{e}\quad \mu (A_n\setminus B_n)\lt \frac{\varepsilon }{2^n}. \]

Como

\[ \bigcap _{n\geq 1}C_n\subseteq \bigcap _{n\geq 1}A_n=\varnothing , \]

a compacidade da classe fornece \(m\geq 1\) tal que \(C_1\cap \cdots \cap C_m=\varnothing \). Como \(B_i\subseteq C_i\), também \(B_1\cap \cdots \cap B_m=\varnothing \). Para todo \(n\geq m\), o encaixe dos conjuntos \(A_n\) implica

\[ A_n\subseteq \bigcup _{i=1}^m(A_n\setminus B_i) \subseteq \bigcup _{i=1}^m(A_i\setminus B_i). \]

Pela monotonicidade e pela subaditividade finita,

\[ \mu (A_n) \leq \sum _{i=1}^m\mu (A_i\setminus B_i) \lt \sum _{i=1}^m\frac{\varepsilon }{2^i} \lt \varepsilon . \]

Logo \(\mu (A_n)\downarrow 0\). Este é exatamente o ponto em que a classe compacta converte a interseção enumerável vazia num controle finito dos erros.

Para concluir diretamente, sem pressupor que \(\mu \) seja uma probabilidade, sejam \(E_1,E_2,\ldots \in \mathcal{F}_0\) disjuntos, com \(E=\bigcup _{j\geq 1}E_j\in \mathcal{F}_0\), e defina

\[ R_n=E\setminus \bigcup _{j=1}^nE_j. \]

Então \(R_n\downarrow \varnothing \), de modo que \(\mu (R_n)\to 0\), e a aditividade finita dá

\[ \mu (E)=\sum _{j=1}^n\mu (E_j)+\mu (R_n). \]

Se algum \(E_j\) tem medida infinita, a igualdade enumerável é imediata. Caso contrário, \(\mu (R_n)\lt \infty \) para \(n\) suficientemente grande; a igualdade anterior mostra então que \(\mu (E)\lt \infty \), e, fazendo \(n\to \infty \), obtemos

\[ \mu (E)=\sum _{j=1}^\infty \mu (E_j). \]

Portanto \(\mu \) é uma pré-medida.

Finalmente, suponha \(\mu (\Omega )\lt \infty \) e (2.18). Então \(\mu (A)\lt \infty \) para todo \(A\in \mathcal{F}_0\). Dado \(\varepsilon \gt 0\), podemos escolher \(C\in \mathcal K\), \(C\subseteq A\), tal que \(\mu (C)\gt \mu (A)-\varepsilon \). Tomando \(B=C\) e usando a aditividade finita,

\[ \mu (A\setminus C)=\mu (A)-\mu (C)\lt \varepsilon , \]

o que reduz o caso finito à primeira parte da demonstração.

Observação 2.30 (Pré-medidas gerais e pré-medidas de probabilidade)

A finitude não é usada no argumento de classe compacta quando se assume diretamente a aproximação por sanduíche e o controle residual de (2.17). Ela é usada somente para deduzir esse controle, no caso \(\mathcal K\subseteq \mathcal{F}_0\), a partir da identidade pelo supremo (2.18): é preciso que \(\mu (A)\lt \infty \) para escrever \(\mu (A\setminus C)=\mu (A)-\mu (C)\). Se \(\mu (A)=\infty \), a igualdade pelo supremo, sozinha, não controla a medida do resíduo, pois envolveria a expressão indeterminada \(\infty -\infty \).

Para uma probabilidade, \(\mu (\Omega )=1\), e portanto a finitude é automática: a formulação pelo supremo é suficiente quando \(\mathcal K\subseteq \mathcal{F}_0\). Para uma função finitamente aditiva geral, há duas alternativas precisas: supor que \(\mu \) seja finita e usar essa regularidade interna, ou manter a generalidade e exigir diretamente (2.17). Em ambos os casos, a classe compacta prova primeiro que \(\mu \) é uma pré-medida. O Teorema de Extensão de Carathéodory fornece então uma medida em \(\sigma \langle \mathcal{F}_0\rangle \); no caso geral, a unicidade requer \(\sigma \)-finitude, enquanto no caso de probabilidade ela é automática.

2.4 Aplicações

2.4.1 Teorema dos Números Normais de Borel

Construiremos agora a medida de Lebesgue em \((0,1]\). O mesmo modelo descreverá tanto a escolha uniforme de um número quanto uma sequência infinita de lançamentos de moeda. O argumento segue um roteiro que reaparecerá no livro:

Construção de Probabilidades

  1. Começaremos construindo uma probabilidade finitamente aditiva. Essa construção em geral é simples e intuitiva.

  2. Provaremos a \(\sigma \)-aditividade. Em alguns casos pode ser mais fácil provar a condição equivalente de continuidade no vazio. Em outros provar a condição do Teorema da Extensão Compacta.

  3. Usaremos o Teorema de Extensão de Carathéodory para obter um espaço de probabilidade.

Começaremos construindo uma probabilidade finitamente aditiva nos intervalos. Essa função atribui a cada intervalo seu comprimento.

Definição 2.31 (Álgebra de Borel)
Seja \(\mathcal{B}_0((0,1])\) a álgebra de Borel, isto é a família formada por uniões finitas (possivelmente vazia) de intervalos da forma \((a,b]\subset (0,1] .\)

Definição 2.32

Se \(A\in \mathcal B_0((0,1])\) possui uma representação disjunta

\[ A=\mathop{\dot\bigcup }_{j=1}^m(a_j,b_j], \]

defina

\[ \P (A)=\sum _{j=1}^m(b_j-a_j), \]

e defina \(\P (\varnothing )=0\).

Teorema 2.33
A função \(\P \) está bem definida e é uma probabilidade finitamente aditiva em \(\mathcal B_0((0,1])\).

Demonstração

Considere duas decomposições finitas de um mesmo conjunto \(A\) em intervalos semiabertos disjuntos. Ordene todos os extremos que aparecem nas duas decomposições, acrescentando \(0\) e \(1\) se necessário: \(0=t_0\lt t_1\lt \cdots \lt t_r=1\). Em cada átomo \((t_{k-1},t_k]\), a função indicadora de \(A\) é constante. Portanto qualquer uma das duas decomposições atribui a \(A\) a soma de \(t_k-t_{k-1}\) exatamente sobre os mesmos átomos. As duas somas coincidem, e \(\P \) está bem definida.

O mesmo refinamento mostra que, se \(A\) e \(B\) são disjuntos, os átomos que compõem \(A\cup B\) são a união disjunta dos átomos que compõem \(A\) e dos que compõem \(B\). Logo \(\P (A\cup B)=\P (A)+\P (B)\). Finalmente, \(\P ((0,1])=1\), de modo que \(\P \) é uma probabilidade finitamente aditiva.

Podemos ver um número real \(\omega \in (0,1]\) como a realização do lançamento de uma moeda infinitas vezes. Para isso considere a expansão binária desse número. Nos pontos diádicos, que admitem duas expansões, adotaremos a expansão que não é eventualmente nula; em particular, representamos \(1\) por \(0{,}111\ldots \). Dessa forma \(\omega \in (0,1]\) determina uma sequência de dígitos em \(\{ 0,1\} ^{\mathbb {N}}\), omitindo-se o dígito inicial antes da vírgula.

Nosso primeiro resultado será sobre a distribuição de dígitos \(0\) e \(1\) num número qualquer \(\omega \in (0,1] .\) Para realizar essa contagem faremos inicialmente uma conversão dos dígitos dessa sequência. Converteremos os \(0\to -1\) obtendo a sequência de funções de Rademacher \(z_k .\)

Definição 2.34
Para todo número \(\omega \in (0,1]\), a função \(d_k(\omega )\) denotará o \(k\)-ésimo digito da representação de \(\omega .\) Seja \(z_k(\omega ):=2d_k(\omega )-1\) e
\[ s_n(\omega ):=\sum _{k=1}^nz_k(\omega )\equiv \text{ excesso de 1's nos $n$ primeiros d\'igitos.} \]

Observação 2.35

A sequencia \(s_n(\omega )\) definida acima pode ser vista como um passeio aleatório simétrico nos pontos de coordenadas inteiras da reta, isto é, em \(\mathbb {Z}\), que começa em \(0\) e a cada passo move para a direita ou esquerda, +1 ou -1, com probabilidade igual. Este passeio pode ser ilustrado da seguinte maneira. Um ponto é colocado no zero e uma moeda justa é jogada. Se sair cara, o marcador é movido uma unidade para a direita e se sair coroa o marcador é movido uma unidade para a esquerda.

Ilustração: Teorema dos Números Normais de Borel

Figura 2.4 Funções de Rademacher z_k .
Figura 2.4 Funções de Rademacher \(z_k .\)

Provaremos que

\[ \lim \limits _{n\rightarrow \infty }\P \Bigl[\bigl\{ \omega \in (0,1]: \left|\text{excesso de 1's nos $n$ primeiros dígitos}\right| \geq n\varepsilon \bigr\} \Bigr] =0. \]

Na expressão acima, o limite está fora da probabilidade. Como veremos, o evento dentro da probabilidade pertence à álgebra de Borel; portanto, a expressão faz sentido com o que desenvolvemos até este ponto.

Teorema 2.36 (Lei Fraca de Bernoulli)
Para todo \(\varepsilon \gt 0\),
\[ \lim \limits _{n\rightarrow \infty }\P \Bigl[\bigl\{ \omega \in (0,1]: \left|{s_n(\omega )}/n \right|\geq \varepsilon \bigr\} \Bigr] =0. \]

Demonstração

Qualquer evento baseado nos valores \(z_1(\omega ), \ldots , z_n(\omega )\) pode ser descrito como uma união disjunta de intervalos diádicos da forma \(\left(\dfrac {k-1}{2^n}, \dfrac {k}{2^n}\right] .\) Logo \(\bigl\{ \omega \in (0,1]: \left|{s_n(\omega )}/n \right| \geq \varepsilon \bigr\} \in \mathcal{B}_0((0,1]) .\)

Nesta prova, a integral de uma função constante em intervalos de \(\mathcal B_0((0,1])\) denota simplesmente a soma dos valores constantes multiplicados pelos comprimentos correspondentes. Cada intervalo diádico de nível \(i-1\) se divide em dois no nível \(i\). Logo \(z_i\) toma valor \(+1\) em metade do intervalo e valor \(-1\) na outra metade. Se \(i\lt j\), então, em cada intervalo diádico de nível \(j-1\), \(z_i\) é constante, enquanto \(z_j\) vale \(-1\) numa metade e \(+1\) na outra. O produto \(z_i z_j\), portanto, tem integral zero em cada um desses intervalos, e

\begin{align*} \displaystyle \int _0^1 z_k(\omega )z_j(\omega )\, d\omega & = \begin{cases} 1 & \text{quando $k=j$} \\ 0 & \text{quando $k\neq j$}. \end{cases}\end{align*}

Isso implica que \(\displaystyle \int _0^1 s^2_n(\omega )\, d\omega = \displaystyle \int _0^1 \sum _{k,j=1}^n z_k(\omega )z_j(\omega ) \, d\omega = n\) e logo

\begin{align*} n & = \displaystyle \int _0^1 s^2_n(\omega )\, d\omega \geq \displaystyle \int _{|s_n/n|\geq \varepsilon } s^2_n(\omega )\, d\omega \\ & \qquad \geq \displaystyle \int _{|s_n/n|\geq \varepsilon } n^2\varepsilon ^2\, d\omega = n^2\varepsilon ^2 \P \bigl[|s_n/n|\geq \varepsilon \bigr]. \end{align*}

Logo \(\P \bigl[|s_n/n|\geq \varepsilon \bigr]\leq 1/(n\varepsilon ^2)\rightarrow 0\) quando \(n\rightarrow \infty .\)

Figura 2.5 Dado uma base, um número normal é um número real cujos algarismos aparecem todos com a mesma frequência.

Figura 2.5 Dado uma base, um número normal é um número real cujos algarismos aparecem todos com a mesma frequência.

Dado uma base, \(b\) um número normal é um número real cujos algarismos aparecem todos com a mesma frequência, ou seja, cuja sequência infinita de dígitos na base \(b\) é distribuída uniformemente no sentido de que cada um dos valores algarismos tem a mesma frequência \(\frac{1}{b}.\) Também significa que nenhum algarismo, ou combinação (finita) de algarismos, ocorre com mais frequência do que qualquer outra. No que se segue trataremos apenas de números normais na base 2, mas os argumentos podem ser adaptados facilmente para outras bases.

Definição 2.37
O conjunto dos números simplesmente normais na base 2 em \((0,1]\) é definido como
\begin{align*} N_1 & :=\{ \omega \in (0,1]: \lim \limits _{n\rightarrow \infty } {s_n(\omega )}/n =0\} \\ & \phantom{:}=\{ \omega \in (0,1]: \lim \limits _{n\rightarrow \infty } \frac{1}{n}\displaystyle \sum _{k=1}^n d_k(\omega ) = \frac{1}{2}\} . \end{align*}
Seu complemento será denotado por \(A_1:=(0,1]\setminus N_1\).

Provaremos que os números anormais formam um conjunto negligenciável.

Definição 2.38 (Conjunto Negligenciável)
Um subconjunto \(B\subset (0,1]\) é dito negligenciável se para todo \(\varepsilon \gt 0\), existem subconjuntos \(B_1, B_2,\ldots \) de \(\mathcal{B}_0((0,1])\) tal que
\begin{align*} & B\subset \bigcup _{k=1}^\infty B_k\quad \text{ e }\quad \sum _{k=1}^\infty \P [B_k]\leq \varepsilon . \end{align*}

O próximo teorema também é conhecido como a Lei Forte dos Grandes Números para o Lançamento de Moedas

Teorema 2.39 (Lei forte para a frequência dos algarismos)

O conjunto \(A_1\) dos números que não são simplesmente normais na base 2 é negligenciável.

Demonstração
  1. Começaremos notando as seguintes inclusões:

Dado \(\varepsilon _k\downarrow 0\) quando \(k\rightarrow \infty .\) Então

\begin{align*} \{ \omega \colon \left|\dfrac {s_{k^2}(\omega )}{k^2}\right| \lt \varepsilon _k & \, \text{ para $k$ suficientemente grande } \} \nonumber \\ & \subset \{ \omega \colon \lim \limits _{k}\dfrac {s_{k^2}(\omega )}{k^2} = 0 \} \nonumber \\ & \subset \underbrace{\{ \omega \colon \lim \limits _{n}\dfrac {s_{n}(\omega )}{n} = 0 \} }_{=N_1} \end{align*}

Para justificar a última inclusão, se \(k^2\leq n\lt (k+1)^2\), então

\[ \frac{|s_n|}{n} \leq \frac{|s_{k^2}|}{k^2}+\frac{n-k^2}{k^2} \leq \frac{|s_{k^2}|}{k^2}+\frac{2k+1}{k^2}. \]

Logo a convergência ao longo dos quadrados implica a convergência da sequência inteira.

  1. Agora por (1.) temos que

    \begin{align*} A_1 = N_1^\mathsf c& \subset \{ \omega \colon \left|\dfrac {s_{k^2}(\omega )}{k^2}\right| \geq \varepsilon _k\, \text{ para infinitos $k$} \} \\ & \subset \bigcup _{k=j}^\infty \underbrace{\{ \omega \colon \left|\dfrac {s_{k^2}(\omega )}{k^2}\right| \geq \varepsilon _k \} }_{=: B_k},\quad \text{para todo $j$} \end{align*}

onde \(B_k\in \mathcal B_0((0,1])\). Da demonstração da Lei Fraca,

\[ \P [B_k]\leq \dfrac {1}{k^2 \varepsilon ^2_k} = \dfrac {1}{k^{3/2}} \]

se tomarmos \(\varepsilon _k:= k^{-1/4} .\) Logo \(\sum _{k=1}^\infty \P [B_k]\lt \infty \) e assim \(\sum _{k=j}^\infty \P [B_k]\rightarrow 0\) quando \(j\rightarrow \infty .\) Portanto \(A_1\) é negligenciável.

Definição 2.40 (Número normal na base 2)
Fixe \(r\geq 1\) e considere uma palavra
\[ u=(u_1,\ldots ,u_r)\in \{ 0,1\} ^r. \]
Defina
\[ N_n(u,\omega ) =\# \{ 1\leq j\leq n:(d_j(\omega ),\ldots ,d_{j+r-1}(\omega ))=u\} . \]
Dizemos que \(\omega \) é normal na base 2 se, para todo \(r\geq 1\) e toda palavra \(u\in \{ 0,1\} ^r\),
\[ \frac{N_n(u,\omega )}{n}\longrightarrow 2^{-r}. \]
Denotaremos por \(N\) o conjunto dos números normais e por \(A=(0,1]\setminus N\) o conjunto dos números anormais.

Teorema 2.41 (Teorema dos Números Normais de Borel)
O conjunto \(A\) dos números anormais na base 2 é negligenciável.

Demonstração

Fixe \(r\geq 1\), uma palavra \(u\in \{ 0,1\} ^r\) e uma classe de resíduos \(\ell \in \{ 1,\ldots ,r\} \). Para \(m\geq 0\), seja \(Y_m(\omega )\) a indicadora do evento em que a palavra \(u\) começa na posição \(\ell +mr\). Esses eventos dependem de blocos disjuntos de \(r\) dígitos. Pela definição de \(\P \) nos intervalos diádicos,

\[ \P (Y_m=1)=2^{-r} \quad \text{e}\quad \P (Y_m=1,Y_q=1)=2^{-2r}\quad (m\ne q). \]

Escrevendo \(p=2^{-r}\) e \(S_n=\sum _{m=0}^{n-1}Y_m\), a mesma soma finita usada na prova da Lei Fraca dá

\[ \int _0^1(S_n-np)^2\, d\omega =np(1-p). \]

Consequentemente,

\[ \P \left(\left|\frac{S_n}{n}-p\right|\geq \varepsilon \right) \leq \frac{p(1-p)}{n\varepsilon ^2}. \]

Aplicando o argumento dos índices quadrados do Teorema 2.39, concluímos que o conjunto em que \(S_n/n\) não converge para \(p\) é negligenciável.

A união enumerável de conjuntos negligenciáveis é negligenciável: dada uma lista \((E_j)\) e \(\eta \gt 0\), cubra \(E_j\) por elementos da álgebra com soma de medidas menor que \(\eta /2^j\) e reúna todas essas coberturas. Podemos, portanto, excluir simultaneamente os conjuntos excepcionais correspondentes a todos os trios \((r,u,\ell )\).

Fora dessa união excepcional, para cada palavra \(u\) as frequências ao longo das \(r\) classes de posições módulo \(r\) convergem todas para \(2^{-r}\). Somando as classes e desprezando no máximo \(r-1\) posições na extremidade, obtemos \(N_n(u,\omega )/n\to 2^{-r}\). Isso vale para toda palavra finita, e portanto \(\omega \in N\). Logo \(A\) é negligenciável.

É até aqui que a aditividade finita nos leva. Para “passar o limite para dentro” e concluir que os números anormais formam um conjunto de medida nula, precisamos da aditividade enumerável.

A extensão a uma medida de probabilidade começa, portanto, pela verificação da continuidade.

Teorema 2.42

A aplicação \(\P :\mathcal{B}_0((0,1])\rightarrow [0,1]\) definida pela Definição 2.32 é uma pré-medida de probabilidade.

Demonstração

Seja \(\mathcal K\) a família formada por \(\varnothing \) e pelas uniões finitas de intervalos fechados contidos em \((0,1]\). Cada elemento de \(\mathcal K\) é compacto em \(\mathbb {R}\); portanto, pelo exemplo da Seção 2.3, \(\mathcal K\) é uma classe compacta.

Fixe \(A\in \mathcal B_0((0,1])\) e \(\varepsilon \gt 0\), e escreva \(A=\dot\bigcup _{j=1}^m(a_j,b_j]\). Escolha números \(0\lt \delta _j\lt b_j-a_j\) tais que \(\sum _j\delta _j\lt \varepsilon \) e defina

\[ C=\bigcup _{j=1}^m[a_j+\delta _j,b_j] \quad \text{e}\quad B=\bigcup _{j=1}^m(a_j+\delta _j,b_j]. \]

Então \(B\in \mathcal B_0((0,1])\), \(C\in \mathcal K\), \(B\subseteq C\subseteq A\) e

\[ \P (A\setminus B)=\sum _{j=1}^m\delta _j\lt \varepsilon . \]

O Teorema de Extensão Compacta, aplicado a esse sanduíche, mostra que \(\P \) é uma pré-medida. Em termos da estratégia da prova, se \(A_n\downarrow \varnothing \), os compactos \(C_n\) têm interseção vazia e uma subfamília finita — incluindo o primeiro compacto quando ele é o compacto fixado — já tem interseção vazia. Os conjuntos \(B_n\) permitem então medir, por aditividade finita, o erro dessa subfamília finita.

Teorema 2.43 (Medida de Lebesgue)
Dado \(\P :\mathcal{B}_0((0,1])\rightarrow [0,1]\) como na Definição 2.32. Então
  1. \(\P \) admite uma única extensão para uma medida de probabilidade em \(\mathcal{B}((0,1])\) (também denotada \(\P \));

  2. \(\P \) é a única medida em \(\mathcal{B}((0,1])\) que satisfaz \(\P [(0,x]]=x\) para todo \(x\in (0,1]\);

Demonstração

\(\square \) Demonstração do item 2.43.1

O Teorema de Extensão de Carathéodory, junto com o Teorema 2.42, mostra que a pré-medida \(\P :\mathcal{B}_0((0,1])\rightarrow [0,1]\) admite uma única extensão, também denotada por \(\P \), à \(\sigma \)-álgebra \(\mathcal{B}((0,1])=\sigma \bigl\langle \mathcal{B}_0((0,1])\bigr\rangle \).

\(\square \) Demonstração do item 2.43.2

Esse item segue do Teorema de Unicidade de medida pois \(\mathcal{B}((0,1]) = \sigma \langle (0,x]\colon x\in (0,1]\rangle \) e \(\{ (0,x]\colon x\in (0,1] \} \) é uma \(\pi \)-sistema.

Como corolário da construção da medida de Lebesgue temos que o conjunto dos números normais tem probabilidade 1 e surpreendentemente temos que a \(\sigma \)- álgebra de Borel não é o conjunto das partes! Isso ocorre pois existe uma medida de probabilidade não trivial e invariante na \(\sigma \)- álgebra de Borel o que sabemos pela construção do conjunto de Vitali não ocorre no conjunto das partes.

Corolário 2.44
Dado \(\P :\mathcal{B}_0((0,1])\rightarrow [0,1]\) como na Definição 2.32. Então
  1. \(N\in \mathcal{B}((0,1])\) e \(\P [N]=1\) onde \(N\) é o conjunto dos números normais em \((0,1]\);

  2. \(\mathcal{B}_0((0,1]) \subsetneq \mathcal{B}((0,1]) \subsetneq \overline{\mathcal{B}((0,1])}\subsetneq \mathcal{P}(\Omega ) .\) Conjuntos em \(\mathcal{B}((0,1])\) são denominados Borel mensuráveis. Conjunto em \(\overline{\mathcal{B}((0,1])}\) são denominados Lebesgue mensuráveis.

Demonstração

\(\square \) Demonstração do item 2.44.1

Para cada palavra finita \(u\), o evento \(\{ |N_n(u,\omega )/n-2^{-|u|}|\lt 1/m\} \) depende de um número finito de dígitos e pertence a \(\mathcal B_0((0,1])\). Assim,

\[ \left\{ \omega :\frac{N_n(u,\omega )}n\longrightarrow 2^{-|u|}\right\} =\bigcap _{m=1}^\infty \bigcup _{j=1}^\infty \bigcap _{n=j}^\infty \left\{ \omega :\left|\frac{N_n(u,\omega )}n-2^{-|u|}\right|\lt \frac1m\right\} \]

é boreliano. Intersectando sobre a família enumerável de palavras finitas, concluímos que \(N\) e \(N^\mathsf c\) pertencem a \(\mathcal B((0,1])\).

Pelo Teorema 2.41, \(N^\mathsf c\) é negligenciável. Isto é, dado \(\varepsilon \gt 0\), existem \(B_n\in \mathcal B_0((0,1])\) tais que \(N^\mathsf c\subseteq \bigcup _{n=1}^\infty B_n\) e \(\sum _{n=1}^\infty \P (B_n)\leq \varepsilon \). Pela subaditividade,

\[ \P (N^\mathsf c) \leq \P \Bigl(\bigcup _{n=1}^\infty B_n\Bigr) \leq \sum _{n=1}^\infty \P (B_n)\leq \varepsilon . \]

Como \(\varepsilon \) é arbitrário, \(\P (N^\mathsf c)=0\) e \(\P (N)=1\).

\(\square \) Demonstração do item 2.44.2

A inclusão \(\mathcal B_0((0,1])\subsetneq \mathcal B((0,1])\) é própria porque todo singleton é boreliano, enquanto nenhum singleton é união finita de intervalos semiabertos não degenerados. A Proposição 2.55, junto com o Teorema da cardinalidade dos borelianos provado adiante, mostra que \(\mathcal B((0,1])\subsetneq \overline{\mathcal B((0,1])}\): todo subconjunto de um conjunto de Cantor de medida zero é Lebesgue mensurável, mas nem todos esses subconjuntos podem ser borelianos.

Para a última inclusão, usaremos a invariância por translações da medida de Lebesgue, demonstrada adiante no Teorema 2.48. Essa invariância passa à completação: se \(E=B\cup N\), com \(B\) boreliano e \(N\) contido em um boreliano nulo, então \(E+x=(B+x)\cup (N+x)\) continua Lebesgue mensurável e tem a mesma medida. A translação módulo \(1\) em \((0,1]\) é obtida cortando o conjunto no ponto de quebra e transladando as duas partes da maneira usual; portanto a medida completada em \((0,1]\) também é invariante por essa operação. O Teorema de Vitali do Capítulo 1 mostra então que essa medida não pode estar definida em todo \(\mathcal{P}((0,1])\). Logo \(\overline{\mathcal B((0,1])}\subsetneq \mathcal{P}((0,1])\).

Qual a diferença entre a lei fraca e a lei forte de grandes números?

\begin{align*} \text{\textbf{ Lei Fraca}: } & \quad \lim \limits _{n\rightarrow \infty } \P \Bigl(\left|\frac{s_n}{n}\right| \lt \varepsilon \Bigr) = 1, \, \text{ para todo $\varepsilon >0$;} \\ \text{\textbf{Lei Forte }: } & \quad \P \Bigl(\lim \limits _{n\rightarrow \infty } \frac{s_n}{n} = 0 \Bigr) = 1. \end{align*}

A lei fraca fixa o \(n\) e analisa o conjunto dos \(s_n(\omega )/n\) sobre \(\omega \in (0,1] .\) Em particular, a lei fraca diz que para grandes valores de \( n \) torna-se cada vez mais raro encontrar \( \omega \) ’s que satisfazem \(|s_n(\omega )/n| \geq \varepsilon .\) Por outro lado, a lei forte fixa cada \(\omega \in (0,1]\) e analisa os conjuntos dos \(s_n(\omega )/n\) sobre \(n .\) Em particular para quase todo \(\omega \), \(s_n(\omega )/n\rightarrow 0\) quando \(n\rightarrow \infty .\)

2.4.2 Moedas II - Medida de Probabilidade em \(\{ 0, 1\} ^\infty \)

Construiremos o mesmo experimento diretamente no espaço das sequências. Para infinitos lançamentos de moedas honestas, queremos que cada configuração possível dos primeiros \(n\) resultados tenha probabilidade \(2^{-n}\).

O espaço amostral para esta experiência é o conjunto \(\{ 0, 1\} ^\infty \) de todas as sequências infinitas de zeros e uns.

\[ \omega = (\omega _1, \omega _2, \dots )\quad \omega _i \in \{ 0,1\} \]

Como já discutimos, de modo geral pode não ser possível atribuir uma probabilidade a todo subconjunto do espaço amostral. Assim nossa abordagem será um pouco mais cuidadosa. Começaremos criando uma álgebra de subconjuntos, atribuiremos probabilidades finitas aos conjuntos que pertencem a esta álgebra e, em seguida, estenderemos para uma medida de probabilidade na \(\sigma \) álgebra gerada por essa álgebra.

Álgebras determinadas pelos primeiros lançamentos

Considere \(\mathcal{F}_n\) a coleção de eventos cuja ocorrência pode ser decidida olhando apenas para os resultados dos primeiros lançamentos. Por exemplo, o evento \(\{ \omega | \omega _1 = 1 \text{ e }\omega _2 = \omega _6\} \) pertence a \(\mathcal{F}_6\) (e deste modo pertence a \(\mathcal{F}_k\) para todo \(k \geq 6\)).

Seja \(B\) um subconjunto arbitrário de \(\{ 0, 1\} ^n .\) Considere o conjunto

\[ A = \{ \omega \in \{ 0, 1\} ^\infty | (\omega _1, \omega _2, \dots , \omega _n) \in B\} . \]

Podemos expressar \(A \subset \{ 0, 1\} ^\infty \) na forma

\[ A = B \times \{ 0, 1\} ^\infty . \]

(Isto é toda sequência em \(A\) pode ser vista como um par que consiste numa sequência de tamanho \(n\) que pertence a \(B\), seguida de uma sequência infinita arbitrária. Nesse caso \(B\) é dito base do cilindro \(A .\))

Os elementos de \(\mathcal{F}_n\) são precisamente os cilindros dessa forma. A representação também permite verificar que \(\mathcal{F}_n\) é uma \(\sigma \)-álgebra.

O Exercício 2.20, ao final do capítulo, formaliza a verificação de que \(\mathcal{F}_n\) é uma \(\sigma \)-álgebra.

Cada \(\sigma \)-álgebra \(\mathcal{F}_n\) descreve apenas os primeiros \(n\) lançamentos. Para reunir os eventos que podem ser decididos após algum número finito de lançamentos, sem fixar esse número de antemão para toda a família, definimos

\[ \mathcal{F}_0 = \bigcup _{n=1}^\infty \mathcal{F}_n, \]

a coleção dos conjuntos que pertencem a \(\mathcal{F}_n\) para algum \(n .\) Assim, \(A \in \mathcal{F}_0\) quando sua ocorrência pode ser decidida após um número fixo de lançamentos, que depende do evento.

Exemplo 2.45
Seja \(A_n = \{ \omega | \omega _n = 1\} \), o evento que o n-ésimo lance resulta em \(1 .\) Observamos que \(A_n \in \mathcal{F}_n .\) Seja \(A = \bigcup _{n=1}^\infty A_n\), que é o evento que existe pelo menos um \(1\) na sequência de lançamentos infinitos. O evento A não pertence a \(\mathcal{F}_n\), para qualquer \(n .\) (Intuitivamente, tendo observado uma sequência de \(n\) zeros isso não nos permite decidir se haverá um \(1\) subsequente ou não.)

O exemplo anterior mostra que \(\mathcal{F}_0\) não é uma \(\sigma \)-álgebra. Por outro lado, podemos mostrar que \(\mathcal{F}_0\) é uma álgebra.

A estrutura algébrica de \(\mathcal{F}_0\) é verificada no Exercício 2.21, ao final do capítulo.

Queremos atribuir probabilidades a todos os eventos em \(\mathcal{F}_n\), para cada \(n\). Precisamos, portanto, de uma \(\sigma \)-álgebra que contenha \(\mathcal{F}_0\). A escolha natural é a menor possível: ela inclui os eventos que dependem de um número finito de coordenadas e apenas os subconjuntos de \(\{ 0,1\} ^\infty \) exigidos pelas operações da teoria. Tomamos, assim, \(F\) como a \(\sigma \)-álgebra gerada por \(\mathcal{F}_0 .\)

Definindo a medida de Probabilidade

Começamos definindo uma função finitamente aditiva \(\P _0\) na álgebra \(\mathcal{F}_0\) que satisfaz \(\P _0 (\{ 0, 1\} ^\infty ) = 1 .\) Isso será realizado da seguinte forma. Todo conjunto \(A\) em \(\mathcal{F}_0\) é da forma \(B \times \{ 0, 1\} ^\infty \), para algum \(B \subset \{ 0, 1\} ^n .\) Então, definimos \(\P _0 (A) = \dfrac {| B |}{ 2^n} .\)

Observe que desta forma ao evento que nos primeiros \(n\) lançamentos ocorre uma sequência particular \(\{ \omega _1, \omega _2,\dots , \omega _n\} \), é atribuída a probabilidade \(1 / 2^n .\) Em particular, todas as sequências possíveis de comprimento fixo são atribuídas a mesma probabilidade, conforme desejado.

A definição deve independer da representação: o mesmo conjunto \(A\) pode pertencer a \(\mathcal{F}_n\) para vários valores de \(n .\) Precisamos verificar que essas escolhas dão o mesmo valor a \(\P _0 (A)\). Na verdade, suponha que \(A \in \mathcal{F}_m\), que implica que \(A \in \mathcal{F}_n\), para \(n\gt m .\) Neste caso,

\[ A = B \times \{ 0, 1\} ^\infty = C \times \{ 0, 1\} ^\infty , \]

onde \(B \subset \{ 0, 1\} ^n\) e \(C \subset \{ 0, 1\} ^m .\) Assim, \(B = C \times \{ 0, 1\} ^{n-m}\) e \(| B | = | C | \cdot 2^{n-m} .\) Uma aplicação da definição produz \(\P _0 (A) = | B | / 2^n\), e outra produz \(\P _0 (A) = | C | / 2^m .\) Como \(| B | = | C | \cdot 2^{n-m}\), ambos produzem o mesmo valor.

A contagem fornece \(\P _0(\Omega )=1\) e mostra que \(\P _0\) é finitamente aditiva. Na topologia produto discreta, \(\Omega =\{ 0,1\} ^{\infty }\) é um espaço compacto de Hausdorff, e cada elemento de \(\mathcal{F}_0\) é um cilindro fechado, portanto compacto. Pelo exemplo da Seção 2.3, \(\mathcal{F}_0\) é uma classe compacta. Além disso, como o próprio \(A\) participa do supremo,

\[ \P _0 (A) = \sup \{ \P _0 (C): C \in \mathcal{F}_0 \text{ e } C \subseteq A\} . \]

Logo o Teorema de Extensão Compacta mostra que \(\P _0\) é uma pré-medida. Aplicando em seguida o Teorema de Extensão de Carathéodory, concluímos que existe uma única medida de probabilidade em \(\mathcal{F}\), a \(\sigma \)-álgebra gerada por \(\mathcal{F}_0\), que concorda com \(\P _0\) em \(\mathcal{F}_0\). Esta medida de probabilidade atribui a mesma probabilidade, \(1/2^n\), a cada sequência possível de comprimento \(n\), conforme desejado.

Os dois modelos de lançamentos de moedas que construímos são equivalentes.

2.4.3 Medida de Lebesgue em \(\mathbb {R}^d\)

Para todo \(\boldsymbol i=(i_1,\ldots , i_d)\in \mathbb Z^d\) seja \((\boldsymbol i,\boldsymbol i+1]\) o cubo unitário em \(\mathbb {R}^d\) transladado por \(\boldsymbol i\) ou seja

\[ (\boldsymbol i,\boldsymbol i+1] \equiv (i_1, i_1+1]\times \cdots \times (i_d,i_d + 1]. \]

Esses conjuntos particionam o espaço,

\[ \mathbb {R}^d=\bigcup _{\boldsymbol i\in \mathbb Z^d} (\boldsymbol i,\boldsymbol i+1], \]

e assim \(\mathbb {R}^d\) pode ser decomposto como união enumerável de cubos unitários disjuntos. Seja \(\mathcal B_0^{(\boldsymbol i,\boldsymbol i+1]}\) a álgebra das uniões finitas de retângulos semiabertos disjuntos contidos em \((\boldsymbol i,\boldsymbol i+1]\), e seja \(\mathcal B((\boldsymbol i,\boldsymbol i+1])= \sigma \langle \mathcal B_0^{(\boldsymbol i,\boldsymbol i+1]}\rangle \) a \(\sigma \)-álgebra de Borel relativa desse cubo. Denote por \(\P _{\boldsymbol i}\) a medida de probabilidade uniforme em \(\mathcal B((\boldsymbol i,\boldsymbol i+1])\) que atribui o volume euclidiano aos retângulos, isto é,

\[ \P _{\boldsymbol i}\bigl( (a_1,b_1]\times \cdots \times (a_d,b_d]\bigr)=\prod _{k=1}^d (b_k - a_k) \]

sempre que \((a_1,b_1]\times \cdots \times (a_d,b_d]\subset (\boldsymbol i,\boldsymbol i+1] .\)

A construção de \(\P _{\boldsymbol i}\) repete, em dimensão \(d\), o argumento usado em \((0,1]\). Numa união disjunta de retângulos, define-se primeiro a soma dos volumes. Um refinamento por todos os hiperplanos coordenados que contêm suas faces mostra que a soma não depende da decomposição e é finitamente aditiva. Uniões finitas de caixas fechadas formam uma classe compacta e, recuando ligeiramente cada face esquerda, obtemos o sanduíche da condição (2.17). O Teorema de Extensão Compacta fornece a pré-medida; o Teorema de Extensão de Carathéodory fornece então a única medida de probabilidade \(\P _{\boldsymbol i}\) na \(\sigma \)-álgebra relativa de Borel.

Para \(A\in \mathcal B(\mathbb {R}^d)\), defina

\begin{equation} \mu _{\mathcal L}^d(A):= \sum _{\boldsymbol i\in \mathbb Z^d} \P _{\boldsymbol i}\bigl((\boldsymbol i,\boldsymbol i+1]\cap A\bigr). \label{lm} \tag{2.19} \end{equation}

Agora provaremos que \(\mu _{\mathcal L}^d\) é uma medida em \((\mathbb {R}^d,\mathcal{B}(\mathbb {R}^d)) .\)

Teorema 2.46 (Medida de Lebesgue)
\(\mu _{\mathcal L}^d\) é uma medida em \((\mathbb {R}^d,\mathcal{B}(\mathbb {R}^d)) .\)

Demonstração

Demonstraremos que\(\mu _{\mathcal L}^d\) satisfaz os três axiomas (i), (ii) e (iii):

  • (i) \(\mu _{\mathcal L}^d(A)\in [0,\infty ] : \) Trivial.

  • (ii) \(\mu _{\mathcal L}^d(\varnothing )=0 : \) Imediato pois \(\P _{\boldsymbol i}\bigl( (\boldsymbol i, \boldsymbol i+1]\cap \varnothing \bigr)=0 .\)

  • (iii) \(\sigma \)-aditividade: Suponha \(A_1,A_2,\ldots \in \mathcal{B}(\mathbb {R}^d)\) são disjuntos. Então

    \begin{align*} \mu _{\mathcal L}^d\Bigl(\bigcup _{k=1}^\infty A_k\Bigr) & =\sum _{\boldsymbol i\in \mathbb Z^d} \P _{\boldsymbol i}\Bigl((\boldsymbol i, \boldsymbol i+1] \cap \bigcup _{k=1}^\infty A_k \Bigr) \nonumber \\ & =\sum _{\boldsymbol i\in \mathbb Z^d} \P _{\boldsymbol i}\Bigl( \bigcup _{k=1}^\infty (\boldsymbol i, \boldsymbol i+1] \cap A_k \Bigr) \nonumber \\ & =\sum _{\boldsymbol i\in \mathbb Z^d} \sum _{k=1}^\infty \P _{\boldsymbol i} \Bigl((\boldsymbol i, \boldsymbol i+1] \cap A_k \Bigr) \\ & =\sum _{k=1}^\infty \sum _{\boldsymbol i\in \mathbb Z^d} \P _{\boldsymbol i} \Bigl((\boldsymbol i, \boldsymbol i+1] \cap A_k \Bigr) \\ & =\sum _{k=1}^\infty \mu _{\mathcal L}^d\bigl(A_k \bigr) \nonumber \end{align*}

Teorema 2.47

\(\mu _{\mathcal L}^d\) é a única medida em \((\mathbb {R}^d,\mathcal B(\mathbb {R}^d))\) que atribui o volume euclidiano padrão aos retângulos semiabertos limitados, isto é,

\[ \mu _{\mathcal L}^d \bigl( (a_1,b_1]\times \cdots \times (a_d,b_d]\bigr)=\prod _{k=1}^d (b_k - a_k) \]

para \(-\infty \lt a_k \lt b_k \lt \infty .\)

Demonstração

Seja \(\nu \) outra medida com a propriedade do enunciado e seja \(\mathcal P\) o \(\pi \)-sistema formado por \(\varnothing \) e pelos retângulos semiabertos limitados. Então \(\mathcal B(\mathbb {R}^d)=\sigma \langle \mathcal P\rangle \), e as duas medidas concordam em \(\mathcal P\). Além disso, os cubos \(D_n=(-n,n]^d\) pertencem a \(\mathcal P\), crescem para \(\mathbb {R}^d\) e satisfazem

\[ \nu (D_n)=\mu _{\mathcal L}^d(D_n)=(2n)^d\lt \infty . \]

A versão \(\sigma \)-finita do Teorema 2.14 implica \(\nu =\mu _{\mathcal L}^d\) em \(\mathcal B(\mathbb {R}^d)\).

Teorema 2.48

Para todo \(A\in \mathcal B(\mathbb {R}^d)\) e \(x\in \mathbb {R}^d\), o conjunto \(A+x:=\{ a+x:a\in A\} \) está em \(\mathcal B(\mathbb {R}^d)\) e

\[ \mu _{\mathcal L}^d(A+x) = \mu _{\mathcal L}^d(A) \]

Demonstração

A translação \(\tau _x(y)=y+x\) é um homeomorfismo de \(\mathbb {R}^d\), com inversa \(\tau _{-x}\). Portanto leva borelianos em borelianos. Defina \(\mu _x(A)=\mu _{\mathcal L}^d(A+x)\). Como a translação preserva uniões disjuntas, \(\mu _x\) é uma medida em \(\mathcal B(\mathbb {R}^d)\). Para cada retângulo semiaberto limitado \(R\), o transladado \(R+x\) é outro retângulo com os mesmos comprimentos laterais; logo \(\mu _x(R)=\mu _{\mathcal L}^d(R)\). Pela unicidade provada no Teorema 2.47, as duas medidas coincidem em toda a \(\sigma \)-álgebra de Borel.

Teorema 2.49

Dado \((\Omega , \mathcal{F},\mu )\) uma medida \(\sigma \)-finita. Então \(\mathcal{F}\) não pode conter uma família de conjuntos disjuntos não enumeráveis de \( \mu \)-medida positiva

Demonstração

Seja \(\{ B_i:i\in \mathcal I\} \) uma família disjunta com \(\mu (B_i)\gt 0\). Escolha \(A_k\in \mathcal{F}\) tais que \(\Omega =\bigcup _kA_k\) e \(\mu (A_k)\lt \infty \). Para \(k,m\geq 1\), defina

\[ I_{k,m}=\{ i\in \mathcal I:\mu (A_k\cap B_i)\gt 1/m\} . \]

Esse conjunto é finito: se contivesse \(N\) índices distintos, a aditividade finita daria \(\mu (A_k)\gt N/m\), o que é impossível para \(N\) arbitrariamente grande. Portanto \(I_k=\{ i:\mu (A_k\cap B_i)\gt 0\} =\bigcup _{m=1}^\infty I_{k,m}\) é enumerável.

Para cada \(i\in \mathcal I\), a \(\sigma \)-subaditividade e \(B_i=\bigcup _k(A_k\cap B_i)\) mostram que algum \(k\) satisfaz \(\mu (A_k\cap B_i)\gt 0\); caso contrário, \(\mu (B_i)=0\). Logo \(\mathcal I=\bigcup _k I_k\), uma união enumerável de conjuntos enumeráveis.

Proposição 2.50
Se \(0\leq k\lt d\), então todo subespaço afim \(k\)-dimensional de \(\mathbb {R}^d\) tem medida de Lebesgue nula.

Demonstração

Escreva \(A=a+V\), onde \(V\) é um subespaço linear de dimensão \(k\lt d\), e escolha \(v\notin V\). Os conjuntos \(A+tv\), \(t\in \mathbb {R}\), são fechados, dois a dois disjuntos e têm todos a mesma medida, pela invariância por translação. Como a medida de Lebesgue é \(\sigma \)-finita, o Teorema 2.50 impede que essa família não enumerável seja formada por conjuntos de medida positiva. Logo \(\mu _{\mathcal L}^d(A)=0\).

Teorema 2.51
Se \(T:\mathbb {R}^d\rightarrow \mathbb {R}^d\) é linear e não singular, então \(A\in \mathcal{B}(\mathbb {R}^d)\) implica que \(T\! A:=\{ T(a): a\in A\} \in \mathcal{B}(\mathbb {R}^d)\) e
\[ \mu _{\mathcal L}^d(T\! A)=|\det T |\mu _{\mathcal L}^d(A). \]

Demonstração

Como \(T\) é um homeomorfismo, leva borelianos em borelianos. Usaremos primeiro o seguinte fato geométrico: se \(R\) é um retângulo semiaberto limitado, então

\begin{equation} \mu _{\mathcal L}^d(TR)=|\det T|\, \mu _{\mathcal L}^d(R). \label{eq:volume-paralelepipedo} \tag{2.20} \end{equation}

Eis uma justificativa compatível com a construção anterior. A fronteira do paralelepípedo \(TR\) está contida numa união finita de hiperplanos afins, que têm medida nula pela Proposição 2.51. Considere as uniões finitas \(I_m\) e \(O_m\) dos cubos da malha \(2^{-m}\mathbb Z^d\) que, respectivamente, estão contidos em \(TR\) e encontram \(TR\). Então \(I_m\subseteq TR\subseteq O_m\), e \(O_m\setminus I_m\) fica contido numa vizinhança de raio \(\sqrt d\, 2^{-m}\) da fronteira, dentro de um conjunto limitado fixo. Pela continuidade por cima e pela nulidade da fronteira, \(\mu (O_m\setminus I_m)\to 0\). As medidas de \(I_m\) e \(O_m\) são as somas dos volumes dos cubos que os compõem; essas são precisamente as somas interna e externa de Jordan. Neste ponto usamos um resultado clássico da Álgebra Linear: o volume euclidiano de um paralelepípedo obtido pela transformação linear \(T\) é \(|\det T|\) vezes o volume do paralelepípedo original. Assim, o limite comum das somas de Jordan é \(|\det T|\, \mu _{\mathcal L}^d(R)\), e (2.20) segue. Essa relação determinante–volume é tomada aqui como resultado prévio de Álgebra Linear.

Defina agora

\[ \nu (A)=\frac{\mu _{\mathcal L}^d(TA)}{|\det T|}, \qquad A\in \mathcal B(\mathbb {R}^d). \]

A bijetividade de \(T\) mostra que \(\nu \) é uma medida. Pela equação (2.20), ela concorda com \(\mu _{\mathcal L}^d\) em todos os retângulos semiabertos limitados. A unicidade do Teorema 2.47 dá \(\nu =\mu _{\mathcal L}^d\), que é a identidade desejada.

Definição 2.52 (Conjuntos mensuráveis de Borel versus Lebesgue)
Dado \(\bigl(\mathbb {R}^d,\overline{\mathcal{B}(\mathbb {R}^d)},\overline{\mu _{\mathcal L}^d}\bigr)\) o completamento de \((\mathbb {R}^d, \mathcal{B}(\mathbb {R}^d),\mu _{\mathcal L}^d) .\) Se \(A\in \mathcal{B}(\mathbb {R}^d)\) então \(A\) é dito Borel mensurável. Se \(A\in \overline{\mathcal{B}(\mathbb {R}^d)}\) então \(A\) é dito Lebesgue mensurável.

2.5 Borelianos: como se formam e quantos são?

Nesta seção opcional estudaremos a estrutura e a cardinalidade dos conjuntos borelianos e dos conjuntos mensuráveis de Lebesgue. Os resultados não serão usados no restante do texto.

Começaremos com uma descrição elementar dos abertos e fechados.

Proposição 2.53
  • Todo subconjunto aberto de \(\mathbb {R}\) é uma união enumerável de intervalos abertos e, portanto, é boreliano.

  • Todo subconjunto fechado de \(\mathbb {R}\) é boreliano.

Demonstração

Se \(U\subseteq \mathbb {R}\) é aberto, para cada \(x\in U\) existem racionais \(p_x\lt x\lt q_x\) tais que \((p_x,q_x)\subseteq U\). Logo \(U\) é a união dos intervalos \((p,q)\), com extremos racionais, que estão contidos em \(U\). Essa família é enumerável. Como intervalos abertos geram \(\mathcal B(\mathbb {R})\), segue que \(U\) é boreliano. Se \(F\) é fechado, então \(F=\mathbb {R}\setminus F^{\mathsf c}\), e a segunda afirmação decorre da primeira.

Conjunto de Cantor

Para construir o conjunto Cantor, começamos com o intervalo unitário: \(C_0 = [0, 1] .\) Em seguida, removemos o terço médio desse intervalo, deixando uma união de dois intervalos fechados:

\[ C_{1}=[0,1/3]\cup [2/3,1] \]

Em seguida, removemos o terço médio de cada um desses intervalos, deixando uma união de quatro intervalos fechados:

\[ C_2=[0,1/9]\cup [2/9,1/3]\cup [2/3,7/9]\cup [8/9,1] \]

Procedendo desta maneira, obtemos uma sequência encaixante \(C_0 \supset C_1 \supset C_2 \supset \cdots \) de conjuntos fechados, onde \(C_n\) é a união de \(2^n\) intervalos fechados, como ilustrado na Figura 2.6. Então a interseção

\[ C = \bigcap _n C_n \]

é o conjunto de Cantor.

Figura 2.6 As primeiras etapas da construção do conjunto de Cantor.

Figura 2.6 As primeiras etapas da construção do conjunto de Cantor.

Proposição 2.54
O conjunto de Cantor \(C\) tem as seguintes propriedades:
  1. \(C\) é fechado, e logo é um Boreliano.

  2. \(C\) é não enumerável. De fato, \(| C | = | \mathbb {R}| .\)

  3. \(\mu (C) = 0 .\)

Demonstração

Como \(C=\bigcap _nC_n\) e cada \(C_n\) é fechado, \(C\) é fechado. A aplicação

\[ (a_n)_{n\geq 1}\longmapsto \sum _{n=1}^\infty \frac{2a_n}{3^n} \]

é uma bijeção de \(\{ 0,1\} ^{\mathbb {N}}\) sobre \(C\); logo \(|C|=|\{ 0,1\} ^{\mathbb {N}}|=|\mathbb {R}|\). Finalmente, \(C_n\) é a união de \(2^n\) intervalos de comprimento \(3^{-n}\), e portanto

\[ 0\leq \mu _{\mathcal L}(C)\leq \mu _{\mathcal L}(C_n) =\left(\frac23\right)^n. \]

Fazendo \(n\to \infty \), obtemos \(\mu _{\mathcal L}(C)=0\).

Proposição 2.55 (Cardinalidade dos conjuntos mensuráveis)
Seja \(\L \) a coleção de todos os subconjuntos Lebesgue mensuráveis de \(\mathbb {R}\). Então
\[ | \L | = | \mathcal{P} (\mathbb {R}) | . \]

Demonstração

Claramente \(|\L |\leq |\mathcal P(\mathbb {R})|\). Como o conjunto de Cantor \(C\) tem medida de Lebesgue nula, todo subconjunto de \(C\) é Lebesgue mensurável, isto é, \(\mathcal P(C)\subseteq \L \). Como \(|C|=|\mathbb {R}|\), temos \(|\mathcal P(C)|=|\mathcal P(\mathbb {R})|\) e, portanto, \(|\mathcal P(\mathbb {R})|\leq |\L |\). O teorema de Cantor–Bernstein conclui a igualdade.

Definição 2.56 (Hierarquia Finita de Borel)
A hierarquia finita do Borel consiste em duas sequências \({\Sigma _n}\) e \({\Pi _n}\) de subconjuntos de \(\mathcal{B}\) definidos da seguinte forma:
  • \(\Sigma _1\) é a coleção de todos os conjuntos abertos em \(\mathbb {R}\) e \(\Pi _1\) é a coleção de todos os conjuntos fechados em \(\mathbb {R}.\)

  • Para cada \(n \geq 1\), a coleção \(\Sigma _{n + 1}\) consiste de todas as uniões enumeráveis de conjuntos de \(\Pi _n\), e a coleção \(\Pi _{n + 1}\) consiste de todas as interseções enumeráveis de conjuntos de \(\Sigma _n .\)

Exemplo 2.57
Assim, cada conjunto em \(\Sigma _3\) pode ser escrito como
\[ \bigcup _{m \in \mathbb {N}} \bigcap _{n \in \mathbb {N}} U_{m, n} \]
para conjuntos abertos \( U_{m, n} \) e cada conjunto em \( \Pi _{3} \) pode ser escrito como
\[ \bigcap _{m \in \mathbb {N}} \bigcup _{n \in \mathbb {N}} F_{m, n} \]
para conjuntos fechados \( F_{m, n}. \)

Obtemos, portanto, \( \Sigma _{1} \subseteq \Sigma _{2}, \Sigma _{1} \subseteq \Pi _{2}, \Pi _{1} \subseteq \Sigma _{2} \) e \( \Pi _{1} \subseteq \Pi _{2}. \) E além disso, todas as quatro inclusões são próprias.

Teorema 2.58 (Propriedades de \( \Sigma _{n} \) e \( \Pi _{n} \))

Para cada \(n\in \mathbb {N}\), as seguintes afirmações são válidas.

  1. Para todo \( S \subseteq \mathbb {R}\), temos \( S \in \Sigma _{n} \) se e somente se \( S ^{c} \in \Pi _{n}. \)

  2. \( \Sigma _{n} \subseteq \Sigma _{n + 1}, \Sigma _{n} \subseteq \Pi _{n + 1}, \Pi _{n} \subseteq \Sigma _{n + 1} \), e \( \Pi _{n} \subseteq \Pi _{n + 1}. \)

Além disso, todas as inclusões são próprias.

Demonstração

A primeira afirmação segue por indução das leis de De Morgan. Para as inclusões, observe inicialmente que, em \(\mathbb {R}\), todo aberto é uma união enumerável de fechados: se \(U\) é aberto, tome, por exemplo,

\[ F_m=\{ x\in [-m,m]:d(x,U^{\mathsf c})\geq 1/m\} , \qquad U=\bigcup _{m=1}^\infty F_m. \]

Logo \(\Sigma _1\subseteq \Sigma _2\); tomando complementos, \(\Pi _1\subseteq \Pi _2\). As inclusões cruzadas seguem repetindo o mesmo conjunto numa união ou interseção enumerável. A indução nas definições de \(\Sigma _{n+1}\) e \(\Pi _{n+1}\) fornece todas as inclusões do item 2.

Registramos também por que nenhuma delas é uma igualdade. No espaço de Baire \(\mathcal N=\mathbb {N}^{\mathbb {N}}\) existe, para cada \(n\), um conjunto universal \(U_n\in \Sigma _n(\mathcal N\times \mathcal N)\): cada conjunto de \(\Sigma _n(\mathcal N)\) é uma seção \((U_n)_x\). Para \(n=1\), basta enumerar os cilindros básicos e usar as coordenadas de \(x\) para indicar quais entram na união. Passar de \(n\) para \(n+1\) consiste em tomar complementos e uniões enumeráveis; uma única sequência de naturais codifica uma sequência enumerável de parâmetros, pois \(\mathcal N\cong \mathcal N^{\mathbb {N}}\). Essa é uma indução explícita da propriedade universal.

O conjunto diagonal

\[ D_n=\{ x\in \mathcal N:(x,x)\notin U_n\} \]

pertence a \(\Pi _n\), mas não a \(\Sigma _n\): se \(D_n=(U_n)_y\) para algum \(y\), teríamos \(y\in D_n\) se e somente se \(y\notin D_n\). Portanto \(\Sigma _n\ne \Pi _n\). Como \(\mathcal N\) é homeomorfo ao conjunto dos irracionais, uma subclasse \(G_\delta \) de \(\mathbb {R}\), a igualdade de qualquer uma das inclusões em \(\mathbb {R}\) forçaria a igualdade correspondente nas classes relativas de \(\mathcal N\). A contradição diagonal, juntamente com as inclusões já provadas e a passagem aos complementos, mostra que as quatro inclusões são próprias.

Se \(B\subseteq \mathbb {R}\) for boreliano e pertencer a algum nível finito, sua classificação de Borel finita é o menor \(n\) tal que \(B\in \Sigma _n\cup \Pi _n\). Assim, conjuntos abertos ou fechados têm classificação no máximo \(1\).

Nem todo boreliano tem classificação finita. A hierarquia prossegue pelos ordinais contáveis. Para um sucessor \(\alpha +1\), define-se \(\Sigma _{\alpha +1}\) por uniões enumeráveis de conjuntos de \(\Pi _\alpha \), e \(\Pi _{\alpha +1}\) por complementação. Se \(\lambda \) é um ordinal limite contável, \(\Sigma _\lambda \) é formada pelas uniões enumeráveis de conjuntos que pertencem a classes \(\Pi _\alpha \) com \(\alpha \lt \lambda \), e novamente \(\Pi _\lambda \) é a classe dos complementos. A mesma construção universal e diagonal usada acima mostra que a hierarquia é própria em cada nível contável; em particular, existem borelianos de classificação não finita. Além disso,

\[ \mathcal B(\mathbb {R}) =\bigcup _{1\leq \alpha \lt \omega _1}\Sigma _\alpha =\bigcup _{1\leq \alpha \lt \omega _1}\Pi _\alpha , \]

onde \(\omega _1\) é o primeiro ordinal não contável.

Teorema 2.59 (Cardinalidade da \(\sigma \)-álgebra de Borel)
Seja \(\mathcal{B}\) a \(\sigma \)-álgebra de Borel em \(\mathbb {R}.\) Então \(| \mathcal{B}| = | \mathbb {R}| .\)

Demonstração

Como todo singleton é fechado, a aplicação \(x\mapsto \{ x\} \) injeta \(\mathbb {R}\) em \(\mathcal B(\mathbb {R})\); portanto \(|\mathbb {R}|\leq |\mathcal B(\mathbb {R})|\). Para a desigualdade contrária, fixe uma base enumerável de intervalos com extremos racionais. Todo boreliano pode ser descrito por um código: uma árvore bem fundada e enumerável cujas folhas são elementos da base e cujos vértices registram complementos ou uniões enumeráveis. Essas árvores podem ser vistas como subconjuntos de \(\mathbb {N}^{\lt \mathbb {N}}\) com rótulos naturais. Há no máximo \(2^{\aleph _0}=|\mathbb {R}|\) códigos desse tipo. Logo \(|\mathcal B(\mathbb {R})|\leq |\mathbb {R}|\), e a igualdade segue.

Proposição 2.60
A cardinalidade da coleção de conjuntos Lebesgue mensuráveis é igual a \(|\mathcal P(\mathbb {R})|\).

Demonstração

Esta é precisamente a Proposição 2.55.

Como essa cardinalidade é maior que a cardinalidade da \(\sigma \)-álgebra de Borel, obtemos o seguinte corolário.

Corolário 2.61
Existe um conjunto mensurável de Lebesgue que não é um conjunto de Borel.

Demonstração

Pelo Teorema 2.59, existem \(|\mathbb {R}|\) borelianos. Pela Proposição 2.55, existem \(|\mathcal P(\mathbb {R})|\) conjuntos Lebesgue mensuráveis. O teorema de Cantor dá \(|\mathcal P(\mathbb {R})|\gt |\mathbb {R}|\), e portanto nem todo conjunto Lebesgue mensurável pode ser boreliano.

2.6 Medidas em Espaços Métricos

Em espaços métricos separáveis e completos, a topologia permite aproximar conjuntos mensuráveis por abertos e compactos. Essa regularidade será útil sempre que precisarmos controlar medidas por objetos geometricamente mais simples.

Definição 2.62 (Espaço polonês)
Um espaço métrico é polonês se é separável e admite uma métrica completa que gera sua topologia.

Definição 2.63 (Regularidade e tightness)
Seja \(S\) um espaço métrico e seja \(\mu \) uma medida finita em \(\mathcal B(S)\). Dizemos que \(\mu \) é regular se, para todo \(A\in \mathcal B(S)\),
\[ \mu (A)=\inf \{ \mu (U):A\subseteq U,\ U\text{ aberto}\} =\sup \{ \mu (F):F\subseteq A,\ F\text{ fechado}\} . \]
Uma medida de probabilidade \(\mu \) é tight se, para todo \(\varepsilon \gt 0\), existe um compacto \(K\subseteq S\) tal que \(\mu (K)\gt 1-\varepsilon \). Quando a aproximação interna na igualdade anterior pode ser feita por compactos, a medida é também chamada de medida de Radon.

Teorema 2.64 (Regularidade de medidas em espaços poloneses)
Toda medida de probabilidade boreliana num espaço polonês é regular, tight e de Radon.

Demonstração

Seja \((S,d)\) polonês e escolha um conjunto enumerável denso. Para cada \(n\geq 1\), as bolas de raio \(2^{-n}\) centradas nesse conjunto cobrem \(S\). Como \(\mu (S)=1\), uma união finita dessas bolas, denotada por \(U_n\), pode ser escolhida de modo que \(\mu (U_n)\gt 1-\varepsilon /2^{n+1}\). Seja \(F_n\) a união das bolas fechadas com os mesmos centros e raios e defina \(K=\bigcap _nF_n\). Então

\[ \mu (K)\geq 1-\sum _{n=1}^\infty \mu (F_n^{\mathsf c}) \gt 1-\varepsilon . \]

O conjunto \(K\) é fechado em um espaço completo e, para cada \(n\), pode ser coberto por um número finito de bolas de raio \(2^{-n}\). Logo é completo e totalmente limitado, portanto compacto. Isso prova a tightness.

Provemos agora a regularidade. Se \(F\) é fechado, os abertos \(U_n=\{ x:d(x,F)\lt 1/n\} \) decrescem para \(F\). Pela continuidade por cima da medida finita, \(\mu (U_n)\downarrow \mu (F)\); logo todo fechado é regular por fora. A finitude mostra, por complementação, que todo aberto é regular por dentro por conjuntos fechados.

Seja \(\mathcal R\) a classe dos borelianos que são regulares por fora por abertos e por dentro por fechados. Ela contém abertos e fechados e é fechada por complementos. Se \(A_j\in \mathcal R\), escolha abertos \(U_j\supseteq A_j\) com \(\mu (U_j\setminus A_j)\lt \varepsilon /2^j\); então \(\bigcup _jU_j\) dá regularidade externa para \(\bigcup _jA_j\). Para a regularidade interna, escolha primeiro \(m\) de modo que \(\mu (\bigcup _jA_j)-\mu (\bigcup _{j=1}^mA_j)\lt \varepsilon /2\) e aproxime cada \(A_j\), \(j\leq m\), por um fechado; a união finita desses fechados dá o aproximante desejado. Assim \(\mathcal R\) é uma \(\sigma \)-álgebra que contém os abertos, e portanto \(\mathcal R=\mathcal B(S)\).

Finalmente, dado \(A\in \mathcal B(S)\), escolha um fechado \(F\subseteq A\) com \(\mu (A\setminus F)\lt \varepsilon /2\) e, pela tightness, um compacto \(K\) com \(\mu (K^{\mathsf c})\lt \varepsilon /2\). O conjunto \(F\cap K\) é compacto, está contido em \(A\) e satisfaz \(\mu (A\setminus (F\cap K))\lt \varepsilon \). Logo a regularidade interna pode ser feita por compactos.

Exercício 2.1

O primeiro seis: construção da probabilidade. Retome o espaço amostral \(\Omega \) do Exercício 1.14. Denote por \(W\) o conjunto das palavras finitas que terminam no primeiro \(6\) e, para todo \(A\subseteq \Omega \), defina

\[ \P (A)=\sum _{w\in A\cap W}6^{-|w|}, \]

onde \(|w|\) é o comprimento da palavra \(w\).

  1. Prove que \(\P \) é uma medida de probabilidade em \((\Omega ,\mathcal{P}(\Omega ))\).

  2. Se \(T\) é o instante do primeiro \(6\), com \(T=\infty \) nas trajetórias infinitas, determine a lei de \(T\) e prove que \(T\lt \infty \) quase certamente.

Ver solução
Há \(5^{n-1}\) palavras de comprimento \(n\) em \(W\), logo
\[ \P (\Omega )=\sum _{n\geq 1}5^{n-1}6^{-n}=1. \]
A aditividade enumerável segue da reordenação de uma série de termos não negativos. Além disso,
\[ \P (T=n)=5^{n-1}6^{-n} =\left(\frac56\right)^{n-1}\frac16, \qquad \P (T\gt n)=\left(\frac56\right)^n. \]
O conjunto \(\{ T=\infty \} =\Omega \setminus W\) não contém palavras finitas e, portanto, tem probabilidade zero.
Exercício 2.2

Seja \(\mu _0\) uma pré-medida numa álgebra \(\mathcal A\) de subconjuntos de \(X\), com \(X\in \mathcal A\) e \(\mu _0(X)\lt \infty \), e seja \(\mu ^*\) a medida exterior induzida por \(\mu _0\). Prove que um conjunto \(E\subseteq X\) é mensurável no sentido de Carathéodory se, e somente se,

\[ \mu ^*(E)+\mu ^*(E^c)=\mu _0(X), \]

onde o complemento é tomado em \(X\).

Ver solução
Se \(E\) é mensurável, aplique o critério de Carathéodory a \(X\) e use \(\mu ^*(X)=\mu _0(X)\). Para a volta, introduza a medida interior \(\mu _*(E)=\mu _0(X)-\mu ^*(E^c)\). A igualdade dada diz \(\mu _*(E)=\mu ^*(E)\). Pela construção da medida exterior a partir da álgebra, escolha conjuntos mensuráveis \(G_n\supseteq E\) com \(\mu ^*(G_n)\downarrow \mu ^*(E)\) e ponha \(G=\bigcap _nG_n\). Então \(\mu ^*(G\setminus E)=\mu ^*(G)-\mu _*(E)=0\). Logo \(E\) difere de um conjunto Carathéodory-mensurável por um conjunto de medida exterior nula e também é mensurável.
Exercício 2.3 (title=Medida de Lebesgue–Stieltjes)

  Considere a álgebra

\[ \mathcal A_0 =f\left\langle (-\infty ,a]:a\in \mathbb {R}\right\rangle \]

de subconjuntos de \(\mathbb {R}\), e seja \(P\) uma probabilidade finitamente aditiva em \(\mathcal A_0\). Defina

\[ F(x)=P(( -\infty ,x]),\qquad x\in \mathbb {R}. \]

Prove que \(P\) é uma pré-medida em \(\mathcal A_0\) se, e somente se, \(F\) é não decrescente, contínua à direita e satisfaz

\[ \lim _{x\to -\infty }F(x)=0, \qquad \lim _{x\to +\infty }F(x)=1. \]

Conclua que, nessas condições, \(P\) possui uma única extensão a uma probabilidade em \(\mathcal B(\mathbb {R})\).

Ver solução
Se \(P\) é pré-medida, monotonicidade dá que \(F\) é crescente; continuidade da medida para \((-\infty ,x+1/n]\downarrow (-\infty ,x]\) dá continuidade à direita, e os limites seguem das exaustões de \(\mathbb {R}\) pelas semirretas. Reciprocamente, em intervalos ponha \(P((a,b])=F(b)-F(a)\), com as fórmulas análogas para intervalos ilimitados. As condições sobre \(F\) garantem não negatividade, massa total um e continuidade no vazio; após disjuntar uma união finita de intervalos, isso prova a aditividade enumerável sempre que a união ainda pertence à álgebra. Assim \(P\) é pré-medida. Carathéodory fornece a extensão, única porque \(P\) é finita e \(\mathcal A_0\) gera \(\mathcal B(\mathbb {R})\).
Exercício 2.4

Subaditividade enumerável. Se \((A_n)_{n\geq 1}\) é uma sequência de eventos, prove que

\[ \P \left(\bigcup _{n=1}^{\infty }A_n\right) \leq \sum _{n=1}^{\infty }\P (A_n). \]
Ver solução
Disjunte a união, pondo \(B_1=A_1\) e \(B_n=A_n\setminus \bigcup _{k\lt n}A_k\). Então \(B_n\subseteq A_n\) e \(\bigcup _nB_n=\bigcup _nA_n\). Pela aditividade enumerável e monotonicidade, \(\P (\bigcup _nA_n)=\sum _n\P (B_n)\leq \sum _n\P (A_n)\).
Exercício 2.5

Continuidade da probabilidade. Sejam \(A_1,A_2,\ldots \) eventos. Prove as afirmações abaixo.

  1. Se \(A_n\uparrow A\), então \(\P (A_n)\uparrow \P (A)\).

  2. Se \(A_n\downarrow A\), então \(\P (A_n)\downarrow \P (A)\).

  3. \[ \P (\liminf A_n) \leq \liminf _{n\to \infty }\P (A_n) \leq \limsup _{n\to \infty }\P (A_n) \leq \P (\limsup A_n). \]
  4. Se \(A_n\to A\) no sentido de que \(\liminf A_n=\limsup A_n=A\), então \(\P (A_n)\to \P (A)\).

Ver solução
No caso crescente, disjunte como no exercício anterior e use aditividade enumerável. No caso decrescente, aplique o primeiro resultado aos complementos e use \(\P (A_n)=1-\P (A_n^c)\). Para o item (c), ponha \(B_n=\bigcap _{k\geq n}A_k\) e \(C_n=\bigcup _{k\geq n}A_k\), de modo que \(B_n\uparrow \liminf A_n\) e \(C_n\downarrow \limsup A_n\). De \(B_n\subseteq A_n\subseteq C_n\) e dos dois itens anteriores segue
\[ \begin{aligned} \P (\liminf A_n) & =\lim _n\P (B_n)\leq \liminf _n\P (A_n),\\ \limsup _n\P (A_n) & \leq \lim _n\P (C_n)=\P (\limsup A_n). \end{aligned} \]
Se os dois limites de conjuntos coincidem com \(A\), as três quantidades intermediárias ficam espremidas entre \(\P (A)\) e \(\P (A)\).
Exercício 2.6

Um precursor do primeiro lema de Borel–Cantelli. Se \((A_n)_{n\geq 1}\) é uma sequência de eventos e

\[ \P (A_n\ \text{i.v.})=1, \]

prove que

\[ \sum _{n=1}^{\infty }\P (A_n)=\infty . \]

Faça a prova usando apenas subaditividade enumerável e continuidade da probabilidade.

Ver solução
Provaremos a contrapositiva. Suponha que \(\sum _n\P (A_n)\lt \infty \) e ponha
\[ B_N=\bigcup _{n\geq N}A_n. \]
Pela subaditividade,
\[ \P (B_N)\leq \sum _{n\geq N}\P (A_n)\longrightarrow 0. \]
Como \(B_N\downarrow \limsup _nA_n=\{ A_n\ \text{i.v.}\} \), a continuidade por cima fornece
\[ \P (A_n\ \text{i.v.})=\P (\limsup _nA_n) =\lim _{N\to \infty }\P (B_N)=0. \]
Logo, se \(\P (A_n\ \text{i.v.})=1\), a série das probabilidades não pode convergir.
Exercício 2.7

Considere um espaço de probabilidade cujo espaço amostral é \(\mathbb {R}\). Use a continuidade da probabilidade para provar que

  1. \[ \P ([0,\infty )) =\lim _{n\to \infty }\P ([0,n]); \]
  2. \[ \lim _{n\to \infty }\P ([n,\infty ))=0. \]
Ver solução
Os conjuntos \([0,n]\) crescem para \([0,\infty )\), logo a primeira igualdade é a continuidade por baixo. Já \([n,\infty )\) decresce para o vazio; como a probabilidade é finita, a continuidade por cima dá limite zero.
Exercício 2.8

Uma condição insuficiente. Sejam

\[ \Omega =\{ 1,2,3,4\} , \qquad \mathcal A=\bigl\{ \{ 1,2\} ,\{ 1,3\} \bigr\} . \]
  1. Mostre que \(\sigma \langle \mathcal A\rangle =\mathcal{P}(\Omega )\).

  2. Construa duas probabilidades distintas \(P_1\) e \(P_2\) em \(\mathcal{P}(\Omega )\) tais que

    \[ P_1(E)=P_2(E) \qquad \text{para todo }E\in \mathcal A. \]

    Este exercício mostra que a coincidência em uma família geradora não basta para garantir a igualdade de duas medidas. Compare-o com o Teorema de Unicidade de Medidas, no qual a família geradora é um \(\pi \)-sistema.

Ver solução
As interseções e diferenças de \(\{ 1,2\} \) e \(\{ 1,3\} \) isolam os quatro pontos, logo a \(\sigma \)-álgebra gerada é \(\mathcal{P}(\Omega )\). Tome \(P_1\) com massas \((1/4,1/4,1/4,1/4)\) e \(P_2\) com massas \((1/10,2/5,2/5,1/10)\). Ambas atribuem \(1/2\) a cada conjunto de \(\mathcal A\), mas, por exemplo, \(P_1(\{ 1\} )=1/4\neq 1/10=P_2(\{ 1\} )\).
Exercício 2.9

Desigualdades de Bonferroni. Dados eventos \(A_1,\ldots ,A_n\), defina, para \(1\leq j\leq n\),

\[ S_j =\sum _{1\leq i_1\lt \cdots \lt i_j\leq n} \P (A_{i_1}\cap \cdots \cap A_{i_j}). \]

Prove que, para \(1\leq k\leq n\),

\[ \P \left(\bigcup _{i=1}^{n}A_i\right) \leq \sum _{j=1}^{k}(-1)^{j-1}S_j \quad \text{se $k$ é ímpar}, \]

e

\[ \P \left(\bigcup _{i=1}^{n}A_i\right) \geq \sum _{j=1}^{k}(-1)^{j-1}S_j \quad \text{se $k$ é par}. \]

Se a preguiça estiver particularmente forte, os casos \(k=2\) e \(k=3\) já contêm a ideia central.

Ver solução
Para \(J\subseteq \{ 1,\ldots ,n\} \), seja \(E_J\) o evento em que ocorrem exatamente os \(A_i\) com \(i\in J\). Os \(E_J\) formam uma partição finita e
\[ S_j=\sum _{J\subseteq \{ 1,\ldots ,n\} } \binom {|J|}{j}\P (E_J). \]
Para \(N\geq 1\),
\[ \sum _{j=1}^k(-1)^{j-1}\binom Nj =1-(-1)^k\binom {N-1}{k}, \]
interpretando o coeficiente binomial como zero quando \(N\leq k\). Portanto, a soma à esquerda é maior ou igual a \(1\) para \(k\) ímpar e menor ou igual a \(1\) para \(k\) par. Somando sobre a partição e observando que \(\bigcup _iA_i=\bigsqcup _{J\neq \varnothing }E_J\), obtemos as duas desigualdades.
Exercício 2.10 (title=Problema do Pareamento)

 Ao final do dia, \(n\) pais chegam a uma escola para buscar seus \(n\) filhos. Suponha que as crianças sejam entregues segundo uma permutação uniforme das \(n\) crianças entre os \(n\) pais. Use a fórmula de inclusão–exclusão para provar que a probabilidade de pelo menos um pai receber o próprio filho é

\[ \sum _{k=1}^{n}\frac{(-1)^{k-1}}{k!} =1-\frac1{2!}+\frac1{3!}-\cdots +(-1)^{n-1}\frac1{n!}. \]

Mostre que essa probabilidade converge para \(1-e^{-1}\) quando \(n\to \infty \).

Ver solução
Se \(A_i\) é o evento de o pai \(i\) receber seu filho, então a interseção de quaisquer \(k\) desses eventos tem probabilidade \((n-k)!/n!\). Inclusão–exclusão dá
\[ \P \Bigl(\bigcup _iA_i\Bigr) =\sum _{k=1}^n(-1)^{k-1}\binom nk\frac{(n-k)!}{n!} =\sum _{k=1}^n\frac{(-1)^{k-1}}{k!}. \]
A série exponencial mostra que o limite é \(1-e^{-1}\).
Exercício 2.11

Escolha um ponto uniformemente no interior de um triângulo equilátero. Qual é a probabilidade de que sua distância ao centro do triângulo seja menor do que sua distância à borda? Justifique geometricamente o valor obtido.

Ver solução
Se \(r\) é o inraio e \(\theta \in [-\pi /3,\pi /3]\) é o ângulo em torno da normal à face mais próxima, a condição radial é \(0\leq \rho \lt r/(1+\cos \theta )\). Por simetria, a área favorável é
\[ \frac32r^2\int _{-\pi /3}^{\pi /3}\frac{\d\theta }{(1+\cos \theta )^2}. \]
Como a integral vale \(10/(9\sqrt3)\) e a área do triângulo vale \(3\sqrt3\, r^2\), a probabilidade é \(5/27\).
Exercício 2.12

Agulha de Buffon. Um plano é dividido por retas paralelas consecutivas, separadas por uma distância \(d\gt 0\). Uma agulha de comprimento \(d\) é lançada ao acaso sobre o plano.

  1. Modele precisamente o experimento por meio da distância do centro da agulha à reta mais próxima e do ângulo que a agulha forma com as retas. Especifique o espaço amostral e a medida de probabilidade.

  2. Prove que a probabilidade de a agulha interceptar alguma das retas é \(2/\pi \). Conclua que a probabilidade de não haver interseção é \(1-2/\pi \).

Ver solução
Por simetria, tome como espaço amostral \(\Omega =(0,d/2)\times (0,\pi /2)\), com a medida uniforme de densidade \(4/(\pi d)\). As coordenadas \(X\) e \(\Theta \) representam, respectivamente, a distância do centro à reta mais próxima e o ângulo agudo com as retas. Há interseção exatamente quando \(X\leq (d/2)\sin \Theta \). Logo
\[ \P (\text{interseção})= \frac4{\pi d}\int _0^{\pi /2}\frac d2\sin \theta \, \d\theta =\frac2\pi . \]
O complemento tem probabilidade \(1-2/\pi \).
Exercício 2.13

Fixe uma base inteira \(b\geq 2\). Expresse, por meio de uniões e interseções enumeráveis de eventos determinados por um número finito de dígitos, o conjunto dos números de \((0,1]\) normais na base \(b\). Conclua que tanto o conjunto dos números normais quanto o dos números não normais na base \(b\) pertencem a \(\mathcal B((0,1])\). Mostre também que o conjunto dos números absolutamente normais é boreliano.

Ver solução
Para uma palavra \(w\) de comprimento \(k\), seja \(N_w(x,n)\) o número de suas ocorrências entre as primeiras \(n\) posições. Cada evento que fixa \(N_w(x,n)\) depende de finitos dígitos. O conjunto dos normais na base \(b\) é
\[ \bigcap _{k\geq 1}\ \bigcap _{w\in \{ 0,\ldots ,b-1\} ^k} \bigcap _{m\geq 1}\ \bigcup _{N\geq 1}\ \bigcap _{n\geq N} \left\{ x:\left|\frac{N_w(x,n)}n-b^{-k}\right|\lt \frac1m\right\} . \]
Logo é boreliano, assim como seu complemento. Os absolutamente normais formam a interseção, sobre \(b\geq 2\), desses conjuntos borelianos.
Exercício 2.14

Prove que todo subconjunto enumerável, todo subconjunto coenumerável e todo subconjunto perfeito de \((0,1]\) é boreliano. Conclua, em particular, que o conjunto dos irracionais de \((0,1]\) é boreliano.

Ver solução
Singletons são fechados; portanto todo conjunto enumerável é uma união enumerável de fechados, e todo coenumerável é o complemento de tal união. Em \(\mathbb {R}\), um conjunto perfeito é fechado por definição, logo boreliano. Finalmente, \((0,1]\setminus \mathbb {Q}\) é coenumerável em \((0,1]\).
Exercício 2.15

Seja \((\Omega ,d)\) um espaço métrico. Recorde que \(\Omega \) é separável quando possui um subconjunto enumerável e denso.

  1. Mostre que

    \[ \sigma \langle \text{bolas abertas de }\Omega \rangle \subseteq \mathcal B(\Omega ). \]
  2. Se \(\Omega \) é separável, prove a inclusão inversa e conclua que as bolas abertas geram \(\mathcal B(\Omega )\).

  3. Mostre que \(\mathbb {Q}\) é denso em \(\mathbb {R}\) com a métrica usual.

  4. Conclua que \(\sigma \langle \text{bolas abertas de }\mathbb {R}\rangle =\mathcal B(\mathbb {R})\).

Ver solução
Toda bola aberta é aberta, logo a \(\sigma \)-álgebra que elas geram está em \(\mathcal B(\Omega )\). Se \(D\) é enumerável e denso, cada aberto \(U\) é a união das bolas \(B(q,r)\) com \(q\in D\), \(r\in \mathbb {Q}_{\gt 0}\) e \(B(q,r)\subseteq U\); a união é enumerável. Assim todo aberto pertence à \(\sigma \)-álgebra das bolas. Em \(\mathbb {R}\), entre \(a\lt b\) existe um racional: escolha \(n\) com \(n(b-a)\gt 1\) e um inteiro entre \(na\) e \(nb\). Logo \(\mathbb {Q}\) é denso e a conclusão se aplica.
Exercício 2.16

Sejam \(\mu _1\) e \(\mu _2\) medidas em \(\sigma \langle \mathcal F_0\rangle \).

  1. Suponha que \(\mathcal F_0\) seja uma álgebra, que ambas as medidas sejam \(\sigma \)-finitas em \(\mathcal F_0\) e que

    \begin{equation} \mu _1(A)\leq \mu _2(A) \qquad \text{para todo }A\in \mathcal F_0. \label{fourteen} \tag{2.21} \end{equation}

    Prove que a mesma desigualdade vale para todo \(A\in \sigma \langle \mathcal F_0\rangle \).

    Dica. Trate primeiro o caso em que \(\mu _1+\mu _2\) é finita e use aproximação em diferença simétrica por elementos da álgebra. Depois localize o argumento numa exaustão de medida finita.

  2. Construa contraexemplos mostrando que a conclusão pode falhar nas situações abaixo:

    1. \(\mathcal F_0\) é uma álgebra, mas as medidas não são \(\sigma \)-finitas em \(\mathcal F_0\);

    2. as medidas são finitas, mas \(\mathcal F_0\) é apenas um \(\pi \)-sistema gerador, e não uma álgebra.

Ver solução

No caso finito, ponha \(\rho =\mu _1+\mu _2\). Todo conjunto da \(\sigma \)-álgebra gerada pode ser aproximado em diferença simétrica, para \(\rho \), por elementos de \(\mathcal F_0\) (a classe dos conjuntos aproximáveis é uma classe monótona que contém a álgebra). Se \(F_n\in \mathcal F_0\) e \(\rho (F_n\triangle A)\to 0\), então \(\mu _i(F_n)\to \mu _i(A)\); passe ao limite na desigualdade. No caso \(\sigma \)-finito, faça isso nas partes de uma exaustão comum por conjuntos de \(\mathcal F_0\) de medida finita e depois use convergência monótona.

Sem \(\sigma \)-finitude, em \(\mathbb {R}\) tome a álgebra das uniões finitas de intervalos semiabertos \((a,b]\), admitindo intervalos ilimitados, e as medidas de contagem em \(\mathbb {R}\) e em \(\mathbb {R}\setminus \mathbb {Q}\). Elas valem \(0\) no vazio e \(\infty \) em todo elemento não vazio da álgebra, mas em \(\{ 0\} \) a primeira vale \(1\) e a segunda, \(0\).

Para o segundo caso, em \(\Omega =\{ 1,2,3,4\} \) use o \(\pi \)-sistema \(\{ \Omega ,\{ 1\} ,\{ 1,2\} ,\{ 1,3\} \} \), que gera \(\mathcal{P}(\Omega )\). Se \(\mu _1\) e \(\mu _2\) têm, respectivamente, as massas

\[ (1/4,1/4,1/4,1/4) \quad \text{e}\quad (7/20,1/5,1/5,1/4), \]

então \(\mu _1\leq \mu _2\) no \(\pi \)-sistema, mas \(\mu _1(\{ 2\} )\gt \mu _2(\{ 2\} )\).

Exercício 2.17

Princípio de Littlewood. Seja \(\mathcal F_0\) uma álgebra, e seja \(\mu \) uma medida \(\sigma \)-finita em \(\mathcal F_0\), definida em \(\sigma \langle \mathcal F_0\rangle \).

  1. Dados \(B\in \sigma \langle \mathcal F_0\rangle \) e \(\varepsilon \gt 0\), prove que existem conjuntos dois a dois disjuntos \(A_1,A_2,\ldots \in \mathcal F_0\) tais que

    \[ B\subseteq \bigcup _{n=1}^{\infty }A_n, \qquad \mu \left(\left(\bigcup _{n=1}^{\infty }A_n\right)\setminus B\right) \leq \varepsilon . \]
  2. Se, além disso, \(\mu (B)\lt \infty \), prove que existe \(A\in \mathcal F_0\) tal que \(\mu (A\mathbin {\triangle } B)\leq \varepsilon \).

  3. Dê um exemplo mostrando que a conclusão do item anterior pode falhar quando \(\mu (B)=\infty \).

Ver solução

Escolha uma exaustão por conjuntos da álgebra nos quais \(\mu \) é finita e disjunte-a. Em cada peça, a caracterização de Carathéodory fornece uma cobertura de \(B\) por elementos de \(\mathcal F_0\) com excesso menor que \(\varepsilon 2^{-k}\); disjuntando todos os termos obtemos \(A_n\) e, por aditividade, excesso total no máximo \(\varepsilon \).

Se \(\mu (B)\lt \infty \), escolha \(N\) tal que \(\mu (B\setminus \bigcup _{n\leq N}A_n)\lt \varepsilon /2\) e faça a primeira construção com excesso \(\varepsilon /2\). Então \(A=\bigcup _{n\leq N}A_n\in \mathcal F_0\) satisfaz \(\mu (A\triangle B)\leq \varepsilon \).

Para mostrar a necessidade da finitude, use Lebesgue em \(\mathbb {R}\) e a álgebra das uniões finitas de intervalos semiabertos, admitindo intervalos ilimitados. Para \(B=\bigcup _{k\in \mathbb {Z}}[2k,2k+1)\), tanto \(B\) quanto \(B^c\) ocupam comprimento infinito nas caudas, enquanto todo elemento da álgebra é eventualmente constante em cada cauda. Logo \(\lambda (A\triangle B)=\infty \) para todo \(A\in \mathcal F_0\).

Exercício 2.18

Seja \(I\) um conjunto arbitrário e \(f:I\to [0,\infty ]\). Defina

\[ \sum _{i\in I}f(i) :=\sup \left\{ \sum _{i\in H}f(i):H\subseteq I\text{ é finito} \right\} . \]

Prove as afirmações abaixo.

  1. Se \(I=\bigcup _{k\in K}I_k\) é uma partição de \(I\) em conjuntos não vazios, então

    \[ \sum _{i\in I}f(i) =\sum _{k\in K}\left(\sum _{i\in I_k}f(i)\right), \]

    onde a soma sobre \(K\) é entendida pela mesma definição.

  2. Se \(I\) é infinito enumerável e \((i_m)_{m\geq 1}\) é uma enumeração de \(I\) sem repetições, então

    \[ \sum _{i\in I}f(i) =\lim _{n\to \infty }\sum _{m=1}^{n}f(i_m). \]

    No caso finito, a definição coincide com a soma finita usual.

  3. Mostre que

    \[ \mu (A):=\sum _{a\in A}f(a), \qquad A\subseteq I, \]

    define uma medida em \((I,\mathcal{P}(I))\).

Ver solução
Para toda escolha finita de índices em \(I\), agrupe-os pelas células \(I_k\); isso dá “\(\leq \)”. Para “\(\geq \)”, escolha finitas células e, dentro de cada uma, uma soma finita arbitrariamente próxima do respectivo supremo. Se \(I\) é infinito enumerável e \((i_m)\) é uma enumeração sem repetições, as somas parciais são crescentes e contêm, a partir de algum índice, qualquer subconjunto finito previamente fixado; isso prova a segunda fórmula. No caso finito, a afirmação reduz-se à soma finita usual. Finalmente, se \(A=\bigsqcup _nA_n\), aplique a primeira identidade à partição de \(A\) pelos \(A_n\): \(\mu (A)=\sum _n\sum _{a\in A_n}f(a)=\sum _n\mu (A_n)\). Também \(\mu (\varnothing )=0\), logo \(\mu \) é medida.
Exercício 2.19

Se \(\mathcal K\) é uma classe compacta, denote por \(\widehat{\mathcal K}\) a menor família de subconjuntos de \(\Omega \) que contém \(\mathcal K\) e é fechada sob uniões finitas e interseções enumeráveis. Prove que \(\widehat{\mathcal K}\) também é uma classe compacta.

Dica. Mostre primeiro que todo elemento de \(\widehat{\mathcal K}\) é uma interseção enumerável de uniões finitas de elementos de \(\mathcal K\); depois use a árvore finitamente ramificada das escolhas possíveis.

Ver solução

Seja \(\mathcal D\) a classe dos conjuntos \(\bigcap _nU_n\), com cada \(U_n\) uma união finita de elementos de \(\mathcal K\). A distributividade mostra que \(\mathcal D\) contém \(\mathcal K\) e é fechada pelas duas operações; logo \(\widehat{\mathcal K}=\mathcal D\).

Dada uma sequência em \(\mathcal D\) com a propriedade da interseção finita, enumere todas as uniões finitas de uma representação de seus termos. As escolhas de um elemento de \(\mathcal K\) em cada união que mantêm a propriedade da interseção finita formam uma árvore finitamente ramificada com nós em todos os níveis. Para justificar o passo usado do lema de König, parta da raiz e escolha sucessivamente um filho que tenha descendentes em níveis arbitrariamente altos; tal filho existe porque há apenas finitos filhos. As escolhas formam um ramo infinito. A compacidade de \(\mathcal K\) dá um ponto comum aos conjuntos desse ramo e, portanto, a todos os conjuntos da sequência original.

Exercício 2.20

No espaço \(\Omega =\{ 0,1\} ^{\mathbb {N}}\), seja \(\mathcal{F}_n\) a família dos eventos cuja ocorrência é determinada pelas primeiras \(n\) coordenadas. Prove que \(\mathcal{F}_n\) é uma \(\sigma \)-álgebra, identificando-a com a família das imagens inversas de subconjuntos de \(\{ 0,1\} ^n\) pela projeção nas primeiras \(n\) coordenadas.

Ver solução
Se \(\pi _n:\Omega \to \{ 0,1\} ^n\) é a projeção, então
\[ \mathcal{F}_n=\{ \pi _n^{-1}(B):B\subseteq \{ 0,1\} ^n\} . \]
Imagens inversas preservam o espaço total, complementos e uniões enumeráveis. Como \(\mathcal{P}(\{ 0,1\} ^n)\) é uma \(\sigma \)-álgebra, \(\mathcal{F}_n\) também é.
Exercício 2.21

Com a notação do exercício anterior, prove que

\[ \mathcal{F}_0=\bigcup _{n\geq 1}\mathcal{F}_n \]

é uma álgebra. Explique também por que esse argumento não prova fechamento sob uniões enumeráveis.

Ver solução
As famílias são crescentes: \(\mathcal{F}_n\subseteq \mathcal{F}_{n+1}\). O espaço total pertence a todas elas e \(A\in \mathcal{F}_m\) implica \(A^c\in \mathcal{F}_m\). Se \(A\in \mathcal{F}_m\) e \(B\in \mathcal{F}_n\), ambos pertencem a \(\mathcal{F}_{\max \{ m,n\} }\), que também contém \(A\cup B\). Isso dá uma álgebra. Numa união enumerável, porém, os níveis necessários podem ser ilimitados, e não há em geral um único \(\mathcal{F}_n\) que contenha todos os termos.
Exercício 2.22

Probabilidade enumerável–coenumerável. Seja \(\Omega \) um conjunto não enumerável e defina

\[ \mathcal F=\{ A\subseteq \Omega :A\text{ é enumerável ou }A^c \text{ é enumerável}\} , \qquad \P (A)= \begin{cases} 0,& A\text{ enumerável},\\ 1,& A^c\text{ enumerável}. \end{cases} \]

Prove que \(\mathcal F\) é uma \(\sigma \)-álgebra e que \(\P \) é uma medida de probabilidade bem definida em \(\mathcal F\).

Ver solução

A não enumerabilidade de \(\Omega \) torna as duas alternativas disjuntas. Complementos apenas as trocam. Numa união enumerável, se todos os termos são enumeráveis, a união é enumerável; se algum é coenumerável, o complemento da união é enumerável. Logo \(\mathcal F\) é uma \(\sigma \)-álgebra.

Para conjuntos disjuntos \((A_j)\), no máximo um pode ser coenumerável. Se nenhum o é, tanto \(\P (\bigcup _jA_j)\) quanto \(\sum _j\P (A_j)\) valem zero. Se \(A_{j_0}\) é coenumerável, todos os outros estão contidos em seu complemento e são enumeráveis; ambos os lados valem um. Assim \(\P \) é enumeravelmente aditiva e \(\P (\Omega )=1\).