Capítulo 10

Modos de Convergência

Em probabilidade, dizer que \(\xi _n\) se aproxima de \(\xi \) ainda não é dizer o bastante: é preciso escolher o que significa aproximar. Neste capítulo apresentaremos e compararemos as noções mais usuais de convergência de variáveis aleatórias. A finitude da medida será usada, por exemplo, na inclusão \(\L ^q\subseteq \L ^p\) para \(q\geq p\) e na passagem da convergência quase certa para a convergência em probabilidade; em espaços de medida infinita, essas afirmações exigem hipóteses adicionais.

10.1 Convergências Determinísticas

Começamos pelas noções determinísticas, que comparam funções sem usar a medida. Como já são conhecidas de outros contextos, recordaremos apenas as definições, alguns exemplos e as diferenças que serão importantes adiante.

10.1.1 Convergência Pontual

Seja \(\Omega \) um conjunto e \(\xi _n:\Omega \to \mathbb {R}\) uma sequência de funções com o mesmo domínio \(\Omega \). Dizemos que \(\xi _{n}(x)\) converge pontualmente para uma função \(\xi :\Omega \to \mathbb {R}\) se:

\[ \lim _{n\to \infty }\xi _{n}(x)=\xi (x), \]

para todo \(x\in \Omega \).

Figura 10.1 A sequência \ xi _n\ _(n=1)^∞ converge pontualmente para a função constante 0. Assim, para quaisquer x,y,z∈ Omega , temos lim _nxi _n(x)=0, lim _nxi _n(y)=0 e lim _nxi _n(z)=0.

Figura 10.1 A sequência \(\{ \xi _n\} _{n=1}^\infty \) converge pontualmente para a função constante \(0\). Assim, para quaisquer \(x,y,z\in \Omega \), temos \(\lim _n\xi _n(x)=0\), \(\lim _n\xi _n(y)=0\) e \(\lim _n\xi _n(z)=0\).

Exemplo 10.1

Para \(n\in \mathbb {N}\) definimos \(\xi _n(x)=\begin{cases} 1 \quad \text{se} \quad 0\lt x\lt 1/n \\ 0 \quad \text{caso contrário} \end{cases}\)

Essa sequência converge pontualmente para a função constante zero.

Ilustração: Convergência Pontual Ilustração: Convergência Pontual Ilustração: Convergência Pontual

10.1.2 Convergência Uniforme

A distância uniforme entre duas funções \(\xi \) e \(\eta \) é definida como

\[ \left\lVert \xi - \eta \right\rVert _u = \sup _{x\in \Omega } \left\lvert \xi (x)-\eta (x)\right\rvert . \]

Essa distância mede o afastamento máximo de \(\xi \) e \(\eta \); quando o supremo é infinito, entendemos \(\left\lVert \xi -\eta \right\rVert _u\) como uma distância estendida.

Ilustração: Convergência Uniforme

Uma sequência de funções \(\{ \xi _n\} _{n=1}^\infty \) converge uniformemente para \(\xi \) se \(\lim _{n\to \infty }\left\lVert \xi _n-\xi \right\rVert _u=0\). Isso significa não só que \(\lim _n\xi _n(x)=\xi (x)\) para cada \(x\in \Omega \), mas também que a aproximação é uniforme em todo o domínio: dado \(\varepsilon \gt 0\), um mesmo índice \(n_0\) serve para todos os pontos \(x\in \Omega \).

Exemplo 10.2
Se \(\xi _n (x) = 1/n\) para todo \(x\in [0, 1]\), então a sequência \(\{ \xi _n\} _{n=1}^\infty \) converge para zero uniformemente em \([0, 1]\).

Exemplo 10.3

Para \(n\in \mathbb {N}\) definimos \(\xi _n(x)=\begin{cases} 1 \quad \text{se} \quad 0\lt x\lt 1/n \\ 0 \quad \text{caso contrário} \end{cases}\)

Essa sequência converge pontualmente para a função constante zero, mas não uniformemente, pois \(\left\lVert \xi _n\right\rVert _u=1\) para todo \(n\).

10.2 Convergência em Espaços de Probabilidade

Passamos agora às convergências que usam a estrutura mensurável e a probabilidade. O conjunto excepcional deixa de ser apenas um defeito: seu tamanho passa a fazer parte da definição.

10.2.1 Convergência em Distribuição

A convergência em distribuição é a mais fraca entre as que estudaremos. Ela compara apenas as leis de \(\xi _n\) com a lei de \(\xi \), por meio de suas funções de distribuição. O espaço amostral fica fora de cena: as variáveis nem sequer precisam estar definidas no mesmo espaço de probabilidade.

Definição 10.4 (Convergência em Distribuição)

Uma sequência de variáveis aleatórias \(\{ \xi _n\} _{n=1}^\infty \), converge em distribuição para uma variável aleatória \(\xi \), fato denotado por \(\xi _n \ \xrightarrow {d} \ \xi \), se

\begin{align*} \lim _{n \rightarrow \infty } F_{\xi _n} (x) = F_\xi (x), \end{align*}

para todo \(x\) tal que \(F_\xi (x)\) é contínua.

Exemplo 10.5

A exigência de que apenas os pontos de continuidade de \(F_X\) sejam considerados na definição acima é, de fato, essencial.

Para ver isso, tome uma sequência \(\{ X_n;n\ge 1\} \) de variáveis aleatórias, definidas em um mesmo espaço de probabilidade \((\Omega ,\mathcal{F},\P )\), e tais que \(X_n(\omega )=\frac1n\) para todo \(\omega \in \Omega \). Tal sequência converge para \(0\) de todos os modos que vimos até agora — pontualmente e uniformemente — e também dos modos que descreveremos a seguir: quase certamente, em \(\L ^p\) (para qualquer \(p\geq 1\)) e em probabilidade.

Além disso, temos

\[ F_{X_n}(x)=\P (X_n\leq x)= \begin{cases} 0 & , \mbox{ se } x\lt \frac1n; \\ 1 & , \mbox{ se }x\ge \frac1n \end{cases}, \]

e para a variável \(X=0\) temos

\[ F_{X}(x)=\P (X\leq x)= \begin{cases} 0 & , \mbox{ se }x\lt 0; \\ 1 & , \mbox{ se }x\ge 0 \end{cases} \]

Observe que para \(x\lt 0\)

\[ \lim _n F_{X_n}(x)=0=F_X(x), \]

e para \(x\gt 0\)

\[ \lim _n F_{X_n}(x)=1=F_X(x), \]

mas para \(x=0\) temos

\[ \lim _n F_{X_n}(0)=0\neq 1=F_X(0). \]

Mas como \(x=0\) é ponto de descontinuidade de \(F_X\), então ainda podemos afirmar que \(X_n\xrightarrow {d}0\).

Ao trabalhar com variáveis aleatórias que tomam valores inteiros, o seguinte teorema é frequentemente útil.

Teorema 10.6

Considere a sequência \(\{ \xi _n\} _{n=1}^\infty \) e a variável aleatória \(\xi \). Suponha que \(\xi \) e \(\xi _n\) sejam não negativas e tomem valores inteiros.

Então \(\xi _n \ \xrightarrow {d} \ \xi \) se e somente se

\begin{align*} \lim _{n\to \infty }\P (\xi _n=k)=\P (\xi =k), \qquad k=0,1,2,\ldots . \end{align*}

Demonstração

Como \(\xi \) toma valores inteiros, sua função de distribuição \(F_\xi \) é contínua em todo \(x\in \mathbb {R}\setminus \{ 0,1,2,\ldots \} \). Se \(\xi _n\xrightarrow d\xi \), então

\begin{align*} \lim _{n\to \infty }F_{\xi _n}(x)=F_\xi (x), \qquad x\in \mathbb {R}\setminus \{ 0,1,2,\ldots \} . \end{align*}

Assim, para \(k = 0,1,2, \cdots \), temos

\begin{align*} \lim _{n\to \infty }\P (\xi _n=k) & = \lim _{n\to \infty } \left[F_{\xi _n}\left(k + \frac12\right) - F_{\xi _n}\left(k- \frac12\right) \right] \\ & = \lim _{n \rightarrow \infty } F_{\xi _n} \left(k + \frac{1}{2} \right) - \lim _{n \rightarrow \infty } F_{\xi _n} \left(k- \frac{1}{2} \right) \\ & = F_{\xi } \left(k + \frac{1}{2} \right) - F_{\xi } \left(k- \frac{1}{2} \right) \hspace{30pt} \textrm{ (pois $ \xi _n \ \xrightarrow {d} \ \xi $)} \\ & = \P (\xi =k). \end{align*}

Para provar a recíproca, suponha que

\begin{align*} \lim _{n\to \infty }\P (\xi _n=k)=\P (\xi =k), \qquad k=0,1,2,\ldots . \end{align*}

Se \(x\lt 0\), então \(F_{\xi _n}(x)=F_\xi (x)=0\). Se \(x\geq 0\), temos

\begin{align*} \lim _{n \rightarrow \infty } F_{\xi _n} (x) & = \lim _{n \rightarrow \infty } \P (\xi _n \leq x) \\ & = \lim _{n\to \infty }\sum _{k=0}^{\lfloor x\rfloor }\P (\xi _n=k), \end{align*}

onde \(\lfloor x\rfloor \) denota o maior inteiro menor ou igual a \(x\). Como, para \(x\) fixo, a soma é finita, podemos trocar o limite com a soma e obtemos

\begin{align*} \lim _{n\to \infty }F_{\xi _n}(x) & = \sum _{k=0}^{\lfloor x\rfloor }\lim _{n\to \infty }\P (\xi _n=k) \\ & = \sum _{k=0}^{\lfloor x\rfloor }\P (\xi =k) \\ & = \P (\xi \leq x) = F_\xi (x). \end{align*}

Teorema 10.7 (Aproximação de Poisson para a binomial)
Seja \(\{ \xi _n\} _{n\geq 1}\) uma sequência de variáveis aleatórias tal que
\begin{align*} \xi _n \sim \operatorname {Bin}\left(n, \frac{\lambda }{n}\right), \qquad \textrm{ para }n \in \mathbb {N}, n\gt \lambda , \end{align*}
onde \(\lambda \gt 0\) é constante. Então \(\xi _n\) converge em distribuição para uma variável aleatória com distribuição \(\operatorname {Po}(\lambda )\).

Demonstração

Pelo teorema anterior, basta mostrar que, para cada \(k=0,1,2,\ldots \),

\begin{align*} \lim _{n\to \infty }\P (\xi _n=k)=\frac{e^{-\lambda }\lambda ^k}{k!}. \end{align*}

Temos

\begin{align*} \lim _{n\to \infty }\P (\xi _n=k) & = \lim _{n\to \infty }\binom nk\left(\frac{\lambda }{n}\right)^k\left(1-\frac{\lambda }{n}\right)^{n-k} \\ & = \lambda ^k \lim \limits _{n \rightarrow \infty } {\frac{n!}{k! (n-k)!}} \left(\frac{1}{n^k}\right) \left(1-\frac{\lambda }{n}\right)^{n-k} \\ & = \frac{\lambda ^k}{k!}\lim _{n\to \infty } \left[ \frac{n(n-1)\cdots (n-k+1)}{n^k}\right] \left(1-\frac{\lambda }{n}\right)^{n} \left(1-\frac{\lambda }{n}\right)^{-k}. \end{align*}

Para \(k\) fixo, temos

\begin{align*} & \lim \limits _{n \rightarrow \infty } \frac{n(n-1)(n-2)...(n-k+1)}{n^k} =1, \\ & \lim \limits _{n \rightarrow \infty } \left(1-\frac{\lambda }{n}\right)^{-k}=1, \\ & \lim \limits _{n \rightarrow \infty }\left(1-\frac{\lambda }{n}\right)^{n}=e^{-\lambda }. \end{align*}

Logo

\begin{equation*} \lim _{n\to \infty }\P (\xi _n=k)=\frac{e^{-\lambda }\lambda ^k}{k!}, \end{equation*}

que é a função de probabilidade de \(\operatorname {Po}(\lambda )\).

10.2.2 Convergência em Probabilidade

Na convergência em probabilidade, não exigimos proximidade em cada ponto; exigimos que a probabilidade de um afastamento fixo desapareça. No contexto da Teoria da Medida, essa noção é chamada de convergência em medida.

Definição 10.8 (Convergência em Probabilidade)
Uma sequência de variáveis aleatórias \( \{ \xi _n\} _{n\geq 1}\) converge em probabilidade para a variável aleatória \(\xi \) se
\[ \forall \epsilon \gt 0\quad \P (|\xi _n - \xi | \gt \epsilon ) \rightarrow 0 \text{ quando } n \rightarrow \infty . \]
Denotaremos tal fato por \(\xi _n \stackrel{\P }{\rightarrow } \xi \).

A sequência pode continuar errando, mas a região em que o erro é maior do que \(\epsilon \) deve tornar-se improvável.

Exemplo 10.9

Dado \(\xi _n \sim \operatorname {Exp}(n)\), então \(\xi _n \ \xrightarrow {\P }\ 0\).

Pois

\begin{align*} \lim \limits _{n \rightarrow \infty } \P \big(|\xi _n-0| \geq \epsilon \big) & =\lim \limits _{n \rightarrow \infty } \P \big(\xi _n \geq \epsilon \big) & (\textrm{ pois $\xi _n\geq 0$ }) \\ & =\lim \limits _{n \rightarrow \infty } e^{-n\epsilon } & (\textrm{ pois $\xi _n \sim \operatorname {Exp}(n)$ }) \\ & =0 , \qquad \textrm{ para todo }\epsilon \gt 0. \end{align*}

Figura 10.2 Densidades exponenciais de parâmetros 1/2, 1 e 2.

Figura 10.2 Densidades exponenciais de parâmetros \(1/2\), \(1\) e \(2\).

Exemplo 10.10

Seja \(\xi \) uma variável aleatória e \(\xi _n=\xi +\eta _n\), com

\begin{align*} \mathbf{E}[ \eta _n]=\frac{1}{n}, \qquad \operatorname {Var}[\eta _n]=\frac{\sigma ^2}{n}, \end{align*}

onde \(\sigma \gt 0\) é uma constante. Então \(\xi _n \ \xrightarrow {\P }\ \xi \).

Pela desigualdade triangular para \(\eta _n-\mathbf{E}[ \eta _n] +\mathbf{E}[ \eta _n]\), temos

\begin{align*} |\eta _n| \leq \left|\eta _n-\mathbf{E}[ \eta _n]\right|+\frac{1}{n}. \end{align*}

Então, para todo \(\epsilon \gt 0\) e todo \(n\gt 1/\epsilon \), temos

\begin{align*} \P \big(|\xi _n-\xi | \geq \epsilon \big) & =\P \big(|\eta _n| \geq \epsilon \big) \\ & \leq \P \left(\left|\eta _n-\mathbf{E}[ \eta _n]\right|+\frac{1}{n} \geq \epsilon \right) \\ & = \P \left(\left|\eta _n-\mathbf{E}[ \eta _n]\right|\geq \epsilon -\frac{1}{n} \right) \\ & \leq \frac{\operatorname {Var}[\eta _n]}{\left(\epsilon -\frac{1}{n} \right)^2} \qquad \text{(Chebyshev)} \\ & = \frac{\sigma ^2}{n \left(\epsilon -\frac{1}{n} \right)^2}\longrightarrow 0. \end{align*}

Logo \(\xi _n \ \xrightarrow {\P }\ \xi \).

10.2.3 Convergência Quase Certa

Na convergência quase certa, recuperamos a convergência pontual, permitindo apenas que ela falhe em um conjunto de probabilidade nula.

Começaremos com uma leve adaptação do exemplo 10.1, onde tínhamos uma sequência convergindo pontualmente.

Exemplo 10.11

Tome \(\Omega =[0,1]\), munido da \(\sigma \)-álgebra de Borel, e seja \(\P \) a medida de Lebesgue em \([0,1]\). Para \(n\geq 1\), defina

\[ \xi _n(\omega )=\begin{cases} 1 \quad \text{se} \quad 0\leq \omega \lt 1/n \\ 0 \quad \text{caso contrário} \end{cases} \]

Observe que, se \(\omega \in (0,1]\), então \(\xi _n(\omega )=0\) para todo \(n\gt 1/\omega \), de modo que \(\xi _n(\omega )\to 0\).

No entanto, vale também que \(\xi _n(0)=1\) para todo \(n\gt 0\), de modo que

\[ \{ \omega \in [0,1]:\xi _n(\omega )\not\to 0\} =\{ 0\} , \]

e

\[ \P \left(\left\{ \omega :\lim _{n\to \infty }\xi _n(\omega )=0\right\} \right)=\P ((0,1])=1. \]

Dizemos assim que \(\xi _n\rightarrow 0\) quase certamente, quando \(n\to \infty \).

Definição 10.12 (Convergência Quase Certa)

Sejam \( \xi \) uma variável aleatória e \( \{ \xi _n\} _{n\geq 1} \) uma sequência de variáveis aleatórias definidas no mesmo espaço de probabilidade. Dizemos que \( \xi _n \) converge quase certamente para \( \xi \), isto é, \( \xi _n\xrightarrow {q.c.}\xi \) se

\[ \P \left(\lim \limits _{n\rightarrow \infty }\xi _n = \xi \right)=1 \]

ou, equivalentemente, se

\[ \P \left(\left\{ \omega \in \Omega :\lim _{n\to \infty }\xi _n(\omega )=\xi (\omega )\right\} \right)=1. \]

A convergência quase certa é uma convergência pontual em um conjunto de probabilidade \(1\): temos \(\xi _n(\omega )\to \xi (\omega )\) para quase todo \(\omega \), isto é, exceto possivelmente em um conjunto de probabilidade nula.

Figura 10.3 As regiões onde xi _n se afasta de zero se estreitam em torno de um conjunto finito; fora desse conjunto, xi _n(ω )→ 0.

Figura 10.3 As regiões onde \(\xi _n\) se afasta de zero se estreitam em torno de um conjunto finito; fora desse conjunto, \(\xi _n(\omega )\to 0\).

Exemplo 10.13

Em \(\Omega =[0,1]\), com a medida de Lebesgue, para \(n\geq 1\) definimos \(\xi _n(x)=\begin{cases} 1 \quad \text{se} \quad x\in \mathbb {Q} \\ 1/n \quad \text{caso contrário} \end{cases}\)

Essa sequência não converge pontualmente para a função constante zero, pois vale \(1\) em todo racional para todo \(n\), mas converge quase certamente para zero porque \(\mathbb {Q}\cap [0,1]\) tem medida de Lebesgue nula.

Heurística 10.14 (math.exchange)

Considere um homem que joga três moedas todas as manhãs. Todas as tardes, ele doa um real para uma instituição de caridade para cada cara que aparecer nos lançamentos. Porém, a primeira vez que o resultado for três coroas ele irá parar de doar permanentemente.

Seja \(\{ \xi _n\} _{n=1}^\infty \) o montante diário que a instituição de caridade recebeu dele. Podemos ter quase certeza de que um dia esse valor será zero e permanecerá zero para sempre depois disso, ou seja, temos que \(\xi _n\xrightarrow {q.c.}0\)

Em qualquer prazo finito, porém, ainda há probabilidade positiva de que as doações continuem. A convergência quase certa não fornece uma data marcada para o último pagamento.

Teorema 10.15 (Critério de Convergência Quase Certa)
Sejam \((\xi _n)_{n\geq 1}\) e \(\xi \) variáveis aleatórias. Então \(\xi _n\xrightarrow {q.c.}\xi \) se, e somente se, para todo \(\epsilon \gt 0\),
\[ \P \bigl(|\xi _n-\xi |\geq \epsilon \ {\, \, \text{\textrm{ i.v.}} }\bigr)=0. \]
Equivalentemente, basta verificar essa condição para \(\epsilon =1/k\), \(k=1,2,\ldots \).

Demonstração

Para \(k,n\geq 1\), ponha \(A_{k,n}=\{ |\xi _n-\xi |\geq 1/k\} \). Pela definição de convergência de sequências reais,

\[ \{ \xi _n\not\to \xi \} =\bigcup _{k=1}^{\infty }\bigcap _{n=1}^{\infty } \bigcup _{m=n}^{\infty }A_{k,m} =\bigcup _{k=1}^{\infty }\{ A_{k,n}\ {\, \, \text{\textrm{ i.v.}} }\} . \]

Se \(\xi _n\to \xi \) quase certamente, o evento à esquerda tem probabilidade zero; logo cada evento \(\{ A_{k,n}\ {\, \, \text{\textrm{ i.v.}} }\} \) tem probabilidade zero. Reciprocamente, se todos esses eventos têm probabilidade zero, sua união enumerável também tem probabilidade zero, e portanto \(\xi _n\to \xi \) quase certamente.

Por fim, a condição para todos os \(\epsilon \gt 0\) implica imediatamente a condição para \(\epsilon =1/k\). Para a recíproca, dado \(\epsilon \gt 0\), escolha \(k\) com \(1/k\leq \epsilon \) e use \(\{ |\xi _n-\xi |\geq \epsilon \} \subseteq A_{k,n}\).

Teorema 10.16
Considere as variáveis aleatórias \((\xi _n)_{n\geq 1}\) e \(\xi \). Se, para todo \(\epsilon \gt 0\), tivermos
\begin{align*} \sum _{n=1}^{\infty } \P \big(|\xi _n-\xi | \gt \epsilon \big) \lt \infty , \end{align*}
então \(\xi _n \ \xrightarrow {q.c.}\ \xi \).

Demonstração

Para cada \(k\geq 1\), aplique o primeiro lema de Borel–Cantelli aos eventos \(A_n^{(k)}=\{ |\xi _n-\xi |\gt 1/k\} \). A hipótese fornece \(\sum _n\P (A_n^{(k)})\lt \infty \), logo \(\P (A_n^{(k)}\ \mathrm{i.v.})=0\). Fora da união desses eventos-limite, para todo \(k\) temos eventualmente \(|\xi _n-\xi |\leq 1/k\); logo \(\xi _n\to \xi \). Portanto, \(\xi _n\xrightarrow {q.c.}\xi \).

Exemplo 10.17

Considere uma sequência \(\{ \xi _n, n=1,2,3, \cdots \} \) tal que

\begin{equation*} \xi _n = \left\{ \begin{array}{l l} -\frac{1}{n} & \quad \textrm{com probabilidade } \frac{1}{2} \\ & \quad \\ \frac{1}{n} & \quad \textrm{com probabilidade } \frac{1}{2} \end{array} \right. \end{equation*}

Então \(\xi _n \ \xrightarrow {q.c.}\ 0.\)

Pelo teorema anterior basta mostrar que

\begin{align*} \sum _{n=1}^{\infty } \P \big(|\xi _n| \gt \epsilon \big) \lt \infty . \end{align*}

Observe que \(|\xi _n|=1/n\). Logo, \(|\xi _n|\gt \epsilon \) se e somente se \(n\lt 1/\epsilon \). Logo temos

\begin{align*} \sum _{n=1}^{\infty } \P \big(|\xi _n| \gt \epsilon \big) & \leq \sum _{n=1}^{\lfloor 1/\epsilon \rfloor } \P \big(|\xi _n| \gt \epsilon \big) \\ & \leq \lfloor 1/\epsilon \rfloor \lt \infty . \end{align*}

Exemplo 10.18 (Corcovas deslizantes)

Considere \(\Omega =[0,1]\) com a medida de Lebesgue. Para cada \(m\geq 2\), particione \([0,1]\) em \(m\) intervalos mensuráveis disjuntos \(I_{m,1},\ldots ,I_{m,m}\), cada um com medida \(1/m\), e enumere em blocos as funções indicadoras

\[ \mathbb {1}_{I_{2,1}},\mathbb {1}_{I_{2,2}}, \mathbb {1}_{I_{3,1}},\ldots ,\mathbb {1}_{I_{3,3}},\ldots . \]

Denote a sequência resultante por \((\xi _n)\). Em cada bloco, temos \(\P (\xi _n=1)=1/m\); portanto, ao avançarmos pelos blocos, \(\P (|\xi _n|\gt \epsilon )\to 0\) para todo \(0\lt \epsilon \lt 1\). Assim, \(\xi _n\to 0\) em probabilidade.

Por outro lado, em cada bloco e para cada \(\omega \in [0,1]\), exatamente uma das indicadoras vale \(1\) em \(\omega \) e as demais valem \(0\). Logo \((\xi _n(\omega ))\) assume os valores \(0\) e \(1\) infinitas vezes e não converge em nenhum ponto.

10.2.4 Convergência em \(\mathcal L^p\)

A convergência em \(\L ^p\) controla o tamanho médio do erro, medido pela potência \(p\).

Definição 10.19
Fixe \(p\gt 0\). Uma sequência de variáveis aleatórias \(\{ \xi _n\} _{n=1}^\infty \) converge em \(\L ^p\) para a variável aleatória \(\xi \) se
\[ \| \xi _n - \xi \| _p \rightarrow 0 \text{ quando } n \rightarrow \infty . \]
Em outras palavras
\[ \mathbf{E}|\xi _n - \xi |^p \rightarrow 0 \text{ quando } n \rightarrow \infty . \]
Para \(0\lt p\lt 1\), a expressão \(\| X\| _p=(\mathbf{E}|X|^p)^{1/p}\) não é uma norma, mas a mesma notação de convergência continua sendo útil.

Exemplo 10.20

Seja \(X_n \sim \operatorname {Uni}\left(0, \frac{1}{n}\right)\). Então \(X_n \xrightarrow {\L ^{p}}0\) para todo \(p \geq 1\).

A densidade de \(X_n\) é dada por

\begin{equation*} f_{X_n}(x) = \left\{ \begin{array}{l l} n & \quad 0 \leq x \leq \frac{1}{n} \\ & \quad \\ 0 & \quad \text{ caso contrário} \end{array} \right. \end{equation*}

Então

\begin{align*} \mathbf{E}\left(|X_n-0|^{p}\right) & =\int _{0}^{\frac{1}{n}} x^{p} n \hspace{10pt} dx \\ & = \frac{1}{(p+1) n^{p}} \rightarrow 0, \qquad \text{ para todo }p\geq 1. \end{align*}

Proposição 10.21
Se \(0\lt p\leq q\lt \infty \) e \(\xi _n\xrightarrow {\mathcal L^q}\xi \), então \(\xi _n\xrightarrow {\mathcal L^p}\xi \).

Demonstração

Se \(p=q\), não há o que provar. Suponha \(p\lt q\) e ponha \(r=q/p\gt 1\), com expoente conjugado \(r'\). Aplicando Hölder a \(|\xi _n-\xi |^p\cdot 1\) e usando \(\P (\Omega )=1\), obtemos

\[ \mathbf{E}|\xi _n-\xi |^p \leq \left(\mathbf{E}|\xi _n-\xi |^{pr}\right)^{1/r} \left(\mathbf{E}1^{r'}\right)^{1/r'} = \left(\mathbf{E}|\xi _n-\xi |^q\right)^{p/q}. \]

Logo

\[ \| \xi _n-\xi \| _p \leq \| \xi _n-\xi \| _q \longrightarrow 0. \]

Exemplo 10.22

Considere uma sequência \(\{ X_n\} \) tal que

\begin{equation*} X_n = \left\{ \begin{array}{l l} n ^2 & \qquad \textrm{ com probabilidade } \frac{1}{n} \\ & \qquad \\ 0 & \qquad \textrm{ com probabilidade } 1- \frac{1}{n} \end{array} \right. \end{equation*}

Mostre que

  • \( X_n \xrightarrow {p} \ 0.\)

  • \(X_n\) não converge em \(\L ^p\) para qualquer \(p\geq 1\).

  • Para mostrar que \(X_n \ \xrightarrow {p} \ 0\), podemos escrever, para qualquer \(\epsilon \gt 0\)

    \begin{align*} \lim _{n \rightarrow \infty } \P \big(| X_n | \geq \epsilon \big) & = \lim _{n \rightarrow \infty } \P (X_n = n ^2) \\ & = \lim _{n \rightarrow \infty } \frac{1}{n} \\ & = 0. \end{align*}

    Assim \(X_n \xrightarrow {p} 0\).

  • Para qualquer \(p\geq 1\), podemos escrever

    \begin{align*} \lim _{n\to \infty }\mathbf{E}\left(|X_n|^p\right) & = \lim _{n\to \infty }\left(n^{2p}\frac1n\right) \\ & = \lim _{n \rightarrow \infty } n ^{2p-1} \\ & = \infty \qquad (\text{ pois $ p \geq 1 $}). \end{align*}

    Portanto, \(X_n\) não converge em \(\L ^p\) para qualquer \(p\geq 1\). Em particular, embora \(X_n\xrightarrow {\P }0\), o valor esperado de \(X_n\) não converge para \(0\).

10.3 Comparando os Modos de Convergência

As noções anteriores não formam apenas uma lista: há uma hierarquia entre elas, embora algumas implicações dependam de hipóteses adicionais. As relações principais estão resumidas no diagrama:

Figura 10.4 Relação entre os modos de convergência em espaços de probabilidade.

Figura 10.4 Relação entre os modos de convergência em espaços de probabilidade.

Convergência quase certa implica convergência em probabilidade

Teorema 10.23 (Convergência q.c. e em Probabilidade)
Dados \(\xi _n\) e \(\xi \) variáveis aleatórias.
  1. \(\xi _n \rightarrow \xi \) q.c. implica \(\xi _n \rightarrow \xi \) em probabilidade.

  2. Se \(\xi _n \rightarrow \xi \) em probabilidade, então existe uma subsequência \(\xi _{n_k} \rightarrow \xi \) quase certamente.

Demonstração
  1. Suponha \(\xi _n\to \xi \) q.c. e fixe \(\epsilon \gt 0\). Ponha \(A_n=\{ |\xi _n-\xi |\gt \epsilon \} \) e \(B_N=\bigcup _{n\geq N}A_n\). Então \(B_N\downarrow \limsup _n A_n\), cuja probabilidade é zero pelo Teorema 10.15. Como \(\P (B_1)\leq 1\lt \infty \), a continuidade da probabilidade por cima dá \(\P (B_N)\downarrow 0\). Para \(n\geq N\), \(A_n\subset B_N\); logo \(\P (A_n)\to 0\).

    Concluímos portanto que \( \xi _n \rightarrow \xi \) em probabilidade.

  2. Suponha \( \xi _n \rightarrow \xi \) em probabilidade. Queremos encontrar uma subsequência que converge quase certamente.

    Pela convergência em probabilidade, podemos escolher recursivamente \(n_1\lt n_2\lt \cdots \) de modo que

    \[ \P \left(|\xi _{n_k}-\xi |\gt \frac1k\right)\lt 2^{-k}, \qquad k=1,2,\ldots . \]

    Como \(\sum _k2^{-k}\lt \infty \), o primeiro lema de Borel–Cantelli mostra que \(|\xi _{n_k}-\xi |\gt 1/k\) ocorre apenas finitas vezes, quase certamente. Portanto, \(\xi _{n_k}\to \xi \) quase certamente.

Convergência em \(\L ^p\) implica convergência em Probabilidade

Proposição 10.24
\(\xi _n \stackrel{\L ^p}{\rightarrow } \xi \) implica \(\xi _n \stackrel{\P }{\rightarrow } \xi \).

Demonstração

Usando a desigualdade de Markov, temos, para todo \(\epsilon \gt 0\),

\[ \P (|\xi _n - \xi | \gt \epsilon ) \leq \P (|\xi _n - \xi |^p \geq \epsilon ^p) \leq \dfrac {\mathbf{E}|\xi _n -\xi |^p}{\epsilon ^p} \rightarrow 0. \]

Vimos que se a sequência \(\xi _n\) converge em \(\L ^p\) para \(\xi \) então a sequência também converge em probabilidade, porém a recíproca nem sempre é verdadeira.

Teorema 10.25 (Convergência dominada em probabilidade)
Se \(p\gt 0\), \(\xi _n\xrightarrow {\P }\xi \) e existe uma variável aleatória não negativa \(\eta \in \L ^p\) tal que \(|\xi _n|\leq \eta \) quase certamente para todo \(n\geq 1\), então \(\xi _n\xrightarrow {\mathcal L^p}\xi \).

Demonstração

Toda subsequência \((\xi _{n_k})\) possui, pela parte anterior, uma subsubsequência \((\xi _{n_{k_j}})\) que converge para \(\xi \) quase certamente. Ao passar ao limite nessa subsubsequência, obtemos \(|\xi |\leq \eta \) quase certamente. Consequentemente,

\[ |\xi _{n_{k_j}}-\xi |^p \leq (|\xi _{n_{k_j}}|+|\xi |)^p \leq 2^p\eta ^p. \]

O lado direito é integrável e o lado esquerdo converge quase certamente para zero. Pelo Teorema da Convergência Dominada, \(\mathbf{E}|\xi _{n_{k_j}}-\xi |^p\to 0\).

Assim, toda subsequência da sequência numérica \(a_n=\mathbf{E}|\xi _n-\xi |^p\) possui uma subsubsequência convergente a zero. Se \(a_n\) não convergisse a zero, haveria uma subsequência limitada inferiormente por alguma constante positiva, uma contradição. Logo \(a_n\to 0\).

Teorema 10.26 (Lema de Scheffé para variáveis não negativas)
Sejam \((\xi _n)\) e \(\xi \) variáveis aleatórias não negativas e integráveis. Se \(\xi _n\xrightarrow {q.c.}\xi \) e \(\mathbf{E}[\xi _n]\to \mathbf{E}[\xi ]\), então \(\xi _n\xrightarrow {\mathcal L^1}\xi \).

Demonstração

Decompondo nos conjuntos \(\{ \xi _n\leq \xi \} \) e \(\{ \xi _n\gt \xi \} \),

\begin{align*} \mathbf{E}|\xi _n-\xi | & =\mathbf{E}\big[(\xi -\xi _n)\mathbb {1}_{\{ \xi _n\leq \xi \} }\big] +\mathbf{E}\big[(\xi _n-\xi )\mathbb {1}_{\{ \xi _n\gt \xi \} }\big]\\ & =2\mathbf{E}\big[(\xi -\xi _n)\mathbb {1}_{\{ \xi _n\leq \xi \} }\big] +\mathbf{E}[\xi _n]-\mathbf{E}[\xi ]. \end{align*}

Além disso, \(0\leq (\xi -\xi _n)\mathbb {1}_{\{ \xi _n\leq \xi \} }\leq \xi \), e esse termo converge quase certamente para zero. A convergência dominada e a hipótese sobre as esperanças mostram que os dois termos da última expressão tendem a zero.

Convergência em Probabilidade implica Convergência em Distribuição

Teorema 10.27
Se uma sequência de variáveis aleatórias \(\xi _n\) converge em probabilidade para uma variável aleatória \(\xi \), então \(\xi _n\) também converge em distribuição para \(\xi \).

Demonstração

Tome \(\epsilon \gt 0\) e note que, como \(\xi _n\xrightarrow {\P }\xi \), então

\[ \lim _{n\to \infty }\P (|\xi _n-\xi |\gt \epsilon )=0. \]

Fixado também \(\delta \gt 0\), existe \(n_0\geq 1\) tal que

\[ \P (|\xi _n-\xi |\gt \epsilon )\lt \delta , \]

para todo \(n\geq n_0\).

Se \(\xi _n\leq x\) e \(|\xi _n-\xi |\leq \epsilon \), então \(\xi \leq x+\epsilon \). Logo, para \(n\geq n_0\),

\[ \P (\xi _n\leq x)\leq \P (\xi \leq x+\epsilon )+\delta . \]

Concluímos assim que

\[ \limsup _n\P (\xi _n\leq x)\leq \P (\xi \leq x+\epsilon ), \]

para todo \(\epsilon \gt 0\).

De modo análogo, se \(\xi \leq x-\epsilon \) e \(|\xi _n-\xi |\leq \epsilon \), então \(\xi _n\leq x\). Portanto,

\[ \P (\xi \leq x-\epsilon )\leq \P (\xi _n\leq x)+\delta . \]

Segue então que para todo \(\epsilon \gt 0\),

\[ \P (\xi \leq x-\epsilon )\leq \liminf _n\P (\xi _n\leq x) \leq \limsup _n\P (\xi _n\leq x)\leq \P (\xi \leq x+\epsilon ). \]

Tomando \(x\) como ponto de continuidade de \(F_\xi \) e fazendo \(\epsilon \downarrow 0\), encontramos

\[ \lim _n\P (\xi _n\leq x)=\P (\xi \leq x), \]

concluindo o resultado.

10.4 Teorema de Representação de Skorokhod

A convergência em distribuição compara leis, não trajetórias, e por isso não exige que as variáveis estejam no mesmo espaço. O Teorema de Representação de Skorokhod mostra até onde podemos inverter essa fraqueza: em um espaço adequado, é possível realizar cópias com as mesmas leis que convergem quase certamente.

Teorema 10.28 (Teorema de Representação de Skorokhod)
Suponha que \(\xi _n\xrightarrow d\xi \). Então existem variáveis aleatórias \(\xi _n'\) com a mesma distribuição que \(\xi _n\) e uma variável aleatória \(\xi '\) com a mesma distribuição que \(\xi \), tais que
\[ \xi _n'\xrightarrow {q.c.}\xi '. \]

Demonstração

Sejam \(F_n\) e \(F\) as funções de distribuição de \(\xi _n\) e \(\xi \), respectivamente. Em \((0,1)\), munido da medida de Lebesgue, considere a variável uniforme \(U(u)=u\) e defina

\[ \xi _n'=F_n^*(U)\qquad \text{e}\qquad \xi '=F^*(U), \]

onde as estrelas denotam as inversas generalizadas. Pela Proposição 6.15, \(\xi _n'\stackrel d=\xi _n\) e \(\xi '\stackrel d=\xi \).

Resta provar a convergência quase certa. Fixe \(u\in (0,1)\) em que \(F^*\) é contínua e fixe \(\varepsilon \gt 0\). Como uma função monótona possui no máximo uma quantidade enumerável de descontinuidades, podemos escolher um ponto de continuidade \(x_-\) de \(F\) tal que

\[ F^*(u)-\varepsilon \lt x_-\lt F^*(u). \]

Pela caracterização \(F^*(u)\leq x\Longleftrightarrow u\leq F(x)\), a desigualdade \(x_-\lt F^*(u)\) implica \(F(x_-)\lt u\). Como \(F_n(x_-)\to F(x_-)\), temos \(F_n(x_-)\lt u\) para todo \(n\) suficientemente grande e, novamente pela mesma caracterização,

\[ F_n^*(u)\gt x_-\gt F^*(u)-\varepsilon . \]

Daí, \(\liminf _nF_n^*(u)\geq F^*(u)\).

Para obter a desigualdade oposta, a continuidade de \(F^*\) em \(u\) permite escolher \(u'\in (u,1)\) tão próximo de \(u\) que \(F^*(u')\lt F^*(u)+\varepsilon /2\). Escolha então um ponto de continuidade \(x_+\) de \(F\) no intervalo

\[ F^*(u')\lt x_+\lt F^*(u)+\varepsilon . \]

Como \(F^*(u')\leq x_+\), temos \(u'\leq F(x_+)\). Portanto, \(F_n(x_+)\to F(x_+)\) e, como \(u'\gt u\), vale \(F_n(x_+)\gt u\) para todo \(n\) suficientemente grande. Segue que

\[ F_n^*(u)\leq x_+\lt F^*(u)+\varepsilon , \]

e assim \(\limsup _nF_n^*(u)\leq F^*(u)\). Concluímos que \(F_n^*(u)\to F^*(u)\) em todo ponto de continuidade de \(F^*\).

Pelo Corolário 6.17, o conjunto \(D_{F^*}\) das descontinuidades de \(F^*\) é no máximo enumerável. Como \(U\) é uniforme, \(\P (U\in D_{F^*})=0\). Logo

\[ \xi _n'=F_n^*(U)\longrightarrow F^*(U)=\xi ' \quad \text{quase certamente}, \]

como queríamos.

10.5 Princípio de Seleção de Helly

O Princípio de Seleção de Helly fornece uma forma de compacidade para funções de distribuição, mas exige uma ressalva: o limite obtido pode perder massa no infinito e, portanto, não ser ele próprio uma função de distribuição.

Teorema 10.29 (Princípio de Seleção de Helly)
Seja \((F_n)\) uma sequência de funções de distribuição. Então existem uma subsequência \((F_{n_k})\) e uma função limitada, contínua à direita e não decrescente \(F\) tais que
\[ F_{n_k}(x)\longrightarrow F(x)\quad \text{em todo ponto de continuidade $x$ de $F$.} \]

Demonstração

Enumere os racionais como \(\mathbb {Q}=\{ q_1,q_2,\ldots \} \). Como cada sequência \((F_n(q_j))_{n\geq 1}\) toma valores em \([0,1]\), aplicações sucessivas de Bolzano–Weierstrass e o argumento diagonal fornecem uma subsequência \((F_{n_k})\) para a qual \(F_{n_k}(q)\) converge para todo \(q\in \mathbb {Q}\). Escreva

\[ G(q)=\lim _{k\to \infty }F_{n_k}(q),\qquad q\in \mathbb {Q}. \]

A monotonicidade das funções \(F_{n_k}\) implica que \(G\) é não decrescente.

Defina, para \(x\in \mathbb {R}\),

\[ F(x)=\inf \{ G(q):q\in \mathbb {Q},\ q\gt x\} . \]

É imediato que \(F\) toma valores em \([0,1]\) e é não decrescente. Além disso, se \(L=\inf _{y\gt x}F(y)\), então \(L\geq F(x)\). Reciprocamente, dado \(\varepsilon \gt 0\), escolha \(q\in \mathbb {Q}\), \(q\gt x\), tal que \(G(q)\lt F(x)+\varepsilon \) e depois escolha \(y\) com \(x\lt y\lt q\). Como o racional \(q\) participa do ínfimo que define \(F(y)\),

\[ L\leq F(y)\leq G(q)\lt F(x)+\varepsilon . \]

Logo \(L=F(x)\), o que prova a continuidade à direita de \(F\).

Resta provar a convergência. Fixe \(x\in \mathbb {R}\) e \(\varepsilon \gt 0\). Pela definição de \(F(x)\), existe \(q\in \mathbb {Q}\), \(q\gt x\), tal que \(G(q)\lt F(x)+\varepsilon /2\). Para \(k\) suficientemente grande, \(F_{n_k}(q)\lt F(x)+\varepsilon \) e, pela monotonicidade,

\[ F_{n_k}(x)\leq F_{n_k}(q)\lt F(x)+\varepsilon . \]

Portanto, \(\limsup _kF_{n_k}(x)\leq F(x)\).

Suponha agora que \(x\) seja ponto de continuidade de \(F\). Escolha \(r\lt x\) de modo que \(F(r)\gt F(x)-\varepsilon /2\) e um racional \(q\) com \(r\lt q\lt x\). Da definição de \(F(r)\),

\[ G(q)\geq F(r)\gt F(x)-\varepsilon /2. \]

Para \(k\) suficientemente grande, \(F_{n_k}(q)\gt F(x)-\varepsilon \) e, novamente pela monotonicidade,

\[ F_{n_k}(x)\geq F_{n_k}(q)\gt F(x)-\varepsilon . \]

Assim, \(\liminf _kF_{n_k}(x)\geq F(x)\). As duas estimativas provam que \(F_{n_k}(x)\to F(x)\) em todo ponto de continuidade de \(F\).

O princípio de seleção de Helly diz que, dada \((F_n)_{n\geq 1}\), alguma subsequência \(F_{n_k}(x)\) converge para uma função \(F(x)\) em todos os pontos de continuidade de \(F\). A função limite é não decrescente e contínua à direita, mas ainda pode não ser uma função de distribuição.

Falta garantir que

\[ \lim _{x\to \infty }F(x)=1\quad \mbox{ e }\quad \lim _{x\to -\infty }F(x)=0. \]

O princípio de Helly, sozinho, não garante essas duas igualdades: à medida que \(n\) cresce, pode haver massa de probabilidade escapando para \(+\infty \) ou para \(-\infty \), como mostra o exemplo abaixo.

Exemplo 10.30

Dada uma variável aleatória \(U\) uniformemente distribuída em \([0,1]\) e constantes \(\delta ,\epsilon \gt 0\) com \(\delta +\epsilon \lt 1\), defina

\[ X_n:=-n\cdot \mathbb {1}_{\{ U\lt \delta \} }+n\cdot \mathbb {1}_{\{ U\gt 1-\epsilon \} }, \]

para \(n\ge 1\).

Note que para todo \(t\gt 0\) temos que

\begin{align*} \lim \limits _{n\to \infty }\P (X_n\gt t)& =\P (U\gt 1-\epsilon )=\epsilon , \quad \text{ e }\\ \lim \limits _{n\to \infty }\P (X_n\lt -t)& =\P (U\lt \delta )=\delta , \end{align*}

de modo que quando \(n\to \infty \) uma “massa” de probabilidade \(\epsilon \) está sendo perdida em \(+\infty \) e \(\delta \) em \(-\infty \).

Como consequência, temos

\[ \lim \limits _{n\to \infty }F_{X_n}(x)=\begin{cases} \delta & ,\mbox{ para }x\lt 0; \\ 1-\epsilon & ,\mbox{ para }x\ge 0, \end{cases} \]

que é uma função não-decrescente e contínua pela direita, mas não é uma função distribuição.

Uma forma de resolver esse problema é garantir que a massa de probabilidade fique quase toda contida em um intervalo limitado, uniformemente ao longo da sequência. Isto é, para todo \(\epsilon \gt 0\) devem existir \(a,b\in \mathbb {R}\) tais que \(\P (a\lt X_n\leq b)\gt 1-\epsilon \) para todo \(n\geq 1\).

Esta propriedade é denominada tightness e está precisamente definida abaixo.

Definição 10.31 (Tightness)
Diremos que uma família \(\{ \mu _i:i\in I\} \) de medidas de probabilidade em \((\mathbb {R},\mathcal{B}(\mathbb {R}))\) é tight se, para todo \(\epsilon \gt 0\), existe um intervalo compacto \([a,b]\) tal que
\[ \mu _i([a,b])\gt 1-\epsilon \qquad \text{para todo }i\in I. \]
Analogamente, uma família \(\{ X_i:i\in I\} \) de variáveis aleatórias é tight se a família de suas distribuições \(\{ \P _{X_i}:i\in I\} \) é tight. Usaremos a mesma terminologia para a família correspondente de funções de distribuição.

Proposição 10.32 (Convergência em distribuição implica tightness)
Se \(X_n\xrightarrow dX\), então a família \(\{ X_n:n\geq 1\} \) é tight.

Demonstração

Fixe \(\varepsilon \gt 0\) e escreva \(F_n\) e \(F\) para as funções de distribuição de \(X_n\) e \(X\). Escolha pontos de continuidade \(a\lt b\) de \(F\) tais que

\[ F(a)\lt \frac{\varepsilon }{4}, \qquad F(b)\gt 1-\frac{\varepsilon }{4}. \]

Como \(F_n(a)\to F(a)\) e \(F_n(b)\to F(b)\), para todo \(n\) suficientemente grande,

\[ \P (a\lt X_n\leq b)=F_n(b)-F_n(a)\gt 1-\varepsilon . \]

Restam apenas finitos índices. Para cada um deles, a continuidade por baixo em \(\{ |X_j|\leq M\} \uparrow \Omega \) permite escolher um intervalo compacto que contenha massa maior que \(1-\varepsilon \). Tome então um único intervalo compacto que contenha todos esses intervalos e também \([a,b]\). Esse intervalo funciona simultaneamente para todo \(n\).

Teorema 10.33 (Teorema de Prokhorov em \(\mathbb {R}\))
Se \((\P _n)\) é uma sequência tight de medidas de probabilidade em \((\mathbb {R},\mathcal{B}(\mathbb {R}))\), então existem uma subsequência \((\P _{n_k})\) e uma medida de probabilidade \(\P \) tais que \(\P _{n_k}\) converge fracamente para \(\P \).

Demonstração

Seja \(F_n(x)=\P _n((-\infty ,x])\). Pelo princípio de seleção de Helly, existem uma subsequência \((F_{n_k})\) e uma função \(F:\mathbb {R}\to [0,1]\), não decrescente e contínua à direita, tais que \(F_{n_k}(x)\to F(x)\) em todo ponto de continuidade de \(F\).

Fixe \(\varepsilon \gt 0\). Pela tightness, existe \([a_0,b_0]\) tal que \(\P _n([a_0,b_0])\gt 1-\varepsilon \) para todo \(n\). Como \(F\) possui no máximo uma quantidade enumerável de descontinuidades, podemos escolher pontos de continuidade \(a\lt a_0\) e \(b\gt b_0\). Então

\[ F(b)-F(a) =\lim _{k\to \infty }\bigl(F_{n_k}(b)-F_{n_k}(a)\bigr) =\lim _{k\to \infty }\P _{n_k}((a,b]) \geq 1-\varepsilon . \]

Se \(L_-:=\lim _{x\to -\infty }F(x)\) e \(L_+:=\lim _{x\to \infty }F(x)\), segue que \(L_+-L_-\geq 1-\varepsilon \). Como isso vale para todo \(\varepsilon \gt 0\) e \(0\leq L_-\leq L_+\leq 1\), necessariamente \(L_-=0\) e \(L_+=1\).

Portanto, \(F\) é uma função de distribuição. Pela Proposição 6.15, existe uma variável aleatória \(X\) com função de distribuição \(F\); seja \(\P \) a lei de \(X\). A convergência obtida nos pontos de continuidade de \(F\) é precisamente \(\P _{n_k}\Rightarrow \P \).

Assim, tomando \(X\) uma variável aleatória com função distribuição \(F\), mostramos o seguinte resultado.

Proposição 10.34
Se \((X_n)_{n\geq 1}\) é uma sequência tight de variáveis aleatórias, então existem uma subsequência \((n_k)\) e uma variável aleatória \(X\) tais que \(X_{n_k}\xrightarrow dX\).

Demonstração

A família das distribuições \((\P _{X_n})\) é tight. Pelo teorema anterior, alguma subsequência \((\P _{X_{n_k}})\) converge fracamente para uma medida de probabilidade \(\P \). No espaço canônico \((\mathbb {R},\mathcal{B}(\mathbb {R}),\P )\), a aplicação identidade define uma variável aleatória \(X\) com lei \(\P \). Pela definição de convergência em distribuição, \(X_{n_k}\xrightarrow dX\).

Exemplo 10.35
Sejam \(X_1,X_2,\ldots \) variáveis aleatórias independentes, identicamente distribuídas e integráveis, e ponha \(S_n=X_1+\cdots +X_n\). Pela desigualdade triangular,
\[ \mathbf{E}|S_n|\leq \sum _{j=1}^n\mathbf{E}|X_j|=n\mathbf{E}|X_1|. \]
A desigualdade de Markov fornece, para todo \(t\gt 0\),
\[ \P \left(\left|\frac{S_n}{n}\right|\gt t\right) \leq \frac{\mathbf{E}|S_n|}{nt} \leq \frac{\mathbf{E}|X_1|}{t}. \]
O último termo tende a zero quando \(t\to \infty \), uniformemente em \(n\). Logo \((S_n/n)_{n\geq 1}\) é tight e, pela proposição anterior, possui uma subsequência convergente em distribuição.

A tightness impede que a massa escape e garante limites ao menos ao longo de subsequências. Para obter a convergência da sequência inteira, resta mostrar que todas as subsequências convergentes conduzem ao mesmo limite.

Proposição 10.36 (Critério de unicidade)
Seja \((X_n)_{n\geq 1}\) uma sequência tight. Suponha que existe uma variável aleatória \(X\) tal que toda subsequência de \((X_n)\) que converge em distribuição tem como limite \(X\). Então \(X_n\xrightarrow dX\).

Demonstração

Denote por \(F\) a função de distribuição de \(X\) e por \(F_n\) a de \(X_n\). Se \(X_n\) não convergisse em distribuição para \(X\), existiriam um ponto de continuidade \(x\) de \(F\), uma constante \(\epsilon \gt 0\) e uma subsequência \((n_k)\) tais que

\[ |F_{n_k}(x)-F(x)|\geq \epsilon \qquad \text{para todo }k. \]

A subsequência \((X_{n_k})\) continua tight. Pela Proposição 10.34, ela possui uma subsubsequência convergente em distribuição; pela hipótese, seu limite é \(X\). Logo \(F_{n_{k_i}}(x)\to F(x)\), contradizendo a desigualdade anterior.

Os modos de convergência não formam uma única cadeia, mas cumprem papéis distintos. A convergência quase certa controla trajetórias; a convergência em probabilidade controla conjuntos excepcionais; a convergência em \(L^p\) acrescenta controle de tamanho; e a convergência em distribuição retém apenas as leis. Skorokhod permite, sob hipóteses adequadas, representar a última por convergência quase certa, enquanto Helly e a tightness fornecem os limites por subsequências. Saber que um limite pode ser extraído é metade do argumento; identificá-lo é a outra metade.

Exercício 10.1

Seja \((\xi _n)_{n\geq 1}\) uma sequência de variáveis aleatórias tal que

\[ \xi _n\sim \operatorname {Ge}_0\left(\frac{\lambda }{n}\right), \qquad n\gt \lambda , \]

onde \(\lambda \gt 0\) e \(\operatorname {Ge}_0(p)\) conta o número de fracassos antes do primeiro sucesso. Defina \(\eta _n=\xi _n/n\). Calcule \(\P (\eta _n\gt x)\) e mostre que \(\eta _n\) converge em distribuição para uma variável exponencial de taxa \(\lambda \).

Ver solução
Para \(x\geq 0\),
\[ \P (\eta _n\gt x) =\left(1-\frac\lambda n\right)^{\lfloor nx\rfloor +1} \longrightarrow e^{-\lambda x}; \]
para \(x\lt 0\) a cauda vale um. Portanto as funções de distribuição convergem em todos os pontos para a da exponencial de taxa \(\lambda \).
Exercício 10.2

Sejam \((\xi _n)\) e \((\eta _n)\) duas sequências de variáveis aleatórias definidas no mesmo espaço de probabilidade. Suponha que

\[ \xi _n\xrightarrow {\P }\xi \qquad \text{e}\qquad \eta _n\xrightarrow {\P }\eta . \]

Prove que \(\xi _n+\eta _n\xrightarrow {\P }\xi +\eta \).

Ver solução
Pela desigualdade triangular e pela união,
\[ \P (|(\xi _n+\eta _n)-(\xi +\eta )|\gt \varepsilon ) \leq \P (|\xi _n-\xi |\gt \varepsilon /2) +\P (|\eta _n-\eta |\gt \varepsilon /2)\longrightarrow 0. \]
Exercício 10.3

Considere uma sequência \((\xi _n)\) tal que

\[ \xi _n= \begin{cases} n,& \text{com probabilidade }1/n^2,\\ 0,& \text{com probabilidade }1-1/n^2. \end{cases} \]

Mostre que:

  1. \(\xi _n\xrightarrow {\P }0\).

  2. \(\xi _n\xrightarrow {\L ^r}0\) para \(0\lt r\lt 2\).

  3. \(\xi _n\) não converge para zero em \(\L ^r\) para \(r\geq 2\).

  4. \(\xi _n\xrightarrow {q.c.}0\).

Ver solução
Para \(0\lt \varepsilon \lt n\), \(\P (|\xi _n|\gt \varepsilon )=n^{-2}\to 0\). Além disso, \(\mathbf{E}|\xi _n|^r=n^{r-2}\), que tende a zero exatamente para \(r\lt 2\) (vale um para \(r=2\) e diverge para \(r\gt 2\)). Por fim, \(\sum _n\P (\xi _n\neq 0)=\sum _n n^{-2}\lt \infty \); Borel–Cantelli implica que apenas finitos \(\xi _n\) são não nulos, quase certamente.
Exercício 10.4

Suponha que \(\xi _n\xrightarrow {\L ^r}\xi \) para \(r\geq 1\). Mostre que

\[ \mathbf{E}|\xi _n|^r\longrightarrow \mathbf{E}|\xi |^r. \]
Ver solução
A desigualdade triangular reversa em \(L^r\) fornece
\[ \bigl|\| \xi _n\| _r-\| \xi \| _r\bigr| \leq \| \xi _n-\xi \| _r\longrightarrow 0. \]
Elevando à potência \(r\), obtemos a convergência dos momentos.
Exercício 10.5

Suponha que \(\xi _n\xrightarrow d\xi \) e \(\eta _n\xrightarrow {\P }c\), onde \(c\) é constante. Prove que

\[ \eta _n\xi _n\xrightarrow d c\xi . \]
Ver solução
A convergência em distribuição torna \((\xi _n)\) tight. Para \(M\gt 0\),
\[ \P (|(\eta _n-c)\xi _n|\gt \varepsilon ) \leq \P (|\xi _n|\gt M)+\P (|\eta _n-c|\gt \varepsilon /M). \]
Escolha primeiro \(M\) grande e depois \(n\) grande: o termo de erro \(D_n=(\eta _n-c)\xi _n\) converge em probabilidade para zero. Por mudança de escala nas funções de distribuição, \(c\xi _n\xrightarrow d c\xi \). Para concluir, escreva \(\eta _n\xi _n=c\xi _n+D_n\) e tome \(x\) ponto de continuidade de \(F_{c\xi }\) e \(\delta \gt 0\) com \(x\pm \delta \) também pontos de continuidade (eles são densos). Então
\[ \P (\eta _n\xi _n\leq x)\leq \P (c\xi _n\leq x+\delta )+\P (|D_n|\gt \delta ), \qquad \P (\eta _n\xi _n\leq x)\geq \P (c\xi _n\leq x-\delta )-\P (|D_n|\gt \delta ). \]
Tomando \(\limsup \) e \(\liminf \) e depois \(\delta \downarrow 0\), a continuidade de \(F_{c\xi }\) em \(x\) dá \(\P (\eta _n\xi _n\leq x)\to F_{c\xi }(x)\).
Exercício 10.6

Prove o Teorema da Aplicação Contínua para a convergência em probabilidade: se \(g:\mathbb {R}\to \mathbb {R}\) é contínua, então

\[ \xi _n\xrightarrow {\P }\xi \quad \Longrightarrow \quad g(\xi _n)\xrightarrow {\P }g(\xi ). \]
Ver solução
Fixe \(a\gt 0\) e seja \(\eta \gt 0\). Escolha \(K\) tal que \(\P (|\xi |\gt K)\lt \eta \). Pela continuidade uniforme de \(g\) em \([-K-1,K+1]\), existe \(0\lt \delta \leq 1\) tal que, para \(x,y\) nesse compacto,
\[ |x-y|\lt \delta \quad \Longrightarrow \quad |g(x)-g(y)|\lt a. \]
Se \(|\xi |\leq K\) e \(|\xi _n-\xi |\lt \delta \), então também \(|\xi _n|\leq K+1\) e, portanto, \(|g(\xi _n)-g(\xi )|\lt a\). Assim,
\[ \P (|g(\xi _n)-g(\xi )|\gt a) \leq \P (|\xi |\gt K)+\P (|\xi _n-\xi |\geq \delta ). \]
Fazendo \(n\to \infty \), o limite superior é no máximo \(\eta \). Como \(\eta \gt 0\) é arbitrário, a probabilidade acima tende a zero.
Exercício 10.7

Seja \((\xi _n)\) uma sequência de variáveis aleatórias mutuamente independentes que converge em probabilidade para \(\xi \). Mostre que \(\xi \) é constante quase certamente.

Dica. Escolha duas subsequências com índices disjuntos. Seus pares permanecem independentes, mas convergem em probabilidade para \((\xi ,\xi )\). Conclua que duas cópias independentes com a lei de \(\xi \) são iguais quase certamente.

Ver solução
Escolha índices disjuntos \(n_k,m_k\). Então \((\xi _{n_k},\xi _{m_k})\to _{\P }(\xi ,\xi )\). Por outro lado, cada par tem lei \(\mu _{n_k}\otimes \mu _{m_k}\) e as marginais convergem fracamente para a lei \(\mu \) de \(\xi \); logo a lei-limite do par é \(\mu \otimes \mu \). Portanto duas cópias independentes \(X,Y\sim \mu \) satisfazem \(X=Y\) quase certamente. Para todo boreliano \(A\), isso implica \(0=\P (X\in A,Y\notin A)=\mu (A)(1-\mu (A))\); assim \(\mu \) só assume valores \(0\) e \(1\) e é uma massa de Dirac.
Exercício 10.8

Prove que, se \(\xi _n\xrightarrow {\L ^2}\xi \), então

\[ \operatorname {Var}(\xi _n)\longrightarrow \operatorname {Var}(\xi ). \]
Ver solução
Convergência em \(L^2\) implica convergência das normas \(L^2\) e também em \(L^1\), pois \(\| Y\| _1\leq \| Y\| _2\). Logo \(\mathbf{E}[\xi _n^2]\to \mathbf{E}[\xi ^2]\) e \(\mathbf{E}[\xi _n]\to \mathbf{E}[\xi ]\). Passe ao limite em \(\operatorname {Var}(\xi _n)=\mathbf{E}[\xi _n^2]-\mathbf{E}[\xi _n]^2\).
Exercício 10.9

Mostre diretamente que a convergência em \(\L ^p\) implica convergência em probabilidade para todo \(p\gt 0\). Dê um contraexemplo para a recíproca, por exemplo quando \(p=1\).

Ver solução
Por Markov,
\[ \P (|\xi _n-\xi |\gt \varepsilon ) \leq \varepsilon ^{-p}\mathbf{E}|\xi _n-\xi |^p\longrightarrow 0. \]
A recíproca falha para \(\xi _n=n\) com probabilidade \(1/n\) e \(0\) caso contrário: \(\xi _n\to _{\P }0\), mas \(\mathbf{E}|\xi _n|=1\), logo não há convergência em \(L^1\).
Exercício 10.10

Considere variáveis aleatórias \(\xi _1,\xi _2,\ldots \) com funções de distribuição \(F_1,F_2,\ldots \). Suponha que \(\xi _n\xrightarrow d\xi \) e que a função de distribuição \(F\) de \(\xi \) seja contínua. Prove que \(F_n\to F\) uniformemente, isto é,

\[ \| F_n-F\| _\infty :=\sup _{x\in \mathbb {R}}|F_n(x)-F(x)|\longrightarrow 0. \]
Ver solução
Dado \(\varepsilon \gt 0\), escolha \(a\lt b\) com \(F(a)\lt \varepsilon \) e \(F(b)\gt 1-\varepsilon \). Pela continuidade uniforme de \(F\) em \([a,b]\), escolha uma partição \(a=x_0\lt \cdots \lt x_m=b\) tal que \(F(x_j)-F(x_{j-1})\lt \varepsilon \). A convergência pontual nos finitos \(x_j\) torna \(|F_n(x_j)-F(x_j)|\lt \varepsilon \). Monotonicidade, espremendo \(F_n(x)\) entre os valores nos extremos da célula, dá \(|F_n(x)-F(x)|\lt 2\varepsilon \) em \([a,b]\); as caudas dão a mesma cota fora. Logo a convergência é uniforme.
Exercício 10.11

Considere variáveis aleatórias de valores inteiros \(\xi _1,\xi _2,\ldots \) e uma variável aleatória \(\xi \) também de valores inteiros. Mostre que \(\xi _n\xrightarrow d\xi \) se, e somente se,

\[ \P (\xi _n=k)\longrightarrow \P (\xi =k) \qquad \text{para todo }k\in \mathbb Z. \]

Na volta, justifique por que a massa não pode escapar para o infinito.

Ver solução
Se \(\xi _n\to _d\xi \), os pontos \(k\pm 1/2\) são continuidades de \(F_\xi \) e
\[ \P (\xi _n=k)=F_n(k+1/2)-F_n(k-1/2)\to \P (\xi =k). \]
Na volta, dado \(\varepsilon \gt 0\), escolha \(K\) com \(\P (|\xi |\leq K)\gt 1-\varepsilon \). A convergência das finitas massas em \([-K,K]\) implica \(\P (|\xi _n|\leq K)\gt 1-2\varepsilon \) para \(n\) grande; logo não há fuga de massa. Somando as massas até \(\lfloor x\rfloor \) e controlando as duas caudas, obtemos \(F_n(x)\to F(x)\) em todo ponto de continuidade de \(F\).
Exercício 10.12

Considere variáveis aleatórias independentes \(\xi _1,\xi _2,\ldots \), uniformemente distribuídas em \([0,1]\), e defina \(Z_n=\max _{k\leq n}\xi _k\).

  1. Prove que \(Z_n\to 1\) em probabilidade.

  2. Prove que \(Z_n\to 1\) quase certamente.

Ver solução
Para \(0\lt \varepsilon \lt 1\), \(\P (Z_n\leq 1-\varepsilon )=(1-\varepsilon )^n\to 0\), o que prova convergência em probabilidade. Além disso, \(Z_n\) é crescente e limitada por \(1\), logo converge quase certamente para algum \(Z\leq 1\). Por continuidade por cima, \(\P (Z\leq 1-\varepsilon )=\lim _n(1-\varepsilon )^n=0\). Intersectando sobre \(\varepsilon =1/m\), concluímos \(Z=1\) quase certamente.
Exercício 10.13

Da hipergeométrica à binomial. Para cada \(n\geq 5\), uma urna contém \(n\) bolas azuis e \(n\) bolas vermelhas. Retiram-se dez bolas, sem reposição, e \(X_n\) denota o número de bolas azuis retiradas. Determine a lei de \(X_n\) e prove que

\[ X_n\xrightarrow {\mathrm d}\operatorname {Binomial}(10,1/2). \]
Ver solução
Para \(k=0,\ldots ,10\), a contagem de subconjuntos dá
\[ \P (X_n=k)=\frac{\binom nk\binom n{10-k}}{\binom {2n}{10}}. \]
Equivalentemente, usando fatoriais decrescentes,
\[ \P (X_n=k)=\binom {10}{k} \frac{(n)_k(n)_{10-k}}{(2n)_{10}} \longrightarrow \binom {10}{k}2^{-10}. \]
Como o suporte finito é comum a todas as variáveis, a convergência das massas prova a convergência em distribuição.