Capítulo 11

Teoremas-limite

Repetir um experimento não elimina o acaso de cada observação, mas pode estabilizar sua média. Esse é o conteúdo das leis dos grandes números. Para somas

\[ S_n=X_1+\cdots +X_n \]

de variáveis aleatórias independentes com média comum \(\mu \), estudaremos condições sob as quais

\[ \frac{S_n}{n}\longrightarrow \mu . \]

As flutuações individuais não desaparecem; tornam-se pequenas na escala da média.

As versões fraca e forte diferem pelo modo de convergência e pelas hipóteses exigidas. Começaremos pelo controle da variância e passaremos à convergência quase certa. Duas aplicações encerram o capítulo: a integração de Monte Carlo e a aproximação por polinômios de Bernstein.

11.1 Lei fraca dos grandes números

A lei fraca afirma a convergência de \(S_n/n\) em probabilidade. Com variâncias uniformemente limitadas, obtemos primeiro a convergência em \(\L ^2\); a desigualdade de Chebyshev fornece então a convergência em probabilidade.

Teorema 11.1 (Lei Fraca dos Grandes Números)
Sejam \(\xi _1, \xi _2,\ldots \) variáveis aleatórias independentes com \(\mathbf{E}[ \xi _k] = \mu \) e \(\operatorname {Var}(\xi _k) \leq c \lt \infty \), para todo \(k\geq 1 .\) Nestas condições, se \(S_n = \xi _1 + \xi _2 + \cdots + \xi _n\), então
\[ \dfrac {S_n}{n} \overset {\L ^2} \longrightarrow \mu \qquad \mbox{e}\qquad \dfrac {S_n}{n} \overset {p} \longrightarrow \mu . \]

Demonstração

Basta mostrar que

\[ \mathbf{E}\left[\left(\frac{S_n}{n}-\mu \right)^2\right]\longrightarrow 0. \]

A convergência em probabilidade seguirá da convergência em \(\L ^2\), pela desigualdade de Chebyshev.

Pela linearidade da esperança, \(\mathbf{E}\left[\dfrac {S_n}{n}\right] = \mu .\) A independência permite somar as variâncias:

\begin{align*} \mathbf{E}\left[\left(\dfrac {S_n}{n} - \mu \right)^2\right] & = \operatorname {Var}\left(\dfrac {S_n}{n}\right) = \dfrac 1{n^2}\operatorname {Var}(S_n) \\ & = \dfrac 1{n^2}(\operatorname {Var}(\xi _1) + \cdots + \operatorname {Var}(\xi _n)) \\ & \leq \dfrac {cn}{n^2}\\ & = \dfrac {c}{n} \rightarrow 0. \end{align*}

A demonstração fornece uma taxa \(O(n^{-1})\) para o erro quadrático médio e, por Chebyshev, para a probabilidade de um desvio fixo. A estimativa ainda não é somável em \(n\): para concluir convergência quase certa por Borel–Cantelli, precisaremos de outro argumento.

Observação 11.2
A demonstração permanece válida para variáveis aleatórias \(\xi _k\) não necessariamente independentes, desde que sejam duas a duas não correlacionadas. De fato, a independência foi usada apenas para escrever a variância da soma como a soma das variâncias.

A mesma ideia se estende a vetores aleatórios de dimensão finita.

Teorema 11.3 (Lei fraca dos grandes números para vetores)
Sejam \(\boldsymbol {\xi }^{(1)},\boldsymbol {\xi }^{(2)},\ldots \) vetores aleatórios i.i.d. com valores em \(\mathbb {R}^d\) e \(\mathbf{E}\| \boldsymbol {\xi }^{(1)}\| ^2\lt \infty \). Então
\[ \frac1n\sum _{i=1}^n\boldsymbol {\xi }^{(i)} \xrightarrow {\P }\mathbf{E}[\boldsymbol {\xi }^{(1)}]. \]

Demonstração

Escreva \(\boldsymbol {\xi }^{(i)}=(\xi ^{(i)}_1,\ldots ,\xi ^{(i)}_d)\). Cada sequência de coordenadas \(\xi ^{(1)}_j,\xi ^{(2)}_j,\ldots \) satisfaz as hipóteses do Teorema 11.1; logo, para todo \(j\),

\[ \frac1n\sum _{i=1}^n\xi ^{(i)}_j\xrightarrow {\P }\mathbf{E}[\xi ^{(1)}_j]. \]

Para a norma do máximo e qualquer \(\varepsilon \gt 0\), a probabilidade de que o vetor se afaste de sua média por mais de \(\varepsilon \) é limitada pela soma das \(d\) probabilidades correspondentes às coordenadas. Como \(d\) é finito, essa soma tende a zero.

O caso dos ensaios de Bernoulli antecede historicamente as versões gerais. Nele, a média amostral é a frequência relativa de sucessos, e a lei dos grandes números dá uma forma precisa à interpretação frequentista da probabilidade.

Teorema 11.4 (Lei dos Grandes Números de Bernoulli)
Seja \(S_n\) o número de sucessos em \(n\) ensaios independentes, cada um com probabilidade de sucesso \(p\). Então \(S_n\) tem distribuição binomial com parâmetros \((n,p)\) e
\[ \dfrac {S_n}{n} \rightarrow p \]
em probabilidade, quando \(n \rightarrow \infty .\)

Demonstração

Se \(\xi _k\) é a indicadora de sucesso no \(k\)-ésimo ensaio, então as variáveis \(\xi _k\) são independentes, \(S_n=\sum _{k=1}^n\xi _k\), \(\mathbf{E}[\xi _k]=p\) e \(\operatorname {Var}(\xi _k)=p(1-p)\leq 1/4\). Basta aplicar o Teorema 11.1.

Exemplo 11.5
Ao lançar uma moeda equilibrada \(n\) vezes, a proporção de caras converge em probabilidade para \(1/2\). Em particular,
\[ \P (0{,}49n\leq \text{número de caras}\leq 0{,}51n)\longrightarrow 1. \]
Isso não obriga a moeda a compensar um excesso anterior de caras. A moeda não contrai dívidas: a lei controla a proporção acumulada, não a previsão do próximo lançamento.

Podemos dispensar a hipótese de variância finita se, em contrapartida, supusermos que as variáveis aleatórias \( \xi _k \) são identicamente distribuídas. A ferramenta será o método de truncamento de Markov: primeiro controlamos variáveis limitadas e depois estimamos a contribuição das caudas.

Mais adiante, um exercício apresenta uma extensão para somas independentes não necessariamente identicamente distribuídas.

Teorema 11.6 (Método de Truncamento de Markov)

Considere \(\xi \) uma variável aleatória, com média finita. Considere \(M \gt 1\) o nível de truncamento.

Defina

\[ \lfloor \xi \rceil ^{M}: = \left\{ \begin{array}{ll} \xi , & \text{ se } |\xi | \leq M \\ 0, & \text{ se } |\xi | \gt M \end{array} \right\} = \xi \cdot \mathbf{1}_{\{ |\xi | \leq M\} } . \]

Então

  • \(|\lfloor \xi \rceil ^{M}| \leq M\) pontualmente, e \(|\lfloor \xi \rceil ^{M}| \leq |\xi |\)

  • \(\lfloor \xi \rceil ^{M} \rightarrow \xi \) pontualmente quando \(M \rightarrow \infty \),

  • A variável \(\lfloor \xi \rceil ^{M}\) possui todos os momentos finitos.

  • Pelo Teorema da Convergência Dominada \(\mathbf{E}[ \lfloor \xi \rceil ^{M}] \rightarrow \mathbf{E}[ \xi ]\) quando \(M \rightarrow \infty .\) Mais ainda,

    \begin{equation} \label{nov21} \mathbf{E}|\lfloor \xi \rceil ^{M} - \xi | \rightarrow 0 \text{ quando } M \rightarrow \infty . \tag{11.1}\end{equation}

Demonstração

As duas desigualdades do primeiro item seguem diretamente da definição. Para cada ponto em que \(\xi \) assume um valor real, quando \(M\) ultrapassa \(|\xi |\) o truncamento coincide com \(\xi \); daí a convergência pontual. Além disso, para todo \(r\gt 0\),

\[ \mathbf{E}\big[|\lfloor \xi \rceil ^M|^r\big]\leq M^r\lt \infty . \]

Por fim, \(|\lfloor \xi \rceil ^M|\leq |\xi |\) e \(\lfloor \xi \rceil ^M\to \xi \); como \(\xi \) é integrável, o Teorema da Convergência Dominada dá a convergência das esperanças. Aplicando-o também a \(|\lfloor \xi \rceil ^M-\xi |=|\xi |\mathbf1_{\{ |\xi |\gt M\} }\), obtemos (11.1).

Corolário 11.7
Dada uma variável aleatória integrável \(\xi \),
\[ \mathbf{E}\left[ |\xi | \cdot \mathbf{1}_{\{ |\xi | \gt M\} }\right] \rightarrow 0 \text{ quando } M \rightarrow \infty . \]

Demonstração

Pela definição do truncamento,

\[ |\xi -\lfloor \xi \rceil ^M|=|\xi |\mathbf{1}_{\{ |\xi |\gt M\} }. \]

A conclusão é exatamente (11.1).

Teorema 11.8 (Lei Fraca dos Grandes Números)

Sejam \(\xi _1, \xi _2,\ldots \) variáveis aleatórias independentes identicamente distribuídas com \(\mathbf{E}[ \xi _k] = \mu \) para todo \(k .\)

Considere \(S_n = \xi _1 + \xi _2 + \cdots + \xi _n .\)

Então

\[ \dfrac {S_n}{n} \rightarrow \mu \]

em probabilidade (quando \(n \rightarrow \infty \)).

Demonstração

Dado \(M\gt 1\), considere

\[ \xi _k^{(M)}:=\xi _k\mathbf{1}_{\{ |\xi _k|\leq M\} }, \qquad S_n^{(M)}:=\sum _{k=1}^n\xi _k^{(M)}. \]

As variáveis \(\xi _k^{(M)}\) continuam i.i.d. e

\[ \operatorname {Var}(\xi _k^{(M)})\leq \mathbf{E}[(\xi _k^{(M)})^2]\leq M^2. \]

Pelo Teorema 11.1,

\[ \frac{S_n^{(M)}}n\xrightarrow {\L ^2}\mathbf{E}[\xi _1^{(M)}]. \]

Em particular, por Cauchy–Schwarz,

\[ \mathbf{E}\left|\frac{S_n^{(M)}}n-\mathbf{E}[\xi _1^{(M)}]\right|\longrightarrow 0. \]

Pela desigualdade triangular e pela distribuição comum,

\[ \mathbf{E}\left| \dfrac {S_n}{n} - \mathbf{E}[ \xi _1]\right| \leq \mathbf{E}\left|\dfrac {S_n^{(M)}}{n} - \mathbf{E}[ \xi _1^{(M)}]\right| +2\mathbf{E}|\xi _1-\xi _1^{(M)}|. \]

Portanto, para todo \(M\) fixo,

\[ \limsup _{n\to \infty }\mathbf{E}\left|\frac{S_n}{n}-\mu \right| \leq 2\mathbf{E}|\xi _1-\xi _1^{(M)}|. \]

Fazendo \(M\to \infty \) e usando (11.1), concluímos na verdade que \(S_n/n\to \mu \) em \(\L ^1\) e, portanto, em probabilidade.

11.2 Lei forte dos grandes números

Na lei fraca, o conjunto em que a média se afasta de \(\mu \) pode mudar com \(n\); exigimos apenas que sua probabilidade tenda a zero. A lei forte afirma algo sobre a sequência inteira: para variáveis i.i.d. integráveis,

\[ \dfrac {S_n} {n} \rightarrow \mu \text{ q.c.} \]

Começaremos pelo caso de quarto momento finito. A estimativa resultante será somável, o que permitirá aplicar Borel–Cantelli; depois removeremos essa hipótese adicional.

Teorema 11.9 (Lei Forte dos Grandes Números - I)
Sejam \( \xi _1, \xi _2, \ldots \) variáveis aleatórias i.i.d. com esperança \(\mu \) e assuma \( \mathbf{E}\left[ \xi _k ^4\right] \lt \infty .\) Então, \( S_n = \xi _1 + \xi _2 + \cdots + \xi _n \) satisfaz
\[ \dfrac {S_n} {n} \rightarrow \mu \text{ quase certamente}. \]

Demonstração

Comecemos pelo caso \(\mu =0\). O caso geral segue ao aplicar esse caso às variáveis centradas \(\xi _k-\mu \), que ainda são i.i.d. e têm quarto momento finito.

Na expansão

\[ \mathbf{E}[S_n^4]=\sum _{1\leq i,j,k,\ell \leq n}\mathbf{E}[\xi _i\xi _j\xi _k\xi _\ell ], \]

todo termo em que algum índice aparece uma única vez é nulo, por independência e pelo fato de \(\mathbf{E}[\xi _i]=0\). Restam os \(n\) termos com os quatro índices iguais e, para cada par de índices distintos, as seis ordenações que os fazem aparecer duas vezes cada. Portanto,

\[ \mathbf{E}[S_n^4] =n\mathbf{E}[\xi _1^4]+6\binom n2\mathbf{E}[\xi _1^2\xi _2^2]. \]

Como a independência dá \(\mathbf{E}[\xi _1^2\xi _2^2]=(\mathbf{E}[\xi _1^2])^2\leq \mathbf{E}[\xi _1^4]\), existe \(C\lt \infty \) tal que

\[ \mathbf{E}[S_n^4]\leq 3Cn^2. \]

Consequentemente, pela desigualdade de Markov aplicada a \(S_n^4\),

\[ \P \left(\left|\frac{S_n}{n}\right|\gt \varepsilon \right) \leq \frac{3C}{\varepsilon ^4n^2}. \]

A série do lado direito é convergente. Pelo primeiro lema de Borel–Cantelli, para cada \(m\geq 1\),

\[ \P \left(\left|\frac{S_n}{n}\right|\gt \frac1m\ \text{infinitas vezes}\right)=0. \]

Fora da união enumerável desses eventos nulos, para cada \(m\) existe um índice a partir do qual \(|S_n/n|\leq 1/m\). Portanto \(S_n/n\to 0\) quase certamente.

O resultado se estende a vetores de dimensão finita pela aplicação do caso escalar a cada coordenada.

Teorema 11.10 (Lei Forte dos Grandes Números)
Sejam \(\boldsymbol {\xi }^{(1)},\boldsymbol {\xi }^{(2)},\ldots \) vetores aleatórios i.i.d. com valores em \(\mathbb {R}^d\) e \(\mathbf{E}\| \boldsymbol {\xi }^{(1)}\| ^4\lt \infty \). Então
\[ \frac1n\sum _{i=1}^n\boldsymbol {\xi }^{(i)} \xrightarrow {\mathrm{q.c.}}\mathbf{E}[\boldsymbol {\xi }^{(1)}]. \]

Demonstração

Cada coordenada satisfaz a versão escalar precedente. Como há apenas \(d\) coordenadas, a interseção dos \(d\) eventos de probabilidade um em que as convergências coordenada a coordenada ocorrem ainda tem probabilidade um. Em dimensão finita, convergência coordenada a coordenada equivale à convergência em qualquer norma.

Proposição 11.11 (Esperança Finita é Necessária)
Sejam \(\xi _1,\xi _2,\ldots \) variáveis aleatórias independentes e identicamente distribuídas, com \(\mathbf{E}|\xi _1|=\infty \). Então \( S_n = \xi _1 + \xi _2 + \cdots + \xi _n \) satisfaz
\[ \P \left(\frac{S_n}{n}\ \text{convergir em }\mathbb {R}\right)=0. \]

Demonstração

A fórmula das caudas para \(|\xi _1|\) implica

\[ \sum _{n=1}^{\infty }\P (|\xi _1|\gt n)=\infty . \]

Como as variáveis são identicamente distribuídas, a mesma série é \(\sum _n\P (|\xi _n|\gt n)\). Os eventos \(\{ |\xi _n|\gt n\} \) são independentes; portanto, o segundo lema de Borel–Cantelli dá

\[ \P (|\xi _n|\gt n\ \text{infinitas vezes})=1. \]

Por outro lado, se \(S_n/n\) convergisse em um ponto \(\omega \), então

\[ \frac{\xi _n}{n} =\frac{S_n}{n}-\frac{n-1}{n}\frac{S_{n-1}}{n-1}\longrightarrow 0. \]

Isso é incompatível com \(|\xi _n|/n\gt 1\) infinitas vezes. Logo o evento de convergência está contido no complementar de um evento de probabilidade um e, portanto, tem probabilidade zero.

Teorema 11.12 (Lei Forte dos Grandes Números de Kolmogorov)
Sejam \(\xi _1,\xi _2,\ldots \) variáveis aleatórias independentes e identicamente distribuídas, com \(\mathbf{E}|\xi _1|\lt \infty \) e \(\mu =\mathbf{E}[\xi _1]\). Então, para \(S_n=\xi _1+\cdots +\xi _n\),
\[ \dfrac {S_n} {n} \rightarrow \mu \quad \text{ quase certamente}. \]

Demonstração

Combinaremos o truncamento com o controle das médias ao longo de uma subsequência geométrica.

Passo 1: redução ao caso não negativo. Suponha primeiro que \(\xi _k\geq 0\). Ao final, o caso geral seguirá de \(\xi _k=\xi _k^+-\xi _k^-\), pois as partes positiva e negativa são integráveis e cada uma forma uma sequência i.i.d.

Passo 2: truncamento. Defina

\[ Y_k=\xi _k\mathbf1_{\{ \xi _k\leq k\} }, \qquad T_n=\sum _{k=1}^nY_k. \]

Pela representação por camadas do Corolário 8.12,

\[ \sum _{k=1}^{\infty }\P (Y_k\neq \xi _k) =\sum _{k=1}^{\infty }\P (\xi _1\gt k) \leq \int _0^\infty \P (\xi _1\gt t)\, dt =\mathbf{E}[\xi _1]\lt \infty . \]

O primeiro lema de Borel–Cantelli mostra que \(Y_k=\xi _k\) para todo \(k\) suficientemente grande, quase certamente. Assim, \((S_n-T_n)/n\to 0\) quase certamente.

Os truncamentos \(Y_k\) são independentes, mas seus níveis de corte variam com \(k\), de modo que já não são identicamente distribuídos. Suas médias e variâncias devem, por isso, conservar esse índice. Como \(0\leq Y_k\leq k\), a mesma representação por camadas, agora com \(r=2\), dá

\begin{align*} \operatorname {Var}(Y_k) & \leq \mathbf{E}[Y_k^2] =\int _0^\infty 2t\, \P (Y_k\gt t)\, dt\\ & \leq \int _0^\infty 2t\, \P (\xi _1\gt t)\mathbf1_{\{ t\lt k\} }\, dt. \end{align*}

Por Tonelli,

\[ \sum _{k=1}^{\infty }\frac{\operatorname {Var}(Y_k)}{k^2} \leq \int _0^\infty 2t\, \P (\xi _1\gt t) \sum _{k\gt t}\frac1{k^2}\, dt\lt \infty . \]

De fato, a soma interna é limitada por uma constante para \(0\leq t\lt 1\) e por \(2/t\) para \(t\geq 1\); a última integral é, portanto, dominada por uma constante mais \(4\mathbf{E}[\xi _1]\).

Passo 3: uma subsequência geométrica. Fixe \(\alpha \gt 1\) e ponha \(m_j=\lfloor \alpha ^j\rfloor \). Descartar um número finito de termos permite supor que \((m_j)\) é estritamente crescente e que \(m_j\geq \alpha ^j/2\). Se \(R_n=T_n-\mathbf{E}[T_n]\), então Chebyshev, a independência e Tonelli dão

\begin{align*} \sum _j\P (|R_{m_j}|\gt \varepsilon m_j) & \leq \frac1{\varepsilon ^2} \sum _j\frac1{m_j^2}\sum _{k\leq m_j}\operatorname {Var}(Y_k)\\ & =\frac1{\varepsilon ^2}\sum _{k=1}^{\infty }\operatorname {Var}(Y_k) \sum _{j:m_j\geq k}\frac1{m_j^2}\\ & \leq C_{\alpha ,\varepsilon } \sum _{k=1}^{\infty }\frac{\operatorname {Var}(Y_k)}{k^2}\lt \infty , \end{align*}

pois a soma geométrica interna é no máximo \(C_\alpha /k^2\). Aplicando Borel–Cantelli a \(\varepsilon =1/r\), \(r\in \mathbb {N}\), obtemos

\[ \frac{R_{m_j}}{m_j}\longrightarrow 0 \quad \text{quase certamente}. \]

Além disso, \(\| Y_k-\xi _k\| _1=\mathbf{E}[\xi _1\mathbf1_{\{ \xi _1\gt k\} }]\to 0\). Como \(\mathbf{E}[\xi _k]=\mu \), segue que \(\mathbf{E}[Y_k]\to \mu \) e, pelo lema de Cesàro,

\[ \frac{\mathbf{E}[T_{m_j}]}{m_j}\longrightarrow \mu . \]

Concluímos que \(T_{m_j}/m_j\to \mu \) quase certamente.

Passo 4: preenchimento das lacunas. Como \(T_n\) é crescente, se \(m_j\leq n\leq m_{j+1}\), então

\[ \frac{m_j}{m_{j+1}}\frac{T_{m_j}}{m_j} \leq \frac{T_n}{n} \leq \frac{m_{j+1}}{m_j}\frac{T_{m_{j+1}}}{m_{j+1}}. \]

Como \(m_{j+1}/m_j\to \alpha \), segue que, quase certamente,

\[ \frac\mu \alpha \leq \liminf _n\frac{T_n}{n} \leq \limsup _n\frac{T_n}{n}\leq \alpha \mu . \]

Repetindo o argumento para a sequência enumerável \(\alpha _r=1+1/r\) e fazendo \(r\to \infty \), obtemos \(T_n/n\to \mu \) quase certamente. Pelo Passo 2, o mesmo vale para \(S_n/n\).

Finalmente, para variáveis de sinal arbitrário, aplicamos o caso não negativo separadamente a \(\xi _k^+\) e \(\xi _k^-\) e subtraímos os limites.

11.3 Integração de Monte Carlo

Considere uma função integrável \(f:[0,1]\to \mathbb {R}\). Queremos aproximar numericamente \(\int _0^1f(x)\, dx\); a escolha do intervalo \([0,1]\) é apenas uma normalização.

Uma abordagem determinística usa pontos equidistantes \(x_1,\ldots ,x_n\) e a aproximação

\[ \int _0^1f(x)\, dx\approx \frac1n\sum _{k=1}^nf(x_k). \]

Para funções regulares, essa é a ideia das somas de Riemann. Para uma função apenas integrável, porém, os valores numa malha prescrita podem não representar bem a integral. O método de Monte Carlo substitui a malha fixa por pontos aleatórios: sejam \(U_1,U_2,\ldots \) variáveis aleatórias i.i.d. uniformes em \([0,1]\) e defina

\[ I_n=\frac1n\sum _{k=1}^nf(U_k). \]

O acaso entra na escolha dos pontos, não no valor da integral que procuramos.

Teorema 11.13 (Integração de Monte-Carlo)
Se \(f:[0,1]\to \mathbb {R}\) é Borel-mensurável e integrável, então
\[ I_n\xrightarrow {\mathrm{q.c.}}\int _0^1f(x)\, dx. \]
Em particular, a convergência também ocorre em probabilidade.

Demonstração

As variáveis \(f(U_k)\) são i.i.d. e integráveis. Como \(U_k\) tem distribuição uniforme,

\[ \mathbf{E}[f(U_k)]=\int _0^1f(x)\, dx. \]

A conclusão segue da Lei Forte dos Grandes Números de Kolmogorov.

A integrabilidade basta para garantir a convergência desse método de computação científica. Quantificar o erro é outra questão: hipóteses adicionais, como variância finita, permitem obter estimativas para amostras de tamanho finito.

11.4 Polinômios de Bernstein e o teorema de Weierstrass

As leis dos grandes números também permitem demonstrar um resultado inteiramente determinístico. A interpretação dos polinômios de Bernstein como esperanças de funções de variáveis binomiais conduz a uma prova do Teorema de Weierstrass. Esta seção é adaptada de [23].

Polinômios de Bernstein

Os polinômios de Bernstein são definidos por

\[ b_{n,j}(x)=\binom njx^j(1-x)^{n-j}, \]

para \(j=0,1,\ldots ,n\).

  • Os polinômios \(b_{n,j}\) formam uma família de \(n+1\) polinômios de grau no máximo \(n\).

  • Para \(0\lt j\lt n\), o máximo de \(b_{n,j}\) em \([0,1]\) é atingido unicamente em \(j/n\).

  • A família \(b_{n,0},\ldots ,b_{n,n}\) é uma base do espaço dos polinômios de grau no máximo \(n\).

  • Eles satisfazem a simetria \(b_{n,j}(x)=b_{n,n-j}(1-x)\), a positividade \(b_{n,j}(x)\geq 0\) em \([0,1]\) e a normalização \(\sum _{j=0}^nb_{n,j}(x)=1\).

    Figura 11.1 Polinômios de Bernstein b_(8,j), j=0,ldots ,8. A curva tracejada destaca b_(8,3). Para cada x, a soma das nove curvas é 1.

    Figura 11.1 Polinômios de Bernstein \(b_{8,j}\), \(j=0,\ldots ,8\). A curva tracejada destaca \(b_{8,3}\). Para cada \(x\), a soma das nove curvas é \(1\).

Teorema de Aproximação de Weierstrass

Associemos agora esses polinômios a uma função contínua \(f:[0,1]^d\to \mathbb {C}\), definindo

\[ B_n [f] ( \mathbf{x}) = \sum _{0 \le i_1, \dots , i_d \le n} f \left( \frac{i_1}{n}, \ldots , \frac{i_d}{n} \right) \prod _{k = 1} ^{d} \binom {n} {i_k} x_k ^{i_k} (1-x_k) ^{n-i_{k}}\, . \]

O teorema afirma que esses polinômios aproximam \(f\) uniformemente.

Figura 11.2 Aproximações de Bernstein com n=10 (à esquerda) e n=50 (à direita), produzidas pelo código de simulação que acompanha as notas.Figura 11.2 Aproximações de Bernstein com n=10 (à esquerda) e n=50 (à direita), produzidas pelo código de simulação que acompanha as notas.

Figura 11.2 Aproximações de Bernstein com \(n=10\) (à esquerda) e \(n=50\) (à direita), produzidas pelo código de simulação que acompanha as notas.

A estrutura dos polinômios torna-se mais clara com a interpretação probabilística

\[ B_n[f](\mathbf{x})=\mathbf{E}\left[f\left(\frac{\mathbf{S}_n}{n}\right)\right], \]

onde as coordenadas de \(\mathbf{S}_n\) são independentes e

\[ S_{k,n}\sim \operatorname {Bin}(n,x_k),\qquad 1\leq k\leq d. \]

A lei dos grandes números sugere a concentração de \(\mathbf{S}_n/n\) perto de \(\mathbf{x}\). Para passar dessa observação à convergência uniforme, precisamos de uma estimativa que não dependa de \(\mathbf{x}\). A desigualdade de Chebyshev fornecerá justamente esse controle.

Teorema 11.14 (Teorema de Aproximação de Weierstrass)
Sejam \(d\geq 1\) e \(f:[0,1]^d\to \mathbb {C}\) uma função contínua. Defina
\[ B_n [f] ( \mathbf{x}) = \sum _{0 \le i_1, \dots , i_d \le n} f \left( \frac{i_1}{n}, \ldots , \frac{i_d}{n} \right) \prod _{k = 1} ^{d} \binom {n} {i_k} x_k ^{i_k} (1-x_k) ^{n-i_{k}} \]
para \(n\geq 1\) e \(\mathbf{x}=(x_1,\ldots ,x_d)\in [0,1]^d\). Então \(B_n[f]\to f\) uniformemente em \([0,1]^d\).

Demonstração

Fixe \(\mathbf{x}=(x_1,\ldots ,x_d)\in [0,1]^d\). Para \(1\leq k\leq d\) e \(1\leq j\leq n\), sejam \(\xi _{k,j}\) variáveis independentes de Bernoulli com parâmetro \(x_k\). Ponha

\[ S_{k,n}=\sum _{j=1}^n\xi _{k,j}, \qquad \mathbf{S}_n=(S_{1,n},\ldots ,S_{d,n}). \]

A independência e a fórmula da distribuição binomial mostram, pela definição da esperança, que

\[ B_n[f](\mathbf{x}) =\mathbf{E}\left[f\left(\frac{\mathbf{S}_n}{n}\right)\right]. \]

Use a norma do máximo em \(\mathbb {R}^d\). Como

\[ \mathbf{E}\left[\frac{S_{k,n}}n\right]=x_k, \qquad \operatorname {Var}\left(\frac{S_{k,n}}n\right) =\frac{x_k(1-x_k)}n\leq \frac1{4n}, \]

a desigualdade da união e a desigualdade de Chebyshev dão, para todo \(\delta \gt 0\),

\[ \P \left(\left\| \frac{\mathbf{S}_n}{n}-\mathbf{x}\right\| _\infty \geq \delta \right) \leq \sum _{k=1}^d\P \left(\left|\frac{S_{k,n}}n-x_k\right|\geq \delta \right) \leq \frac{d}{4n\delta ^2}. \]

Essa cota não depende de \(\mathbf{x}\).

Seja \(M=\max _{\mathbf{y}\in [0,1]^d}|f(\mathbf{y})|\). Dado \(\varepsilon \gt 0\), a continuidade uniforme de \(f\) fornece \(\delta \gt 0\) tal que \(|f(\mathbf{y})-f(\mathbf{x})|\lt \varepsilon /2\) sempre que \(\| \mathbf{y}-\mathbf{x}\| _\infty \lt \delta \). Separando a esperança conforme esse evento e seu complementar, obtemos

\begin{align*} |B_n[f](\mathbf{x})-f(\mathbf{x})| & \leq \mathbf{E}\left|f\left(\frac{\mathbf{S}_n}{n}\right)-f(\mathbf{x})\right|\\ & \leq \frac\varepsilon 2 +2M\P \left(\left\| \frac{\mathbf{S}_n}{n}-\mathbf{x}\right\| _\infty \geq \delta \right)\\ & \leq \frac\varepsilon 2+\frac{Md}{2n\delta ^2}. \end{align*}

Para \(n\) suficientemente grande, o último termo é menor que \(\varepsilon /2\), uniformemente em \(\mathbf{x}\). Logo \(\| B_n[f]-f\| _\infty \to 0\).

A prova introduz variáveis aleatórias para construir uma aproximação determinística. Depois de tomada a esperança, o acaso já fez seu trabalho.

Uma extensão da Lei Forte: Kolmogorov e Kronecker

A Lei Forte apresentada no texto trata sobretudo de sequências i.i.d. Há uma extensão simples e útil para somas de variáveis independentes que não precisam ter a mesma distribuição. Ela repousa em três ferramentas que também voltarão a aparecer, em linguagem de martingalas, no Capítulo 15.

Teorema 11.15 (Desigualdade maximal de Kolmogorov)
Sejam \(X_1,\ldots ,X_n\) variáveis aleatórias independentes, centradas e com segundo momento finito, e ponha \(S_k=X_1+\cdots +X_k\). Então, para todo \(r\gt 0\),
\[ \P \left(\max _{1\leq k\leq n}|S_k|\geq r\right) \leq \frac{\operatorname {Var}(S_n)}{r^2} =\frac{1}{r^2}\sum _{k=1}^n\operatorname {Var}(X_k). \]

Demonstração

Seja \(A_k\) o evento em que \(k\) é o primeiro índice para o qual \(|S_k|\geq r\). Os eventos \(A_k\) são disjuntos e \(A_k\) depende apenas de \(X_1,\ldots ,X_k\). Como \(S_n-S_k\) é independente de \(A_k\) e de \(S_k\), e tem média zero,

\[ \mathbf{E}\bigl[S_n^2\mathbb {1}_{A_k}\bigr] =\mathbf{E}\bigl[S_k^2\mathbb {1}_{A_k}\bigr] +\P (A_k)\mathbf{E}[(S_n-S_k)^2] \geq r^2\P (A_k). \]

Somando em \(k\) e usando a disjunção,

\[ r^2\P \left(\max _{k\leq n}|S_k|\geq r\right) \leq \mathbf{E}[S_n^2]=\operatorname {Var}(S_n), \]

pois os incrementos são independentes e centrados.

Teorema 11.16 (Critério de convergência de Kolmogorov)
Se \(X_1,X_2,\ldots \) são independentes, centradas, têm segundo momento finito e
\[ \sum _{k=1}^{\infty }\operatorname {Var}(X_k)\lt \infty , \]
então a série \(\sum _{k\geq 1}X_k\) converge quase certamente.

Demonstração

Escreva \(S_n=\sum _{k\leq n}X_k\). Para \(m\lt n\), a desigualdade maximal aplicada à cauda fornece

\[ \P \left(\max _{m\lt j\leq n}|S_j-S_m|\geq r\right) \leq \frac{1}{r^2}\sum _{k=m+1}^{n}\operatorname {Var}(X_k). \]

Fazendo \(n\to \infty \) e usando continuidade da probabilidade,

\[ \P \left(\sup _{j\gt m}|S_j-S_m|\geq r\right) \leq \frac{1}{r^2}\sum _{k\gt m}\operatorname {Var}(X_k)\longrightarrow 0. \]

Se \(C_m(r)=\{ \sup _{j,\ell \geq m}|S_j-S_\ell |\gt r\} \), então \(C_m(r)\subseteq \{ \sup _{j\geq m}|S_j-S_m|\gt r/2\} \); portanto \(\P (C_m(r))\to 0\). Como \(C_m(r)\) decresce em \(m\), segue que, para cada \(r\gt 0\), quase toda trajetória é eventualmente \(r\)-Cauchy. Intersectando sobre \(r\in \mathbb {Q}_{\gt 0}\), \((S_n)\) é Cauchy quase certamente e, portanto, converge.

Lema 11.17 (Lema de Kronecker, na forma usada aqui)
Se a série \(\sum _{k\geq 1}x_k/k\) converge, então
\[ \frac1n\sum _{k=1}^n x_k\longrightarrow 0. \]

Demonstração

Ponha \(T_n=\sum _{k=1}^n x_k/k\) e \(T_0=0\). Como \(x_k=k(T_k-T_{k-1})\), uma soma por partes dá

\[ \frac1n\sum _{k=1}^n x_k =T_n-\frac1n\sum _{k=1}^{n-1}T_k. \]

Se \(T_n\to T\), a média de Cesàro à direita também converge a \(T\); a diferença, portanto, tende a zero.

Exercício 11.1

Truncamento. Seja \(\xi \) uma variável aleatória integrável. Para \(M\gt 0\), defina

\[ \xi ^{(M)} =\xi \mathbb {1}_{\{ |\xi |\leq M\} }. \]

Prove que:

  • \(|\xi ^{(M)}|\leq M\) e \(|\xi ^{(M)}|\leq |\xi |\) pontualmente;

  • \(\xi ^{(M)}\to \xi \) quase certamente quando \(M\to \infty \);

  • para cada \(M\) fixo, \(\xi ^{(M)}\) possui momentos de todas as ordens;

  • \(\mathbf{E}[\xi ^{(M)}]\to \mathbf{E}[\xi ]\) quando \(M\to \infty \).

Indique explicitamente qual função domina a sequência no último item.

Ver solução
As duas cotas são imediatas da definição. Para cada valor finito de \(\xi \), \(\xi ^{(M)}=\xi \) quando \(M\gt |\xi |\), logo há convergência quase certa. Como \(|\xi ^{(M)}|\leq M\), todos os seus momentos são finitos. Finalmente, \(|\xi ^{(M)}|\leq |\xi |\in L^1\) e a Convergência Dominada dá \(\mathbf{E}[\xi ^{(M)}]\to \mathbf{E}[\xi ]\); a função dominante é \(|\xi |\).
Exercício 11.2

Sejam \(\xi _1,\xi _2,\ldots \) variáveis aleatórias i.i.d. com distribuição \(N(0,1)\). Prove que

\[ \frac{\xi _1^2+\cdots +\xi _n^2}{(\xi _1-1)^2+\cdots +(\xi _n-1)^2} \]

converge quase certamente e determine o limite.

Ver solução
Pela Lei Forte, \(n^{-1}\sum _{k\leq n}\xi _k^2\to \mathbf{E}\xi _1^2=1\) e \(n^{-1}\sum _{k\leq n}(\xi _k-1)^2\to \mathbf{E}(\xi _1-1)^2=2\) quase certamente. O denominador é então positivo para \(n\) grande, e o quociente converge a \(1/2\).
Exercício 11.3

Sejam \(\xi _1,\xi _2,\ldots \) variáveis aleatórias i.i.d. com distribuição uniforme em \((0,1)\). Prove que a média geométrica

\[ \left(\prod _{k=1}^{n}\xi _k\right)^{1/n} \]

converge quase certamente e determine o limite.

Dica. Aplique a Lei Forte dos Grandes Números a \(\log \xi _1,\log \xi _2,\ldots \) e verifique antes a integrabilidade.

Ver solução
\(\mathbf{E}|\log \xi _1|=\int _0^1-\log x\, \d x=1\) e \(\mathbf{E}\log \xi _1=-1\). Pela Lei Forte,
\[ \frac1n\log \prod _{k=1}^n\xi _k =\frac1n\sum _{k=1}^n\log \xi _k\longrightarrow -1 \]
quase certamente. Pela continuidade da exponencial, a média geométrica converge a \(e^{-1}\).
Exercício 11.4

Lei Fraca por funções geradoras de momentos. Sejam \(\xi _1,\xi _2,\ldots \) variáveis aleatórias i.i.d., com \(\mathbf{E}|\xi _1|\lt \infty \), e suponha que

\[ M_\xi (s)=\mathbf{E}[e^{s\xi _1}] \]

seja finita para \(s\in [-c,c]\), onde \(c\gt 0\). Defina \(\overline\xi _n=n^{-1}\sum _{k=1}^{n}\xi _k\) e \(\mu =\mathbf{E}[\xi _1]\).

  1. Prove que, para todo \(s\in [-c,c]\),

    \[ M_{\overline\xi _n}(s) =\left[M_\xi \left(\frac{s}{n}\right)\right]^n \longrightarrow e^{s\mu }. \]
  2. Reconheça o limite como a função geradora de momentos da constante \(\mu \) e conclua que \(\overline\xi _n\xrightarrow {\P }\mu \).

    Dica. Mostre que \(M_\xi (u)=1+u\mathbf{E}[\xi _1]+o(u)\) quando \(u\to 0\).

Ver solução
Independência dá \(M_{\bar\xi _n}(s)=[M_\xi (s/n)]^n\). A diferenciabilidade em zero fornece \(M_\xi (u)=1+\mu u+o(u)\); portanto
\[ n\log M_\xi (s/n)\longrightarrow s\mu \quad \text{e}\quad M_{\bar\xi _n}(s)\longrightarrow e^{s\mu }. \]
Essa é a função geradora de momentos da constante \(\mu \). Para concluir, use a cota exponencial de Markov diretamente: para \(t\in (0,c]\), a independência dá
\[ \P \bigl(\overline\xi _n\geq \mu +\varepsilon \bigr) \leq e^{-tn(\mu +\varepsilon )}M_\xi (t)^n =\bigl[e^{-t(\mu +\varepsilon )}M_\xi (t)\bigr]^{n}, \]
e de \(M_\xi (t)=1+\mu t+o(t)\) segue \(e^{-t(\mu +\varepsilon )}M_\xi (t)=1-t\varepsilon +o(t)\), que é \(\lt 1\) para \(t\gt 0\) pequeno. Logo a probabilidade decai geometricamente em \(n\). Aplicando o mesmo a \(-\xi _k\) controla-se a cauda inferior, e portanto \(\overline\xi _n\xrightarrow {\P }\mu \).
Exercício 11.5

Sejam \(\xi _1,\xi _2,\ldots \) variáveis aleatórias independentes com

\[ \mathbf{E}[\xi _k]=0, \qquad \sigma _k^2=\operatorname {Var}(\xi _k)\lt \infty . \]

Para \(S_n=\sum _{k=1}^{n}\xi _k\), prove que

\[ \sum _{k=1}^{\infty }\frac{\sigma _k^2}{k^2}\lt \infty \quad \Longrightarrow \quad \frac{S_n}{n}\xrightarrow {q.c.}0. \]

Dica. Aplique o Teorema 11.16 à série \(\sum _k\xi _k/k\) e depois o Lema 11.17.

Ver solução
As variáveis \(\xi _k/k\) são independentes, centradas, e a soma de suas variâncias é \(\sum _k\sigma _k^2/k^2\lt \infty \). Pelo Teorema 11.16, a série \(\sum _k\xi _k/k\) converge quase certamente. O Lema 11.17 implica então \(n^{-1}\sum _{k=1}^n\xi _k=S_n/n\to 0\) quase certamente.
Exercício 11.6

Seja \(\xi _1,\xi _2,\ldots \) uma sequência i.i.d. com

\[ \P (\xi _k=0)=\P (\xi _k=2)=\frac12, \]

e defina

\[ Z=\sum _{k=1}^{\infty }\frac{\xi _k}{3^k}. \]
  1. Prove que a série converge e que \(Z\) pertence ao conjunto de Cantor quase certamente.

  2. Prove que \(Z\) possui a distribuição de Cantor.

  3. Calcule \(\mathbf{E}[Z]\) e \(\operatorname {Var}(Z)\) justificando a troca entre soma e esperança.

Ver solução
A série é dominada por \(\sum 2/3^k=1\) e sua expansão ternária usa somente \(0\) e \(2\), logo \(Z\in C\). Os dígitos são independentes e equiprováveis, o que produz precisamente a distribuição de Cantor. Por Tonelli,
\[ \mathbf{E}Z=\sum _{k\geq 1}\frac{\mathbf{E}\xi _k}{3^k} =\sum _{k\geq 1}3^{-k}=\frac12. \]
Como \(\operatorname {Var}(\xi _k)=1\) e os termos são independentes, \(\operatorname {Var}Z=\sum _{k\geq 1}3^{-2k}=1/8\); a série converge em \(L^2\), justificando essa passagem.
Exercício 11.7

Integração de Monte Carlo. Seja \(f:[0,1]\to [0,1]\) contínua. Considere \(\xi _1,c_1,\xi _2,c_2,\ldots \) independentes e uniformes em \([0,1]\) e defina

\[ \eta _i =\mathbb {1}_{\{ c_i\lt f(\xi _i)\} }. \]
  1. Mostre que \(\eta _1,\eta _2,\ldots \) são i.i.d. de Bernoulli e calcule \(\mathbf{E}[\eta _i]\).

  2. Use a Lei Forte dos Grandes Números para concluir que

    \[ \frac1n\sum _{i=1}^{n}\eta _i \longrightarrow \int _0^1f(x)\, \d x \qquad \text{quase certamente}. \]
Ver solução
Cada \(\eta _i\) é função apenas do par independente \((\xi _i,c_i)\), logo as variáveis são i.i.d. Além disso, condicionando em \(\xi _i\),
\[ \P (\eta _i=1)=\mathbf{E}[\P (c_i\lt f(\xi _i)\mid \xi _i)] =\mathbf{E}[f(\xi _i)]=\int _0^1f(x)\, \d x. \]
Assim são Bernoulli com esse parâmetro, e a Lei Forte aplicada às \(\eta _i\) fornece a convergência exibida.