Apêndice A

História da medida e da probabilidade

A probabilidade nasceu ao menos duas vezes. Na primeira, no século XVII, apareceu como uma aritmética do futuro: como dividir uma aposta interrompida, quanto vale uma chance, que preço é justo pagar por um risco? Na segunda, no início do século XX, reapareceu como uma teoria de medida: antes de calcular a probabilidade de um evento, tornou-se necessário dizer com precisão o que são o espaço de resultados, os eventos e a própria probabilidade.

Entre esses dois nascimentos, a pergunta mudou. De início, queria-se saber quanto. Mais tarde, foi preciso perguntar o que pode ser medido e quais operações preservam essa medida. A passagem de uma pergunta à outra não apagou o cálculo clássico; deu-lhe uma linguagem capaz de tratar limites, variáveis contínuas e trajetórias inteiras.

Ilustração: História da medida e da probabilidade

Este capítulo não pretende oferecer uma história exaustiva, nem transformar o desenvolvimento da área numa procissão de nomes e datas. Seu fio condutor é a formação da linguagem usada neste livro. A primeira versão deste texto nasceu de uma tradução de um ensaio de Maurice Sion sobre a história da teoria da medida no século XX. A presente reescrita conserva essa dívida e amplia o foco para a história da probabilidade; para panoramas mais extensos, veja [34, 35].

A.1 O primeiro nascimento: calcular o acaso

Jogos de azar, seguros, anuidades e decisões sob incerteza são muito anteriores à teoria matemática da probabilidade. Durante séculos, porém, os cálculos permaneceram locais: uma contagem para este jogo, uma regra prática para aquele contrato. Em meados do século XVI, Girolamo Cardano já comparava casos favoráveis e casos possíveis em problemas com dados. Seu tratado sobre jogos foi publicado apenas postumamente, em 1663, e não chegou a organizar uma teoria geral.

Em 1654, a correspondência entre Blaise Pascal e Pierre de Fermat inaugurou a probabilidade matemática. Um dos problemas discutidos era o problema dos pontos: se uma partida é interrompida antes de haver vencedor, como dividir honestamente o prêmio? A pontuação já obtida não basta. É preciso enumerar os futuros possíveis e pesar o valor presente de cada jogador pelas chances de vitória que ainda possui.

Essa mudança de perspectiva é pequena apenas em aparência. Pascal e Fermat transformaram uma disputa sobre dinheiro numa pergunta acerca da estrutura do futuro. Seus métodos eram diferentes — Pascal explorava uma recorrência, Fermat enumerava continuações possíveis — mas conduziam à mesma divisão. Em 1657, Christiaan Huygens publicou o primeiro tratado impresso dedicado ao cálculo de probabilidades e colocou a esperança matemática no centro do assunto.

Ao mesmo tempo, outra tradição tomava forma fora das mesas de jogo. Em 1662, John Graunt analisou registros de mortalidade de Londres, procurando regularidades em dados coletivos. De um lado havia a combinatória dos casos possíveis; de outro, frequências observadas em populações reais. Grande parte da história posterior da probabilidade pode ser lida como a tentativa de explicar por que essas duas linguagens conversam.

A.2 Frequências, erros e leis-limite

O primeiro resultado geral a aproximar probabilidade teórica e frequência observada apareceu na obra de Jakob Bernoulli. Publicado postumamente em 1713, o Ars Conjectandi contém uma forma da Lei dos Grandes Números. Na notação atual, se \(X_1,X_2,\ldots \) são ensaios de Bernoulli independentes, com \(\P (X_k=1)=p\), e \(S_n=X_1+\cdots +X_n\), então, para todo \(\epsilon \gt 0\),

\[ \P \left(\left|\frac{S_n}{n}-p\right|\gt \epsilon \right) \longrightarrow 0. \]

A afirmação não define \(p\) como uma frequência observada. Ela diz algo mais delicado: partindo de um modelo com parâmetro \(p\), as frequências tendem a se concentrar perto desse parâmetro. A teoria passava a produzir regularidade a partir da repetição do acaso.

No século XVIII, Abraham de Moivre descobriu que a distribuição binomial, depois de centralizada e reescalada, podia ser aproximada pela curva normal. Laplace ampliou essa ideia e reuniu, em sua Théorie analytique des probabilités, de 1812, técnicas combinatórias, funções geradoras, inferência e aproximações assintóticas. A normal deixou de ser apenas uma fórmula ligada a um problema específico e começou a revelar uma forma universal das flutuações.

Durante o século XIX, Poisson, Chebyshev e Markov, entre outros, deram às leis dos grandes números hipóteses e demonstrações cada vez mais gerais. No início do século XX, Lyapunov formulou uma versão ampla do Teorema do Limite Central. Essa linhagem chega diretamente aos capítulos de leis-limite deste livro. Média, variância, independência e normalização já formavam uma teoria poderosa antes da axiomatização moderna.

Mas o sucesso dos cálculos escondia uma fragilidade. O que significava, em geral, atribuir probabilidade a um subconjunto infinito de resultados? Como integrar uma variável aleatória sem supor que ela possuísse uma densidade bem comportada? E o que justificava trocar limite e esperança nas demonstrações? As respostas exigiriam uma teoria que, à primeira vista, não havia sido criada para falar de acaso.

A.3 Medir o que não é um intervalo

A noção de medida nasceu de problemas de comprimento, área, volume e integração. No cálculo de Newton e Leibniz, a integral ligava a área sob um gráfico à operação inversa da diferenciação. No século XIX, as séries de Fourier e o estudo da equação do calor forçaram os analistas a considerar funções e convergências mais irregulares do que as admitidas pelo cálculo elementar.

A integral de Riemann organizou de modo rigoroso uma parte importante dessa teoria. Ainda assim, sequências de funções integráveis podiam convergir para funções problemáticas, limites não podiam ser trocados livremente com integrais, e conjuntos definidos analiticamente escapavam da geometria intuitiva de intervalos e retângulos. Não faltavam apenas técnicas de cálculo; faltava uma noção mais flexível de tamanho.

Em 1898, Émile Borel estendeu o comprimento dos intervalos a uma classe muito maior de subconjuntos da reta. A novidade decisiva era a aditividade enumerável: se \(A_1,A_2,\ldots \) são disjuntos, então

\[ \mu \left(\bigcup _{n=1}^{\infty }A_n\right) =\sum _{n=1}^{\infty }\mu (A_n). \]

A família obtida a partir dos abertos por complementos e uniões enumeráveis é hoje chamada de \(\sigma \)-álgebra de Borel. É importante separar os dois nomes: uma \(\sigma \)-álgebra é qualquer família de conjuntos fechada por essas operações; ela é de Borel quando é gerada pelos abertos de um espaço topológico.

Henri Lebesgue deu o passo seguinte. Em sua tese de 1902, construiu uma noção de medida mais ampla e uma integral adaptada a ela. Em vez de controlar uma função apenas por partições do eixo horizontal, sua teoria permitia organizar o domínio segundo os valores assumidos pela função. Conjuntos de medida zero passaram a registrar exceções que podiam ser ignoradas pela integral sem serem apagadas da matemática.

A nova linguagem produziu teoremas de convergência com hipóteses simples e fortes conclusões. O Teorema da Convergência Dominada, em sua forma moderna, afirma que, se \(f_n\to f\) quase sempre e existe \(g\in L^1\) tal que \(|f_n|\leq g\) para todo \(n\), então

\[ \int f_n\, \d{\mu }\longrightarrow \int f\, \d{\mu }. \]

A função dominante não é um detalhe técnico dispensável: é justamente o que impede que massa relevante fuja para regiões cada vez menores ou mais distantes. A teoria tornou precisas as condições sob as quais as operações que os analistas desejavam fazer eram de fato legítimas.

Nos anos seguintes, Carathéodory abstraiu a construção por medida exterior. Radon relacionou medidas e funcionais lineares, enquanto Daniell mostrou que a integral também podia ser tomada como ponto de partida. O teorema de Radon–Nikodým permitiu representar uma medida em relação a outra por meio de uma densidade. O objeto já não precisava viver apenas na reta: podia ser definido em espaços abstratos, exatamente onde a probabilidade logo precisaria dele.

A.4 O segundo nascimento: probabilidade como medida

Na virada do século XX, problemas probabilísticos já exigiam espaços muito maiores do que conjuntos finitos de resultados. Em 1900, Louis Bachelier usou um modelo contínuo para descrever flutuações de preços. Poucos anos depois, Einstein e Smoluchowski explicaram estatisticamente o movimento errático de partículas suspensas num fluido, observado por Robert Brown no século XIX. Markov, por sua vez, iniciou o estudo de sequências de variáveis dependentes que hoje levam seu nome.

Esses exemplos mudavam a natureza do resultado aleatório. O resultado de um lançamento de dado é um número; o resultado de um movimento ao longo do tempo é uma trajetória inteira. Dizer “a partícula permanece nesta região até o instante \(t\)” significa atribuir probabilidade a um conjunto de funções. A geometria elementar dos casos favoráveis já não alcançava esse espaço.

Em 1923, Norbert Wiener construiu rigorosamente uma medida no espaço das funções contínuas para descrever o movimento browniano. A medida de Wiener mostrou que a teoria de Lebesgue podia sustentar probabilidades em dimensão infinita. Não se tratava apenas de calcular a distribuição da posição em um instante: a própria curva aleatória tornava-se o objeto observado.

Essa construção não surgiu isolada. Borel já havia usado ideias de medida em probabilidade; os trabalhos de Fréchet e Daniell haviam ampliado o cenário abstrato; e o sexto problema de Hilbert pedira uma axiomatização matemática das teorias físicas, mencionando explicitamente o cálculo de probabilidades. Ao início da década de 1930, muitas peças estavam disponíveis. Faltava reuni-las num sistema pequeno o bastante para servir de fundamento e amplo o bastante para acomodar os exemplos.

A.5 A síntese de Kolmogorov

Em 1933, Andrei Kolmogorov publicou os Grundbegriffe der Wahrscheinlichkeitsrechnung. O livro não inventou a teoria da medida nem apagou as tradições anteriores da probabilidade. Sua força foi reconhecer que elas se encaixavam. Na formulação moderna, um modelo probabilístico é uma trinca

\[ (\Omega ,\mathcal F,\P ), \]

em que \(\Omega \) é o espaço de resultados, \(\mathcal F\) é uma \(\sigma \)-álgebra de eventos e \(\P \) é uma medida de probabilidade, isto é,

\[ \P (\Omega )=1 \qquad \text{e}\qquad \P \left(\bigcup _{n=1}^{\infty }A_n\right) =\sum _{n=1}^{\infty }\P (A_n) \]

para toda sequência de eventos dois a dois disjuntos.

O vocabulário da probabilidade passou então a ser uma leitura particular do vocabulário da medida:

teoria da medidaprobabilidade
espaço mensurável $(\Omega,\mathcal F)$experimento e seus eventos
medida finita com massa total $1$probabilidade $\P$
função mensurávelvariável aleatória
imagem de uma medidadistribuição de uma variável
integral $\int X\,\d{\P}$esperança $\E[X]$
medida produtoexperimentos independentes
derivada de Radon--Nikodýmdensidade e esperança condicional

A aditividade enumerável permitia passar de eventos finitos para eventos definidos por limites. A integração de Lebesgue permitia tratar variáveis sem densidade, esperanças infinitas e convergências quase certas. Os teoremas de extensão permitiam construir uma lei em espaços de sequências ou trajetórias a partir de distribuições finito-dimensionais compatíveis.

Os axiomas, entretanto, não dizem por que um modelo descreve bem um fenômeno, nem resolvem sozinhos o significado filosófico da palavra “probabilidade”. Eles separam duas tarefas que antes apareciam misturadas: construir uma teoria matemática coerente e justificar sua relação com a experiência. Essa separação foi uma virtude, não uma fuga. Depois dela, modelos frequentistas, bayesianos, físicos ou combinatórios puderam compartilhar a mesma gramática matemática.

A.6 Processos, condicionamento e martingalas

Com os fundamentos disponíveis, a probabilidade deixou de ser apenas uma teoria de distribuições isoladas e passou a estudar sistemas que evoluem. Um processo estocástico é uma família \((X_t)_{t\in T}\) de variáveis aleatórias definida num mesmo espaço de probabilidade. Dependendo da pergunta, podemos observá-lo por suas distribuições finito-dimensionais, por suas trajetórias ou pela informação acumulada ao longo do tempo.

Paul Lévy desenvolveu profundamente as leis estáveis, o movimento browniano e os processos com incrementos independentes. Jean Ville e Joseph Doob deram à ideia de jogo justo sua forma moderna por meio das martingalas. Uma filtração \((\mathcal F_t)\) registra a informação disponível até o instante \(t\), e a condição

\[ \mathbf{E}[X_t\mid \mathcal F_s]=X_s, \qquad s\leq t, \]

diz que, conhecendo o passado, não existe ganho médio previsível. O antigo vocabulário das apostas retornou, agora dentro da teoria abstrata que ele ajudara a iniciar.

Também a esperança condicional ganhou uma definição que não depende de densidades ou partições finitas: ela pode ser construída como uma derivada de Radon–Nikodým. Tempos de parada formalizaram a decisão de observar um processo até que algo aconteça. O cálculo de Itô, criado na década de 1940, tornou possível integrar em relação ao movimento browniano e abriu um novo ramo da análise.

O problema dos pontos e os tempos de parada tratam, em épocas e linguagens muito diferentes, de uma questão aparentada: o que se pode dizer quando um jogo ou processo é interrompido antes de terminar? Não há uma linha direta entre as duas teorias, mas a comparação ajuda a reconhecer a persistência de certas perguntas probabilísticas.

A.7 A linguagem que ficou

A ordem adotada neste livro não é a ordem histórica. Aqui começamos por \(\sigma \)-álgebras e medidas, passamos pela integral e pelas variáveis aleatórias e só depois chegamos aos teoremas-limite, ao condicionamento e às martingalas. Na história, muitas dessas ideias apareceram na direção contrária: cálculos e problemas concretos vieram antes da linguagem que hoje usamos para justificá-los.

A teoria da medida não foi apenas uma mudança de nomes. Ela tornou possíveis perguntas que antes sequer cabiam no vocabulário: probabilidades de conjuntos de trajetórias, convergência de leis, condicionamento por informação e comportamento assintótico de processos inteiros. Também não eliminou a intuição dos jogos, das frequências ou dos fenômenos físicos; deu-lhe uma casa comum.

O acaso não ficou menos acaso. Tornou-se um objeto sobre o qual se podia integrar.