Processos estocásticos
Neste capítulo vamos estabelecer a linguagem básica que será usada ao longo de todo o livro. A ideia central é simples: um processo estocástico descreve um sistema cuja evolução envolve aleatoriedade. Formalmente, ele será representado por uma família de variáveis aleatórias indexadas por algum parâmetro, que na maior parte das aplicações será interpretado como tempo.
Essa definição, embora curta, reúne diferentes ingredientes. É preciso especificar quais valores o processo pode assumir, em que instantes ele é observado e qual é o mecanismo probabilístico que produz suas possíveis evoluções. Dependendo dessas escolhas, obtemos modelos bastante distintos: o tempo pode ser discreto ou contínuo; o conjunto de estados pode ser finito, enumerável ou contínuo; as trajetórias podem apresentar saltos, oscilações ou outras formas de comportamento.
Há também duas maneiras complementares de observar um processo. Podemos fixar um instante \(t\) e considerar \(X_t\) como uma variável aleatória, perguntando quais valores ela pode assumir e com quais probabilidades. Ou podemos fixar uma realização \(\omega \) e acompanhar a função
obtendo uma trajetória do processo. Essa mudança de ponto de vista será recorrente: ora estudaremos distribuições em instantes determinados, ora propriedades de trajetórias inteiras.
Nosso objetivo aqui não é ainda estudar profundamente uma classe particular de processos. Queremos primeiro organizar essas ideias, apresentar a notação e examinar exemplos suficientemente variados para reconhecer o que há de comum entre modelos muito diferentes.
1.1 Processos, estados e trajetórias
Em muitas aplicações, \(t\) representa tempo e \(T\) é \(\mathbb N_0=\{ 0,1,2,\ldots \} \), \(\mathbb Z\) ou \([0,\infty )\). O parâmetro também pode representar posição, escala ou uma combinação de variáveis. Em imagens, por exemplo, um campo aleatório pode ser indexado pelas coordenadas \((u,v)\) dos pixels. A palavra “processo” não exige, portanto, que o índice seja temporal.
Para um \(t\) fixo, \(X_t\) é uma variável aleatória. Se fixamos, em vez disso, um resultado \(\omega \in \Omega \), obtemos uma função do parâmetro.
Convém manter separadas essas duas leituras. Em \(X_t(\omega )\), fixar \(t\) produz uma variável aleatória e fixar \(\omega \) produz uma trajetória. Um gráfico obtido por simulação representa uma dessas trajetórias, não o processo inteiro.
Um processo estocástico pode ser pensado como uma regra aleatória que escolhe uma trajetória. Antes de sabermos qual \(\omega \) ocorreu, temos várias trajetórias possíveis; depois que \(\omega \) é fixado, uma delas fica determinada.
Para estudar a dependência ao longo do parâmetro, observamos vários instantes simultaneamente. Dados \(t_1,\ldots ,t_k\in T\), o vetor aleatório
possui uma distribuição conjunta, chamada de distribuição finito-dimensional do processo. Em outras palavras, escolhemos um número finito de instantes e perguntamos pela lei conjunta dos valores do processo nesses instantes. Em vez de descrever uma trajetória inteira, essa distribuição descreve o processo visto em um número finito de coordenadas.
As distribuições individuais de \(X_t\) dizem o que pode acontecer em cada instante isoladamente; as distribuições finito-dimensionais também registram como os valores se relacionam ao longo do parâmetro.
Essa distinção é essencial. Seja \(Z\) uma variável de Bernoulli com parâmetro \(1/2\). O processo \(X_n=Z\) tem a mesma distribuição marginal em todo instante. Uma sequência \((Y_n)\) de variáveis de Bernoulli independentes, também com parâmetro \(1/2\), possui exatamente as mesmas marginais. Entretanto, as trajetórias são muito diferentes: \(X\) permanece constante, enquanto \(Y\) pode mudar a cada passo. Conhecer apenas a distribuição de cada coordenada não determina um processo.
Quando os estados são numéricos e os segundos momentos existem, duas funções fornecem resumos úteis:
A média descreve o comportamento central em cada instante; a covariância mede como observações feitas em dois instantes variam conjuntamente. Esses resumos não determinam a lei de todo processo em geral. Para os processos gaussianos, apresentados adiante, média e covariância determinam todas as distribuições finito-dimensionais.
1.2 Classes e propriedades fundamentais
Há duas perguntas elementares sobre um processo: o conjunto de parâmetros é discreto ou contínuo? E o espaço de estados? Combinando as respostas, obtemos quatro classes:
processos de parâmetro discreto e estado discreto;
processos de parâmetro discreto e estado contínuo;
processos de parâmetro contínuo e estado discreto;
processos de parâmetro contínuo e estado contínuo.
Aqui, “parâmetro contínuo” significa que o processo pode ser consultado em qualquer instante de um intervalo; “estado contínuo” significa que seus valores pertencem, tipicamente, a \(\mathbb R^d\). Nenhuma dessas expressões afirma que as trajetórias sejam contínuas. Um processo com parâmetro contínuo e estado real pode apresentar saltos.
| Estado discreto | Estado contínuo | |
|---|---|---|
| Parâmetro discreto | Cadeias de Markov, passeios aleatórios, processos de ramificação | Séries temporais, modelos autorregressivos, iterações do gradiente estocástico |
| \addlinespace Parâmetro contínuo | Processo de Poisson, tamanho de filas, cadeias de Markov em tempo contínuo | Movimento browniano, difusões, processos gaussianos |
A Figura 1.3 mostra uma trajetória típica de cada classe. Nos painéis com parâmetro discreto, mostramos apenas os valores nos instantes observados; não há trajetória definida entre esses pontos.
Os exemplos a seguir não serão desenvolvidos todos com a mesma profundidade. A intenção, neste primeiro panorama, é reconhecer como a classificação aparece em modelos que serão retomados ao longo do livro e perceber que processos de naturezas bastante diferentes cabem na mesma linguagem.
Parâmetro discreto e estado discreto.
Nesta classe, observamos o sistema em instantes separados e cada observação assume valores em um conjunto finito ou enumerável. Uma sequência de resultados de lançamentos de uma moeda, o número de clientes presentes ao final de cada hora e a posição de um passeio aleatório em \(\mathbb Z\) são exemplos.
O passeio guarda no estado atual a soma de todos os incrementos anteriores. A independência dos incrementos permite calcular suas primeiras características sem conhecer a distribuição completa de cada trajetória.
Como \(S_n=\xi _1+\cdots +\xi _n\), a linearidade da esperança dá
Pela independência dos incrementos, as variâncias se somam, logo
Para a covariância, suponha primeiro \(m\leq n\) e escreva
O segundo termo é independente de \(S_m\). Portanto,
Se \(n\leq m\), trocamos os papéis de \(m\) e \(n\). Em ambos os casos obtemos \(\sigma ^2\min \{ m,n\} \).
No caso simétrico, \(p=1/2\) e \(\mu =0\). Conhecidos os \(n\) primeiros incrementos,
A melhor previsão do próximo valor é, portanto, o valor atual. Essa propriedade caracteriza os martingais e será formalizada no capítulo dedicado a eles.
Parâmetro discreto e estado contínuo.
Mantemos o parâmetro discreto, de modo que o sistema continua sendo observado por etapas, mas permitimos agora que seus valores pertençam a \(\mathbb R\) ou a \(\mathbb R^d\). Séries temporais de temperatura, demanda ou retorno financeiro são exemplos usuais.
Iterando (1.1), obtemos
Se \(X_0\) tem média zero, variância \(\sigma _\varepsilon ^2/(1-\varphi ^2)\) e é independente das inovações, então
Essas fórmulas vêm diretamente da recursão. Como as inovações têm média zero, \(\mathbb E[X_{n+1}]=\varphi \mathbb E[X_n]\), e uma média inicial nula permanece nula. Se
então, pela independência, \(\operatorname {Var}(X_{n+1})=\varphi ^2v+\sigma _\varepsilon ^2=v\); a variância também permanece constante. Por fim, para \(h\geq 0\), podemos escrever \(X_{n+h}=\varphi ^hX_n+\) uma soma de inovações futuras, independente de \(X_n\). Logo
e a simetria da covariância produz o expoente \(|h|\).
A distribuição de \(X_n\) não muda com \(n\) quando as inovações e \(X_0\) são gaussianos. A dependência, entretanto, permanece e decai com a distância entre os instantes.
Um exemplo importante em ciência de dados é produzido durante o treinamento de um modelo. O gradiente estocástico atualiza um vetor de parâmetros por
em que \(Z_{n+1}\) é a observação sorteada na etapa \(n+1\) e \(G\) é uma estimativa do gradiente. Antes de fixada a sequência de observações sorteadas, \((\theta _n)\) é um processo estocástico com parâmetro discreto e estado em \(\mathbb R^d\). Essa interpretação permite estudar flutuações, estabilidade e convergência do treinamento por ferramentas probabilísticas.
Parâmetro contínuo e estado discreto.
Até aqui, o parâmetro avançava por etapas. Passamos agora ao tempo contínuo, mantendo por enquanto um espaço de estados discreto. Um processo de contagem registra quantos eventos ocorreram até cada instante: embora o tempo varie continuamente, o valor observado pertence a \(\mathbb N_0\), e a trajetória muda por saltos.
Um processo de Poisson de taxa \(\lambda \gt 0\) é um processo de contagem \((N_t)_{t\geq 0}\) com incrementos independentes e tal que
O incremento \(N_{t+h}-N_t\) conta quantos eventos novos ocorrem entre os instantes \(t\) e \(t+h\). Sua distribuição depende apenas do comprimento \(h\) do intervalo, e não do instante em que começamos a observar. Assim, dois intervalos de mesma duração têm a mesma lei para o número de eventos, ainda que estejam em posições diferentes no tempo.
A independência dos incrementos acrescenta outra informação: contagens feitas em intervalos disjuntos não interferem umas nas outras. Em particular, o número de eventos novos entre \(t\) e \(t+h\) é independente da contagem acumulada até \(t\). A taxa \(\lambda \) fixa a escala do processo: ela representa o número médio de eventos por unidade de tempo e, em um intervalo de comprimento \(h\), esperamos \(\lambda h\) eventos.
Uma interpretação útil é imaginar um relógio aleatório que toca a cada nova chegada. O processo \(N_t\) registra quantas vezes esse relógio tocou até o instante \(t\).
Por exemplo, se chegam em média três clientes por hora, então o número de chegadas nos próximos trinta minutos tem distribuição \(\operatorname {Poisson}(3/2)\). A probabilidade de exatamente duas chegadas é
Em particular,
O processo combina, portanto, uma taxa constante no tempo com independência entre contagens em intervalos disjuntos. Essas hipóteses simples tornam o processo de Poisson um primeiro modelo natural para chegadas a um sistema.
Se clientes chegam segundo um processo de Poisson e permanecem algum tempo em atendimento, o tamanho da fila \((Q_t)\) também possui parâmetro contínuo e estado discreto. Diferentemente de \(N_t\), suas trajetórias podem subir nas chegadas e descer nas conclusões de serviço. Modelos de filas mostram que classificar o tipo de trajetória é apenas o começo; a dependência entre os saltos determina o comportamento do sistema.
Parâmetro contínuo e estado contínuo.
O tempo já é contínuo; para completar o quadro, permitimos agora também que o estado varie continuamente. Nesta última classe, portanto, tanto o parâmetro quanto o estado variam em conjuntos contínuos. O exemplo central é o movimento browniano.
Em 1827, Robert Brown observou ao microscópio o movimento irregular de pequenas partículas suspensas em água. O fenômeno persistia em partículas sem atividade biológica e, portanto, pedia uma explicação física. Décadas mais tarde, a teoria cinética o interpretou como o efeito acumulado de inúmeros choques das moléculas do fluido; no trabalho de Einstein de 1905, essa imagem levou à previsão de que o deslocamento típico cresce como a raiz quadrada do tempo, ou, equivalentemente, de que sua variância é proporcional ao tempo.
O modelo matemático conserva os traços macroscópicos dessa descrição e deixa de lado os choques individuais. Em intervalos disjuntos, os deslocamentos são tomados como independentes; sua distribuição depende apenas da duração do intervalo e é gaussiana, com variância igual ao tempo decorrido. A continuidade das trajetórias completa a idealização e conduz aos axiomas seguintes.
\(W_0=0\);
seus incrementos em intervalos disjuntos são independentes;
\(W_{t+h}-W_t\) tem distribuição normal com média zero e variância \(h\);
suas trajetórias são contínuas quase certamente.
Das propriedades dos incrementos segue que
Apesar de contínuas, as trajetórias brownianas são, quase certamente, não diferenciáveis em ponto algum. Continuidade do estado e continuidade da trajetória, portanto, não significam suavidade.
Processos gaussianos estendem essa ideia e aparecem diretamente em aprendizado de máquina. Dizemos que \((X_t)_{t\in T}\) é gaussiano quando, para qualquer escolha finita \(t_1,\ldots ,t_k\), o vetor \((X_{t_1},\ldots ,X_{t_k})\) possui distribuição normal multivariada. O processo fica determinado por sua função média \(m(t)\) e por seu núcleo de covariância \(K(s,t)\).
Em regressão por processos gaussianos, o índice \(t\) representa uma entrada do modelo, possivelmente um vetor em \(\mathbb R^d\), e \(X_t\) representa o valor desconhecido da função nessa entrada. O núcleo especifica quais entradas devem produzir valores semelhantes. Depois de observar dados, condicionamos o processo e obtemos simultaneamente uma previsão e uma medida de incerteza. Esse exemplo reforça que o parâmetro de um processo não precisa representar tempo.
Propriedades que atravessam as quatro classes.
A classificação anterior descreve os conjuntos envolvidos, mas não determina como as coordenadas do processo dependem umas das outras. As propriedades a seguir aparecem repetidamente nos modelos estudados neste livro.
Dizemos que \((X_t)\) é estritamente estacionário se, para quaisquer \(t_1,\ldots ,t_k\) e para todo deslocamento \(h\) permitido,
possuem a mesma distribuição.
Quando os segundos momentos existem, o processo é estacionário de segunda ordem se sua média é constante e sua covariância depende apenas da diferença entre os parâmetros:
O processo AR(1) iniciado em equilíbrio é estacionário. O passeio aleatório e o processo de Poisson não são, pois suas variâncias crescem com o tempo. Ambos possuem, entretanto, incrementos estacionários: a distribuição de \(X_{t+h}-X_t\) depende de \(h\), mas não de \(t\). Estacionariedade do processo e estacionariedade dos incrementos são propriedades distintas.
Passeios aleatórios, processos de Poisson e movimentos brownianos possuem incrementos independentes. No processo autorregressivo, cada novo estado herda parte do estado anterior e os incrementos geralmente são dependentes.
A propriedade não afirma que o futuro seja independente do passado. Ela afirma que o estado presente contém a informação do passado necessária para prever o próximo passo. Passeios aleatórios, processos autorregressivos, processos de Poisson e movimentos brownianos são markovianos. Em cada caso, porém, o espaço de estados e a forma das transições são diferentes.
Martingais formalizam a ideia de um processo sem deriva previsível. Em tempo discreto e em relação ao próprio histórico, a condição elementar é
conhecido o passado, a melhor previsão do próximo valor é o valor atual. A definição geral exige especificar precisamente a informação disponível em cada instante e será apresentada no capítulo de martingais.
O passeio aleatório de média zero possui essa propriedade. Outros processos podem adquiri-la depois que retiramos sua deriva média. Por exemplo, se \((N_t)\) é um processo de Poisson de taxa \(\lambda \), então \(M_t=N_t-\lambda t\) separa o crescimento previsível, \(\lambda t\), da flutuação aleatória e é um martingal em relação à informação gerada pelas contagens.
Por fim, processos também diferem pela regularidade de suas trajetórias. Em tempo discreto, falamos naturalmente de sequências. Em tempo contínuo, uma trajetória pode ser contínua, como no movimento browniano, ou constante por trechos e contínua à direita, como no processo de Poisson. A distribuição dos estados e a regularidade dos caminhos respondem a perguntas diferentes e devem ser especificadas separadamente.
| Processo | Estacionário | Incr. estacionários | Incr. independentes | Markov |
|---|---|---|---|---|
| Passeio aleatório | Não | Sim | Sim | Sim |
| AR(1) em equilíbrio | Sim | Sim | Não | Sim |
| Processo de Poisson | Não | Sim | Sim | Sim |
| Movimento browniano | Não | Sim | Sim | Sim |
Esse panorama fornece uma linguagem comum para os capítulos seguintes. A classificação indica onde o processo vive; estacionariedade, independência dos incrementos, propriedade de Markov e estrutura de martingal descrevem como ele evolui.
Para outras introduções aos processos apresentados neste capítulo, veja Durrett 2016; Lawler 2006. A relação entre processos gaussianos e aprendizado de máquina é desenvolvida em Rasmussen e Williams 2006.