Capítulo 6

Distribuições

6.1 Distribuição de uma Variável Aleatória

Em muitos problemas, o espaço amostral serve de bastidor. O que observamos é o valor de uma variável aleatória e as probabilidades com que ela visita diferentes regiões da reta. Num modelo epidêmico, por exemplo, interessam o número de infectados e o número de recuperados; os detalhes de \(\Omega \) podem permanecer invisíveis.

A distribuição registra exatamente essa informação e permite, quando possível, deixar o espaço de probabilidade subjacente em segundo plano. Seja \(\xi \) uma variável aleatória definida em \((\Omega ,\mathcal{F},\P )\). Então

  1. \(\P (\xi \in \mathbb {R})=\P (\Omega )=1\);

  2. se \(A_1, A_2,\ldots \in \mathcal{B}(\mathbb {R})\) são disjuntos então \(\xi ^{-1}(A_1), \xi ^{-1}(A_2), \ldots \in \mathcal{F}\) também são disjuntos, pois as pré-imagens preservam interseções, e

    \[ \P \left(\xi ^{-1}\left(\bigcup _{n=1}^\infty A_n\right)\right) =\P \left(\bigcup _{n=1}^\infty \xi ^{-1}(A_n)\right) =\sum _{n=1}^\infty \P (\xi ^{-1}(A_n)). \]

Essas propriedades mostram que \(A\mapsto \P (\xi \in A)\) é uma probabilidade na reta.

Definição 6.1 (Distribuição de uma Variável Aleatória)

Se \( \xi \) for uma variável aleatória definida em um espaço de probabilidade \((\Omega , \mathcal{F}, \P )\), então \( \xi \) induz uma medida de probabilidade \( \P _\xi \) em \( \mathbb {R}\) definida por

\begin{equation} \label{noomega1} \P _\xi (A) = \P (\xi ^{- 1} (A)) = \P (\xi \in A), \tag{6.1} \end{equation}

para \(A\in \mathcal{B}(\mathbb {R}) .\)

Esta medida de probabilidade \( \P _\xi \) é denominada distribuição de \( \xi .\)

Na Equação (6.1), toda a estrutura específica de \(\Omega \) desaparece. Permanece uma probabilidade na reta, suficiente para responder a qualquer pergunta que dependa apenas do valor de \(\xi \).

De maneira análoga podemos definir a distribuição de um vetor aleatório

Definição 6.2 (Distribuição de Vetores Aleatórios)

Se \( \xi \) for um vetor aleatório, então \( \xi \) induz uma medida de probabilidade \( \P _\xi \) em \( \mathbb {R}^n \) definida tomando a pré-imagem de cada conjunto de Borel \( A\subset \mathbb {R}^n : \)

\begin{equation} \label{eq:distribuicao-vetor} \P _\xi (A) = \P (\xi ^{- 1} (A)) = \P (\xi \in A). \tag{6.2} \end{equation}

Esta medida de probabilidade \( \P _\xi \) é denominada distribuição do vetor \( \xi .\)

Se \(\xi =(\xi _1,\dots ,\xi _n)\) é um vetor aleatório, então as distribuições de cada uma das variáveis aleatórias \(\xi _i\), para \(i=1,\dots ,n\), são chamadas de distribuições marginais de \(\xi \).

A distribuição não determina a variável aleatória ponto a ponto. Duas variáveis podem estar relacionadas de maneiras muito diferentes e ainda ter a mesma lei.

Exemplo 6.3

Considere o experimento de lançar uma moeda não viciada, e tome como espaço amostral o conjunto \(\Omega =\{ H, T\} \), onde \(H\) representa cara e \(T\) representa coroa. Tomamos \(\P \) como a medida de probabilidade equiprovável em \(\Omega .\)

Podemos agora definir a variável aleatória \( \xi (H) = 1, \xi (T) = 0 .\)

Note que \(\P (\xi =1)=\P (\xi =0)=\frac12\), e para \(A\in \mathcal{B}(\mathbb {R})\) temos

\[ \P (\xi \in A)=\frac12\mathbb {1}_A(0)+\frac12\mathbb {1}_A(1). \]

Em particular, essa probabilidade é \(1/2\) se exatamente um dos pontos \(0,1\) pertence a \(A\), é \(1\) se ambos pertencem a \(A\) e é \(0\) se nenhum deles pertence a \(A\).

Por outro lado poderíamos definir a variável aleatória \( \eta (H) = 0, \eta (T) = 1 .\)

As variáveis nunca coincidem (de fato \(\xi =1-\eta \)), mas \( \xi \) e \( \eta \) possuem a mesma distribuição.

O exemplo distingue duas noções de igualdade que usaremos repetidamente.

Definição 6.4 (Equivalências de Variáveis Aleatórias)
  1. Dizemos que as variáveis aleatórias \(\xi \) e \(\eta \) são iguais quase certamente, fato que denotaremos por

    \[ \xi \overset {\mathrm{q.c.}}{=} \eta , \]

    se \( \P (\xi \not= \eta ) = 0. \)

  2. Dizemos que as variáveis aleatórias \( \xi \) e \( \eta \) são iguais em distribuição, fato que denotaremos por

    \[ \xi \overset {\mathrm d}{=} \eta , \]

    se eles tiverem a mesma distribuição. Equivalentemente,

    \[ \P (\xi \in A) = \P (\eta \in A) \text{ para todo } A \text{ de Borel.} \]

Observe que se \(\xi \overset {\mathrm{q.c.}}{=}\eta \), então \(\xi \overset {\mathrm d}{=}\eta \), mas a recíproca não é verdadeira. De fato, se \(\xi \overset {\mathrm{q.c.}}{=}\eta \), então

\[ \P (\xi \in A)=\P (\xi \in A; \xi =\eta )=\P (\eta \in A; \xi =\eta )=\P (\eta \in A). \]

Por outro lado, podemos ter \(\xi \overset {\mathrm d}{=}\eta \) sem que \(\xi \) e \(\eta \) estejam definidas em um mesmo espaço de probabilidade.

Exemplo 6.5

Seja agora \(\P \) a medida de Lebesgue em \(\Omega =[0,1]\), e defina \(\xi (\omega )=\omega \) e \(\eta (\omega )=1-\omega .\) Note que para \(x\in \mathbb {R}\)

\[ \{ \xi \leq x\} =\{ \omega \in [0,1]:\omega \leq x\} =\begin{cases} \emptyset & ;\mbox{ se }x\lt 0; \\ {} [0, x] & ;\mbox{ se }0\leq x\leq 1; \\ {} [0,1] & ;\mbox{ se }x\geq 1 \end{cases}, \]

e

\[ \{ \eta \leq x\} =\{ \omega \in [0,1]:1-\omega \leq x\} =\begin{cases} \emptyset & ;\mbox{ se }x\lt 0; \\ {} [1-x, 1] & ;\mbox{ se }0\leq x\leq 1; \\ {} [0,1] & ;\mbox{ se }x\geq 1 \end{cases}. \]

Segue que para \(x\in [0,1]\)

\[ \P _\xi ((-\infty ,x])=\P (\xi \leq x)=x =\P (\eta \leq x)=\P _\eta ((-\infty ,x]), \]

e portanto

\[ \P _\xi ((-\infty , x])=\P _\eta ((-\infty , x]), \]

para todo \(x\in \mathbb {R}.\)

Agora, como \(\{ (-\infty , x]:x\in \mathbb {R}\} \) é um \(\pi \)-sistema que gera \(\mathcal{B}(\mathbb {R})\), então \(\P _\xi =\P _\eta .\)

No exemplo anterior comparamos a distribuição de duas variáveis aleatórias olhando apenas para as probabilidades em intervalos do tipo \((-\infty , x]\), \(x\in \mathbb {R}\). Para tanto argumentamos que

  1. a classe \(\mathcal P=\{ (-\infty , x]: x\in \mathbb {R}\} \) é \(\pi \)-sistema;

  2. \(\mathcal{B}(\mathbb {R})\) é gerada por tais intervalos.

Com isso pudemos concluir que duas medidas de probabilidade em \((\mathbb {R}, \mathcal{B}(\mathbb {R}))\) que coincidam em \(\mathcal P\) são de fato a mesma medida.

Isso demonstra o seguinte resultado.

Teorema 6.6

Sejam \(\xi \) uma variável aleatória definida em \((\Omega _1,\mathcal{F}_1,\P _1)\) e \(\eta \) uma variável aleatória definida em \((\Omega _2,\mathcal{F}_2,\P _2)\). Então \(\xi \overset {\mathrm d}{=}\eta \) se, e somente se,

\[ \P _1(\xi \leq x)=\P _2(\eta \leq x) \qquad \text{para todo }x\in \mathbb {R}. \]

De maneira equivalente, a distribuição \(\P _\xi \) de \(\xi \) está completamente determinada pelos valores de \(\P _1(\xi \leq x), x\in \mathbb {R}.\)

Demonstração

Se \(\xi \) e \(\eta \) têm a mesma distribuição, a igualdade nos intervalos \((-\infty ,x]\) é imediata. Reciprocamente, suponha que essas igualdades valham para todo \(x\in \mathbb {R}\). As probabilidades induzidas \(\P _\xi \) e \(\P _\eta \) coincidem no \(\pi \)-sistema

\[ \mathcal P=\{ (-\infty ,x]:x\in \mathbb {R}\} , \]

que gera \(\mathcal{B}(\mathbb {R})\). Pelo Teorema de Unicidade de Medidas (Teorema 2.14), elas coincidem em \(\mathcal{B}(\mathbb {R})\). Portanto, \(\xi \stackrel{\mathrm d}= \eta \).

Esse resultado permite registrar uma distribuição por meio da função que introduziremos a seguir.

6.2 A Função Distribuição

Definição 6.7 (Função de distribuição)

A função de distribuição \( F: \mathbb {R}\rightarrow [0,1] \) de uma variável aleatória \( \xi \) é definida como

\[ F (x): = \P (\xi \leq x), \qquad x \in \mathbb {R}. \]
O teorema 6.6 nos garante que a função de distribuição determina unicamente a distribuição de \( \xi .\)

A função de distribuição comprime a lei de \(\xi \) numa única função real. O espaço \(\Omega \) desaparece da notação, mas não a informação probabilística: \(F\) determina completamente a distribuição.

Exemplo 6.8
Seja \( \xi = \) número de \( H \) em dois lançamentos independentes de uma moeda justa. Então temos
\begin{equation*} \xi = \left\{ \begin{array}{cc} 0, & \text{ com probabilidade } \frac14 \\ 1, & \text{ com probabilidade } \frac12 \\ 2, & \text{ com probabilidade } \frac14 \\ \end{array} \right. \end{equation*}
Então, podemos criar a função de distribuição. Esta função apresentará descontinuidades do tipo salto nos pontos \( 0 \), \( 1 \) e \( 2 .\)
\begin{equation*} F (x) = \P (\xi \leq x) = \left\{ \begin{array}{cl} 0, & \quad x \lt 0 \\ \frac14, & \quad x \in [0, 1) \\ \frac14 + \frac12, & \quad x \in [1,2) \\ \frac14 + \frac12 + \frac14 , & \quad x \in [2, + \infty ) \end{array} \right. \end{equation*}

Figura 6.1 Distribuição do Exemplo 6.8 .

Figura 6.1 Distribuição do Exemplo 6.8.

Exemplo 6.9

Considere o experimento de sortear ao acaso um ponto na bola unitária \(B=\{ (a, b): a^2+b^2\leq 1\} \) em \(\mathbb {R}^2\), e defina \(\xi \) como a distância ao centro da bola.

Para modelar este problema podemos considerar \(\P (\cdot )=\mu (\cdot )/\pi \), onde \(\mu \) é a medida de Lebesgue em \(B .\) Ou seja, a probabilidade de sortearmos um ponto em uma região \(A\in \mathcal{B}(B)\) é proporcional à área de \(A .\) Mais especificamente

\[ \P (A)=\frac{\mu (A)}{\pi }. \]

Agora, note que \(\xi (a, b)=\sqrt{a^2+b^2}\) e portanto para \(x\in [0,1]\)

\[ \P (\xi \leq x)=\P (\{ (a, b): a^2+b^2\leq x^2\} )=\frac{\pi \, x^2}{\pi }=x^2, \]

e portanto

\[ F(x)=\begin{cases} 0 & , x\lt 0 \\ x^2 & , 0\leq x\lt 1 \\ 1 & , x\geq 1 \end{cases}. \]

Teorema 6.10 (Propriedades da Função de Distribuição)
A função de distribuição \( F (x) \) de uma variável aleatória \( \xi \) possui as seguintes propriedades:
  1. \( F \) é não decrescente e \( 0 \leq F (x) \leq 1 .\)

  2. \( F (x) \rightarrow 0 \) quando \( x \rightarrow - \infty \) e \( F (x) \rightarrow 1 \) quando \( x \rightarrow + \infty .\)

  3. \( F \) é contínua à direita, ou seja

    \[ \lim _{y \rightarrow x_+} F (y) = F (x). \]
  4. \( F \) possui limites à esquerda em todos os pontos. Além disso,

    \[ F (x^-): = \lim _{y \rightarrow x^-} F (y) = \P (\xi \lt x). \]

    Em particular,

    \[ \P (\xi = x) = F (x) - F (x^-). \]
  5. \( F \) possui no máximo número enumerável de descontinuidades.

Uma função \(F\) que é contínua à direita e possui limites à esquerda em todos os pontos é dita càdlàg, do francês continue à droite, limites à gauche.

Demonstração
  1. Se \(x\lt y\), então \(\{ \xi \leq x\} \subseteq \{ \xi \leq y\} \), de onde \(F(x)\leq F(y)\). As cotas \(0\leq F\leq 1\) decorrem dos axiomas da probabilidade.

  2. Como \(\{ \xi \leq -n\} \downarrow \varnothing \) e \(\{ \xi \leq n\} \uparrow \Omega \), a continuidade da probabilidade por cima e por baixo dá

    \[ F(-n)\longrightarrow 0, \qquad F(n)\longrightarrow 1. \]

    A monotonicidade estende esses limites de sequências inteiras para \(x\to -\infty \) e \(x\to +\infty \).

  3. Se \(x_n\downarrow x\), então \(\{ \xi \leq x_n\} \downarrow \{ \xi \leq x\} \). Pela continuidade por cima da probabilidade, \(F(x_n)\to F(x)\). Para uma sequência arbitrária \(y_n\gt x\) com \(y_n\to x\), ponha \(z_n=\sup _{k\geq n}y_k\). Então \(z_n\downarrow x\) e, pela monotonicidade,

    \[ F(x)\leq F(y_n)\leq F(z_n). \]

    Como \(F(z_n)\to F(x)\), segue que \(F(y_n)\to F(x)\). Logo \(F\) é contínua à direita.

  4. Se \(x_n\uparrow x\), com \(x_n\lt x\), então \(\{ \xi \leq x_n\} \uparrow \{ \xi \lt x\} \). Pela continuidade por baixo,

    \[ F(x^-)=\lim _{n\to \infty }F(x_n)=\P (\xi \lt x). \]

    A monotonicidade mostra que o valor independe da sequência escolhida. Como \(\{ \xi \leq x\} \) é a união disjunta de \(\{ \xi \lt x\} \) e \(\{ \xi =x\} \),

    \[ \P (\xi =x)=F(x)-F(x^-). \]
  5. Pela continuidade à direita, toda descontinuidade de \(F\) é um salto positivo. Para \(m\geq 1\), ponha

    \[ D_m=\{ x:F(x)-F(x^-)\geq 1/m\} . \]

    Se \(x_1\lt \cdots \lt x_r\) pertencem a \(D_m\), então, pela monotonicidade,

    \[ \frac rm \leq \sum _{j=1}^r\bigl(F(x_j)-F(x_j^-)\bigr) \leq 1. \]

    Portanto, \(D_m\) possui no máximo \(m\) pontos. O conjunto de descontinuidades é \(\bigcup _{m\geq 1}D_m\) e, assim, é no máximo enumerável.

Proposição 6.11
Se \(a\lt b\), então \( \P (\xi \in (a, b]) = F (b) - F (a)\).

Demonstração

Como \(\{ \xi \leq b\} \) é a união disjunta de \(\{ \xi \leq a\} \) e \(\{ a\lt \xi \leq b\} \),

\[ F(b)=F(a)+\P (a\lt \xi \leq b), \]

o que prova a identidade.

Definição 6.12
Uma função \(F: \mathbb {R}\to [0, 1]\) tal que
  1. \(F\) é não-decrescente;

  2. \(F\) é contínua pela direita;

  3. \(\displaystyle \lim \limits _{x\to a^-}F(x)\) existe para todo \(a\in \mathbb {R}\) (possui limite pela esquerda);

  4. \(\displaystyle \lim \limits _{x\to +\infty } F(x)=1\) e \(\displaystyle \lim \limits _{x\to -\infty } F(x)=0\).

é chamada de candidata a função de distribuição de probabilidade.

As condições anteriores também são suficientes. A demonstração fará mais do que garantir existência: permitirá construir variáveis com distribuições prescritas num mesmo espaço de probabilidade. Essa escolha comum será útil para comparar sequências de variáveis.

Dada uma função \(F\) com as propriedades acima, construiremos uma variável aleatória \(X\) num espaço de probabilidade \((\Omega , \mathcal{F}, \P )\) tal que \(\P (X\leq x)=F(x),\) para todo \(x\in \mathbb {R}\).

Uma maneira interessante seria definir a variável \(X\) como uma função de alguma variável aleatória cuja distribuição seja conhecida. Tomemos, por exemplo, uma variável \(U\sim Uniforme(0,1)\), e tentemos escrever \(X=F^*(U)\) para alguma função \(F^*:(0,1)\to \mathbb {R}\).

Para escolher \(F^*\), lembre que o que gostaríamos é que \(\P (X\le x)=\P (F^*(U)\le x)=F(x)\).

Para isso note primeiro que, como \(F(x)\in [0,1]\), então \(\P (U\le F(x))=F(x)\). Ou seja, queremos \(F^*\) tal que

\[ \P (F^*(U)\le x)=\P (U\le F(x)). \]

Ou ainda, que \(F^*(u)\le x\Leftrightarrow u\le F(x)\).

Se \(F\) fosse inversível, poderíamos fazer \(F^*=F^{-1}\) e, como \(F\) é crescente teríamos que

\[ F^*(u)\le x\Leftrightarrow F(F^*(u))\le F(x)\Leftrightarrow u\le F(x). \]

Em geral \(F\) não é inversível, mas as considerações acima nos mostram que a chave para conseguir o que queremos ainda está em, de algum modo, “inverter” a função distribuição \(F:\mathbb {R}\to [0,1]\).

Como \(F\) é não decrescente, as dificuldades para uma inversão clássica se concentram em dois tipos de comportamento:

  1. intervalos \((a,b)\) onde a função é constante;

  2. pontos de descontinuidade de \(F\).

Não precisamos, porém, de uma inversa clássica. Basta uma função \(F^*:(0,1)\to \mathbb {R}\) que preserve a equivalência entre as desigualdades: \(F^*(\omega )\leq x\) se, e só se, \(F(x)\geq \omega \).

Uma maneira de resolver esse problema é tentar definir \(F^*\) de modo que

  1. se \(F\) é inversível em \((a,b)\) então queremos que \(F^*(\omega )=F^{-1}(\omega )\) em \(F((a,b))\);

  2. se \(F(x)=\omega \) para todo \(a\lt x\lt b\), então \(F^*\) é descontínua em \(\omega \);

  3. se \(F(x)\) é descontínua em \(x=x_0\) com \(\omega _1=\lim \limits _{x\to x_0^-}F(x)\lt F(x_0)=\omega _2\), então \(F^*(\omega )=x_0\) para \(\omega \in (\omega _1,\omega _2)\).

Essas ideias são melhor visualizadas na Figura 6.2.

Figura 6.2 Uma função de distribuição e sua inversa generalizada. Um salto de F produz um trecho constante em F^*, enquanto um trecho constante de F produz um salto em F^*.

Figura 6.2 Uma função de distribuição e sua inversa generalizada. Um salto de \(F\) produz um trecho constante em \(F^*\), enquanto um trecho constante de \(F\) produz um salto em \(F^*\).

Existem diversas formas de definir uma função \(F^*\) com tais propriedades, e a seguir apresentaremos uma das mais comuns.

Definição 6.13
Dada uma candidata a função de distribuição \(F:\mathbb {R}\to [0,1]\), definimos a inversa generalizada de \(F\) como a função \(F^*:(0,1)\to \mathbb {R}\) dada por
\[ F^*(\omega )=\inf \{ x\in \mathbb {R}: F(x) \geq \omega \} . \]

Apesar de não ser a inversa de \(F\), \(F^*\) ainda herda algumas propriedades de \(F\).

Proposição 6.14 (Propriedades da Inversa Generalizada)
Se \(F\) é uma candidata a função de distribuição e \(u\in (0,1)\), defina
\[ F^*(u):= \inf \{ x\in \mathbb {R}: F(x)\geq u\} . \]
A inversa generalizada satisfaz:
  1. \(F^*(u)=\sup \{ x\in \mathbb {R}:F(x)\lt u\} \);

  2. \(F^*\) é não decrescente;

  3. se \(0\lt F(x)\lt 1\), então \(F^*(F(x))\leq x\);

  4. \(F(F^*(u))\geq u\);

  5. \(F^*(u)\leq x\) se e somente se \(u\leq F(x)\).

Demonstração

Para \(u\in (0,1)\), o conjunto \(A_u=\{ x:F(x)\geq u\} \) é não vazio e limitado inferiormente, em virtude dos limites de \(F\) em \(\pm \infty \). Portanto, \(F^*(u)\) é um número real.

  1. Pela monotonicidade de \(F\), o complemento de \(A_u\) é \(B_u=\{ x:F(x)\lt u\} \), e todo elemento de \(B_u\) é menor que todo elemento de \(A_u\). Se \(a=\inf A_u\), então \(x\lt a\) implica \(x\in B_u\), enquanto \(x\gt a\) implica que existe \(z\in A_u\) com \(z\lt x\) e, pela monotonicidade, \(x\in A_u\). Logo \(\sup B_u=a=\inf A_u\).

  2. Se \(u_1\lt u_2\), então \(A_{u_2}\subseteq A_{u_1}\), de modo que \(F^*(u_1)\leq F^*(u_2)\).

  3. O ponto \(x\) pertence a \(A_{F(x)}\); portanto, o ínfimo desse conjunto é menor ou igual a \(x\).

  4. Ponha \(a=F^*(u)\). Para cada \(n\), escolha \(y_n\in A_u\) com \(a\leq y_n\lt a+1/n\) e defina \(x_n=\min \{ y_1,\ldots ,y_n\} \). Então \(x_n\downarrow a\), pois \(a\leq x_n\leq y_n\lt a+1/n\). Pela continuidade de \(F\) à direita,

    \[ F(a)=\lim _nF(x_n)\geq u. \]
  5. Se \(F^*(u)\leq x\), o item anterior e a monotonicidade dão \(u\leq F(F^*(u))\leq F(x)\). Reciprocamente, se \(u\leq F(x)\), então \(x\in A_u\) e, por definição, \(F^*(u)\leq x\).

Com isso, dada uma variável aleatória \(U\) definida em um espaço de probabilidade \((\Omega , \mathcal{F}, \P )\), e uniformemente distribuída no intervalo \((0,1)\), podemos definir a variável aleatória

\[ X=F^*(U), \]

e perceber que para \(x\in \mathbb {R}\) temos \(F(x)\in [0,1]\), e portanto

\[ \P (X\le x)=\P (F^*(U)\le x)=\P (U\le F(x))=F(x) \]

onde na última igualdade usamos que a probabilidade que a uniforme seja menor que \(y\) é \(y\), i.e., \(\P (U\leq y)=y\)

Mostramos assim o seguinte resultado.

Proposição 6.15 (Distribuição prescrita)
Dada uma candidata a função de distribuição \(F:\mathbb {R}\to [0,1]\), existe uma variável aleatória \(X\), definida em algum espaço de probabilidade \((\Omega ,\mathcal{F},\P )\), tal que
\[ \P (X\leq x)=F(x)\qquad \text{para todo }x\in \mathbb {R}. \]

Demonstração

Tome \(\Omega =(0,1)\), \(\mathcal{F}=\mathcal{B}((0,1))\), \(\P =\lambda |_{(0,1)}\) e \(U(\omega )=\omega \). Pelo item 5 da Proposição 6.14,

\[ \{ u\in (0,1):F^*(u)\leq x\} =(0,F(x)]\cap (0,1), \]

que é boreliano. Portanto, \(F^*\) é Borel mensurável e \(X=F^*(U)\) é uma variável aleatória. Novamente pelo mesmo item,

\[ \{ X\leq x\} =\{ F^*(U)\leq x\} =\{ U\leq F(x)\} . \]

Como \(U\) é uniforme em \((0,1)\),

\[ \P (X\leq x)=\P (U\leq F(x))=F(x) \]

para todo \(x\in \mathbb {R}\).

Portanto, toda candidata a função de distribuição é efetivamente a função de distribuição de alguma variável aleatória. A partir deste ponto, podemos usar simplesmente a expressão função de distribuição para funções com essas propriedades.

Resta examinar as descontinuidades de funções não decrescentes, como \(F\) e \(F^*\).

Proposição 6.16

Se \(f:I\to \mathbb {R}\) é uma função não decrescente definida em um intervalo \(I\subseteq \mathbb {R}\), então o conjunto \(D_f\) formado pelos pontos de descontinuidade de \(f\) é no máximo enumerável.

O mesmo resultado vale para \(f\) não-crescente.

Demonstração

Suponha primeiro que \(f\) seja não decrescente. Em todo ponto interior \(a\) de \(I\), os limites laterais

\[ f(a-)=\lim _{x\uparrow a}f(x) \quad \text{e}\quad f(a+)=\lim _{x\downarrow a}f(x) \]

existem. Se \(a\in D_f\) é interior a \(I\), então \(f(a-)\lt f(a+)\); logo o intervalo \(I_a=(f(a-),f(a+))\) é não vazio.

Se \(a_1\lt a_2\), então \(f(a_1+)\leq f(a_2-)\), de modo que \(I_{a_1}\) e \(I_{a_2}\) são disjuntos. Escolha um racional \(r(a)\in I_a\) para cada ponto de descontinuidade interior. O mapa \(a\mapsto r(a)\) é injetivo e toma valores em \(\mathbb {Q}\); portanto há no máximo um número enumerável desses pontos. Os extremos de \(I\), quando pertencem a \(I\), acrescentam no máximo dois pontos.

Para uma função não crescente, aplique o resultado a \(-f\).

Corolário 6.17
Dadas uma função de distribuição \(F\) e sua inversa generalizada \(F^*\), os conjuntos de pontos de descontinuidade de \(F\) e de \(F^*\) são, no máximo, enumeráveis.

Demonstração

As funções \(F\) e \(F^*\) são não decrescentes; basta aplicar a proposição anterior a cada uma delas.

Encerramos a seção fixando a terminologia para variáveis com a mesma distribuição.

Definição 6.18 (Variáveis Aleatórias Identicamente Distribuídas)
Duas variáveis aleatórias \( \xi \) e \( \eta \) são ditas identicamente distribuídas se
\[ \P (\xi \leq x) = \P (\eta \leq x) \quad \text{ para todo } x \in \mathbb {R}. \]

6.3 Tipos de Distribuições

Definição 6.19
Uma função de distribuição \(F\) é dita
  1. discreta se existem um conjunto enumerável de números reais \(\{ x_j\} \) e massas pontuais \(p_j\geq 0\), com \(\sum _jp_j=1\), tais que

    \[ F(x)=\sum _{x_j\leq x}p_j\quad \text{ para todo } x\in \mathbb {R} \]
  2. contínua se for contínua para todo \(x .\)

  3. absolutamente contínua se existe uma função \(f\) não negativa Lebesgue integrável tal que

    \[ F(b)-F(a)=\displaystyle \int _a^b f(x)dx \text{ para todo } a\lt b \]
  4. singular contínua se \(F\) é contínua e \(F'\) existe e é igual a \(0\) em quase todo ponto, com respeito à medida de Lebesgue.

Temos o seguinte Teorema de decomposição

Teorema 6.20 (Decomposição de Distribuição)

Toda função de distribuição pode ser decomposta em uma combinação convexa de três tipos puros, discretas, absolutamente contínuas, e contínuas singulares. Assim, se F é uma função de distribuição, então

\[ F = \alpha F_{ac} + \beta F_d + \gamma F_s, \]

onde \(\alpha ,\beta ,\gamma \geq 0\) e \(\alpha +\beta +\gamma =1\).

  • \(F_{ac}(x)=\displaystyle \int _{-\infty }^x f(y)\, \d y\), com \(f=F'_{ac}\) em quase todo ponto;

  • \(F_d\) é uma função de saltos com no máximo um número enumerável de saltos;

  • \(F_s\) é singular contínua.

Componentes com coeficiente zero podem ser omitidas.

Demonstração

Pelo Teorema 6.21, demonstrado a seguir, existem \(\delta \in [0,1]\) e funções de distribuição \(F_d\) e \(F_c\), respectivamente discreta e contínua, tais que

\[ F=\delta F_d+(1-\delta )F_c. \]

Pelo Teorema 6.22, também demonstrado abaixo, existem \(r,s\geq 0\), com \(r+s=1\), e funções de distribuição \(F_{ac}\) e \(F_s\), respectivamente absolutamente contínua e singular contínua, tais que \(F_c=rF_{ac}+sF_s\). Portanto,

\[ F=(1-\delta )rF_{ac}+\delta F_d+(1-\delta )sF_s. \]

Os três coeficientes são não negativos e somam \(1\), como desejado.

Começaremos provando que toda distribuição pode ser decomposta como soma de uma discreta e uma contínua.

Teorema 6.21
Toda função de distribuição pode ser decomposta em uma combinação convexa de uma discreta e uma contínua. Assim, se \(F\) é uma função de distribuição, então
\[ F = \alpha F_{c} + \beta F_d \]
onde \(\alpha ,\beta \geq 0\) e \(\alpha +\beta =1\).

Demonstração

Seja \(\nu \) a medida de probabilidade cuja função de distribuição é \(F\). Já provamos que \(F\) possui no máximo um número enumerável de saltos; enumere seus pontos como \(\{ x_j\} _{j\geq 1}\) e defina

\[ p_j=F(x_j)-F(x_j^-)=\nu (\{ x_j\} ). \]

A série \(\sum _jp_j\) é no máximo \(1\). A fórmula

\[ \nu _d(A)=\sum _{j:x_j\in A}p_j,\qquad A\in \mathcal{B}(\mathbb {R}), \]

define uma medida finita e discreta. Além disso, \(\nu _d\leq \nu \): para um conjunto \(A\) e um subconjunto finito \(J\) dos índices com \(x_j\in A\),

\[ \sum _{j\in J}p_j =\nu \left(\bigcup _{j\in J}\{ x_j\} \right)\leq \nu (A), \]

e basta fazer os subconjuntos finitos crescerem. Logo \(\nu _c:=\nu -\nu _d\) é também uma medida finita e positiva.

Ponha \(\beta =\nu _d(\mathbb {R})\) e \(\alpha =\nu _c(\mathbb {R})=1-\beta \). Se \(\beta \gt 0\), normalize \(\nu _d/\beta \) e denote sua função de distribuição por \(F_d\); se \(\beta =0\), escolha qualquer função de distribuição discreta para \(F_d\). Analogamente, se \(\alpha \gt 0\), normalize \(\nu _c/\alpha \) e denote sua função de distribuição por \(F_c\). A medida \(\nu _c\) não possui átomos, pois retiramos precisamente todas as massas pontuais de \(\nu \). Assim,

\[ F_c(x)-F_c(x^-)=\frac{\nu _c(\{ x\} )}{\alpha }=0 \]

quando \(\alpha \gt 0\); pela continuidade à direita, \(F_c\) é contínua. Se \(\alpha =0\), escolha qualquer função de distribuição contínua para \(F_c\). Finalmente,

\[ F(x)=\nu ((-\infty ,x]) =\alpha F_c(x)+\beta F_d(x), \]

e \(\alpha +\beta =1\).

Teorema 6.22

Toda função de distribuição contínua pode ser decomposta em uma combinação convexa de uma absolutamente contínua e uma contínua singular. Assim, se \(F\) é uma função de distribuição contínua, então

\[ F = \alpha F_{ac} + \beta F_s \]

onde \(\alpha ,\beta \geq 0\) e \(\alpha +\beta =1\). Componentes com coeficiente zero podem ser omitidas.

Para a demonstração desse teorema usaremos a seguinte ferramenta de análise real.

Teorema de diferenciação para funções monótonas. Se \(G\) é não decrescente em \([a,b]\), então \(G'\) existe e é não negativa quase certamente, e

\[ \int _a^b G'(x)\, \d x\leq G(b)-G(a). \]

Além disso, se \(g\) é integrável em \(\mathbb {R}\), a função \(x\mapsto \int _{-\infty }^xg(y)\, \d y\) é absolutamente contínua em intervalos compactos e tem derivada \(g\) quase certamente.

Esse é um resultado avançado de análise real, baseado no lema de cobertura de Vitali e no Teorema Fundamental do Cálculo de Lebesgue. Usaremos esse resultado sem demonstração.

Demonstração

Aplique o teorema de diferenciação a \(F\) em cada intervalo compacto e defina \(g=F'\) nos pontos em que a derivada existe, tomando \(g=0\) no conjunto excepcional. Então \(g\geq 0\) e, para \(a\lt b\),

\[ \int _a^b g(y)\, \d y\leq F(b)-F(a). \]

Em particular, fazendo \(a=-n\), \(b=n\) e usando o Teorema da Convergência Monótona, vemos que \(g\) é integrável em \(\mathbb {R}\) e \(\alpha :=\int _{\mathbb {R}}g\, \d\lambda \leq 1\). Ponha

\[ G(x)=\int _{-\infty }^xg(y)\, \d y, \qquad H(x)=F(x)-G(x), \qquad \beta =1-\alpha . \]

A função \(G\) é contínua e não decrescente. A desigualdade acima mostra que, se \(a\lt b\),

\[ H(b)-H(a) =F(b)-F(a)-\int _a^b g(y)\, \d y\geq 0. \]

Como \(F\) é contínua, \(H\) também é contínua. Além disso,

\[ G(-\infty )=H(-\infty )=0,\qquad G(+\infty )=\alpha ,\qquad H(+\infty )=\beta . \]

Se \(\alpha \gt 0\), a função \(F_{ac}=G/\alpha \) é uma função de distribuição absolutamente contínua. Se \(\beta \gt 0\), a função \(F_s=H/\beta \) é uma função de distribuição contínua e

\[ F_s'=\frac{F'-G'}{\beta }=\frac{g-g}{\beta }=0 \quad \text{quase certamente}; \]

logo ela é singular contínua. Desse modo, \(F=\alpha F_{ac}+\beta F_s\). Quando um coeficiente é zero, a componente correspondente é simplesmente omitida.

6.3.1 Distribuições Discretas

Seja \( \xi \) uma variável aleatória com a função de distribuição \( F \) (com probabilidade induzida \( \P \)).

Definição 6.23
A distribuição de \( \xi \) (e \( \xi \) em si) é dita discreta se existir um conjunto enumerável \( S \) tal que
\[ \P (\xi \in S)=1. \]

Podemos enumerar o conjunto \(S\), escrevendo \( S = \{ x_1, x_2, \ldots \} \), e definimos \( p_k: = \P (\xi = x_k) .\) Então temos

\[ F (x) = \sum _{k: \ x_k \leq x} p_k, \]

e esta é uma soma sobre um conjunto enumerável. Estes \( p_k \) às vezes são denominados massas pontuais.

  1. Massa de um ponto em zero:

    \[ \P (\xi = 0) = 1. \]

    Portanto, a função de distribuição \( F \) é:

    \[ F (x) = \left\{ \begin{array}{ll} 0 & , x \lt 0 \\ 1 & , x \geq 0 \end{array} \right. \]

    A distribuição correspondente é a medida de Dirac no \(0\).

  2. Qualquer variável aleatória simples é discreta. Uma variável aleatória simples é uma variável aleatória que toma um número finito de valores.

  3. Uma distribuição discreta não precisa manter seus átomos afastados: podemos tomar \( S = \mathbb {Q}\) e atribuir massas positivas que somem \( 1 \), por exemplo, \( p_k = \frac1{2 ^k} \), após enumerar os racionais. A distribuição é discreta; o conjunto de seus átomos não tem a mesma obrigação.

Algumas Distribuições Discretas

DistribuiçãoNotaçãoFunção de ProbabilidadeDomínio
Um ponto$\delta_a$$p(a)=1$$\{a\}$
Uniforme Discreta$\mathrm{Unif}\{x_1,\ldots,x_n\}$$p(x_i)=\frac{1}{n}$$\{x_1,\ldots,x_n\}$
Bernoulli$\operatorname{Be}(p)$$p(0)=q$, $p(1)=p$$\{0,1\}$
Binomial$\operatorname{Bin}(n,p)$$p(k)=\binom nkp^kq^{n-k}$$k=0,1,\dots,n$
Geométrica (fracassos)$\operatorname{Ge}_0(p)$$p(k)=pq^k$$k\in\N_0$
Primeiro Sucesso$\operatorname{Ge}_1(p)$$p(k)=pq^{k-1}$$k\in\N$
Poisson$\operatorname{Po}(\lambda)$$p(k)=e^{-\lambda}\frac{\lambda^k}{k!}$$k\in\N_0$

A distribuição uniforme discreta assume os valores \(x_1,\dots x_n\) e \(p(x_i)=\dfrac {1}{n} .\) Aqui e nas linhas seguintes, \(q=1-p\). A distribuição \(\operatorname {Be}(p)\) descreve o resultado de um experimento de lançamento de moeda (não necessariamente honesta), e a distribuição \(\operatorname {Bin}(n,p)\) descreve o número de sucessos em \(n\) lançamentos. A distribuição \(\operatorname {Ge}_0(p)\) descreve o número de fracassos antes do primeiro sucesso, enquanto \(\operatorname {Ge}_1(p)\) descreve o número de lançamentos necessários até o primeiro sucesso.

A distribuição de Poisson surge como o limite da distribuição binomial quando \(n \to \infty \) e \(p \to 0\) e \(np \to \lambda .\)

Teorema 6.24 (Teorema Limite de Poisson)
Se \(p_n\in [0,1]\) e \(np_n\rightarrow \lambda \geq 0\), então, para cada \(k\in \mathbb {N}_0\) fixo,
\[ \binom nk p_n^k (1-p_n)^{n-k} \longrightarrow e^{-\lambda }\dfrac {\lambda ^k}{k!}. \]

Demonstração

Para \(n\) suficientemente grande, temos \(n\geq k\) e \(p_n\lt 1\), e então

\[ \binom nk p_n^k(1-p_n)^{n-k} = \frac{n(n-1)\cdots (n-k+1)}{n^k} \frac{(np_n)^k}{k!} (1-p_n)^n(1-p_n)^{-k}. \]

Os dois primeiros fatores convergem, respectivamente, para \(1\) e \(\lambda ^k/k!\), e o último converge para \(1\). Como \(p_n\to 0\),

\[ n\log (1-p_n) =-(np_n)\frac{-\log (1-p_n)}{p_n} \longrightarrow -\lambda , \]

com a razão interpretada por continuidade quando \(p_n=0\). Logo \((1-p_n)^n\to e^{-\lambda }\), e o produto dos quatro limites dá a conclusão. Quando \(k=0\), usa-se a convenção \(\lambda ^0=1\), inclusive para \(\lambda =0\).

6.3.2 Distribuições Absolutamente Contínuas

A distribuição de \(\xi \) é absolutamente contínua se existir uma função \(f\), denominada densidade de \(\xi \), tal que

\[ F (x) = \displaystyle \int _{- \infty } ^x f (y) \ dy \qquad \text{para cada} x. \]

Claramente, é necessário que \( f \geq 0 \) e que

\[ \displaystyle \int _{- \infty } ^\infty f (x) \ dx = 1. \]

Figura 6.3 A probabilidade de um intervalo é a área sob a densidade nesse intervalo.

Figura 6.3 A probabilidade de um intervalo é a área sob a densidade nesse intervalo.
  • Em particular, se \( f \) for contínua, então

    \[ F '(x) = f (x), \]

    ou seja, é a derivada de uma função de distribuição.

  • Então, podemos dizer

    \[ \P (\xi \in (a, b]) = F (b) - F (a) = \displaystyle \int _a ^b f (x) \ dx. \]
  • Alternativamente, podemos começar com uma função \( f \) tal que

    \[ f \geq 0 \qquad \text{e} \qquad \displaystyle \int _{- \infty } ^\infty f (x) \ dx = 1, \]

    e definir a função de distribuição pela fórmula

    \[ F (x): = \displaystyle \int _{- \infty } ^x f (y) \ dy. \]

Exemplo 6.25 (XKCD)

Alice secretamente escolhe dois números reais diferentes por um processo desconhecido e os coloca em dois envelopes. Bob escolhe um dos dois envelopes aleatoriamente (com um lançamento de uma moeda justa) e mostra o número desse envelope. Agora você deve adivinhar se o número no outro envelope fechado é maior ou menor que o que você viu.

Existe uma estratégia que lhe dê uma chance melhor do que 50% de adivinhar corretamente, não importando o procedimento que Alice usasse para escolher seus números?

Solução:

Antes de abrir qualquer envelope, você escolhe um número \(r\) de forma aleatória, independentemente da escolha de Bob, usando uma distribuição absolutamente contínua que dê probabilidade positiva a todo intervalo aberto; a distribuição normal padrão é um exemplo. Vamos chamar de \(x\) o número do envelope aberto por Bob.

A estratégia agora é: se \(r \lt x\), então você prevê que o número oculto \(y\) é menor que \(x\); Caso contrário, você adivinha que \(y\) é maior do que \(x .\)

Para ver por que a estratégia é vencedora, denote os dois números de Alice por \(a\lt b\) e ponha \(\varepsilon =\P (a\lt r\lt b)\gt 0\). Existem três casos:

  • Se \(r\lt a\), a regra sempre prevê que o número oculto é menor. Ela acerta exatamente quando Bob mostra \(b\), o que ocorre com probabilidade \(1/2\).

  • Se \(r\gt b\), a regra sempre prevê que o número oculto é maior. Ela acerta exatamente quando Bob mostra \(a\), novamente com probabilidade \(1/2\).

  • Se \(a\lt r\lt b\), a regra acerta qualquer que seja o envelope mostrado.

Portanto, a probabilidade de vitória é

\[ \frac12(1-\varepsilon )+\varepsilon =\frac{1+\varepsilon }{2}\gt \frac12. \]

O número auxiliar não precisa adivinhar os de Alice: basta ter uma chance positiva de cair entre eles.

Distribuição Uniforme Contínua

Uma variável aleatória \(\xi \) tem distribuição uniforme no intervalo \([a,b]\), para \(a\lt b\), se sua lei é absolutamente contínua e sua densidade é

\[ f(x)= \begin{cases} \frac1{b-a}, & \textrm{ se } x\in [a,b]\\ 0 & \textrm{caso contr\'ario} \end{cases} \]

e denotamos esse fato por \(\xi \sim \mathrm{Uniforme}([a,b]) .\)

Nesse caso, a probabilidade de \(\xi \) estar num subintervalo de \([a,b]\) é proporcional ao comprimento de tal subintervalo; de fato, para \(a\leq y\lt z\leq b\),

\[ \P (y\leq \xi \leq z) = \displaystyle \int _y^z \frac1{b-a}\, \mathrm{d}x = \frac{z-y}{b-a}. \]

Distribuição Exponencial

Uma variável aleatória \(\xi \) tem distribuição exponencial com parâmetro \(\lambda \gt 0\), e denotamos esse fato por

\[ \xi \sim \mathrm{Exponencial}(\lambda ) \]

se sua função de densidade é

\[ f_\xi (x)= \begin{cases} \lambda \mathrm{e}^{-\lambda x}, & \textrm{ se } x\geq 0\\ 0 & \textrm{caso contr\'ario.} \end{cases} \]

A função de distribuição é

\[ F_\xi (t)= \begin{cases} 0, & t\lt 0,\\ 1-\mathrm{e}^{-\lambda t}, & t\geq 0. \end{cases} \]

Portanto, \(\P (\xi \gt a) = \mathrm{e}^{-\lambda a}\) para \(a\geq 0\).

Distribuição Normal

Sejam \(\mu \in \mathbb {R}\) e \(\sigma \gt 0\). A variável aleatória \(\xi \) possui distribuição normal com média \(\mu \) e variância \(\sigma ^2\), abreviado por \(\xi \sim \mathcal{N}(\mu ;\sigma ^2)\), se sua densidade é dada por

\[ f_\xi (x) = \frac1{\sigma \sqrt{2\pi }} \mathrm{e}^{-\frac{(x-\mu )^2}{2\sigma ^2}}, \qquad x\in \mathbb {R}. \]

Em particular, a distribuição normal padrão \(\mathcal{N}(0;1)\) tem densidade

\[ \varphi (x)=\frac{1}{\sqrt{2\pi }}\, \mathrm e^{-x^2/2}. \]

6.3.3 Distribuições Singulares

Distribuição uniforme no conjunto de Cantor

Seja \(\mathscr K\) a família das uniões finitas de intervalos compactos disjuntos de \([0,1]\). Para \(A=\bigcup _{i=1}^m[a_i,b_i]\in \mathscr K\), defina

\[ \Phi (A)=\bigcup _{i=1}^m \left( \left[a_i,\frac{2a_i+b_i}{3}\right] \cup \left[\frac{a_i+2b_i}{3},b_i\right] \right). \]

Em cada componente, \(\Phi \) remove o terço central. Portanto,

\begin{equation} \lambda (\Phi ^n(A))=\left(\frac23\right)^n\lambda (A). \label{areaphi} \tag{6.3} \end{equation}

Para \(n\geq 0\), defina \(C_n=\Phi ^n([0,1])\). Os conjuntos \(C_n\) são compactos, \(C_{n+1}\subset C_n\) e \(\lambda (C_n)=(2/3)^n\). O conjunto de Cantor é

\[ C=\bigcap _{n=0}^{\infty }C_n. \]

Pela continuidade por cima da medida de Lebesgue, \(\lambda (C)=\lim _n\lambda (C_n)=0\).

Observação 6.26
Geometricamente, começamos removendo \((1/3,2/3)\) de \([0,1]\) e, em seguida, removemos o terço central de cada intervalo remanescente. Assim,
\begin{align*} C_0 & = [0,1],\\ C_1 & = [0,1/3]\cup [2/3,1],\\ C_2 & = [0,1/9]\cup [2/9,1/3]\cup [2/3,7/9]\cup [8/9,1]. \end{align*}
Equivalentemente, usando uma das duas expansões ternárias nos pontos que as possuem,
\[ C=\left\{ x\in [0,1]: x=\sum _{i=1}^{\infty }\frac{a_i}{3^i}, \ a_i\in \{ 0,2\} \right\} . \]

Figura 6.4 As quatro primeiras etapas da construção do conjunto de Cantor.

Figura 6.4 As quatro primeiras etapas da construção do conjunto de Cantor.

Agora construiremos uma função de distribuição que cresce sobre o conjunto de Cantor e permanece constante nos intervalos removidos. Defina

\[ f_n(x)=\left(\frac32\right)^n\mathbb {1}_{C_n}(x), \qquad F_n(x)=\int _{-\infty }^x f_n(t)\, \d t, \]

e seja \(\nu _n\) a probabilidade com densidade \(f_n\). Se \(\mathcal I_n\) denota a coleção dos \(2^n\) intervalos componentes de \(C_n\), então cada \(J\in \mathcal I_n\) tem comprimento \(3^{-n}\) e

\[ \nu _n(J)=\left(\frac32\right)^n3^{-n}=2^{-n}. \]

Mais geralmente, para \(k\geq 0\),

\[ \nu _{n+k}(J) =\left(\frac32\right)^{n+k} \lambda \bigl(C_{n+k}\cap J\bigr) =\left(\frac32\right)^{n+k}3^{-n}\left(\frac23\right)^k =2^{-n}. \]

Fixados \(x\in \mathbb {R}\) e \(k\geq 0\), todos os componentes de \(\mathcal I_n\) inteiramente à esquerda de \(x\) dão a mesma contribuição a \(F_n(x)\) e \(F_{n+k}(x)\). Há no máximo um componente de nível \(n\) cortado pelo ponto \(x\), e a massa que cada uma das duas probabilidades atribui a esse componente é no máximo \(2^{-n}\). Consequentemente,

\[ \sup _{x\in \mathbb {R}}|F_{n+k}(x)-F_n(x)|\leq 2^{1-n}. \]

Logo \((F_n)\) é uniformemente de Cauchy. Seu limite uniforme \(F\) é contínuo, não decrescente, vale \(0\) à esquerda de \(0\) e vale \(1\) à direita de \(1\); portanto, é uma função de distribuição.

Figura 6.5 Aproximação de terceira ordem da função de Cantor; os refinamentos convergem uniformemente para a função singular contínua.

Figura 6.5 Aproximação de terceira ordem da função de Cantor; os refinamentos convergem uniformemente para a função singular contínua.

Cada componente de \([0,1]\setminus C\) foi removida em alguma etapa. A partir dessa etapa, todas as funções \(F_n\) são constantes nessa componente, e o mesmo vale para \(F\). Como \(\lambda (C)=0\), segue que \(F'=0\) quase certamente. Assim, \(F\) é uma função de distribuição singular contínua. Ela não pode ter densidade: se \(F(x)=\int _{-\infty }^x h(t)\, \d t\), então \(h=F'=0\) quase certamente, o que contradiz \(\int _{\mathbb {R}} h\, \d\lambda =1\).

A construção probabilística correspondente, por lançamentos de moedas, é desenvolvida no Exercício 6.6, ao final do capítulo.

Outros exemplos selvagens

Exemplo 6.27 (Uma densidade uniforme nos irracionais)
A função
\[ f(x)= \begin{cases} 1, & x\in [0,1]\setminus \mathbb {Q}, \\ 0, & \text{caso contrário}, \end{cases} \]
é uma densidade. Como ela coincide quase certamente com \(\mathbb {1}_{[0,1]}\), a distribuição correspondente é simplesmente a uniforme em \([0,1]\). Este exemplo ilustra que uma densidade só é determinada quase certamente.

Exemplo 6.28

Dada uma enumeração \(\{ r_k\} _{k\geq 1}\) dos racionais, defina a função de massa

\[ p(x)= \begin{cases} \frac{6}{\pi ^2 k^2}, & x=r_k,\\ 0, & x\notin \mathbb {Q}. \end{cases} \]

Como \(\sum _{k=1}^\infty 1/k^2=\pi ^2/6\), temos \(\sum _{x\in \mathbb {R}}p(x)=1\); portanto, \(p\) define uma distribuição discreta concentrada em \(\mathbb {Q}\).

Exercício 6.1

Variáveis aleatórias discretas independentes. Sejam \(X\) e \(Y\) variáveis aleatórias independentes com valores inteiros.

  1. Prove que, para todo \(n\in \mathbb {Z}\),

    \[ \P (X+Y=n) =\sum _{k\in \mathbb {Z}}\P (X=k)\P (Y=n-k). \]
  2. Se \(X\sim \operatorname {Poisson}(\lambda )\) e \(Y\sim \operatorname {Poisson}(\mu )\), determine a distribuição de \(X+Y\).

  3. Se \(X\sim \operatorname {Binomial}(n,p)\) e \(Y\sim \operatorname {Binomial}(m,p)\), determine a distribuição de \(X+Y\).

Ver solução
Os eventos \(\{ X=k,Y=n-k\} \) são disjuntos e cobrem \(\{ X+Y=n\} \); a independência dá
\[ \P (X+Y=n)=\sum _{k\in \mathbb {Z}}\P (X=k)\P (Y=n-k). \]
Substituindo as massas de Poisson e usando o binômio de Newton, obtemos
\[ \P (X+Y=r)=e^{-(\lambda +\mu )}\frac{(\lambda +\mu )^r}{r!}, \]
logo \(X+Y\sim \operatorname {Poisson}(\lambda +\mu )\). Para as binomiais, a identidade de Vandermonde (ou a interpretação como soma de ensaios de Bernoulli) dá \(X+Y\sim \operatorname {Binomial}(n+m,p)\).
Exercício 6.2

A lei de uma variável aleatória. Seja \(X:(\Omega ,\mathcal F,\P )\to \mathbb {R}\) uma variável aleatória. Para \(A\in \mathcal B(\mathbb {R})\), defina

\[ P_X(A)=\P (X\in A) =\P \bigl(\{ \omega \in \Omega :X(\omega )\in A\} \bigr). \]

Prove diretamente que \(P_X\) é uma medida de probabilidade em \((\mathbb {R},\mathcal B(\mathbb {R}))\).

Ver solução
Como \(X\) é mensurável, \(P_X(A)\) está definida para todo boreliano. Além disso, \(P_X(\varnothing )=0\) e \(P_X(\mathbb {R})=1\). Se \(A_j\) são disjuntos, também o são \(X^{-1}(A_j)\) e
\[ P_X\left(\bigsqcup _jA_j\right) =\P \left(\bigsqcup _jX^{-1}(A_j)\right) =\sum _jP_X(A_j). \]
Logo \(P_X\) é uma probabilidade.
Exercício 6.3

Seja \(F:\mathbb {R}\to [0,1]\) uma função não decrescente, contínua à direita e tal que

\[ \lim _{x\to -\infty }F(x)=0, \qquad \lim _{x\to +\infty }F(x)=1. \]

Construa explicitamente um espaço de probabilidade e uma variável aleatória \(X\) cuja função de distribuição seja \(F\).

Dica. Tome uma variável uniforme \(U\) em \((0,1)\) e use uma inversa generalizada de \(F\).

Ver solução
No espaço \(((0,1),\mathcal B,\lambda )\), tome \(U(u)=u\) e
\[ X=F^{-1}(U),\qquad F^{-1}(v)=\inf \{ x:F(x)\geq v\} . \]
Essa inversa é crescente, logo mensurável, e \(\{ F^{-1}(U)\leq x\} =\{ U\leq F(x)\} \) (a continuidade à direita resolve os pontos de salto). Portanto \(\P (X\leq x)=\P (U\leq F(x))=F(x)\).
Exercício 6.4

Sejam \(Y_1,Y_2,\ldots \) variáveis aleatórias independentes, com

\[ \P (Y_k=0)=\P (Y_k=1)=\frac12, \qquad k\geq 1, \]

e defina

\[ U=\sum _{k=1}^{\infty }2^{-k}Y_k. \]
  1. Mostre que a série converge para um valor em \([0,1]\).

  2. Para \(U_n=\sum _{k=1}^{n}2^{-k}Y_k\), calcule a função de distribuição de \(U_n\) nos pontos diádicos.

  3. Passando ao limite, prove que \(U\) possui distribuição uniforme em \([0,1]\). Explique por que a dupla representação binária dos racionais diádicos não altera a conclusão.

Ver solução
A série converge absolutamente e fica entre \(0\) e \(\sum _{k\geq 1}2^{-k}=1\). Cada uma das \(2^n\) configurações iniciais tem probabilidade \(2^{-n}\), de modo que \(U_n\) assume os valores \(i2^{-n}\), \(i=0,\ldots ,2^n-1\), todos com massa \(2^{-n}\), e
\[ \P \bigl(U_n\leq i2^{-n}\bigr)=(i+1)2^{-n}, \qquad i=0,\ldots ,2^n-1 . \]
Como \(0\leq U-U_n\leq 2^{-n}\) e o evento \(U-U_n=2^{-n}\) (todos os dígitos seguintes iguais a \(1\)) tem probabilidade zero, segue que, para \(j=0,\ldots ,2^n\),
\[ \P (U\lt j2^{-n})=\P \bigl(U_n\leq (j-1)2^{-n}\bigr)=j2^{-n}. \]
Passando ao limite e aproximando qualquer \(x\in [0,1]\) por diádicos, \(\P (U\leq x)=x\). As duas expansões de um diádico correspondem a uma cauda eventualmente toda \(0\) ou toda \(1\); cada evento tem probabilidade zero, por isso a ambiguidade não altera a lei.
Exercício 6.5

Escreva

\[ X=X^+-X^-, \qquad Y=Y^+-Y^-. \]

Prove, usando apenas transformações mensuráveis, que

\[ X\overset {\mathrm d}=Y \quad \Longrightarrow \quad X^+\overset {\mathrm d}=Y^+ \quad \text{e}\quad X^-\overset {\mathrm d}=Y^-. \]
Ver solução
As funções \(g_+(x)=x^+=\max \{ x,0\} \) e \(g_-(x)=x^-=\max \{ -x,0\} \) são contínuas. Para todo boreliano \(B\),
\[ \P (g_\pm (X)\in B)=\P (X\in g_\pm ^{-1}(B)) =\P (Y\in g_\pm ^{-1}(B))=\P (g_\pm (Y)\in B). \]
Exercício 6.6 (difficulty=1)

Outra construção da distribuição de Cantor. Sejam \(Y_1,Y_2,\ldots \) como no exercício da expansão binária e defina

\[ Y=\sum _{n=1}^{\infty }\frac{2Y_n}{3^n}. \]
  1. Prove que \(Y\) toma valores no conjunto de Cantor e que sua função de distribuição \(F_Y\) é contínua.

  2. Mostre que \(F_Y\) é constante em cada componente conexa de \([0,1]\setminus C\), onde \(C\) é o conjunto de Cantor. Conclua que \(F_Y'(x)=0\) para Lebesgue-quase todo \(x\).

  3. Seja \(\mu _Y\) a lei de \(Y\) e \(\lambda \) a medida de Lebesgue. Prove que \(\mu _Y\) e \(\lambda \) são mutuamente singulares, isto é, encontre um boreliano \(A\) tal que \(\lambda (A)=0\) e \(\mu _Y(A^c)=0\).

Ver solução
A série converge absolutamente e sua expansão ternária usa somente \(0\) e \(2\), logo \(Y\in C\). Para todo \(y\), o evento \(\{ Y=y\} \) fixa uma sequência infinita de dígitos (no máximo duas nas ambiguidades) e tem probabilidade zero; portanto \(F_Y\) não tem saltos e é contínua. Em cada intervalo removido na construção de \(C\) não há massa, de modo que \(F_Y\) é constante; como \([0,1]\setminus C\) tem medida de Lebesgue um, \(F_Y'=0\) quase em toda parte. Por fim, escolha \(A=C\): \(\lambda (C)=0\) e \(\mu _Y(C^c)=\P (Y\notin C)=0\), provando singularidade mútua.
Exercício 6.7

Recorde que uma variável aleatória \(Y\) é estocasticamente maior do que \(X\) quando

\[ \P (X\leq x)\geq \P (Y\leq x) \qquad \text{para todo }x\in \mathbb {R}. \]

Prove que essa relação vale se, e somente se, existem variáveis \(X^*\) e \(Y^*\), definidas no mesmo espaço de probabilidade, tais que

\[ X^*\overset {\mathrm d}=X, \qquad Y^*\overset {\mathrm d}=Y, \qquad X^*\leq Y^*\quad \text{quase certamente}. \]

Dica. Para uma das implicações, use o mesmo uniforme nas inversas generalizadas das duas funções de distribuição.

Ver solução
Se existe o acoplamento ordenado, então \(\{ Y^*\leq x\} \subseteq \{ X^*\leq x\} \) e, portanto, \(F_X(x)\geq F_Y(x)\). Reciprocamente, tome um único \(U\sim U(0,1)\) e ponha \(X^*=F_X^{-1}(U)\), \(Y^*=F_Y^{-1}(U)\). A desigualdade entre as funções de distribuição implica \(F_X^{-1}(u)\leq F_Y^{-1}(u)\) para todo \(u\), e a construção por quantis preserva as leis marginais.
Exercício 6.8

Convenções para a inversa generalizada. Seja \(F\) uma função de distribuição e, para \(t\in (0,1)\), defina

\begin{align*} F^{-1}_1(t)& =\sup \{ y\in \mathbb {R}:F(y)\lt t\} ,& F^{-1}_2(t)& =\inf \{ y\in \mathbb {R}:F(y)\geq t\} ,\\ F^{-1}_3(t)& =\inf \{ y\in \mathbb {R}:F(y)\gt t\} ,& F^{-1}_4(t)& =\sup \{ y\in \mathbb {R}:F(y)\leq t\} . \end{align*}

Prove que \(F^{-1}_1=F^{-1}_2\) e que \(F^{-1}_3=F^{-1}_4\). Dê um exemplo de função de distribuição e de \(t\in (0,1)\) para os quais \(F^{-1}_1(t)\neq F^{-1}_3(t)\).

Ver solução

Para um conjunto não vazio \(S_t=\{ y:F(y)\geq t\} \), monotonicidade e continuidade à direita mostram que sua extremidade esquerda é simultaneamente \(\inf S_t\) e \(\sup \{ y:F(y)\lt t\} \); logo \(F_1^{-1}=F_2^{-1}\). Aplicando o mesmo argumento a \(\{ F\gt t\} \) obtém-se \(F_3^{-1}=F_4^{-1}\).

Se \(X\) é Bernoulli\((1/2)\) em \(\{ 0,1\} \) e \(t=1/2\), então \(F_1^{-1}(t)=F_2^{-1}(t)=0\), enquanto \(F_3^{-1}(t)=F_4^{-1}(t)=1\).