Capítulo 5

Variáveis aleatórias contínuas

No capítulo anterior, as probabilidades eram calculadas por somas de massas concentradas em pontos. Nos modelos contínuos aqui estudados, usados para representar grandezas como tempo, comprimento, massa e temperatura, os valores isolados têm probabilidade zero. A probabilidade de um intervalo é obtida integrando uma densidade:

\[ \P (a\leq X\leq b)=\int _a^b f(x)\, dx. \]

Por isso, para variáveis contínuas, incluir ou não os extremos não altera a probabilidade.

O valor \(f_X(x)\) representa uma altura no gráfico da densidade, e não a probabilidade do ponto \(x\). As probabilidades correspondem a áreas sob esse gráfico. Uma densidade pode, portanto, ser maior que \(1\): se \(X\sim \operatorname {Unif}(0,1/2)\), então \(f_X=2\) no intervalo, mas

\[ \P (0\leq X\leq 1/4)=2\cdot \frac14=\frac12. \]

A escolha da distribuição depende das características do fenômeno. A uniforme representa a simetria entre subintervalos de mesmo comprimento; a exponencial é usada para tempos de espera com taxa constante; a normal, para grandezas formadas pela soma de muitos pequenos efeitos; e a gama, entre outras aplicações, para tempos até várias ocorrências sucessivas.

5.1 Distribuição Uniforme Contínua

Se todos os subintervalos de mesmo comprimento devem ter a mesma probabilidade, a densidade precisa ser constante. Dizemos que \(X\) tem distribuição uniforme no intervalo \([a,b]\), com \(a\lt b\), quando

\[ f_X(x)= \begin{cases} \dfrac {1}{b-a}, & a\leq x\leq b,\\[4pt] 0, & \text{caso contrário}. \end{cases} \]

Escrevemos \(X\sim \operatorname {Unif}(a,b)\). Se \(a\leq y\lt z\leq b\), então

\[ \P (y\leq X\leq z) =\int _y^z\frac{1}{b-a}\, \mathrm{d}x =\frac{z-y}{b-a}. \]

Assim, a probabilidade é a razão entre o comprimento do intervalo favorável e o comprimento total.

A função de distribuição é

\[ F_X(x)= \begin{cases} 0, & x\lt a,\\ \dfrac {x-a}{b-a}, & a\leq x\leq b,\\[4pt] 1, & x\gt b, \end{cases} \]

e a média e a variância são

\[ \mathbf{E}[X]=\frac{a+b}{2} \quad \text{e}\quad \operatorname {Var}(X)=\frac{(b-a)^2}{12}. \]

Exemplo 5.1 (Tempo de espera por um ônibus)
Um ônibus passa a cada \(14\) minutos, e uma pessoa chega ao ponto em um instante que pode ser considerado uniforme entre duas passagens. Se \(X\) é o tempo de espera, em minutos, então \(X\sim \operatorname {Unif}(0,14)\). A probabilidade de esperar entre \(3\) e \(8\) minutos é
\[ \P (3\leq X\leq 8)=\frac{8-3}{14}=\frac{5}{14}\approx 0{,}3571. \]
Já a probabilidade de esperar mais de \(10\) minutos é
\[ \P (X\gt 10)=\frac{14-10}{14}=\frac{2}{7}\approx 0{,}2857. \]
O tempo médio de espera é \(\mathbf{E}[X]=7\) minutos.

A distribuição uniforme descreve valores em um intervalo limitado. Para muitos tempos de espera, porém, não há um limite máximo natural. Quando a taxa de ocorrência é constante, a distribuição exponencial fornece um modelo usual.

5.2 Distribuição Exponencial

Suponha que ocorrências se deem ao longo do tempo com taxa média constante \(\lambda \gt 0\), como chegadas a uma central ou falhas de certo tipo. O tempo \(X\) até a próxima ocorrência é frequentemente modelado pela distribuição exponencial, cuja densidade é

\[ f_X(x)= \begin{cases} \lambda e^{-\lambda x}, & x\geq 0,\\ 0, & x\lt 0. \end{cases} \]

Nesse caso, escrevemos \(X\sim \operatorname {Exp}(\lambda )\). Para \(t\geq 0\),

\[ F_X(t)=\int _0^t\lambda e^{-\lambda x}\, \mathrm{d}x =1-e^{-\lambda t}, \]

e, portanto,

\[ \P (X\gt t)=e^{-\lambda t}. \]

A média e a variância são

\[ \mathbf{E}[X]=\frac{1}{\lambda } \quad \text{e}\quad \operatorname {Var}(X)=\frac{1}{\lambda ^2}. \]

Logo, uma taxa maior corresponde a uma espera média menor.

Exemplo 5.2 (Espera até a próxima chamada)
As chamadas chegam a uma central a uma taxa média de \(0{,}20\) por minuto. Admitindo um modelo exponencial para o tempo \(X\) até a próxima chamada, \(X\sim \operatorname {Exp}(0{,}20)\). A probabilidade de a espera ultrapassar \(8\) minutos é
\[ \P (X\gt 8)=e^{-0{,}20\cdot 8}=e^{-1{,}6}\approx 0{,}2019. \]
Por outro lado,
\[ \P (X\leq 3)=1-e^{-0{,}20\cdot 3} =1-e^{-0{,}6}\approx 0{,}4512. \]
O tempo médio de espera é \(1/0{,}20=5\) minutos.

A distribuição exponencial aparece também em confiabilidade, como modelo para a duração de componentes com taxa de falha constante, e em sistemas de filas, como modelo para tempos entre chegadas. A hipótese de taxa constante deve ser avaliada com cuidado: componentes sujeitos a envelhecimento, por exemplo, podem não se ajustar bem a esse modelo.

Proposição 5.1 (Propriedade sem memória)
Se \(X\sim \operatorname {Exp}(\lambda )\), então, para \(s,t\geq 0\),
\[ \P (X\gt s+t\mid X\gt s)=\P (X\gt t). \]

Demonstração

Usando a expressão da cauda,

\[ \P (X\gt s+t\mid X\gt s) =\frac{e^{-\lambda (s+t)}}{e^{-\lambda s}} =e^{-\lambda t} =\P (X\gt t). \]

No exemplo das chamadas, saber que já se passaram \(8\) minutos sem uma nova chamada não altera, sob o modelo exponencial, a distribuição da espera adicional. Essa propriedade é a versão contínua da propriedade sem memória da distribuição geométrica.

A distribuição exponencial admite outras aplicações além da descrição de esperas sem memória. Mínimos de tempos exponenciais modelam riscos concorrentes; quantis relacionam metas de confiabilidade e prazos; e a transformação de uma uniforme permite simular tempos exponenciais.

Exemplo 5.3 (Riscos competitivos)

Uma máquina pode parar por dois mecanismos independentes. O tempo até uma falha do tipo 1 é

\[ T_1\sim \operatorname {Exp}(0{,}02), \]

e o tempo até uma falha do tipo 2 é

\[ T_2\sim \operatorname {Exp}(0{,}03), \]

com taxas medidas por dia. O tempo efetivo até a parada é

\[ T=\min (T_1,T_2). \]

Para \(t\geq 0\),

\[ \begin{aligned} \P (T\gt t) & =\P (T_1\gt t,T_2\gt t)\\ & =e^{-0{,}02t}e^{-0{,}03t} =e^{-0{,}05t}. \end{aligned} \]

Portanto,

\[ T\sim \operatorname {Exp}(0{,}05), \qquad \mathbf{E}[T]=20\text{ dias}. \]

Podemos também perguntar qual mecanismo provavelmente causará a primeira falha. Temos

\[ \begin{aligned} \P (T_1\lt T_2) & =\int _0^\infty f_{T_1}(t)\P (T_2\gt t)\, dt\\ & =\int _0^\infty 0{,}02e^{-0{,}02t}e^{-0{,}03t}\, dt =\frac{0{,}02}{0{,}05}=0{,}4. \end{aligned} \]

Assim, embora o sistema pare em média após vinte dias, apenas \(40\% \) das paradas são atribuídas ao primeiro mecanismo. Em geral, para riscos exponenciais independentes com taxas \(\lambda _1,\ldots ,\lambda _m\), o tempo até a primeira ocorrência é exponencial com taxa \(\lambda _1+\cdots +\lambda _m\), e a probabilidade de o mecanismo \(i\) ser o primeiro é

\[ \frac{\lambda _i}{\lambda _1+\cdots +\lambda _m}. \]

Exemplo 5.4 (Garantia definida por um quantil)

O tempo de vida \(X\), em horas, de um componente é modelado por uma exponencial com média \(20\, 000\) horas. Em vez de perguntar a probabilidade de falha antes de um prazo dado, o fabricante deseja escolher um período de garantia \(w\) para que apenas \(5\% \) dos componentes falhem antes dele.

Como \(\lambda =1/20\, 000\), devemos resolver

\[ \P (X\leq w)=0{,}05. \]

Logo,

\[ 1-e^{-w/20\, 000}=0{,}05, \]

e portanto

\[ \boxed { w=-20\, 000\log (0{,}95)\approx 1\, 026\text{ horas}. } \]

O problema é o inverso dos exemplos usuais: a probabilidade desejada é dada e o valor da variável precisa ser determinado. Essa é a interpretação dos quantis de uma distribuição.

Exemplo 5.5 (Da uniforme à exponencial: simulação por transformação inversa)

Geradores de números pseudoaleatórios produzem, em sua forma mais básica, valores aproximadamente uniformes em \((0,1)\). Como transformar esses valores em tempos exponenciais?

Seja \(U\sim \operatorname {Unif}(0,1)\) e defina

\[ X=-\frac{1}{\lambda }\log U. \]

Para \(x\geq 0\),

\[ \begin{aligned} \P (X\leq x) & =\P \left(-\frac1\lambda \log U\leq x\right)\\ & =\P (U\geq e^{-\lambda x})\\ & =1-e^{-\lambda x}. \end{aligned} \]

Logo,

\[ X\sim \operatorname {Exp}(\lambda ). \]

Essa identidade não serve apenas para reconhecer uma distribuição: ela fornece um algoritmo. Gerando \(U\) uniforme e calculando \(-\log U/\lambda \), obtemos uma observação exponencial. O mesmo princípio, aplicado à inversa da função de distribuição, é uma das técnicas fundamentais de simulação probabilística.

Esses exemplos mostram três leituras diferentes da mesma cauda exponencial: competição entre mecanismos, escolha de um nível de garantia e geração computacional de tempos aleatórios.

5.3 Distribuição Normal

A distribuição exponencial descreve esperas positivas e assimétricas. Em outros problemas, como os de erros de medição, os desvios podem ocorrer nos dois sentidos em torno de um valor central. A distribuição normal é um modelo usual nessas situações, especialmente para grandezas formadas pela soma de muitos pequenos efeitos.

Dizemos que \(X\) tem distribuição normal com média \(\mu \) e variância \(\sigma ^2\gt 0\), e escrevemos \(X\sim \mathcal{N}(\mu ,\sigma ^2)\), quando

\[ f_X(x)=\frac{1}{\sigma \sqrt{2\pi }} \exp \left[-\frac{(x-\mu )^2}{2\sigma ^2}\right], \qquad x\in \mathbb {R}. \]

O parâmetro \(\mu \) determina o centro da curva, e \(\sigma \) determina sua dispersão. Em particular,

\[ \mathbf{E}[X]=\mu \quad \text{e}\quad \operatorname {Var}(X)=\sigma ^2. \]

Padronização

A integral da densidade normal não possui antiderivada elementar. Todos os cálculos podem, porém, ser reduzidos à normal padrão. Se \(X\sim \mathcal{N}(\mu ,\sigma ^2)\), então

\[ Z=\frac{X-\mu }{\sigma }\sim \mathcal{N}(0,1). \]

Denotamos a função de distribuição de \(Z\) por

\[ \Phi (z)=\P (Z\leq z) =\int _{-\infty }^{z}\frac{1}{\sqrt{2\pi }}e^{-t^2/2}\, \mathrm{d}t. \]

Consequentemente,

\[ \P (X\leq x)=\Phi \left(\frac{x-\mu }{\sigma }\right). \]

Para um intervalo, padronizamos os dois extremos. A simetria da curva fornece \(\Phi (-z)=1-\Phi (z)\).

Exemplo 5.6 (Diâmetro de peças usinadas)
O diâmetro \(X\), em milímetros, de uma peça é modelado por \(\mathcal{N}(20,0{,}12^2)\). Uma peça atende à especificação se seu diâmetro está entre \(19{,}8\) e \(20{,}2\) mm. Então
\[ \begin{aligned} \P (19{,}8\leq X\leq 20{,}2) & =\P \left(-1{,}6667\leq Z\leq 1{,}6667\right)\\ & =2\Phi (1{,}6667)-1\\ & \approx 0{,}9044. \end{aligned} \]
Assim, aproximadamente \(90{,}44\% \) das peças atendem à especificação, de acordo com o modelo.

A padronização também aparece quando a probabilidade desejada é uma restrição de projeto. No exemplo seguinte, o nível de falso alarme determina o limiar do sensor e, em seguida, esse mesmo limiar determina a probabilidade de detecção.

Exemplo 5.7 (Limiar de detecção com ruído gaussiano)

Um sensor produz a medida

\[ Y=\theta +\varepsilon , \qquad \varepsilon \sim \mathcal N(0,2^2). \]

Na ausência de sinal, \(\theta =0\). Um alarme é disparado quando \(Y\gt c\). O limiar deve ser escolhido de modo que a probabilidade de falso alarme seja apenas \(1\% \):

\[ \P (Y\gt c\mid \theta =0)=0{,}01. \]

Se \(z_{0{,}99}\approx 2{,}326\) é o percentil \(99\% \) da normal padrão, então

\[ \frac{c}{2}=z_{0{,}99}, \qquad c\approx 4{,}653. \]

Agora suponha que um sinal de intensidade \(\theta =6\) esteja presente. A probabilidade de detecção é

\[ \begin{aligned} \P (Y\gt c\mid \theta =6) & =\P \left( Z\gt \frac{c-6}{2} \right)\\ & \approx \P (Z\gt -0{,}674) =\Phi (0{,}674) \approx 0{,}75. \end{aligned} \]

O mesmo limiar que controla falsos alarmes determina, portanto, a capacidade de detectar um sinal real. Esse é o embrião probabilístico dos problemas de detecção e testes de hipóteses.

Aproximação da binomial pela normal

Uma variável binomial é uma soma de variáveis que valem \(0\) ou \(1\). Quando o número de parcelas é grande e nenhuma das duas respostas é excessivamente rara, a forma de sua distribuição se aproxima da curva normal.

Teorema 5.2 (Aproximação da binomial pela normal)
Fixe \(0\lt p\lt 1\) e, para cada \(n\), seja \(X_n\sim \operatorname {Bin}(n,p)\). Então
\[ \lim _{n\to \infty } \P \left(\frac{X_n-np}{\sqrt{np(1-p)}}\leq z\right) =\Phi (z),\qquad z\in \mathbb {R}. \]
Assim, para \(n\) grande, \(X_n\) pode ser aproximada por uma variável normal com média \(np\) e variância \(np(1-p)\).

Esse resultado será retomado como consequência do Teorema Central do Limite no Capítulo 9.

Como regra prática, a aproximação costuma ser adequada quando \(np\geq 5\) e \(n(1-p)\geq 5\); quanto maiores forem essas duas quantidades, melhor tende a ser o resultado. Essa regra é apenas um diagnóstico inicial, não uma garantia de erro máximo.

Há ainda uma diferença de natureza entre os modelos: a binomial assume valores inteiros, enquanto a normal é contínua. Para compensá-la, usa-se a correção de continuidade. Se \(Y\sim \mathcal{N}(np,np(1-p))\), aproximamos, por exemplo,

\[ \begin{aligned} \P (X\leq a)& \approx \P (Y\leq a+0{,}5),\\ \P (X\geq a)& \approx \P (Y\geq a-0{,}5),\\ \P (X=a)& \approx \P (a-0{,}5\leq Y\leq a+0{,}5). \end{aligned} \]

Exemplo 5.8 (Controle de qualidade)
Em um processo de produção, \(1000\) itens são inspecionados e cada item tem, independentemente, probabilidade \(0{,}1\) de ser defeituoso. Se \(X\) é o número de defeituosos, então \(X\sim \operatorname {Bin}(1000,0{,}1)\), com
\[ \mu =np=100 \quad \text{e}\quad \sigma ^2=np(1-p)=90. \]
Como \(np=100\) e \(n(1-p)=900\), a aproximação normal é apropriada. Aplicando a correção de continuidade,
\[ \begin{aligned} \P (90\leq X\leq 110) & \approx \P (89{,}5\leq Y\leq 110{,}5)\\ & =\P (-1{,}1068\leq Z\leq 1{,}1068)\\ & \approx 0{,}7316, \end{aligned} \]
onde \(Y\sim \mathcal{N}(100,90)\). Portanto, a probabilidade procurada é aproximadamente \(73{,}16\% \).

A família gama amplia o modelo exponencial e permite descrever grandezas positivas com diferentes graus de assimetria. Uma de suas aplicações é o estudo do tempo até várias ocorrências sucessivas, como a terceira ou a quarta ocorrência de um processo de contagem.

5.4 Distribuição Gama

A distribuição gama é usada para modelar grandezas positivas. Quando o parâmetro de forma é maior que \(1\), sua densidade começa em zero, cresce até um máximo e depois decresce, o que é adequado para situações em que valores muito pequenos e muito grandes são pouco frequentes. Ela também descreve o tempo acumulado até várias ocorrências sucessivas de um processo com taxa constante.

Dizemos que \(X\) tem distribuição gama com parâmetro de forma \(\alpha \gt 0\) e parâmetro de taxa \(\beta \gt 0\) quando

\[ f_X(x)= \begin{cases} \dfrac {\beta ^\alpha }{\Gamma (\alpha )} x^{\alpha -1}e^{-\beta x}, & x\gt 0,\\[6pt] 0, & x\leq 0, \end{cases} \]

onde

\[ \Gamma (\alpha )=\int _0^{\infty }u^{\alpha -1}e^{-u}\, \mathrm{d}u. \]

Escrevemos \(X\sim \operatorname {Gama}(\alpha ,\beta )\). Adotaremos em todo o livro a parametrização forma–taxa; nessa convenção,

\[ \mathbf{E}[X]=\frac{\alpha }{\beta } \quad \text{e}\quad \operatorname {Var}(X)=\frac{\alpha }{\beta ^2}. \]

Quando \(\alpha =1\), a densidade gama se reduz à densidade exponencial de taxa \(\beta \).

Se \(\alpha =m\) é um inteiro positivo, a distribuição pode ser interpretada como o tempo até a \(m\)-ésima ocorrência de um processo de Poisson de taxa \(\beta \). Nesse caso, para \(t\geq 0\), a probabilidade de ainda não terem ocorrido \(m\) eventos até o instante \(t\) é

\[ \P (X\gt t)=e^{-\beta t} \sum _{j=0}^{m-1}\frac{(\beta t)^j}{j!}. \]

A derivação seguinte explicita a relação com a Poisson e a origem da densidade gama quando o parâmetro de forma é inteiro.

Exemplo 5.9 (Da contagem de Poisson ao tempo da \(k\)-ésima ocorrência)
Suponha que \(N(t)\) conte o número de ocorrências até o instante \(t\) e que
\[ N(t)\sim \operatorname {Poisson}(\lambda t), \qquad t\geq 0. \]
Seja \(T_k\) o instante da \(k\)-ésima ocorrência. Os eventos
\[ \{ T_k\leq t\} \quad \text{e}\quad \{ N(t)\geq k\} \]
são exatamente os mesmos: a \(k\)-ésima ocorrência já aconteceu até \(t\) se, e somente se, pelo menos \(k\) ocorrências foram contadas nesse intervalo. Portanto,
\[ \begin{aligned} F_{T_k}(t) & =\P (T_k\leq t)\\ & =\P (N(t)\geq k)\\ & =1-\sum _{j=0}^{k-1} e^{-\lambda t}\frac{(\lambda t)^j}{j!}, \qquad t\geq 0. \end{aligned} \]
Derivando,
\[ f_{T_k}(t) =\frac{\lambda ^k}{(k-1)!} t^{k-1}e^{-\lambda t}, \qquad t\gt 0. \]
Logo,
\[ \boxed {T_k\sim \operatorname {Gama}(k,\lambda )}. \]
Para \(k=1\), recuperamos a distribuição exponencial. Assim, exponencial, gama e Poisson não são três modelos independentes: a Poisson descreve o número de ocorrências, a exponencial o tempo até a primeira e a gama o tempo até a \(k\)-ésima.

O caso seguinte especializa essa identidade para \(k=3\) e a usa numericamente.

Exemplo 5.10 (Tempo até a terceira ocorrência)
Eventos chegam a um sistema à taxa média de \(2\) por hora. Seja \(X\) o tempo, em horas, até a terceira ocorrência. Sob o modelo de Poisson, \(X\sim \operatorname {Gama}(3,2)\). Logo,
\[ \mathbf{E}[X]=\frac{3}{2}=1{,}5 \quad \text{e}\quad \operatorname {Var}(X)=\frac{3}{2^2}=0{,}75. \]
A probabilidade de a terceira ocorrência demorar mais de duas horas é
\[ \begin{aligned} \P (X\gt 2) & =e^{-4}\left(1+4+\frac{4^2}{2!}\right)\\ & =13e^{-4}\approx 0{,}2381. \end{aligned} \]
Equivalentemente, até duas horas ocorreram no máximo dois eventos.

Figura 5.1 Densidade gama com parâmetros α =3 e β =1.

Figura 5.1 Densidade gama com parâmetros \(\alpha =3\) e \(\beta =1\).

As distribuições uniforme, exponencial, normal e gama descrevem estruturas distintas. Os exemplos mostraram como o suporte, a simetria, os mecanismos de ocorrência e as transformações de variáveis ajudam a escolher uma distribuição. Essa escolha precede o cálculo das probabilidades por integração.

Resumo do capítulo
Em modelos contínuos, probabilidades são áreas sob densidades. Uniforme, exponencial, normal e gama são reconhecidas por suporte, forma, parâmetros e propriedades estruturais.

5.5 Exercícios

Exercício 5.1 (Normalização)
Considere \(f(x)=c(1-x^2)\), para \(-1\lt x\lt 1\), e \(f(x)=0\) fora desse intervalo. Determine \(c\), \(F_X\) e \(\P (|X|\lt 1/2)\).
Exercício 5.2 (Uniforme)
O atraso de um ônibus é uniforme entre \(0\) e \(14\) minutos. Calcule a probabilidade de o atraso: (a) superar \(9\) minutos; (b) ficar entre \(3\) e \(8\) minutos; (c) superar \(11\) minutos dado que já superou \(6\).
Exercício 5.3 (Exponencial)
O tempo de vida de um componente é exponencial com média \(450\) horas. Determine a probabilidade de ele durar mais de \(600\) horas e a probabilidade de durar mais \(200\) horas sabendo que já funcionou por \(500\).
Exercício 5.4 (Normal)
O diâmetro de uma peça é normal com média \(20{,}0\) mm e desvio padrão \(0{,}12\) mm. Peças entre \(19{,}8\) e \(20{,}2\) mm são aceitas. Calcule a proporção esperada de peças aceitas e o percentil \(95\) do diâmetro.
Exercício 5.5 (Gama)
Se \(X\sim \operatorname {Gama}(3,2)\), na parametrização forma–taxa, determine \(\mathbf{E}[X]\), \(\operatorname {Var}(X)\) e escreva a integral que fornece \(\P (X\gt 2)\). Para o parâmetro de forma inteiro, simplifique essa probabilidade.

Exercício 5.6 (Transformação monotônica)
Se \(X\sim U(-2,3)\) e \(Y=(X+2)^2\), determine \(F_Y\), \(f_Y\) e o suporte de \(Y\).
Exercício 5.7 (Convolução)
Se \(X\) e \(Y\) são exponenciais independentes com taxas \(2\) e \(5\), respectivamente, encontre a densidade de \(Z=X+Y\). Verifique que ela integra para \(1\).