Capítulo 6

Vetores aleatórios

6.1 Vetores aleatórios e funções de distribuição

Até aqui, uma variável aleatória foi suficiente para registrar a quantidade de interesse: o tempo de vida de uma bateria, o número de chamadas recebidas ou a distância percorrida. Muitos experimentos, porém, produzem várias quantidades simultaneamente. Se escolhemos ao acaso um ponto no disco unitário, por exemplo, suas duas coordenadas precisam ser estudadas em conjunto. Se \(\omega \) é o resultado do experimento, o ponto observado é

\[ (X(\omega ),Y(\omega ))\in \{ (x,y)\in \mathbb {R}^2:x^2+y^2\leq 1\} . \]

Estudar apenas \(X\) e apenas \(Y\) não descreve a maneira como essas variáveis variam em conjunto. Duas coordenadas podem ter marginais simples e, ainda assim, apresentar forte dependência. A informação conjunta é necessária, por exemplo, ao relacionar tempo de espera e duração do atendimento, volume de vendas e lucro ou duas medições do mesmo indivíduo.

Um vetor aleatório é uma coleção ordenada de variáveis aleatórias observadas no mesmo experimento. Neste capítulo, começaremos pela distribuição conjunta, passaremos aos casos discreto e contínuo e, em seguida, estudaremos independência, somas e distribuições condicionais. Em cada etapa, a ideia central será a mesma: calcular probabilidades em regiões do espaço dos valores possíveis.

Definição 6.1
  1. Um vetor \(X=(X_1,\ldots ,X_n)\), cujas componentes são variáveis aleatórias definidas no mesmo espaço de probabilidade, é denominado vetor aleatório.

  2. A função de distribuição conjunta de \(X=(X_1,\ldots ,X_n)\) é

    \[ F_X(x_1,\ldots ,x_n) =\P (X_1\leq x_1,\ldots ,X_n\leq x_n), \qquad (x_1,\ldots ,x_n)\in \mathbb {R}^n. \]
Exemplo 6.1
Em uma central de reservas, seja \(X_1\) o tempo de espera, em minutos, até o início do atendimento e seja \(X_2\) a duração do atendimento. Suponha que a função de distribuição conjunta seja
\[ F_{X_1,X_2}(x_1,x_2)= \begin{cases} 0, & x_1\lt 0\text{ ou }x_2\lt 0,\\ 1-e^{-x_1}-e^{-2x_2}+e^{-(x_1+2x_2)}, & x_1\geq 0,\ x_2\geq 0. \end{cases} \]
Por exemplo, a probabilidade de uma chamada esperar no máximo um minuto e durar no máximo dois minutos é \(F_{X_1,X_2}(1,2)\). Assim, uma única função permite avaliar simultaneamente as duas etapas do serviço.

Proposição 6.1

A função de distribuição \(F\) de um vetor aleatório \(\left(X,Y\right)\) possui as seguintes propriedades:

  1. \(F\left(x,y\right)\) é não-decrescente em cada uma das variáveis. Por exemplo, é não-decrescente em \(x\) : se \(x_1\leq x_2\), então

    \[ F\left(x_1, y\right) \leq F\left(x_{2}, y\right) . \]
  2. \(F\left(x,y\right)\) é contínua à direita em cada uma das variáveis. Ou seja, para quaisquer \(x, y\):

    \[ \lim _{u \to x^+} F(u, y) = F(x, y) \]

    e

    \[ \lim _{v \to y^+} F(x, v) = F(x, y) \]
  3. Para cada \(y\) fixado, \(\lim _{x\to -\infty }F(x,y)=0\), e, para cada \(x\) fixado, \(\lim _{y\to -\infty }F(x,y)=0\). Além disso,

    \[ \lim _{x\to \infty }\lim _{y\to \infty }F(x,y)=1. \]
  4. Todo retângulo semiaberto tem incremento não negativo: se \(a_1\lt a_2\) e \(b_1\lt b_2\), então

    \[ F(a_2,b_2)-F(a_1,b_2)-F(a_2,b_1)+F(a_1,b_1)\geq 0. \]

Demonstração

As propriedades F1 e F2 seguem, como no caso unidimensional, da inclusão de eventos e da continuidade da probabilidade. Para F3, se \(x_m\downarrow -\infty \), então \([X\leq x_m,Y\leq y]\downarrow \varnothing \); portanto, \(F(x_m,y)\to 0\). O mesmo argumento vale na segunda coordenada. Se \(x_m\uparrow \infty \) e \(y_m\uparrow \infty \), então \([X\leq x_m,Y\leq y_m]\uparrow \Omega \), e daí \(F(x_m,y_m)\to 1\).

Por fim, o incremento em F4 é exatamente

\[ \P (a_1\lt X\leq a_2,\ b_1\lt Y\leq b_2), \]

e, portanto, é não negativo.

Para recuperar a distribuição de uma única componente, fazemos as demais coordenadas tenderem a \(+\infty \). No caso bidimensional,

\[ F_X(a)=\lim _{b\to \infty }F(a,b)\coloneqq F(a,\infty ), \qquad F_Y(b)=\lim _{a\to \infty }F(a,b)\coloneqq F(\infty ,b). \]

Essas são as distribuições marginais. Elas descrevem cada coordenada separadamente, mas não determinam, em geral, como \(X\) e \(Y\) se relacionam.

A distribuição conjunta, por sua vez, determina probabilidades de regiões. Por exemplo,

\[ \begin{aligned} \P (X\gt a, Y\gt b) & =1-\P \left((X\gt a, Y\gt b)^c\right) \\ & =1-\P \left((X\gt a)^c \cup (Y\gt b)^c\right) \\ & =1-\P ((X \leq a ) \cup (Y \leq b )) \\ & =1-[\P (X \leq a )+\P (Y \leq b )-\P (X \leq a, Y \leq b )] \\ & =1-F_X(a)-F_Y(b)+F(a, b) \end{aligned} \]

A equação anterior é um caso especial da equação a seguir:

\begin{align} \P ( a_1\lt X \leq a_2, b_1\lt Y \leq b_2) =F\left(a_2, b_2\right)+F\left(a_1, b_1\right)-F\left(a_1, b_2\right)-F\left(a_2, b_1\right) \label{eq:probdist} \tag{6.1} \end{align}

sempre que \(a_1\lt a_2, b_1\lt b_2\). Geometricamente, a fórmula soma o retângulo até \((a_2,b_2)\), retira as duas faixas excedentes e devolve a região retirada duas vezes. Esse princípio de inclusão e exclusão reaparecerá tanto nas tabelas do caso discreto quanto nas integrais do caso contínuo.

Nos casos discretos e absolutamente contínuos, a distribuição conjunta admite descrições semelhantes às de uma variável: massas atribuídas a pontos ou uma densidade cuja integral fornece probabilidades de regiões. Estudaremos essas duas situações separadamente.

6.2 Vetores aleatórios discretos

No caso discreto, a distribuição conjunta pode ser representada por uma tabela: cada célula contém \(p(x,y)=\P (X=x,Y=y)\), e as marginais são obtidas somando linhas ou colunas. Uma função de probabilidade conjunta deve satisfazer

\[ p(x,y)\geq 0, \qquad \sum _x\sum _y p(x,y)=1, \]

com soma sobre o suporte, finito ou enumerável. Reciprocamente, qualquer tabela não negativa com soma total igual a \(1\) define uma distribuição conjunta.

A função de distribuição é recuperada acumulando as massas:

\[ F(a,b)=\P (X\leq a,Y\leq b) =\sum _{x\leq a}\sum _{y\leq b}p(x,y). \]

Proposição 6.2
O vetor \((X_1, \ldots ,X_n)\) é discreto se, e somente se, as variáveis \(X_1,\ldots X_n\) são discretas.

Demonstração

Se o vetor assume valores em um conjunto enumerável, cada coordenada assume valores na projeção desse conjunto e, portanto, é discreta. Reciprocamente, se cada \(X_i\) assume valores em um conjunto enumerável \(C_i\), então o vetor assume valores no produto \(C_1\times \cdots \times C_n\), que também é enumerável.

Para obter a função de probabilidade marginal de \(X\), basta somar \(p(x,y)\) sobre todos os valores possíveis de \(y\), resultando em:

\[ \begin{aligned} p_X(x) & = \P (X = x) \\ & = \sum _{y : p(x,y) \gt 0} p(x,y). \end{aligned} \]

Analogamente, a função de probabilidade marginal de \(Y\) é dada pela soma de \(p(x,y)\) sobre todos os valores possíveis de \(x\):

\[ p_Y(y) \; =\; \sum _{x : p(x,y) \gt 0} p(x,y). \]

Exemplo 6.2

Uma caixa contém cinco lâmpadas, duas delas defeituosas. As lâmpadas são testadas em ordem aleatória, sem reposição. Seja \(X\) a posição em que aparece a primeira defeituosa e \(Y\) a posição da segunda. Então \(1\leq X\lt Y\leq 5\).

Há apenas \(\binom {5}{2}=10\) pares possíveis de posições para as duas lâmpadas defeituosas, todos equiprováveis. Por isso, cada par \((x,y)\) com \(1\leq x\lt y\leq 5\) tem probabilidade \(1/10\). A tabela conjunta é:

\[ \begin{array}{c|cccc} X & 1 & 2 & 3 & 4 \\ \hline Y = 2 & 1/10 & 0 & 0 & 0 \\ Y = 3 & 1/10 & 1/10 & 0 & 0 \\ Y = 4 & 1/10 & 1/10 & 1/10 & 0 \\ Y = 5 & 1/10 & 1/10 & 1/10 & 1/10 \\ \end{array} \]

Probabilidades de eventos são somas de células. Por exemplo, \(\P (X\gt 2)=3/10\). As marginais surgem somando as colunas e as linhas. Para \(X\):

\[ \begin{array}{r|cccc} X & 1 & 2 & 3 & 4 \\ \hline \P (X = x) & \frac{4}{10} & \frac{3}{10} & \frac{2}{10} & \frac{1}{10} \end{array} \]

De modo análogo, para \(Y\):

\[ \begin{array}{r|cccc} Y & 2 & 3 & 4 & 5 \\ \hline \P (Y = y) & \frac{1}{10} & \frac{2}{10} & \frac{3}{10} & \frac{4}{10} \end{array} \]

Exemplo 6.3

Duas canetas esferográficas são selecionadas aleatoriamente de uma caixa que contém 3 canetas azuis, 2 canetas vermelhas e 3 canetas verdes. Se \( X \) é o número de canetas azuis selecionadas e \( Y \) é o número de canetas vermelhas selecionadas, encontre

  1. a função de probabilidade conjunta \( p(x, y) \),

  2. \( \P [(X, Y) \in A] \), onde \( A \) é a região \(\{ (x, y) | x + y \leq 1\} \).

Sol Os pares possíveis de valores \((x, y)\) são \((0,0), (0,1), (1,0), (1,1), (0,2)\) e \((2,0)\).

1. Por exemplo, \(p(0,1)\) corresponde à escolha de uma caneta vermelha e uma verde. Entre as \(\binom {8}{2}=28\) duplas equiprováveis, há \(\binom {2}{1}\binom {3}{1}=6\) desse tipo; logo \(p(0,1)=3/14\). O mesmo raciocínio fornece as demais células da tabela, cuja soma total é \(1\).

2. A probabilidade de que \((X, Y)\) pertença à região \( A \) é

\begin{align*} \P [(X, Y) \in A] & = \P (X + Y \leq 1) = p(0,0) + p(0,1) + p(1,0) \\ & = \frac{3}{28} + \frac{3}{14} + \frac{9}{28} = \frac{9}{14}. \end{align*}
\(p(x,y)\)\(x = 0\)\(x = 1\)\(x = 2\)Totais
\(y = 0\)\( \frac{3}{28} \)\( \frac{9}{28} \)\( \frac{3}{28} \)\(\frac{15}{28}\)
\(y = 1\)\( \frac{3}{14} \)\( \frac{3}{14} \)\( 0 \)\(\frac{3}{7}\)
\(y = 2\)\( \frac{1}{28} \)\( 0 \)\( 0 \)\(\frac{1}{28}\)
Totais\( \frac{5}{14} \)\( \frac{15}{28} \)\( \frac{3}{28} \)\(1\)
Tabela 6.1 Distribuição de Probabilidade Conjunta para o Exemplo 6.3.

Exemplo 6.4

Suponha que realizamos sucessivos lançamentos de uma moeda com probabilidade \(p\) de cair cara. Defina as variáveis aleatórias \(X_1\) como o número do lançamento em que ocorre a primeira cara, e \(X_2\) como o número do lançamento em que ocorre a segunda cara. O suporte da distribuição conjunta de \((X_1, X_2)\) não é finito, pois \(X_1\) e \(X_2\) podem assumir valores arbitrariamente grandes, desde que \(1 \leq X_1 \leq X_2 - 1\).

Para \(x_2 \ge x_1 + 1\) e \(x_1 \ge 1\), podemos recorrer às propriedades da distribuição geométrica para determinar que

\[ \P (X_1 = x_1, X_2 = x_2) \; =\; \bigl[p\, (1-p)^{\, x_1-1}\bigr]\, \bigl[p\, (1-p)^{\, x_2 - x_1 - 1}\bigr]. \]

O primeiro termo representa a probabilidade de ser necessário \(x_1\) lançamentos para obter a primeira cara, e o segundo termo corresponde à probabilidade de que sejam necessários \(x_2 - x_1\) lançamentos adicionais para aparecer a segunda cara. Essas probabilidades multiplicam-se em razão da independência dos lançamentos. Simplificando, obtemos

\[ \P (X_1 = x_1, X_2 = x_2) = p^2 (1 - p)^{x_2 - 2}, \quad \text{para } 1 \leq x_1 \lt x_2. \]

A normalização também pode ser verificada diretamente. Escrevendo \(q=1-p\),

\[ \sum _{x_2=2}^{\infty }\sum _{x_1=1}^{x_2-1}p^2q^{x_2-2} =p^2\sum _{k=0}^{\infty }(k+1)q^k =\frac{p^2}{(1-q)^2}=1. \]

Exemplo 6.5

Retomando o Exemplo 6.4, já identificamos que a distribuição marginal de \(X_1\) deve ser geométrica com parâmetro \(p\). Para confirmar essa afirmação de outra forma, podemos recorrer à fórmula da distribuição marginal. No caso em questão, a função de probabilidade marginal de \(X_1\) é dada por:

\begin{align*} \P (X_1 = x_1) & = \sum _{x_2 = x_1 + 1}^{\infty } \P (X_1 = x_1, X_2 = x_2) \\ & = \sum _{x_2 = x_1 + 1}^{\infty } p^2 (1-p)^{x_2-2} \\ & = p^2(1-p)^{x_1-1}\sum _{k=0}^{\infty }(1-p)^k. \end{align*}

Essa soma é uma série geométrica de razão \( (1 - p) \) e primeiro termo \( p^2 (1 - p)^{x_1 - 1} \), cuja soma é dada por:

\begin{align*} \P (X_1 = x_1) & = p^2 (1 - p)^{x_1 - 1} \frac{1}{p} \\ & = p (1 - p)^{x_1 - 1}, \quad \text{para } x_1 \geq 1. \end{align*}

Isso mostra que \(X_1\) segue uma distribuição geométrica com parâmetro \( p \).

A função de probabilidade marginal de \(X_2\) é obtida somando sobre \(x_1\):

\[ \P (X_2 = x_2) = \sum _{x_1 = 1}^{x_2 - 1} \P (X_1 = x_1, X_2 = x_2). \]

Substituindo a função de probabilidade conjunta:

\[ \P (X_2 = x_2) = \sum _{x_1 = 1}^{x_2 - 1} p^2 (1 - p)^{x_2 - 2}. \]

O termo \( p^2 (1 - p)^{x_2 - 2} \) não depende de \( x_1 \), então a soma simplesmente conta o número de termos, que é \( x_2 - 1 \):

\[ \P (X_2 = x_2) = (x_2 - 1) p^2 (1 - p)^{x_2 - 2}, \quad \text{para } x_2 \geq 2. \]

Modelo multinomial

A binomial conta quantas vezes ocorre um resultado em ensaios com duas categorias. Com \(m\) categorias, as contagens devem ser estudadas em conjunto. Se, em cada um de \(n\) ensaios independentes, a categoria \(i\) ocorre com probabilidade \(p_i\), \(i=1,\ldots ,m\), e \(\sum _i p_i=1\), então o vetor \(X=(X_1,\ldots ,X_m)\) das contagens tem distribuição multinomial:

Definição 6.2 (Modelo multinomial)
Para inteiros \(k_i\geq 0\) com \(k_1+\cdots +k_m=n\),
\[ \P (X_1=k_1,\ldots ,X_m=k_m) =\frac{n!}{k_1!\cdots k_m!}p_1^{k_1}\cdots p_m^{k_m}. \]
Fora desse suporte, a probabilidade é zero. O coeficiente multinomial conta as sequências de \(n\) resultados que produzem as mesmas contagens.
Exemplo 6.6
Em dez lançamentos independentes de um dado equilibrado, seja \(X_i\) o número de ocorrências da face \(i\). Então \((X_1,\ldots ,X_6)\) é multinomial e
\[ \P (X_1=k_1,\ldots ,X_6=k_6) =\frac{10!}{k_1!\cdots k_6!}\left(\frac16\right)^{10}, \qquad k_1+\cdots +k_6=10. \]

6.3 Vetores aleatórios contínuos

No caso contínuo, as somas sobre pontos são substituídas por integrais sobre regiões. Antes de integrar, identificamos o suporte da densidade e a parte desse suporte correspondente ao evento de interesse. Essa descrição determina a região de integração.

No caso bidimensional, dizemos que \((X,Y)\) é contínuo quando existe uma função não negativa \(f\), com integral total igual a \(1\), tal que, para toda região \(C\) considerada,

\begin{align} \P ((X, Y) \in C)=\iint _{(x, y) \in C} f(x, y) d x d y \label{eq:comjcont} \tag{6.2} \end{align}

Se \(A\) e \(B\) são quaisquer conjuntos de números reais, então, para o conjunto

\[ C=\{ (x, y): x \in A, y \in B\} , \]

obtemos da Equação 6.2 que

\[ \P (X \in A, Y \in B)=\int _B \int _A f(x, y) d x d y . \]

Interpretação da densidade

Da função de distribuição conjunta,

\begin{align} \label{vetor:distribuicaointervalo} F(a, b) & =\P (X \in (-\infty , a], Y \in (-\infty , b]) =\int _{-\infty }^b \int _{-\infty }^a f(x, y) d x d y \tag{6.3} \end{align}

obtemos, nos pontos em que as derivadas existem,

\[ f(a, b) = \frac{\partial ^2}{\partial a \partial b} F(a, b). \]

O valor \(f(a,b)\) não é uma probabilidade pontual. Ele indica como a probabilidade se concentra nas proximidades de \((a,b)\). Para pequenos \(\Delta a,\Delta b\gt 0\),

\begin{align} \P (a\lt X\lt a+\Delta a, b\lt Y\lt b+\Delta b) & =\int _b^{b+\Delta b} \int _a^{a+\Delta a} f(x, y) d x d y \tag{6.4} \\ & \approx f(a, b) \Delta a \Delta b \label{eq:densidade} \tag{6.5} \end{align}

quando \(f\) é contínua em \((a,b)\). A aproximação corresponde ao volume de um paralelepípedo de base \(\Delta a\Delta b\) e altura \(f(a,b)\).

Marginais

Se \( X \) e \( Y \) são variáveis aleatórias conjuntamente contínuas, então elas também são contínuas individualmente. As funções de densidade de probabilidade marginais de \( X \) e \( Y \) podem ser determinadas da seguinte forma:

\[ \begin{aligned} \P (X \in A ) & =\P (X \in A, Y \in (-\infty , \infty )) \\ & =\int _A \int _{-\infty }^{\infty } f(x, y) d y d x \\ & =\int _A f_X(x) d x \end{aligned} \]

onde

\[ f_X(x)=\int _{-\infty }^{\infty } f(x, y) d y . \]

Similarmente, a função densidade de probabilidade de \(Y\) é dada por

\[ f_Y(y)=\int _{-\infty }^{\infty } f(x, y) d x . \]

Exemplo 6.7 (Distribuição uniforme bidimensional)

A distribuição uniforme no quadrado unitário é o exemplo bidimensional mais simples. Se \((X,Y)\) é uniforme em \((0,1)^2\), a densidade é constante no quadrado e zero fora dele. Como a área do suporte é \(1\), a constante também deve ser \(1\):

\[ f_{XY}(x,y)=\begin{cases} 1 & \text{ se } 0\lt x\lt 1, 0\lt y\lt 1 \\ 0 & \text{ caso contrário} \end{cases} \]

A Figura 6.3 mostra o suporte e a superfície da densidade. Como a altura é \(1\), probabilidades são simplesmente áreas. Assim, a região \(Y\gt 1/2\) ocupa metade do quadrado e tem probabilidade \(1/2\).

Para calcular \(\P (X+2Y\gt 2)\), identificamos no quadrado a região acima da reta \(x+2y=2\), mostrada na Figura 6.2.

O triângulo sombreado tem área \(1/4\); portanto \(\P (X+2Y\gt 2)=1/4\).

Figura 6.3 Função densidade para a distribuição uniforme.

Figura 6.3 Função densidade para a distribuição uniforme.

Exemplo 6.8

A função densidade conjunta de \(X\) e \(Y\) é dada por

\[ f_{XY}(x, y)= \begin{cases} 2 e^{-x} e^{-2 y} & 0\lt x\lt \infty , 0\lt y\lt \infty \\ 0 & \text{ caso contrário }\end{cases} \]

Calcule

  1. \(\P (X\gt 1, Y\lt 1)\)

  2. \(\P (X\lt Y)\)

  3. \(\P (X\lt a)\).

Sol

1

\[ \begin{aligned} \noindent \P (X\gt 1, Y\lt 1) & =\int _0^1 \int _1^{\infty } 2 e^{-x} e^{-2 y} d x d y \\ & =\int _0^1 2 e^{-2 y}\left(-\left.e^{-x}\right|_1 ^{\infty }\right) d y \\ & =e^{-1} \int _0^1 2 e^{-2 y} d y \\ & =e^{-1}\left(1-e^{-2}\right) \end{aligned} \]

2

\[ \begin{aligned} \P (X\lt Y) & =\iint _{(x, y): x\lt y} 2 e^{-x} e^{-2 y} d x d y \\ & =\int _0^{\infty } \int _0^y 2 e^{-x} e^{-2 y} d x d y \\ & =\int _0^{\infty } 2 e^{-2 y}\left(1-e^{-y}\right) d y \\ & =\int _0^{\infty } 2 e^{-2 y} d y-\int _0^{\infty } 2 e^{-3 y} d y \\ & =1-\frac{2}{3} \\ & =\frac{1}{3} \end{aligned} \]

3

\[ \begin{aligned} \P (X\lt a) & =\int _0^a \int _0^{\infty } 2 e^{-2 y} e^{-x} d y d x \\ & =\int _0^a e^{-x} d x \\ & =1-e^{-a} \end{aligned} \]

Exemplo 6.9

Em um processo de fabricação de chips de computadores, pode haver dois tipos de impurezas que afetam a qualidade do produto final. Para um certo lote de chips, seja \( X \) a proporção total de impurezas encontradas no lote, e seja \( Y \) a proporção das impurezas do tipo 1 em relação ao total de impurezas presentes. Suponha que, após analisar diversos lotes, a distribuição conjunta de \( X \) e \( Y \) possa ser adequadamente modelada pela função de densidade:

\[ f_{X,Y}(x, y) = \begin{cases} 2(1 - x), & \text{para } 0 \leq x \leq 1, 0 \leq y \leq 1, \\ 0, & \text{caso contrário}. \end{cases} \]

Sol

Desejamos calcular a probabilidade de que a proporção total de impurezas \( X \) seja inferior a 0,5 e que a proporção de impurezas do tipo 1, \( Y \), esteja entre 0,4 e 0,7.

\begin{align*} \P (0 \leq X \leq 0.5, \; 0.4 \leq Y \leq 0.7) & = \int _{0.4}^{0.7} \int _{0}^{0.5} 2(1 - x) \, dx \, dy \\ & = \int _{0.4}^{0.7} \left[ - (1 - x)^2 \right]_{0}^{0.5} dy \\ & = \int _{0.4}^{0.7} (0.75) \, dy \\ & = 0.75 \int _{0.4}^{0.7} dy \\ & = 0.75 (0.7 - 0.4) \\ & = 0.75 \cdot 0.3 = 0.225. \end{align*}

Portanto, a probabilidade de que \( X \) seja menor que 0,5 e \( Y \) esteja entre 0,4 e 0,7 é 0,225.

Exemplo 6.10

Considere um círculo de raio \(R\) e suponha que um ponto em seu interior seja escolhido aleatoriamente e uniformemente distribuído no interior do círculo. Se o centro do círculo está na origem do sistema de coordenadas, e \(X\) e \(Y\) correspondem às coordenadas do ponto escolhido, então, como \((X, Y)\) tem a mesma probabilidade de estar na vizinhança de qualquer ponto no círculo, a função densidade conjunta de \(X\) e \(Y\) é dada pela uniforme:

\[ f(x, y)=\left\{ \begin{array}{l} K \text{ se } x^2+y^2 \leq R^2 \\ 0 \text{ se } x^2+y^2\gt R^2 \end{array}\right. \]

para algum valor de K.

  1. Determine \(K\).

  2. Encontre as funções densidade marginais de \(X\) e \(Y\).

  3. Calcule a probabilidade de que \(D\), a distância da origem ao ponto selecionado, seja menor ou igual a \(a\).

  4. Determine \(\mathbf{E}[D]\), a esperança da distância \( D \).

Sol

  1. Determinação de \( c \):

    Para que \( f(x, y) \) seja uma função densidade de probabilidade, devemos ter:

    \[ \int _{-\infty }^{\infty } \int _{-\infty }^{\infty } f(x, y) \, dy \, dx = 1. \]

    Assim, obtemos:

    \[ K \iint _{x^2 + y^2 \leq R^2} dy \, dx = 1. \]

    Podemos calcular \( \iint _{x^2 + y^2 \leq R^2} dy \, dx \) usando coordenadas polares, ou mais diretamente, reconhecendo que essa integral representa a área do círculo de raio \( R \), que é \( \pi R^2 \). Portanto,

    \[ K = \frac{1}{\pi R^2}. \]
  2. Funções densidade marginais de \( X \) e \( Y \):

    Para encontrar a densidade marginal de \( X \), temos:

    \[ \begin{aligned} f_X(x) & = \int _{-\infty }^{\infty } f(x, y) \, dy \\ & = \frac{1}{\pi R^2} \int _{x^2 + y^2 \leq R^2} dy \\ & = \frac{1}{\pi R^2} \int _{-\sqrt{R^2 - x^2}}^{\sqrt{R^2 - x^2}} dy \\ & = \frac{2}{\pi R^2} \sqrt{R^2 - x^2}, \quad \text{para } x^2 \leq R^2. \end{aligned} \]

    Para \( x^2 \gt R^2 \), temos \( f_X(x) = 0 \). Por simetria, a densidade marginal de \( Y \) é dada por:

    \[ \begin{aligned} f_Y(y) & = \frac{2}{\pi R^2} \sqrt{R^2 - y^2}, \quad \text{para } y^2 \leq R^2, \\ & = 0, \quad \text{para } y^2 \gt R^2. \end{aligned} \]
  3. Probabilidade de que \( D \leq a \), onde \( D = \sqrt{X^2 + Y^2} \):

    Para \(0\leq a\leq R\), a função de distribuição de \(D\) é:

    \[ \begin{aligned} F_D(a) & = \P (\sqrt{X^2 + Y^2} \leq a) \\ & = \P (X^2 + Y^2 \leq a^2) \\ & = \iint _{x^2 + y^2 \leq a^2} f(x, y) \, dy \, dx \\ & = \frac{1}{\pi R^2} \iint _{x^2 + y^2 \leq a^2} dy \, dx \\ & = \frac{\pi a^2}{\pi R^2} \\ & = \frac{a^2}{R^2}, \end{aligned} \]

    Para \(a\lt 0\), \(F_D(a)=0\); para \(a\geq R\), \(F_D(a)=1\).

  4. Esperança de \( D \), \( \mathbf{E}[D] \):

    Do item anterior, temos que a densidade de \( D \) é:

    \[ f_D(a) = \frac{2a}{R^2}, \quad 0 \leq a \leq R. \]

    Portanto,

    \[ \mathbf{E}[D] = \frac{2}{R^2} \int _0^R a^2 \, da = \frac{2R}{3}. \]

6.4 Independência

As distribuições marginais não determinam, em geral, a distribuição conjunta. Sob a hipótese de independência, porém, a distribuição conjunta é obtida pelo produto das marginais. Essa hipótese expressa que observar uma coordenada não altera a distribuição da outra. A ausência de correlação, que será estudada adiante, não é suficiente para garantir independência. Formalmente, \(X\) e \(Y\) são independentes se, para quaisquer conjuntos borelianos \(A,B\subseteq \mathbb {R}\),

\[ \P (X \in A, Y \in B)=\P (X \in A ) \P (Y \in B) \]

Em outras palavras, os eventos \([X\in A]\) e \([Y\in B]\) devem ser independentes para todas essas escolhas.

Definição 6.3
As variáveis aleatórias \(X_{1}, \ldots , X_{n}\) são independentes se

\begin{equation} \label{eq:ind} \P \left(X_{1} \in B_{1},\ldots ,X_{n} \in B_{n}\right) =\prod _{i=1}^{n} \P \left(X_{i} \in B_{i}\right). \tag{6.6} \end{equation}

A igualdade deve valer para todos os conjuntos borelianos \(B_1,\ldots ,B_n\subseteq \mathbb {R}\).
Para qualquer família de variáveis aleatórias independentes, qualquer subfamília é também formada por variáveis independentes. Por exemplo, se \(X, Y\) e \(Z\) são independentes, então \(X\) e \(Y\) também o são.

Os critérios mais úteis são fatorizações da distribuição conjunta. Eles permitem reconhecer independência sem voltar à definição para todos os conjuntos.

Proposição 6.3 (Critérios para independência)
  1. As variáveis \(X_1,\ldots ,X_n\) são independentes se, e somente se,

    \[ F_{X_1,\ldots ,X_n}(x_1,\ldots ,x_n) =\prod _{i=1}^n F_{X_i}(x_i), \qquad (x_1,\ldots ,x_n)\in \mathbb {R}^n. \]
  2. Se \(X_1,\ldots ,X_n\) são discretas, elas são independentes se, e somente se,

    \begin{align} p(x_1,\ldots ,x_n)=\prod _{i=1}^n p_{X_i}(x_i) \label{eq:inpdisc} \tag{6.7} \end{align}

    para todo \((x_1,\ldots ,x_n)\).

  3. Suponha que \(X\) e \(Y\) tenham densidades conjunta e marginais contínuas. Então são independentes se, e somente se,

    \[ f_{X,Y}(x,y)=f_X(x)f_Y(y),\qquad (x,y)\in \mathbb {R}^2. \]

Demonstração

Para 1, independência aplicada aos eventos \([X_i\leq x_i]\) fornece a fatorização da função de distribuição. Reciprocamente, se a função de distribuição fatora, diferenças sucessivas mostram que as probabilidades de retângulos semiabertos fatoram; como esses retângulos determinam a distribuição conjunta, segue a independência.

Para 2, no caso bidimensional, a independência aplicada aos eventos \([X=x]\) e \([Y=y]\) dá \(p(x,y)=p_X(x)p_Y(y)\). Na direção inversa, para quaisquer conjuntos \(A\) e \(B\),

\[ \begin{aligned} \P (X\in A,Y\in B) & =\sum _{x\in A}\sum _{y\in B}p_X(x)p_Y(y)\\ & =\P (X\in A)\P (Y\in B). \end{aligned} \]

O argumento em dimensão maior é o mesmo.

Para 3, se \(X\) e \(Y\) são independentes, então \(F_{X,Y}(x,y)=F_X(x)F_Y(y)\); derivando, obtemos \(f_{X,Y}(x,y)=f_X(x)f_Y(y)\). Reciprocamente, se as densidades fatoram,

\[ F_{X,Y}(x,y) =\int _{-\infty }^x\! f_X(u)\, du \int _{-\infty }^y\! f_Y(v)\, dv =F_X(x)F_Y(y), \]

e 1 conclui a prova.

Exemplo 6.11

Suponha que \( X \) e \( Y \) sejam variáveis aleatórias com a função de distribuição conjunta dada por

\[ F_{X, Y}(x, y) = \begin{cases} 1 - e^{-x} - e^{-y} + e^{-x-y} & \text{se } x, y \geq 0, \\ 0 & \text{caso contrário}. \end{cases} \]

Para encontrar a função de distribuição marginal de \( X \), podemos considerar:

\[ F_X(x) = \lim _{y \rightarrow \infty } F_{X, Y}(x, y) = \begin{cases} 1 - e^{-x} & \text{se } x \geq 0, \\ 0 & \text{caso contrário}. \end{cases} \]

Isso indica que \( X \) segue uma distribuição exponencial com parâmetro \( 1 \). Um cálculo análogo mostra que \( Y \) também segue uma distribuição exponencial com o mesmo parâmetro.

Podemos verificar a independência das variáveis \( X \) e \( Y \) observando que:

\[ F_{X, Y}(x, y) = F_X(x) F_Y(y) \quad \text{para todos } x, y \in \mathbb {R}, \]

o que confirma que \( X \) e \( Y \) são variáveis independentes.

Exemplo 6.12

Sejam \(n+m\) experimentos independentes, cada um com probabilidade de sucesso \(p\). Se \(X\) conta o número de sucessos nas primeiras \(n\) tentativas e \(Y\) nas últimas \(m\), então \(X\) e \(Y\) são variáveis aleatórias independentes. Isso ocorre porque o resultado das primeiras \(n\) tentativas não influencia o número de sucessos nas \(m\) tentativas restantes. De fato, para \(x\) e \(y\) inteiros,

\[ \begin{aligned} \P (X=x, Y=y) & =\left(\begin{array}{c} n \\ x \end{array}\right) p^x(1-p)^{n-x}\left(\begin{array}{c} m \\ y \end{array}\right) p^y(1-p)^{m-y} & & 0 \leq x \leq n, \\ & =\P (X=x) \P (Y=y) & & \end{aligned} \]

Por outro lado, o número de sucessos nas primeiras \(n\) tentativas, \(X\), e o número total de sucessos, \(Z\) são dependentes.

Exemplo 6.13 (Afinamento de Poisson e independência)

No capítulo anterior vimos que, se \(N\sim \operatorname {Poisson}(\lambda )\) e cada ocorrência é classificada independentemente como detectada com probabilidade \(p\), o número \(X\) de detectadas é \(\operatorname {Poisson}(\lambda p)\). Seja \(Y=N-X\) o número de não detectadas. Além das marginais, o afinamento produz independência.

De fato, para \(i,j\geq 0\),

\[ \begin{aligned} \P (X=i,Y=j) & =\P (N=i+j)\binom {i+j}{i}p^i(1-p)^j\\ & =\frac{e^{-\lambda p}(\lambda p)^i}{i!} \frac{e^{-\lambda (1-p)}[\lambda (1-p)]^j}{j!}. \end{aligned} \]

A última expressão é o produto das massas de \(\operatorname {Poisson}(\lambda p)\) e \(\operatorname {Poisson}(\lambda (1-p))\). Portanto, \(X\) e \(Y\) são independentes.

Exemplo 6.14

Suponha que \( X \) e \( Y \) sejam variáveis aleatórias com a seguinte função de distribuição conjunta:

\[ F_{X, Y}(x, y) = \begin{cases} 1 - e^{-x} - e^{-y} + e^{-x-y}, & \text{se } x, y \geq 0, \\ 0, & \text{caso contrário}. \end{cases} \]

Para determinar a função de distribuição marginal de \( X \), podemos calcular:

\[ F_X(x) = \lim _{y \rightarrow \infty } F_{X, Y}(x, y) = \begin{cases} 1 - e^{-x}, & \text{se } x \geq 0, \\ 0, & \text{caso contrário}. \end{cases} \]

Assim, podemos concluir que \( X \) segue uma distribuição exponencial com parâmetro \( 1 \). Um cálculo semelhante revela que \( Y \) também segue uma distribuição exponencial com o mesmo parâmetro.

Além disso, podemos verificar que:

\[ F_{X, Y}(x, y) = F_X(x) F_Y(y) \quad \text{para todos } x, y \in \mathbb {R}, \]

o que implica que \( X \) e \( Y \) são variáveis independentes.

Exemplo 6.15 (Variáveis Aleatórias Dependentes)

Para ver a dependência geometricamente, considere \( X \) e \( Y \) como definidos no Exemplo 6.10. Para \( -R \lt x \lt R \) e \( -R \lt y \lt R \), temos:

\[ f_X(x) f_Y(y) = \frac{4 \sqrt{R^2 - x^2} \sqrt{R^2 - y^2}}{\pi ^2 R^4}, \]

o que não coincide com a densidade conjunta dessas variáveis e assim concluímos que \( X \) e \( Y \) são variáveis aleatórias dependentes.

Isso está de acordo com nossa intuição de dependência, pois, quando \( X \) está próximo de \( R \), \( Y \) deve estar próximo de zero. Assim, obter informações sobre \( X \) nos fornece informações sobre \( Y \).

Exemplo 6.16

Dois amigos planejam se encontrar na biblioteca dentro do intervalo de uma hora. Seus horários de chegada são independentes e distribuídos uniformemente ao longo do período de uma hora. Cada um concorda em esperar por 15 minutos, ou até o final da hora. Se o outro não aparecer nesse tempo, a pessoa parte. Qual é a probabilidade de os dois amigos se encontrarem?

Sol Se \(X_1\) denota o horário de chegada do primeiro amigo no intervalo (0,1), o período de uma hora, e se \(X_2\) denota o horário de chegada do segundo amigo, então \(\left(X_1, X_2\right)\) pode ser modelado como tendo uma distribuição uniforme bidimensional sobre o quadrado unitário; isto é,

\[ f\left(x_1, x_2\right)= \begin{cases} 1, & 0 \leq x_1 \leq 1, 0 \leq x_2 \leq 1 \\ 0, & \text{ caso contrário. }\end{cases} \]

O evento de os dois amigos se encontrarem depende do tempo \(Y\) entre suas chegadas, onde

\[ Y=\left|X_1-X_2\right| \text{. } \]

Podemos resolver o problema encontrando primeiro a distribuição de \(Y\). Como

\[ \begin{aligned} Y \leq y & \Rightarrow \left|X_1-X_2\right| \leq y \\ & \Rightarrow -y \leq X_1-X_2 \leq y . \end{aligned} \]

A Figura 6.5 mostra que a região quadrada sobre a qual \(\left(X_1, X_2\right)\) tem probabilidade positiva e a região definida por \(Y \leq y\). A probabilidade de \(Y \leq y\) pode ser encontrada integrando a função de densidade conjunta de \(\left(X_1, X_2\right)\) sobre a região de seis lados mostrada no centro da Figura 6.5. Isso pode ser simplificado integrando sobre os triângulos \(\left(A_1\right.\) e \(\left.A_2\right)\) e subtraindo de 1, como veremos agora.

Temos

\[ \begin{aligned} F_Y(y)=\P (Y \leq y) & =\int \int _{\left|x_1-x_2\right| \leq y} f\left(x_1, x_2\right) \mathrm{d} x_1 \mathrm{~ d} x_2 \\ & =1-\int _{A_1} \int f\left(x_1, x_2\right) \mathrm{d} x_1 \mathrm{~ d} x_2-\int _{A_2} \int f\left(x_1, x_2\right) \mathrm{d} x_1 \mathrm{~ d} x_2 \\ & =1-\int _y^1 \int _0^{x_2-y}(1) \mathrm{d} x_1 \mathrm{~ d} x_2-\int _0^{1-y} \int _{x_2+y}^1(1) \mathrm{d} x_1 \mathrm{~ d} x_2 \end{aligned} \]
\[ \begin{aligned} & =1-\int _y^1\left(x_2-y\right) \mathrm{d} x_2-\int _0^{1-y}\left(1-y-x_2\right) \mathrm{d} x_2 \\ & =1-\left[\frac{1}{2} x_2^2-x_2 y\right]_y^1-\left[x_2-x_2 y-\frac{1}{2} x_2^2\right]_0^{1-y} \\ & =1-\frac{1}{2}(1-y)^2-\frac{1}{2}(1-y)^2 \\ & =1-(1-y)^2, \quad 0 \leq y \leq 1 . \end{aligned} \]

O problema solicita a probabilidade de um encontro se cada amigo esperar até 15 minutos. Como 15 minutos é \(1/4\) de hora, isso pode ser encontrado avaliando

\[ \begin{aligned} \P \left(Y \leq \frac{1}{4}\right) & =F_Y\left(\frac{1}{4}\right) \\ & =1-\left(1-\frac{1}{4}\right)^2 \\ & =1-\left(\frac{3}{4}\right)^2 \\ & =\frac{7}{16} \\ & =0.4375 . \end{aligned} \]

Há menos de 50% de chance de que os dois amigos se encontrem sob essa regra.

Exemplo 6.17 (Agulha de Buffon)

Uma agulha de comprimento \(2a\) é lançada ao acaso sobre um plano coberto por retas paralelas separadas por distância \(2b\), com \(a\lt b\). Seja \(X\) a distância do centro da agulha à reta mais próxima e \(\Theta \) o ângulo entre a agulha e a direção perpendicular às retas. Pelo modelo geométrico,

\[ X\sim \operatorname {Unif}(0,b), \qquad \Theta \sim \operatorname {Unif}(0,\pi /2), \]

e tomamos \(X\) e \(\Theta \) independentes. Assim, no retângulo \(0\lt x\lt b\), \(0\lt \theta \lt \pi /2\), a densidade conjunta é constante:

\[ f_{X,\Theta }(x,\theta )=\frac{2}{\pi b}. \]

A agulha cruza uma reta exatamente quando \(X\lt a\cos \Theta \). Portanto,

\[ \begin{aligned} p & =\P (X\lt a\cos \Theta )\\ & =\frac{2}{\pi b} \int _0^{\pi /2}\int _0^{a\cos \theta }dx\, d\theta =\frac{2a}{\pi b}. \end{aligned} \]

Se, em \(n\) lançamentos, ocorrerem \(n_\ell \) cruzamentos, a frequência relativa \(n_\ell /n\) sugere a aproximação

\[ \pi \approx \frac{2an}{b n_\ell }. \]

Figura 6.6 Agulha de Buffon

Figura 6.6 Agulha de Buffon

Exemplo 6.18 (Normal bivariada)

Dizemos que \((X,Y)\) tem distribuição normal bivariada com parâmetros \(\mu _1,\mu _2\), \(\sigma _1,\sigma _2\gt 0\) e \(-1\lt \rho \lt 1\) quando

\[ f(x,y)=\frac{1}{2\pi \sigma _1\sigma _2\sqrt{1-\rho ^2}} \exp \! \left\{ -\frac{1}{2(1-\rho ^2)} \left[ \left(\frac{x-\mu _1}{\sigma _1}\right)^2 -2\rho \left(\frac{x-\mu _1}{\sigma _1}\right) \left(\frac{y-\mu _2}{\sigma _2}\right) +\left(\frac{y-\mu _2}{\sigma _2}\right)^2 \right]\right\} . \]

A forma da densidade parece complicada, mas completar o quadrado revela sua estrutura. Escrevendo \(u=(x-\mu _1)/\sigma _1\) e \(v=(y-\mu _2)/\sigma _2\),

\[ \frac{u^2-2\rho uv+v^2}{1-\rho ^2} =u^2+\frac{(v-\rho u)^2}{1-\rho ^2}. \]

Por isso, para cada \(x\), a densidade pode ser vista como o produto da densidade \(N(\mu _1,\sigma _1^2)\) em \(x\) por uma densidade normal em \(y\) com média

\[ \mu _2+\rho \frac{\sigma _2}{\sigma _1}(x-\mu _1) \]

e variância \((1-\rho ^2)\sigma _2^2\). Integrando em \(y\), obtemos \(X\sim N(\mu _1,\sigma _1^2)\); por simetria, \(Y\sim N(\mu _2,\sigma _2^2)\).

Quando \(\rho =0\), a densidade conjunta se reduz ao produto das duas marginais, e \(X\) e \(Y\) são independentes. Para \(\rho \neq 0\), a fatorização falha. Mais adiante, ao estudar correlação, veremos que o parâmetro \(\rho \) coincide com o coeficiente de correlação desse vetor.

6.5 Soma de variáveis aleatórias independentes

Somas aparecem ao acumular tempos, custos, contagens ou erros. Em geral, as distribuições de \(X\) e \(Y\) não determinam a de \(X+Y\), pois a dependência entre as parcelas também interfere. Quando \(X\) e \(Y\) são independentes, a distribuição da soma pode ser calculada a partir das marginais. No caso com densidade, o cálculo envolve as retas \(x+y=z\). Suponha inicialmente que \((X,Y)\) tenha densidade conjunta \(f_{X,Y}\). Então:

\begin{align} F_{X+Y}(z) & =\P ( X+Y \leq z ) \tag{6.8} \\ & =\iint _{x+y \leq z} f_{X, Y}(x, y) d x d y \tag{6.9} \\ & =\int _{-\infty }^{\infty }\left[\int _{-\infty }^{z-x} f_{X, Y}(x, y) d y\right] d x \quad \text{ subst. } y=u-x. \tag{6.10} \\ & =\int _{-\infty }^{\infty }\left[\int _{-\infty }^z f_{X, Y}(x, u-x) d u\right] d x \label{eq:conv} \tag{6.11} \\ \end{align}

Para obter a densidade tomamos a derivada:

\[ \begin{aligned} \frac{d F_{X+Y}(z)}{d z} & =\frac{d}{dz}\left\{ \int _{-\infty }^{z} \left[\int _{-\infty }^{\infty } f_{X,Y}(x,u-x)\, dx\right]du\right\} , \end{aligned} \]

assim, concluímos que

\begin{equation} f_{X+Y}(z)=\int _{-\infty }^{\infty } f_{X Y}(x, z-x) d x \label{eq:conv31}. \tag{6.13} \end{equation}

Se as variáveis \(X\) e \(Y\) são independentes podemos reescrever 6.13 como

\begin{equation} f_{X+Y}(z)=\int _{-\infty }^{\infty } f_{X}(z-t) f_{Y}(t) d t=\int _{-\infty }^{\infty } f_{X}(t) f_{Y}(z-t) d t \label{eq:convb} \tag{6.14} \end{equation}

Com isso está provada a seguinte proposição.

Proposição 6.4

Sejam \(X\) e \(Y\) variáveis aleatórias.

  1. Se \(X\) e \(Y\) têm densidade conjunta \(f_{X,Y}(x, y)\), então

    \[ f_{X+Y}(z)=\int _{-\infty }^{\infty } f_{X,Y}(z-t, t) d t=\int _{-\infty }^{\infty } f_{X,Y}(t, z-t) d t \]
  2. Se \(X\) e \(Y\) são independentes e possuem densidades \(f_{X}\) e \(f_{Y}\), então (por 1 \(\text{ e }\) a 3.) \(X+Y\) tem densidade

    \[ f_{X+Y}(z)=\int _{-\infty }^{\infty } f_{X}(z-t) f_{Y}(t) d t=\int _{-\infty }^{\infty } f_{X}(t) f_{Y}(z-t) d t \]

O mesmo raciocínio fornece, para a diferença,

\[ f_{X-Y}(w)=\int _{-\infty }^{\infty }f_{X,Y}(w+y,y)\, dy. \]

Se \(X\) e \(Y\) forem independentes, essa expressão é a convolução de \(f_X\) com a densidade de \(-Y\).

Definição 6.4
Se \(f_{1}\) e \(f_{2}\) são densidades de variáveis aleatórias, sua convolução \(f_{1} * f_{2}\) é definida por
\[ f_{1} * f_{2}(x)=\int _{-\infty }^{\infty } f_{1}(x-t) f_{2}(t) d t \]
Portanto, pela proposição, se \(X\) e \(Y\) são independentes e absolutamente contínuas, então \(f_{X} * f_{Y}\) é densidade da soma \(X+Y\).

Soma de duas variáveis aleatórias uniformes independentes

A convolução já produz um exemplo geométrico importante: a soma de duas uniformes não é uniforme.

Proposição 6.5 (Soma de duas variáveis aleatórias uniformes independentes)

Se \(X\) e \(Y\) são variáveis aleatórias independentes, ambas uniformemente distribuídas em \((0,1)\), então a densidade de \(X+Y\) é

\[ f_{X+Y}(a)= \begin{cases} a & 0 \leq a \leq 1 \\ 2-a & 1\lt a\lt 2 \\ 0 & \text{ caso contrário }\end{cases} \]

Demonstração

A densidade de \(X+Y\) toma valores diferentes de \(0\) em \((0,2).\)

Da Equação 6.14, como

\[ f_{X}(a)=f_{Y}(a)= \begin{cases} 1 & 0\lt a\lt 1 \\ 0 & \text{ caso contrário }\end{cases} \]

obtemos

\[ f_{X+Y}(a)=\int _{0}^{1} f_{X}(a-y) d y \]

O intervalo de integração depende de \(a\):

Para \(0 \leq a \leq 1\), temos que

\[ f_{X+Y}(a)=\int _{0}^{a} d y=a. \]

Para \(1\lt a\lt 2\), obtemos

\[ f_{X+Y}(a)=\int _{a-1}^{1} d y=2-a. \]

E assim

\[ f_{X+Y}(a)= \begin{cases} a & 0 \leq a \leq 1 \\ 2-a & 1\lt a\lt 2 \\ 0 & \text{ caso contrário }\end{cases} \]

A variável aleatória \(U = X + Y\) tem distribuição triangular, nome que se refere ao formato de sua densidade, representado na Figura 6.7.

Variáveis aleatórias normais

A Equação 6.14 também permite demonstrar o resultado seguinte sobre somas de variáveis aleatórias normais.

Proposição 6.6
Se \(X_{i}, i=1, \ldots , n\), são variáveis aleatórias independentes normalmente distribuídas com respectivos parâmetros \(\mu _{i}, \sigma _{i}^{2}, i=1, \ldots , n\), então \(\displaystyle \sum _{i=1}^{n} X_{i}\) é normalmente distribuída com parâmetros \(\displaystyle \sum _{i=1}^{n} \mu _{i} \) e \( \displaystyle \sum _{i=1}^{n} \sigma _{i}^{2}\).

Demonstração

Para começar, suponha que \(X\) e \(Y\) sejam variáveis aleatórias normais independentes, onde \(X\) possui média 0 e variância \(\sigma ^2\), enquanto \(Y\) possui média 0 e variância 1. Nosso objetivo é determinar a densidade de \(X + Y\) a partir da Equação \(\ref{eq:convb}\).

Primeiramente, observemos que

\[ \begin{aligned} f_{X}(a - y)\, f_{Y}(y) & = \frac{1}{\sqrt{2\pi }\, \sigma } \exp \! \Bigl(-\tfrac {(a-y)^2}{2\sigma ^2}\Bigr) \; \frac{1}{\sqrt{2\pi }} \exp \! \Bigl(-\tfrac {y^2}{2}\Bigr) \\ & = \frac{1}{2\pi \, \sigma } \exp \! \Bigl(-\tfrac {a^2}{2\sigma ^2}\Bigr)\, \exp \! \Bigl[-c\Bigl(y^2 - 2\, y\, \tfrac {a}{1+\sigma ^2}\Bigr)\Bigr], \end{aligned} \]

onde

\[ c \; =\; \frac{1}{2\, \sigma ^2} + \frac{1}{2} \; =\; \frac{1 + \sigma ^2}{2\, \sigma ^2}. \]

A partir da Equação \(\ref{eq:convb}\) e completando quadrados, deduzimos que a densidade de \(X + Y\) em \(a\) é:

\begin{align*} f_{X+Y}(a) & = \frac{1}{2\pi \, \sigma }\, \exp \! \Bigl(-\tfrac {a^2}{2\sigma ^2}\Bigr)\, \exp \! \Bigl(\tfrac {a^2}{2\, \sigma ^2\, (1+\sigma ^2)}\Bigr) \int _{-\infty }^{\infty } \exp \! \Bigl[-c\Bigl(y - \tfrac {a}{1+\sigma ^2}\Bigr)^2\Bigr]\, dy \\ & = \frac{1}{2\pi \, \sigma }\, \exp \! \Bigl(-\tfrac {a^2}{2\, (1+\sigma ^2)}\Bigr) \int _{-\infty }^{\infty } \exp \! \bigl(-c\, x^2\bigr)\, dx \\ & = C\, \exp \! \Bigl(-\tfrac {a^2}{2\, (1+\sigma ^2)}\Bigr), \end{align*}

onde \(C\) não depende de \(a\). Conclui-se, portanto, que \(X + Y\) é normal com média 0 e variância \(\, 1 + \sigma ^2\).

Para passar ao caso geral, suponha que \(X_1\) e \(X_2\) sejam normais independentes com médias \(\mu _1\) e \(\mu _2\) e variâncias \(\sigma _1^2\) e \(\sigma _2^2\), respectivamente. Então,

\[ X_1 + X_2 = \sigma _2 \Bigl(\tfrac {X_1 - \mu _1}{\sigma _2} + \tfrac {X_2 - \mu _2}{\sigma _2}\Bigr) + (\mu _1 + \mu _2). \]

A variável \(\tfrac {X_1 - \mu _1}{\sigma _2}\) é normal com média 0 e variância \(\tfrac {\sigma _1^2}{\sigma _2^2}\), enquanto \(\tfrac {X_2 - \mu _2}{\sigma _2}\) é normal com média 0 e variância 1. Com base no resultado anterior, a soma

\[ \frac{X_1 - \mu _1}{\sigma _2} \; +\; \frac{X_2 - \mu _2}{\sigma _2} \]

é normal com média 0 e variância \(1 + \tfrac {\sigma _1^2}{\sigma _2^2}\). Dessa forma, \(X_1 + X_2\) é normal com média \(\mu _1 + \mu _2\) e variância

\[ \sigma _2^2 \Bigl(1 + \tfrac {\sigma _1^2}{\sigma _2^2}\Bigr) = \sigma _1^2 + \sigma _2^2. \]

Assim, comprova-se a Proposição \(\ref{prop:somadenormais}\) para \(n = 2\). O caso geral segue por indução.

Exemplo 6.19

Um time de futebol jogará uma temporada com 40 partidas. Vinte e seis dessas partidas serão contra times da divisão \(\mathrm{A}\), e 14 contra times da divisão \(\mathrm{B}\). Suponha que o time ganhe cada partida disputada contra um adversário da divisão A com probabilidade 0,4, e ganhe cada partida disputada contra um adversário da divisão B com probabilidade 0,8. Suponha também que os resultados das diferentes partidas sejam independentes. Obtenha um valor aproximado para a probabilidade de que

  1. o time vença 25 partidas ou mais;

  2. o time vença mais partidas contra times da divisão A do que contra times da divisão \(B\).

Sol 1 Sejam \(X_{A}\) e \(X_{B}\) variáveis aleatórias que representam, respectivamente, o número de partidas que o time vence contra equipes da divisão A e B. \(X_{A}\) e \(X_{B}\) são binomiais independentes com

\[ \begin{array}{ll} \mathbf{E}[X_{A}]=26(0,4)=10,4 & \operatorname {Var}(X_{A})=26(0,4)(0,6)=6,24 \\ \mathbf{E}[X_{B}]=14(0,8)=11,2 & \operatorname {Var}(X_{B})=14(0,8)(0,2)=2,24 \end{array} \]

Pela aproximação normal para a distribuição binomial, \(X_{A}\) e \(X_{B}\) têm aproximadamente a mesma distribuição que teriam variáveis aleatórias normais independentes com os valores esperados e as variâncias acima. Portanto, pela Proposição 6.6, \(X_{A}+X_{B}\) terá aproximadamente uma distribuição normal com média \(\mu = 21,6\) e variância \(\sigma ^2 = 8,48\). Assim, fazendo com que \(Z\) represente uma variável aleatória normal padrão, temos: 1

\[ \begin{aligned} \P (X_{A}+X_{B} \geq 25) & = \P (X_{A}+X_{B} \geq 24,5) \quad \text{ (correção de continuidade) } \\ & = \P \left(\frac{X_{A}+X_{B}-\mu }{\sigma } \geq \frac{24,5-\mu }{\sigma }\right) \\ & \approx \P \left(Z \geq \frac{24,5-21,6}{\sqrt{8,48}}\right) \\ & \approx \P (Z \geq 0,9947) \\ & \approx 1-\Phi (0,9947) \\ & \approx 0,1600 \end{aligned} \]

onde \(\Phi \) é a função de distribuição da normal padrão.

2 Notamos que \(X_{A}-X_{B}\) tem aproximadamente uma distribuição normal com média \(\mu = -0,8\) e variância \(\sigma ^2 = 8,48\). Com isso,

\[ \begin{aligned} \P (X_{A}-X_{B} \geq 1) & = \P (X_{A}-X_{B} \geq 0,5) \quad \text{(correção de continuidade)} \\ & = \P \left(\frac{X_{A}-X_{B}-\mu }{\sigma } \geq \frac{0,5-\mu }{\sigma }\right) \\ & \approx \P \left(Z \geq \frac{0,5+0,8}{\sqrt{8,48}}\right) \\ & \approx \P (Z \geq 0,4472) \\ & \approx 1-\Phi (0,4472) \\ & \approx 0,3274 \end{aligned} \]

Assim, há aproximadamente \(16,00\% \) de chances de que o time ganhe pelo menos 25 partidas, e aproximadamente \(32,74\% \) de chances de que o time ganhe mais partidas contra times da divisão \(A\) do que contra times da divisão \(B\).

Soma de variáveis aleatórias gama

Recordemos a definição da variável aleatória gama de parâmetros \((t,\lambda )\), cuja função densidade de probabilidade tem a forma:

\[ f(y) = \frac{\lambda e^{-\lambda y}(\lambda y)^{t-1}}{\Gamma (t)}, \quad 0 \lt y \lt \infty \]

onde \(\Gamma (t) = \int _0^{\infty } x^{t-1}e^{-x}dx\) é a função gama. Esta função é uma extensão do fatorial para os reais positivos; para um inteiro positivo \(n\), temos \(\Gamma (n+1) = n!\).

Proposição 6.7
Se \(X\) e \(Y\) são variáveis aleatórias gama independentes com parâmetros \((s, \lambda )\) e \((t, \lambda )\) respectivamente, então \(X+Y\) é uma variável aleatória gama com parâmetros \((s+t, \lambda )\).

Demonstração

Utilizando a fórmula de convolução (Equação 6.14), obtemos:

\begin{align*} f_{X+Y}(a) & = \frac{1}{\Gamma (s) \Gamma (t)} \int _0^a \lambda e^{-\lambda (a-y)}[\lambda (a-y)]^{s-1} \lambda e^{-\lambda y}(\lambda y)^{t-1} dy \\ & = K e^{-\lambda a} \int _0^a (a-y)^{s-1} y^{t-1} dy \\ & = K e^{-\lambda a} a^{s+t-1} \int _0^1 (1-x)^{s-1} x^{t-1} dx \quad \text{(fazendo } x = \frac{y}{a}\text{)} \\ & = C e^{-\lambda a} a^{s+t-1} \end{align*}

onde \(K\) e \(C\) são constantes que não dependem de \(a\).

Como \(f_{X+Y}(a)\) é uma função densidade de probabilidade, sua integral em todo o domínio deve ser igual a 1, o que nos permite determinar o valor de \(C\). Consequentemente, temos:

\[ f_{X+Y}(a) = \frac{\lambda e^{-\lambda a}(\lambda a)^{s+t-1}}{\Gamma (s+t)} \]

Isto conclui a demonstração, mostrando que \(X+Y\) segue uma distribuição gama com parâmetros \((s+t, \lambda )\).

Exemplo 6.20 (Duas lâmpadas em sequência)
Duas lâmpadas têm vidas independentes exponenciais com média \(5\) anos, isto é, taxa \(1/5\). Se a segunda é instalada quando a primeira queima, o tempo total \(T=X_1+X_2\) satisfaz
\[ T\sim \operatorname {Gama}\left(2,\frac15\right) \]
na parametrização forma–taxa adotada neste livro. Portanto,
\[ \P (T\geq 15)=e^{-3}(1+3)=4e^{-3}\approx 0{,}199. \]

Pode-se demonstrar por indução, utilizando a Proposição 6.7, que para variáveis aleatórias gama \(X_i\), \(i = 1, \ldots , n\), com parâmetros respectivos \((t_i, \lambda )\), \(i = 1, \ldots , n\), a soma \(\sum _{i=1}^n X_i\) segue uma distribuição gama com parâmetros \((\sum _{i=1}^n t_i, \lambda )\). A prova formal deste resultado fica como exercício para o leitor.

Exemplo 6.21
Considere \(X_1, X_2, \ldots , X_n\) como \(n\) variáveis aleatórias exponenciais independentes, cada uma com parâmetro \(\lambda \). Sabendo que uma variável aleatória exponencial com parâmetro \(\lambda \) é equivalente a uma variável aleatória gama com parâmetros \((1, \lambda )\), podemos aplicar a Proposição 6.7. Consequentemente, \(X_1 + X_2 + \cdots + X_n\) segue uma distribuição gama com parâmetros \((n, \lambda )\).

Somas de variáveis aleatórias de Poisson independentes

Proposição 6.8
Se \(X\) e \(Y\) são variáveis aleatórias de Poisson independentes com respectivos parâmetros \(\lambda _{1}\) e \(\lambda _{2}\), então \(X+Y\) tem uma distribuição de Poisson com parâmetro \(\lambda _{1}+\lambda _{2}\).

Demonstração

Como o evento \([X+Y=n]\) pode ser expresso como a união dos eventos disjuntos \([X=k, Y=n-k]\), para \(0 \leq k \leq n\), temos:

\[ \begin{aligned} \P ( X+Y=n ) & =\sum _{k=0}^{n} \P ( X=k, Y=n-k ) \\ & =\sum _{k=0}^{n} \P ( X=k ) \P ( Y=n-k ) \\ & =\sum _{k=0}^{n} e^{-\lambda _{1}} \frac{\lambda _{1}^{k}}{k !} e^{-\lambda _{2}} \frac{\lambda _{2}^{n-k}}{(n-k) !} \\ & =e^{-\left(\lambda _{1}+\lambda _{2}\right)} \sum _{k=0}^{n} \frac{\lambda _{1}^{k} \lambda _{2}^{n-k}}{k !(n-k) !} \\ & =\frac{e^{-\left(\lambda _{1}+\lambda _{2}\right)}}{n !} \sum _{k=0}^{n} \frac{n !}{k !(n-k) !} \lambda _{1}^{k} \lambda _{2}^{n-k} \\ & =\frac{e^{-\left(\lambda _{1}+\lambda _{2}\right)}}{n !}\left(\lambda _{1}+\lambda _{2}\right)^{n} \quad \text{ (binômio de Newton)} \end{aligned} \]

Logo, \(X+Y\) segue uma distribuição de Poisson com parâmetro \(\lambda _{1}+\lambda _{2}\).

Somas de variáveis aleatórias binomiais independentes

Proposição 6.9

Sejam \(X\) e \(Y\) variáveis aleatórias binomiais independentes com respectivos parâmetros \((n, p)\) e \((m, p)\). Então \(X+Y\) é binomial com parâmetros \((n+m, p)\).

Demonstração

A partir da interpretação de uma variável aleatória binomial, e sem necessidade de cálculos, podemos concluir diretamente que \(X+Y\) é binomial com parâmetros \((n+m, p)\). Isso se deve ao fato de que \(X\) representa o número de sucessos em \(n\) tentativas independentes, cada uma com probabilidade de sucesso \(p\), e \(Y\) representa o número de sucessos em \(m\) tentativas independentes, também com probabilidade de sucesso \(p\). Assim, pela independência de \(X\) e \(Y\), \(X+Y\) corresponde ao número de sucessos em um total de \(n+m\) tentativas independentes, cada uma com probabilidade \(p\) de sucesso. Portanto, \(X+Y\) é uma variável aleatória binomial com parâmetros \((n+m, p)\).

Para verificar essa conclusão analiticamente, note que

\[ \begin{aligned} \P ( X+Y=k ) & =\sum _{i=0}^{n} \P ( X=i, Y=k-i ) \\ & =\sum _{i=0}^{n} \P ( X=i ) \P ( Y=k-i ) \\ & =\sum _{i=0}^{n}\left(\begin{array}{c} n \\ i \end{array}\right) p^{i} q^{n-i}\left(\begin{array}{c} m \\ k-i \end{array}\right) p^{k-i} q^{m-k+i} \end{aligned} \]

onde \(q=1-p\) e adotamos \(\binom {r}{j}=0\) quando \(j\lt 0\) ou \(j\gt r\). Assim,

\[ \P ( X+Y=k )=p^{k} q^{n+m-k} \sum _{i=0}^{n}\left(\begin{array}{c} n \\ i \end{array}\right)\left(\begin{array}{c} m \\ k-i \end{array}\right) \]

e a conclusão segue da identidade combinatória:

\[ \left(\begin{array}{c} n+m \\ k \end{array}\right)=\sum _{i=0}^{n}\left(\begin{array}{c} n \\ i \end{array}\right)\left(\begin{array}{c} m \\ k-i \end{array}\right) \]

6.6 Distribuição condicional

A distribuição conjunta contém a informação necessária para estudar como a distribuição de \(X\) se altera quando obtemos informação sobre \(Y\). A probabilidade condicional, apresentada para eventos em um capítulo anterior, será agora usada para definir distribuições condicionais de variáveis aleatórias. No caso discreto, fixamos um evento \(Y=y\) com probabilidade positiva e renormalizamos. No caso contínuo, \(\P (Y=y)=0\), portanto não dividimos por essa probabilidade. Condicionamos primeiro numa faixa \(y\lt Y\leq y+h\) e deixamos \(h\downarrow 0\). Sob as hipóteses usuais,

\[ \P (X\in A\mid y\lt Y\leq y+h) \longrightarrow \int _A f_{X\mid Y}(x\mid y)\, dx. \]

Sob essas hipóteses, o limite motiva a definição no caso contínuo. As fórmulas nos dois casos têm formas análogas:

\[ p_{X\mid Y}(x\mid y)=\frac{p_{XY}(x,y)}{p_Y(y)}, \qquad f_{X\mid Y}(x\mid y)=\frac{f_{XY}(x,y)}{f_Y(y)}. \]

Para cada valor admissível de \(y\), elas definem uma distribuição em \(x\).

Antes de fixar um valor, vale registrar a versão para uma faixa. Se \(\P (y_1\lt Y\leq y_2)\gt 0\), definimos

\begin{align} F_{X\mid \{ y_1\lt Y\leq y_2\} }(x) & \coloneqq \P (X\leq x\mid y_1\lt Y\leq y_2) \tag{6.15}\\ & =\frac{F_{X,Y}(x,y_2)-F_{X,Y}(x,y_1)}{F_Y(y_2)-F_Y(y_1)}. \label{eq:cond} \tag{6.16} \end{align}

6.6.1 Variáveis aleatórias discretas

Se \(Y\) é discreta e \(\P (Y=y)\gt 0\), a definição usual de probabilidade condicional pode ser aplicada diretamente. Para qualquer \(X\),

\[ F_{X\mid Y}(x\mid y) =\P (X\leq x\mid Y=y) =\frac{\P (X\leq x,\, Y=y)}{\P (Y=y)}. \]

A lei da probabilidade total recupera a distribuição marginal:

\[ F_X(x)=\sum _y \P (Y=y)F_{X\mid Y}(x\mid y). \]

Se \(X\) também é discreta, podemos trabalhar diretamente com as massas pontuais.

Definição 6.5

Se \(X\) e \(Y\) são ambas variáveis aleatórias discretas

  • A função de probabilidade condicional de \(X\) dado \(Y=y\) é definida, para todo \(y\) com \(p_Y(y) \gt 0\), como

    \[ \begin{aligned} p_{X \mid Y}(x \mid y) & \coloneqq \P ( X=x \mid Y=y ) \\ & =\frac{\P ( X=x, Y=y )}{\P ( Y=y )} \\ & =\frac{p(x, y)}{p_Y(y)} \end{aligned} \]

    para todos os valores de \(y\) tais que \(p_Y(y)\gt 0\).

  • a função de distribuição condicional de \(X\) dado \(Y=y\) é definida, para todo \(y\) com \(p_Y(y) \gt 0\), como

    \[ \begin{aligned} F_{X \mid Y}(x \mid y) & \coloneqq \P ( X \leq x \mid Y=y ) \\ & =\sum _{a \leq x} p_{X \mid Y}(a \mid y) \end{aligned}. \]

Em outras palavras, essas definições são análogas ao caso incondicional de \(X\), mas agora tudo é condicionado no evento \(Y = y\). Se \(X\) for independente de \(Y\), então as funções de probabilidade e de distribuição condicionais coincidem com as respectivas funções incondicionais. Isso ocorre pois, nesse caso,

\[ \begin{aligned} p_{X \mid Y}(x \mid y) & =\P ( X=x \mid Y=y ) \\ & =\frac{\P ( X=x, Y=y )}{\P ( Y=y )} \\ & =\frac{\P ( X=x ) \P ( Y=y )}{\P ( Y=y )} \\ & =\P ( X=x ) \end{aligned} \]

Exemplo 6.22

Se \(X\) e \(Y\) são variáveis aleatórias de Poisson independentes com respectivos parâmetros \(\lambda _1\) e \(\lambda _2\), calcule a distribuição condicional de \(X\) dado que \(X+Y=n\).

Sol

A função de probabilidade condicional de \(X\) dado \(X+Y=n\) é

\[ \begin{aligned} p_{X \mid X+Y}(k \mid n) & =\P ( X=k \mid X+Y=n ) \\ & =\frac{\P ( X=k, X+Y=n )}{\P ( X+Y=n )} \\ & =\frac{\P ( X=k, Y=n-k )}{\P ( X+Y=n )} \\ & =\frac{\P ( X=k ) \P ( Y=n-k )}{\P ( X+Y=n )} \end{aligned} \]

onde a última igualdade é consequência da hipótese de independência de \(X\) e \(Y\). Na Proposição 6.8 mostramos que \(X+Y\) tem uma distribuição de Poisson com parâmetro \(\lambda _1+\lambda _2\), e assim temos

\[ \begin{aligned} \P ( X=k \mid X+Y=n ) & =\frac{e^{-\lambda _1} \lambda _1^k}{k !} \frac{e^{-\lambda _2} \lambda _2^{n-k}}{(n-k) !}\left[\frac{e^{-\left(\lambda _1+\lambda _2\right)}\left(\lambda _1+\lambda _2\right)^n}{n !}\right]^{-1} \\ & =\frac{n !}{(n-k) ! k !} \frac{\lambda _1^k \lambda _2^{n-k}}{\left(\lambda _1+\lambda _2\right)^n} \\ & =\left(\begin{array}{l} n \\ k \end{array}\right)\left(\frac{\lambda _1}{\lambda _1+\lambda _2}\right)^k\left(\frac{\lambda _2}{\lambda _1+\lambda _2}\right)^{n-k} \end{aligned} \]

Logo a distribuição condicional de \(X\) dado que \(X+Y=n\) é uma binomial com parâmetros \(n\) e \(\lambda _1 /\left(\lambda _1+\lambda _2\right)\).

6.6.2 Variáveis aleatórias contínuas

Se \(Y\) é contínua, em geral \(\P (Y=y)=0\), de modo que não podemos dividir por essa probabilidade. Em vez disso, condicionamos em uma faixa estreita \(y\lt Y\leq y+\Delta y\). Para \(\Delta y\gt 0\),

\[ f_{X\mid \{ y\lt Y\leq y+\Delta y\} }(x) =\frac{\displaystyle \int _y^{y+\Delta y}f_{XY}(x,s)\, ds}{\displaystyle \int _y^{y+\Delta y}f_Y(s)\, ds}. \]

Quando \(\Delta y\to 0\), numerador e denominador são, em primeira ordem, \(f_{XY}(x,y)\Delta y\) e \(f_Y(y)\Delta y\). Isso motiva a definição seguinte.

Definição 6.6
Para todo \(y\) tal que \(f_Y(y)\gt 0\), a densidade condicional de \(X\) dado \(Y=y\) é
\[ f_{X\mid Y}(x\mid y)=\frac{f_{XY}(x,y)}{f_Y(y)}. \]
Para cada \(y\) admissível, essa expressão é de fato uma densidade em \(x\), pois

\[ \int _{-\infty }^{\infty }f_{X\mid Y}(x\mid y)\, dx =\frac{1}{f_Y(y)}\int _{-\infty }^{\infty }f_{XY}(x,y)\, dx =1. \]

De modo análogo,

\[ f_{Y\mid X}(y\mid x)=\frac{f_{XY}(x,y)}{f_X(x)}. \]

Se \(X\) e \(Y\) são independentes, \(f_{XY}(x,y)=f_X(x)f_Y(y)\), e portanto

\[ f_{X\mid Y}(x\mid y)=f_X(x), \qquad f_{Y\mid X}(y\mid x)=f_Y(y). \]

Ou seja, condicionar não altera a distribuição quando as variáveis são independentes.

A função de distribuição condicional é obtida integrando a densidade condicional:

Definição 6.7
A função de distribuição condicional de \(X\) dado \(Y=y\) é
\[ F_{X\mid Y}(x\mid y) =\int _{-\infty }^{x} f_{X\mid Y}(z\mid y)\, dz. \]

Como consequência, as seguintes fórmulas são válidas:

\[ \begin{aligned} & F_{X, Y}(x, y)=\int _{-\infty }^{y} f_{Y}(z) F_{X \mid Y}(x \mid z) d z \\ & F_{X}(x)=\int _{-\infty }^{\infty } f_{Y}(y) F_{X \mid Y}(x \mid y) d y \end{aligned} \]

Exemplo 6.23

Dado

\[ f_{X Y}(x, y)= \begin{cases} k & 0\lt x\lt y\lt 1 \\ 0 & \text{ caso contrário }\end{cases} \]

determine \(f_{X \mid Y}(x \mid y)\) e \(f_{Y \mid X}(y \mid x)\).

Sol

A densidade conjunta é constante na região triangular sombreada da Figura 6.8.

Podemos determinar \(k\) lembrando que a densidade deve integrar \(1\):

\[ \iint f_{X Y}(x, y) d x d y=\int _0^1 \int _0^y k d x d y=\int _0^1 k y d y=\frac{k}{2}=1 \Rightarrow k=2 \]

E agora podemos calcular as marginais:

\[ f_X(x)=\int f_{X Y}(x, y) d y=\int _x^1 2 d y=2(1-x) \quad 0\lt x\lt 1 \]

e

\[ f_Y(y)=\int f_{X Y}(x, y) d x=\int _0^y 2 d x=2 y \quad 0\lt y\lt 1 \]

E assim

\[ f_{X \mid Y}(x \mid y)=\frac{f_{X Y}(x, y)}{f_Y(y)}=\frac{1}{y} \quad 0\lt x\lt y\lt 1 \]

e

\[ f_{Y \mid X}(y \mid x)=\frac{f_{X Y}(x, y)}{f_X(x)}=\frac{1}{1-x} \quad 0\lt x\lt y\lt 1 \]

Exemplo 6.24

As variáveis \(X\) e \(Y\) têm densidade dada por

\[ f(x, y)=(x+y), \text{ se }0 \leq x \leq 1,0 \leq y \leq 1 \]

Calculemos a densidade condicional \(f_{X \mid Y}\). Inicialmente, calculamos a marginal de \(Y\). Temos

\[ f_{Y}(y)=\int _{0}^{1}(x+y) d x=y+\frac{1}{2}, 0 \leq y \leq 1 \]

Então, para qualquer \(y\) fixado com \(0 \leq y \leq 1\),

\[ f_{X \mid Y}(x \mid y)=\frac{f(x, y)}{f_{Y}(y)}=\frac{x+y}{y+1 / 2}=\frac{2(x+y)}{2 y+1} ; \text{ para } 0 \leq x \leq 1 \]

Fora desse intervalo, \(f_{X \mid Y}(x \mid y)\) é zero.

A função de distribuição condicional pode ser obtida a partir da integração da densidade condicional. Assim, para qualquer \(y\) fixado com \(0 \leq y \leq 1\) e \(0 \leq x \leq 1\), vem:

\[ \begin{aligned} F_{X \mid Y}(x \mid y) & =\int _{-\infty }^{x} \frac{2(z+y)}{2y+1}\, dz \\ & =\frac{x(2y+x)}{2y+1}. \end{aligned} \]

e, portanto,

\[ F_{X \mid Y}(x \mid y)= \begin{cases} 0, & \text{se }x\lt 0, \\ \dfrac {x(2y+x)}{2y+1}, & \text{se }0\leq x\lt 1, \\ 1, & \text{se }x\geq 1. \end{cases} \]

A função de distribuição conjunta pode ser obtida a partir da condicional, da seguinte forma:

\[ \begin{aligned} F_{X,Y}(x,y) & =\int _{-\infty }^{y} f_Y(z)F_{X\mid Y}(x\mid z)\, dz \\ & = \begin{cases} 0, & \text{se }x\lt 0\text{ ou }y\lt 0, \\ \dfrac {x^2y+xy^2}{2}, & \text{se }0\leq x\lt 1,\ 0\leq y\lt 1, \\ \dfrac {x+x^2}{2}, & \text{se }0\leq x\lt 1,\ y\geq 1, \\ \dfrac {y+y^2}{2}, & \text{se }x\geq 1,\ 0\leq y\lt 1, \\ 1, & \text{se }x\geq 1,\ y\geq 1. \end{cases}\end{aligned} \]

Deixamos ao leitor a tarefa de verificar se essa expressão está correta, o que pode ser feito calculando seu valor diretamente pela densidade conjunta.

6.6.3 Variáveis aleatórias mistas

Também é possível combinar uma variável contínua e outra discreta. Se \(X\) tem densidade \(f_X\) e \(N\) é discreta, escrevemos \(p_{N\mid X}(n\mid x)\) para a probabilidade condicional de \(N=n\) quando o valor de \(X\) é \(x\). A forma mista da regra de Bayes é

\[ f_{X\mid N}(x\mid n) =\frac{p_{N\mid X}(n\mid x)f_X(x)}{p_N(n)}, \qquad p_N(n)\gt 0. \]

A estrutura é a da fórmula de Bayes: verossimilhança \(\times \) densidade inicial, divididas pela constante de normalização.

Exemplo 6.25 (Atualizando uma probabilidade de Bernoulli)

Suponha que realizemos \(n+m\) tentativas de Bernoulli e observemos \(n\) sucessos e \(m\) fracassos. A probabilidade de sucesso é desconhecida. Para ilustrar o condicionamento misto, tratemos essa probabilidade como uma variável aleatória \(\Theta \in (0,1)\) e adotemos, por simplicidade, uma priori uniforme:

\[ f_\Theta (\theta )=1,\qquad 0\lt \theta \lt 1. \]

Essa é uma escolha de modelagem, não uma afirmação de ausência absoluta de informação.

Se \(N\) é o número de sucessos, então, dado \(\Theta =\theta \),

\[ N\mid (\Theta =\theta )\sim \operatorname {Bin}(n+m,\theta ). \]

Logo, pela forma mista da regra de Bayes,

\[ \begin{aligned} f_{\Theta \mid N}(\theta \mid n) & \propto p_{N\mid \Theta }(n\mid \theta )f_\Theta (\theta )\\ & \propto \theta ^n(1-\theta )^m, \qquad 0\lt \theta \lt 1. \end{aligned} \]

Normalizando,

\[ f_{\Theta \mid N}(\theta \mid n) =\frac{\theta ^n(1-\theta )^m}{B(n+1,m+1)}, \]

portanto

\[ \Theta \mid (N=n)\sim \operatorname {Beta}(n+1,m+1). \]

A conta mostra por que a família beta é natural para modelar probabilidades de sucesso: depois de observar dados de Bernoulli, permanecemos na mesma família.

Exemplo 6.26 (Uma distribuição mista)

Considere \(X\in \{ 1,2,3\} \) discreta e \(Y\in [0,1]\) contínua. A lei conjunta é mista: para cada \(x\), o valor \(g(x,y)\, dy\) representa aproximadamente a probabilidade de \(X=x\) e \(Y\in [y,y+dy]\), onde

\[ g(x,y)= \begin{cases} \dfrac {x y^{x-1}}{3}, & x\in \{ 1,2,3\} ,\ 0\leq y\leq 1,\\[6pt] 0, & \text{caso contrário}. \end{cases} \]

Integrando em \(y\), obtemos \(p_X(x)=1/3\) para \(x=1,2,3\). Somando em \(x\),

\[ f_Y(y)=\frac{1+2y+3y^2}{3},\qquad 0\leq y\leq 1. \]

Se fixamos \(X=2\), a distribuição condicional de \(Y\) é contínua:

\[ f_{Y\mid X}(y\mid 2) =\frac{g(2,y)}{p_X(2)}=2y, \qquad 0\leq y\leq 1. \]

Por outro lado, se fixamos \(Y=1/2\), a distribuição condicional de \(X\) é discreta. Como \(f_Y(1/2)=11/12\),

\[ p_{X\mid Y}\left(x\mid \frac12\right) =\frac{g(x,1/2)}{f_Y(1/2)} =\frac{4}{11}x\left(\frac12\right)^{x-1}, \qquad x=1,2,3. \]

Assim,

\[ F_{Y\mid X}(y\mid 2)= \begin{cases} 0, & y\lt 0,\\ y^2, & 0\leq y\leq 1,\\ 1, & y\gt 1, \end{cases} \]

e

\[ F_{X\mid Y}\left(x\mid \frac12\right)= \begin{cases} 0, & x\lt 1,\\ \dfrac {4}{11}, & 1\leq x\lt 2,\\ \dfrac {8}{11}, & 2\leq x\lt 3,\\ 1, & x\geq 3. \end{cases} \]

Esse exemplo mostra por que, em modelos mistos, é importante distinguir massa condicional de densidade condicional.

Distribuições conjuntas permitem responder três perguntas diferentes: como as coordenadas variam juntas, quando podem ser separadas por independência e como a informação sobre uma delas altera a distribuição da outra. Essas três ideias serão usadas repetidamente nos capítulos seguintes.

6.7 Exemplos integradores

Os modelos deste capítulo começam a ficar especialmente úteis quando o vetor aleatório não é apenas um par de números, mas registra a configuração inteira de um sistema. Os exemplos a seguir mostram três maneiras de explorar essa ideia: representar um objeto combinatório por indicadores, transformar contagens multinomiais em uma quantidade operacional e reconhecer dependência entre coordenadas que têm marginais simples.

Exemplo 6.27 (Um grafo aleatório como vetor de Bernoulli)

Considere o grafo aleatório de Erdős–Rényi \(G(n,p)\). Para cada par \(e=\{ i,j\} \) de vértices, seja \(I_e\) a indicadora do evento “a aresta \(e\) está presente”. O vetor

\[ (I_e)_{e\in \binom {[n]}2} \]

é um vetor aleatório discreto com \(\binom n2\) coordenadas. Como as arestas são escolhidas independentemente,

\[ \P (I_e=i_e,\ e\in \binom {[n]}2) =\prod _e p^{i_e}(1-p)^{1-i_e}, \qquad i_e\in \{ 0,1\} . \]

Um objeto combinatório inteiro passa, assim, a ser uma única observacaoervação vetorial. Graus, número de arestas e número de triângulos são funções desse vetor; voltaremos a elas nos capítulos de transformações e esperança.

Exemplo 6.28 (Balanceamento de carga e o problema de ocupação)

Suponha que \(n\) requisições sejam enviadas, independentemente e com a mesma probabilidade, para \(m\) servidores. Se \(N_j\) é o número de requisições que chegam ao servidor \(j\), então

\[ (N_1,\ldots ,N_m) \]

tem distribuição multinomial com parâmetros \(n\) e \(p_1=\cdots =p_m=1/m\).

Uma pergunta natural é quantos servidores serão efetivamente utilizados. Defina

\[ I_j=\mathbb {1}_{\{ N_j\gt 0\} }, \qquad A=\sum _{j=1}^m I_j. \]

Como um servidor fica vazio somente quando nenhuma das \(n\) requisições o escolhe,

\[ \P (I_j=1)=1-\left(1-\frac1m\right)^n. \]

Logo,

\[ \mathbf{E}[A] =m\left[1-\left(1-\frac1m\right)^n\right]. \]

A mesma conta descreve bolas lançadas em caixas, chaves distribuídas numa tabela de hash ou usuários distribuídos entre máquinas. O vetor multinomial guarda a carga completa; a função \(A\) extrai uma característica operacional do sistema.

Exemplo 6.29 (Graus de vértices vizinhos)
No modelo \(G(n,p)\), sejam \(D_u\) e \(D_v\) os graus de dois vértices distintos. Cada um tem distribuição
\[ \operatorname {Bin}(n-1,p), \]
mas eles não são independentes, pois ambos contêm a indicadora \(I_{\{ u,v\} }\) da aresta comum. Escrevendo
\[ D_u=I_{\{ u,v\} }+\sum _{w\ne u,v} I_{\{ u,w\} }, \qquad D_v=I_{\{ u,v\} }+\sum _{w\ne u,v} I_{\{ v,w\} }, \]
todas as parcelas distintas são independentes. Portanto,
\[ \operatorname {Cov}(D_u,D_v) =\operatorname {Var}(I_{\{ u,v\} }) =p(1-p). \]
As marginais dos dois graus são iguais e muito simples, mas a distribuição conjunta registra a aresta que compartilham. É exatamente esse tipo de informação que se perde quando olhamos apenas para as marginais.

Resumo do capítulo
Distribuições conjuntas descrevem dependência. Marginais são obtidas somando ou integrando; condicionais renormalizam uma fatia; independência equivale à fatoração adequada. Vetores de indicadores também permitem representar objetos complexos, como grafos e sistemas de ocupação, por coordenadas elementares.

6.8 Exercícios

Exercício 6.1 (Tabela conjunta)
A função de probabilidade conjunta de \(X,Y\in \{ 0,1,2\} \) é proporcional a \(x+y+1\). Determine a constante, as marginais, \(\P (X\lt Y)\) e \(\P (X=1\mid Y=2)\). Decida se \(X\) e \(Y\) são independentes.
Exercício 6.2 (Região triangular)
Se \(f_{XY}(x,y)=c\) na região \(0\lt y\lt x\lt 3\), determine \(c\), as densidades marginais e \(\P (X+Y\lt 3)\).
Exercício 6.3 (Condicional contínua)
Se \(f_{XY}(x,y)=2\), para \(0\lt y\lt x\lt 1\), obtenha \(f_Y(y)\) e \(f_{X\mid Y}(x\mid y)\). Calcule \(\P (X\gt 3/4\mid Y=1/2)\).
Exercício 6.4 (Máximo e mínimo)
Se \(X\) e \(Y\) são independentes e uniformes em \((0,1)\), determine as funções de distribuição de \(M=\max (X,Y)\) e \(N=\min (X,Y)\). Calcule \(\P (M-N\lt 1/3)\).
Exercício 6.5 (Soma de Poisson)
Se \(X\sim \operatorname {Poisson}(2{,}5)\) e \(Y\sim \operatorname {Poisson}(1{,}7)\) são independentes, obtenha a distribuição de \(X+Y\) e calcule \(\P (X+Y\leq 2)\).

  1. Leia sobre a correção de continuidade na Seção 5.3