Variáveis aleatórias
3.1 Variáveis aleatórias e funções de distribuição
Um experimento produz um resultado \(\omega \), mas nem sempre é necessário registrar toda a informação contida nele. Em lançamentos de moeda, pode interessar apenas o número de caras; em um componente eletrônico, o tempo até a falha; em um ponto do plano, a distância à origem. Em cada caso, associamos ao resultado uma quantidade numérica.
Para estudar as probabilidades associadas aos valores de uma função \(X(\omega )\), precisamos garantir que as condições impostas a esses valores definam eventos. Em particular, a condição “\(X\leq x\)” deve determinar um evento. Por isso exigimos que
para todo \(x\in \mathbb R\). Nos exemplos usuais, essa condição será satisfeita; ela garante que expressões como \(\P (X\leq x)\) estejam definidas.
Se o próprio resultado já é um número real, podemos simplesmente tomar \(X(\omega )=\omega \). Se o resultado é um ponto do plano, suas coordenadas podem ser registradas por duas variáveis \(X\) e \(Y\); essa ideia será retomada no capítulo de vetores aleatórios.
Assim, conhecer \(F_X\) permite calcular probabilidades de intervalos sem retornar ao espaço amostral original. Para esses cálculos, a informação relevante de \(\Omega \) está reunida em uma função da reta real.
Considere o experimento de sortear ao acaso um ponto no disco unitário \(B=\{ (a, b): a^2+b^2\leq 1\} \) em \(\mathbb {R}^2\), e defina \(X\) como a distância ao centro da bola.
Para modelar este problema podemos considerar que a probabilidade de sortearmos um ponto em uma região \(A\in \mathcal{B}(B)\) é proporcional à área de \(A .\) Mais especificamente
Agora, note que \(X(a, b)=\sqrt{a^2+b^2}\) e portanto para \(x\in [0,1]\)
e portanto
\( F \) é não decrescente e \( 0 \leq F (x) \leq 1 .\)
\( F (x) \rightarrow 0 \) quando \( x \rightarrow - \infty \) e \( F (x) \rightarrow 1 \) quando \( x \rightarrow + \infty .\)
\( F \) é contínua à direita, ou seja
\[ \lim _{y \rightarrow x^+} F (y) = F (x). \]\( F \) possui limites à esquerda em todos os pontos. Além disso,
\[ F (x^-): = \lim _{y \rightarrow x^-} F (y) = \P (X \lt x). \]Em particular,
\[ \P (X = x) = F (x) - F (x^-). \]\( F \) possui no máximo número enumerável de descontinuidades.
Uma função \(F\) contínua à direita e com limites à esquerda é chamada càdlàg, abreviação da expressão francesa continue à droite, limites à gauche.
Se \(x\lt y\), então \(\{ X\leq x\} \subseteq \{ X\leq y\} \). A monotonicidade de \(\P \) mostra que \(F(x)\leq F(y)\); os limites \(0\leq F\leq 1\) seguem dos axiomas.
Escolha sequências \(x_n\downarrow -\infty \) e \(y_n\uparrow +\infty \). Então \(\{ X\leq x_n\} \downarrow \emptyset \) e \(\{ X\leq y_n\} \uparrow \Omega \). Pela continuidade da probabilidade, \(F(x_n)\to 0\) e \(F(y_n)\to 1\). Como \(F\) é monótona, esses são os limites de \(F\) nos extremos da reta.
Se \(x_n\downarrow x\), então \(\{ X\leq x_n\} \downarrow \{ X\leq x\} \). Logo \(F(x_n)\to F(x)\), o que prova a continuidade à direita.
Se \(y_n\uparrow x\), então \(\{ X\leq y_n\} \uparrow \{ X\lt x\} \). Portanto
\[ F(x^-)=\lim _{n\to \infty }F(y_n)=\P (X\lt x). \]Como \(\{ X\leq x\} \) é a união disjunta de \(\{ X\lt x\} \) e \(\{ X=x\} \), segue que \(\P (X=x)=F(x)-F(x^-)\).
Para \(m\geq 1\), seja \(D_m=\{ x:F(x)-F(x^-)\geq 1/m\} \). Como a soma das probabilidades \(\P (X=x)\) não pode exceder \(1\), o conjunto \(D_m\) tem no máximo \(m\) pontos. Toda descontinuidade de \(F\) pertence a algum \(D_m\); portanto o conjunto de descontinuidades, \(\bigcup _{m\geq 1}D_m\), é enumerável.
\(F\) é não-decrescente;
\(F\) é contínua pela direita;
\(\displaystyle \lim _{x\to -\infty }F(x)=0\) e \(\displaystyle \lim _{x\to +\infty }F(x)=1\)
Mostraremos que as propriedades apresentadas caracterizam as funções de distribuição: dada uma função que as satisfaça, construiremos uma variável aleatória com essa função de distribuição. A construção também permite obter, no mesmo espaço de probabilidade, sequências de variáveis aleatórias com distribuições previamente especificadas, o que será útil no estudo de sua convergência.
Uma construção útil justifica a afirmação. Se \(U\) é uniforme em \((0,1)\), defina
Pela monotonicidade e continuidade à direita de \(F\), os eventos \(\{ X\leq x\} \) e \(\{ U\leq F(x)\} \) coincidem. Assim \(\P (X\leq x)=\P (U\leq F(x))=F(x)\).
3.2 Tipos de variáveis aleatórias
As variáveis aleatórias podem ser classificadas em dois tipos principais: discretas e contínuas, dependendo da natureza dos valores que elas podem assumir.
A variável aleatória \(X\) é dita discreta se toma um número finito ou enumerável de valores, i.e., se existe um conjunto finito ou enumerável \(\left\{ x_{1}, x_{2}, \ldots \right\} \subset \mathbb {R}\) tal que \(X(\omega ) \in \left\{ x_{1}, x_{2}, \ldots \right\} \text{ para todo }\omega \in \Omega \). A função \(p\left(x_{i}\right)\) definida por \(p\left(x_{i}\right)=\P \left(X=x_{i}\right), i=1,2, \ldots \), é dita função de probabilidade de \(X\).
A variável aleatória \(X\) é (absolutamente) contínua se existe uma função \(f(x) \geq 0\) tal que
\[ F_{X}(x)=\int _{-\infty }^{x} f(t) d t, \quad \text{ para todo }x \in \mathbb {R} \]
A densidade de probabilidade pode ser compreendida por analogia com a densidade de massa. Nos dois casos, a integral da densidade fornece a quantidade total atribuída a um intervalo.
Densidade de Massa em Uma Dimensão Imagine uma barra fina e longa de material uniforme (por exemplo, um fio ou uma haste), onde a densidade de massa \( \rho (x) \) indica como a massa está distribuída ao longo do comprimento \( x \). A densidade de massa \( \rho (x) \) é medida em unidades de massa por unidade de comprimento (por exemplo, kg/m). Para encontrar a massa total \( M \) em um intervalo \( [a, b] \) ao longo do fio, integramos a densidade de massa sobre esse intervalo:
Densidade de Probabilidade em Uma Dimensão A densidade de probabilidade \( p(x) \) funciona de maneira semelhante, mas, em vez de medir como a massa está distribuída, ela mede como a probabilidade está distribuída ao longo de um eixo. A densidade de probabilidade \( p(x) \) indica a "concentração" da probabilidade em torno de um ponto \( x \) e é adimensional. A probabilidade total \( P \) de encontrar uma variável aleatória dentro de um intervalo \( [a, b] \) é dada pela integral da densidade de probabilidade nesse intervalo:
Sorteio de Pontos Segundo uma Distribuição de Probabilidade
Considere uma distribuição de probabilidade contínua descrita por uma densidade de probabilidade \( p(x) \) definida no intervalo \( [0, 1] \). Para ilustrar o conceito, vamos considerar uma distribuição linear simples dada por:
Essa função \( p(x) \) indica que a probabilidade de encontrar um valor próximo a \( x \) aumenta à medida que \( x \) cresce. Em outras palavras, valores de \( x \) mais próximos de 1 são mais prováveis de serem escolhidos do que valores próximos de 0. Essa é uma situação análoga a ter uma barra de densidade de massa que se torna mais densa à medida que nos aproximamos de uma das extremidades. Podemos verificar que \( p(x) \) é uma densidade de probabilidade válida, pois ela satisfaz a condição de normalização:
Agora, vamos calcular a probabilidade de a variável estar dentro de um subintervalo específico \( [a, b] \), onde \( 0 \leq a \lt b \leq 1 \). Isso pode ser obtido integrando a densidade de probabilidade \( p(x) \) nesse intervalo:
Gráficos das Funções de Distribuição de Variáveis Aleatórias Discreta, Contínua e Mista
Dependendo da natureza da variável aleatória — discreta, contínua ou mista — a forma da função de distribuição apresenta características distintas:
Discreta: Para variáveis aleatórias discretas, a função de distribuição possui uma estrutura em degraus. Isso ocorre porque a probabilidade se acumula em valores específicos, resultando em saltos na função. Entre esses saltos, a função de distribuição permanece constante, indicando que a variável não assume valores intermediários.
Contínua: Para variáveis aleatórias contínuas, a função de distribuição é uma função contínua, sem qualquer tipo de salto. Isso reflete o fato de que a probabilidade é distribuída de maneira contínua ao longo de um intervalo de valores. A continuidade da função indica que a variável pode assumir qualquer valor dentro de um intervalo onde a função de distribuição é crescente.função.
Mista: A função de distribuição de uma variável aleatória mista combina as características das duas anteriores. Ela apresenta trechos contínuos não constantes, correspondentes a intervalos onde a variável pode assumir um conjunto infinito de valores, e saltos em pontos específicos, onde existe uma probabilidade acumulada discreta.
Determine para que valores da constante \(c \in \mathbb {R}\), a função abaixo representa uma densidade de probabilidade.
Para que \(f\) seja uma densidade, precisamos de \(f(x) \geq 0\) e \(\int _{-\infty }^{\infty } f(x)\, dx=1\). Se \(c \geq 0\), a primeira condição já está satisfeita; resta impor a normalização:
que resulta em
A solução negativa dessa equação é descartada e obtemos \(c=3\).
Se \(X\) é discreta, então \([X \leq x]=\underset { x_{i} \leq x}{\bigcup }\left[X=x_{i}\right]\), logo
\[ F_{X}(x)=\sum _{ x_{i} \leq x} \P \left(X=x_{i}\right)=\sum _{ x_{i} \leq x} p\left(x_{i}\right) \]Se \(X\) é absolutamente contínua, então \(F_{X}\), sendo uma integral indefinida de \(f\), é contínua.
Uma função \(f(x) \geq 0\) é densidade de alguma variável aleatória se, e somente se, \(\int _{-\infty }^{\infty } f(x) d x=1\), já que neste caso \(F\) definida por
é função de distribuição. Reciprocamente, se \(f\) é densidade então \(\int _{-\infty }^{\infty } f(x) d x=1\).
O critério seguinte permite verificar a existência de densidade para as funções de distribuição regulares consideradas neste curso.
contínua e
continuamente diferenciável por partes, em uma partição finita da reta, com derivada integrável,
O valor de \(f\) nos poucos pontos onde \(F_X\) não é diferenciável é irrelevante para a integral. Em cada trecho, o Teorema Fundamental do Cálculo fornece a variação de \(F_X\); somando os trechos e usando \(\lim _{x\to -\infty }F_X(x)=0\), obtemos
Por exemplo, seja
Então \(X\) tem densidade, pois \(F_{X}\) é contínua e
Logo a densidade de \(X\) é dada por
O valor de \(f\) nos pontos 0 e 1 é arbitrário, pois qualquer que seja \(f(0)\) e \(f(1)\), a integral \(\int _{-\infty }^{x} f(t) d t\) é ainda igual a \(F_{X}(x)\). Costuma-se definir ou \(f(0)=f(1)=1\) ou \(f(0)=f(1)=0\).
Por outro lado, suponha que
Aqui \(X\) não tem densidade, pois \(F_{X}\) não é contínua. De fato \(X\) é uma variável aleatória discreta, e \(\P (X=0)=1\).
O próximo exemplo apresenta uma variável aleatória que não é discreta nem absolutamente contínua, mas combina os dois tipos de distribuição.
A variável aleatória \(X\) tem função de distribuição dada por:
O trecho inclinado entre \(0\) e \(1\) corresponde à parte com densidade. Os saltos em \(1\) e \(2\), de tamanhos \(1/4\) e \(1/2\), correspondem às massas pontuais.
A subtração da função-degrau remove precisamente os saltos de \(F\), de modo que \(H\) é a parte contínua. Como \(H\) é continuamente diferenciável por partes e \(h=H'\) é integrável, o Teorema Fundamental do Cálculo, aplicado em cada trecho, dá
Além disso, \(h\geq 0\) nos pontos de diferenciabilidade, pois \(H\) é não decrescente. Fazendo \(x\to \infty \), obtemos \(\int _{-\infty }^{\infty }h(t)\, dt=1-\alpha \). Logo as normalizações exibidas no enunciado são funções de distribuição, e a identidade decorre diretamente da definição de \(H\).
A discussão acima dá um método de decompor \(F\) em suas partes discreta e absolutamente contínua. Consideremos um exemplo.
Seja
\(F_{Y}\) tem apenas um salto, em \(x=1 / 2\), e \(p_{1}=\) salto no ponto \(1 / 2=1 / 2\). Logo
Diferenciando, temos
Logo
Como \(F_{d}+F_{ac}=F_Y\), metade da probabilidade está concentrada no ponto \(1/2\) e a outra metade tem densidade constante no intervalo \([0,1/2]\). Normalizando as componentes, temos \(F_Y=\tfrac 12F_d^*+\tfrac 12F_{ac}^*\).
3.3 Distribuição de uma variável aleatória
Até aqui descrevemos \(X\) por eventos do tipo \([X\leq x]\). Mas, uma vez que a variável foi definida, podemos perguntar mais: qual é a probabilidade de \(X\) cair num intervalo, numa união de intervalos ou em outro conjunto usual da reta? A condição da definição é suficiente para garantir que essas perguntas também estejam bem definidas. Em particular:
\(\P _{X}(B)=\P (X \in B) \geq 0\).
\(\quad \P _{X}(\mathbb {R})=\P (X \in \mathbb {R})=1\).
Se \(B_{1}, B_{2}, \ldots \in \mathcal{B}\) são disjuntos, então
\[ \begin{aligned} \P _{X}\left(\cup B_{n}\right) & =\P \left(X \in \cup B_{n}\right)=\P \left(\cup \left[X \in B_{n}\right]\right)= \\ & =\sum _{n} \P \left(X \in B_{n}\right)=\sum _{n} \P _{X}\left(B_{n}\right) . \end{aligned} \]
Se a variável aleatória \(X\) é discreta e toma valores somente no conjunto \(\left\{ x_{1}, x_{2}, \ldots \right\} \), então
\[ \P _{X}(B)=\sum _{ x_{i} \in B} \P \left(X=x_{i}\right)=\sum _{ x_{i} \in B} p\left(x_{i}\right), \quad \text{ para todo }B \in \mathcal{B} . \]Se X é absolutamente contínua com densidade \(f(x)\), então
\[ \P _{X}(B)=\int _{B} f(x) d x, \quad \text{ para todo }B \in \mathcal{B} . \]
A distribuição de \(X\) é determinada por qualquer das seguintes funções:
A função de distribuição \(F_{X}\).
A densidade \(f(x)\), se \(X\) é absolutamente contínua.
A função de probabilidade \(p\left(x_{i}\right)\), no caso discreto.
A representação da distribuição pode ser escolhida de acordo com o cálculo que se pretende realizar. No caso contínuo, a densidade costuma ser a representação mais conveniente.
3.4 Esperança
A esperança resume uma distribuição por meio de um valor central. Ela é obtida como uma média ponderada, na qual os pesos são dados pelas probabilidades.
\(\mathbf{E}[X]=\sum _{x} xp(x)\)
\(\mathbf{E}(X) =\int _{-\infty }^{+\infty }xf(x)\, \mathrm{d}x\)
Para duas variáveis aleatórias \(X\) e \(Y\) no mesmo espaço amostral, podemos definir novas variáveis aleatórias \(X + Y\), \(X\cdot Y\), etc. como
Se as variáveis aleatórias \(X\) e \(Y\) são independentes e \(\mathbf{E}[X]\) e \(\mathbf{E}[Y]\) são finitos, então \(\mathbf{E}[XY]\) está bem definida e satisfaz
No caso contínuo temos:
3.5 Variância
A esperança localiza um centro, mas não descreve a dispersão dos valores em torno dele. Duas distribuições podem ter a mesma média e apresentar comportamentos muito diferentes.
Uma medida de dispersão poderia ser construída a partir de \(|X-\mathbf{E}[X]|\). O quadrado \((X-\mathbf{E}[X])^2\), porém, tem propriedades algébricas que tornam seu uso conveniente e conduz à variância. Nesta seção, suporemos finitos os momentos necessários.
O desvio padrão \(\sigma (X)\) de X é definido como a raiz quadrada da variância,
Escreveremos \(\mathbf{E}(X) = \mu \). Então temos:
Considere o experimento de jogar \(5\) moedas honestas. Se \(H\) representar o número de caras que aparecerem. Calcule a esperança e a variância de \(H\).
Lembramos que
Logo a esperança é
Para o calculo da variância começaremos calculando
Logo a variância é
Dadas \(X\) e \(Y\) variáveis aleatoriamente e \( a, b \in \mathbb {R}\) então
\(\operatorname {Var}(aX + b) = a^2 \operatorname {Var}(X).\)
\(\operatorname {Var}(X + Y ) = \operatorname {Var}(X) +\operatorname {Var}(Y ) + 2(\mathbf{E}(XY ) -\mathbf{E}(X)\mathbf{E}(Y ))\). Em particular, se X e Y são independentes, então
\[ \operatorname {Var}(X + Y ) = \operatorname {Var}(X) + \operatorname {Var}(Y ) \]
3.6 Exercícios