Probabilidade e inferência: evidência, base e incerteza
Um classificador sinaliza uma ocorrência rara. O painel exibe uma taxa alta de detecção, mas isso não responde quantos alertas estão corretos. Para compreender a diferença, construiremos uma população fictícia de mil pedidos e contaremos os caminhos que levam ao alerta. Probabilidade será uma linguagem para explicitar hipóteses, e não um selo de certeza colocado sobre a saída de um modelo.
Depois passaremos de uma população conhecida para uma amostra: cem respostas revisadas, das quais oitenta foram aceitas. Você vai distinguir o resultado observado da quantidade desconhecida que se quer estimar. A unidade prepara uma leitura cuidadosa de métricas e experimentos; demonstrações formais e muitos métodos de inferência ficam além deste primeiro percurso.
IA & MLMatemáticaAo terminar esta aula
- Condicionar muda o conjunto de referência.
- Taxa de base e custos devem acompanhar a interpretação de alertas.
- Intervalos exigem hipóteses de amostragem e não corrigem viés automaticamente.
Antes de continuar: Laboratório: Álgebra linear: representar, projetar e ajustar
Eventos e condicionamento: qual conjunto mudou?
FundamentosUm evento é um conjunto de resultados possíveis. Em um pedido escolhido ao acaso, chamaremos F o evento de existir uma falha real e A o evento de um detector emitir alerta. P(F) descreve a proporção de falhas antes de observar o detector. P(A|F) descreve a proporção de alertas entre pedidos que realmente falharam. A barra vertical significa que restringimos o conjunto de referência. Já P(F|A) pergunta pela proporção de falhas entre alertas. Essas duas probabilidades condicionais usam denominadores diferentes e não podem ser trocadas por conveniência.
Na população didática, um por cento dos mil pedidos tem falha: são dez. O detector alerta em noventa por cento dos pedidos com falha, gerando nove alertas verdadeiros. Nos outros novecentos e noventa pedidos, a taxa de falso positivo é cinco por cento, portanto esperamos 49.5 alertas falsos. Uma contagem esperada pode ser fracionária: ela descreve uma média de repetições do cenário, não metade de um pedido concreto. Entre os 58.5 alertas esperados, só nove correspondem a falhas. A fração é aproximadamente 15.4%, embora a sensibilidade seja 90%.
A probabilidade de alerta é P(A)=P(A|F)P(F)+P(A|não F)P(não F). Dividir a contribuição das falhas por esse total dá P(F|A)=P(A|F)P(F)/P(A). Essa é a aplicação de Bayes ao caso. O programa de probabilidade do MIT inclui condicionamento, Bayes e erros de taxa de base; o detector e as contagens usados aqui são fictícios. Não há resultado empírico de modelo nesta conta, apenas consequências das hipóteses fornecidas.
↗ 18.05 Introduction to Probability and Statistics — syllabus
Taxa de base e decisões que custam diferente
FundamentosMantenha o mesmo detector e mude a taxa de falha para dez por cento. Em mil pedidos, esperamos noventa alertas verdadeiros e quarenta e cinco falsos. A posterior passa a ser 90/135, ou dois terços. O detector não mudou, mas a composição do conjunto mudou. Isso explica por que uma métrica obtida em uma avaliação com proporções artificiais não deve ser transportada diretamente para a operação. Sensibilidade e falso positivo também podem mudar quando a população muda; tratá-los como constantes nesta conta é uma simplificação explícita, não uma garantia.
Probabilidade posterior e decisão são etapas diferentes. Encaminhar um alerta para revisão custa tempo; bloquear um pedido errado pode causar dano maior. Uma posterior de quinze por cento pode justificar revisão barata e ser insuficiente para bloqueio automático. Para decidir, precisamos de custos de erros, capacidade de revisão e consequência da ação. Não existe um limiar universal deduzido apenas de Bayes. Registre primeiro qual população foi considerada e o significado dos eventos; depois discuta a política. Essa separação também impede tratar uma pontuação emitida por um modelo como posterior calibrada sem medir a relação com frequências reais.
Variável aleatória, distribuição, média e variância
FundamentosUma variável aleatória associa um número a cada resultado. Defina X=1 quando uma resposta é aceita e X=0 quando é rejeitada. Se a probabilidade de aceitação for p, X tem distribuição de Bernoulli: P(X=1)=p e P(X=0)=1-p. Sua média é p e sua variância é p(1-p). Média resume o centro; variância resume dispersão em torno dele. Se p=0.8, a variância vale 0.16. Isso não significa que uma resposta individual terá qualidade 0.8: seu resultado neste contrato é zero ou um.
Se observarmos n resultados independentes com o mesmo p, o total de aceitações K tem distribuição binomial. Sua média é np e sua variância np(1-p). Em cem tentativas com p=0.8, o número esperado é oitenta e o desvio padrão do total é quatro. O número observado pode ser setenta e oito ou oitenta e três sem contradizer o modelo. Independência e probabilidade constante fazem parte da hipótese. Cem respostas quase idênticas do mesmo caso, ou cem avaliações feitas pelo mesmo revisor sob um viés persistente, podem apresentar dependência que a binomial não representa.
↗ 18.05 Introduction to Probability and Statistics — syllabus
Da amostra ao intervalo: o que os números sustentam
FundamentosA proporção observada p̂ é K/n. No conjunto revisado, p̂=80/100=0.8. Sob um modelo de observações independentes e condições suficientes para aproximação normal, estimamos seu erro padrão por raiz de p̂(1-p̂)/n. Aqui a raiz de 0.16/100 é 0.04. Um intervalo aproximado de 95% usa p̂ mais ou menos 1.96 vezes esse erro: [0.7216,0.8784]. O resultado torna visível que cem observações não determinam uma taxa operacional exata. Arredondar o painel para muitos decimais não reduz essa incerteza.
A interpretação frequencista de confiança refere-se ao procedimento: em repetições do desenho amostral e sob suas condições, uma proporção nominal dos intervalos conteria o parâmetro fixo. Não significa que o parâmetro tenha 95% de probabilidade de mudar de posição dentro deste intervalo já calculado. Uma inferência bayesiana atribui distribuição ao parâmetro mediante hipóteses adicionais e produz outro tipo de intervalo. Também não podemos usar automaticamente esta aproximação perto de zero ou um, com poucos sucessos ou fracassos. No laboratório, adotaremos uma guarda conservadora que exige ao menos dez de cada; existem métodos mais apropriados para outras situações.
Mantendo a proporção em 0.8 e aumentando a amostra de cem para quatrocentos, o erro padrão cai de 0.04 para 0.02. Quadruplicar o tamanho reduz a largura pela metade, em vez de quatro vezes. Mais registros ajudam a reduzir erro amostral sob o mesmo desenho, mas não corrigem seleção enviesada. Uma amostra enorme coletada apenas de perguntas fáceis pode continuar inadequada para estimar aceitação em perguntas difíceis. A procedência dos casos e o contrato de aceitação precisam acompanhar qualquer intervalo mostrado.
Amostragem: quem teve chance de entrar?
FundamentosConsidere duas avaliações com cem registros. A primeira sorteia pedidos da fila completa; a segunda usa apenas clientes que responderam voluntariamente a uma pesquisa. Elas têm o mesmo tamanho e podem produzir 0.8, mas estimam objetos diferentes. Quem respondeu voluntariamente pode estar especialmente satisfeito ou insatisfeito. Um intervalo calculado da mesma forma não elimina esse viés de seleção. Defina população alvo, regra de inclusão, período, unidade amostral e possibilidade de registros repetidos. Se o objetivo envolve próximos meses, separar períodos também importa: sortear tudo em uma única fotografia não mede mudança futura.
Para praticar, simularemos Bernoulli com um gerador determinístico. Uma semente reproduz a sequência, facilitando depuração; isso não prova que os dados de negócio sejam independentes. Repetir duzentas pequenas amostras ilustra a variação dos intervalos, mas a fração de cobertura observada não tem obrigação de ser exatamente 95%. Não ajuste o algoritmo até atingir esse número em uma semente escolhida. Essa manipulação esconderia a variabilidade que queremos estudar. O relatório deve separar hipótese matemática, experimento sintético e evidência operacional, em vez de apresentar as três como se fossem o mesmo tipo de resultado.
Exercício aplicado
Revise a interpretação de um detector e de uma avaliação de respostas antes de aprovar um painel.
- Calcule a posterior com taxa de base de 1%, sensibilidade de 90% e falso positivo de 5%.
- Repita a conta com taxa de base de 10% e explique a diferença.
- Calcule o intervalo normal aproximado de 80 aceitações em 100 e compare com 320 em 400.
- Escreva duas limitações ligadas à seleção e à dependência de observações.
Abrir resolução comentada
Na primeira população, a contribuição verdadeira é 0.009 e a falsa é 0.0495. A razão 0.009/0.0585 resulta em aproximadamente 0.15385. Na segunda, a razão é 0.09/(0.09+0.045)=2/3. A posterior depende do conjunto de referência; sensibilidade não responde sozinha à pergunta sobre a composição dos alertas.
Com 80/100, o erro padrão é 0.04 e a margem 0.0784. Com 320/400, o erro padrão é 0.02 e a margem 0.0392. Os centros coincidem, mas a segunda amostra produz intervalo com metade da largura sob as mesmas hipóteses. A confiança descreve o procedimento repetido; a conta não atribui probabilidade frequentista ao parâmetro fixo.
Uma resposta completa registra que participação voluntária pode enviesar a amostra e que registros repetidos de um cliente podem reduzir a informação independente. Nenhum desses problemas é resolvido apenas aumentando n. Antes de escolher bloqueio ou revisão, acrescente custos e consequências; o cálculo de probabilidade informa a decisão, mas não define sua política.
Como conferir seu resultado
- Denominadores condicionais identificados.
- Duas posteriores conferidas por contagens.
- Margens e interpretação do intervalo corretas.
- Duas limitações do desenho amostral específicas.
Teste sua compreensão
Responda com suas palavras antes de abrir o comentário. Saber explicar uma decisão é parte do domínio.
1. Sensibilidade de 90% significa que 90% dos alertas estão corretos?
Não.
A composição dos alertas também depende da taxa de base e dos falsos positivos.
↗ 18.05 Introduction to Probability and Statistics — syllabus
2. Quadruplicar n reduz o erro padrão por qual fator, mantendo p?
Por dois.
O erro padrão é proporcional ao inverso da raiz de n.
↗ 18.05 Introduction to Probability and Statistics — syllabus
3. Um intervalo estreito elimina viés de seleção?
Não.
Precisão sob um desenho não garante que a população selecionada represente a população alvo.
↗ 18.05 Introduction to Probability and Statistics — syllabus
Seu progresso fica salvo neste navegador. Concluir a leitura não substitui demonstrar o domínio nos exercícios.
Referências e aprofundamento
Documentação oficial e trabalhos originais. As referências registram o escopo e as limitações para você conferir o que sustentam.
- 18.05 Introduction to Probability and Statistics — syllabus
MIT OpenCourseWare • consulta: 2026-10-06
FundamentosProbabilidade condicional, Bayes, variáveis aleatórias, distribuições, amostragem e intervalos de confiança.
Limites: Programa de 2022; o intervalo normal da aula é uma aproximação didática sujeita a condições, não uma recomendação universal.