Aprendizado e redes: do gradiente à avaliação
Você já sabe representar entradas, calcular incerteza e ajustar uma função por gradiente. Agora vamos juntar essas ferramentas em um experimento de aprendizado supervisionado. Uma rede pequena receberá um número e produzirá uma probabilidade para uma classe. Como a regra que gerou os rótulos é conhecida, o objetivo não é descobrir um fenômeno; é tornar visíveis o mecanismo de treinamento e a disciplina de avaliação.
O caso usa números negativos rotulados como zero e positivos como um. Uma regra direta resolveria a tarefa sem rede; essa alternativa simples será parte da discussão de tradeoffs. A unidade prepara conceitos encontrados depois no curso, incluindo neurônios e generalização. Quatro acertos em quatro casos sintéticos não equivalem a evidência de desempenho operacional nem a uma formação completa em aprendizado de máquina.
IA & MLAvaliaçãoMatemáticaRedesAo terminar esta aula
- Separar conjuntos separa ajuste, seleção e avaliação.
- Backpropagation aplica a regra da cadeia e deve ser verificável.
- Vencer um baseline não elimina a necessidade de comparar alternativas simples.
Antes de continuar: Laboratório: Cálculo e otimização: derivadas que orientam o ajuste
O que é aprendido e o que permanece escolhido
FundamentosNo aprendizado supervisionado, cada observação contém entrada x e alvo y. A família de modelos define quais funções podemos representar; os parâmetros determinam uma função dentro dessa família; a perda mede discrepâncias no treino; o algoritmo muda parâmetros para reduzir essa perda. A escolha da família e da perda é feita pelo projeto, não descoberta automaticamente em toda sua extensão. Neste caso, o número x é a entrada, y pertence a {0,1} e a saída p será um valor entre zero e um. Chamá-lo de probabilidade prevista não prova que esteja calibrado em uma população real.
Generalizar significa ter comportamento útil em exemplos que não foram utilizados para ajustar a função. Sobreajuste ocorre quando o modelo aproveita particularidades do treino que não se sustentam fora dele. Um ajuste pode reduzir muito sua perda de treino sem melhorar avaliação externa. Representação, generalização e sobreajuste fazem parte da introdução de aprendizado de máquina do MIT. Nossa construção abaixo é um experimento editorial mínimo para separar esses conceitos, com dados e resultados cuja origem você consegue inspecionar.
Parâmetros são valores ajustados pelo gradiente, como pesos e interceptos. Hiperparâmetros são escolhas do procedimento, como taxa de aprendizado e número de passos. A palavra não implica importância menor: mudar a taxa pode determinar se a otimização funciona. Também há escolhas fora dessas listas, como qual população avaliar e qual custo de erro considerar. Uma biblioteca não decide sozinha se os rótulos representam o objetivo do produto, e uma arquitetura maior não corrige um contrato de avaliação indefinido.
Treino, validação e teste têm papéis diferentes
AvaliaçãoO treino fornece os exemplos usados no cálculo de gradientes. A validação ajuda a escolher entre configurações ou checkpoints. O teste oferece uma avaliação final após essas decisões. Se você olhar o teste, mudar a configuração e olhar novamente até gostar do resultado, esse conjunto passa a participar da seleção. Seu número deixa de representar a mesma avaliação independente planejada inicialmente. Na prática, novos testes podem ser necessários quando o projeto muda; o importante é registrar quais dados influenciaram cada decisão.
Usaremos quatro pontos de treino, quatro de validação e quatro de teste, todos com identificadores distintos. A separação por identificador é uma defesa básica, mas não detecta duplicatas semânticas, usuários repetidos ou influência temporal. Em dados reais, uma divisão aleatória pode permitir que versões quase iguais da mesma observação apareçam em treino e teste. Para prever eventos futuros, uma separação temporal pode ser mais apropriada; para avaliar usuários novos, separar por usuário pode ser necessário. A estratégia depende da pergunta, e não apenas de um percentual padrão de divisão.
Nosso baseline prevê sempre a classe majoritária do treino. Como há empate, definimos antecipadamente que escolherá zero. Em um teste equilibrado, ele acerta metade. A rede será comparada a essa referência, mas a tarefa também admite a regra x>0, que acerta os rótulos por construção. Assim, vencer o baseline constante não justifica usar uma rede no produto. O exercício ensina a exigir uma referência simples e considerar custo, interpretação e adequação, em vez de tratar uma melhora numérica isolada como aprovação arquitetural.
Um neurônio é uma soma ponderada seguida de função
FundamentosA primeira camada calcula z₁=wx+b e uma ativação h=σ(z₁), com σ(z)=1/(1+exp(−z)). A segunda calcula z₂=ch+d e p=σ(z₂). Os quatro parâmetros são w,b,c,d. A sigmoide transforma qualquer número real em uma saída entre zero e um e tem derivada σ(z)(1−σ(z)). A composição de camadas e o cálculo de ativações seguem a base das notas de redes de Stanford; a rede de uma unidade oculta desta aula é uma redução didática própria.
A camada oculta não recebe um rótulo específico dizendo que valor h deve assumir. Os parâmetros que a produzem são ajustados pelo efeito da saída final na perda. É por isso que precisamos propagar sensibilidades através da composição. A não linearidade também importa: se cada camada fosse apenas uma transformação linear, a composição continuaria linear. Empilhar essas camadas sem ativações não criaria automaticamente uma família mais rica de funções. Por outro lado, adicionar não linearidade não garante que a arquitetura pequena consiga representar qualquer relação que desejarmos.
A sigmoide pode saturar perto de zero ou um; sua derivada então fica pequena. Isso pode tornar lenta a transmissão de gradiente para a camada anterior. Em modelos maiores, escolhas de ativação, inicialização e arquitetura influenciam o treinamento. Aqui usamos valores moderados para manter o cálculo observável. Não generalize a escolha de uma sigmoide oculta para toda rede moderna: o caso foi construído para permitir uma conta manual curta e tornar a regra da cadeia explícita.
Perda binária e backpropagation passo a passo
FundamentosPara y em {0,1}, a perda binária é −y log p−(1−y)log(1−p). Se y=1, prever probabilidade pequena gera penalidade grande; se y=0, ocorre o inverso. Com p=σ(z₂), a derivada da perda em relação a z₂ simplifica para δ₂=p−y. Os gradientes da segunda camada são ∂L/∂c=δ₂h e ∂L/∂d=δ₂. A sensibilidade que chega à camada oculta é δ₁=δ₂c h(1−h), resultando em ∂L/∂w=δ₁x e ∂L/∂b=δ₁. Backpropagation organiza essas aplicações da regra da cadeia reutilizando resultados intermediários.
Confira um caso: x=2,y=1,w=0,b=0,c=1,d=0. A ativação oculta é 0.5; a saída é σ(0.5), aproximadamente 0.622459. Então δ₂≈−0.377541. Os gradientes de c e d são aproximadamente −0.188770 e −0.377541. Como h(1−h)=0.25, δ₁≈−0.094385; o gradiente de w é aproximadamente −0.188770 e o de b é −0.094385. Os sinais indicam sensibilidades no estado atual; todas as atualizações precisam usar esse mesmo estado para corresponder ao passo simultâneo.
Verificar implementação e interpretar o resultado
FundamentosO laboratório usa uma expressão numericamente estável para a perda em função do logit z₂: max(z₂,0)−z₂y+log(1+exp(−|z₂|)). Ela evita calcular log de probabilidades arredondadas a zero ou um. O gradiente continua p−y. Para conferir a implementação, alteramos cada um dos quatro parâmetros por mais e menos h e comparamos diferenças centrais ao gradiente analítico, retomando o método da unidade de cálculo. A concordância verifica a derivada do programa neste exemplo; não demonstra que os dados sejam representativos nem que a classe de modelos seja adequada.
Treinaremos até mil e quinhentos passos e guardaremos checkpoints previamente definidos em cem, quinhentos e mil e quinhentos. A validação escolherá o menor valor de perda entre eles. Só então o teste será avaliado com limiar fixo de 0.5. Quatro acertos dão acurácia um, mas um conjunto de quatro pontos gerado por uma regra simples não sustenta estimativa precisa de qualidade. A probabilidade estudada na unidade anterior lembra por que tamanho, seleção e dependência importam. O relatório deve celebrar a evidência de execução correta e limitar a conclusão operacional ao que os dados permitem.
Exercício aplicado
Explique o experimento antes de implementá-lo, mostrando que treinamento correto e avaliação independente são evidências diferentes.
- Desenhe os papéis de treino, validação e teste e defina um baseline.
- Calcule a passagem direta e os quatro gradientes do caso manual.
- Descreva o teste numérico de cada parâmetro e a seleção de checkpoint.
- Compare rede, baseline constante e regra conhecida, com uma limitação do conjunto pequeno.
Abrir resolução comentada
O treino calcula gradientes; a validação escolhe entre três checkpoints previamente fixados; o teste é reservado para a configuração escolhida. O baseline usa a maioria do treino, com desempate zero declarado antecipadamente. A escolha de classe ou limiar não pode ser ajustada após observar o teste sem mudar a interpretação dessa avaliação.
No caso manual, h=0.5 e p≈0.622459. A derivada de saída é p−1≈−0.377541. Multiplicá-la por h dá o gradiente de c; multiplicá-la por c×h(1−h) dá a sensibilidade oculta. Multiplicar esta última por x=2 produz o gradiente de w. Essa sequência mostra exatamente onde cada dependência da regra da cadeia entra, em vez de tratar backpropagation como uma caixa preta.
A diferença central altera cada parâmetro separadamente e compara a perda média no treino. A avaliação posterior compara o checkpoint escolhido com o baseline, mas a regra x>0 continua uma alternativa mais simples para a tarefa sintética. Uma resposta madura conclui que implementamos e verificamos um mecanismo de aprendizado; não conclui que a rede é necessária nem que quatro pontos estimam seu desempenho em uma operação real.
Como conferir seu resultado
- Papéis dos conjuntos e desempate explicitados.
- Passagem direta e quatro derivadas conferidas.
- Verificação numérica por coordenada explicada.
- Seleção precede teste; simplicidade da regra e limitação reconhecidas.
Teste sua compreensão
Responda com suas palavras antes de abrir o comentário. Saber explicar uma decisão é parte do domínio.
1. Backpropagation é o mesmo que atualizar os pesos?
Não.
Ele calcula gradientes; o otimizador usa esses gradientes numa regra de atualização.
2. Por que não selecionar o checkpoint pela perda de teste?
Porque o teste passaria a influenciar a escolha.
A avaliação final deixaria de ter o papel independente planejado.
3. Quatro acertos provam que a rede serve à operação?
Não.
Os exemplos são poucos, sintéticos e não representam uma população operacional.
Seu progresso fica salvo neste navegador. Concluir a leitura não substitui demonstrar o domínio nos exercícios.
Referências e aprofundamento
Documentação oficial e trabalhos originais. As referências registram o escopo e as limitações para você conferir o que sustentam.
- 6.036 Introduction to Machine Learning
MIT OpenCourseWare • consulta: 2026-10-06
FundamentosProblemas de aprendizado supervisionado, representação, generalização e sobreajuste.
Limites: Página introdutória do curso de 2020; divisão e conjuntos de dados desta unidade são originais e pequenos demais para estimar desempenho real.
- CS229 Lecture Notes — Deep Learning
Stanford University / Andrew Ng e Kian Katanforoosh • consulta: 2026-10-06
FundamentosNeurônios, ativações, composição de camadas e cálculo de gradientes por backpropagation.
Limites: Notas de 2019; rede minúscula, dados sintéticos e resultados executáveis da unidade são exemplos editoriais, sem benchmark de produção.
- 18.02SC Multivariable Calculus — syllabus
MIT OpenCourseWare • consulta: 2026-10-06
FundamentosDerivadas parciais, gradientes, regra da cadeia e otimização; estudo com problemas antes da solução.
Limites: A unidade oferece preparação inicial com polinômios; não substitui cálculo de uma e várias variáveis.