Cálculo e otimização: derivadas que orientam o ajuste
A reta da álgebra foi ajustada resolvendo duas equações. Muitos modelos maiores não têm uma solução tão simples, e seus parâmetros são melhorados por pequenos passos. Para entender esses passos, precisamos descobrir como a perda muda quando um parâmetro varia. Derivadas e gradientes fornecem essa informação local; um otimizador decide como usá-la.
Usaremos novamente três pedidos para manter uma resposta conhecida como referência. Depois examinaremos um caso em que um passo grande piora a perda, mesmo com derivada correta. Faça as contas com frações ou decimais simples antes de executar o programa. Esta introdução conecta cálculo ao aprendizado de máquina sem substituir o estudo formal de limites, continuidade e cálculo multivariável.
MatemáticaAo terminar esta aula
- Derivada é sensibilidade local com unidade.
- A regra da cadeia acompanha todas as dependências.
- Gradiente correto, passo adequado e generalização são questões distintas.
Antes de continuar: Laboratório: Probabilidade e inferência: evidência, base e incerteza
Derivada: sensibilidade em torno de um ponto
MatemáticaPara uma função f(w), a razão [f(w+h)-f(w)]/h mede a variação média num deslocamento h. A derivada f′(w) é o limite dessa razão quando h se aproxima de zero, se esse limite existir. Seu sinal informa se aumentar w faz a função crescer ou diminuir localmente. Sua magnitude depende das unidades: derivar tempo em relação a tamanho produz uma taxa de tempo por unidade de tamanho. Não se trata de uma previsão global sobre todos os valores de w. Um deslocamento grande pode sair da região em que a aproximação local é útil.
Considere f(w)=w². Expandir (w+h)²-w² produz 2wh+h². Dividir por h dá 2w+h, cujo limite é 2w. Em w=3, a derivada vale seis: um aumento pequeno de 0.01 tende a mudar a função por aproximadamente 0.06. O valor exato é 3.01²-3²=0.0601, mostrando o pequeno termo de segunda ordem omitido. Essa diferença entre aproximação e resultado exato prepara o diagnóstico de passos grandes. O programa de cálculo do MIT situa derivadas e otimização entre os conceitos da disciplina; nossas contas com perdas são aplicações originais dessa base.
Regra da cadeia: atravessar uma composição
FundamentosUm modelo raramente aplica uma única operação. Primeiro calcula uma previsão, depois um erro e finalmente uma penalidade. Para uma observação x=2, y=1, com previsão z=2w, defina erro e=z-1 e perda L=e²/2. A derivada de L em relação a e é e; a de e em relação a z é um; a de z em relação a w é dois. Multiplicar essas sensibilidades dá dL/dw=2(2w-1). Essa é a regra da cadeia: cada etapa informa como uma mudança chega à seguinte.
Em w=0, a previsão é zero, o erro é menos um, a perda é 0.5 e a derivada é menos dois. Para reduzir a perda, aumentamos w um pouco, indo contra o sinal negativo da derivada. Se alguém usar apenas a derivada do quadrado e esquecer que z depende de w por um fator dois, o gradiente terá magnitude errada. O algoritmo pode continuar produzindo melhorias em alguns passos, portanto observar queda da perda não prova que a derivada esteja correta. Conferir a composição no papel e por diferenças finitas é um diagnóstico mais forte.
Gradiente: várias sensibilidades juntas
MatemáticaAgora a previsão tem dois parâmetros: z=b+mx. A perda de uma observação é (z-y)²/2. A derivada parcial em relação a b é z-y, e em relação a m é (z-y)x. O gradiente reúne essas duas derivadas na ordem dos parâmetros. Parcial significa variar um parâmetro mantendo os outros fixos. Se a entrada for x=2 e os parâmetros forem zero, o gradiente é [-1,-2]. Isso conecta a conta ao produto matriz-vetor da álgebra: as coordenadas [1,x] determinam como cada parâmetro influencia a previsão.
Em um lote com n observações, usaremos a média das perdas: L=(1/n)Σ(zᵢ-yᵢ)²/2. Cada componente do gradiente também é a média de suas contribuições. Dividir apenas a perda por n e esquecer de dividir o gradiente altera a relação entre fórmula e implementação. Duplicar todas as linhas deve preservar a média e o gradiente médio, oferecendo um teste simples. Uma soma de perdas também é válida como objetivo, mas sua escala cresce com n e exige interpretar a taxa de aprendizado de outra forma. O importante é declarar a convenção e usá-la consistentemente.
Descida de gradiente e o tamanho do passo
MatemáticaA atualização é theta_novo=theta_atual−η gradiente, com taxa de aprendizado η positiva. O sinal de menos busca a direção local de queda. Para o exemplo de um parâmetro, w=0 e gradiente menos dois, usar η=0.1 produz w=0.2. A nova previsão é 0.4 e a perda cai de 0.5 para 0.18. Usar η=1 produz w=2, previsão quatro e perda 4.5. A direção inicial estava correta nos dois casos; a diferença está na distância percorrida. Um passo que ultrapassa a região útil pode piorar o objetivo.
Com vários parâmetros, calcule todas as componentes do gradiente no mesmo estado e só depois atualize. Se modificar b antes de calcular a derivada de m, a segunda derivada verá outro modelo e deixará de representar o passo simultâneo descrito. Escala dos atributos também importa: multiplicar x por cem aumenta a sensibilidade em relação à inclinação e altera a curvatura da perda. A taxa que funcionava antes pode se tornar excessiva. Normalização, escolha de taxa e algoritmos adaptativos são ferramentas possíveis, mas nenhuma dispensa verificar o objetivo e os dados.
Para a reta com x=[0,1,2] e y=[1,2,2], a perda quadrática é convexa e a solução conhecida é b=7/6, m=0.5. Um gradiente adequado se aproxima dessa solução sob um passo compatível. Redes com camadas e ativações geralmente têm superfícies mais complexas; queda local não garante encontrar o melhor resultado global. Também há diferença entre minimizar perda no treino e produzir boas previsões em novos casos. A próxima unidade separará esses dois critérios por meio de conjuntos diferentes.
Verificação numérica e escolha da perda
FundamentosA diferença central estima uma derivada por [L(theta+h eⱼ)-L(theta-h eⱼ)]/(2h), alterando uma coordenada por vez. Usaremos h=0.00001 em dados pequenos e compararemos ao gradiente analítico. Essa verificação não é a maneira eficiente de treinar uma rede grande, pois exige muitas avaliações da função. Ela é uma ferramenta de depuração. h grande aumenta erro de aproximação; h pequeno demais pode causar cancelamento numérico. Teste em pontos não especiais: no mínimo, um gradiente incorreto pode coincidir com zero e esconder o defeito.
A perda quadrática penaliza erros grandes de forma acentuada. Perda absoluta responde de maneira diferente e não tem derivada usual no erro zero. Classificação binária frequentemente utiliza uma perda ligada à probabilidade prevista, que estudaremos com uma rede. Escolher uma função de perda significa definir que erros o treinamento enfatizará. Ela deve ser comparada com a métrica relevante para a operação, pois um objetivo diferenciável é uma ferramenta de otimização e não uma descrição completa do custo de negócio. Em todo caso, valores não finitos e dados vazios precisam ser tratados antes do primeiro passo.
Como aprofundar na fonte
FundamentosNas notas do CS229, leia 4.1 (gradiente) e 4.4 (mínimos quadrados). Compare a forma matricial com as derivadas escalares calculadas aqui e identifique a hipótese que permite zerar o gradiente. Essa leitura não substitui o teste de passo ou a avaliação de generalização da próxima unidade.
Exercício aplicado
Uma rotina de treinamento diminui a perda em alguns casos, mas a equipe não sabe se seu gradiente está correto.
- Derive a perda do caso x=2,y=1 com previsão 2w.
- Compare passos de taxa 0.1 e 1 partindo de w=0.
- Derive o gradiente médio de b+mx para os três pedidos.
- Descreva um teste numérico de derivada e uma verificação pela solução algébrica.
Abrir resolução comentada
A regra da cadeia dá 2(2w−1). Em zero, o gradiente é −2. O passo de taxa 0.1 leva a w=0.2 e perda 0.18; o passo de taxa um leva a w=2 e perda 4.5. Portanto a derivada correta não garante melhora quando o deslocamento é excessivo. A conta diferencia erro de gradiente de erro na escolha do passo.
Para cada linha, some erro/n ao componente de b e erro×x/n ao componente de m. No ponto [0.3,−0.2], altere cada coordenada separadamente em mais e menos h e compare a diferença central ao gradiente. Escolher um ponto fora do mínimo exercita derivadas não nulas. Duplicar o lote deve preservar ambas as médias.
O treinamento iterativo deve aproximar [7/6,0.5]. Sua perda, definida com metade do quadrado e média sobre três linhas, é (1/6)/(2×3)=1/36. A unidade da álgebra calculou a soma dos quadrados 1/6; o valor diferente decorre da convenção, não de um novo ajuste. Explicar essa relação é parte da resolução, pois comparar números sem identificar a definição pode criar um falso diagnóstico.
Como conferir seu resultado
- Regra da cadeia inclui o fator de x.
- Dois passos e perdas calculados.
- Gradiente e perda usam a mesma média.
- Verificação numérica e referência algébrica explicitadas.
Teste sua compreensão
Responda com suas palavras antes de abrir o comentário. Saber explicar uma decisão é parte do domínio.
1. Uma derivada negativa garante que qualquer aumento de w reduzirá a perda?
Não.
Ela descreve comportamento local; um passo grande pode atravessar o mínimo.
2. O que varia numa derivada parcial?
Um parâmetro, mantendo os outros fixos.
O gradiente organiza essas sensibilidades na ordem das coordenadas.
3. Por que SSE=1/6 e perda média=1/36 são compatíveis neste caso?
A perda divide SSE por duas vezes o número de observações.
A convenção inclui o fator 1/2 e a média sobre três registros.
Seu progresso fica salvo neste navegador. Concluir a leitura não substitui demonstrar o domínio nos exercícios.
Referências e aprofundamento
Documentação oficial e trabalhos originais. As referências registram o escopo e as limitações para você conferir o que sustentam.
- 18.02SC Multivariable Calculus — syllabus
MIT OpenCourseWare • consulta: 2026-10-06
FundamentosDerivadas parciais, gradientes, regra da cadeia e otimização; estudo com problemas antes da solução.
Limites: A unidade oferece preparação inicial com polinômios; não substitui cálculo de uma e várias variáveis.
- 18.06 Linear Algebra — syllabus
MIT OpenCourseWare • consulta: 2026-10-06
MatemáticaVetores, sistemas lineares, projeções e mínimos quadrados como fundamentos da disciplina.
Limites: Programa da disciplina de 2010; exemplos numéricos e implementação desta preparação são originais e não cobrem o curso completo.
- CS229 Linear Algebra Review and Reference
Stanford University / Zico Kolter e Chuong Do • consulta: 2026-10-06
MatemáticaSeções 2.1, 3.5, 4.1 e 4.4: produto escalar, normas, gradiente e mínimos quadrados.
Limites: Notas de 2015; explicam as operações matemáticas, não garantias de busca semântica ou generalização.