Álgebra linear: representar, projetar e ajustar
Um modelo recebe números, mas esses números só fazem sentido quando sabemos o que cada posição representa. Uma planilha com duração, quantidade e custo de três atendimentos já contém a estrutura que chamaremos de matriz. Nesta preparação, você vai ligar essa estrutura a contas pequenas que consegue conferir no papel. O objetivo é compreender operações antes de usar uma biblioteca que as execute em grande escala.
O caso será estimar tempo de processamento a partir do tamanho de um pedido. Também estudaremos uma projeção no plano para visualizar o significado de aproximar um vetor. Tenha papel disponível: tente cada conta antes da resposta comentada. Esta unidade introduz ferramentas de álgebra linear usadas no curso; uma disciplina universitária acrescenta demonstrações, espaços abstratos, decomposições e muitos outros problemas.
MatemáticaAo terminar esta aula
- Dimensão e unidade fazem parte do significado de uma operação.
- Projeção separa componente representável e resíduo perpendicular.
- Mínimos quadrados define uma aproximação e exige diagnóstico de identificação.
Antes de continuar: Laboratório: Redes, sistemas e decisões de engenharia
Vetores: posição, dimensão e unidade
FundamentosUm vetor é uma lista ordenada de coordenadas. O vetor [2,5] pode descrever duas quantidades de produtos; trocá-lo por [5,2] muda o pedido. A dimensão é o número de posições, neste caso dois. Um escalar é um número que pode multiplicar todas as coordenadas: três pedidos iguais correspondem a 3[2,5]=[6,15]. Somar [2,5] e [1,4] produz [3,9], porque somamos quantidades do mesmo produto. Somar um vetor de duas posições a outro de três não tem definição nessa representação. O programa deve detectar a incompatibilidade, em vez de ignorar a coordenada excedente.
As unidades merecem tanta atenção quanto a dimensão. [2,5] também poderia significar duas horas e cinco reais, mas uma norma que misture essas grandezas dependeria da unidade escolhida. Converter horas em minutos multiplicaria apenas a primeira coordenada por sessenta. Uma distância calculada depois dessa conversão teria outro valor, mesmo que o atendimento fosse o mesmo. Padronizar ou ponderar atributos pode ser necessário, porém a escolha incorpora uma hipótese sobre o que deve contar como diferença. Em embeddings, as coordenadas são aprendidas e não equivalem diretamente a horas ou reais; isso não elimina a necessidade de verificar dimensão e normalização.
Uma norma mede comprimento segundo uma regra. Usaremos a norma euclidiana: para [3,4], a soma dos quadrados é 9+16=25 e a raiz quadrada é 5. O produto interno de [a,b] e [c,d] é ac+bd. Ele combina pares de posições e será a operação elementar dos modelos lineares. Esses objetos e suas relações fazem parte da base de álgebra linear descrita no programa do MIT; as situações de pedidos desta unidade são exemplos próprios para praticar essa base.
Matrizes como transformação verificável
FundamentosUma matriz organiza números em linhas e colunas. Na matriz A=[[1,0],[1,1],[1,2]], cada linha descreve uma observação e cada coluna um atributo. A primeira coluna constante permitirá um termo independente; a segunda contém o tamanho do pedido. Se theta=[b,m], multiplicar A por theta produz [b,b+m,b+2m]. A matriz tem três linhas e duas colunas, portanto transforma um vetor de dimensão dois em um vetor de dimensão três. Essa leitura dimensional antecipa muitos erros de implementação: o número de parâmetros deve coincidir com o número de colunas, e o número de previsões com o número de observações.
Com theta=[1,0.5], a primeira previsão é 1×1+0×0.5=1; a segunda é 1×1+1×0.5=1.5; a terceira é 1×1+2×0.5=2. Cada linha é um produto interno. O termo b representa a previsão no tamanho zero e m a variação por unidade de tamanho. Se tamanhos reais começarem em mil, interpretar b como um tempo operacional observado seria uma extrapolação. Parâmetro matemático e explicação de negócio não são automaticamente a mesma coisa. Também não devemos interpretar m como efeito causal: o conjunto pode misturar pedidos de tipos diferentes, cuja dificuldade varia junto com o tamanho.
Projeção: a parte que cabe em uma direção
FundamentosConsidere u=[2,1] e a direção v=[1,1]. Queremos um vetor sobre a linha de v que fique o mais perto possível de u. Qualquer candidato tem a forma c[1,1]. O coeficiente da projeção é c=(u·v)/(v·v)=3/2. Portanto a projeção é [1.5,1.5] e o que sobrou é [0.5,-0.5]. Esse restante é perpendicular à direção porque seu produto interno com [1,1] é zero. A aproximação não reproduz cada coordenada; ela preserva a componente que cabe no espaço permitido e deixa um resíduo que não pode ser corrigido movimentando-se apenas naquela linha.
A fórmula exige v diferente de zero: [0,0] não define direção e produz divisão por zero. Se usarmos [2,2], o coeficiente muda para 3/4, mas a projeção continua [1.5,1.5]. Isso mostra por que o coeficiente sozinho não é o objeto geométrico final. A relação entre projeção e mínimos quadrados é uma ponte conceitual importante no estudo de álgebra linear. Aqui calculamos um caso em duas coordenadas; projetar em várias direções exige considerar como essas direções se relacionam, especialmente quando uma é combinação das outras.
Mínimos quadrados: aproximar observações incompatíveis
FundamentosAgora os tempos observados são y=[1,2,2] para tamanhos x=[0,1,2]. Não existe uma reta que passe pelos três pontos: o aumento foi um entre os dois primeiros e zero entre os dois últimos. Definimos resíduo como observado menos previsto e procuramos b e m que minimizem a soma dos resíduos ao quadrado. Elevar ao quadrado impede cancelamento entre erros positivos e negativos e aumenta o peso de erros grandes. Essa escolha é adequada a algumas perguntas e sensível a valores extremos. Se um tempo vier de falha de medição, ajustar a reta sem examinar a origem poderá distorcer toda a estimativa.
As condições do mínimo são soma dos resíduos igual a zero e soma de x vezes o resíduo igual a zero. Para estes dados, surgem 3b+3m=5 e 3b+5m=6. Subtrair as equações dá 2m=1, portanto m=0.5 e b=7/6. As previsões são [7/6,5/3,13/6], e os resíduos [-1/6,1/3,-1/6]. A soma dos quadrados é 1/36+1/9+1/36=1/6. Verificar as duas condições vale mais que apenas imprimir os parâmetros: elas mostram que não há componente residual nas direções das colunas usadas.
Limites da conta e critérios de diagnóstico
FundamentosSe todos os tamanhos forem iguais, a coluna de tamanhos será múltipla da coluna constante. Nesse caso não conseguimos separar b de m a partir das observações: várias combinações produzem as mesmas previsões. O determinante do sistema de duas equações fica zero. Isso é falta de informação, não uma falha que se resolve aumentando a precisão decimal. Mesmo com determinante pequeno e diferente de zero, pequenas perturbações podem mudar bastante os parâmetros. Nosso código didático detecta um caso degenerado; em problemas gerais, métodos numericamente estáveis como decomposições apropriadas são preferíveis a formar uma inversa explicitamente.
Mudar x de unidades para centésimos multiplica seus valores por cem e divide a inclinação por cem. As previsões devem permanecer iguais. Esse teste de transformação distingue mudança de representação de mudança de comportamento. Antes de confiar num ajuste, confira significado das colunas, dimensões, unidades, valores ausentes e faixa de uso. Uma reta ajustada em tamanhos de zero a dois não autoriza uma promessa para tamanho mil. O cálculo encontra uma aproximação dentro de uma família de funções; decidir se essa família serve ao processo exige observação e avaliação adicionais.
Como aprofundar na fonte
FundamentosNas notas de álgebra do CS229, procure as seções 2.1 (produto escalar), 3.5 (normas) e 4.4 (mínimos quadrados). Depois tente explicar por que as dimensões precisam combinar e por que o resíduo do ajuste é ortogonal às colunas da matriz. As contas desta aula são exemplos originais; a referência oferece notação e desenvolvimento para aprofundar.
Exercício aplicado
A equipe quer revisar o ajuste dos três pedidos antes de usar uma biblioteca. Resolva primeiro no papel e depois compare com o programa do laboratório.
- Calcule A[1,0.5] e identifique a dimensão da saída.
- Projete [2,1] em [1,1] e confira a perpendicularidade do restante.
- Resolva as duas equações do ajuste, calcule os resíduos e a soma dos quadrados.
- Explique o que acontece se todos os tamanhos forem iguais ou se a unidade de x mudar.
Abrir resolução comentada
A saída de A[1,0.5] é [1,1.5,2], com uma previsão por linha. Na projeção, o coeficiente 3/2 produz [1.5,1.5]; o restante [0.5,-0.5] tem produto interno zero com a direção. Um coeficiente sem multiplicar o vetor ainda não é a projeção completa.
No ajuste, a diferença entre 3b+5m=6 e 3b+3m=5 dá m=0.5. Substituir na primeira dá b=7/6. A soma dos resíduos é zero e a soma ponderada pelos tamanhos também é zero. Esses dois testes diagnosticam a solução, enquanto SSE=1/6 quantifica a discrepância que a reta não remove.
Tamanhos constantes não identificam separadamente os dois parâmetros. Já multiplicar tamanhos por cem exige inclinação 0.005 e mantém o intercepto e as previsões. Uma boa justificativa apresenta as contas, explica a unidade da inclinação e reconhece que os três registros não validam extrapolação nem causalidade.
Como conferir seu resultado
- Dimensões explicitadas antes da multiplicação.
- Projeção e resíduo calculados com produto interno.
- Parâmetros e SSE conferidos manualmente.
- Dependência de colunas e mudança de unidade explicadas.
Teste sua compreensão
Responda com suas palavras antes de abrir o comentário. Saber explicar uma decisão é parte do domínio.
1. Por que [2,5] e [5,2] não são intercambiáveis?
Porque a posição identifica o atributo.
Permutar coordenadas sem permutar o contrato muda a entrada representada.
2. Qual é o resíduo da projeção de [2,1] em [1,1]?
[0.5,-0.5].
Subtraímos a projeção [1.5,1.5] e conferimos produto interno zero.
3. Determinante zero significa que uma reta não pode produzir previsões?
Não; significa que os parâmetros não são identificados separadamente.
Colunas dependentes permitem diferentes parâmetros com as mesmas previsões.
Seu progresso fica salvo neste navegador. Concluir a leitura não substitui demonstrar o domínio nos exercícios.
Referências e aprofundamento
Documentação oficial e trabalhos originais. As referências registram o escopo e as limitações para você conferir o que sustentam.
- 18.06 Linear Algebra — syllabus
MIT OpenCourseWare • consulta: 2026-10-06
MatemáticaVetores, sistemas lineares, projeções e mínimos quadrados como fundamentos da disciplina.
Limites: Programa da disciplina de 2010; exemplos numéricos e implementação desta preparação são originais e não cobrem o curso completo.
- CS229 Linear Algebra Review and Reference
Stanford University / Zico Kolter e Chuong Do • consulta: 2026-10-06
MatemáticaSeções 2.1, 3.5, 4.1 e 4.4: produto escalar, normas, gradiente e mínimos quadrados.
Limites: Notas de 2015; explicam as operações matemáticas, não garantias de busca semântica ou generalização.