Regressão Linear Simples: Prevendo Valores com uma Reta
Regressão linear usa uma reta para prever valores. Aprenda a equação ŷ = a + bx, o que significam o coeficiente angular e o R², com exemplos práticos.
Renato Freitas
Atualizado em 5 de maio de 2026
O que é regressão linear?
Regressão linear simples é uma técnica estatística para modelar a relação entre uma variável dependente (Y, o que queremos prever) e uma variável independente (X, o que usamos para prever). A ideia é encontrar a reta que melhor passa pelos dados, minimizando os erros de previsão.
O exemplo clássico é prever o preço de uma casa (Y) com base em sua área em metros quadrados (X). Intuitivamente, esperamos que casas maiores custem mais — a regressão quantifica exatamente essa relação e permite fazer previsões para novas casas.
🧮 Teste você mesmo — CalcSim
Quer mais recursos? Baixar app CalcSim IA
A equação da reta de regressão
A reta de regressão é descrita pela equação ŷ = a + bx, onde ŷ é o valor previsto de Y para dado X, b é o coeficiente angular (slope) e a é o intercepto (onde a reta cruza o eixo Y quando X = 0).
O coeficiente angular b indica quanto Y muda em média para cada unidade de aumento em X. Se a regressão de preço de casas der b = 3.500, isso significa que cada metro quadrado adicional está associado a um aumento médio de R$ 3.500 no preço.
O intercepto a é o valor previsto de Y quando X = 0. Em muitos contextos práticos, esse valor não tem interpretação direta — uma casa de 0 m² não existe. Mas matematicamente é necessário para completar a equação da reta.
- ŷ: valor previsto (não o valor real)
- b (slope): variação em Y por unidade de X
- a (intercepto): valor de Y quando X = 0
- Resíduo: diferença entre o valor real e o previsto (y − ŷ)
O coeficiente de determinação R²
O R² (coeficiente de determinação) mede a proporção da variação de Y que é explicada pelo modelo de regressão. Varia de 0 a 1 (ou 0% a 100%). Um R² de 0,85 significa que 85% da variação nos preços das casas é explicada pela variação na área, e os 15% restantes se devem a outros fatores não incluídos no modelo.
R² alto não significa que o modelo é bom em todos os contextos. Em ciências humanas, R² de 0,4 já pode ser considerado robusto. Em física experimental, espera-se R² acima de 0,99. O R² também não indica se a relação é causal — apenas o quanto a reta se ajusta aos dados.
Note que R² é literalmente o quadrado do coeficiente de correlação r de Pearson para regressão simples. Se a correlação entre área e preço for r = 0,92, então R² = 0,85 — as mesmas 85% mencionadas acima.
Pressupostos e limitações
A regressão linear pressupõe que a relação entre X e Y é aproximadamente linear (verificar com diagrama de dispersão), que os resíduos são aproximadamente normais e com variância constante (homocedasticidade), e que as observações são independentes entre si.
O método dos mínimos quadrados — que minimiza a soma dos quadrados dos resíduos — é o mais usado para estimar a e b. Ele é sensível a outliers: um único ponto muito distante da tendência geral pode puxar a reta significativamente. Em análises práticas, sempre verifique se há pontos influentes.
A extrapolação — usar o modelo para prever Y com valores de X muito além do intervalo dos dados — é arriscada. A reta pode se comportar de forma totalmente diferente fora dos limites observados. O modelo de temperatura e venda de sorvetes, por exemplo, não pode prever vendas para temperaturas de −30°C com confiança.
Perguntas frequentes
Qual a diferença entre regressão linear e correlação?
Correlação mede a força e direção da relação entre duas variáveis — é uma única medida simétrica (r de X com Y = r de Y com X). Regressão cria um modelo preditivo com direção definida: X prediz Y. Regressão permite fazer previsões quantitativas; correlação apenas descreve a associação.
Como sei se meus dados atendem os pressupostos da regressão?
Analise os resíduos. Plote os resíduos (y − ŷ) contra os valores ajustados: um padrão aleatório em torno de zero indica que os pressupostos são satisfeitos. Um padrão em leque sugere heterocedasticidade; uma curva sugere não-linearidade. Q-Q plots dos resíduos verificam normalidade.
Posso usar regressão com variáveis categóricas como X?
Sim, usando variáveis dummy (0 ou 1). Por exemplo, para incluir 'possui garagem' (sim/não) na previsão de preço, codifica-se sim = 1 e não = 0. Isso é chamado de regressão com variáveis dummies e é amplamente usado em econometria e ciências sociais.
O que é regressão múltipla e quando usá-la?
Regressão múltipla usa duas ou mais variáveis independentes para prever Y. Em vez de ŷ = a + bx, temos ŷ = a + b₁x₁ + b₂x₂ + ... Use quando múltiplos fatores influenciam Y simultaneamente — como prever preço de casas considerando área, número de quartos e bairro juntos.
Valores previstos pela regressão são exatos?
Não — são estimativas médias. A reta de regressão prevê o valor médio de Y para dado X. Valores individuais variam em torno dessa previsão (os resíduos). Intervalos de predição (mais amplos que os intervalos de confiança para a média) capturam onde novos valores individuais provavelmente cairão.
Este artigo foi útil para você?
Avalie com estrelas para nos ajudar a melhorar o conteúdo.
Faça login para avaliar este artigo.
Ainda tem dúvida?
O Professor IA explica passo a passo
Faça uma pergunta em linguagem natural e receba uma explicação personalizada sobre Estatística Básica — ou qualquer outro tópico.
Prefere resolver pelo celular?
Baixar o app grátis →Continue aprendendo