Estatística BásicaAvançado· 10 min de leitura

Regressão Linear Simples: Prevendo Valores com uma Reta

Regressão linear usa uma reta para prever valores. Aprenda a equação ŷ = a + bx, o que significam o coeficiente angular e o R², com exemplos práticos.

RF

Renato Freitas

Atualizado em 5 de maio de 2026

O que é regressão linear?

Regressão linear simples é uma técnica estatística para modelar a relação entre uma variável dependente (Y, o que queremos prever) e uma variável independente (X, o que usamos para prever). A ideia é encontrar a reta que melhor passa pelos dados, minimizando os erros de previsão.

O exemplo clássico é prever o preço de uma casa (Y) com base em sua área em metros quadrados (X). Intuitivamente, esperamos que casas maiores custem mais — a regressão quantifica exatamente essa relação e permite fazer previsões para novas casas.

🧮 Teste você mesmo — CalcSim

Quer mais recursos? Baixar app CalcSim IA

A equação da reta de regressão

A reta de regressão é descrita pela equação ŷ = a + bx, onde ŷ é o valor previsto de Y para dado X, b é o coeficiente angular (slope) e a é o intercepto (onde a reta cruza o eixo Y quando X = 0).

O coeficiente angular b indica quanto Y muda em média para cada unidade de aumento em X. Se a regressão de preço de casas der b = 3.500, isso significa que cada metro quadrado adicional está associado a um aumento médio de R$ 3.500 no preço.

O intercepto a é o valor previsto de Y quando X = 0. Em muitos contextos práticos, esse valor não tem interpretação direta — uma casa de 0 m² não existe. Mas matematicamente é necessário para completar a equação da reta.

  • ŷ: valor previsto (não o valor real)
  • b (slope): variação em Y por unidade de X
  • a (intercepto): valor de Y quando X = 0
  • Resíduo: diferença entre o valor real e o previsto (y − ŷ)

O coeficiente de determinação R²

O R² (coeficiente de determinação) mede a proporção da variação de Y que é explicada pelo modelo de regressão. Varia de 0 a 1 (ou 0% a 100%). Um R² de 0,85 significa que 85% da variação nos preços das casas é explicada pela variação na área, e os 15% restantes se devem a outros fatores não incluídos no modelo.

R² alto não significa que o modelo é bom em todos os contextos. Em ciências humanas, R² de 0,4 já pode ser considerado robusto. Em física experimental, espera-se R² acima de 0,99. O R² também não indica se a relação é causal — apenas o quanto a reta se ajusta aos dados.

Note que R² é literalmente o quadrado do coeficiente de correlação r de Pearson para regressão simples. Se a correlação entre área e preço for r = 0,92, então R² = 0,85 — as mesmas 85% mencionadas acima.

Pressupostos e limitações

A regressão linear pressupõe que a relação entre X e Y é aproximadamente linear (verificar com diagrama de dispersão), que os resíduos são aproximadamente normais e com variância constante (homocedasticidade), e que as observações são independentes entre si.

O método dos mínimos quadrados — que minimiza a soma dos quadrados dos resíduos — é o mais usado para estimar a e b. Ele é sensível a outliers: um único ponto muito distante da tendência geral pode puxar a reta significativamente. Em análises práticas, sempre verifique se há pontos influentes.

A extrapolação — usar o modelo para prever Y com valores de X muito além do intervalo dos dados — é arriscada. A reta pode se comportar de forma totalmente diferente fora dos limites observados. O modelo de temperatura e venda de sorvetes, por exemplo, não pode prever vendas para temperaturas de −30°C com confiança.

Perguntas frequentes

Qual a diferença entre regressão linear e correlação?

Correlação mede a força e direção da relação entre duas variáveis — é uma única medida simétrica (r de X com Y = r de Y com X). Regressão cria um modelo preditivo com direção definida: X prediz Y. Regressão permite fazer previsões quantitativas; correlação apenas descreve a associação.

Como sei se meus dados atendem os pressupostos da regressão?

Analise os resíduos. Plote os resíduos (y − ŷ) contra os valores ajustados: um padrão aleatório em torno de zero indica que os pressupostos são satisfeitos. Um padrão em leque sugere heterocedasticidade; uma curva sugere não-linearidade. Q-Q plots dos resíduos verificam normalidade.

Posso usar regressão com variáveis categóricas como X?

Sim, usando variáveis dummy (0 ou 1). Por exemplo, para incluir 'possui garagem' (sim/não) na previsão de preço, codifica-se sim = 1 e não = 0. Isso é chamado de regressão com variáveis dummies e é amplamente usado em econometria e ciências sociais.

O que é regressão múltipla e quando usá-la?

Regressão múltipla usa duas ou mais variáveis independentes para prever Y. Em vez de ŷ = a + bx, temos ŷ = a + b₁x₁ + b₂x₂ + ... Use quando múltiplos fatores influenciam Y simultaneamente — como prever preço de casas considerando área, número de quartos e bairro juntos.

Valores previstos pela regressão são exatos?

Não — são estimativas médias. A reta de regressão prevê o valor médio de Y para dado X. Valores individuais variam em torno dessa previsão (os resíduos). Intervalos de predição (mais amplos que os intervalos de confiança para a média) capturam onde novos valores individuais provavelmente cairão.

Este artigo foi útil para você?

Avalie com estrelas para nos ajudar a melhorar o conteúdo.

Faça login para avaliar este artigo.

Ainda tem dúvida?

O Professor IA explica passo a passo

Faça uma pergunta em linguagem natural e receba uma explicação personalizada sobre Estatística Básica — ou qualquer outro tópico.

Prefere resolver pelo celular?

Baixar o app grátis →

Continue aprendendo