首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >剩余情节:为什么我们要知道错误?

剩余情节:为什么我们要知道错误?
EN

Data Science用户
提问于 2018-12-23 16:05:11
回答 2查看 756关注 0票数 3

残差图表示实际值之间的错误。

Y轴:残差X轴:预测变量或拟合值.

为什么我们想知道错误,我们得到残差有什么好处?我从视频上传了一张照片。我不明白插图里的样本是什么。

自变量和因变量(S)在哪里?如何识别错误?

它们只进行一次计算,然后应用到图形的右侧,以此类推。

我要上这门课,不知道老师在说什么。

有人能把这件事彻底搞砸吗?(这是初学者的课程!)

这是视频的文字记录:

通过检验预测值和实际值,我们看到了一个差异。我们通过减去预测值和实际目标值来获得这个值。然后,我们用因变量作为水平轴在垂直轴上绘制该值。同样,对于第二个样本,我们重复这个过程。从预测值中减去目标值。然后绘制相应的值。看这幅图能让我们对我们的数据有一些了解。我们期望看到的结果是零均值,均匀分布在x轴附近,具有相似的方差。没有曲率。这种类型的残差图表明线性图是合适的。

EN

回答 2

Data Science用户

发布于 2018-12-24 00:54:38

让我举一个例子:假设我们想通过观察浴室的数量来预测房价。X轴代表你的特征/自变量(#卫生间),y轴代表响应/因变量。这些点代表了你收集到的训练样本,同时也知道了你的自变量和因变量。

现在,在线性回归中,我们的目标是根据一个我们还没有看到的#浴室的新例子来预测房价。为此,我们必须在代表培训数据的数据点上创建一条线条。那么,什么才能使一条线成为好的还是坏的呢?答案是成本/损失函数。在线性回归中,我们经常使用误差/残差(MSE)的平方平均值:

\frac{1}{n} \sum (y_i - \hat{y_i})^2

其中y_i是真实的房价,\hat{y_i}是预测值。我们的目标是尽量减少这种损失。

绘制残差可以给我们很多启示:例如,在哪些训练样本上,我们会产生最大的误差。我们还可以看到残差是如何分布的。对于更复杂的应用,我们需要检查这个分布的所谓马尔可夫定理,这将是太多的细节。

票数 1
EN

Data Science用户

发布于 2020-01-27 14:02:17

为什么要使用剩余的地块?

残差是观测的y值(从散点图)和预测的y值(从回归方程线)之间的差额。

残差图是显示垂直轴上的残差和水平轴上的自变量的图形。如果残差图中的点是随机分布在水平轴上的,则采用线性回归模型更适合于数据;否则,采用非线性模型更合适。

良好拟合

坏拟合

非随机残差模式表示拟合度差,说明可能需要非线性模型.

  1. Roberts,D. (2019年)。残差- MathBitsNotebook(A1 - CCSS数学)。在线 Mathbitsnotebook.com.可在以下网址获得:https://mathbitsnotebook.com/Algebra1/StatisticsReg/ST2Residuals.html
  2. 库瑟拉。(2018)。使用可视化的模型评估-模型开发-课程。在线可访问:https://www.coursera.org/learn/data-analysis-with-python/lecture/istf4/model-evaluation-using-visualization 2020年年1月9日查阅。

‌‌‌

票数 1
EN
页面原文内容由Data Science提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://datascience.stackexchange.com/questions/43074

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档