新闻和博客

“基于实例”和“基于模型”的学习

基于实例和基于模型的学习
银行业管理中的人工智能新闻

“基于实例”和“基于模型”的学习

由皮埃尔·朱塞佩·吉里博内编辑

另一种对学习系统进行分类的方法是基于它们的泛化能力。

大多数机器学习算法的预期目标都与其预测能力有关。这意味着,给定一定数量的训练样本,系统必须能够对新的或先前未知的数据做出良好的预测。

在训练数据(“样本内”)上找到良好的性能指标固然是好事,但这还不够,因为真正的目标是在新实例上获得可靠的结果。

因此,“样本外”测量是验证系统是否能够正确概括训练期间获得的知识的最佳工具。

泛化方法主要有两种:基于实例的学习基于模型的学习

最简单的学习方式,也就是第一类,就是死记硬背。这意味着,如果我们设计一个遵循这种启发式方法的垃圾邮件过滤器,它会将所有与已被其他用户标记为垃圾邮件的邮件完全相同的邮件都标记为垃圾邮件。这或许不是解决问题的最差方法,但肯定不是最佳方法。

与其标记与已识别垃圾邮件完全相同的邮件,该算法还可以被编程为标记与已知垃圾邮件非常相似的邮件。这种设计方法虽然显然更合理,但需要对两封邮件之间的相似度进行衡量。

例如,一个非常简单的相似性度量可以用两封电子邮件中共同出现的单词数量来表示:如果新实例与已知为垃圾邮件的实例之间的比较显示有很多共同的单词,则系统会将它们标记为垃圾邮件。

这种学习方式称为基于实例的学习:算法尽可能忠实地学习训练期间提供的示例,然后使用相似性度量将此知识推广到新案例,以便与已知元素(或其中的一个子集)进行比较。

另一种从一组示例中进行概括的方法是构建这些示例之间潜在关系的数学模型,并利用该模型进行预测。这种概括方式称为基于模型的学习

假设我们有一个可以用散点图表示的数据集,即用排列在笛卡尔平面上的点来表示的数据集。例如,经合组织(经济合作与发展组织)美好生活指数(https://www.oecdbetterlifeindex.org)与人均GDP(国内生产总值)之间的关系就属于这种情况。

虽然众所周知金钱本身并不能带来幸福,但统计数据清楚地表明,金钱可以作为一种工具来帮助人们实现这一崇高的目标,当然,前提是要考虑到道德以及对我们星球上其他现在和未来居民的相互尊重。

因此,在因变量(指数得分,图表的y轴)和自变量(人均GDP,图表的x轴)之间会观察到一条正向趋势线。各点将大致沿这条上升趋势线排列。因此,能够恰当地表示这种关系的数学模型是线性模型。它可以表示为:得分= θ0 + θ1 * GDP

所描述的阶段称为模型选择:也就是说,在所有能够表示可用数据之间关系的数学函数中,选择最合适的函数。这种选择可能是直觉的结果,正如刚才讨论的情况一样;也可能源于在特定假设下经过验证的严格数学证明。

例如,我们能够根据债券收益率计算其价格的关系是基于严格、众所周知的金融数学原理,因此,构建一个直接从经验数据中学习或通过从中推导出的代表性模型的直觉来学习该关系的算法是没有意义的。

一旦确定了得分与 GDP 之间的关系,就必须确定theta0(线性模型常数)和theta1(线性模型斜率)的最合适值,即最能代表数据中存在的趋势的值。

为了获得模型参数的最优值,需要指定一个性能指标。通常,可以定义一个效用函数(称为适应度函数)来衡量模型的优劣,或者定义一个成本函数衡量模型的劣劣程度。

对于像本文提出的这种线性回归问题,通常会使用成本函数来衡量线性模型提供的理论预测与用于训练模型的数据中实际发生的预测之间的距离:目标是最小化这种距离。

此时,学习过程开始发挥作用:输入训练数据,找到最具代表性的参数值,即那些能够最好地概括数据之间假定存在的关系的参数值。

值得注意的是,在线性回归的情况下,存在解析公式可以让我们找到 theta 的值它实际上是 OLS——普通最小二乘法。

对于非线性模型,采用数值方法来解决模型训练问题。

训练阶段完成后,即可使用校准后的模型进行预测。

例如,假设有一个国家的 GDP 已知,但经合组织尚未计算出该国的得分。

我们可以使用线性关系式Score = theta0 + theta1*GDP,将自变量(国内生产总值)的值替换为该国的已知值,使用估计的 theta,并将因变量的值(即我们模型解释的分数)作为输出(即作为预测)获得。

总之,可以看出传统计量经济学最常用的方法是基于模型的方法,在这种方法中,一旦选定了数据之间的现有关系,就会做出最佳估计来确定该模型的系数。

基于实例的学习不会预先假设数据之间的关系必须适应的函数形式,随着新的机器学习范式的出现,它受到了特别重视。

最后,我们断言“天下没有免费的午餐”:虽然基于实例的学习在定义数据之间的关系方面提供了更大的灵活性,因为它不必事先指定,但必须强调的是,具有这种学习类型的模型更容易出现潜在的过拟合数据的情况,并且往往是“黑箱”,因此缺乏对所获得预测结果的可解释性。

选择要显示的字段。 其他人将被隐藏。 拖放以重新排列顺序。
  • 图片
  • SKU
  • 评分
  • 价格筛选
  • 股票
  • 可用性
  • 加入购物车
  • 描述
  • 内容
  • 重量
  • 尺寸
  • 其他信息
点击外部隐藏比较栏
竞品对比