首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >GATE工具中的机器学习

GATE工具中的机器学习
EN

Stack Overflow用户
提问于 2014-08-28 09:34:33
回答 1查看 641关注 0票数 0

在使用GATE工具对训练数据运行机器学习算法(SVM)后,我想在测试数据上对其进行测试。我的问题是,我是否应该使用相同的训练数据进行测试,同时,模型如何从测试数据中提取实体,而测试数据没有使用训练数据中学习到的注释进行注释。

我遵循了这个链接http://gate.ac.uk/sale/talks/gate-course-may11/track-3/module-11-machine-learning/module-11.pdf上的教程,但在最后,当它谈到将数据集拆分为训练和测试时,它有点令人困惑。

EN

回答 1

Stack Overflow用户

发布于 2014-08-29 05:28:03

在GATE中,你有3种机器学习PR模式--用于训练、评估和应用。

训练时发生的情况是,ML PR正在检查选定的注释(比方说Token),收集它的特征并学习目标类(即Person、提及或其他任何类)。使用示例文档,ML PR创建了一个模型,该模型保存了特征的值,并基本上“学习”如何对新的标记(或句子或其他)进行分类。

在测试时,您仅向ML PR提供具有其所有功能的令牌。然后ML PR使用它们作为其模型的输入,并决定是否或要创建什么提及。ML PR实际上需要训练语料库中的所有内容,除了标签/目标类/提及-应该做出的决定。

我认为当处于测试模式时,GATE ML PR会忽略标签,因此删除它并不重要。

评估是一个有用的选项,其中训练和测试是自动完成的,语料库被分割并显示结果。它所做的是将语料库一分为二,在其中一部分上训练,在另一部分上应用模型,将黄金标准与它所标记的进行比较。使用不同的拆分重复此操作。

通常的顺序是训练和评估、检查结果、修复、添加功能等,当您对评估结果感到满意时,切换到应用程序并在没有标签的数据上运行。

在训练和测试时,运行相同的预处理是至关重要的。例如,如果你在训练中运行了一个POS标记器,而你在测试时跳过了这一步,那么ML PR就不会有"Token.category“功能,并且会计算出截然不同的结果。

现在回答您的问题:)

不是的!不要使用相同的数据进行测试,这是一个非常常见的错误,如果你得到了可疑的好结果,首先检查你是否在这样做。

在本教程中,当您拆分语料库时,两个部分都将像以前一样具有所有注释,因此ML PR将具有它所需的所有功能。在现实生活中,您必须首先运行一些预处理,因为文档将不带令牌或其他任何东西。

在他们的案例中,拆分非常简单-只需将所有文档保存到文件中,将文件拆分到两个文件夹中,将它们作为两个语料库加载即可。

希望这能有所帮助:)

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/25539404

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档