我正在使用Weka的资源管理器功能进行分类。
所以我有我的.arff文件,有两个数值特征,我的类是一个二进制的0或1(例如{0,1})。
示例:
@RELATION summary
@ATTRIBUTE feature1 NUMERIC
@ATTRIBUTE feature2 NUMERIC
@ATTRIBUTE class {1,0}
@DATA
23,11,0
20,100,1
2,36,0
98,8,1
.....我加载这个.arff文件,使用10折交叉验证(没有测试文件),然后选择NaiveBayes,然后我对数据进行分类,结果显示:5个标签错误,100个标签正确。到目前一切尚好。
现在,我显着地更改了我的.arff文件(为我的特性属性提供了完全随机的值)。重复上述步骤,我在分类时会得到完全相同的统计数据。
我尝试对我的.arff文件做了更多的更改,使用了不同的分类算法。不管我给.arff文件赋什么值,统计数据都是一样的(在相同的算法中)。
我是不是做错了什么?
发布于 2009-11-27 19:29:21
没有更多的信息很难判断,但我有两个建议:
发布于 2010-02-11 14:44:17
另外:请记住,交叉验证在UI中是相当可怕的,因为它们只显示原始的树,无论如何(在它们折叠其他数据之前)。如果您希望生成最终的树,则需要编程API。我建议使用分离的训练/测试数据集。
发布于 2010-03-23 20:06:36
你有没有试过改变
@ATTRIBUTE class {1,0} 使用
@ATTRIBUTE class {yes,no} https://stackoverflow.com/questions/1806827
复制相似问题