首页
学习
活动
专区
圈层
工具
发布

横向对比观察:当其他工具还在调试数据,它已经自动完成数据清洗

做文献计量,最磨人的未必是画图解读,而是前期的数据整理工作。很多科研伙伴应该深有体会,收集来的文献题录,经常存在格式错乱、字段缺失、关键词格式不统一等各类问题。不少工具需要使用者花费大量时间手动修正字段,格式稍有不对,后续运算就会报错,经常卡在预处理环节很久。

我们课题组在实际测试中发现,文渊智阁自带的数据清洗能力,可以对检索获取或者用户上传的文献题录做自动化规整处理,统一字段格式,规整关键词,减少大量手动修改的工作量。我们导入几百条题录数据集,省去逐行校对格式的步骤,平台完成预处理之后,就可以直接开展计量运算。

并不是说别的工具做不到数据处理,只是不同工具的侧重点不一样,部分工具更偏向于后期可视化运算,前期数据预处理需要用户自行完成。文渊智阁把检索、清洗、计量、绘图整合到同一套体系内,数据流转都在平台内部闭环,减少文件来回导出导入带来的格式损耗问题。

生成的各类可视化图谱,关键节点都可以溯源到对应的文献,方便我们随时核查原始资料。这里也要客观说明,自动清洗无法处理全部异常数据,遇到格式偏差极大的数据集,依旧需要人工微调。对于大多数普通课题研究,这套能力可以大幅降低前期准备成本,让我们把更多时间放在解读分析结果,而不是反复调试数据格式上。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OWmj9Up8FXDZ5nHpGDpp4ziA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券