拿到一份数据,十有八九是脏的:有重复的、有空着的、日期有的写"2026.1.1"有的写"一月一号"、名字有全角半角。直接拿去用,模型学歪、报表算错。本文用大白话教你,怎么用 WorkBuddy 当"数据洗衣工"。
脏数据三大害:重复让统计翻倍、缺失让计算报错、格式乱让系统不认。清洗就是把数据收拾干净,让它能用。这一步省不得,后面全白搭。
下面是一段脏数据(CSV 或表格文字),请帮我清洗。
数据:[粘贴] 已知问题:[如"有重复行、日期格式乱、手机号有空格"]
请输出:
大白话讲你为什么这么处理。
第一轮:拿到干净数据 + 处理说明。 第二轮:追问"把'有疑问'的那几行,给我具体修改建议,但要我确认才改"。 第三轮:追问"生成一段质检规则清单,以后新数据照这清单查"(如"日期必须 YYYY-MM-DD")。
数据含"张三,138 0013 8000,2026.1.1"和重复行: 输出结构:
注意:以上为结构示例,实际以 WorkBuddy 实时返回为准。
追问"把上面规则写成一份'数据接入检查清单',以后每次新数据先过一遍",把一次性的活变成可复用的规矩。
坑一:让 AI 擅自改有疑问的内容,改错了难追溯。规则:"有疑问先列,不擅自改"。 坑二:不要求说明处理,后面不知它动了什么。 坑三:一次清洗太多,AI 漏处理,分批更稳。
清洗不是可有可无,是数据能用的前提。用本文模板,把重复、缺失、格式乱理干净,再进治理下一步。大白话:数据先洗澡,再上桌。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。