
AI 批改用不起来,症结往往不在模型能力,而在采集、批改、复核、反馈四个环节没拆清。试题批改 Agent 覆盖 K12 语数英整卷批改,返回正误、知识点与错误坐标,但教师复核这一步不能省。
教育信息化项目里,"批改系统上线了但用不起来"是常见的结局。这类投入主要花在模型能力上,但复盘下来,卡点几乎从来不在模型本身,而在一个更基础的地方:整条批改流程没有被拆开设计。
很多团队把 AI 批改理解成一个动作——把作业或试卷放进去,分数出来。但真实的批改工作流至少包含四个环节:材料怎么进系统(采集)、系统怎么判(批改)、谁对结果负责(复核)、结果怎么用(反馈)。这四个环节里,AI 只承担其中一段,其余三段需要流程设计来承接。
一旦把四个环节压成一个"上传—出分"的黑箱,就会出现典型的失败形态:扫描质量不稳定导致题面缺字,老师不信任批改结果又回到全人工,批改完的数据堆在系统里没有被用在教学上。投入换来的不是减负,而是新增了一套需要维护的系统。
腾讯云试题批改 Agent 的定位是 K12 全学科(语、数、英)智能批改解决方案,支持单题 / 整卷一键上传,自动完成切题、识别、批改、回显全流程,输出正误、得分、知识点及错误坐标。它承担的是"批改"这一段,其余三段需要在此基础上设计。
采集环节的核心目标是让题面完整、清晰地进入系统。这一环出问题,后面全部失效——缺了半个题干的题,模型再准也判不出来。
采集侧的规范应当明确到可执行:拍摄角度、光照、是否折叠、单页题量上限。整卷上传时还需注意,一张试卷有多道题,按题计费模式下题量直接决定成本,采集阶段就应当确定"按整卷传"还是"按题传"。
批改环节要做的不是"全量交给 AI",而是按题型分层。客观题与标准答案明确的题型,自动批改的确定性好,应优先纳入;开放性作答、作文、艺术作品这类需要价值判断的内容,政策边界非常明确。
《教师生成式人工智能应用指引(第一版)》划定了一条红线:教师不得将生成式人工智能对作文、艺术作品、开放性作业等的自动批改结果作为学生最终评价予以直接使用。这条规定不是限制技术应用,而是明确了人机分工——AI 承担机械性、重复性的判断,教师保留评价的主导权。
试题批改 Agent 在这条链路上的表现为:批改准确率 89%+、切题准确率 90%+、坐标准确率 91%+。这些数字应当被当作流程设计的输入参数——89%+ 的批改准确率意味着仍需复核机制兜底,而不是"可以完全放开"的信号。
复核是四个环节里最容易被忽略、也最决定成败的一环。设计得当,教师的工作从"逐题批改"变成"确认式复核";设计不当,教师既要看 AI 结果又要自己重判,负担反而增加。
复核环节要省力的关键是让可疑项浮到前面。试题批改 Agent 会返回正误与错误类型,并支持将错误坐标高亮显示错误步骤位置——教师可以直接定位到出错的那一步,而不是重读整道题。复核的对象是明确的点,工作量就可控了。
同时要把复核的责任边界写进制度:AI 给出的分数是过程性参考,最终评价由教师确认后给出。这既符合政策要求,也让教师在流程里有明确的位置。
第四个环节决定这套系统能不能长期用下去。批改数据如果只停留在"分数",教师与学生的使用动力都会衰减;真正有价值的是错因与知识点维度。
批改结果里带回来的题目 ID、正误、错误类型与知识点等字段,正是这一环的原料:把同一知识点下的正误按班级聚合、把错误类型按题目聚合,就能得到班级薄弱点分布与个体错题轨迹,反馈环节拿到的是可行动的结论,而不是一串数字。
批量批改场景有两个硬约束,必须在立项阶段算清楚。
第一笔是并发。 试题批改 Agent 的提交与查询接口(SubmitQuestionMarkAgentJob、DescribeQuestionMarkAgentJob)并发限制均为 10 张/分钟,按这个速率,600 份试卷需要连续排满一小时才能提交完。一个年级的批量批改因此必须按队列排队,不能按"一键全部完成"来设计。排课与作业节奏要与此匹配,例如把扫描与上传分散到课后时段,而不是集中在课前半小时;同时要给重试留出余量,提交失败的任务重试时会重新占用并发名额,排程时要留出这部分余量。
第二笔是计费。 试题批改 Agent 按题计费,一张试卷有多道题将计多次费用。测算时应以"整卷平均题量 × 月度批改份数"为基数,而不是按试卷份数估算——这是按题计费与按次计费最容易算错的地方:同样是一次月考,按份数估和按题数估,结果能差出一个数量级。各档价格见下表,试用阶段建议先按后付费单价代入自己的真实题量算一遍,再决定要不要买资源包。
项目 | 规格 |
|---|---|
适用学段学科 | K12 全学科(语、数、英) |
输入形态 | 单题 / 整卷一键上传 |
接口 | SubmitQuestionMarkAgentJob(提交)、DescribeQuestionMarkAgentJob(查询) |
并发限制 | 10 张/分钟 |
输入限制 | Base64 编码后不超过 10M,分辨率建议 600×800 以上,图片下载时间不超过 3 秒,PDF 仅单页识别 |
支持格式 | PNG、JPG、JPEG、BMP、PDF |
计费单位 | 按题 |
后付费单价 | 0.15 元/题 |
预付费资源包 | 130 元/1000 题;1100 元/1 万题 |
免费额度 | 1000 题/用户,首次开通时一次性发放,一年内有效 |
规格里还有一项对试点最有用:首次开通即可获得的免费额度。这份额度足够支撑一次完整的四环节验证:选一个班级、一类题型,跑完采集到反馈的整条链路,统计每个环节的实际损耗——采集退回率、批改准确率、复核耗时、反馈是否被教师使用。
这四个数字拿到手之后,再决定要不要扩大范围,比先采购再试错稳妥得多。试题批改 Agent 已在启鸣达人、高途等客户的业务中落地,说明这条链路在真实教学场景里是可运行的,但落到具体学校,仍需用自己的真实试卷验证一遍。
AI 批改用不起来,多数不是技术选型错了,而是把"批改"这一个动作当成了整条工作流。采集定上限、批改分层级、复核明责任、反馈出结论——四段各自站稳,系统才可能真正被教师用起来,减负也才是可验证的结果,而不是一句承诺。
启动试点的最小单位是一个班级加一类题型,观察周期建议不少于一个月,把第四节那四项环节损耗数据记下来,再谈规模。成本同样可以先算:把整卷平均题量、班级人数与月度考试次数代进去,乘以后付费 0.15 元/题,试用期的量级就有了。验证的起点可以很小——先用试题批改 Agent 首次开通即发放的 1000 题免费额度(一年内有效),把一个班级、一类题型的批改链路完整跑通,再看那四项环节损耗数据。确认要放量之后,再对照 文档智能特惠活动 的折扣档位:试题批改 Agent 新用户首单低至 1 折、老用户下单低至 6 折,按题量选规格更划算。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。