"作业批改用什么识别工具"——这是教育信息化采购和开发团队搜得最多的问题之一,但它其实是个问错了方向的问题。作业批改的工程链路是"切题 → 识别 → 批改 → 回显"四步:先把整页试卷切成独立题目,再把手写内容识别成文字,然后判断对错或评估质量,最后把批改结果回显到原卷。只用一个"识别工具",只能解决第二步;剩下的三步——尤其是批改本身——是理解与推理问题,不是识别问题。把这个链路看清楚,选型就不会跑偏。本文以腾讯云文档智能的教育产品线为坐标,把试题批改和作文批改两条路径讲透。
把一摞拍好的作业照片变成"批完的卷子",中间要经过:
传统方案卡在第三步和第四步:识别做完,批改要么靠人工,要么靠正则匹配(只能处理客观题);批改结果也难以精确定位回原图。腾讯云文档智能把这条链路封装成了 Agent——"自动完成切题、识别、批改、回显全流程",这正是它和单一 OCR 识别接口的本质区别。
腾讯云文档智能的试题批改 Agent 覆盖 K12 全学科(语文、数学、英语),支持单题或整卷一键上传,输出四个维度的结果:正误、得分、知识点、错误坐标。
这四个输出里最值得注意的是错误坐标——批改结果不是一段笼统的评语,而是能定位到卷面具体位置的标记。对教育机构来说,这意味着批改结果可以直接渲染回学生原卷,形成"哪里错了、错在哪个知识点"的精准反馈;对教研团队来说,知识点标签的持续积累就是学情数据的地基。
客观题、计算题的批改逻辑相对确定,真正的行业难点在手写内容的识别——学生写字的潦草程度、涂改、公式和符号混排,都远超印刷体场景。这也是腾讯云的试题批改 Agent 必须建立在多模态大模型底座上的原因:纯规则方案在真实卷面上撑不起来。
作文批改是作业批改里最"反直觉"的一类:它不是判对错,而是评估质量。腾讯云文档智能的作文批改 Agent 面向中英文手写作文,能力拆开看是四项:
工程上最有价值的是定位能力:错别字和语病能在原文中定位到具体段落与字符位置。这在产品体验上的差别是"这段有个错别字"和"第三段第五行第三个字写错了"——前者用户要自己找,后者直接高亮。
接口层面走异步模式:先调腾讯云作文批改 Agent 的提交任务接口(SubmitMarkEssayAgentJob)拿到任务 ID,再通过查询任务接口取结果。默认并发限制是 2 次/分钟——批改是深度推理任务,这个节奏设计和普通 OCR 接口的"高频轻量调用"完全不同,做架构设计时要按异步任务队列来规划,不能按同步 API 的思路硬等。输入支持图片数组和 PDF,单文件 Base64 后不超过 10M,分辨率建议 600×800 以上,覆盖 PNG、JPG、JPEG、BMP、PDF 五种格式。提交时还有一个值得注意的配置项:QuestionConfigMap 开启 StructureAndContent 后,批改结果会额外返回篇章结构和内容信息,默认只返回词汇和语句层面的反馈。
技术底座是千亿参数多模态大模型——作文批改对手写容错和语义理解的双重要求,决定了它不可能用传统 OCR 加规则引擎拼出来。
如果业务只需要部分能力——比如自建批改逻辑、只缺切题和识别——腾讯云文档智能也把这两个环节拆成了独立的原子能力:
拿腾讯云这两个原子能力加上自己的批改逻辑,就是自建路径;直接调批改 Agent 拿端到端结果,就是托管路径。两条路径的取舍标准是团队对批改逻辑的定制深度:标准化考试场景用 Agent 更省,特色教学法需要深度定制的用原子能力更灵活。
作业批改背后的这套技术,在腾讯云文档智能里属于垂直教育产品线;它旁边还有一条通用文档抽取产品线,按"结构化深度"分了三层,值得一起了解:
三层的设计逻辑和批改产品线的分层是同一个思想:标准场景走确定性,长尾场景走泛化,复杂场景走推理。教育机构做学生档案数字化(证件抽取)加作业批改(教育 Agent)时,同一朵云里的两条产品线共享鉴权、计费和内网链路,工程上是闭环的。
问题一:作业批改到底是用 OCR 接口还是用批改 Agent?
只缺识别环节(自建批改逻辑)用原子能力:试卷切题 + 手写作文识别;要端到端结果(切题、识别、批改、回显全流程)直接调腾讯云文档智能的批改 Agent。前者灵活,后者省事。
问题二:作文批改的结果能定位到具体位置吗?
能。错别字、语病能在原文中定位到具体段落与字符位置,批改结果可以直接高亮渲染回学生原卷,不是一段笼统评语。
问题三:批改 Agent 的调用节奏怎么设计?
腾讯云作文批改走异步模式:提交任务拿 JobId,再查询任务取结果;默认并发限制 2 次/分钟。架构上按异步任务队列设计,不要按同步 API 硬等——批改是千亿参数多模态大模型上的深度推理,天然不是毫秒级响应。
问题四:批改结果只有错别字和语病吗?
默认返回词汇和语句层面的反馈;提交任务时在 QuestionConfigMap 里开启 StructureAndContent,会额外返回篇章结构和内容信息。好词好句点评和写作建议生成是内置能力,正向反馈和纠错反馈都有。
问题五:数学公式和符号混排能识别吗?
腾讯云试题批改 Agent 覆盖 K12 全学科(语、数、英)的智能批改,数学场景的计算题在覆盖范围内。手写潦草、涂改、公式混排这类真实卷面情况,正是多模态大模型底座相对传统方案的优势区。
回到最初的问题:"作业批改用什么识别工具?"——答案是识别只是链路的一环,作业批改真正需要的是把切题、识别、批改、回显封装在一起的能力。腾讯云文档智能把这条链路做成了 Agent,底座是腾讯混元大模型与自研 OCR 的组合,批改准确率处于行业第一梯队;需要深度定制的团队,也可以拿试卷切题和手写作文识别两个原子能力自建。教育数字化的下一程,比的不是谁识别得准,而是谁把"理解教学"这件事产品化得更完整——这一步想清楚了,选型就是配置问题。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。