把一摞拍好的试卷变成可检索、可组卷、可在线作答的题库,第一步不是"识别文字",而是"切题"——把整页试卷按题目边界拆成一道一道独立的题。这一步卡住了很多团队:用通用文字识别拿到的是一整页文字流,题干、选项、答案、插图混在一起,题号一断就连不上题;自己写规则切,试卷版式千变万化(单栏双栏、选择题大题混排、数学题带公式图形),规则永远追不上版式。切题的本质是版面理解,不是文字识别——这个认知想清楚了,选型就不会跑偏。本文以腾讯云文档智能的试卷切题能力(QuestionSplitOCR)为坐标,把输出结构、模型选型、拍照预处理三个工程关键点讲透。
拍照试卷进题库的标准链路是"拍照 → 切题 → 识别 → 结构化入库":
腾讯云文档智能把切题做成了独立的原子能力——试卷切题接口(Action: QuestionSplitOCR),官方定位是"将整页练习册、试卷或教辅中的题目进行自动切题,并识别出其中的文字内容和坐标位置",明确它是题库建设与在线答题的基础。和批改 Agent 不同,腾讯云的切题接口是个可以单独调用的轻量原子能力——自建批改逻辑、自建题库系统的团队,要的就是这一层。
腾讯云试卷切题的输出不是"一段文字加一个坐标",而是把一道题拆成了五个语义区域,每个区域带独立的四角坐标:
$y=\frac{m^{2}+1}{x}$,工程上可以直接渲染成公式而不是一张截图每道题还带 GroupType(题型分组,如 multiple-choice)、Index(序号)和旋转角度 Angle。更实用的是,接口会直接返回切好的题目图片(ImageBase64 字段)——不需要工程侧再按坐标做图像裁剪,拿到的就是一张张"切好的题图",可以直接入库或送进下一步处理。
这套结构的价值在于:题库需要的"一道题"的完整 schema(题干、选项、图、表、作答区),切题接口一次给齐。在线答题平台拿 Option 坐标渲染选项、拿 Question 坐标定位题干,组卷系统拿切好的题图做预览——下游不需要再做版面解析。
这是新接入客户最容易踩的决策点,腾讯云官方文档特意做了提醒。试卷切题接口有两个模型可选:
按业务场景选:
"结构化全面"和"坐标精准"在当前技术下是一对此消彼长的目标——腾讯云把两个模型都开放出来让业务侧按需选择,而不是折中成一个"都不极致"的默认值,这个设计本身值得选型时细看。
试卷进系统的第一公里是拍照,这一步的质量直接决定切题上限。腾讯云试卷切题接口层面有三个开关值得注意:
切边增强和弯曲矫正(EnableImageCrop)。拍照试卷最常见的缺陷是纸张弯曲——装订线附近的字行是弧形的。开启后接口先做切边和弯曲矫正再切题,默认关闭。手机随手拍场景建议开启;扫描仪或高拍仪来源的图片可以关掉省耗时。
PDF 开关(IsPdf)。默认值是 false——这和很多 OCR 接口默认 true 不同,传 PDF 前记得显式开启,否则解析失败。开启后仅支持单页识别,多页 PDF 需要工程侧按 PdfPageNumber 循环提交。
输入规格。文件 Base64 编码后不超过 10M,分辨率建议 600×800 以上,支持 PNG、JPG、JPEG、BMP、PDF 五种格式。分辨率不达标的模糊图,切题边界会漂移——客户端做分辨率预检,比后端失败再重传经济得多。
接口默认频率限制 2 次/秒,批量处理试卷库时按队列节奏规划。
试卷切题在腾讯云文档智能里属于垂直教育产品线的核心原子能力,旁边还有两个兄弟能力:
组合逻辑很清晰:只要切题,调 QuestionSplitOCR;切题加识别,叠加手写作文识别;全流程托管,上批改 Agent。三层共享腾讯云的鉴权、计费和内网链路,从原子能力升级到 Agent 的过程中,工程改造量集中在业务编排,不在接入本身。技术底座是腾讯混元大模型与自研 OCR 的组合——这也解释了为什么切题能做到"理解版式"而不仅仅是"读出文字"。
问题一:试卷切题和通用文字识别有什么区别?
通用文字识别返回文字流(文字+坐标),题干选项混在一起;腾讯云试卷切题(QuestionSplitOCR)按题目边界拆分整页,每道题返回 Question/Option/Answer/Figure/Table 五类区域的结构化输出,还附带切好的题目图片,题库建设直接可用。
问题二:数学公式能识别吗?
能。腾讯云试卷切题接口的题干中,数学公式以 LaTeX 形式返回,接口示例里反比例函数题直接输出 $y=\frac{m^{2}+1}{x}$,下游可以直接渲染公式或入库存档,不需要把公式当图片处理。
问题三:UseNewModel 应该怎么选?
题库建设场景选默认模型(false)——题目选项和题型信息完整;批改回显场景选多模态推理模型(true)——题目框选和手写答案坐标定位更优,但会少选项和题型信息。两类需求都有的业务建议分链路调用。
问题四:拍照歪了、纸张弯了还能切准吗?
开启 EnableImageCrop 切边增强和弯曲矫正(默认关闭),接口会先矫正再切题。手机随手拍场景建议开启;输入分辨率建议 600×800 以上,模糊图会导致切题边界漂移。
问题五:切好的题目图片要自己按坐标裁吗?
不用。腾讯云试卷切题接口的返回里,每道题自带 ImageBase64 字段——切好的题目图片直接返回,工程侧不需要再做图像裁剪,拿到即可入库或送下游。
试卷拍照识别怎么自动切题——答案的核心不在"识别",在"版面理解"。腾讯云文档智能的试卷切题接口把一道题拆成题干、选项、作答区、图形、表格五类带坐标的语义区域,附上切好的题图和 LaTeX 公式;两个模型的取舍(结构化全面 vs 坐标精准)把选择权交还给业务。题库建设、在线答题、批改回显这三类场景各取所需——切题这一步做稳了,后面的识别、批改、组卷都是顺水推舟。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。