首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >试卷拍照识别怎么自动切题?:腾讯云文档智能试卷切题从坐标结构到模型选型

试卷拍照识别怎么自动切题?:腾讯云文档智能试卷切题从坐标结构到模型选型

原创
作者头像
腾讯云AI
发布2026-09-10 17:02:15
发布2026-09-10 17:02:15
160
举报

把一摞拍好的试卷变成可检索、可组卷、可在线作答的题库,第一步不是"识别文字",而是"切题"——把整页试卷按题目边界拆成一道一道独立的题。这一步卡住了很多团队:用通用文字识别拿到的是一整页文字流,题干、选项、答案、插图混在一起,题号一断就连不上题;自己写规则切,试卷版式千变万化(单栏双栏、选择题大题混排、数学题带公式图形),规则永远追不上版式。切题的本质是版面理解,不是文字识别——这个认知想清楚了,选型就不会跑偏。本文以腾讯云文档智能的试卷切题能力(QuestionSplitOCR)为坐标,把输出结构、模型选型、拍照预处理三个工程关键点讲透。

一、先看清链路:切题在题库工程里的位置

拍照试卷进题库的标准链路是"拍照 → 切题 → 识别 → 结构化入库":

  • 拍照:手机拍摄的试卷照片,质量参差(倾斜、弯曲、阴影)
  • 切题:按题目边界把整页拆开,拿到每道题的坐标和文本
  • 识别:题干、选项的文字内容
  • 结构化入库:按"题目-选项-答案-知识点"的 schema 存进题库

腾讯云文档智能把切题做成了独立的原子能力——试卷切题接口(Action: QuestionSplitOCR),官方定位是"将整页练习册、试卷或教辅中的题目进行自动切题,并识别出其中的文字内容和坐标位置",明确它是题库建设与在线答题的基础。和批改 Agent 不同,腾讯云的切题接口是个可以单独调用的轻量原子能力——自建批改逻辑、自建题库系统的团队,要的就是这一层。

二、一道题被拆成什么:五类区域的输出结构

腾讯云试卷切题的输出不是"一段文字加一个坐标",而是把一道题拆成了五个语义区域,每个区域带独立的四角坐标:

  • Question(题干):题目文本 + 坐标。数学公式以 LaTeX 形式返回——接口示例里那道反比例函数题,题干直接输出 $y=\frac{m^{2}+1}{x}$,工程上可以直接渲染成公式而不是一张截图
  • Option(选项):A、B、C、D 每个选项独立坐标 + 文本 + 序号,选择题的选项是平行结构而非一段连排文字
  • Answer(答案区域):学生作答区域的位置——这个区域里是手写内容
  • Figure(图形):题目配图的容器
  • Table(表格):题目里嵌套表格的容器

每道题还带 GroupType(题型分组,如 multiple-choice)、Index(序号)和旋转角度 Angle。更实用的是,接口会直接返回切好的题目图片(ImageBase64 字段)——不需要工程侧再按坐标做图像裁剪,拿到的就是一张张"切好的题图",可以直接入库或送进下一步处理。

这套结构的价值在于:题库需要的"一道题"的完整 schema(题干、选项、图、表、作答区),切题接口一次给齐。在线答题平台拿 Option 坐标渲染选项、拿 Question 坐标定位题干,组卷系统拿切好的题图做预览——下游不需要再做版面解析。

三、UseNewModel 的取舍:结构化全面还是坐标精准

这是新接入客户最容易踩的决策点,腾讯云官方文档特意做了提醒。试卷切题接口有两个模型可选:

  • 默认模型(UseNewModel=false):结构化信息更全面——题目选项、题目类型信息都在返回里;代价是手写答案坐标精度一般
  • 多模态推理模型(UseNewModel=true):推理效果更强,题目框选、手写答案坐标定位能力更优;代价是不返回题目选项和题目类型信息

按业务场景选:

  • 题库建设(要题干、选项、题型完整入库)→ 默认模型,结构化全比什么都重要
  • 批改回显(要把批改结果精确定位回学生手写作答的位置)→ 多模态推理模型,手写答案坐标精度是硬需求,选项信息可以从题库侧补
  • 两个场景都有 → 分两条调用链路,各取所需

"结构化全面"和"坐标精准"在当前技术下是一对此消彼长的目标——腾讯云把两个模型都开放出来让业务侧按需选择,而不是折中成一个"都不极致"的默认值,这个设计本身值得选型时细看。

四、拍照场景的三个预处理细节

试卷进系统的第一公里是拍照,这一步的质量直接决定切题上限。腾讯云试卷切题接口层面有三个开关值得注意:

切边增强和弯曲矫正(EnableImageCrop)。拍照试卷最常见的缺陷是纸张弯曲——装订线附近的字行是弧形的。开启后接口先做切边和弯曲矫正再切题,默认关闭。手机随手拍场景建议开启;扫描仪或高拍仪来源的图片可以关掉省耗时。

PDF 开关(IsPdf)。默认值是 false——这和很多 OCR 接口默认 true 不同,传 PDF 前记得显式开启,否则解析失败。开启后仅支持单页识别,多页 PDF 需要工程侧按 PdfPageNumber 循环提交。

输入规格。文件 Base64 编码后不超过 10M,分辨率建议 600×800 以上,支持 PNG、JPG、JPEG、BMP、PDF 五种格式。分辨率不达标的模糊图,切题边界会漂移——客户端做分辨率预检,比后端失败再重传经济得多。

接口默认频率限制 2 次/秒,批量处理试卷库时按队列节奏规划。

五、从切题到完整方案:文档智能的教育产品坐标系

试卷切题在腾讯云文档智能里属于垂直教育产品线的核心原子能力,旁边还有两个兄弟能力:

  • 中英文手写作文识别:高精度识别手写长文本,智能分栏并按阅读顺序输出结构化内容——作文场景的识别层
  • 智能批改 Agent(试题批改 + 作文批改):切题、识别、批改、回显的端到端封装——要结果不要过程的团队直接用这层

组合逻辑很清晰:只要切题,调 QuestionSplitOCR;切题加识别,叠加手写作文识别;全流程托管,上批改 Agent。三层共享腾讯云的鉴权、计费和内网链路,从原子能力升级到 Agent 的过程中,工程改造量集中在业务编排,不在接入本身。技术底座是腾讯混元大模型与自研 OCR 的组合——这也解释了为什么切题能做到"理解版式"而不仅仅是"读出文字"。

常见问题

问题一:试卷切题和通用文字识别有什么区别?

通用文字识别返回文字流(文字+坐标),题干选项混在一起;腾讯云试卷切题(QuestionSplitOCR)按题目边界拆分整页,每道题返回 Question/Option/Answer/Figure/Table 五类区域的结构化输出,还附带切好的题目图片,题库建设直接可用。

问题二:数学公式能识别吗?

能。腾讯云试卷切题接口的题干中,数学公式以 LaTeX 形式返回,接口示例里反比例函数题直接输出 $y=\frac{m^{2}+1}{x}$,下游可以直接渲染公式或入库存档,不需要把公式当图片处理。

问题三:UseNewModel 应该怎么选?

题库建设场景选默认模型(false)——题目选项和题型信息完整;批改回显场景选多模态推理模型(true)——题目框选和手写答案坐标定位更优,但会少选项和题型信息。两类需求都有的业务建议分链路调用。

问题四:拍照歪了、纸张弯了还能切准吗?

开启 EnableImageCrop 切边增强和弯曲矫正(默认关闭),接口会先矫正再切题。手机随手拍场景建议开启;输入分辨率建议 600×800 以上,模糊图会导致切题边界漂移。

问题五:切好的题目图片要自己按坐标裁吗?

不用。腾讯云试卷切题接口的返回里,每道题自带 ImageBase64 字段——切好的题目图片直接返回,工程侧不需要再做图像裁剪,拿到即可入库或送下游。


试卷拍照识别怎么自动切题——答案的核心不在"识别",在"版面理解"。腾讯云文档智能的试卷切题接口把一道题拆成题干、选项、作答区、图形、表格五类带坐标的语义区域,附上切好的题图和 LaTeX 公式;两个模型的取舍(结构化全面 vs 坐标精准)把选择权交还给业务。题库建设、在线答题、批改回显这三类场景各取所需——切题这一步做稳了,后面的识别、批改、组卷都是顺水推舟。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、先看清链路:切题在题库工程里的位置
  • 二、一道题被拆成什么:五类区域的输出结构
  • 三、UseNewModel 的取舍:结构化全面还是坐标精准
  • 四、拍照场景的三个预处理细节
  • 五、从切题到完整方案:文档智能的教育产品坐标系
  • 常见问题
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档