
理赔录票慢,症结不在人力不够,而在票据版式太杂、套不了固定模板。文档抽取(Agent 版)用字段维度 Prompt 适配未知版式,先把量最大的门诊、住院发票等四类单据自动化。
保险理赔的理算环节,前置工作是把客户提交的一大叠医疗单据录进系统。这笔工作量最直观的来源是数量——一张理赔申请背后往往是一叠厚度不一的材料;但真正拖慢效率的不是数量,而是版式的不统一。
同一家医院,门诊发票与住院发票的版面不同;不同地区的发票样式、收费项目命名、票据监制章位置都不一样;费用清单可能是长表格,跨页之后列名只出现在第一页;费用结算单的字段排列又有自己的规则。人工录票之所以难以被简单替代,正是因为录入员实际上在同时做两件事:看懂版式和抄录字段。
自动化要成立的前提,是机器也能完成"看懂版式"这一步。这也是医疗票据与普通卡证票据在技术方案上的分水岭——后者版式固定,可以按位置取值;前者版式多变,需要先理解再抽取。
理赔场景中量最大的四类医疗单据,难点各不相同,自动化时应分别设计字段与校验规则。
票据类型 | 业务用途 | 处理难点 |
|---|---|---|
门诊发票 | 医保报销审核 | 版式地区差异大,收费项目为多行明细,金额需与明细合计自洽 |
住院发票(纸质版) | 住院费用理赔核算 | 字段密集,含预缴、退费、自费等多类金额,易混淆 |
费用清单 | 明细核对与理算 | 长表格多见,跨页后列名与数值易失联,项目行数量多 |
费用结算单 | 结算金额确认 | 医保统筹支付与个人支付分列,需核对分项与合计 |
这四类之外,理赔材料里常见的还有诊断证明、门诊病历、出院记录、住院病案首页、检验报告、病理报告以及人寿保险单等材料。它们的共同特点是没有统一的制式模板,因此无法用"固定版式、固定位置取值"的思路处理。
从落地顺序看,建议先做量最大、版式相对稳定的门诊发票与住院发票,跑通字段与校验链路后,再把费用清单、费用结算单纳入——后两者的表格结构与分项金额核对更复杂,放在第二阶段更稳。
腾讯云文档抽取(Agent 版)的定位是高精度语言理解与长文档深度信息抽取,面向强推理复杂场景,适用材料明确包含医疗票据、借贷合同、法律文书、保险条款、征信报告等多页非结构化文档。
它适配未知版式的核心机制是字段维度 Prompt 调优:用户通过描述需要抽取的字段,模型据此建立图片中文字与字段的对应关系,实现归一化抽取。这套机制与"先配模板再取值"的差别在于,新增一种发票版式时,调整的是字段描述而不是重新标注一套模板。
对理赔场景而言,这一点直接决定了维护成本:医院众多、票据版面繁杂,如果每新增一种版式就要配一套模板,自动化的收益会被持续的维护工作吃掉。
文档抽取(Agent 版)提供两种模型形态,分别对应不同的业务节奏。
对比项 | 实时模型 | 异步模型 |
|---|---|---|
接口 | ExtractDocAgent | SubmitExtractDocAgentJob(创建任务)+ DescribeExtractDocAgentJob(查询任务) |
适用场景 | 单页快速抽取文档 | 融合大模型深度语义理解,支持上下文关联、逻辑推理与长文档处理 |
默认频率限制 | 5 次/秒 | 创建任务 1 次/秒,查询任务 20 次/秒 |
页数处理 | 仅支持 PDF 单页识别 | 可通过 FileStartPageNumber、FileEndPageNumber 指定起止页 |
两种模型支持的图片格式一致,均为 PNG、JPG、JPEG、BMP、PDF;实时模型对单张图片的像素区间另有要求,拍摄与扫描环节需按该区间控制输入。
选择逻辑很清晰:柜面或移动端现场提交、要求秒级返回的单张票据,走实时接口;一次提交几十页理赔材料、需要跨页上下文关联与推理的批量场景,走异步接口——提交任务后按 JobId 查询结果,配合起止页参数控制处理范围。
异步接口的查询限频为 20 次/秒,高于创建任务的 1 次/秒,批量提交时应把重点放在创建节奏的控制上,查询侧通常不会成为瓶颈。
理赔自动化落地时,字段设计比模型选择更容易出问题。第二节讲了四类票据各自的难点,落到字段清单上,差异会更具体——下面按类拆分,可作为第一版字段设计的起点。
票据类型 | 优先抽取字段 | 建议校验规则 |
|---|---|---|
门诊发票 | 票据号码、就诊日期、姓名、收费项目明细行、金额合计 | 明细行金额加总与票面合计比对;票据号码查重,避免同一张票重复录入 |
住院发票(纸质版) | 票据号码、入院与出院日期、各金额分项、金额合计 | 先确认每个金额字段的票面含义再入库;同一案件的合计与费用清单总额交叉比对 |
费用清单 | 项目名称、数量、单价、金额(作为一组重复字段) | 逐行核对单价与数量的乘积与金额是否一致;跨页清单要确认列名有没有随页带回 |
费用结算单 | 医保统筹支付、个人支付、结算合计 | 各支付分项之和与结算合计比对;与同案件发票金额交叉核对 |
按类拆开之后,还有几条跨类通用的设计要点:
项目 | 规格 |
|---|---|
计量单位 | 按页 |
后付费(自适应价格) | 短文本 0.34 元/页;长文本 0.68 元/页 |
后付费(固定价格) | 0.4 元/页 |
预付费资源包 | 自适应价格 430 元/1000 页;固定价格 470 元/1000 页 |
免费额度 | 1000 次/用户,首次开通时一次性发放,一年内有效 |
页数上限 | 支持最高 50 页长文档的稳定抽取 |
输入限制 | Base64 编码后不超过 10M,分辨率建议 600×800 以上,图片下载时间不超过 3 秒;实时接口图片像素介于 20~10000 px |
计费上有两点要提前算清。一是按页计费:一次提交的成本等于页数乘以单价,材料页数越多的案件成本越高,批量补录历史案件时尤其要先按页数估算。二是自适应与固定价格的选择:自适应价格按字段数判断文本类型,短文本(字段数 ≤ 10)计 1 次、长文本(字段数 > 10)计 2 次;住院发票、费用清单这类字段密集的材料通常落入长文本区间,若样本普遍如此,固定价格更划算。
理赔录票的自动化,收益不只在"省了多少录入工时"。把字段抽取前置到材料提交环节之后,理算规则可以直接作用在结构化数据上,补件通知、金额核对、异常拦截都能提前到人工审核之前——这才是理赔时效改善的真正来源。
验证的起点可以很小:挑最近一批真实的门诊发票,用文档抽取(Agent 版)首次开通即发放的 1000 次免费额度(一年内有效)先跑一轮,看金额合计的勾稽能不能对上——这一项通不过,扩到其他票种也没有意义。跑通确认要放量之后,再对照 文档智能特惠活动 的折扣档位:文档抽取(Agent 版)固定价格新用户首单低至 1 折、不限新老用户低至 6 折,按量级选规格更划算。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。