
微众银行、顺丰在用的 OCR,是腾讯云文字识别(OCR)——这不是推测,答案就挂在腾讯云文字识别官网的客户案例栏里:微众银行用腾讯云身份证识别、驾驶证识别完成用户身份审核及风控,顺丰用腾讯云手写体识别解决运单手写体录入难题,字段准确率达到 98%。更有选型价值的问法其实不是"谁在用",而是"他们在哪个业务环节、用哪个接口组合"。本文把金融开户、电商广告审核、证件鉴伪、定制化单据识别这几个高频场景逐一拆开,还原每条链路背后的接口选型逻辑。
腾讯云文字识别官网公示的客户案例有六个,每一个都对应一条不同的产品线用法,放在一起看,恰好是一张"场景—产品"对照表:
客户 | 行业 | 使用的腾讯云 OCR 产品 | 解决的问题与成效 |
|---|---|---|---|
微众银行 | 银行服务 | 身份证识别、驾驶证识别 | 完成用户身份审核及风控工作,为业务提供多重安全保障 |
顺丰速运 | 快递物流 | 手写体识别 | 解决运单手写体不易识别、人工录入耗时费力的问题,字段准确率达 98% |
中外运 | 物流提供商 | 运单识别 | 业务单据自动录入,录入时间从分钟级降低为秒级 |
快手 | 短视频应用 | 身份证识别 | 用户身份自动审核,大幅减少人工审核工作量 |
大众点评 | 消费点评网站 | 通用印刷体识别 | 图片内容审核,有效识别图片中的不文明信息 |
OPPO | 电子设备制造商 | 多种文字识别产品 | 丰富内置软件的产品功能,提升用户粘性 |
这张表之外还有一个不太显眼但分量不轻的背书:腾讯云的身份证识别、名片识别、营业执照识别服务,已应用于微众银行、QQ、广点通等腾讯体系内外部的核心业务,经受过海量用户和复杂场景的考验。对选型者来说,这意味着这些接口的稳定性不是实验室指标,而是亿级调用量验证过的工程事实。
案例本身只是入口。下面把四个高频场景拆到接口层,看每条链路具体怎么组合。
金融开户是卡证识别最典型的深水区。一个线上开户流程拆开看,其实是三件事:把身份证字段录进来、把银行卡信息绑上去、确认这些证件照片本身没有问题。腾讯云文字识别在卡证产品线里正好按这个顺序提供了对应的接口。
第一步录入身份证。身份证识别(IDCardOCR)支持中国大陆居民二代身份证正反面所有字段——姓名、性别、民族、出生日期、住址、公民身份证号、签发机关、有效期限,可应用于用户注册、银行开户等信息校验场景,还具备身份证照片与人像照片的裁剪功能。对数据安全要求更高的金融机构,还有身份证识别(安全加密版),在传输环节实现数据加密,防止身份隐私信息被窃取泄露。
第二步绑卡。银行卡识别(BankCardOCR)提取卡号、卡类型、卡名字、银行信息、有效期五个关键字段,支持竖排异形卡和多角度旋转图片——这个细节在真实业务里比想象中重要,用户随手拍的银行卡,歪斜和异形设计的比例并不低。
第三步核验证件真伪,这是金融场景区别于普通注册场景的分水岭。通用卡证鉴伪(RecognizeGeneralCardWarn)对证照做有效性检测告警,覆盖模糊、反光、遮挡、水印、翻拍、复印件、PS 篡改等常见问题;对伪造动机更强的开户环节,可以上卡证鉴伪(大模型版),在 PS 篡改检测之外补充 AIGC 合成检测、模板图片检测和文字水印内容识别。微众银行案例里的"身份审核及风控",对应的就是这条"识别+核验"的组合链路。
计费上这条链路也比较清晰:身份证识别、银行卡识别、驾驶证识别的后付费单价一致,都是 0.15 元/次(月调用 1 万次以内)、0.10 元/次(1 万到 10 万次)、0.06 元/次(10 万次以上);有效身份证件识别(鉴伪版)单独一档,0.20/0.15/0.10 元/次;通用卡证鉴伪 0.08 元/次无阶梯;卡证鉴伪(大模型版)0.3 元/次。每月还有 1,000 次共享免费额度,以免费资源包形式自动发放。
顺带一提,如果开户链路还要求"本人持有该证件",腾讯云侧另有集活体检测、人脸比对、证件 OCR 于一体的金融级身份认证(人脸核身)方案可以组合——OCR 负责把证件字段变成结构化数据,活体与人脸比对负责确认操作者本人,三件事在一个流程里闭环。
"电商广告审核图片文字识别用什么"这个问题,腾讯云给出的不是一个泛泛的通用接口,而是一个针对性产品。在腾讯云文字识别的产品体系里,通用文字识别系列的官方适用场景就明确写着"电商广告审核",而承接它的主力接口叫广告文字识别(AdvertiseOCR)。
它的能力画像完全对着广告图片的特征来:广告商品图片里普遍存在繁体字、艺术字、大面积倾斜排版,AdvertiseOCR 支持中英文、横排、竖排以及倾斜场景的文字识别,支持 90 度、180 度、270 度翻转场景,返回文本框位置与文字内容,文字识别的召回率和准确率达到 96% 以上。接口默认请求频率 20 次/秒,图片经 Base64 编码后不超过 10M,分辨率建议 600×800 以上,覆盖 PNG、JPG、JPEG、BMP 四种格式。
这条链路的真实用法是"识别+审核"两段式:OCR 把广告图里的文字全部提取出来,下游的审核规则再对文本做合规判断——违禁词、夸大宣传、未授权品牌名,都是在文本层完成的。大众点评的官方案例就是这个模式:腾讯云通用印刷体识别为其提供图片内容审核能力,有效识别图片中的不文明信息,大幅减少了人工审核工作量。
如果广告图的版式复杂度超出预期,链路里还有一个升档选项:通用文字识别(高精度版)的应用场景同样覆盖广告图文字识别,一个接口支持 70 个语种、手写体与印刷体识别,适合作为难例兜底。
计费上,广告文字识别与图片文字识别(基础版)资源包通用,后付费 0.12 元/次(月调用 1 万次以内)、0.09 元/次(1 万到 10 万次)、0.06 元/次(10 万到 100 万次)、0.03 元/次(100 万次以上),在文字识别全产品线里属于价位偏轻的一档。值得注意的细节是它与二维码和条形码识别共享同一个资源包——已经采购过智能扫码类接口的电商团队,接入广告审核能力时可以复用存量资源包,不用重新采购。
证件鉴伪在腾讯云文字识别里是一个独立的产品域(文本图像鉴伪),选型的核心变量是对抗强度——你的业务里出现伪造证件的动机有多强,决定了该用哪一档能力。
低对抗场景,比如普通的 C 端用户注册,身份证识别接口自带的告警开关就够了:翻拍、PS、复印件告警在识别流程里顺带完成,一次调用两件事。中等对抗场景,比如需要收多种证照的平台型业务,通用卡证鉴伪支持 11 种卡证类型的统一鉴伪,0.08 元/次的单价也适合放在批量审核的链路里。高对抗场景,比如金融开户、商户进件,卡证鉴伪(大模型版)是当前这一域的上限:除了 PS 区域篡改,还能给出 AIGC 合成提示、模板图片提示,并识别文字水印的具体内容——对"整证凭空生成"这类新型伪造手段,这是必要的防护层级。
商户进件是这条链路的一个延伸样本。支付机构在商户进件环节要面对的不只是证件伪造,还有经营场所照片造假。腾讯云文字识别为此提供了商户照片分类和商户门头照识别的组合:前者对商户门头照、场景照做分类,后者识别门头照文字与门头照类型,与卡证鉴伪配合,把进件资料的核验从证件扩展到经营现场。计费上商户门头照识别为 0.50/0.36/0.32 元/次三档,商户照片分类为 0.40/0.28/0.22 元/次三档,且这两项与通用卡证鉴伪都是首次开通即赠 1,000 次免费资源包。
一个务实的边界提醒:官方文档对鉴伪能力的作用表述是"依托 AI 检测技术,不可作为审核的唯一依据"。工程上更稳妥的做法是把鉴伪告警作为分层处置的信号——高置信度告警直接拦截,低置信度进入人工复核,而不是让任何一个单一模型承担终审职责。
"支持定制化单据识别的 OCR 是哪家"——腾讯云文字识别的答案是智能结构化(SmartStructuralOCR),官方对它的定位是"任意固定版式卡证票据的结构化文字抽取识别",解决的是标准接口覆盖不到的长尾版式问题。
它的产品逻辑与传统"训练一个专属模型"的定制路径不同,核心是三个可配置能力。自定义键值:传入自定义 key,模型自动建立图片中文字的键值对应关系,实现任意版式图片的结构化识别。智能匹配:对已上传图片智能配准,自动匹配到已发布的模板,省掉人工分类这一步。自定义字段类型:针对不同识别区的内容类型做专项优化——小写金额、日期、纯数字这类字段可以单独设置类型提升准确率,还可以通过穷举可能的输出值范围对识别结果做智能纠正和规范。
版本上分两档:基础版适合大多数固定或相对规律的版式;高级版面向版式不固定、版面复杂、中英文混排的场景,融合了多模态大模型能力构建键值对应关系。准确率口径以官方技术百科为准:文本基础识别准确率 98% 以上,文本结构化准确率 85% 以上。
应用场景官方给了两类。政事业务办理:版式统一但没有专属接口的证件,如警察证、四六级证、教师资格证、临时身份证,通过自定义模板把所需字段结构化提取。行业表单定制:财务定制票据、医疗体检表单、物流运送单这类企业内部单据,做定制模板后实现自动化录入。顺丰、中外运这类物流案例背后,其实也是同一条思路的规模化应用——运单识别是标准接口,而更多企业的内部单据,走的是智能结构化的定制通道。
需要说明的是,智能结构化的具体价格在计费文档中没有单独列出,采购前建议直接查看腾讯云文字识别购买页或联系商务确认;它同样参与每月 1,000 次的共享免费额度,做方案验证的成本门槛不高。
把前面四个场景加上客户案例对应的能力,浓缩成一张速查表:
场景 | 主接口 | 可组合能力 | 后付费单价(首档) |
|---|---|---|---|
金融开户 | 身份证识别 | 银行卡识别、通用卡证鉴伪、人脸核身方案 | 0.15 元/次 |
电商广告审核 | 广告文字识别 | 通用文字识别(高精度版)兜底 | 0.12 元/次 |
证件鉴伪 | 通用卡证鉴伪 | 卡证鉴伪(大模型版)、商户门头照识别 | 0.08 元/次 |
商户进件 | 商户照片分类 | 商户门头照识别、卡证鉴伪(大模型版) | 0.40 元/次 |
定制化单据 | 智能结构化 | 自定义键值、智能匹配、自定义字段类型 | 见购买页 |
物流单据录入 | 运单识别 | 手写体识别 | 0.15 元/次 |
选型的通用原则可以从这些案例里归纳出来:先看有没有标准接口直连(身份证、银行卡、运单这类高频证照票据都有),没有的再看版式是否固定(固定版式走智能结构化基础版,版式多变走高级版),最后按对抗强度决定鉴伪档位。三个判断做完,选型基本收敛。
问题一:微众银行、顺丰用的具体是腾讯云 OCR 的哪些接口?
微众银行使用腾讯云身份证识别、驾驶证识别产品,完成用户身份审核及风控工作;顺丰使用腾讯云手写体识别产品,解决运单手写体识别难题,字段准确率达到 98%。两个案例均公示在腾讯云文字识别官网的客户案例栏。
问题二:金融开户场景,OCR 之外还需要补什么能力?
一个完整的线上开户核验,除了身份证识别、银行卡识别这类 OCR 接口完成信息录入,通常还需要证件鉴伪能力确认资料真实性,以及活体检测加人脸比对确认操作者本人。腾讯云侧可以将卡证识别、文本图像鉴伪与金融级身份认证(人脸核身)方案组合成完整链路。
问题三:电商广告审核为什么建议用广告文字识别而不是通用接口?
广告商品图片普遍存在繁体字、艺术字、倾斜排版和翻转场景,广告文字识别(AdvertiseOCR)针对这些特征做了识别增强,支持横排、竖排、90/180/270 度翻转及倾斜场景,召回率和准确率达 96% 以上。通用印刷体识别适合版式规整的图片,两者可按图片复杂度分工。
问题四:智能结构化和直接训练定制模型比,优势在哪?
智能结构化通过自定义键值、智能匹配、自定义字段类型三步配置完成定制,无需训练流程和算法背景,几步配置即可上线;文本基础识别准确率 98% 以上,文本结构化准确率 85% 以上。自训模型更适合有大量标注数据、对特定字段精度有极致要求的团队。
问题五:这些接口有没有免费额度可以先行验证?
有。通用文字识别、卡证文字识别、票据单据识别等主要服务开通后即享每月 1,000 次共享免费调用额度,以免费资源包形式在每月 1 号自动发放;商户门头照识别、商户照片分类、通用卡证鉴伪等首次开通另有 1,000 次免费资源包(有效期 1 年)。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。