登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
OCR大模型技术演进与场景实践
2025-06-12
腾讯
秋穆
技术演进与商业化领跑
技术演进路线
OCR 1.0(多阶段定制 OCR 模型)
:采用检测、识别、结构化分阶段流程,存在多模块瓶颈,如文本检测易错检漏检、角度预测易错分、识别模块受限、信息提取泛化能力弱等。
OCR 2.0(端到端 OCR 大模型,DocLM-Base)
:通过单一模型解决链路问题,实现端到端智能化,支持多种任务(识别、KV 结构化提取),推理耗时低于 1ms。
OCR 3.0(多模态 OCR 大模型,DocLM-Large)
:支持开放式任务和个性化需求,通过 Prompt 驱动处理复杂场景识别与结构化提取。
领域进展
现有视觉语言模型(如 GPT-4o、Mini-GPT4、LLVA)虽具备图像感知和意图理解能力,但在 OCR 任务中存在精度低、场景受限、成本高等问题。
技术要点
高分辨率图像处理
:提出内容感知的视觉过滤机制,过滤无关视觉信息,将 4K 分辨率图像的视觉 Token 压缩 95% 以上,支持多图处理。
文档场景细粒度感知
:通过文档对象对比学习(DoCo)增强视觉编码器对文本密集文档的理解,提升识别精准度,在 VDU 基准上优于 CLIP 技术。
文档智能能力
:支持多模态融合解析、识别到推理能力跃升,同等参数规模下处理速度行业领先(5ms/token),复杂文档准确率 95% 以上。
商业化应用
交通物流场景
:单据处理时效缩短至分钟级,错误率下降 60%,年节省人力成本超千万元。
医疗保险理赔场景
:理赔材料处理效率提升 200%,人工审核成本降低 60%。
实测体验
支持复杂文档字段理解与映射、表格结构化及行列信息提取、5 页内文档信息提取、Prompt 自定义能力。
你可能感兴趣
oceanbase-周跃跃-分布式数据库 OceanBase 架构演进与业务场景实践-
信息技术
2023第十二届全球TOP100软件案例研究峰会
2024-08-21
GLM大模型:场景落地的探索与实践
信息技术
智谱AI
2024-09-05
大模型赋能企业服务:智能客服与办公场景落地实践
信息技术
腾讯
2025-04-17
大模型场景下智算平台的设计与优化实践
信息技术
百度
2024-06-14
AI技术驱动下座舱演进趋势与实践
腾讯
2025-04-28
移动云(陶捷):海山数仓:移动云云原生OLAP数据库的技术演进与实践
信息技术
-
2024-08-26
防录音行业安全白皮书 录音干扰器的技术演进与应用实践
电子设备
深安协&CPS中安网
2026-04-10
2023智算时代的容器技术演进与实践报告
信息技术
阿里巴巴
2024-01-09
饿了么跨端技术的演进实践与落地_刘宇
商贸零售
ArchSummit深圳2023|全球架构师峰会
2023-08-02
Grok系列大模型发展历程与技术演进研究报告
信息技术
AGI智能时代
2025-02-24