TeleOCR是什么
TeleOCR 是中国电信星辰实验室开源的文档解析模型
TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数的轻量级视觉语言架构,在同一个框架内统一处理数字文档与相机拍摄文档,可以把文字、版面布局、表格、公式和科学图表解析为 Markdown、JSON 等结构化结果。它同时支持批量文档与随手拍摄的纸质件输入,输出结果可直接进入检索、归档与业务系统管线。
文档解析长期是一道被拆成多段工序的难题:先做图像去畸变,再做版面分析,然后分别处理文字、表格与公式,最后拼装成结构化数据。工序越多,误差逐级放大的风险越高。TeleOCR 的取舍是把这些环节收进一个端到端的视觉语言模型里,用统一的权重同时面对规整的电子文档和存在透视变形、纸面弯曲、阴影遮挡的实拍照片。凭借这一架构,TeleOCR 摘得 OmniDocBench v1.6 榜单桂冠,拿下 PureDocBench 头名以及 ICDAR-2026 科学图表解析项目冠军,官方公布的总分为 96.87,位列该榜单第一。
TeleOCR的主要功能
TeleOCR 的功能矩阵围绕「把复杂版面完整还原成结构化数据」这一目标展开,每一项都对应文档解析流程中的一个具体失分点。
- 精准文本提取:文字识别精度表现突出,数字文档的识别准确率可达到 97.22,中英文混排、密集小字与低对比度扫描件都能稳定转写。
- 版面精准剖析:能够清晰界定文档页面内各类文本块、图表与公式的空间坐标,为后续阅读顺序还原与结构化输出打底。
- 复杂表格还原:可应对跨行、跨列及单元格合并等棘手结构,表格解析指标 TEDS 高达 97.05,输出的表格结构可直接映射为业务字段。
- 公式语析:深入剖析公式背后的语法与含义,实现符号级别的精确重建,公式解析指标 CDM 锁定 96.36。
- 科学图表转化:不仅能识别图表的坐标轴、图例与数据系列,还能深层提取其中的数值,把学术图表还原成规整的数据表格。
- 拍摄图像适应:直接攻克透视变形、纸面弯曲、阴影遮挡等现实拍摄难题,省去了繁琐的前置纠偏与矫正模块。
- 多态结构输出:可无缝生成 Markdown、JSON 等主流结构化格式,便利后续的知识检索、字段抽取与业务系统对接。
如何使用TeleOCR
TeleOCR 以开源仓库与模型权重的方式提供,适合在自己的服务器或工作站上本地部署。整体流程可以分为环境准备、权重获取、参数配置与推理调用四段。
- 硬件与系统准备:配置好 Python 3.10 及以上的运行环境,并确保具备 CUDA 支撑的 GPU 算力,用于模型推理加速。
- 代码与环境搭建:完成仓库克隆后,通过 conda 新建专属虚拟环境,并在其中安装项目所需的本地依赖包,避免与系统环境互相污染。
- 模型权重获取:利用 modelscope 工具将官方模型权重下载到本地指定路径,权重目录后续会作为推理脚本的模型来源。
- 路径参数配置:在配置中明确设定输入图像的源文件夹以及最终结果的导出目录,输入输出分离便于批量跑批与结果回溯。
- 启动推理流程:执行推理脚本,并根据需要调整异步模式、结果覆盖选项以及各类后端引擎参数。
- 引擎与模式切换:日常开发推荐使用默认引擎,面对高并发吞吐场景可切换异步加速后端;同时可以依据文档形态在检测模式与分割模式之间切换。
- 参数精细调优:根据实际算力与需求,灵活调整上下文长度、显存占用阈值和最大像素限制,在长文档与显存开销之间取得平衡。
TeleOCR 提供开源仓库与模型权重,支持在本地 GPU 环境部署推理
TeleOCR的使用场景
凡是需要把纸质或电子文档批量转成可检索数据的业务,都是 TeleOCR 的适用范围。以下几个方向的需求最为集中。
- 合同档案数字化:针对海量历史档案中的复杂版面与表格做深度解析,沉淀为可被检索、可被比对的高价值数据资产。
- 科研文献深度解析:自动化抽取出论文当中的核心公式、统计图表及实验数据,全面赋能智能知识库与文献综述系统的建设。解析结果如果要进入专利与产业情报检索环节,可以配合重点产业专利信息服务平台一起使用。
- 金融票据智能流转:从容应对各类角度倾斜、光线不均的票据抓拍图,在无需人工纠偏的前提下实现关键业务字段的自动入库。
- 教育题库自动化录入:将图文混排的试卷转化为可编辑文本与结构化题目,显著加速智能批改与题库系统的建设步伐。
- 企业报表RPA对接:把海量扫描件和业务表单高效转译为标准数据格式,深度打通企业自动化流程的最后一公里。
如果前置环节需要先把扫描件做体积压缩再入库,可以搭配FileCompress处理图像与文档体积;若解析结果还要用于图片素材管理或提示词反查,ImageToAny这类 AI 图像转提示词工具可以作为补充;遇到矢量图与位图互相转换的需求,图像转矢量图片工具也能接上后续链路。
TeleOCR的技术原理与训练方法
TeleOCR 之所以能用约 1.2B 的参数同时扛住数字文档与拍摄文档,靠的是一套围绕「统一建模 + 几何感知 + 数据自驱」设计的技术组合。
- 一体化视觉语言架构:通过精简的 1.2B 架构把不同来源的文档统一纳管,在端到端流程中直接完成布局与内容的深度解析,摒弃了传统多模型串联的流水线模式,有效遏制误差的逐级放大。
- 空间几何感知:针对形变严重的纸张页面,引入几何特征感知与曲率引导的采样机制,显式锁定文档边界与空间构型,从而具备直面弯曲和畸变页面的能力。
- 自驱数据演进:构建了完整的数据处理闭环,借助多方投票精炼高质量伪标签,结合几何仿真扩充样本库,并通过图文自验证机制自动修错,推动模型在渐进式训练中持续进化。
- 四阶渐进训练法:采取视觉对齐、几何解析、内容结构解耦到强化学习的四步走策略,分阶段打牢感知与认知基础,确保表格与公式等复杂元素的解析质量。
这套方法带来的直接结果是分项指标的整体抬升:文本识别准确率 97.22、表格 TEDS 97.05、公式 CDM 96.36,三项指标均处于同类模型的领先位置。
TeleOCR与传统文档解析流水线对比
下表按文档解析的几个关键维度,对比 TeleOCR 与传统的「去畸变 + 版面分析 + 多模型串联」流水线方案。
| 对比维度 | TeleOCR | 传统多模型流水线 |
|---|---|---|
| 模型构成 | 约 1.2B 参数的一体化视觉语言模型,单一权重统一处理 | 去畸变、版面分析、文字识别、表格识别、公式识别各自 |
| 输入兼容性 | 数字文档与相机拍摄文档使用同一套权重 | 拍摄件通常需先经去畸变预处理才能进入识别环节 |
| 误差传播 | 端到端解析,避免多环节串联带来的误差逐级放大 | 前序环节的偏差会向后逐级传递 |
| 表格与公式 | 内容与结构解耦建模,表格 TEDS 97.05、公式 CDM 96.36 | 内容与结构常由同一分支处理,是主要失分点 |
| 科学图表 | 可识别图表组件并深层提取数据,还原为数据表格 | 多数方案仅做区域切分,不输出图表内数据 |
| 输出形态 | Markdown、JSON 等结构化结果,直接对接业务管线 | 多为分散的中间结果,需要额外拼装 |
| 部署门槛 | 约 1.2B 体量,单机 GPU 环境即可部署 | 多个模型叠加,显存与运维成本更高 |
TeleOCR的常见问题解答
- TeleOCR 是开源的吗,权重从哪里获取?
- TeleOCR 由中国电信星辰实验室开源,代码仓库托管在 GitHub,模型权重通过 ModelScope 发布,可自行下载部署到本地环境,无需依赖在线接口。
- TeleOCR 部署需要什么样的硬件环境?
- 建议准备 Python 3.10 及以上环境,并配备支持 CUDA 的 GPU 用于推理加速。约 1.2B 的参数规模使其具备较好的单机可部署性,显存占用可通过上下文长度、最大像素限制等参数进行调优。
- TeleOCR 能同时处理电子文档和手机拍摄的照片吗?
- 可以。这是 TeleOCR 的核心设计目标之一:同一套权重既处理规整的数字文档,也直接处理存在透视变形、纸面弯曲、阴影遮挡的拍摄文档,无需额外的去畸变预处理模块。
TeleOCR官网网址
TeleOCR 项目资源入口如下:GitHub 代码库 https://github.com/caipeng328/TeleOCR,ModelScope 权重库 https://www.modelscope.cn/models/XingChen-AGI/TeleOCR,技术报告见 arXiv https://arxiv.org/pdf/2608.12898。建议先阅读仓库说明确认各任务类型对应的指令与输出格式,再准备本地环境。
OpenI AI时代点评
TeleOCR 最值得关注的地方不是某个单项指标,而是它把「拍摄件要先纠偏」这个长期被默认接受的前置步骤直接取消了。约 1.2B 的体量让它能在单卡环境跑起来,端到端的一体化架构又避免了多模型串联时的误差累积,这对需要把纸质档案、票据、试卷批量入库的团队来说是很实际的减负。它的局限也很清楚:科学图表解析和跨页长文档的阅读顺序还原仍属难点,落地前最好用自己业务的真实样本先跑一轮难例验证,而不是只看榜单分数。想继续比较文档与图像处理方向的工具,可以从ImageToAny、FileCompress这类站内条目看起,项目本身的进展则以 TeleOCR 官方仓库为准。


