TeleOCR

AI工具9分钟前更新 AI工具集
0 0 0

TeleOCR是什么

TeleOCRTeleOCR 是中国电信星辰实验室开源的文档解析模型

TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数的轻量级视觉语言架构,在同一个框架内统一处理数字文档与相机拍摄文档,可以把文字、版面布局、表格、公式和科学图表解析为 Markdown、JSON 等结构化结果。它同时支持批量文档与随手拍摄的纸质件输入,输出结果可直接进入检索、归档与业务系统管线。

文档解析长期是一道被拆成多段工序的难题:先做图像去畸变,再做版面分析,然后分别处理文字、表格与公式,最后拼装成结构化数据。工序越多,误差逐级放大的风险越高。TeleOCR 的取舍是把这些环节收进一个端到端的视觉语言模型里,用统一的权重同时面对规整的电子文档和存在透视变形、纸面弯曲、阴影遮挡的实拍照片。凭借这一架构,TeleOCR 摘得 OmniDocBench v1.6 榜单桂冠,拿下 PureDocBench 头名以及 ICDAR-2026 科学图表解析项目冠军,官方公布的总分为 96.87,位列该榜单第一。

TeleOCR的主要功能

TeleOCR 的功能矩阵围绕「把复杂版面完整还原成结构化数据」这一目标展开,每一项都对应文档解析流程中的一个具体失分点。

  1. 精准文本提取:文字识别精度表现突出,数字文档的识别准确率可达到 97.22,中英文混排、密集小字与低对比度扫描件都能稳定转写。
  2. 版面精准剖析:能够清晰界定文档页面内各类文本块、图表与公式的空间坐标,为后续阅读顺序还原与结构化输出打底。
  3. 复杂表格还原:可应对跨行、跨列及单元格合并等棘手结构,表格解析指标 TEDS 高达 97.05,输出的表格结构可直接映射为业务字段。
  4. 公式语析:深入剖析公式背后的语法与含义,实现符号级别的精确重建,公式解析指标 CDM 锁定 96.36。
  5. 科学图表转化:不仅能识别图表的坐标轴、图例与数据系列,还能深层提取其中的数值,把学术图表还原成规整的数据表格。
  6. 拍摄图像适应:直接攻克透视变形、纸面弯曲、阴影遮挡等现实拍摄难题,省去了繁琐的前置纠偏与矫正模块。
  7. 多态结构输出:可无缝生成 Markdown、JSON 等主流结构化格式,便利后续的知识检索、字段抽取与业务系统对接。

如何使用TeleOCR

TeleOCR 以开源仓库与模型权重的方式提供,适合在自己的服务器或工作站上本地部署。整体流程可以分为环境准备、权重获取、参数配置与推理调用四段。

  1. 硬件与系统准备:配置好 Python 3.10 及以上的运行环境,并确保具备 CUDA 支撑的 GPU 算力,用于模型推理加速。
  2. 代码与环境搭建:完成仓库克隆后,通过 conda 新建专属虚拟环境,并在其中安装项目所需的本地依赖包,避免与系统环境互相污染。
  3. 模型权重获取:利用 modelscope 工具将官方模型权重下载到本地指定路径,权重目录后续会作为推理脚本的模型来源。
  4. 路径参数配置:在配置中明确设定输入图像的源文件夹以及最终结果的导出目录,输入输出分离便于批量跑批与结果回溯。
  5. 启动推理流程:执行推理脚本,并根据需要调整异步模式、结果覆盖选项以及各类后端引擎参数。
  6. 引擎与模式切换:日常开发推荐使用默认引擎,面对高并发吞吐场景可切换异步加速后端;同时可以依据文档形态在检测模式与分割模式之间切换。
  7. 参数精细调优:根据实际算力与需求,灵活调整上下文长度、显存占用阈值和最大像素限制,在长文档与显存开销之间取得平衡。

TeleOCRTeleOCR 提供开源仓库与模型权重,支持在本地 GPU 环境部署推理

TeleOCR的使用场景

凡是需要把纸质或电子文档批量转成可检索数据的业务,都是 TeleOCR 的适用范围。以下几个方向的需求最为集中。

  1. 合同档案数字化:针对海量历史档案中的复杂版面与表格做深度解析,沉淀为可被检索、可被比对的高价值数据资产。
  2. 科研文献深度解析:自动化抽取出论文当中的核心公式、统计图表及实验数据,全面赋能智能知识库与文献综述系统的建设。解析结果如果要进入专利与产业情报检索环节,可以配合重点产业专利信息服务平台一起使用。
  3. 金融票据智能流转:从容应对各类角度倾斜、光线不均的票据抓拍图,在无需人工纠偏的前提下实现关键业务字段的自动入库。
  4. 教育题库自动化录入:将图文混排的试卷转化为可编辑文本与结构化题目,显著加速智能批改与题库系统的建设步伐。
  5. 企业报表RPA对接:把海量扫描件和业务表单高效转译为标准数据格式,深度打通企业自动化流程的最后一公里。

如果前置环节需要先把扫描件做体积压缩再入库,可以搭配FileCompress处理图像与文档体积;若解析结果还要用于图片素材管理或提示词反查,ImageToAny这类 AI 图像转提示词工具可以作为补充;遇到矢量图与位图互相转换的需求,图像转矢量图片工具也能接上后续链路。

TeleOCR的技术原理与训练方法

TeleOCR 之所以能用约 1.2B 的参数同时扛住数字文档与拍摄文档,靠的是一套围绕「统一建模 + 几何感知 + 数据自驱」设计的技术组合。

  • 一体化视觉语言架构:通过精简的 1.2B 架构把不同来源的文档统一纳管,在端到端流程中直接完成布局与内容的深度解析,摒弃了传统多模型串联的流水线模式,有效遏制误差的逐级放大。
  • 空间几何感知:针对形变严重的纸张页面,引入几何特征感知与曲率引导的采样机制,显式锁定文档边界与空间构型,从而具备直面弯曲和畸变页面的能力。
  • 自驱数据演进:构建了完整的数据处理闭环,借助多方投票精炼高质量伪标签,结合几何仿真扩充样本库,并通过图文自验证机制自动修错,推动模型在渐进式训练中持续进化。
  • 四阶渐进训练法:采取视觉对齐、几何解析、内容结构解耦到强化学习的四步走策略,分阶段打牢感知与认知基础,确保表格与公式等复杂元素的解析质量。

这套方法带来的直接结果是分项指标的整体抬升:文本识别准确率 97.22、表格 TEDS 97.05、公式 CDM 96.36,三项指标均处于同类模型的领先位置。

TeleOCR与传统文档解析流水线对比

下表按文档解析的几个关键维度,对比 TeleOCR 与传统的「去畸变 + 版面分析 + 多模型串联」流水线方案。

对比维度TeleOCR传统多模型流水线
模型构成约 1.2B 参数的一体化视觉语言模型,单一权重统一处理去畸变、版面分析、文字识别、表格识别、公式识别各自
输入兼容性数字文档与相机拍摄文档使用同一套权重拍摄件通常需先经去畸变预处理才能进入识别环节
误差传播端到端解析,避免多环节串联带来的误差逐级放大前序环节的偏差会向后逐级传递
表格与公式内容与结构解耦建模,表格 TEDS 97.05、公式 CDM 96.36内容与结构常由同一分支处理,是主要失分点
科学图表可识别图表组件并深层提取数据,还原为数据表格多数方案仅做区域切分,不输出图表内数据
输出形态Markdown、JSON 等结构化结果,直接对接业务管线多为分散的中间结果,需要额外拼装
部署门槛约 1.2B 体量,单机 GPU 环境即可部署多个模型叠加,显存与运维成本更高

TeleOCR的常见问题解答

TeleOCR 是开源的吗,权重从哪里获取?
TeleOCR 由中国电信星辰实验室开源,代码仓库托管在 GitHub,模型权重通过 ModelScope 发布,可自行下载部署到本地环境,无需依赖在线接口。
TeleOCR 部署需要什么样的硬件环境?
建议准备 Python 3.10 及以上环境,并配备支持 CUDA 的 GPU 用于推理加速。约 1.2B 的参数规模使其具备较好的单机可部署性,显存占用可通过上下文长度、最大像素限制等参数进行调优。
TeleOCR 能同时处理电子文档和手机拍摄的照片吗?
可以。这是 TeleOCR 的核心设计目标之一:同一套权重既处理规整的数字文档,也直接处理存在透视变形、纸面弯曲、阴影遮挡的拍摄文档,无需额外的去畸变预处理模块。

TeleOCR官网网址

TeleOCR 项目资源入口如下:GitHub 代码库 https://github.com/caipeng328/TeleOCR,ModelScope 权重库 https://www.modelscope.cn/models/XingChen-AGI/TeleOCR,技术报告见 arXiv https://arxiv.org/pdf/2608.12898。建议先阅读仓库说明确认各任务类型对应的指令与输出格式,再准备本地环境。

OpenI AI时代点评

TeleOCR 最值得关注的地方不是某个单项指标,而是它把「拍摄件要先纠偏」这个长期被默认接受的前置步骤直接取消了。约 1.2B 的体量让它能在单卡环境跑起来,端到端的一体化架构又避免了多模型串联时的误差累积,这对需要把纸质档案、票据、试卷批量入库的团队来说是很实际的减负。它的局限也很清楚:科学图表解析和跨页长文档的阅读顺序还原仍属难点,落地前最好用自己业务的真实样本先跑一轮难例验证,而不是只看榜单分数。想继续比较文档与图像处理方向的工具,可以从ImageToAny、FileCompress这类站内条目看起,项目本身的进展则以 TeleOCR 官方仓库为准。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...