HyOCR-1.5

AI工具2个月前更新 AI工具集
37 0 0

HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型

HyOCR-1.5:腾讯混元倾力打造的轻巧型端到端 OCR 专家大模型,以其仅 10 亿参数的精悍身躯,囊括了文档解析、文本识别、信息提取、随拍翻译、图表解读、古籍文字辨识、视频字幕抓取乃至多页文档问答等一套完整的解决方案。

HyOCR-1.5 究竟是何方神圣

HyOCR-1.5 是腾讯混元团队开源的一款体积精巧、功能全面的端到端 OCR 专家大模型。其显著特点在于,仅需 1B 的参数量,便能胜任文档结构化、文字精准识别、关键信息抽取、即拍即译、图表内容解析、古老文字辨识、视频字幕提取以及针对多页文档的智能问答等一系列任务。该模型引入了 DFlash 投机解码技术,使得长篇结构化输出的推理速度最高可提升 6.37 倍。在 OmniDocBench v1.6 基准测试中,HyOCR-1.5 以 94.74 的高分荣登端到端 OCR 性能榜首。

HyOCR-1.5 的核心本领

  • 文档结构化处理:能够将排版密集、多栏布局、包含表格和公式的文档,一键转化为结构化的文本格式,如 Markdown、HTML 或 LaTeX。
  • 全场景文本识别:精准捕捉图片中的所有文字信息及其精确位置,覆盖范围广泛,包括但不限于文档、街景、手写体、广告牌、游戏界面和视频画面。
  • 智能信息提取:从各类票据、证件和收据中,高效提取用户指定的关键字段信息,并以 JSON 格式呈现。
  • 即时拍照翻译:快速识别图片中的文字内容,并将其翻译成多种语言,同时巧妙地保留原始文档的排版风格和公式格式。
  • 图表内容解析:能够将流程图、各类统计图表转化为 Mermaid 或 Markdown 格式,便于理解和引用。
  • 古文字识别能力:支持识别中国汉字的七种主要字体,包括甲骨文、金文、篆书、隶书、楷书、行书和草书。
  • 视频字幕提取:从视频画面中精确地提取字幕文本信息。
  • 多页文档智能问答:基于多页 PDF 文件,实现跨页面信息检索、内容比对,并能聚合证据进行问答。

HyOCR-1.5 的技术基石

  • 精简高效的端到端架构:延续了 HyOCR-1.0 备受好评的紧凑设计理念,由原生分辨率视觉编码器 Hunyuan-ViT、灵活的自适应 MLP 连接器以及轻量级语言模型 Hunyuan-0.5B 构成。这种架构能够直接将多模态输入映射为 Markdown、HTML、LaTeX 等结构化输出,无需额外的任务特定后处理模块。
  • 4K 原生分辨率视觉编码:其视觉编码器基于 Hunyuan-ViT 构建,支持的最大输入分辨率从 2K 提升至 4K,并能维持原始的宽高比和空间布局。这使得模型能够精细捕捉高密度文档、超大表格以及复杂版面布局中的细微结构信息。
  • DFlash 投机解码技术:引入了一个约 90.7M 参数的 block-diffusion 草稿模型,能够一次性并行预测整块候选的 token。随后,目标模型进行单次验证,并接受最长正确的预测前缀。此方法在严格保持目标模型输出分布一致性的同时,大幅缩短了长结构化 OCR 生成过程中的解码延迟。
  • Agentic Data Flow 智能体数据流:该技术实现了智能体驱动的数据生产闭环。它能将模型自身的不足转化为具体的数据需求,并自主完成素材搜集、工具辅助的数据清洗、疑难样本挖掘以及数据管线的开发,从而与算法工程师形成持续迭代的良性循环。
  • 三阶段训练策略:训练过程分为三个阶段。预训练阶段着重于 Stage 3 的重规划,注入新能力的数据,并将分辨率扩展至 4K,上下文长度增至 128K。SFT(监督微调)阶段则对数据进行深度清洗,统一 prompt 接口。RL(强化学习)阶段采用 IcePop(类似于 GRPO)进行优化,通过事实性、一致性评估以及退化抑制这三类互补的奖励机制,显著提升了输出内容的质量。

HyOCR-1.5 的使用指南

  • 环境配置:需要安装 Python 3.12 及以上版本、CUDA 12.9、PyTorch 2.7.1 以及 vLLM(版本号需大于等于 0.12.0)。
  • 模型启动:可通过执行 vllm serve tencent/HunyuanOCR 命令来启动服务,或者直接加载 Hugging Face 上的模型权重。
  • 图片输入处理:使用 PIL 库读取图片,并构建包含 image 和 text 的 messages 对话结构。
  • 任务指令设定:根据具体应用场景,选择相应的 Prompt 指令,例如文档解析、文本检测、信息提取或翻译等。
  • 执行推理操作:通过 vLLM 或 Transformers 库生成推理结果,并将 temperature 设置为 0,max_tokens 设置为 16384。
  • 结果后处理:利用内置的去重函数清理可能出现的重复子串,最终获得结构化的输出结果。
  • 本地化部署:借助 llama.cpp 工具,可以在 CPU 或消费级 GPU 上实现模型的本地运行,无需依赖服务器。

HyOCR-1.5 的突出亮点

  • 极致的推理速度:得益于 DFlash 投机解码技术,长文档生成在 Transformers 框架下提速达 6.37 倍,在 vLLM 框架下提速 2.14 倍,平均每页的处理时间仅需 1.4 秒。
  • 轻量级部署能力:1B 的参数量使得该模型能够轻松部署在 CPU、消费级显卡以及笔记本电脑上运行。
  • 业界领先的精度表现:在 OmniDocBench v1.6 测试中,端到端性能达到 94.74,表格解析 TEDS 分数高达 93.67,在处理复杂表格和阅读顺序方面表现尤为突出。
  • 全栈开源与开放性:训练方法、推理框架及模型权重均完全公开,用户可以复现、微调和扩展。
  • 强大的长尾能力覆盖:通过 Agentic Data Flow 技术,模型成功弥补了在 331 种低资源语种、古文字识别以及多图问答等稀缺场景下的能力短板。
  • 高分辨率与长上下文处理:支持 4K 图像分辨率和 128K 的上下文长度,能够有效应对高密度、长篇幅的文档。
  • 卓越的幻觉抑制能力:在 CHAOS-Bench 测试中,模型平均每页召回率达到 14.15,优于现有同类模型,输出结果更加忠实于原始内容。

HyOCR-1.5 的项目入口

  • GitHub 源代码库:https://github.com/Tencent-Hunyuan/HunyuanOCR
  • Hugging Face 模型仓库:https://huggingface.co/tencent/HunyuanOCR
  • arXiv 技术论文链接:https://arxiv.org/pdf/2607.04884

HyOCR-1.5 与竞品的横向对比

对比维度HyOCR-1.5DeepSeek-OCR-2
参数量级10 亿(精巧)30 亿(大 3 倍)
OmniDocBench 评分94.7487.01
端到端延迟(每页)1.408 秒5.460 秒(慢 3.9 倍)
表格解析 TEDS 指标93.67约 84.97
推理速度提升DFlash 投机解码,Transformers 下提速 6.37 倍无专用加速技术,纯自回归解码
部署硬件要求可在 CPU 或笔记本电脑上运行需要服务器级 GPU

HyOCR-1.5 的应用场景拓展

  • 密集文档的数字化转型:能够一键将合同、学术论文、研究报告等高密度、多栏排版的文档,转换为结构化的 Markdown、HTML 或 LaTeX 文本,同时完整保留其阅读顺序和版式信息。
  • 复杂表格与公式的精准解析:能够精确还原财务报表、学术论文中的超大表格以及复杂的数学公式,并支持生成 HTML 表格和 LaTeX 公式。
  • 多语种跨国文档处理:支持 331 种语言,能够自动识别并解析包含多种语言混合的文档,非常适用于外贸、法律、出版等需要处理全球化业务的场景。
  • 古文字研究与文化遗产保护:具备识别甲骨文、金文、篆书、隶书等七种汉字古体字的能力,为博物馆、考古机构在数字化存档和研究历史文献方面提供有力支持。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...