AngelSpec

AI工具10分钟前更新 AI工具集
0 0 0

AngelSpec – 腾讯混元团队开源的端到端推测解码训练框架

AngelSpec:腾讯混元团队打造的革新性推测解码训练框架

AngelSpec,一款由腾讯混元团队倾力研发并开源的尖端推测解码训练框架,正以前所未有的方式重塑大模型推理与训练的格局。该框架以 TorchSpec 为基石,巧妙融合了 MTP 自回归与 DFly 块并行等六种前沿的草稿架构,实现了训练与推理的深度解耦。其创新的推理引擎,借助 Mooncake/RDMA 技术,能够将隐藏状态如行云流水般流式传输至训练工作器,为大模型提速增效提供了强大的技术支撑。在 Hy3-A21B 模型上的实测结果尤为亮眼,DFly 架构带来了高达 1.98–2.40 倍的端到端加速,吞吐量较 DFlash 提升了惊人的 10.5–11.8%。

AngelSpec 的核心亮点

  • 六大草稿架构的统一调度:DFly、DFlash、DFlare、Eagle3、DSpark、MTP 等六种各具特色的草稿架构,如今被整合进同一条训练流水线,只需简单的配置调整,即可实现架构间的无缝切换。
  • MTP 训练与 TTT 机制的深度融合:该框架支持多深度自回归展开训练,其内存占用率与单次因果前向传播相当。通过 Ulysses 序列并行技术,更是将上下文长度的极限推至 128k,为处理海量信息提供了可能。
  • 多元化的接受率对齐目标函数:AngelSpec 提供了丰富的目标函数选择,包括 CE、top-k KL、LK Loss、D-PACE 加权以及端到端 TV 损失,用户可根据实际需求组合,以优化模型性能。
  • 文档感知的序列打包策略:借鉴 Megatron 的经验,AngelSpec 采用了固定长度的打包方式,并严格遵循文档边界进行隔离,确保了数据处理的准确性。此策略同时适用于 DFlash 和 MTP 两种路径。
  • 实时的在线真实评估:在训练过程中,AngelSpec 集成了 vLLM 等先进引擎,能够执行真实的推测解码,并实时反馈平均接受长度与逐位接受率,为模型优化提供精准的数据支持。
  • 广泛的推理后端兼容性:该框架与 vLLM、SGLang、HuggingFace 等主流推理引擎实现了高度兼容,为用户提供了灵活的选择空间。

AngelSpec 的技术内涵解析

  • 推测解码的基石:AngelSpec 的核心在于其对推测解码机制的深刻理解与应用。它利用一个轻量级的草稿模型,能够并行预测多个潜在的未来 token。随后,目标大模型通过一次前向传播,运用拒绝采样技术完成批量验证,从而在不改变目标概率分布的前提下,将单步解码过程扩展为多步高效推进。框架的关键在于巧妙平衡草稿接受率与验证开销之间的关系,并在训练、架构设计及推理等多个层面提供了系统性的解决方案。
  • 工作负载异构性的建模智慧:AngelSpec 在设计之初便将真实世界中复杂多变的工作负载异构性作为首要考量。无论是开放式对话、代码生成,还是数学推理与工具调用,它们在条件熵和延续结构上都存在显著差异。例如,高熵的对话场景下,接受率会随深度快速衰减,更适合短序列自回归草稿;而代码与数学场景则具备长且可预测的跨度,更倾向于块并行扩散草稿。因此,AngelSpec 并非追求单一的通用模型,而是训练互补的专用草稿器——MTP 专攻对话数据,DFly 则聚焦代码与数学数据。
  • 共享参数多深度 MTP 训练的精妙之处:MTP 草稿器采用了独具匠心的共享参数多深度训练方案。所有的逻辑预测深度共享同一物理 MTP 模块,并在训练时进行自回归展开。具体而言,深度 k+1 的预测会接收深度 k 的 argmax 预测结果,同时动态维护逐层增长的草稿 KV 缓存以及对角线注意力掩码。通过引入 Training-Time Test(TTT)机制,草稿器得以在训练过程中接触到推理时遇到的自生成轨迹分布,从而有效消除了教师带来的暴露偏差,显著提升了第二、第三草稿位的接受率。

您可以通过微信关注并回复“开源”,加入AI开源项目交流群,获取更多前沿资讯与技术交流机会。

AngelSpec 的使用指南

  • 简便的环境安装:您只需执行 pip install -e ".[vllm]"pip install mooncake-transfer-engine 命令,即可轻松完成框架及 vLLM 后端的安装。
  • 单节点快速部署实践:在拥有 8 张 GPU 的环境中,您可以将 4 张 GPU 分配给推理任务,另外 4 张用于训练。通过运行 ./examples/qwen3-8b-dfly/run.sh 脚本,即可一键启动完整的流水线。
  • 灵活的配置覆盖选项:AngelSpec 支持通过命令行直接覆盖 YAML 配置文件中的参数,例如,您可以通过 training.learning_rate=5e-5 training.num_train_steps=500 来调整学习率和训练步数。
  • 便捷的 Conda 环境搭建:运行 ./tools/build_conda.sh 1 vllm 命令,即可快速构建一个包含 mooncake 的 Conda 环境,激活后即可立即使用。
  • 多节点分布式部署方案:通过 Inference Controller 与 Training Controller 结合 Ray 进行调度,并利用 Mooncake 隐藏状态存储实现跨节点训练的解耦,使得分布式部署更加高效和灵活。

AngelSpec 的核心竞争优势

  • 工作负载的专业化适配:MTP 架构专为高熵对话场景优化,而 DFly 则强化了对代码和数学等长可预测跨度场景的处理能力,避免了单一草稿模型在不同领域表现平庸的困境。
  • DFly 架构的创新突破:DFly 架构巧妙结合了混合目标条件主干与逐层目标视图,并辅以前驱条件自回归头,在保持强大并行生成能力的同时,显著提升了块内依赖关系的建模精度。
  • D-Cut 动态验证机制:该机制将目标验证视为一种共享的批次级资源,能够根据前缀置信度和运行时成本模型自适应地调整验证深度。在高并发场景下,它能够持续将额外负载转化为更高的吞吐量。
  • 分离式扩展的灵活性:推理与训练的 GPU 池通过 Mooncake 存储实现完全解耦,双方可以根据各自的负载需求进行扩缩容,有效避免了统一并行策略可能带来的次优问题。
  • 完善的开源套件体验:AngelSpec 同步发布了框架代码、Hy3-A21B/Qwen3-8B 的 MTP 和 DFly 草稿权重、详细的训练配置以及深入的技术报告,为用户提供了开箱即用的便捷体验。

AngelSpec 的项目链接

  • 官方项目网站:https://angelspec.readthedocs.io/
  • GitHub 开源仓库:https://github.com/Tencent/AngelSpec
  • HuggingFace 模型库集锦:https://huggingface.co/collections/AngelSlim/angelspec
  • arXiv 技术论文全文:https://arxiv.org/pdf/2607.25852

AngelSpec 与同类竞品深度对比

对比维度AngelSpecSpecForge
出品方腾讯混元团队SGLang / 美团等社区团队
核心定位统一 MTP + 块并行推测解码训练框架面向 EAGLE-3 的生产级训练框架
草稿架构6 种(DFly、DFlash、DFlare、Eagle3、DSpark、MTP)以 EAGLE-3 为主,支持主流开源模型
架构特色DFly 混合目标条件 + 前驱自回归头 + D-Cut 动态验证目标-草稿解耦混合并行 + TTT 稀疏树注意力优化
分离设计推理/训练完全解耦,经 Mooncake/RDMA 流传输隐藏状态支持同机共存与跨节点分离,通过 SGLang 后端集成
训练优化接受率对齐目标(TV/LK/D-PACE)+ 文档感知打包FlexAttention 稀疏掩码 + 原地梯度内核,内存降 93.5%
开源模型Hy3-A21B、Qwen3-8B 的 MTP/DFly 权重SpecBundle(Llama、Qwen、Kimi、DeepSeek 等 EAGLE-3 草稿)
性能数据Hy3-A21B 上 1.98–2.40× 加速,较 DFlash 高 10.5–11.8%Qwen3-235B 训练加速 9.99×,推理最高 4.48× 加速
推理后端vLLM、SGLang、HuggingFaceSGLang、HuggingFace、自定义后端

AngelSpec 的应用场景展望

  • 大模型在线推理的提速利器:为混元 Hy3、Qwen3 等 MoE/稠密模型部署推测解码草稿,显著降低自回归解码过程中的延迟,提升用户体验。
  • 高并发对话服务的理想选择:充分利用 D-Cut 动态资源分配的优势,在 4–64 的并发范围内保持最高的平均吞吐量,完美适配客服和智能助手等场景。
  • 代码生成与数学推理的强大引擎:借助 DFly 块并行草稿强大的长可预测跨度捕获能力,显著加速 IDE 代码补全、解题引擎等结构化输出任务的执行效率。
  • 长上下文处理的革新者:通过 Ulysses 序列并行技术,支持高达 128k 的上下文长度,为文档分析、代码库检索等需要处理超长序列的场景提供了强大的解决方案。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...