Qwen3.8-27B-DFlash2 – Inco AI 开源的投机解码草稿模型
在当前大模型推理性能优化的赛道上,Inco AI 团队近期推出的 Qwen3.8-27B-DFlash2 无疑是一项极具突破性的技术成果。这是一款专为 Qwen3.8-27B 打造的投机解码草稿模型,通过仅 1.92B 的轻量级参数规模,实现了推理速度的显著跃升。它巧妙地结合了块级并行预测、轻量化路径选择机制以及双抽头动态卷积技术,在确保输出结果与原模型完全一致的前提下,让推理过程告别了传统的逐字等待。
与以往依赖自回归方式逐个生成 token 的草稿模型不同,Qwen3.8-27B-DFlash2 采用了非自回归的并行策略。这意味着模型能够在单次前向传播中,直接预测出一整块待验证的 token 序列,极大地削减了草稿生成的响应延迟。为了解决并行预测中常见的 token 衔接生硬问题,该模型引入了“轻量路径选择器”。该组件通过保留各位置的 top-16 候选,并利用低秩双线性注意力与上下文门控技术,为模型挑选出最连贯的路径,仅需极小的参数开销,便将平均接受长度提升了约 0.4 个 token。
此外,针对深层注意力在处理块内依赖时出现的“后缀衰减”难题,DFlash2 创新性地应用了双抽头动态卷积。通过在 Attention 和 MLP 层中嵌入这种能够捕捉局部依赖的卷积结构,模型能够有效融合自身表示与前驱信息,其效果足以媲美堆叠十层 Transformer,而付出的延迟开销却微乎其微。实测数据显示,在 H200 单卡环境下,配合 SGLang 推理引擎,该方案能够将吞吐量提升至原生自回归解码的 2.7 到 3.4 倍,平均接受长度达到 4.80。
在实际部署与应用方面,Qwen3.8-27B-DFlash2 展现了极强的生态兼容性。开发者可以通过 SGLang、vLLM 以及 llama.cpp 等主流推理引擎快速集成,甚至在 Apple Silicon 平台上也能通过 oMLX 实现高效的本地化运行。无论是构建高吞吐的 AI Agent 平台、提升实时对话系统的响应速度,还是优化代码补全助手的用户体验,这款模型都能凭借其低部署成本和卓越的加速比,成为提升生产力的利器。
通过对比数据可以发现,相较于社区常见的 DSpark 草稿模型,Qwen3.8-27B-DFlash2 在 GSM8K、MATH-500、HumanEval 等多项基准测试中均表现出显著的性能优势。特别是其极低的额外参数负担和极小的周期延迟影响,使其在追求高性能推理的场景中极具竞争力。对于关注 AI 开源技术的开发者而言,可以通过访问其 GitHub 仓库或官方博客,深入了解这一提升推理效率的先进方案。


