Qwen3.8-Flash是什么
Qwen3.8-Flash 是阿里云通义千问团队推出的多模态混合专家(MoE)大模型,其开源权重以 Qwen3.8-Flash-Next 的名义在 Hugging Face 发布。模型总参数量达 125B,借助 MoE 架构每 token 仅需激活 6B 参数即可完成推理,并原生支持 262K 上下文窗口、可扩展至 1M。凭借 GDN+QSA 混合注意力、门控残差、N-gram 嵌入层与 Muon 优化器四项底层架构革新,它将训练成本压缩至前代 Qwen3.7-Plus 的九分之一,在软件工程、办公自动化与多模态感知等方向展现出旗舰级能力,同时也被官方定位为 Qwen4 系列架构的试验田。
Qwen 官方博客宣布 Qwen3.8-Flash 正式发布(开源版本名为 Qwen3.8-Flash-Next)
Qwen3.8-Flash的主要功能
- 海量信息检索与分析:原生 262K 上下文、可扩展至 1M,足以整卷读入大型代码库与长篇技术文档,完成深度检索与解析。
- 端到端软件工程:具备的代码编写、故障排查与多语言项目维护能力,可承担完整的开发任务闭环。
- 自动化办公生态:面向复杂冗长的办公流程,通过集成多种工具调用实现任务的自动闭环管理。
- 全场景多模态感知:覆盖长视频理解、科学图表解析、视觉几何问题与现实场景理解等多种感知任务。
- 交互式设备操控:依托视觉感知能力直接操控安卓终端、桌面系统与网页界面,实现更深层的人机协作。
- 严谨推理:在科学实验分析、竞技编程、复杂指令遵循与跨学科综合推理等高难度任务中表现出色。
Qwen3.8-Flash的四项底层架构革新
- GDN+QSA 混合注意力:每四层网络交替部署三层 Gated DeltaNet 与一层 Qwen Sparse Attention,在记忆存储与精准检索之间取得平衡,将 1M 上下文下的预填充(Prefill)吞吐量提升 8.6 倍。
- 门控残差(GR):把传统单线残差流升级为四路并行分支,用动态门控调配信息读写,强化长距离信息关联,并支持 FP8 格式存储以优化显存占用。
- N-gram 嵌入层:在传统 Embedding 之上增设 51B 参数的 N-gram 模块,通过异步预取与计算重叠技术,在几乎不增加计算负担的前提下增强对短语搭配模式的捕捉。
- Muon 优化器:对核心线性映射权重引入正交化优化,Embedding 与 Router 部分沿用 AdamW,并优化 Scaling Law 策略,支持更高效的学习率与批处理规模。
Qwen3.8-Flash的基准测试表现
作为 Qwen4 系列架构的试验田,Qwen3.8-Flash 在发布时同步公开了完整的技术报告与基准成绩,方便开发者与研究者复核其架构收益。
在官方公布的成绩中,Qwen3.8-Flash-Next 于 SWE-bench Pro 软件工程基准取得 62.5 分,在 AndroidWorld 移动操控基准达到 84.5 分,并在 MathVision 等视觉与科学类基准上对同类竞品保持领先。结合 1M 上下文下的高速处理能力与 FP8 支持、N-gram 卸载至内存等工程方案,它在 Agent 智能体协同、软件工程与多模态操控任务中确立了新一代智能体基座的定位,同时显著降低了开发者的硬件部署压力。
Qwen3.8-Flash-Next 在 Hugging Face 的开源权重仓库页面
如何使用Qwen3.8-Flash
- 本地化部署:从 Hugging Face 获取 Qwen3.8-Flash-Next 开源权重,根据自身算力条件自主部署。
- 云端 API 调用:通过千问 AI 官方平台接入服务,官方表示采用极具竞争力的定价策略(具体价格以官方平台公示为准)。
- 千问办公应用:在办公场景中直接调用,体验长文档处理与自动化办公的便利,相关生态可参考千问办公 QwenWork。
- 学术研究:查阅 GitHub 仓库中的技术报告,获取架构细节与训练方案进行二次开发。
Qwen3.8-Flash的使用场景
- 代码库级开发与重构:借助 262K~1M 上下文整库理解代码,适合大型项目的检索、排查与端到端开发,可与Qwen 3.8-Max 等同家族模型按任务规模搭配使用。
- 智能体与设备操控:以视觉感知驱动安卓、桌面与网页操控,构建自动化 Agent 工作流。
- 长文档与办公自动化:处理长报告、合同与表格流程,配合Qwen Chat 等对话入口完成日常任务。
- 科研与图表解析:解析科学图表、长视频与几何问题,服务科研与工程分析场景。
- 多模态创作延伸:在通义家族中还可与通义万相(Qwen-Image)等视觉生成模型组合,覆盖理解与生成两端;轻量在线体验也可尝试Qwen3.app。
Qwen3.8-Flash的常见问题解答
- Qwen3.8-Flash 与 Qwen3.8-Flash-Next 是什么关系?
- Qwen3.8-Flash-Next 是开源权重的发布名称,而 Qwen3.8-Flash 是基于该架构的官方版本,默认即提供 1M 上下文长度与官方内置工具等更多生产级特性。
- 每 token 激活 6B 参数意味着什么?
- 这是 MoE(混合专家)架构的特点:模型总参数为 125B,但每个 token 只需调用其中约 6B 参数参与计算,从而在保持大模型能力的同时大幅降低推理成本。
- 没有云端 API 也能用吗?
- 可以。Qwen3.8-Flash-Next 的开源权重已托管在 Hugging Face,用户可在本地或私有环境中自行部署,也可以选择千问 AI 官方平台的云端 API。
Qwen3.8-Flash官网网址
官方博客:https://qwen.ai/blog?id=qwen3.8-flash-next
Hugging Face 模型仓库:https://huggingface.co/Qwen/Qwen3.8-Flash-Next
技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
OpenI AI时代点评
Qwen3.8-Flash 的价值在于对成本与性能的极致平衡:以九分之一的前代训练成本、每 token 6B 的激活量,交出了 SWE-bench Pro 62.5、AndroidWorld 84.5 的旗舰级答卷,并以 1M 上下文的高速处理能力服务于智能体与软件工程场景。对于希望在本地部署多模态大模型、或以低成本接入云端能力的开发者而言,它都是当前开源生态中极具吸引力的一款基座模型,值得持续关注其在 Qwen4 系列中的架构演进(官方博客:https://qwen.ai/blog?id=qwen3.8-flash-next)。


