Qwen 3.8-Max

AI工具2个月前更新 AI工具集
5 0 0

Qwen 3.8-Max – 阿里云 Qwen 团队推出的旗舰大模型

Qwen 3.8-Max,这款由阿里云 Qwen 团队倾力打造的旗舰级大型语言模型,以其惊人的 2.4 万亿总参数量,在 Qwen 3.5 架构的基础上实现了质的飞跃。它不仅是 Qwen 系列迄今为止最为强大的代表,更是首个即将向公众开放权重的 Max 级别模型,预示着其在人工智能领域的重要地位。

Qwen 3.8-Max 究竟是何方神圣?

Qwen 3.8-Max 是阿里云 Qwen 团队精心研发的尖端大型语言模型,其庞大的 2.4 万亿参数规模,在 Qwen 3.5 架构的坚实基础上进一步拓展。作为 Qwen 模型家族的集大成者,它以无与伦比的强大性能傲视群雄,并即将成为首个开源权重的 Max 级别模型,为AI生态注入新的活力。该模型在编程、办公、科研以及长距离任务处理等方面实现了全方位的性能提升,用户可以通过千问AI平台提供的API轻松调用,并且完美兼容OpenAI与Anthropic的协议,能够无缝集成到Claude Code、Codex、Qoder等主流的智能体框架中。

Qwen 3.8-Max 的核心能力亮点

  • 深度自主编程能力:它能够完成长达十天的自主编程任务,构建具备自我进化能力的“harness”系统,并自主完成需求收集、问题分配、代码生成以及代码自我修复等一系列复杂流程。
  • 论文复现与创新突破:该模型在复现学术论文实验的基础上,通过四轮自我进化循环,测试了 18 种改进策略,并在 AIME24 竞赛中,以超出原方法 2.7 分的成绩取得了显著的超越。
  • 竞赛实战表现卓越:在短短 24 小时内,模型能够搭建并迭代优化解决方案,将准确率从 0.60 提升至 0.853,其表现超越了 87% 的人类参赛队伍。
  • 办公效率的性提升:Qwen 3.8-Max 能够覆盖数百种高价值的职业场景,例如,在法律领域,它可以在一小时内精准标记出 1,284 条法律条款;在设计领域,它能一次性生成 8 页可交互的原型设计,极大地提升了工作效率。
  • 量化策略的智能研发:仅凭一句简单的描述,模型即可调度约 330 个子智能体,执行约 6,000 次回测,最终交付一套完整的端到端 ETF 轮动策略。
  • 芯片设计的自主优化:历经约 500 轮的交互式优化,模型成功将密码加速器网表的门数从 8,298 优化至 678,实现了 81% 的面积缩减,并确保了时序的完美收敛。

Qwen 3.8-Max 的技术基石

  • 架构的创新扩展:模型在继承 Qwen 3.5 架构特性的同时,通过参数量的激增至 2.4 万亿,并保持 95B 的激活参数,实现了规模上的巨大飞跃。
  • 真实世界的强化学习体系:通过同步扩展 RL 环境数量与训练算力,模型实现了通用工作能力的显著提升。其核心突破在于解决了三个相互关联的挑战:在任务、工作空间和 Harness 三个维度上实现解耦,使得环境数量能够以组合的方式自然增长;构建了一个统一的奖励系统,将基于执行的校验、文本及渲染后视觉输出的评估标准、以及 Agentic 检查统一整合,消除了任务专用验证器之间不一致的问题;建立了一个在线数据均衡器,能够对每个训练批次在任务、难度、工作区和 Harness 上进行均衡重构,有效降低了梯度方差,为训练算力的稳定持续扩展奠定了基础。
  • 自进化反馈闭环机制:模型通过执行-反馈-迭代的自适应循环机制不断优化自身性能。在数百至数千轮的交互过程中,它能够保持高度连贯的系统性策略。依赖于仿真、综合、布局等多种反馈闭环,模型实现了算法层面的数据通路重构,而非仅仅进行浅层的语法微调。
  • 动态工作流的智能编排:模型能够以编程的方式驱动任务规划,将编排逻辑固化为可复现的程序。这使得它能够灵活地在单链路的连贯研发与大规模并行探索之间切换,将复杂任务的串行推进过程转化为一次对话内即可大规模交付的自动化闭环。

如何驾驭 Qwen 3.8-Max 的强大力量

  • 通过千问AI平台便捷调用:只需注册账号并获取 API Key,即可通过与 OpenAI 或 Anthropic 协议兼容的接口直接调用模型。
  • 灵活调控推理深度:通过设置 reasoning_effort 参数,您可以选择 xhigh(默认,进行深度分析)、medium(平衡性能与速度)或 low(追求高效推理),从而按需控制成本与性能的平衡。
  • 无缝集成智能体框架:在配置好 API Key 和 Base URL 后,您可以将模型轻松接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流的编程助手和 Agent 框架。
  • 开源权重本地部署:从下周开始,您可以在 Hugging Face 或 ModelScope 下载模型权重,实现本地部署并进行二次开发,充分发挥其潜力。

Qwen 3.8-Max 的核心竞争力

  • 超乎想象的长程自主执行能力:模型能够连续数天甚至数十天保持专注,通过执行-反馈-迭代的闭环机制实现自我进化,全程无需人工干预。
  • 源于真实世界的 RL 训练:通过联合扩展环境数量与训练算力,模型在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 等 Harness 上展现出均衡且持续提升的性能。
  • 端到端的交付能力:通过动态工作流将复杂的编排逻辑固化为可复现的程序,将原本需要数周才能完成的复杂任务,压缩为一次对话内即可规模化交付的自动化闭环。

Qwen 3.8-Max 的项目信息

维度Qwen 3.8-MaxGPT 5.6 Sol
论文复现PaperBench 93.0 分,复现后自我进化超越原文PaperBench 90.5 分
软件工程SWE-bench Pro 67.7 分,FrontierSWE 73.5 分SWE-bench Pro 64.6 分,FrontierSWE 无官方数据
终端编码Terminal Bench 2.1 86.6 分Terminal Bench 2.1 88.8 分
通用办公CoWorkBench 74.8 分,JobBench 53.4 分CoWorkBench 71.5 分,JobBench 45.4 分
多模态推理MMMU-Pro 82.3 分,BabyVision 82.0 分MMMU-Pro 83.0 分,BabyVision 65.5 分
视觉智能体OSWorld-Verified 86.1 分,AndroidWorld 85.3 分OSWorld-Verified 83.2 分,AndroidWorld 77.6 分
视频理解VideoMME 90.4 分,MLVU 90.8 分VideoMME 89.5 分,MLVU 87.6 分
长程任务365 天电商模拟 4.16 倍回报,芯片设计 500 轮优化无公开同类长程自主任务数据

Qwen 3.8-Max 的广泛应用场景

  • 法律合规审查的革新:模型能够一次性通读数百份法律文档,在一小时内精确识别出上千条相关条款,其效率相当于法务团队约一周的工作量。
  • UI/UX 原型设计的飞跃:对于数字银行 App,模型能够一次性生成 8 页高保真且具备交互性的原型设计,无需后续的人工修改。
  • 餐饮菜单的智能开发:基于上百份食材资料,模型能够一次性产出包含 26 道菜品的完整菜单,并精准控制食材成本率在 33.8%。
  • 结构工程建模的精细化:仅凭一张图纸,模型就能在浏览器中还原出 30 层写字楼的抗震结构模型,并支持实时悬停查看关键性能指标。
  • 康复医学可视化的创新:模型可以将二维纸质评估单转化为可旋转、逐层显现的三维交互式演示,极大地帮助患者理解其康复过程。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...