Step 5 Preview

AI工具10小时前更新 AI工具集
1 0 0

Step 5 Preview 是什么

Step 5 PreviewStep 5 Preview 官方页面:向前一步,智能效率的新一代「帕累托前沿」

Step 5 Preview 是什么?它是阶跃星辰StepFun)匠心打造的新一代旗舰级基座引擎,专为复杂的真实世界 Agentic 任务而生。该模型创新性地引入了稀疏 MoE 架构,在总参数量高达 600B 的情况下,每次激活参数仅为 27B。它不仅具备百万级别的 Token 超长上下文处理能力,更实现了原生多模态融合。在各项全球权威测评中,其表现稳居开源阵营前三甲,性能直逼 GPT-6 Astra 与 Claude Opus 5,而单任务的运行成本却仅为后者的八分之一。

简单来说,Step 5 Preview 想回答的是一个很具体的问题:当一个模型要在真实世界里连续跑上几十个小时、反复调用工具、不断根据现实反馈纠错,它能不能扛住?阶跃星辰给出的思路不是简单堆参数,而是走「高能效 Scaling」这条路——用稀疏 MoE 把算力精准投放到真正需要的专家上,用百万 Token 上下文对抗长程任务的记忆衰减,用闭环 Agentic 工具调用把「规划、执行、观测、修正」串成一条自动运转的链路。

这三件事,恰好对应着 Agent 从「能演示」走向「能交付」的三道坎:算得起的成本、记得住的历史、接得上的工具。Step 5 Preview 的产品叙事,基本就是围绕这三道坎展开的。

Step 5 Preview 的产品定位与命名由来

「Preview」这个后缀本身就说明了态度:这是一次面向真实世界 Agentic 能力的前瞻性发布,重点展示的是长周期自主作业与工具调用闭环这两条主线能力,而不是一次普通的版本号迭代。从官方页面的表述来看,Step 5 Preview 被定位为「向前一步,智能效率的新一代帕累托前沿」——它所追求的并不是在某一个单点跑分上刷到最高,而是在「能力、成本、效率」这三者构成的曲面上,把可行域往外推一格。

这一点从它的架构取舍上就能看出来。600B 的总参数量保证了知识容量与推理天花板,27B 的激活参数则让单次前向传播的算力开销保持在一个可以长期在线运行的水平。对开发者而言,这意味着你可以在真实业务里把模型跑成一条长期在线的 Agent 流水线,而不必每次调用都心疼账单。

从产业位置上看,它还承担着另一层角色:在开源阵营里提供一个「旗舰能力 + 可自部署」的选项。闭源旗舰模型能力再强,企业在数据合规、私有化部署、单位成本可控这几件事上始终有顾虑;而完整权重释出的开源路线,恰好把这三个顾虑同时接住了。对需要在自有环境里长期跑 Agent 的团队来说,这是选型时绕不开的一个变量。

Step 5 Preview 的能力边界在哪里

从官方披露的实测场景看,Step 5 Preview 的能力边界大致落在三类任务上:一是需要长期连续迭代的工程类任务,比如从零调优 GPU 内核、自动化处理后训练数据流;二是需要跨工具协作的设备联调任务,比如自主解读硬件手册、驱动串口与摄像设备;三是需要信息交叉验证与建模的专业分析任务,比如金融投研中的估值建模与研报撰写。

反过来说,它并不是一个「什么都能干」的万能模型。它对任务的可验证性有依赖——只有当任务结果能够被工具反馈验证(比如代码能否跑通、内核性能是否提升、数据是否对齐),它的自我纠错闭环才能真正发挥作用。理解这一点,才能在实际使用中把它的长板用在刀刃上。

换句话说,把 Step 5 Preview 用好的关键,往往是先替它把「验收标准」准备好。你给它的反馈通道越明确,它自己纠错的效率就越高;反过来,如果你的任务本身无法判断对错,那它的长周期作业优势也就无从发挥。这不是模型能力的问题,而是任务设计的问题。

Step 5 Preview 的稀疏 MoE 架构为什么能省钱

要理解 Step 5 Preview 的成本优势,得先理解稀疏混合专家(MoE)在做什么。

在传统的稠密模型里,每一次前向传播都要把全部参数过一遍,参数量越大,单次推理的算力开销就越高。而 MoE 的思路是把模型拆成许多「专家」子网络,再配一个路由器:面对每个 Token,路由器只挑出最相关的一小部分专家参与计算。于是总参数量可以做得很大——保证知识容量——但每次实际参与运算的参数却少得多。

Step 5 Preview 正是这个思路的典型体现:600B 的总参数规模,每次前向传播仅精准激活 27B。按需调度专家的机制,让它在输出旗舰级水准的同时大幅压缩算力开销,这也是其成本优势的关键所在。放到实际业务里,这个差别会直接体现在两处:一是单次任务的费用,二是长周期任务的可行性。前者决定你敢不敢试,后者决定你能不能把它当成一条常驻流水线来用。

当然,稀疏架构也有它的工程代价——路由均衡、专家负载、通信开销都需要精细处理。但「以最高能效把算力转化为模型智慧」这条路线,本身就是在回答一个更长远的问题:当算力不再无限增长时,智能还能靠什么继续往前走。

Step 5 Preview 的百万 Token 上下文解决了什么问题

100 万 Token 的上下文窗口,听起来像是一个「容量参数」,但在 Agent 场景里,它其实是一个「可靠性参数」。

设想一个需要连续跑二十多个小时的任务:中间会有几十轮工具调用、上百条命令输出、若干次失败与重试。如果模型的记忆容量不够,它就会在某个节点上「忘掉」前面为什么失败过,于是重复踩同一个坑,或者在错误的前提上继续推进。上下文窗口越大,历史操作日志、工具输出反馈及错误信息就能留存得越完整,模型也越有条件依此自主调整后续步骤,达成真正的长距离规划。

所以百万级 Token 视窗的价值,不在于能一次性读进多少文档,而在于它让「长程记忆与持续跟进」这件事变得可能。配合频繁调用各类外部工具的能力,模型才有机会在漫长的任务链条中始终锁定上下文,最终交付一个完整的成果,而不是一堆各自为战的中间片段。

Step 5 Preview 的核心能力拆解

下面按官方给出的功能清单和技术说明,把 Step 5 Preview 的能力逐项拆开来看。

Step 5 Preview 的主要功能

  1. 智能编程与软件研发:全面支持 553 个多样化代码仓库以及 33 种主流编程语言,轻松驾驭 Bug 修复、新功能迭代与代码重构,甚至能直连真实物理硬件,展开长达三个多小时的不间断调试。
  2. 超长周期自主任务处理:具备长达 24 小时的高强度连续作业能力,能够高效完成诸如从零开始调优 GPU 内核、自动化处理后训练数据流等高难任务。
  3. 前端开发与创意呈现:无缝联动 Blender 自动生成 3D 模型资产,并快速接入 Three.js 构建互动网页应用。
  4. 专业金融投资分析:融合了信息交叉验证、企业财务估值建模以及深度研报撰写三位一体的核心功底,并通过了严苛的 FrontierFinance 评测检验。
  5. 百万级上下文洞察:依托 100 万 Token 的超大容量窗口,在漫长的任务链条中精准锁定上下文,支持频繁调用各类外部工具以完美交付最终成果。
  6. 嵌入式硬件与设备联调:能够自主解读硬件技术手册,驱动串口与摄像设备,并根据实时故障回传动态调试底层程序。

把这六项功能放在一起看,会发现它们共享同一个底层能力:在缺少人类逐步指导的情况下,自己去查资料、动手做、看结果、修错误。编程、调优、渲染、投研、嵌入式联调,虽然表面差异很大,但都需要「连续多轮行动 + 实时反馈修正」这套机制。Step 5 Preview 把这些场景集中列出,本质上是在展示同一块能力在不同领域的投影。

Step 5 Preview 的核心技术亮点

  1. 稀疏混合专家(MoE)架构:总参数规模达 600B,但每次前向传播仅精准激活 27B。通过按需调度专家的机制,在输出旗舰级水准的同时大幅压缩算力开销,这也是其成本优势的关键所在。
  2. 长程记忆与持续跟进:借助百万级 Token 视窗,模型在几十个小时的作业周期内,能够完整留存历史操作日志、工具输出反馈及错误信息,并依此自主调整后续步骤,达成真正的长距离规划。
  3. 闭环式 Agentic 工具调用:构筑了「规划、执行、观测、修正」的自动化运转链路,可灵活对接串口、摄像头与各类 API,依据现实环境的实时反馈不断自我纠错,直至顺利通关。
  4. 跨模态深度集成:将文本和视觉信息置于同一基座中进行一体化处理,使得模型既能深度剖析文档和截图,也能创作与演进视觉内容。
  5. 高能效 Scaling 演进路径:秉承自 Step 3.5 Flash 的研发理念,专注于探索如何以最高能效将算力转化为模型智慧,不断拓展「能力、成本与效率」的帕累托最优边界。

Step 5 PreviewStepFun AI Studio:在浏览器端即可直接开启 Step 5 Preview 的对话体验

Step 5 Preview 的 Agentic 闭环是怎么运转的

「规划、执行、观测、修正」这四个词看起来朴素,但要真正闭环起来,链条上每一环都不能掉。

规划环节,模型需要把一句模糊的任务描述拆成可执行的步骤序列,并判断哪些步骤需要外部工具介入;执行环节,它要真的把工具调起来——这里所说的工具不只是软件 API,还包括串口、摄像头这类物理接口;观测环节,它需要读懂工具返回的结果,包括那些没有明说报错、但数据明显不对的「沉默失败」;修正环节,它要基于观测结果回头改方案,而不是硬着头皮往下走。

大多数 Agent 产品死在第三步和第四步之间:能调工具,但看不懂结果;或者看懂了结果,却不知道怎么改。Step 5 Preview 把「依据现实环境的实时反馈不断自我纠错,直至顺利通关」写进技术说明,说明它的设计目标就是打通这段最难的链路。而百万 Token 上下文的存在,正是为了让这条链路在跑到第二十个小时的时候还记得第一小时发生过什么。

Step 5 Preview 的长周期作业体现在哪里

官方给出的两个数字很有代表性:长达 24 小时的高强度连续作业能力,以及在持续任务中可维持 22 小时以上的连续运转。这不是「理论续航」,而是针对具体任务类型给出的能力描述——从零开始调优 GPU 内核、自动化处理后训练数据流,属于典型的「没有标准答案、只能靠反复试」的任务。

以 GPU 内核调优为例,这类工作的特点是优化空间巨大但反馈信号明确:改动一版、跑一次基准、看吞吐是否提升,然后继续。人做这件事的瓶颈不在于聪明程度,而在于耐心和连续性;而模型的优势恰好是可以不厌其烦地迭代上千轮,还能把每一轮的改动与结果都记在上下文里,避免重复试探。官方披露的 508 TFLOPS 内核调优表现,正是这类长周期迭代的产物。

嵌入式联调则是另一种长周期任务:硬件会在运行过程中抛出各种非预期状态,模型需要一边读手册、一边驱动串口与外设、一边根据实时故障回传调整底层程序。这类任务对「观测」能力的要求极高,也最能体现闭环式工具调用的价值。

Step 5 Preview 怎么用、用在哪

如何使用 Step 5 Preview

  1. 网页在线直连:登录官方 Studio 平台(https://studio.stepfun.com/),完成注册后即可在浏览器端开启模型对话体验。这是上手成本最低的方式,适合先做一轮能力验证。
  2. 国内 API 开发接入:访问国内开放平台(https://platform.stepfun.com/)注册账号,生成专属 API Key 即可调用相关接口。
  3. 海外生态集成:海外开发者可前往(https://platform.stepfun.ai/)注册并获取 API Key,轻松将模型嵌入自有系统或 Agent 工作流。
  4. 构建 Agent 智能体:在 API 请求中合理配置超长上下文及工具参数,赋能模型高效处理编程、投研等复杂自动化场景。
  5. 从短任务验证起步:建议先用一次对话或一次代码修复验证调用链路是否通畅,再逐步把任务周期拉长,观察模型在长程任务中的记忆保持与自我纠错表现。
  6. 补齐工具与反馈通道:如果要用它的闭环 Agentic 能力,需要提前把可调用的工具、API、串口或设备反馈通道接好——反馈越真实,模型自我修正的效果越明显。
  7. 设计好验收标准:给每个长周期任务定义清晰的完成判定条件,让模型有明确的「通关」信号,避免它在没有终点的任务里空转。
  8. 按需评估自部署方案:对数据合规要求较高的团队,可以基于已释出的完整权重评估私有化部署路径,把模型放进自有环境长期运行。

Step 5 Preview 的使用场景

  1. 专业软件研发辅助:全方位应对错误排查、模块扩充、代码重构与环境搭建,通晓 33 种程序设计语言,胜任开发者核心日常搭档。想横向了解同类模型的能力分布,可以对照 DeepSeek模型百灵大模型孟子GPT 的公开能力说明。
  2. 长期科学探索与工程攻坚:针对需要数十小时不间断迭代的复杂研究课题,如全天候优化 GPU 底层核心、自动化生成后训练数据流等场景游刃有余。
  3. 嵌入式硬件与设备联调:能够自主解读硬件技术手册,驱动串口与摄像设备,根据实时故障回传动态调试底层程序,例如 ESP32 智能硬件改造项目。
  4. 量化金融与行业研究:赋能专业分析师高效检索财税资讯、搭建商业估值预测模型并产出高水准研究报告,相关能力已通过 FrontierFinance 评测检验。
  5. 前沿创意视觉设计:从可视化原型构建到三维资产渲染与网页动态交互,强力支撑创意工作者将灵感极速转化为现实产品。
  6. Agent 工作流与工具编排:把「规划、执行、观测、修正」的闭环嵌进业务系统,适配需要频繁调用外部工具的自动化流程。同类编排型产品可参考 天工超级智能体天工AI智能体AutoGLM沉思AI控制电脑GLM-PCCoze智能体

把场景按「任务周期」重新排一下,会更清楚该从哪里开始:小时级以内的任务(改一段代码、生成一份研报初稿、模型一个 3D 资产)适合先用 Studio 网页端试水;跨天级别的任务(GPU 内核调优、后训练数据流处理)则需要走 API 并把反馈通道接好;而涉及物理设备的任务,还要额外准备串口与摄像头的接入环境。它的能力上限很高,但前提是你愿意把工程接口准备好。

Step 5 Preview 的产品独特优势

  1. 极致的性价比体验:在权威的 Artificial Analysis Intelligence Index 中斩获 44 分的高分,位列开源前三,而单次任务耗费仅为 Claude Opus 5 的 1/8,极大刷新了智能效率极限。
  2. 卓越的长周期自主 Agent 战力:可维持长达 22 小时以上的连续任务运转,例如将 GPU 内核性能推高至 508 TFLOPS 甚至超越同类闭源竞品,尽显强大的持续规划与容错特质。
  3. 海量上下文承载力:拥有 100 万 Token 的记忆空间,在多轮复杂工具协作中确保历史轨迹不丢失、上下文理解不掉线。
  4. 高精尖的稀疏架构设计:以 600B 总参、27B 激活的精妙配比,实现了低能耗与高性能的完美兼顾。
  5. 多元垂直场景全覆盖:在代码编写、金融掘金、创意设计等诸多行业展现出深厚的全栈服务功底。
  6. 完整权重开源:已于 2026 年 10 月 15 日释出完整权重,为需要私有化部署与深度定制的团队提供了闭源方案之外的选项。

Step 5 Preview 同类工具对比

把 Step 5 Preview 放到当前的旗舰模型版图里,它的差异化其实相当清晰:同价位模型里它的长周期自主作业能力更突出,同能力模型里它的单任务成本又低得多。对于要长期在线运行 Agent 的团队来说,这两点合在一起,直接决定了方案是否跑得下去。

如果你是做技术选型,建议横向多看几家:可以在 DataLearner预训练模型平台 查公开评测与榜单数据,在 林哥的大模型野榜 看社区实测口径,在 无阶未来模型擂台 做同题盲测对照;需要一站式试用多个模型,可以走 AI大模型聚合平台星图大模型平台JuheNext;开发者视角的推理实践,则可以参考 大模型实验室Lab4AI动手学大模型BISHENG毕昇大模型

同一门派的兄弟产品也值得一并了解:阶跃视频阶跃AI阶跃星辰开放平台阶跃星辰AI对话【阶跃星辰·跃问】,分别覆盖视频生成、通用对话与开放平台接入等不同入口。至于对比参照对象,星图astraflow大模型火山方舟大模型体验中心MOSS复旦大模型Yan模型 也都各有侧重,按自己的任务类型逐个试跑一遍最稳妥。

选型时有一个容易被忽略的维度:反馈通道的丰富度。同样标称支持 Agent 能力的模型,有的只能调用 JSON 化的软件 API,有的还能对接串口和摄像头这类物理接口。如果你的业务落在硬件、设备、产线一侧,能不能「看到」真实世界的反馈,差别会非常大。Step 5 Preview 在这方面的说明相对具体,值得在看榜单分数之外单独考量。

Step 5 Preview 同类旗舰竞品横向评测

对比维度Step 5 PreviewClaude Opus 5
研发机构阶跃星辰(StepFun)Anthropic
底层架构稀疏 MoE(600B 总参 / 27B 激活)保密
Intelligence Index 评分44 分(跻身全球开源前三)略微领先
单任务开销经济基准约为本模型的 8 倍
上下文容量100 万 Token200K Token
原生模态文本 + 视觉一体化文本 + 视觉
GPU Kernel 调优跑分508 TFLOPS(性能拔尖)493 TFLOPS
AIME24 后训练表现53.3% 提升至 60%(效率更高)53.3% 提升至 60%
开源生态已于 2026 年 10 月 15 日释出完整权重闭源商业化运营

从这张表里能读出的结论很直白:在 Intelligence Index 这一档综合智能评分上,Claude Opus 5 依然略微领先;但 Step 5 Preview 在上下文容量、单位成本与 GPU 内核调优跑分上建立了明显优势,并且选择了以完整权重开源的方式参与竞争。

几项指标里最值得展开的是 GPU Kernel 调优:508 TFLOPS 对 493 TFLOPS,看上去只差 3%,但这项数字的特殊之处在于它不是一次静态问答的结果,而是一段长时间自主迭代的产出。要把内核性能推到某个数值,模型必须反复编译、运行、测量、再改,中间任何一次记忆断裂或纠错失败都会让过程中断。所以这个数字背后衡量的是「持续作业能力」,而不只是「代码写得对不对」。

AIME24 后训练表现那一行同样耐人寻味:两家的成绩都从 53.3% 提升到 60%,说明在同样的提升幅度下,Step 5 Preview 用了更低的成本——这正是「效率更高」四个字的含义所在。对预算敏感又需要长上下文、长周期 Agent 能力的团队,这个组合的吸引力相当强。

Step 5 Preview 常见问题与官网入口

Step 5 Preview 适合哪些团队使用

按使用形态区分,Step 5 Preview 大致对应三类使用者。

第一类是「需要长周期自动化」的工程团队。典型特征是任务可以自我验证——代码能跑通、内核吞吐能测量、数据管道能对账——但迭代次数极多、人工盯守成本高。这类团队最该关注的是 24 小时连续作业能力与百万 Token 上下文,因为它们直接决定了一次任务能跑多远而不跑偏。

第二类是「对单位成本敏感」的产品团队。当 Agent 要在线上长期服务大量用户时,单次任务成本会被放大成决定性变量。单任务开销约为 Claude Opus 5 的 1/8 这个比例,意味着同样的预算可以支撑约 8 倍的任务量,或者同样的任务量可以把成本压到原来的八分之一。对刚起步的产品来说,这个差值往往就是「能不能跑通商业模式」的分界线。

第三类是「有私有化诉求」的机构用户。完整权重开源之后,模型可以部署在自有环境里,数据不出域、调用不受外部服务可用性影响。对金融、医疗、制造这类对数据合规要求较高的行业,这是选型时的硬性条件,而不是加分项。

至于只需要短期对话、单轮问答、文案润色的个人使用者,坦诚地说,Step 5 Preview 的长板并不在你这里——它的价值要在长周期、多工具、可验证的任务里才会真正显现出来。选对使用姿势,比选对模型更重要。

另外值得一提的是它在中西方开发者生态上的布局:国内开放平台与海外平台并行,意味着跨区域团队可以用同一套模型能力做协作,而不必为不同地区各准备一套技术栈。对出海团队来说,这种一致性本身就省下了不少工程协调成本。

Step 5 Preview 选型自查清单

如果你正在评估要不要把 Step 5 Preview 纳入技术栈,可以按下面这份清单逐条打勾,命中越多,它越可能是对的选择:

  1. 任务可以自我验证吗:结果是否能用工具或数据直接判断对错(编译是否通过、指标是否提升、账是否对得上)。可验证性是它发挥长周期自主能力的前提。
  2. 任务是否需要跨天连续运行:如果单次任务动辄需要十几二十小时反复迭代,它的 24 小时连续作业能力与百万 Token 上下文才有用武之地。
  3. 是否要频繁调用外部工具:包括软件 API,也包括串口、摄像头这类物理接口。工具种类越杂,闭环式 Agentic 调用的价值越大。
  4. 单任务成本是否构成约束:如果调用量级较大、成本会显著影响商业模型,那么约八分之一的成本差额就值得认真计算。
  5. 是否有私有化部署需求:涉及敏感数据、要求数据不出域的场景,可以基于已释出的完整权重评估自部署路径。
  6. 是否需要处理超长文档或超长会话:百万 Token 上下文对整本文档分析、超长日志排查、多轮工具协作这类任务收益明显。
  7. 是否需要跨区域协作:国内与海外平台双通道并行,可以降低跨区域团队的技术栈协调成本。

反过来说,如果你的需求集中在短文本生成、日常问答、简单翻译润色这类单轮任务上,那么选择更轻量的模型反而更划算。工具没有绝对的好坏,只有匹配与否。

Step 5 Preview 的完整权重开源意味着什么

「已于 2026 年 10 月 15 日释出完整权重」这句话,在产业层面的分量可能比跑分更大。

权重公开之后,模型从一项「服务」变成了一件「工具」。团队可以把模型拉进自己的机房,用内部数据做后训练与领域适配,把推理链路和业务系统深度耦合,而不必担心调用配额、接口变更或数据出境问题。对需要把 Agent 嵌进核心生产流程的企业来说,可控性往往是第一位的需求。

其次,权重公开会显著加快生态创新。研究者可以基于它做长上下文、MoE 路由、Agentic 训练方向的实验;开发者可以针对具体行业做微调与蒸馏;开源社区则会自然形成工具链、评测集与最佳实践的积累。这些衍生的价值,通常会在发布后几个月内陆续显现出来,而不体现在发布当天的榜单上。

再往远看,开源旗舰模型与闭源旗舰模型形成的能力对照,本身也在推动整个行业把注意力从「参数规模竞赛」转向「智能效率竞赛」。当同等能力可以用更低成本获得时,竞争的重心自然会移到「谁能把它用出更多场景」上来——这对应用层的开发者而言,是最好的消息。

把这几个数字和场景放在一起,Step 5 Preview 的画像就清晰了:它是一款把「能效」作为第一优化目标、把「长周期自主作业」当作核心卖点的旗舰基座模型。它不追求在所有榜单上都拿第一,但在单位成本、上下文容量与持续作业这几项上,给出了目前开源阵营里相当有说服力的答案。

需要提醒的是,本文所有参数与评测数字均来自阶跃星辰官方公开信息,实际体验会受调用方式、工具接入质量与任务设计影响,建议以自己的真实任务做最终验证。

Step 5 Preview 关键数据速查

把官方披露的核心参数集中列表,方便与自己的选型需求逐条对照:

指标项数值
总参数量600B
单次前向激活参数27B
上下文窗口100 万 Token
Artificial Analysis Intelligence Index44 分(位列开源前三)
支持代码仓库数量553 个
支持编程语言数量33 种
单任务成本约为 Claude Opus 5 的 1/8
GPU 内核调优跑分508 TFLOPS
连续作业能力最长 24 小时高强度连续作业,持续任务可维持 22 小时以上
硬件直连调试单次时长长达三个多小时的不间断调试
AIME24 后训练表现由 53.3% 提升至 60%

读这张表时建议抓住三个「量级差」:600B 与 27B 之间的 22 倍差距,是成本优势的来源;100 万 Token 与 200K Token 之间的 5 倍差距,是长程记忆优势的来源;508 与 493 TFLOPS 之间看似只有 3% 的差距,却是在长时间自主迭代下取得的,是持续作业能力优势的来源。把这三条想清楚,选型时基本就不会跑偏。

Step 5 Preview 的常见问题解答

Step 5 Preview 是开源模型吗?
是。根据公开信息,该模型已于 2026 年 10 月 15 日释出完整权重,采用开源方式发布,开发者可以基于权重自行部署与二次开发。
Step 5 Preview 的 600B 总参会不会很吃算力?
这正是稀疏 MoE 架构要解决的问题。虽然总参数量高达 600B,但每次前向传播仅激活 27B 参数,算力开销大幅压缩,这也是它单任务成本能控制在 Claude Opus 5 约八分之一的关键原因。
Step 5 Preview 和 Claude Opus 5 应该怎么选?
取决于你的任务形态。如果追求极致的综合智能评分,Claude Opus 5 目前略微领先;如果需要 100 万 Token 级别的超长上下文、要跑几十小时不间断的 Agent 任务,或者对单任务成本敏感,Step 5 Preview 在 GPU 内核调优跑分(508 TFLOPS)与性价比上的优势更实在。建议用自己最典型的任务做一次同题实测再决定。

Step 5 Preview 官网网址

Step 5 Preview 的官方项目主页是 https://www.stepfun.com/step-5-preview,可以在该页面查阅模型的完整能力说明与实测案例。

需要直接上手体验的,可访问官方 Studio 平台 https://studio.stepfun.com/;国内开发者调用 API 走 https://platform.stepfun.com/,海外开发者则使用 https://platform.stepfun.ai/

OpenI AI时代点评

Step 5 Preview 给整个行业提了一个很有价值的问题:当同一档智能水平可以用更低的成本实现时,Agent 产品的设计空间会被放大多少?过去很多「让 AI 连续工作一整天」的想法之所以停留在演示阶段,核心障碍从来不是模型不够聪明,而是长周期运行的成本与记忆衰减这两件事撑不住。稀疏 MoE 加上百万 Token 上下文,恰好同时压住了这两个变量。

它的另一个看点是路线选择。在 600B 总参与 27B 激活之间做出的取舍,说明阶跃星辰把「能效」当成了第一性优化目标,而不是单纯追逐参数规模。这种取向对实际落地更友好——毕竟在企业侧,决定一个方案能不能上的往往不是榜单上多两分,而是月账单上少一位数。把完整权重开源,则进一步把选择权交给了使用者:要托管服务还是要私有部署,由团队自己按合规与成本条件来定。

当然,Preview 就是 Preview,它的价值更多在于指明方向。后续版本能否把长程任务的稳定性、工具调用的成功率再推高一层,才是真正见分晓的地方。想跟进最新进展,可以直接查看官方主页 https://www.stepfun.com/step-5-preview,也可以到 林哥的大模型野榜无阶未来模型擂台 这类社区看看真实同题实测的结果。

最后给一个务实的建议:不要把 Step 5 Preview 当成一个「更便宜的模型」来用,那是低估了它。它真正的使用姿势,是把它放进一条需要连续作业的流水线里,配上可验证的反馈信号,让它自己跑上十几个小时。等你亲眼看到它在你自己的任务上迭代出结果,对「Agentic」这三个字的理解会完全不一样。

如果你还在观望阶段,一个低成本的起步路径是:先用官网 Studio 网页端跑一次短任务,感受一下它的规划方式与输出结构;再把同一个任务搬到 API 上,加上两三个可调用的工具,观察它在有反馈时的表现差异;最后挑一个可以跑上一整天的真实任务,把反馈通道补全,完整走一遍长周期流程。三步走下来,你基本就能判断它值不值得进入你的生产环境。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...