VibeThinker-3B – 微博开源的 30 亿参数密集推理模型
VibeThinker-3B:微博AI团队的推理“小钢炮”
新浪微博AI团队近日重磅发布了VibeThinker-3B,一款仅拥有30亿参数的密集推理模型。这款模型并非凭空捏造,而是以强大的Qwen2.5-Coder-3B为基石,通过一套创新的“Spectrum-to-Signal”后训练流程精心打磨而成。其惊艳之处在于,在数学、编程等需要严谨验证的推理任务上,VibeThinker-3B的性能已能媲美Gemini 3 Pro、Claude Opus 4.5等行业内的顶尖大模型。这标志着小模型在能力边界上的新突破,并为传统的“Scaling Law”(规模法则)提供了一种极具潜力的补充方案。
VibeThinker-3B的亮点功能一览
- 数学推理的“硬骨头”:在极具挑战性的AIME’26竞赛中,VibeThinker-3B取得了94.3分的高分;在HMMT’25竞赛中也斩获了89.3分;BruMO’25竞赛的成绩更是达到了93.8分。这些数字充分证明了其在高难度数学推理上的深厚功底。
- 竞技编程的“夺冠利器”:在LiveCodeBench v6评测中,模型实现了80.2%的Pass@1通过率;而在LeetCode的最新周赛及双周赛中,其通过率更是高达惊人的96.1%,展现了其在解决实际编程难题时的卓越能力。
- STEM领域的“解题能手”:针对IMO-AnswerBench,VibeThinker-3B获得了76.4分(在引入CLR策略后更是提升至80.6分),能够有效地解析和求解复杂的科学问题。
- 精准的指令遵循者:在IFBench评测中,模型获得了74.5分,这意味着它不仅能理解指令,还能准确地按照特定格式和约束条件进行操作,具备了高度的敏感性和检查能力。
- “测试时缩放”(CLR)的可靠加持:引入了“Claim-Level 可靠性评估”策略,这意味着在模型进行推理时,能够进一步增强答案的可靠性和准确性,尤其是在数学类任务中。
VibeThinker-3B背后的技术引擎
- 坚实的基座:模型完全基于Qwen2.5-Coder-3B构建,其30亿参数的密集架构保持不变。所有性能的飞跃,都源自于后训练技术栈的极致打磨与优化。
- “Spectrum-to-Signal”范式:这是其核心训练流程,巧妙地分为两个阶段:“频谱阶段”负责扩展模型的通用能力覆盖,而“信号阶段”则通过RLVR(Reinforcement Learning from Variational Rewards)技术,对可验证任务进行精准优化。
- 课程式的两阶段SFT(Supervised Fine-Tuning):第一阶段旨在广泛覆盖数学、编程、STEM以及对话等多种能力;第二阶段则聚焦于高难度、长推理的样本,循序渐进地深化模型的推理能力。
- 多样性探索的蒸馏:模型并非追求唯一的“最优解”,而是力求保留多种有效的推理路径,以此来增强模型在面对复杂问题时的泛化能力。
- MGPO(Multi-objective Guided Policy Optimization)强化学习:在GRPO(Guided Reinforcement Learning Policy Optimization)的基础上,引入了额外的权重,使得模型在优化过程中,能够优先选择那些“既不太容易也不太难”的样本,从而实现更高效的学习。
- 多领域顺序强化学习:实验发现,按照Math → Code → STEM的顺序依次进行强化学习,能带来整体效果的最优表现。
想要深入了解AI开源项目?关注微信并回复“开源”,即可加入AI开源项目交流群,与同好们一起探索前沿技术。
如何让VibeThinker-3B为你效力
- 轻松获取模型:前往HuggingFace或GitHub的官方仓库,即可便捷下载模型权重。
- 本地部署无忧:借助transformers等成熟框架,即可加载这款3B参数模型,即使是消费级硬件也能流畅运行。
- 智能推理体验:只需输入数学、编程或STEM类问题,模型便会输出带有完整推理链(Chain-of-Thought)的答案,让你清晰理解解题过程。
- 可选的CLR增强:对于数学类任务,用户可以主动开启Claim-Level可靠性评估,进一步提升答案的准确性。
VibeThinker-3B的独特优势
- 参数精简,性能卓越:仅需3B参数,却能在可验证推理任务上达到与千亿级前沿模型比肩的水平。
- 精心设计的SFT流程:从广度到深度,循序渐进地提升模型的推理能力。
- 优化的多领域RL训练:科学的训练顺序和长上下文推理的保留,确保了模型的高效性。
- 高效的离线自蒸馏:精准筛选高质量推理轨迹,专注于提升模型在未知领域的学习能力。
VibeThinker-3B的项目入口
- GitHub代码库:https://github.com/WeiboAI/VibeThinker
- HuggingFace模型集:https://huggingface.co/WeiboAI/VibeThinker-3B
- arXiv技术白皮书:https://arxiv.org/pdf/2606.16140
VibeThinker-3B与同类产品的横向对比
| 衡量维度 | VibeThinker-3B | Claude Opus 4.5 |
|---|---|---|
| 开发者 | 新浪微博AI团队 | Anthropic |
| 模型规模 | 30亿(密集模型) | 未公开(估计在数百亿至千亿级) |
| 开源情况 | 完全开源(含论文、代码及模型权重) | 闭源(仅提供API或产品服务) |
| 部署便利性 | 消费级GPU即可运行 | 仅支持云端API调用 |
| 核心定位 | 专精于可验证推理的引擎 | 通用型智能助手 |
VibeThinker-3B的潜在应用场景
- 竞赛备赛的得力助手:在AIME、HMMT、IMO等数学竞赛中,提供多角度的解题思路和参考。
- 编程面试的“陪练”:辅助解决LeetCode、LiveCodeBench等平台上的编程挑战,并附带详尽的解题分析。
- STEM教育的个性化辅导:为物理、化学、生物等学科问题,提供清晰、分步的推导过程。
- 边缘设备的智能推理:由于模型体量小,非常适合部署在手机、物联网设备等算力受限的环境中,实现本地化智能。
- 推理能力研究的基准模型:为学术界提供一个研究小模型推理上限的平台,探索超越传统Scaling Law的替代路径。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


