Nanbeige4.2-3B – 南北阁实验室推出的通用Agent小模型
Nanbeige4.2-3B:颠覆性微小模型,Agent能力远超同级别大模型
由BOSS直聘南北阁实验室精心打造的Nanbeige4.2-3B,是一款令人瞩目的通用Agent微型模型。尽管其参数量仅为30亿,却在代码智能体、办公自动化流程以及复杂工具调用等Agent任务上,展现出远超Qwen3.5-9B和Gemma4-12B等体量更为庞大的模型的卓越性能。
Nanbeige4.2-3B究竟是什么?
Nanbeige4.2-3B是BOSS直聘南北阁实验室倾力推出的通用Agent微型模型。其30亿参数的精巧设计,却能在代码智能体、办公工作流、复杂工具调用等Agent相关任务中,超越Qwen3.5-9B和Gemma4-12B等规模更大的模型。该模型巧妙地运用了Looped Transformer架构,极大地增强了其有效容量。同时,构建了涵盖代码、工具、办公三大类Agent数据的闭环合成管线,并经过三阶段的课程化SFT(Supervised Fine-Tuning)和多阶段的RL(Reinforcement Learning)训练。这一系列精细化的训练策略,不仅有效降低了推理成本,更在保持强大Agent能力的同时,实现了开源并适配多种推理引擎。
Nanbeige4.2-3B的核心功能亮点
- 代码智能体:能够深入真实代码仓库进行浏览、精准定位问题、执行修改操作,并进行运行验证,全面覆盖软件工程的各个环节。
- 办公智能体:处理各类文档、表格、幻灯片、PDF等跨格式文件游刃有余,并能支持多文件间的依赖关系及长流程的办公自动化任务。
- 复杂工具调用:支持MCP在线服务、本地Python工具以及虚拟工具的链式调用,并能智能推断参数,实现高效协同。
- 通用推理能力:在数学、代码和科学推理领域表现出色,在GPQA Diamond、HMMT等权威评测中,取得了同等规模模型中的最佳成绩。
- 本地个人助手:具备多轮规划、文件处理和错误恢复的能力,可以轻松部署为低门槛的本地Agent助手。
Nanbeige4.2-3B的技术原理剖析
- Looped Transformer架构:模型在经过全部Transformer层的计算后,其隐藏状态会被再次送回同一组层进行二次计算。此举在不增加模型参数量的前提下,显著提升了有效计算深度。经过验证,循环两次的计算在效果和稳定性之间取得了最佳平衡,且为了追求最佳效果,并未共享KV Cache。
- 预训练数据的策略性上采样:语料库规模从23万亿 tokens 扩展至28万亿 tokens。特别地,对数学、代码和合成QA数据进行了激进的上采样处理,使得这款小模型在推理和知识评测方面,全面超越了同规模的基座模型。
- Agent数据闭环合成机制:针对代码智能体,建立了“训练—失败分析—数据补充”的飞轮机制。针对工具调用,设计了真实MCP、本地Python和虚拟工具三类环境,并根据模型能力的演进动态调整难度。针对办公智能体,构建了素材聚类、任务生成和产出回收的闭环反馈系统。
- 三阶段课程化SFT:Agent数据的占比逐步提升,从64K增加到128K,再到256K。在错误轮次的处理上,设置了Loss Mask,保留错误上下文信息但不学习错误动作,从而使模型能够在真实的错误历史中学会自我修正。
- 多阶段RL配方:首先通过Think/Non-Think两阶段RLHF(Reinforcement Learning from Human Feedback)来稳定生成质量。随后,引入带长度控制的Reasoning RL,减少简单问题中的无效Token输出。最后,结合Outcome Reward和Action-Centric Rubric进行Agentic RL,优先选择轨迹较短且成功率较高的任务进行训练,以提升整体稳定性。
关注微信公众号,回复“开源”,即可加入AI开源项目交流群。
如何高效使用Nanbeige4.2-3B
- 获取模型权重:您可以从Hugging Face平台下载Agent模型(Nanbeige4.2-3B)或Base模型(Nanbeige4.2-3B-Base)的权重文件。
- 选择合适的推理引擎:使用已适配的Transformers、SGLang、vLLM、llama.cpp或Ollama等推理引擎加载模型。由于其3B参数的特性,对硬件要求较低,非常适合在本地PC或边缘设备上进行部署。
- 灵活切换推理模式:根据任务的复杂程度,选择“思考模式”(Think)进行深度推理,或选择“非思考模式”(Non-Think)以获得快速响应。这两种模式可以根据实际需求灵活切换。
- 接入Agent框架:将模型集成到OpenClaw等Agent框架中,并配置好外部工具和Scaffold,即可执行复杂的多步代码、办公或研究任务。
Nanbeige4.2-3B的核心竞争优势
- 参数精巧,能力卓越:仅30亿参数,却能在Agent任务上稳定超越90亿/120亿级别的模型,显著降低了高频调用场景下的推理成本。
- 架构创新之举:采用Looped Transformer架构,在固定参数量下最大限度地挖掘有效容量,相较于标准Transformer,实现了约75%的token效率提升。
- 数据飞轮的持续进化:三类Agent数据的训练均构建了闭环反馈和难度演化机制,确保了训练数据的质量与模型能力的同步提升,避免了数据停滞。
- 精细化的训练工艺:SFT阶段的错误掩码设计,既保留了错误上下文,又避免了学习错误动作。RL多阶段配方的应用,兼顾了准确率的提升和输出长度的优化。
- 低门槛部署的便捷性:已全面适配主流推理引擎,支持Think/Non-Think双模式,特别适合本地部署和成本敏感型应用场景。
Nanbeige4.2-3B的项目资源链接
- HuggingFace模型库:
- https://huggingface.co/Nanbeige/Nanbeige4.2-3B
- https://huggingface.co/Nanbeige/Nanbeige4.2-3B-Base
- 技术论文深度解读:https://huggingface.co/Nanbeige/Nanbeige4.2-3B/blob/main/Nanbeige42_report.pdf
Nanbeige4.2-3B的同类竞品对比分析
| 对比维度 | Nanbeige4.2-3B | Qwen3.5-4B |
|---|---|---|
| 非Embedding参数量 | 3B | 4B |
| General Agent(PinchBench-V2) | 74.7 | 63.9 |
| Code Agent(SWE-Bench Verified) | 63.6 | 38.8 |
| 办公任务(GDPval) | 68.8 | 37.0 |
| 推理能力(GPQA) | 53.3 | 43.1 |
| 架构特色 | Looped Transformer | 标准Transformer |
| 部署门槛 | 更低,适配多引擎 | 标准部署 |
Nanbeige4.2-3B的应用场景拓展
- 本地代码开发助手:在开发者本地环境中,执行代码仓库的浏览、Bug的修复以及补丁的验证等软件工程任务。
- 办公工作流的自动化革新:自动处理各类跨格式文档、表格和幻灯片,高效完成数据整理、报告生成以及格式转换等工作。
- 智能工具编排服务专家:通过MCP协议调用在线服务和本地工具,实现信息检索、数据分析以及多步骤任务的智能编排。
- 边缘设备上的专属个人助手:可部署在PC或NAS等本地设备上,提供低延迟、高隐私保障的通用Agent助手服务。
- 高频Agent系统的核心引擎革新:在需要数十至上百次模型调用的复杂Agent系统中,替代大模型,从而显著降低运营成本。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


