NeoHorse-1

NeoHorse-1是什么

NeoHorse-1 是由基元律动(TokenRhythm)联合无问芯穹、清华大学、北京大学、香港中文大学、阿里巴巴等机构共同推出并开源的 Agent 模型系列,提供 4B 与 9B 两个参数版本。与先做通用问答、再补智能体能力的传统路线不同,这个系列从一开始就是围绕”把任务做完”来训练的:模型在工具调用任务规划深度搜索代码生成等真实执行场景中接受训练,原生上下文长度达到 262,144 tokens,并且可以扩展到约 101 万 tokens,足以承载长程智能体任务。

它的训练方法被团队称为 Agent-Native 后训练:把 Routing Harness 在真实环境中留下的执行轨迹直接转化为训练语料,同时把路由信号复用为课程排序的依据,从而建立起”评测反馈 → 数据配比 → 模型更新”的自动化闭环。模型权重已在 ModelScope、Hugging Face 等平台开放下载,代码仓库同样公开,开发者可以用 SGLang 或 vLLM 在本地快速拉起推理服务。对于想构建自动化智能体、又受限于大参数模型成本的团队来说,这是一个值得关注的选项。

NeoHorse-1NeoHorse 系列代码仓库(GitHub:TokenRhythm/NeoHorse)

NeoHorse-1的主要功能

NeoHorse-1 的能力矩阵覆盖了智能体任务的四个关键环节:

  1. 工具调用:能根据任务需求从众多外部工具中挑选并调用最合适的一个,支持多阶段、多工具的协同操作,调用过程流畅且参数准确。
  2. 任务规划:面对复杂的大型任务,可以将其拆解为条理清晰的子任务,并进行长周期的调度与管控,避免中途丢失目标。
  3. 深度搜索:在多轮交互中主动发起检索请求,对信息进行交叉比对与整合,为最终结论提供完整的证据链支撑。
  4. 代码生成:不仅能写出可用的代码,还能根据运行环境返回的报错进行实时调试与修复,循环迭代直到任务完成。
  5. 超长上下文承载:原生支持 262,144 tokens 的上下文窗口,可扩展至约 101 万 tokens,适合需要处理大量历史记录和工具输出的长程任务。
  6. 小参数量下的高性价比:4B 版本经过 Agent 导向后训练,可以在不少执行型任务上追平甚至超过参数量更大的通用模型,便于在有限算力下部署。

NeoHorse-1的核心技术:Harness轨迹、路由课程与递归自我改进

NeoHorse-1 的差异化主要来自训练数据与训练信号的组织方式,可以概括为三层设计:

  1. Harness 轨迹驱动的专属训练:训练语料的核心是 Routing Harness 在真实执行中产生的结构化轨迹,完整记录了用户请求、能力需求评估、路由选择、模型响应、工具交互、环境反馈以及错误与恢复过程。相比”题目 + 答案”式的问答语料,它多出能力需求、执行决策、环境结果三个维度的信息,并且对成功与失败的轨迹兼收并蓄——失败与修复路径恰恰告诉模型”哪里容易出错、出错后如何恢复”。
  2. 能力引导的动态数据配比:Harness 路由器会为每轮请求估计能力需求,归入 C0 到 C3 四个档位(C0 处理边界清晰的低风险请求,C1 为通用默认档,C2 支持多步推理与执行,C3 提供最高能力或可靠性)。这套原本只用于线上选模型的路由信号,被离线复用为训练信号:训练记录被切分为预测、行动、结果三段,用预测段编排学习课程的先后顺序,用结果段锁定反复失败的能力短板,再据此动态调整下一轮的数据配比。
  3. 递归自我改进机制(RSI):包含数据端与模型端的双向循环。模型在实际执行中持续产出新轨迹,经严格筛选后沉淀为训练资产;评测暴露出的短板又被用来更新模型并注入新的测试池。官方也坦承,当前版本验证的是一次”执行—评估—选择—更新”的单轮闭环,距离完整的持续自我进化还有距离。

NeoHorse-1ModelScope 上的 TokenRhythm/NeoHorse-1-4B 模型主页

如何使用NeoHorse-1:从下载权重到起一个本地服务

NeoHorse-1 的部署路径对熟悉开源模型的开发者来说相当常规,整体分为三步:

  1. 下载模型权重:先通过 pip 安装 ModelScope 命令行工具,再用下载命令把 4B 或 9B 权重拉取到本地目录,两者按显存与任务复杂度任选其一。
  2. 启动推理服务:可选用 SGLang 或 vLLM 拉起服务,启动时合理配置上下文长度以及推理解析、工具调用解析等参数即可,服务默认以 OpenAI 兼容接口对外暴露。
  3. 接入业务代码:使用 OpenAI 兼容的 SDK,把 base_url 指向本地服务端口,就能像调用普通大模型 API 一样使用 NeoHorse-1。

需要注意的一点是:实际可用的上下文长度与显存直接挂钩。官方提示,如果硬件资源紧张,可以适当调低上下文长度来保证服务平稳运行。

NeoHorse-1的使用场景

围绕工具调用、规划、深搜、代码四项能力,NeoHorse-1 适合嵌入各类智能体产品与自动化流程:

  1. 自动化办公助手:处理日程调整、数据整理、报表生成等多步骤的职场任务,把跨工具的长流程交给模型托管执行。同类产品中,天工超级智能体Coze智能体 提供了更偏平台化的搭建方式,适合不想自己管模型的团队。
  2. 深度调研与信息检索:多轮主动检索、交叉验证并输出带证据链的结论,适合做带引用的调研报告。AutoGLM 沉思 – AI智能体 也是这一方向的代表,可以对比使用。
  3. 软件工程与代码代理:在开发流程中完成写码、跑测试、读报错、修复的闭环,配合 Trae智能体 这类编程助手产品,可以进一步压缩交付周期。
  4. 企业级智能体底座:以本地私有化部署的形式充当企业 Agent 平台的执行模型,数据不出内网。需要开箱即用平台方案的,可以了解 百贝AI-企业级智能体平台ArkClaw智能体

NeoHorse-1核心参数速览

项目说明
模型版本4B 与 9B 两个参数规模,BF16 精度
上下文长度原生 262,144 tokens,可扩展至约 1,010,000 tokens
训练方式Agent-Native 后训练:Harness 轨迹 + 路由信号课程 + 递归自我改进闭环
能力覆盖工具调用、任务规划、深度搜索、代码生成
部署方式ModelScope CLI 下载权重,SGLang / vLLM 起服务,OpenAI 兼容 SDK 调用
获取渠道GitHub 仓库与 ModelScope / Hugging Face 模型页公开可下载

NeoHorse-1的常见问题解答

NeoHorse-1 和通用对话大模型的区别在哪里?
通用模型主要面向问答与对话,而 NeoHorse-1 用 Routing Harness 的真实执行轨迹做后训练,训练目标直接指向”把任务做完”,因此在工具调用、多步规划、检索与代码修复等执行型任务上表现更稳。
应该选 4B 还是 9B 版本?
如果显存有限、任务以常规工具调用和流程执行为主,4B 是性价比更高的选择;如果任务涉及更复杂的推理与长程规划,且硬件条件允许,9B 的表现上限更高。两个版本的部署方式一致,可以按需切换。
长上下文配置对硬件有什么要求?
原生上下文为 262,144 tokens,可扩展到约 101 万 tokens,但实际可用额度与 GPU 显存直接相关。官方建议在显存受限时适当调低上下文长度,以保证推理服务稳定运行。

NeoHorse-1官网网址

代码仓库:https://github.com/TokenRhythm/NeoHorse

模型下载:https://www.modelscope.cn/models/TokenRhythm/NeoHorse-1-4B

OpenI AI时代点评

Agent 模型训练最头疼的问题之一,是”执行经验进不了参数”:模型每天在真实环境里跑任务,踩过的坑和修复路径都留在日志里,下一轮训练却用不上。NeoHorse-1 的价值在于把这条断路接上了——路由 Harness 的结构化轨迹直接成为训练语料,路由信号一物两用,在线负责派单、离线负责排课程,”评测反馈 → 数据配比 → 模型更新”的闭环也因此有了工程化的载体。对小参数模型”用训练换参数”的思路,它给出了一个可复现的验证样本。

当然,官方自己也把话说得很克制:目前验证的只是一轮 RSI 闭环,信号设计和训练流程仍由人工设定,多代模型能否持续拿到稳定增益还有待观察。对开发者的建议是,先在真实业务里小规模试用 4B 版本,验证它在自己的工具链和任务分布上的表现,再决定是否引入生产环境。想深入了解训练细节的,可以前往 NeoHorse 代码仓库 查阅技术报告与模型卡。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...