HarnessEval

AI工具53分钟前更新 AI工具集
0 0 0

HarnessEval – MirroS 联合清北、英伟达等推出的评测系统

在人工智能领域,如何科学、客观地衡量大模型的表现始终是一个核心挑战。传统的静态基准测试往往只能给出冷冰冰的数字,难以揭示模型决策背后的逻辑。为了解决这一痛点,MirroS 联合清华、北大、加州大学伯克利分校、麻省理工学院以及英伟达等全球顶尖科研机构,共同推出了具有里程碑意义的评测系统——HarnessEval。

HarnessEval 的核心创新在于将“评测”本身智能化、Agent 化。它不再是机械地套用固定公式,而是模拟人类专家“观察、思考、验证”的完整思维过程。当面对一个评测案例时,系统会启动一套动态规划机制:首先深入分析任务目标,从内置的技能库(Skill Library)中精准匹配适用工具;随后将复杂的评测课题拆解为一个个细小的、可验证的子问题;通过调用专业的诊断工具搜集证据,最终构建出一棵逻辑严密、清晰可溯的“证据树”(Evidence Tree)。这一过程让评测结果从单一的黑盒分数,转变为可解释、可复现、可追责的智能工作流。目前,该系统的首个落地项目 HarnessEval-W 已成功应用于交互式世界模型的深度评测。

HarnessEval 具备一系列独特的功能优势,使其在同类工具中脱颖而出:

  • 智能化动态规划:拒绝“一刀切”,系统会根据每个评测案例的特定上下文,量身定制评测路径。
  • 灵活的技能路由:根据任务需求从技能库中调用最匹配的模块,避免无效指标带来的资源浪费。
  • 精细化问题拆解:通过将宏观问题下钻,确保每一个维度都能得到精确测量。
  • 多维证据搜集与验证:利用子智能体(sub-agent)从视觉、逻辑等多个维度获取证据,并由主智能体进行全局审视,确保结论的权威性。
  • 证据树输出机制:完整记录评测中的工具调用、推理逻辑与视觉证据,让每一分都有据可查。
  • 持续进化的技能库:内置九大核心技能模块,并支持随技术迭代动态扩展,确保评测能力始终处于前沿。
  • 自动化案例构建:基于科学的场景分类标准,自动生成评测所需的世界模型、动作序列及验证逻辑。

在技术架构上,HarnessEval 构建了严谨的四层 Agentic 工作流,即“规划(Plan)—路由(Route)—拆解(Decompose)—验证(Verify)”。这种分层协作模式,由主智能体负责宏观统筹,各专项技能智能体负责执行,确保了复杂评测任务的高效完成。与传统工具相比,HarnessEval 的核心差异在于其对“物理因果”和“交互逻辑”的深度洞察,它不仅关注视觉画面是否美观,更关注世界模型在动作输入下的状态转移是否符合物理规律、是否具备长期的因果一致性。

HarnessEval 的应用前景十分广阔,涵盖了从交互式世界模型到具身智能机器人,再到自动驾驶仿真与游戏场景生成等多个领域。对于 Sora、Kling 等视频生成模型而言,它更像是一位“质量诊断医生”,能够精准定位模型在处理目标漂移、物理违规或场景不一致时的具体病灶。

如果您希望深入了解或参与该项目,欢迎访问其官方博客(https://mirros.ai/blog/harnesseval)或直接查阅 GitHub 代码仓库(https://github.com/mirros-lab/harnesseval-w)。通过简单的环境配置与数据准备,开发者即可通过几行命令开启高效、透明的智能评测之旅。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...