MineExplorer – 美团推出的开放世界分钟级长程任务评测基准
美团LongCat团队倾力打造的MineExplorer,作为首个立足于Minecraft的开放世界长程任务评测基准,现已问世。它包含813个经过人工严谨验证的1至4跳实例,任务设计巧妙,隐藏了前置条件,并且不直接罗列依赖关系图,旨在激发模型自主推断子任务的能力。
MineExplorer:开放世界智能体评测的新标杆
MineExplorer由美团LongCat团队匠心推出,是首个以Minecraft为载体的、针对开放世界分钟级长程任务的评测基准。该基准集囊括了813个由人工精心验证的、包含1至4个“跳”(即步骤或依赖关系)的实例。其任务设计的一大亮点在于,前置条件被隐藏起来,同时指令中并不直接列出任务的依赖图谱,这迫使接受评测的模型必须具备自主推断复杂子任务的能力。MineExplorer的独特之处在于,它刻意剥离了Minecraft游戏特有的专业知识,转而专注于评估模型通用的动态探索能力。此外,该项目还配套了由五大智能体协作完成的数据合成框架,以及一套规则化的里程碑自动评测体系,其源代码和数据集均已面向公众开源。
MineExplorer的核心亮点
- 分钟级动态开放世界评测:以高度仿真的Minecraft实时3D沙盒环境为基础,每个评测任务模拟1800个环境步。模型需要在动态变化的画面中,持续地调整和优化其策略。
- 隐含多跳任务与隐藏前置条件:提供813个经过人工验证的、包含1至4个跳跃步骤的实例。指令中仅呈现最终目标,而相关的子任务和依赖关系则被巧妙地隐藏,模型需要自行推断出完整的任务依赖图。
- 知识解耦的评测设计:主动剔除了Minecraft游戏固有的专业机制,仅保留那些依赖于通用世界常识的任务,确保评测的公平性和普遍性。
- 流程化的自动评测体系:将复杂的子任务转化为可自动执行的“里程碑检查器”,从而实现无需人工干预的自动评分,大大提高了评测效率和可重复性。
- 多智能体协同的数据生成:采用五种专业智能体协同工作的方式,自动生成任务数据。这一流程涵盖了任务选择、场景设计、里程碑设定、专家审查与验证等全环节,确保了数据的多样性和高质量。
MineExplorer的技术基石
- 动态交互式环境架构:评测所用的环境并非静态图像,而是实时的物理沙盒。模型每执行一个动作,世界状态都会即时更新,模型需要基于最新的观测信息进行持续的决策。
- 隐式有向无环图(DAG)任务建模:每个复合任务被定义为一个四元组 τ=(q,s₀,Gτ,Mτ),其中 Gτ 代表任务的依赖图。其关键创新在于,指令 q 并不枚举 DAG 中的所有节点,而是要求智能体通过与环境的交互来推断出隐藏的前置任务。
- 多智能体协作式造题流程:由一个“协调者”(orchestrator)控制五个专业智能体(任务选择器、场景设计师、里程碑设计师、Minecraft专家、验证器)在群聊模式下协作。该流程分为初始化和辩论两个阶段,旨在生成初稿并进行修订,相比单智能体的效率提升了约30%。
- 知识过滤机制:利用大型语言模型(LLM)作为裁判,对每个原子任务进行领域知识判断,区分通用世界常识与Minecraft专有机制。以此来过滤掉那些高度依赖游戏专属知识的任务,从而专注于评测模型的通用能力。
- ReAct能力拆解框架:借鉴ReAct(Reasoning + Acting)范式,将开放世界探索能力系统性地分解为感知、推理、行动三个核心维度,并细分为14项精细化评估指标。
关注微信公众号,回复“开源”,即可加入AI开源项目交流群。
如何上手MineExplorer
- 环境部署:首先,将GitHub仓库克隆至本地,并确保已安装Python 3.9或更高版本,以及Minecraft相关的运行环境。
- 启动评测环境:配置并启动Minecraft沙盒服务端,确保评测环境能够实时运行,并能够接收模型的动作指令。
- 执行基准评测:加载MineExplorer提供的813个验证实例,将待测的多模态模型接入环境。模型将根据实时画面输出一系列动作序列。
- 自动评分流程:评测结束后,系统将自动调用规则化里程碑检查器。基于背包物品、坐标区域等量化指标,计算出TSR(Task Success Rate)与MSR(Multi-hop Success Rate)得分。
- 自定义任务生成:运行多智能体数据合成脚本,根据设定的任务跳数,由五个协作智能体自动生成包含隐藏前置条件的新任务实例。
- 训练与模型迭代:将生成的新任务作为训练数据输入模型,并在Minecraft沙盒中反复进行探索-反馈循环,以逐步提升模型的开放世界长程规划能力。
- 查阅评测结果:评测报告将自动输出各维度得分,并支持按模型类型和难度进行分层对比。
MineExplorer的独特优势
- 首创分钟级开放世界评测:基于实时运行的Minecraft 3D沙盒,模型需要在长达3分钟的动态交互中完成持续决策。
- 隐藏前置的多跳任务设计:指令仅提供最终目标,不枚举依赖图,模型进行自主推断隐藏子任务。
- 知识解耦的评测原则:主动剥离Minecraft的专有机制,侧重于评估模型对通用世界常识的运用能力。
- 多智能体高效造题机制:通过五个智能体的协作,实现高效的任务生成,相比单智能体效率提升约30%,并且支持1至12跳的自定义任务扩展。
- 规则化的自动评测:将子任务转化为可自动执行的里程碑检查器,实现无需人工标注即可量化评分,保证了结果的可复现性。
MineExplorer的项目入口
- GitHub代码库:https://github.com/meituan-longcat/MineExplorer
- arXiv技术论文:https://arxiv.org/pdf/2605.30931
MineExplorer与同类竞品深度对比
| 对比维度 | MineExplorer | MineDojo |
|---|---|---|
| 评测目标 | 评估通用开放世界探索能力,主动剥离游戏特有知识。 | 评估具身智能体在Minecraft中完成任务及利用互联网知识的能力。 |
| 任务设计 | 1-4跳的隐藏前置多跳任务,指令不枚举依赖图,需模型自主推断。 | 数千个程序化及创意任务,指令明确给出目标和具体步骤。 |
| 知识来源 | 仅依赖通用世界常识,主动过滤Minecraft Wiki中的机制。 | 深度整合YouTube视频、Wiki、Reddit等海量游戏知识库。 |
| 数据合成 | 五智能体协作自动生成任务,效率提升约30%。 | 基于互联网多模态数据自动构建任务和奖励函数。 |
| 评测方式 | 规则化里程碑自动检查器,覆盖感知/推理/行动共14项指标。 | 程序化任务通过模拟器状态判定,创意任务则由MINECLIP视频模型评分。 |
| 开源侧重 | 评测基准与可扩展的训练环境,支持1-12跳自定义任务。 | 训练框架与评测套件,强调从互联网知识中学习可泛化技能。 |
MineExplorer的应用前景
- 多模态大模型能力评测:为Claude、GPT、Gemini等顶尖多模态大语言模型(MLLM)提供了一个标准化的平台,用于评测其在动态开放世界中的长程规划与推理能力。
- Agent训练的理想环境:作为Minecraft沙盒内的训练场,它支持模型在持续交互中不断提升其感知-推理-行动闭环能力。
- 模型选型的权威参考:为业界提供了一个开放世界探索能力横向对比的排行榜,有助于辅助模型选型和评估其能力边界。
- 推动前沿学术研究:促进在长程推理、隐式任务分解、视觉引导(visual grounding)以及行动对齐(action alignment)等前沿研究方向上的深入探索。
- 具身智能的预研与验证:为机器人、自动驾驶等真实物理世界应用提供了一个低成本、高效率的能力验证沙盒。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


