LoHoSearch

AI工具9小时前更新 AI工具集
0 0 0

LoHoSearch – 美团推出的下一代搜索智能体评测基准

LoHoSearch:下一代搜索智能体评测新标杆

在人工智能飞速发展的今天,搜索智能体的能力日益受到关注。为了更准确地衡量这些智能体在复杂信息检索和推理方面的真实水平,美团 LongCat 团队重磅推出了 LoHoSearch——一个创新性的下一代搜索智能体评测基准。它巧妙地利用覆盖 762 万实体和 2.65 亿条关系边的庞大知识图谱,实现了题目生成自动化,彻底告别了传统依赖人工出题的模式。

LoHoSearch 究竟是什么?

LoHoSearch 不仅仅是一个评测基准,更是对现有搜索智能体能力的一次深度挑战。它基于一个规模宏大的知识图谱,该图谱囊括了 762 万个实体,并连接着 2.65 亿条关系边。这个知识图谱为自动生成高质量的评测题目提供了坚实的基础,有效克服了人工出题在规模和难度上的局限性。LoHoSearch 收录了 544 道经过人工严格校验的高质量题目,它们广泛覆盖了音乐、影视、地理等 11 个领域。为了制造真正的挑战,LoHoSearch 在题目设计上巧妙地操纵了搜索空间和结构复杂度这两个关键维度。即使是当前最先进的模型 GPT-5.5,在 LoHoSearch 上的准确率也仅为 34.74%,这与它在 BrowseComp 基准上 90% 以上的优异表现形成了鲜明对比。这充分说明 LoHoSearch 在长程搜索推理和上下文管理方面提供了更具区分度的评测标准。

LoHoSearch 的核心亮点

  • 知识图谱驱动的自动化建图:以完整的英文为数据源,构建了一个极其庞大的知识图谱,包含 762 万个实体节点和 2.65 亿条有向边。每个实体都经过 Wikidata 类型和入度热度的标注,为全局视角的题目设计奠定了基础。
  • 双维度难度调控:通过精细地调整搜索空间和结构复杂度这两个正交维度,LoHoSearch 能够系统性地控制题目难度,突破了传统人工出题在认知上的瓶颈。
  • 多样化的子图采样策略:LoHoSearch 采用树结构和图结构两种采样方式。树结构通过放大搜索空间来增加难度,而图结构则在庞大的搜索空间之上叠加了环形依赖和交叉约束,显著提升了结构复杂度。
  • 题目生成与验证的自动化流程:从知识图谱的子图中抽取描述,并利用大模型将其改写为自然语言题目。整个流程经过关系提取、子图覆盖检查、答案满足度验证等多重自动筛选,并辅以人工复核,确保了题目的高质量。
  • 全面的多模型性能评测:LoHoSearch 支持对各类主流搜索智能体进行标准化评测,能够输出准确率、工具调用次数、校准误差等关键指标,直观地反映出模型在长程推理任务中的表现。

LoHoSearch 的技术基石

  • 知识图谱的自动构建机制:利用海量的英文内容,提取 762 万个实体页面作为节点,并将正文中的 2.65 亿条超链接转化为有向边,构建了一个覆盖广泛的全局知识网络。每个实体都附带 Wikidata P31 类型和入度热度信息。
  • 难度定义的创新性:将题目难度量化为“搜索空间”和“结构复杂度”两个且正交的维度,从而克服了人工评估的主观性和局限性。
  • 树结构子图的采样设计:通过从单一答案节点向下扩展多条分支,每条分支代表一个高候选空间内的约束条件,指数级地增加了排除成本,从而提高了搜索难度。
  • 图结构子图的复杂性构建:在广阔搜索空间的基础上,引入了多节点之间的环形依赖和交叉约束。求解过程需要同时满足多组相互关联的条件,层层叠加的结构复杂度构成了严峻的挑战。
  • 关系提取与自然语言生成技术:从采样的子图中提取实体描述,并利用大模型进行润色和改写,生成连贯的自然语言问题,确保题目能够完整地传达原始子图中的关系信息。

如何运用 LoHoSearch

  • 轻松加载数据集:您可以通过 datasets 库便捷地加载 meituan-longcat/LoHoSearch,获取包含 544 道题目及其标准答案的数据集。
  • 深入解析数据结构:数据集不仅提供题目文本,还包含对应的子图结构、领域标签,以及经过知识图谱校验的唯一答案。
  • 高效接入评测流程:将题目输入您待测的搜索智能体,并详细记录其推理过程和最终输出。
  • 自动化评分与分析:与数据集中的标准答案进行比对,验证模型输出是否满足所有约束条件,并统计准确率。
  • 精细化对比分析:利用数据集中提供的子图复杂度与领域标签,您可以针对性地分析模型在不同难度级别和主题下的表现差异。

LoHoSearch 的核心优势

  • 打破人工出题的局限:与传统人工基准不同,LoHoSearch 依托全局知识图谱,能够系统性地识别具有高搜索空间和高结构复杂度的“硬骨头”题目,远超人工标注者的认知范围。
  • 显著提升的挑战难度:在 LoHoSearch 上,同一模型(GPT-5.5)的准确率从 BrowseComp 的 58.84% 急剧下降至 10.02%,平均工具调用次数从 35 次飙升至 61 次,挑战强度提升高达 74%。
  • 更强的模型区分度:在 LoHoSearch 上,上下文管理策略的提升幅度仅为 6.8%,远低于在 BrowseComp 上的 14.03%,这更真实地反映了策略在长程复杂场景下的实际边际效益。
  • 结构复杂度可量化:图结构题目的准确率(8.01%)明显低于树结构题目(11.89%),这有力地证明了结构复杂度是于搜索空间之外的额外难度来源,并且可以被单独衡量。

LoHoSearch 项目资源

LoHoSearch 与同类竞品对比

维度LoHoSearchBrowseComp
出题方式知识图谱自动化生成 + 人工核验人工设计
题目数量544 道数百道
覆盖领域11 个领域(音乐、影视、地理等)未明确分领域
难度控制搜索空间 + 结构复杂度双维度人工主观控制
最强模型准确率GPT-5.5:34.74%GPT-5.5 Pro:90.1%
工具调用中位数59 次26 次
上下文策略提升+6.8%+14.03%
饱和状态远未饱和,区分度高已接近饱和
适用场景长程搜索推理、上下文管理评测基础搜索能力评测

LoHoSearch 的应用场景

  • 搜索智能体能力评估:为那些具备长程推理能力的搜索 Agent 提供一个高难度的标准化测试平台,从而精准地定位模型在复杂信息检索链条中的薄弱环节。
  • 上下文管理策略验证:有效评估 Summary、Discard-all、Verify 等上下文压缩与验证策略在超长交互场景下的真实收益,避免在简单基准上对策略效果产生过度高估。
  • 模型迭代的对标工具:为研究团队提供一个尚未饱和的评测标准,有力地支撑模型版本迭代过程中的能力边界探测和性能对比分析。
  • 搜索算法前沿研究:为需要多步推理、交叉验证的复杂搜索算法研究提供一个难度可控的数据集和评测框架。
  • 智能体产品选型参考:帮助企业在选择搜索智能体解决方案时,通过 LoHoSearch 能够清晰地区分不同模型在真实复杂查询场景下的实际表现。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...