自动化、可复现，基于大语言模型群体智能的多维评估基准Decentralized Arena来了

AIGC动态2年前 (2024)发布机器之心

AIGC动态欢迎阅读

原标题：自动化、可复现，基于大语言模型群体智能的多维评估基准Decentralized Arena来了
关键字：模型,报告,维度,问题,基准
文章来源：机器之心
内容字数：0字

内容摘要：

AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年，机器之心AIxiv专栏接收报道了2000多篇内容，覆盖全球各大高校与企业的顶级实验室，有效促进了学术交流与传播。如果您有优秀的工作想要分享，欢迎投稿或者联系报道。投稿邮箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.comMaitrix.org 是由 UC San Diego, John Hopkins University, CMU， MBZUAI 等学术机构学者组成的开源组织，致力于发展大语言模型 (LLM)、世界模型 (World Model)、智能体模型 (Agent Model) 的技术以构建 AI 驱动的现实。Maitrix.org 此前成功开发了 Pandora 视频-语言世界模型、LLM Reasoners，以及 MMToM-QA 评测（ACL 2024 Outstanding Paper Award）。
研究者们已经并陆续构建了成千上万的大规模语言模型（LLM），这些模型的各项能力（如推理和生成）也越来越强。因此，在多样的应用场景中对其进行性能基准测试已成为了

原文链接：自动化、可复现，基于大语言模型群体智能的多维评估基准Decentralized Arena来了