LongCat-2.0

AI工具2个月前更新 AI工具集
25 0 0

LongCat-2.0 – 美团开源的新一代万亿参数语言模型

LongCat-2.0:美团重磅开源的万亿级 MoE 语言模型,引领长上下文处理新纪元

美团近期发布了其自主研发的重磅开源项目——LongCat-2.0,这是一款拥有惊人 1.6 万亿总参数的超大规模 MoE(混合专家)语言模型。其核心亮点在于每 token 激活约 480 亿参数,并且在强大的 AI ASIC 超算集群上完成了训练与部署,为人工智能领域带来了新的突破。

LongCat-2.0 究竟是什么?

LongCat-2.0 不仅仅是一个参数庞大的语言模型,它更是美团在人工智能领域深耕的结晶。这款模型拥有 1.6 万亿的总参数量,但其精妙之处在于“稀疏激活”的 MoE 架构,使得每次处理 token 时仅激活约 480 亿参数,在保证强大能力的同时,显著提升了计算效率。模型的一大突破性进展是原生支持高达 100 万 token 的超长上下文,这得益于其创新的 LongCat Sparse Attention(LSA)稀疏注意力机制和 N-gram Embedding 架构。这些技术创新使得 LongCat-2.0 在代码生成、Agent 任务执行以及复杂推理等领域展现出卓越的性能,并已与 Claude Code、OpenClaw、Hermes 等业界主流工具实现了深度集成。

LongCat-2.0 的核心能力有哪些?

  • 卓越的长文本理解能力:LongCat-2.0 能够一次性处理多达 100 万 token 的超长上下文,这意味着它可以完整地“阅读”整个代码库或海量文档,实现精准的定位和深度分析,彻底告别了传统模型在处理长文本时容易出现的“中间遗忘”现象。
  • 高效的代码生成与重构:凭借其 Agentic Coding 能力,LongCat-2.0 能够对整个代码仓库进行深入分析,梳理跨文件的逻辑,甚至支持架构迁移和功能重构,并且生成的代码能够实现一次编译通过。
  • 自主的 Agent 执行引擎:深度整合了 Claude Code、OpenClaw、Hermes 等领先的 AI 开发框架,LongCat-2.0 能够自主规划多步骤任务,灵活调用各种工具,进行 API 交互,并具备强大的错误自纠正能力。
  • 强大的多语言代码处理能力:模型能够跨越语言障碍,理解和生成多种编程语言的代码,支持中英等多种语言的编程场景下的代码迁移和审查工作。
  • 智能化的信息搜索与检索:内置强大的搜索和浏览功能,能够应对复杂的信​​息检索需求,进行多跳推理,并整合跨网页的内容,满足严谨的研究型任务。
  • 自然语言数据查询:业务人员无需编写复杂的 SQL 语句,可以直接使用自然语言向数据库提问,模型将自动完成意图解析、SQL 生成、执行以及结果洞察输出。

想要第一时间了解 AI 开源的最新动态?请关注微信公众号,回复“开源”即可加入 AI 开源项目交流群。

LongCat-2.0 背后的技术引擎

  • MoE 稀疏化架构的精妙之处:LongCat-2.0 采用了总参数量高达 1.6 万亿的混合专家(MoE)架构,但每 token 的激活参数量仅为约 480 亿。这种稀疏激活机制在庞大的参数规模和高效的计算之间取得了完美的平衡。
  • LongCat Sparse Attention (LSA) 的突破:LSA 引入了流式感知索引(SI)、跨层索引(CLI)和分层索引(HI)三大创新组件,成功将长上下文注意力计算的复杂度从平方级降低到线性级,彻底解决了处理百万 token 上下文时的性能瓶颈。
  • N-gram Embedding 的增强表征:通过集成 5-gram 嵌入模块,LongCat-2.0 将嵌入空间扩展了约 100 倍,能够更精细地捕捉 token 组合所蕴含的丰富局部上下文信息,极大地提升了模型的表征能力。
  • 零计算专家 + ScMoE 的动态资源分配:模型能够根据 token 的复杂度动态分配计算资源。对于简单的 token,它们会被路由到“零计算专家”以避免不必要的计算消耗;而对于复杂的 token,模型则会自动分配更多的专家资源进行处理。
  • MOPD 多专家融合的后训练策略:通过 Multi-Teacher On-Policy Distill(MOPD)架构,模型将 Agent Experts、Reasoning Experts 和 Interaction Experts 三类专家组进行了深度融合。门控网络能够根据具体的任务类型,动态调度最适合的专家组合。
  • 6D 并行训练的效能提升:在标准的张量并行(TP)、算子并行(CP)、专家并行(EP)、数据并行(DP)和流水线并行(PP)基础上,LongCat-2.0 创新地增加了嵌入并行(EMBP),并结合 Superpod 物理集群架构,实现了超大规模模型的高效训练。

如何体验 LongCat-2.0 的强大能力?

  • 在线即时体验:用户可以直接访问 LongCat 官网,通过在线对话的方式直观感受模型的各项能力。
  • API 接口集成:若需将 LongCat-2.0 集成到自有应用或 Agent 框架中,可登录 https://longcat.chat/platform/product 获取 API Key,轻松实现对接。
  • 与主流工具无缝集成:LongCat-2.0 可直接作为底层模型驱动 Claude Code、OpenClaw、Hermes 等主流 AI 开发工具链,为开发者提供更强大的支持。

LongCat-2.0 的核心优势一览

  • 国产算力全链路验证:LongCat-2.0 是业界首个在五万卡国产算力集群上完成万亿参数模型全流程训练与推理的范例,有力地证明了非 NVIDIA 平台在超大规模模型训练中的可行性。
  • 百万级上下文处理能力:凭借 100 万 token 的原生上下文窗口和 LSA 稀疏注意力机制,LongCat-2.0 能够实现对长文本的精准定位和深度理解,彻底解决了“中间遗忘”的问题。
  • Agentic Coding 专属优化:模型在代码理解、生成和执行方面进行了深度优化,在 SWE-bench、Terminal-Bench 等权威评测中,其表现已超越 Gemini 3.1 Pro 和 GPT-5.5。
  • 动态计算资源分配:通过零计算专家和 ScMoE 架构,LongCat-2.0 实现了 token 级别的动态激活(33B~56B),确保简单 token 不消耗算力,复杂任务则获得更多资源支持。
  • 三类专家融合的智能调度:MOPD 架构成功融合了 Agent、Reasoning 和 Interaction 专家组,门控网络能够根据任务需求动态调度,兼顾了执行、推理和交互的综合体验。
  • 全球开发者的高度认可:其预览版通过 OpenRouter 开放调用后,月调用量迅速跻身全球前三,在 Hermes、Claude Code、OpenClaw 等工具中均位列前茅,显示了其在全球开发者社区中的强大吸引力。

LongCat-2.0 的项目入口

  • 项目官方网站:https://longcat.chat/blog/longcat-2.0/
  • GitHub 代码仓库:https://github.com/meituan-longcat/LongCat-2.0
  • HuggingFace 模型库:https://huggingface.co/meituan-longcat/LongCat-2.0

LongCat-2.0 与同类竞品深度对比

对比维度LongCat-2.0DeepSeek-V3
发布方美团DeepSeek
总参数1.6 万亿 (MoE)6710 亿 (MoE)
激活参数~480 亿 / token~370 亿 / token
上下文长度1M (100万) tokens64K-128K tokens
训练硬件五万卡国产算力集群NVIDIA GPU 集群
注意力机制LongCat Sparse Attention (LSA)Multi-head Latent Attention (MLA)
嵌入优化N-gram Embedding (5-gram, 135B)标准嵌入层
后训练架构MOPD 多专家融合 (Agent/Reasoning/Interaction)标准 SFT + RL
代码能力 (SWE-bench Pro)59.5~50+

LongCat-2.0 的应用场景拓展

  • 大规模代码迁移与重构:模型能够一次性读取整个代码库和迁移文档,自动映射架构,将插件重构至新的 SDK,同时保留原有功能并修复潜在的 Bug。
  • 全仓库代码审查与优化:基于 100 万 token 的上下文理解能力,LongCat-2.0 可以深入分析整个项目结构,进行跨文件 Bug 检测、性能优化建议以及架构改进。
  • AI Agent 的底层驱动:作为 Claude Code、OpenClaw 等框架的底层模型,LongCat-2.0 能够驱动它们执行复杂的多步骤任务和自主调用工具。
  • 海量长文档的深度分析与生成:模型能够处理百万字级别的技术文档、学术论文、研究报告等,进行精准的深度摘要、智能问答和内容改写。
  • 数据查询与洞察的智能化:业务人员能够以自然语言直接查询数据库,模型将自动完成 SQL 生成、执行以及对结果的深度解读,提供有价值的洞察。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...