Longcat-2.5-preview 是什么:美团推出的新一代大模型
Longcat-2.5-preview(官方模型代号写作 LongCat-2.5-Preview)是美团近期正式发布的新一代大模型。它继承了前代 LongCat-2.0 的架构基因,延续了 1.6 万亿总参数量、约 480 亿激活参数、100 万 token 超长上下文这一组核心规格;在此基础上,2.5 版本实现了关键的代际跃迁——首次引入原生多模态处理机制,并能够面向终端、浏览器、桌面软件等真实计算环境执行长流程任务。目前官方接口已经上线,同时兼容 OpenAI 与 Anthropic 两大主流调用标准,最大单次输出可达 128K tokens,可以直接无缝对接 Codex、OpenClaw、Claude Code 等各类 Agent 开发工具,现有工作流几乎可以零成本迁移。
要理解这次更新的分量,需要先看清它改了什么、没改什么。没改的是底座规模:1.6T 总参数配合 MoE 稀疏激活,每次推理只唤醒约 48B 参数,这个“大容量、低开销”的组合被完整保留下来,说明美团对 2.0 代的架构判断是成功的,2.5 不需要推倒重来。改的是能力边界:从纯文本(或者说以文本为核心)走向原生多模态,从“能写代码、能回答问题”走向“能操作终端、能浏览网页、能使用桌面软件完成一整条任务链”。前者是模型能力的扩展,后者是模型形态的转变——它不再只是一个被调用的接口,而是一个可以被派活的智能体。
对于开发者来说,最实际的变化有两个:一是图片可以直接喂进基座,视觉理解不再是外挂模块的拼接结果,而是与文本在同一空间内联合训练出来的原生能力;二是接入成本被压到极低,官方同时提供 OpenAI 与 Anthropic 两种协议端点,绝大多数现有 Agent 工具只需要改一个 base_url 和一个模型名就能跑起来。这两点叠加,让 LongCat-2.5-Preview 成为国产大模型里少见的“既旗舰、又好接”的选择。
LongCat 官方平台页面(longcat.ai/platform),模型列表与控制台入口
Longcat-2.5-preview 的命名与代际定位
从命名上看,LongCat-2.5-Preview 中的 “2.5” 表明它是 2.0 与下一代之间的中间版本,而 “Preview” 则明确说明这是一个预览版本:能力已经开放、接口已经可用,但产品形态与能力边界仍在快速演进中。这个定位很重要,因为它直接解释了官方资料里那些“暂时性的空白”——例如目前暂无官方跑分数据公示、GUI Agent 能力仍处于起步开拓阶段。对于预览版,这些都不算缺陷,而是版本阶段的客观描述。
在代际关系上,官方表述是“继承了前代 LongCat-2.0 宏大的架构基因”。这句话包含三个具体的可验证事实:总参数量 1.6 万亿、激活参数约 480 亿、上下文长度 100 万 token。三者被完整沿用,说明 2.5 的升级不是靠堆规模实现的,而是靠架构与训练方式的改进。这一点在当前的大模型行业里其实相当罕见——大多数换代伴随着参数暴涨,而 LongCat-2.5-Preview 选择在同一规模下做能力增量,意味着它的工程重心放在了“如何让既有算力产出更多能力”上。
值得注意的是,官方在描述 2.5 版本时反复使用了“原生”二字——原生多模态、多模态原生融入基座。这两个字是理解这次升级的钥匙。在多模态大模型的发展过程中,“原生”与“拼接”代表着两条截然不同的技术路线:拼接路线先训好一个强文本模型,再想办法把视觉能力接上去,优点是见效快、风险低,缺点是模态之间存在表示鸿沟,遇到需要精细跨模态对齐的任务时容易露怯;原生路线则从预训练阶段就让文本与视觉在同一空间里共同学习,前期投入大,但能力上限更高。LongCat-2.5-Preview 明确选择后者,意味着它把这次升级的赌注压在了长期能力上,而不是短期功能清单上。
还有一个细节值得单独说明:官方给出的模型代号写作 LongCat-2.5-Preview,采用驼峰式大小写,调用时必须严格按这个写法填写模型名。这一点看似琐碎,但在实际接入时是不少人踩的第一个坑——模型名大小写或连字符写错,通常只会得到一个“模型不存在”的报错,很容易被误判成密钥或端点配置问题。因此在正式写代码之前,建议先在网页端的模型列表里确认一次准确的代号写法,再把它填进 SDK 或环境变量。
再看它与美团整体技术体系的关系。LongCat 系列是美团自研的大模型品牌,其设计取向从一开始就带有明显的业务牵引特征:美团拥有庞大的本地生活服务场景,涉及大量图文混排内容、海量日志数据、复杂的流程调度,这些业务特点恰好对应了 2.5 版本主打的三项能力——多模态理解、超长上下文、长流程 Agent 执行。换句话说,LongCat-2.5-Preview 的能力选型并不是为了在榜单上刷分,而是为了覆盖真实业务里那些“需要模型自己把一件事从头做到尾”的任务。
Longcat-2.5-preview 的核心功能
按照官方介绍,LongCat-2.5-Preview 的核心功能可以归纳为以下五个方面,每一项都对应着 2.5 版本相对前代的具体增量。
- 视觉多模态认知:突破性地加入了图像解析模块,不仅能看懂画面细节,还可以实现跨模态问答、深度内容提炼以及复杂的视觉逻辑推理。这意味着你可以直接把截图、设计稿、图表、扫描件丢给模型,让它结合文字指令一起理解,而不需要先自己做一遍 OCR 或图像描述转换。
- 长链条智能体操作:擅长在终端指令、网页浏览、图形用户界面(GUI)、表格处理以及设计软件中实施自主化的长周期作业。这是从“问答模型”走向“执行模型”的关键一步——模型不再只告诉你怎么做,而是可以自己一步步把事情做完。
- 卓越的编程战力:在代码自动编写、逻辑剖析及程序开发等领域,延续了上一代 “Agentic Coding” 的强势表现。代码能力是 LongCat 系列的既有长板,2.5 版本在保持这块优势的同时,把它与多模态、超长上下文组合起来,形成了“看得懂整个仓库、也看得懂界面截图”的完整开发能力。
- 开发工具生态无缝对接:与 Claude Code、Hermes、OpenClaw、OpenCode 以及 Kilo Code 等众多行业主流开发套件高度集成。官方还专门提供了 Codex、OpenClaw、Claude Code 等工具的配置指引,这在国产模型里属于对开发者生态投入较大的一类。
- 双协议切换:API 同时支持 OpenAI 和 Anthropic 两种传输协议,最高支持 128K tokens 的输出长度,助力现有 Agent 零成本直接迁移。这一项看似是工程细节,实际影响巨大——它决定了你是需要重写接入层,还是只需要改两行配置。
把这五项能力放在一起看,会发现它们并不是五个孤立的功能点,而是围绕同一条主线展开的组合:原生多模态让模型能“看见”,长链条 Agent 让模型能“动手”,编程长板让模型能“产出”,工具生态对接让模型能“被编排”,而双协议让这一切“接得上”。缺少任何一环,这条链子都会在某一处断掉——只有视觉没有动手能力,模型仍然只是一个看图说话的问答器;只有动手能力没有编程长板,它只能在界面上点来点去却无法交付真正的工程产物;能力齐备但接不进现有工具链,则意味着用户要为了它重写一整套工作流。LongCat-2.5-Preview 的五位一体,正是为了让这条链路从头到尾贯通。
Longcat-2.5-preview 的底层技术剖析
官方对 2.5 版本的技术说明集中在四个点上:MoE 稀疏激活机制、原生多模态一体化基座、百万级上下文,以及面向 Agent 的训练理念。下面逐项展开。
第一,MoE 稀疏激活机制。LongCat-2.5-Preview 采用混合专家(Mixture-of-Experts)架构:虽然总参数高达 1.6T,但每次运算仅会唤醒约 48B 的参数。这种动态调度机制带来的是一种非常划算的交换——模型的“知识容量”由总参数决定,因此 1.6T 的体量保证了它能容纳足够广博的知识与足够细分的专家能力;而模型的“实际算力消耗”由激活参数决定,因此 48B 的激活量又把单次推理的成本压在了一个可控区间。用旗舰级的容量,花接近中型模型的开销,这就是 MoE 稀疏激活的核心价值,也是 LongCat 系列敢于在 1.6T 规模上谈性价比的底气。
第二,原生多模态一体化基座。这是 2.5 版本最重要的架构变化。以往很多多模态模型采用的是“分支拼接”路线:先有一个文本基座,再外挂一个视觉编码器,通过适配器把视觉特征投影到文本空间里。这种做法上手快,但视觉与文本之间始终隔着一层翻译,跨模态的细节对齐往往不够扎实。LongCat-2.5-Preview 的做法是把多模态特性直接根植于模型内核:文本与视觉信息在同一空间内完成联合训练。官方说明指出,这一设计传承自成熟的 DiNA(离散原生自回归)技术路线——将各类模态直接转化为离散的 token 集合进行统一编码。也就是说,图像在模型眼里并不是一段被压缩后的特征向量,而是和文字一样的 token 序列,两者共享同一套自回归建模方式。这种统一带来的好处是跨模态推理不再需要额外的桥接,图文之间的细粒度对应关系可以被模型直接学习到。
第三,百万级上下文。LongCat-2.5-Preview 标配 1M token 的超大上下文窗口,单次输入便可完整吞下超长篇幅文档、庞大工程源码、海量系统日志或多维度复杂任务。官方把这称为长程 Agent 多步推演的“坚实记忆基石”。这个说法是准确的:Agent 在执行长流程任务时,每一步的动作、观察、错误与修正都需要留在上下文里,几十轮的交互很快就能吃掉数十万 token。如果上下文不够,系统就不得不做压缩或外部检索,而这恰恰会引入信息丢失与上下文割裂。1M 的余量意味着在绝大多数任务里,你不需要在“记住全部”和“继续执行”之间做取舍。官方同时将其定位为国产智算集群在超大参数与长文本平衡上取得的重大工程突破——在 1.6T 参数规模下还能维持 100 万上下文,本身就是一个不小的工程挑战。
把这三项技术放在一起看,会发现它们之间存在明确的相互支撑关系:没有 MoE 稀疏激活,1.6T 的参数规模在推理成本上根本不可行;没有 1M 上下文,长流程 Agent 会在中途失忆,多步推演无法闭合;没有原生多模态,Agent 就看不见屏幕,GUI 操作无从谈起。三者缺一,2.5 版本主打的“面向终端、浏览器、桌面软件的长流程任务”就无法成立。反过来说,也正是因为这三项能力在同一代模型上同时成熟,官方才敢把“长流程任务执行”写进核心定位——这不是一句营销话术,而是三项底层技术叠加后自然得出的能力结论。
第四,专为 Agent 而生的训练理念。LongCat-2.5-Preview 从架构设计之初就聚焦智能体应用场景,原生具备出色的工具调度与多步思考能力。这一点与“先训好语言模型再想办法让它用工具”的路线不同:前者在后训练阶段就把工具调用、环境反馈、多步规划作为一等目标来优化,因此模型对“什么时候该调工具、调完怎么根据结果调整下一步”这类行为更加熟练。此外,官方提到借助 dlp 投机加速等推理优化方案,大幅削减了长链路交互的响应延迟。对于 Agent 场景来说,这一点至关重要——长流程任务意味着几十上百次模型调用,单次延迟哪怕只降低一点,累积起来也是显著的体验差异。
最后补充一个容易被忽略的规格项:最大单次输出 128K tokens。上下文长度决定“能读多少”,最大输出长度决定“能写多少”,两者对应的是完全不同的任务类型。1M 的输入窗口让它能一次吃下整个代码库或整摞文档,而 128K 的输出上限则意味着它可以一口气产出一份完整的技术方案、一份长篇报告,或者一次大批量的代码改写结果,而不必被截断成多轮续写。对于需要“一次付完整产物”的场景——比如生成整份重构补丁、输出完整的分析文档——这个数字比上下文长度更能决定实际体验。输入与输出两个维度同时拉满,是 LongCat-2.5-Preview 在规格上最直观的旗舰特征。
Longcat-2.5-preview 的接入方式、落地场景与同类模型对比
接下来从实操角度展开:如何把 LongCat-2.5-Preview 接进自己的系统,它适合解决哪几类问题,以及它与当前旗舰闭源模型相比各自的位置如何。需要提前说明的是,作为预览版本,官方目前暂无公开的基准跑分数据,GUI Agent 能力也处于起步开拓阶段,因此下面的讨论以能力描述与架构事实为主,不涉及任何未经官方公布的评测数字。
LongCat 官方平台的 API 接入与控制台页面
如何调用 Longcat-2.5-preview 的 API
官方给出的第一条路径是直接调用 API。整个过程对熟悉 OpenAI 或 Anthropic SDK 的开发者几乎没有学习成本,步骤如下。
- 账户注册:访问官方指定网址 https://longcat.ai/platform/ 完成新用户注册与登录流程。
- 生成密钥:在个人控制台内申请并创建专属的 API Key。这个 Key 是后续所有请求的身份凭证,需要妥善保管,不要提交到公开代码仓库。
- 配置开发包:直接调用现有的 OpenAI 或 Anthropic 标准 SDK,无需额外下载专用客户端。这一点对已有项目极其友好——你不需要引入新的依赖,也不需要重写请求与响应的解析逻辑。
- 调整请求地址:将 base_url 替换为 https://api.longcat.ai/openai(对应 OpenAI 标准)或 https://api.longcat.ai/anthropic(对应 Anthropic 标准),并填入对应的密钥。选择哪一个端点,取决于你现有的 SDK 用的是哪套协议。
- 指定模型代号:在模型参数处填入 LongCat-2.5-Preview,按照常规的标准报文格式发送请求即可。
这里有一个实践细节值得提醒:由于两个端点分别对应两套协议,请求体的字段名、消息结构、流式返回的格式都会跟随协议走。如果你原本用 OpenAI 格式写的,就走 /openai 端点,不要试图在 /anthropic 端点上发 OpenAI 格式的请求。反过来,如果你用的是 Anthropic 生态的工具(详见下一节),就走 /anthropic 端点。选错端点通常表现为字段名不识别或返回结构解析失败,排查时优先确认这一点。
关于额度,官方给出的信息是采取流量包套餐模式,当前阶段附赠 500 万免费额度。具体的套餐档位与后续计价规则需要以控制台内的实时说明为准,这里不做展开。但从试用角度看,500 万的免费额度已经足够支撑相当规模的真实任务验证——尤其考虑到它支持 1M 上下文,一次长文档请求就会消耗较多 token,因此建议在开始试用前先在控制台确认自己的额度使用情况,避免在压测阶段被意外限流。
Longcat-2.5-preview 接入 Agent 工具链的方法
第二条路径是把模型嵌进现有的 Agent 工具链,官方以 Claude Code 为例给出了具体做法:在系统的环境变量里配置 ANTHROPIC_BASE_URL=https://api.longcat.ai/anthropic 以及 ANTHROPIC_AUTH_TOKEN=您的密钥,再将模型名称变量 ANTHROPIC_MODEL 的值指定为 LongCat-2.5-Preview,随后即可直接启动 Claude Code 编写代码。整个过程不需要修改 Claude Code 本身,也不需要安装任何插件——因为 Claude Code 走的是标准 Anthropic 协议,而 LongCat 恰好实现了这套协议。
同样的思路可以推广到其他工具。官方明确指出,像 OpenClaw、OpenCode、Codex 等其他工具只需依样画葫芦,修改基础请求路径和模型标识即可畅通使用;此外还提到 Hermes 与 Kilo Code 也在高度集成的覆盖范围内。这意味着市面上主流的终端型编程 Agent,理论上都能通过改环境变量的方式切换到 LongCat-2.5-Preview。
除了 API 与工具链,官方还提供了第三条路径:网页端即开即用。登录 LongCat 官方网站并在模型列表中勾选 LongCat-2.5-Preview,便能在浏览器内直接开展对话交流、图片上传以及基础的智能体任务实测。对于只想先看看效果、不想折腾环境的用户,这是门槛最低的入口;建议在正式接入之前,先在网页端用自己最典型的任务跑一轮,确认能力符合预期再去写代码。
从工程组织的角度看,这种“改环境变量即可切换模型”的接入方式还有一个额外的好处:它让模型层的替换变成了一件可灰度、可回滚的事。你可以先在一台开发机上把 ANTHROPIC_BASE_URL 指向 LongCat,跑一段时间观察效果与稳定性,确认没问题再推广到团队;如果出现不兼容,把环境变量改回原值就能立刻回到原来的模型,代码本身不需要做任何改动。对于需要控制风险的团队来说,这种低成本试错的机会非常宝贵——它把“要不要换模型”这个重大决策,降格成了一次可以随时撤销的配置变更。
LongCat 官方网站首页
Longcat-2.5-preview 的典型应用场景
结合 1M 上下文、原生多模态与长流程 Agent 这三项能力,官方给出的典型落地场景主要有以下五类。
- 全代码库智能维护:借助 100 万长度的上下文一次性载入庞大工程,执行跨模块重构、隐藏 Bug 排查以及复杂 PR 编写,通过 Claude Code 等工具高效驱动。这类任务的难点从来不是“写一段代码”,而是“理解整个仓库的上下文”——1M 窗口恰好对上了这个需求。
- 跨平台办公自动化流程:指挥模型联动浏览器、电子表格与各类桌面客户端,自动化完成“网页信息采集—数据清洗—Excel 录入—生成分析报告”等一系列无人化值守工作。这是 GUI Agent 能力最直观的落点,也是 2.5 版本相对纯文本模型最大的增量。
- 海量日志与档案深度挖掘:将百万级字数的运行日志、法律合同或学术论文整体输入,进行宏观层面的问答检索、摘要生成与深层异常甄别。官方特别指出,这种方式从根本上消除了传统 RAG 检索造成的上下文割裂感——因为全部材料都在窗口里,模型不需要靠分片召回去拼凑全局。
- 图形界面自动化运维与测试:自主操作终端和桌面图形软件,执行大批量系统配置、UI 界面回归测试以及历史遗留系统的繁琐数据补录工作。对于大量没有现代 API 的老系统,GUI 自动化往往是唯一可行的自动化路径。
- 多模态创意与工程辅助:依托新增的视觉理解专长,实现设计图纸转代码、UI 原型还原及图文混排资料的归纳整理与二次创作。这类任务同时需要“看懂图”和“写出代码”,正是原生多模态与编程长板叠加后最有想象空间的方向。
把这五类场景再抽象一层,会发现它们分别对应了 LongCat-2.5-Preview 的三项底层能力的不同组合:代码库维护主要吃的是 1M 上下文加编程长板;办公自动化与 GUI 运维主要吃的是长链条 Agent 加多模态(要能看懂屏幕);日志档案挖掘几乎纯粹依赖 1M 上下文;创意与工程辅助则是多模态与编程能力的叠加。理解这个映射关系很有用——它可以帮助你在评估时有的放矢:如果你的需求是长文档问答,那么模型在 GUI 上的成熟度其实与你无关;反之如果你的核心诉求是自动化操作桌面软件,那么就要重点关注它在 GUI Agent 上的实际表现,而这个能力按官方说法目前仍处于起步开拓阶段。
如果你正在为编程 Agent 选型,平台上还收录了不少同赛道的工具可供横向参考,例如 Claude Code、iFlow CLI、CodeFlicker、InfCode 以及 TArk元舟。它们与 LongCat-2.5-Preview 并不一定是替代关系——更常见的组合是:用这些工具作为交互与编排层,用 LongCat-2.5-Preview 作为底层模型,通过双协议兼容的特性把两者接起来。
Longcat-2.5-preview 与 Claude Opus 5.5 对比
下面按照官方给出的竞品横向评测表,把 LongCat-2.5-Preview 与 Claude Opus 5.5 放在一起对比。需要强调的是,这份对比来自官方资料,且 LongCat-2.5-Preview 目前仍是预览版本,部分项目(如公开基准数据、GUI Agent 成熟度)存在客观差距,阅读时应结合版本阶段理解。
| 对比维度 | LongCat-2.5-Preview | Claude Opus 5.5 |
|---|---|---|
| 上下文窗口 | 1M tokens | 1M tokens |
| 最大输出 | 128K tokens | 128K tokens |
| 多模态水平 | 多模态原生融入基座,拓展图形理解 | 原生多模态(图文处理经验丰富,生态经时间沉淀) |
| 图形界面智能体(GUI Agent) | 处于起步开拓阶段,聚焦网页与桌面端协同,暂未公布评测基准数据 | Claude Computer Use 已经历多轮商业迭代,拥有庞大的实测案例 |
| 接口开放性 | 同时支持 OpenAI 与 Anthropic 双向协议 | 仅限 Anthropic 单一协议 |
| 调用资费 | 采取流量包套餐模式,当前阶段附赠 500 万免费额度(极具市场竞争力) | 约合 $4 / $20 每百万 tokens,处于高端旗舰价格区间 |
| 开发者生态适配 | 官方文档提供 Codex、OpenClaw、Claude Code 等多款工具的配置指引 | 与 Claude Code、Cowork 等官方工具链深度绑定,企业级生态完备 |
| 公开基准数据 | 暂无官方跑分数据公示 | 具备透明可查的 SWE-bench 等权威测评背书 |
把这张表读透,可以得出三个判断。第一,在硬规格上两者已经站在同一梯队:上下文同为 1M、最大输出同为 128K,多模态同为原生路线,这说明国产旗舰在参数与工程指标上不再落后。第二,差距主要集中在成熟度而非能力有无:GUI Agent 一项,Claude 侧依托 Computer Use 已经历多轮商业迭代、积累了大量实测案例,而 LongCat-2.5-Preview 明确处于起步开拓阶段且暂未公布基准数据;公开跑分一项,Claude 有 SWE-bench 等可查背书,LongCat 侧暂无官方数据公示。这些都是时间与工程积累的问题,不是架构上的不可逾越。第三,LongCat-2.5-Preview 在开放性与成本上有明确的差异化优势:双协议支持让它在接入侧几乎无摩擦,流量包套餐叠加当前阶段赠送的 500 万免费额度,也让它在试用与中小规模生产阶段的成本压力显著低于高端旗舰定价。
Longcat-2.5-preview 常见问题解答
- Longcat-2.5-preview 支持哪些调用协议?需要更换 SDK 吗?
- 它同时支持 OpenAI 与 Anthropic 两种传输协议,对应端点分别是 https://api.longcat.ai/openai 与 https://api.longcat.ai/anthropic。绝大多数情况下不需要更换 SDK——如果你原本用 OpenAI 标准 SDK,就把 base_url 换成 /openai 端点;如果用 Anthropic 标准 SDK,就换成 /anthropic 端点,再把模型名填为 LongCat-2.5-Preview 即可。对于 Claude Code 这类工具,只需配置 ANTHROPIC_BASE_URL、ANTHROPIC_AUTH_TOKEN 与 ANTHROPIC_MODEL 三个环境变量。
- Longcat-2.5-preview 的多模态能力和“外挂视觉模块”有什么不同?
- 根据官方说明,2.5 版本的多模态是“原生”的:它不像以往那样把图文拆成分支,而是直接将多模态特性根植于模型内核,文本与视觉信息在同一空间内完成联合训练。这一设计传承自 DiNA(离散原生自回归)技术路线,把各类模态直接转化为离散的 token 集合进行统一编码。因此图像在模型中与文本共享同一套表示与自回归建模方式,跨模态的细粒度对齐不再依赖额外的桥接模块。
- Longcat-2.5-preview 适合直接用于生产环境吗?有没有公开的跑分可以参考?
- 它目前是 Preview(预览)版本,官方资料明确说明暂无跑分数据公示,且 GUI Agent 能力处于起步开拓阶段、暂未公布评测基准数据。因此对于稳定性要求极高的核心生产链路,建议先用网页端或 500 万免费额度做充分自测,尤其是用自己业务里最典型的长流程任务去验证;对于编程、长文档理解这类相对成熟的场景,可以先在非关键路径上试用。同时注意端点选择需与你的 SDK 协议匹配,避免格式不兼容导致的解析失败。
最后提醒一点实践上的先后顺序。对于第一次接触 LongCat 系列的团队,我们建议按“网页端体验 → API 单次调用 → 接入单个 Agent 工具 → 长流程任务试点”这条路径推进:先在网页端用最典型的任务确认能力边界,再用最简的 SDK 调用验证端点、密钥与模型名三者配置正确,然后挑一个日常使用的编程 Agent 做切换试点,最后才把需要 GUI 协同的长流程任务纳入评估。这样做的好处是每一阶段的失败都可以被快速定位——网页端不通是账号问题,单次调用不通是配置问题,工具接入不通是协议问题,长流程不通才是真正的能力问题。
官网入口与 API 信息汇总如下:官方平台 https://longcat.ai/platform/(注册、控制台、API Key 申请与网页端体验);API 端点 https://api.longcat.ai/openai(OpenAI 标准)与 https://api.longcat.ai/anthropic(Anthropic 标准);调用时模型代号填 LongCat-2.5-Preview。
OpenI AI时代点评
把 LongCat-2.5-Preview 放进 2026 年大模型竞争的坐标系里看,它释放出的信号比它本身的规格更值得关注。第一层信号是国产旗舰在硬指标上已经完成对齐:1M 上下文、128K 输出、原生多模态,这些曾经是少数闭源旗舰专属的标签,如今在同一个模型上同时出现,而且还是以开源友好的 API 形态提供。第二层信号是竞争焦点正在从“模型有多强”转向“模型能不能把事做完”——长流程任务、GUI 操作、跨软件协同,这些能力的共同点是不再以单轮回答质量衡量,而以任务完成率衡量。LongCat-2.5-Preview 明确把“专为 Agent 而生”写进训练理念,正是对这一转向的回应。
从工程角度看,它最聪明的一步其实是双协议兼容。在一个 Claude Code、Codex 这类工具事实上定义了开发者日常习惯的市场里,一个国产模型要让用户迁移,最大的阻力从来不是模型能力,而是切换成本。LongCat-2.5-Preview 把切换成本压缩到“改两个环境变量”,等于直接绕开了这道墙。这也解释了为什么官方要不厌其烦地给出 Codex、OpenClaw、Claude Code、Hermes、OpenCode、Kilo Code 一长串工具的配置指引——它要争取的不是“用户愿意试试”,而是“用户不用改习惯就能用上”。对于平台上的 Claude Code、iFlow CLI 这类工具条目来说,这种兼容性也意味着模型层的可替换性被真正打开了。
还有一个观察值得记录:LongCat-2.5-Preview 在“原生多模态”上的技术选择——走 DiNA 离散原生自回归路线、把图文统一成离散 token 在同一空间联合训练——实际上代表了一种与“文本基座 + 视觉编码器 + 适配器”相对立的架构立场。后者的优势是工程上可以复用成熟的语言模型,见效快;前者的优势是模态之间不存在表示鸿沟,跨模态推理更扎实,但训练成本与工程难度都更高。美团选择后者,说明它对多模态的判断不是“先有功能再说”,而是“要做就做进基座”。这个选择短期内未必能立刻转化为跑分优势,但中长期看,它决定了模型在复杂跨模态任务上的能力上限。
当然,客观地说,LongCat-2.5-Preview 目前仍是一个需要被谨慎评估的预览版本。官方明确表示暂无跑分数据公示、GUI Agent 处于起步阶段,这两点决定了它在“可被验证”这件事上还落后于有 SWE-bench 等公开背书的成熟旗舰。因此我们的建议是分场景推进:长文档理解、代码辅助、图文混排内容处理这三类相对成熟的场景,可以现在就开始试用,用官方赠送的 500 万免费额度把自己的真实任务跑一遍;而对 GUI 自动化、跨软件办公流程这类仍在开拓中的能力,建议先做小范围试点,观察其在自己环境下的稳定表现再决定是否规模化。把它与 MiniMax 等国产开放模型放在一起看,一个健康的信号是:这个市场正在从“比参数、比榜单”走向“比能不能接、比能不能用”,这最终受益的是每一个开发者。官网入口:https://longcat.ai/platform/。


