星火X2.5是什么
星火X2.5是科大讯飞于2025年正式推出的旗舰通用大模型系列,由云端 MoE 基座模型与开源端侧轻量模型共同构成。基座模型采用混合专家架构,参数规模为 293B 总参数、30B 激活参数;端侧开源版本则包括星火X2.5-4B 与星火X2.5-1.7B 两种规格,覆盖从云端推理到终端嵌入式部署的完整场景。整套模型的预训练、后训练与微调流程均在以华为昇腾为代表的国产智算集群上完成,从底层芯片、训练框架到顶层算法实现全栈自主可控,是国产大模型在自主算力路线上的一次系统性输出。
围绕代码重构、多智能体协同与复杂数学推理等核心任务,星火X2.5 对基座进行了深度优化;端侧版本原生支持 100 万 Token 超长上下文,硬件上同时兼容英伟达 GPU 与华为昇腾、海光、后摩等国产芯片,部署上适配 vLLM、Ollama 等主流推理框架。当前该系列已通过 GitHub 代码仓库和 Hugging Face 模型集合面向开发者开放。
图1:星火X2.5 在 GitHub 的开源仓库首页
星火X2.5的主要功能
星火X2.5 的能力可以拆解为以下几个核心维度,每一项都围绕通用大模型在生产环境中真正落地的痛点来设计:
- 云端 MoE 基座推理:总参数 293B、激活参数 30B 的稀疏激活架构,让模型在不显著增加单次推理算力开销的前提下,享受到大体量参数带来的表达力提升,可承担复杂对话、长文生成与多步任务规划。
- 端侧 4B/1.7B 轻量模型:面向手机、车机与物联网终端的开源版本,1.7B 与 4B 两种规格分别对应极致轻量与端侧高质量两类部署需求,可在无网或弱网环境完成推理。
- 代码与多智能体协同:在后训练阶段引入 MOPD 多目标偏好蒸馏,针对代码重构、Agent 自主逻辑规划与数学解题进行专项强化,提升模型在工程开发与企业级自动化场景的指令遵循精度。
- 百万级长上下文:端侧模型采用全注意力与滑动窗口注意力混合机制,打破设备内存壁垒,原生支持高达 100 万 Token 的上下文窗口,可一次性处理合同、研报、整本教材等长文本。
- 多芯片与多框架兼容:同时适配英伟达 GPU、华为昇腾、海光、后摩等异构算力,并兼容 vLLM、Ollama、LM Studio、MLX 等主流推理与本地对话框架。
星火X2.5的技术架构与训练路径
星火X2.5 的关键技术选择可以归纳为五条主线,它们共同决定了模型在性能、效率与可控性上的平衡方式:
- 全国产算力全流程训练:模型预训练与微调均在国产智算集群上完成,避开了对单一海外算力供给的依赖,训练链路的可追溯性与供应链安全性显著提升。
- MoE 稀疏激活的效能优势:293B 总参数 / 30B 激活参数的组合让模型在保持高表达力的同时,把单次推理的显存与算力成本压到与传统 30B 级稠密模型相当的水平,兼顾效果与推理经济性。
- 端侧长上下文的混合注意力:星火X2.5-4B/1.7B 通过全注意力 + 滑动窗口注意力的组合,把百万级 Token 的处理能力下沉到 1.7B 参数量级,是端侧模型中较早达到该量级的方案之一。
- MOPD 后训练策略:引入多目标偏好蒸馏,把代码生成、Agent 任务规划与数学推理这三类高频高价值任务作为后训练目标,提升模型在生产链路中的指令遵循精度。
- 端侧轻量化与毫秒级响应:针对手机与物联网终端做专门压缩与算子优化,目标是低算力设备上仍能保持毫秒级响应,并保证任务完成度不输云端同尺寸模型。
星火X2.5的使用方法
开发者与产品方接入星火X2.5 主要有四条路径,可以按硬件条件与上线节奏灵活选择:
- 讯飞开放平台线上 API:在讯飞开放平成账号注册与实名认证后,创建应用即可获得 API Key;接口兼容 OpenAI 标准,可直接在现有 OpenAI SDK 上替换 Base URL 与 Key 调用云端 MoE 基座,享受限时免费额度。
- 下载开源权重本地部署:通过 Hugging Face 模型集合、ModelScope 或 GitHub 仓库下载星火X2.5-4B 或 1.7B 权重,再用 vLLM、Ollama、LM Studio 启动本地推理服务。
- 苹果芯片上 MLX 推理:在搭载 Apple Silicon 的 Mac 设备上,可借助 MLX 框架直接加载星火X2.5 的端侧权重,获得与 M 系列芯片高度适配的本地推理体验,适合开发调试与个人场景。
- 基于 LLaMA-Factory 的领域微调:使用 LLaMA-Factory 等开源工具,对 4B/1.7B 底座叠加行业语料进行增量微调,可以快速产出面向金融、医疗、法律、政务等垂直领域的专属模型,再以 API 或本地化方式上线。
星火X2.5的使用场景
凭借云端基座与端侧模型的完整覆盖,星火X2.5 在以下几类高价值场景中具备比较明确的落地空间:
- 软件开发辅助:作为 AI 编程助手承担从需求梳理、代码编写到测试修复的全流程,可直接对接主流 IDE 与 Git 工作流,成为研发团队的高频生产力工具。
- 企业级 Agent 自动化:结合 Agent 框架承担多步业务规划与工具调用,帮助企业把跨系统的办公流程自动化,例如报销、合同审阅、数据报表生成等长链路任务。
- 离线长文档分析:依赖百万 Token 长上下文,车载终端、移动设备即便在无网环境下也能一次性消化厚重的合同文件、招股书或长篇研报。
- 教育与个性化辅导:在数学推理、逻辑分析等任务上的强化让模型可以为学生提供解题思路引导,辅助构建自适应学习路径与错题讲解。
- 信创私有化部署:、能源、金融等对数据合规要求高的行业,可以借助星火X2.5 的全栈自主可控特性完成私有化交付,兼顾数据不出域与国产化替代要求。
星火X2.5的常见问题解答
图2:星火X2.5 在 Hugging Face 上开放的 1.7B / 4B 模型集合
- 星火X2.5 与星火V4.0 系列是什么关系?
- 星火X2.5 是科大讯飞面向通用大模型场景推出的新一代旗舰系列,采用 293B/30B 的 MoE 架构与全国产算力训练路径,与既有的星火V4.0 等版本并行存在;老版本仍可通过讯飞开放平台继续调用,新项目与新部署则推荐直接接入星火X2.5 系列。
- 端侧 1.7B 模型真的能跑到 100 万 Token 上下文吗?
- 可以。星火X2.5-1.7B 通过全注意力 + 滑动窗口注意力的混合机制,把百万级 Token 的处理能力下沉到 1.7B 参数量级,配合端侧 KV Cache 优化与量化方案,能够在手机级内存预算内完成超长文档的读取与问答。
- 星火X2.5 适合哪些硬件部署?
- 基座 MoE 模型建议在多卡 GPU 或昇腾集群上部署;端侧 4B/1.7B 版本可分别覆盖消费级 GPU、苹果 Mac、车机与高算力手机,配合 vLLM、Ollama、MLX 等框架即可上线。
星火X2.5官网网址
项目主页与代码仓库:https://github.com/XHToken/Spark-X2.5
开源模型集合:https://huggingface.co/collections/XHToken/spark-x25
星火X2.5同类工具对比
| 模型 / 系列 | 架构与参数 | 上下文 | 算力路线 | 开放方式 |
|---|---|---|---|---|
| 星火X2.5 | MoE 293B 总参 / 30B 激活;端侧 4B / 1.7B | 端侧原生 100 万 Token | 全国产算力训练,兼容英伟达 GPU 与昇腾、海光、后摩 | 讯飞开放平台 + Hugging Face + GitHub 开源 |
| 科大讯飞星火认知大模型 | 认知大模型系列 | 长文本能力 | 国产算力 | 讯飞开放平台 |
| 星火大模型 | 通用大模型基线版本 | 中长上下文 | 国产算力 | 讯飞开放平台 |
| 讯飞星火4.0 API | 4.0 系列 API 形态 | 中长上下文 | 国产算力 | API 调用 |
| 讯飞星火API | 通用 API 接入 | 中长上下文 | 国产算力 | API 调用 |
OpenI AI时代点评
星火X2.5 是一次以”全国产算力 + MoE 云端基座 + 端侧开源”三件套同时推进的国产大模型升级:在 293B/30B 的稀疏激活架构与百万级 Token 端侧上下文的组合下,把云端推理与终端部署拉到同一条技术路线上。配合 vLLM、Ollama、MLX 等主流部署框架以及讯飞开放平台和 Hugging Face 的双重开放,开发者既可以直接调用 API 跑业务,也可以私有化部署到自有集群。完整入口见星火X2.5 GitHub 仓库与科大讯飞星火认知大模型 OpenI 词条。


