讯飞星火 X2.5 发布:293B-A30B MoE,重点升级代码与智能体能力
科大讯飞发布星火 X2.5 旗舰模型,采用 293B-A30B MoE 架构,支持 256K 上下文和 200 余种语言,已上线讯飞星辰 MaaS。本文梳理旗舰版与端侧版差异、限时 API 价格,以及小团队最值得验证的场景。
2026 年 9 月 7 日,科大讯飞发布星火 Spark-X2.5 多语言文本生成模型。旗舰版采用 MoE(混合专家)架构,总参数量 293B、每次推理激活约 30B 参数,支持 256K 上下文,重点升级代码开发、智能体与工具调用能力。模型已上线讯飞星辰 MaaS,开发者可以直接通过平台体验和调用。
这次更新容易与同系列端侧模型混淆。旗舰 Spark-X2.5 的上下文规格是 256K;此前发布并开源的 Spark-X2.5-4B 与 Spark-X2.5-1.7B 才是原生支持 1M 上下文的轻量端侧版本。三者属于同一产品家族,但参数规模、部署位置与适用任务不同。
旗舰版把资源投向 Coding 与 Agent
星火 X2.5 基于全国产算力平台完成训练,讯飞将这一代旗舰模型的升级重点放在真实代码项目和复杂智能体任务上。官方披露的核心规格包括:
项目 | Spark-X2.5 旗舰版 |
|---|---|
架构 | MoE 混合专家 |
参数规模 | 293B 总参数,约 30B 激活参数 |
上下文 | 256K |
语言覆盖 | 200 余种语言 |
重点方向 | 代码、智能体、工具调用 |
使用方式 | 讯飞星辰 MaaS |
MoE 让模型保留较大的总容量,同时每次推理只激活部分专家参数。开发者选型时,架构名称只能提供背景;延迟、稳定性、Token 消耗和一次性交付质量才会直接影响使用体验。
目前可见的第三方实测也提醒了这一点。在一个 HTML 游戏开发任务中,模型首次交付遗漏了敌人,收到反馈后才补齐关键玩法;网页原型能够生成基本结构和交互,但视觉排版仍需人工整理;一项 3D 创作任务则多次尝试后未能交付。单次测试不能代表模型的整体水平,却足以说明:代码与 Agent 能力的提升,仍然需要在真实仓库、连续工具调用和失败恢复中验证。
256K 与 1M 上下文分别属于谁
星火 X2.5 目前形成了云端旗舰与端侧轻量模型两条路线:
型号 | 参数形态 | 上下文 | 更适合先测试的场景 |
|---|---|---|---|
Spark-X2.5 | 293B-A30B MoE | 256K | 云端代码项目、复杂推理、智能体工作流 |
Spark-X2.5-4B | 4B Dense | 1M | 本地长文档、设备端工具调用、隐私敏感任务 |
Spark-X2.5-1.7B | 1.7B Dense | 1M | 资源更受限的终端、轻量文本与 Agent 任务 |
两款端侧模型还支持 200 余种语言,并已开放模型权重。1M 上下文可以容纳完整手册、长记录和较大代码资料,最终效果仍取决于模型能否准确找回并利用其中的信息。实际部署还要测试内存占用、首 Token 延迟、长上下文检索准确率,以及设备在持续负载下的表现。
对小团队来说,选择逻辑可以更直接:需要快速接入旗舰能力、暂时不承担部署运维时,先用 MaaS;数据不宜离开本地、设备资源允许,且任务确实依赖超长上下文时,再评估 4B 或 1.7B 端侧版本。不要只因“1M”这一项规格就替换现有方案。
API 价格降低了试用门槛,但要按完整任务核算
讯飞星辰 MaaS 的模型页面显示,Spark-X2.5 当前提供限时五折价格:输入 1.6 元/百万 Token、缓存命中输入 0.24 元/百万 Token、输出 6 元/百万 Token。页面列出的原价分别为 3.2 元、0.48 元和 12 元,尚未说明优惠截止日期。
这套计价对长上下文和 Agent 工作流尤其值得关注,因为多轮规划、读取文件、执行工具和错误重试会明显扩大 Token 用量。小团队测试时可以把成本拆成四项:
- 一次任务的未缓存输入、缓存命中与输出 Token;
- 完成任务所需的平均轮次和重试次数;
- 成功交付后仍需人工修正的时间;
- 失败任务造成的无效调用与排查成本。
如果只比较“百万 Token 单价”,很容易低估 Agent 的完整任务成本。更有用的指标是每个通过验收的任务花了多少钱,以及人工接手发生在哪一步。
小团队最值得先跑的三类验证
星火 X2.5 的发布重点非常明确,首轮测试也应围绕它宣称强化的边界展开。
- 真实代码仓库任务:选择一个可回滚的小需求,让模型读取项目、修改代码、运行测试并修复失败。记录首次通过率和人工提示次数。
- 带工具的研究任务:要求模型检索、读取多份材料、整理结论并保留证据链,观察长流程中是否遗漏约束或引用错误信息。
- 长文档持续问答:分别用 256K 旗舰版和 1M 端侧版处理相同材料,除能否成功载入外,还要比较召回准确率、响应时间和总成本。
目前公开信息还不足以判断星火 X2.5 在不同开发框架中的稳定性,也没有统一的第三方评测可以覆盖代码、Agent、多语言与长上下文这几项能力。讯飞还预告了面向代码和日常办公的 Harness 桌面产品 AStudio,但正式发布时间与完整功能尚未公布。对准备接入的团队,现阶段最稳妥的做法是用自己的任务集做小规模对照测试,同时把限时价格与未来常规定价分开计算。