Qwen3.8-Flash 发布:阿里用 6B 激活参数重做百万 Token Agent 模型
阿里通义千问于 2026 年 8 月 26 日发布 Qwen3.8-Flash,并开放 Qwen3.8-Flash-Next 权重。新架构以 125B 主模型、51B N-gram Embedding 和每 Token 6B 激活参数,降低长上下文、编程与办公 Agent 的训练和推理成本。
阿里通义千问团队于 2026 年 8 月 26 日发布 Qwen3.8-Flash,同时开放 Qwen3.8-Flash-Next 模型权重。这次发布包含一项容易混淆的安排:前者是 QwenCloud 提供的生产服务版本,默认支持 100 万 Token 上下文和官方内置工具;后者是可下载部署的开放权重版本,也是 Qwen4 架构的实验性预览。
两者共享同一条技术主线。Qwen3.8-Flash-Next 的主模型为 125B 参数,另有 51B N-gram Embedding 和 4B MTP 层,每个 Token 只激活 6B 主模型参数。千问希望用新的注意力、残差、Embedding 和训练方案,把长上下文与多模态 Agent 的计算成本压下来,同时保留编程、办公和工具执行能力。
生产版与开放权重版需要分开理解
版本 | 当前定位 | 上下文与工具 | 获取方式 |
|---|---|---|---|
| 面向应用的生产服务 | 默认 1M 上下文,提供官方内置工具 | QwenCloud API |
| Qwen4 新架构预览 | 原生 262,144 Token,可通过 YaRN 扩展至 1M | Hugging Face、ModelScope、自部署框架 |
QwenCloud 模型页显示,生产版接受文本、图像和视频输入,输出文本,支持 Function Calling、Structured Outputs、批处理和上下文缓存。页面还列出代码解释器、网页搜索、网页抽取和图像搜索等 Responses API 工具,并提供 OpenAI 与 Anthropic 兼容接口。
开放权重版则更适合研究架构、自建推理服务或做底层适配。模型采用 Qwen Community License 1.0,不能直接套用其他千问模型曾使用的许可证结论。开发者在商用、再分发或提供托管服务前,仍需阅读这一版本的具体许可条款。
QSA 把长上下文检索缩到微块级别
新架构的第一处重点是 Gated DeltaNet 与 Qwen Sparse Attention(QSA)组成的混合注意力。四层为一个循环,其中三层使用 Gated DeltaNet,把历史信息压缩为固定大小的状态;另一层使用 QSA,从完整上下文中精确找回重要内容。
QSA 不再逐个 Token 选择注意位置,而是在 micro-block 粒度筛选上下文。官方测试显示,在 100 万 Token 场景下,QSA Attention Kernel 的 Prefill 和 Decode 最高分别获得 7.6 倍、4.9 倍加速;当测试设置为 90% 前缀缓存命中率时,Prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。
这些是特定实现和测试条件下的峰值数据,不能直接换算成所有应用的端到端提速。真实收益会受提示词长度、缓存命中率、并发量、推理框架和硬件影响。对 Agent 工作流来说,它仍指出了明确方向:模型正在为反复读取大型代码库、长文档和工具轨迹做专门优化。
51B Embedding 为模型增加低计算成本的记忆
Qwen3.8-Flash-Next 另外引入 51B N-gram Embedding。它根据局部上下文中的二元组和三元组查询大规模表格,增加模型容量时不需要像普通网络层一样完成密集计算。查询位置可以提前确定,Embedding 也可以卸载到主机内存,再通过异步预取与 GPU 计算重叠。
第二项变化是 Gated Residual。传统单一路径的残差流被扩展为四条分支,模型通过动态读门和每分支写门控制跨层信息传递。训练侧则把 Muon 与 AdamW 分配给不同权重类型,并重新拟合 Scaling Law,取消传统的 batch size warmup。
千问称,这套组合让 Qwen3.8-Flash-Next 的训练开销约为 Qwen3.7-Plus 的九分之一,同时在多项编程和办公评测中取得更高结果。这里比较的是官方训练方案和厂商评测,九分之一不能简单解释为所有团队训练、微调或部署时都会节省同样比例。
编程、办公和视觉 Agent 是能力重点
官方模型卡给出的结果显示,新模型的提升集中在需要持续执行的任务。
评测 | Qwen3.8-Flash-Next | Qwen3.7-Plus | 测试方向 |
|---|---|---|---|
DeepSWE 1.1 | 58.7 | 16.5 | 长程软件工程 |
SWE-bench Multilingual | 81.0 | 75.8 | 多语言代码修复 |
CoWorkBench | 73.9 | 65.1 | 长程办公与专业任务 |
Toolathlon Verified | 73.5 | 50.6 | 真实工具调用 |
Vision2Web | 64.0 | 42.1 | 视觉网页开发 |
这些数字由千问发布,部分项目使用自研评测或指定 Agent Harness,不适合脱离测试设置做“全面领先”结论。例如 DeepSWE 取 Claude Code 与 mini-SWE-agent 两种 Harness 中的较高分;CoWorkBench 是千问内部的长程办公评测。它们可以帮助开发者选择测试场景,但不能替代自己的代码库和业务流程。
模型原生支持视觉编码器,因此生产版可以处理图表、桌面应用、网页界面和长视频。对小团队更实用的判断,是视觉输入能否提高 Agent 的任务完成率:它能否看懂失败页面、定位表格异常、根据截图修复代码,并在调用工具后验证结果。
API 低价之外,还要计算缓存与工具成本
QwenCloud 国际模型页当前列出的价格为每百万 Token 输入 0.16 美元、输出 0.47 美元;隐式缓存输入和显式缓存读取均为 0.016 美元,显式缓存创建为 0.20 美元。页面标注 1M 总上下文、最大输入约 991K、最大输出 131K。
价格对长上下文应用有吸引力,但预算不能只用输入单价乘文档长度。多轮 Agent 还会产生输出 Token、工具调用、缓存创建、失败重试和人工接管。不同地区、渠道和账户的计费与开放状态也可能不同,接入前应以实际控制台为准。
此外,官方发布文章写有 API “即将提供”,而 QwenCloud 模型页已经展示调用入口。这表明上线可能按地区或账户分阶段完成。准备立刻迁移生产流量的团队,应先确认自己的账户是否已获得模型 ID、配额与所需工具权限。
小团队可以先跑两类对照测试
- 长代码库 Agent。 选择有自动化测试的真实 Issue,对比模型读取仓库、修改代码、运行测试和修复失败的完整过程。记录首轮通过率、总 Token、缓存命中率和人工接管时间。
- 多模态办公交付。 输入脱敏的文档、表格、图表与截图,让模型完成核对、分析和文件交付。重点检查数字是否准确、工具结果是否被正确引用,以及视觉输入是否减少了返工。
API 版本适合快速测生产能力和内置工具,开放权重版适合验证自部署、量化和数据边界。尽管每 Token 只激活 6B 主模型参数,完整模型仍包含 125B 主模型、51B Embedding 和 4B MTP,不能把它当作普通 6B 模型估算显存。自部署团队还要确认推理框架对 QSA、N-gram Embedding 和长上下文扩展的实际支持。
Qwen3.8-Flash 同时推进了低价 API、Qwen4 新架构、百万 Token 服务、多模态 Agent 与开放权重预览,开发者现在可以从托管服务和自部署两条路线验证它。下一步最值得观察的是第三方复测、各地区 API 的稳定开放,以及新架构在高并发和真实百万 Token 任务中的端到端收益。