Qwen3.8-Flash 发布:阿里用 6B 激活参数重做百万 Token Agent 模型

阿里通义千问于 2026 年 8 月 26 日发布 Qwen3.8-Flash,并开放 Qwen3.8-Flash-Next 权重。新架构以 125B 主模型、51B N-gram Embedding 和每 Token 6B 激活参数,降低长上下文、编程与办公 Agent 的训练和推理成本。

Qwen3.8-Flash 标识连接云端服务与本地模型机箱的紫色科技插画
Qwen3.8-Flash Qwen3.8-Flash-Next 通义千问 Qwen4 多模态模型 AI Agent

阿里通义千问团队于 2026 年 8 月 26 日发布 Qwen3.8-Flash,同时开放 Qwen3.8-Flash-Next 模型权重。这次发布包含一项容易混淆的安排:前者是 QwenCloud 提供的生产服务版本,默认支持 100 万 Token 上下文和官方内置工具;后者是可下载部署的开放权重版本,也是 Qwen4 架构的实验性预览。

两者共享同一条技术主线。Qwen3.8-Flash-Next 的主模型为 125B 参数,另有 51B N-gram Embedding 和 4B MTP 层,每个 Token 只激活 6B 主模型参数。千问希望用新的注意力、残差、Embedding 和训练方案,把长上下文与多模态 Agent 的计算成本压下来,同时保留编程、办公和工具执行能力。

生产版与开放权重版需要分开理解

版本

当前定位

上下文与工具

获取方式

Qwen3.8-Flash

面向应用的生产服务

默认 1M 上下文,提供官方内置工具

QwenCloud API

Qwen3.8-Flash-Next

Qwen4 新架构预览

原生 262,144 Token,可通过 YaRN 扩展至 1M

Hugging Face、ModelScope、自部署框架

QwenCloud 模型页显示,生产版接受文本、图像和视频输入,输出文本,支持 Function Calling、Structured Outputs、批处理和上下文缓存。页面还列出代码解释器、网页搜索、网页抽取和图像搜索等 Responses API 工具,并提供 OpenAI 与 Anthropic 兼容接口。

开放权重版则更适合研究架构、自建推理服务或做底层适配。模型采用 Qwen Community License 1.0,不能直接套用其他千问模型曾使用的许可证结论。开发者在商用、再分发或提供托管服务前,仍需阅读这一版本的具体许可条款。

QSA 把长上下文检索缩到微块级别

新架构的第一处重点是 Gated DeltaNet 与 Qwen Sparse Attention(QSA)组成的混合注意力。四层为一个循环,其中三层使用 Gated DeltaNet,把历史信息压缩为固定大小的状态;另一层使用 QSA,从完整上下文中精确找回重要内容。

QSA 不再逐个 Token 选择注意位置,而是在 micro-block 粒度筛选上下文。官方测试显示,在 100 万 Token 场景下,QSA Attention Kernel 的 Prefill 和 Decode 最高分别获得 7.6 倍、4.9 倍加速;当测试设置为 90% 前缀缓存命中率时,Prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。

这些是特定实现和测试条件下的峰值数据,不能直接换算成所有应用的端到端提速。真实收益会受提示词长度、缓存命中率、并发量、推理框架和硬件影响。对 Agent 工作流来说,它仍指出了明确方向:模型正在为反复读取大型代码库、长文档和工具轨迹做专门优化。

51B Embedding 为模型增加低计算成本的记忆

Qwen3.8-Flash-Next 另外引入 51B N-gram Embedding。它根据局部上下文中的二元组和三元组查询大规模表格,增加模型容量时不需要像普通网络层一样完成密集计算。查询位置可以提前确定,Embedding 也可以卸载到主机内存,再通过异步预取与 GPU 计算重叠。

第二项变化是 Gated Residual。传统单一路径的残差流被扩展为四条分支,模型通过动态读门和每分支写门控制跨层信息传递。训练侧则把 Muon 与 AdamW 分配给不同权重类型,并重新拟合 Scaling Law,取消传统的 batch size warmup。

千问称,这套组合让 Qwen3.8-Flash-Next 的训练开销约为 Qwen3.7-Plus 的九分之一,同时在多项编程和办公评测中取得更高结果。这里比较的是官方训练方案和厂商评测,九分之一不能简单解释为所有团队训练、微调或部署时都会节省同样比例。

编程、办公和视觉 Agent 是能力重点

官方模型卡给出的结果显示,新模型的提升集中在需要持续执行的任务。

评测

Qwen3.8-Flash-Next

Qwen3.7-Plus

测试方向

DeepSWE 1.1

58.7

16.5

长程软件工程

SWE-bench Multilingual

81.0

75.8

多语言代码修复

CoWorkBench

73.9

65.1

长程办公与专业任务

Toolathlon Verified

73.5

50.6

真实工具调用

Vision2Web

64.0

42.1

视觉网页开发

这些数字由千问发布,部分项目使用自研评测或指定 Agent Harness,不适合脱离测试设置做“全面领先”结论。例如 DeepSWE 取 Claude Code 与 mini-SWE-agent 两种 Harness 中的较高分;CoWorkBench 是千问内部的长程办公评测。它们可以帮助开发者选择测试场景,但不能替代自己的代码库和业务流程。

模型原生支持视觉编码器,因此生产版可以处理图表、桌面应用、网页界面和长视频。对小团队更实用的判断,是视觉输入能否提高 Agent 的任务完成率:它能否看懂失败页面、定位表格异常、根据截图修复代码,并在调用工具后验证结果。

API 低价之外,还要计算缓存与工具成本

QwenCloud 国际模型页当前列出的价格为每百万 Token 输入 0.16 美元、输出 0.47 美元;隐式缓存输入和显式缓存读取均为 0.016 美元,显式缓存创建为 0.20 美元。页面标注 1M 总上下文、最大输入约 991K、最大输出 131K。

价格对长上下文应用有吸引力,但预算不能只用输入单价乘文档长度。多轮 Agent 还会产生输出 Token、工具调用、缓存创建、失败重试和人工接管。不同地区、渠道和账户的计费与开放状态也可能不同,接入前应以实际控制台为准。

此外,官方发布文章写有 API “即将提供”,而 QwenCloud 模型页已经展示调用入口。这表明上线可能按地区或账户分阶段完成。准备立刻迁移生产流量的团队,应先确认自己的账户是否已获得模型 ID、配额与所需工具权限。

小团队可以先跑两类对照测试

  1. 长代码库 Agent。 选择有自动化测试的真实 Issue,对比模型读取仓库、修改代码、运行测试和修复失败的完整过程。记录首轮通过率、总 Token、缓存命中率和人工接管时间。
  2. 多模态办公交付。 输入脱敏的文档、表格、图表与截图,让模型完成核对、分析和文件交付。重点检查数字是否准确、工具结果是否被正确引用,以及视觉输入是否减少了返工。

API 版本适合快速测生产能力和内置工具,开放权重版适合验证自部署、量化和数据边界。尽管每 Token 只激活 6B 主模型参数,完整模型仍包含 125B 主模型、51B Embedding 和 4B MTP,不能把它当作普通 6B 模型估算显存。自部署团队还要确认推理框架对 QSA、N-gram Embedding 和长上下文扩展的实际支持。

Qwen3.8-Flash 同时推进了低价 API、Qwen4 新架构、百万 Token 服务、多模态 Agent 与开放权重预览,开发者现在可以从托管服务和自部署两条路线验证它。下一步最值得观察的是第三方复测、各地区 API 的稳定开放,以及新架构在高并发和真实百万 Token 任务中的端到端收益。