千问 Qwen3.8-Max 正式上线:2.4T 旗舰模型押注长程智能体

阿里千问 Qwen3.8-Max 于 2026 年 8 月 3 日正式上线,总参数 2.4T、激活参数 95B,重点升级自主编程、专业办公、长程任务与多模态智能体。API 已开放,模型权重与 27B 版本计划于下周发布。

紫蓝色发布台上的 Q 形模型核心与 Qwen3.8-Max 正式上线标题
千问 Qwen3.8-Max 大模型 AI 编程 智能体 开放权重

阿里千问在 2026 年 8 月 3 日正式上线 Qwen3.8-Max。这款旗舰模型总参数量为 2.4T,每次推理激活 95B 参数,重点提升自主编程、专业办公、长程任务和多模态智能体能力。API 已在千问 AI 平台开放,并接入同日推出的千问办公;官方还宣布,Qwen3.8-Max 与更小的 Qwen3.8-27B 将于下周开放权重。

这次发布补齐了 7 月预览版最关键的两块信息:激活参数规模已经公开,正式 API 也有了明确价格。权重文件、许可证和完整部署条件仍要等待下周实际发布,因此,团队现在可以开始做 API 评测,但自部署计划还不能定案。

从预览版到正式版,变化集中在“持续执行”

Qwen3.8-Max 基于 Qwen3.5 架构构建。官方没有把它描述成只追求单轮问答分数的模型,而是把发布重点放在长时间工作、工具使用和环境反馈上:模型需要在数百甚至数千轮交互中保持目标,观察中间结果,在失败后重新规划,并最终交付可检查的成果。

官方演示覆盖了几类任务:

  • 自主编程:模型从空文件夹开始,连续运行约 16 天完成 oh-my-cli 智能体框架;另一个实验中,它用约 125 小时复现一篇研究论文,并继续测试改进方案。
  • 专业办公:模型被用于大批量合同审阅、交互原型制作、结构工程建模和量化研究等任务,强调从资料处理到最终文件交付的完整链路。
  • 长程优化:在芯片设计与电商经营模拟中,模型通过多轮“执行—反馈—迭代”调整方案,展示持续规划能力。
  • 多模态智能体:视觉信息进入任务执行回路,模型可以检查页面、图像或视频处理结果,并根据观察修正下一步操作。

这些案例由千问团队设计并发布,能说明产品方向,却不能直接代表团队在真实代码库、内部数据和权限环境中的成功率。尤其是长时间运行的 Agent,最终效果还会受到工具稳定性、沙箱权限、错误恢复和推理成本影响。

2.4T 总参数之外,95B 激活参数更有参考价值

预览版发布时,外界只知道 2.4T 的总参数量。正式版披露 95B 激活参数后,模型的推理形态更清楚:它采用稀疏激活思路,每次生成无需调用全部 2.4T 参数。

对开发者来说,95B 仍然是很大的激活规模,但它比“2.4T”更接近推理成本与部署门槛。判断开放权重版本能否被实际部署,还要等官方公布专家结构、显存需求、量化方案、推理框架兼容性和许可证。

官方基准中,Qwen3.8-Max 在 PaperBench、IFBench、OSWorld-Verified 等项目上给出了接近或超过部分国际旗舰模型的成绩;在 CoWorkBench、JobBench 与 AndroidWorld 等测试中则仍有差距。现阶段这些数字适合用来选择测试方向,不宜替代团队自己的任务集。长程智能体的价值往往不在一次回答,而在多小时执行后是否仍能保持目标、留下可审计过程,并在失败时安全退出。

API 已可用,国内价格低于预览期

开发者已经可以通过千问 AI 平台调用 Qwen3.8-Max。公开价格如下:

计费项

国内价格

国际价格

输入

12 元 / 百万 Tokens

2 美元 / 百万 Tokens

输出

36 元 / 百万 Tokens

6 美元 / 百万 Tokens

隐式缓存命中

1.5 元 / 百万 Tokens

0.25 美元 / 百万 Tokens

长程任务会反复读取代码、文档和历史状态,缓存价格因此比普通聊天场景更重要。不过,单价只是成本的一部分。模型如果运行十几个小时并调用大量工具,总 Tokens、重试次数、外部服务费用和人工验收时间都会进入最终账单。

正式版还接入了千问办公。这个组合把模型能力直接放进文档、表格、演示稿和网页等交付场景,对小团队比单纯的榜单名次更有现实意义:不需要先搭一套 Agent 基础设施,也能观察模型是否真的可以把复杂任务推进到可编辑成果。

小团队最值得先测的三类任务

Qwen3.8-Max 的优势主张集中在长程执行,评测也应该围绕可验收的完整任务设计,而不是只问几道知识题。

  1. 有测试集的代码任务:选择一个可隔离的仓库,让模型完成跨文件修复或小型功能开发。记录测试通过率、人工返工次数、工具失败恢复和总成本。
  2. 可核对的办公交付:用脱敏材料生成行业研究、合同条款表或经营分析,逐项检查引用、数字、格式与遗漏,不把“文件已经生成”当成任务完成。
  3. 带视觉反馈的制作任务:让模型完成网页或交互原型,并要求它根据截图检查布局。重点观察多轮修改后是否引入新的回归。

测试时应限制写入范围、网络权限和最高预算,并保留每次工具调用记录。连续运行时间越长,权限失控、错误累积和成本超限的风险越高。涉及合同、财务、客户数据或生产系统时,仍需人工审批关键动作。

下一个验证点是权重和许可证是否如期出现

官方给出的时间表是下周发布 Qwen3.8-MaxQwen3.8-27B 的开放权重。对大多数独立开发者来说,27B 版本可能比 2.4T Max 更接近可部署范围;但在文件、许可证、量化版本与推理指南出现前,具体硬件需求和商业使用边界都还不清楚。

因此,这次上线可以分成两个阶段看:API 与千问办公已经提供了立即可测的正式产品;开放权重是下一周需要核验的交付。小团队现在适合用真实任务建立能力和成本基线,等权重真正发布后,再决定是继续使用托管 API,还是评估更可控的自部署方案。