阿里发布最新AI模型Qwen3.8-Max 总参数量2.4兆 处全球顶尖水平

撰文: 吴真铭
出版:更新:

8月3日,阿里巴巴发布最新AI大模型Qwen3.8-Max,总参数量2.4万亿,为Qwen家族迄今最强大的模型,将于下周开源。据《IT之家》报道,在3日放榜的第三方模型评测榜单Arena中,阿里Qwen模型仅次于Anthropic的Claude系列,整体性能处于全球大模型顶尖水平。

8月3日,阿里巴巴发布最新AI大模型Qwen3.8-Max。(“千问大模型”微信公众号)

据“千问大模型”微信公众号介绍,Qwen3.8-Max建立在Qwen3.5架构基础上,参数规模扩展至2.4万亿,激活参数950亿,支持100万上下文Tokens,在编程、办公、科研以及长周期任务等方面实现了全面提升。Qwen3.8-Max不仅能应对更具挑战性的问题,还能更可靠地端到端完成复杂任务,输出值得信赖的成果。该模型权重将在下周开源,同时,也将开源Qwen3.8-27B模型。

消息指出,目前,全球开发者都可通过千问AI平台获得Qwen3.8的API服务:中国内地每百万Tokens输入12元(人民币,下同)、输出36元,隐式缓存命中1.5元;海外每百万Tokens输入2美元、输出6美元,隐式缓存命中0.25美元,与海外相近智能的前沿模型比,Qwen3.8有更高性价比。

Arena放榜,Qwen3.8-Max在 Text Arena、CodeArena、VisionArena上的成绩。(“千问大模型”微信公众号)

“千问大模型”介绍了Qwen3.8-Max的编程能力。测试要求Qwen3.8-Max从零创建项目,并在十天级长程自动编程中构建一套自进化 harness。结果显示,截至2026年7月30日,完全由AI自主运行约16天后,仓库累计留下265次程式码提交、127个合并请求和151个问题工单,展现出持续演进的自动编程能力。

Arena放榜,Qwen3.8-Max在 Text Arena、CodeArena、VisionArena上的成绩。(“千问大模型”微信公众号)

在专业办公方面,阿里从数百种高价值职业的高频工作场景里压力测试了Qwen3.8-Max 交付生产级成果的广度。以企业律师为例,Qwen3.8-Max面对百余份文档的语料,单次通读即标出1284条相关条款,并在一小时内全部审阅完成。以结构工程师为例,Qwen3.8-Max仅凭一份图纸,在浏览器中还原30层写字楼的抗震结构模型。

针对长程任务,阿里基于淘宝天猫真实脱敏交易数据构建了E-Commerce Bench测试模型,以模拟365天长周期电商经营为基准。Qwen3.8-Max需使用10万元启动资金同时运营多家网店,独立完成选品、供应链议价等工作。结果显示,Qwen3.8-Max最终以高达41.6万元的总现金胜出,比第二名GLM 5.2高出38%,相较上一代旗舰模型Qwen3.7-Max提升152%。

Qwen3.8-Max在QwenWork、Claude Code、Codex、OpenClaw、Hermes等众多harness上取得相当的性能表现。(“千问大模型”微信公众号)

另据《IT之家》报道,在3日公布的第三方模型评测榜单Arena中,阿里Qwen模型仅次于Anthropic旗下Claude系列,整体性能被指位居全球大模型顶尖水平。目前Qwen3.8的API已在千问AI平台上线,并接入阿里同日推出的AI Agent产品“千问办公”。

6月11日,千问举办首个足球预测AI助手上线沙龙。(千问官方)