Qwen3.8评测:2.4万亿参数基座模型的编程新标杆

AI聊天 2026-08-07 97 阅读
Qwen3.8 阿里巴巴 大模型 AI编程 开源模型

2026年8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8。总参数量达2.4万亿,在权威三方榜单Arena中整体性能仅次于Anthropic的Claude系列,处于全球大模型第一梯队。

模型概述

Qwen3.8是阿里巴巴继Qwen3.7系列之后的最新旗舰基座模型。在编程能力(Coding)这一前沿大模型核心能力上,Qwen3.8实现了自主编程的新突破。在权威CodeArena榜单中,Qwen3.8位居全球第四

与两年前仅能写好函数、补全代码的前沿模型不同,Qwen3.8可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人类干预。

核心能力突破

自主编程能力

Qwen3.8最引人注目的能力是其端到端自主编程。测试案例显示,只需一句"创建一个自进化的智能体Harness",Qwen3.8就像资深工程师一样,从零开始自主搭建循环工程框架,编排智能体自动领取和执行任务。

人类工程师还可通过钉钉给Qwen3.8提出新要求。模型独立编程运行约16天后,做出了一个真实可用的自进化智能体框架"oh-my-cli",该项目已完全开源,完整过程保存在GitHub仓库中。

性能与性价比

Qwen3.8的API已上线千问AI平台。国内定价为每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元。国际价格仅为Opus5的40%(输入)和24%(输出),实现相近智能更高性价比。

Qwen3.8-Max预计下周开源,同时还将开源Qwen3.8-27B版本。阿里云表示,全球开发者都可通过千问AI平台获得Qwen3.8的API服务。

与竞品对比

在Arena榜单中,Qwen3.8仅次于Claude系列,整体性能处于全球第一梯队。相比GPT-5.6Kimi K3,Qwen3.8在编程场景下的自主交付能力尤为突出,而其API价格仅为国际顶尖模型的四分之一。

优缺点分析

优点:编程能力全球第四、端到端自主项目交付、开源策略开放、价格极具竞争力、中文理解能力顶尖。

缺点:部分超长上下文场景仍不及Claude Opus 5、复杂多模态任务有提升空间、企业级安全合规能力待验证。

适合人群

Qwen3.8最适合中文开发者、企业级应用开发、全栈项目交付等场景。对于需要从零构建完整项目的开发团队,Qwen3.8的自主编程能力可以显著缩短项目周期。结合DeepSeekKimi K3使用,可以覆盖从代码补全到全项目交付的完整编程需求。

总结

Qwen3.8的发布标志着国产大模型在编程能力上已进入全球第一梯队。2.4万亿参数、CodeArena全球第四、自主项目交付、四分之一的价格——这四个数据点构成了Qwen3.8的核心竞争力。对于追求性价比和中文体验的开发者和企业,Qwen3.8是2026年8月最值得关注的基座模型。