7月19日,阿里千问在X上发了一条推文。

「Qwen3.8即将推出并开源权重,凭借庞大的2.4T参数,我们相信它是当今最强大的模型之一,仅次于Fable 5」。


一句话,两个信息:第一,2.4万亿参数;第二,全球第二。但你翻遍这条推文的评论区、Qwen的GitHub仓库、官方博客、阿里云开发者社区,找不到任何一张benchmark对比图。没有MMLU分数,没有SWE-bench排名,没有Arena Elo,什么都没有。

一个号称「仅次于Fable 5」的模型,却没有公开任何性能数据。这就很有意思了,所以我们干了件最简单的事:自己测。

官方说了什么?

先看看阿里官方到底公布了哪些信息。

在阿里云开发者社区的文章里,Qwen3.8被描述为一款「2.4T参数级全模态旗舰预览模型」,原生支持文本、图像、视频、文档处理,128K标准上下文窗口,可拓展至1M token。相比前代Qwen3.7-Max,「实现全方位跨越式升级」。

听起来很美好,但仔细读完整篇文章,你会发现一个规律:所有的性能描述都是定性的,没有一个是定量的。

「综合编码实力远超前代版本,达到行业顶尖水准」,具体在哪个benchmark上超了多少?没说。

「长周期智能体自治能力大幅强化」,跟谁比?强了多少?没说。

「综合实力比肩全球前沿顶级AI模型」,哪个模型?差多少?还是没说。

整篇文章最精确的数字,是定价:日间1折,夜间0.2折。这不是技术发布,这是营销文案。


阿里自己也说了,这是个预览版,模型「将以天为单位快速进化」,翻译成人话就是:后训练还没做完。

所以核心问题就变成了:这个没做完的预览版,到底能用吗?既然官方不给数据,我们自己测。

我们测了什么

我们设计了5项测试,按场景分类:

01-03:编码与Agent核心能力,验证官方主打的强项。04:3D浮岛创意项目,用GPT-5.6和Kimi K3的同一道题,原题复现,看编码能力的天花板。05:深度分析写作,看看非编码能力到底是不是短板。

测试平台是Qoder,模型版本Qwen3.8-Max-Preview。所有测试都是首轮结果直接记录,不修不改。

基础编码:够硬

第一道题是LRU Cache,用Python实现,要求O(1)时间复杂度,附带5个测试用例。

Qwen3.8选了哈希表加双向链表的组合,技术选型没有问题。代码直接复制到本地就能跑,5个测试用例全部通过。数据结构严密,边界处理也到位,比如key不存在时返回-1。对于基础算法题,没什么好说的,过了就是过了。


全栈开发:14个文件,一把跑通

第二道题是完整Todo应用,前端React加TypeScript,后端Flask,前后端对接完整,再加启动说明,一次性给出所有文件。

Qwen3.8生成了14个文件:11个前端组件加配置,2个后端文件,1个README。npm install之后前端正常启动,Flask后端也跑起来了,前后端对接没有问题。


UI这块,说实话比预期的好。简洁的现代风格,鼠标悬停的过渡动画做得挺到位,筛选功能的交互逻辑也正确:全部、已完成、未完成三个Tab切换流畅。


有个细节,前代Qwen3.7系列在HN上被用户评价为「完全不可用」,理由是「偏离轨道、死循环、无法调试」。从3.7到3.8,至少在Todo这种中等复杂度的全栈项目上,进步是肉眼可见的。

Agent任务:Cowork确实是真本事

第三道题是官方最引以为傲的Cowork场景,给Qwen3.8一个真实的GitHub仓库链接,让它先分析结构,再找3个bug,最后给出修复方案。

我给的仓库是GangBeng,一个相对小众的Python做的拼豆网站项目。

第一步分析仓库结构,模型正确识别了项目的主入口、核心模块、配置文件和依赖关系,没有胡编。第二步找bug,提了3个问题:一个资源泄漏,一个异常处理缺失,一个类型推断问题。逐个验证了一下,都是真实存在的。


然后我让它把仓库克隆到本地,按方案修复bug。它完成了,修复后的代码能成功运行。

结合起来看,Qwen3.8在编码和Agent任务上的表现是扎实的。基础算法能过,全栈项目能跑,Agent也能多步执行。至少在纯编码场景下,「仅次于Fable 5」的差距可能没有想象中那么大。但真正的好戏,在下一道题。


3D浮岛:翻得很彻底

这是文章最核心的一个对比。

两周前我们测GPT-5.6的时候,用了一个3D浮岛创意作品集的Prompt。完整的技术栈:React加Three.js(React Three Fiber),要求程序化生成浮岛、滚动驱动相机叙事、Bloom后处理、交互物件、性能优化,难度标签是四星。

GPT-5.6 Sol当时的成绩:功能完整度18/20,大部分Prompt要求都实现了,甚至自动加了背景虚化这种没要求的细节。GPT-5.6 Luna虽然最便宜,至少逻辑是对的,转场也还在。GPT-5.5虽然颜色审美一言难尽,但镜头推拉和物件交互都能正常运作。

甚至在后续给Kimi K3的时候完成的比GPT要更好。

同一道题,同样的Prompt,给了Qwen3.8。

跑起来了,npm install没报错,npm start也启动了。岛确实浮在空中,有几棵树,有些草,有个岛的模样,静态场景还算能看。

但到此为止。


四个滚动章节?没有镜头变化。相机只是在原地不动,你滚你的,它看它的。展示物件倒是摆了三四个,但鼠标悬停不发光,点击不拉近视角,emissive增强完全没生效。Bloom后处理在哪里也不知道。萤火虫粒子没有,云雾淡出也没有。


测试过这个Prompt的6个模型里(GPT-5.5加5.6三个变体,Kimi K3,Qwen3.8),Qwen3.8的成品是最差的一个。这不是「审美不好」的问题,是逻辑都没有跑通。GPT-5.6 Luna再简陋,至少把滚动驱动的框架搭出来了,物件能交互,相机能动。Qwen3.8只完成了3D场景的静态渲染部分,剩下所有涉及动效和交互的需求,基本没做。


这完美解释了为什么阿里自己不提非编码能力。3D场景的动效和交互需要的不是纯粹的代码逻辑,而是对视觉效果、用户体验、设计品味的综合判断。这部分能力,恰好是后训练还没覆盖到的。

非编码写作:意外的亮点

但最后一题,画风突变。

我让Qwen3.8写一篇1500字以上的分析文章,主题是2026年上半年中国AI大模型密集发布潮。同样的Prompt,之前让GPT-5.6跑过,结果是一篇典型AI文:每段只有一句话,满篇「不是而是」句式,读到一半就想关。

Qwen3.8这篇,不能说惊为天人,但至少有模有样。段落结构合理,论证有层次,从资本驱动、技术追赶、市场需求三个角度拆解了密集发布潮的原因。引用的数据大多是真实的(抽查了两个数据点,都能搜到原文)。最关键的是,没有那种「值得注意的是」「不可否认」「综上所述」的AI套话味。


分析深度打个4分,比GPT强,比Fable 5还是有差距,但考虑到这是以编码为主打场景的模型,文章质量已经超出了预期。

这个结果其实有点意外,非编码能力是Qwen3.8明确承认的弱项,但具体到中文长文写作这个子场景,表现反而不错。可能的原因:中文写作的训练数据本身就有优势,而且这个任务不涉及复杂的逻辑推理或多模态处理。

所以Qwen3.8到底排第几?

回到文章标题的问题。要给出一个诚实的排名,得分场景来看。

纯编码场景下,Qwen3.8跟Kimi K3同一梯队,跟Fable 5的差距在10几个百分点左右,属于「同一级别但略弱」的范畴。考虑到当前预览版近乎免费的定价,性价比极高。如果你的工作流以写代码为主,它完全够用。

Agent任务上,Qwen3.8的表现甚至可能是这个价位上最好的选择。我们的实测中,Cowork场景的多步自主执行确实靠谱,从分析仓库到修复bug全程没有断链。

但如果你需要创意编程、3D可视化、前端动效这类编码加审美的复合型任务,现阶段Qwen3.8还差得远。不是参数不够,是后训练还没做完。你用它能搭出一个功能完整的全栈应用,但不要指望它能生成一个让你「卧槽」的3D场景。


至于「仅次于Fable 5」这个说法,在编码维度上基本站得住,但在全面评测的场景下,水分不小。没有公开的benchmark数据、没有技术报告、没有模型卡,只靠一条推文和一篇营销文案立Flag,这种发布方式本身就说明:阿里自己也知道,东西还没做完。


正式版预计一个月后发布,届时会开源。如果后训练能补上非编码能力这块短板,定价保持目前策略,Qwen3.8确实有机会成为Fable 5之外最实用的选择。

但不是现在。

这件事还有一层更大的背景,就在Qwen3.8发布的同一周,Kimi K3(2.8T)和DeepSeek V4也相继亮相。三天三连发,全部逼近或突破2万亿参数。

中国模型在参数规模上已经不输硅谷,性能差距收窄到个位数百分点。但Qwen3.8这次「裸奔式」的发布,有参数没数据,有口号没证据,暴露了一个问题:造出大模型的能力是有了,但把模型打磨到能拿上台面接受公开审视的能力,还在路上。

预览版也好,限时1折也好,本质上是一次大规模公测,阿里需要用户反馈来完成最后那一轮打磨。

而我们这些用户,就是打磨过程中的小白鼠。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给个星标⭐~

谢谢你看这篇文章,我们,下次再见。

>/ 作者:高晓阳