中国政策档案 Governance Archive HOLDINGS 252,928 · FONDS 267
Record · 葬AI ACC. 900091586

Qwen 3.8 Upgraded: A Pure Workhorse Model

Qwen 3.8升级纯血力工模型

Issuer
葬AI
Date
2026-08-05
Instrument
other
Cited by
0
This media review benchmarks Alibaba's Qwen 3.8 Max large language model, finding strong coding, agent, and browser-automation performance but weaker multimodal and one-shot generation. It is a product evaluation rather than a government policy document.
Full text · 原文 3,502 字
0·1Qwen 3.8 Max是一个很适合干活的模型。<br> 「下次别做汪峰了」<br> Qwen 3.8 Max是一个很适合干活的模型。<br> 它的编程和Agent能力,稳定地呈现出一流模型水平,仅次于GPT 5.6 Sol和Fable/Opus 5,略微超越K3。所以阿里可以在宣传里强调「编程与办公,全面跃升」。<br> 在葬AI和AI浏览器ego (lite)合作的浏览器专项测试中,Qwen 3.8 Max也是一流水平,仅次于硅谷双子星。这块后文会专门展开。<br> Qwen 3.8的软肋在多模态和一次性生成能力。最典型的场景是一次性生成漂亮网页和小游戏,这一块Qwen 3.8显著落后K3,后者专门优化了这块能力。<br> 所以,评价Qwen 3.8 Max是一个定位问题。<br> Qwen 3.8 Max没有在模型产品化上多做一步,导致用户很难靠生成一两个小游戏觉得模型牛逼。它不是一个独立的模型产品,而是一个为集团业务服务,能力相对均衡稳定的基座模型。<br> 让我们来逐项充分检验Qwen 3.8 Max的能力。<br> 首先登场的是ego (lite)为我们准备的浏览器基准测试。<br> 这个bench主要用于考验模型在真实浏览器里操纵网站、搜索规划和填表的能力,总计有31道真实任务。<br> 包括统计Hacker News的热门帖、筛选IMDb 科幻电影、申请OpenAI 的职位、去Reddit找工作、填写从纽约到迈阿密的单程航班表单、通过查询就业人数和年均工资比较两个地区谁更适合零售门店扩张等等。<br> 在跑完31道真实任务后,Qwen 3.8 Max的得分仅次于硅谷双子星Claude和GPT。<br> 结果一目了然。横轴代表价格,竖轴代表成绩。<br> 右上角是贵又好,GPT 5.6 Sol(跑完测试花了602元)第一、Fable 5(600元)和Opus 5(359元)其次,第四名是Qwen 3.8 Max(215元)。<br> 值得一提的是,Qwen 3.8预览版成绩还比正式版略高一点,多做对了两道题。有波动很正常,不过也说明正式版在浏览器调用上提升不大。<br> 必须要说明的是,这个bench是首发,绝对没有任何模型厂商刷过,纯纯靠模型本身的能力来跑。<br> 我们很快会专门拆解各家模型在这个bench的表现,今天先只爱Qwen。<br> 以一道亚马逊找差评的题目为例。要求各家模型去亚马逊找到一款不锈钢水杯(产品要至少有 1000 条顾客评价),通过顾客评论找到这款水杯在什么情况下会漏水,最后筛选出最有信息量的一条漏水评论:<br> Qwen 3.8 Max选了一款不锈钢运动水杯,有8676 条顾客评价。<br> 接着直接开始搜索差评,逻辑清晰,页面显示找到了 28 条相关结果,最后筛选出「只要杯子倒在侧面,水就会漏,而且不管怎么拧紧盖子都没用。」这一条。<br> 大部分模型都能搜索到水杯,但无法筛选出真实差评。<br> 比如GLM5.2(170元)就找到了评论区,但一直都在看 AI 总结的泛评论内容,没把具体顾客的差评找出来,和它表现一样是Seed Evolving(98元),不懂这俩模型咋这么爱看AI总结呢?<br> 接下来登场的是老朋友葬AI基准测试。<br> 让每个模型跑10轮知识图谱构建任务,通过重复任务来考验模型的稳定性,拉出区分度。<br> 如图所示,Qwen 3.8 Max的表现和K3、Opus 5差不多,都属于一个梯队。<br> 考虑到Claude终于封了我的号,而中转站API因为大厂疯狂蒸馏又不太稳定,所以Opus 5分数偏低也很合理。<br> Qwen 3.8的优点是工程相对可靠,很少犯根本性错误,扣分点都是一些细节问题。<br> 跑完测试花费38元API成本,略低于K3(43元),远低于GPT 5.6 Sol(87元)、Fable5(188元)和Opus 5(273元,调用次数畸高导致缓存命中成本高)。<br> Qwen 3.8只能说在同档次模型中有性价比。真论性价比,DeepSeek V4 Flash正式版只花了一块钱,斩杀线真是恐怖如斯。<br> 需要说明的是,情理之中,这个测试可能已经被模型厂刷过了。<br> 过去一个月MiniMax M3和混元Hy3跑分持续提高,终于在这周高到不正常,我加测了几轮都是这个成绩。Hy3可能是刚好提升了知识图谱相关能力,没找到把柄。<br> 但M3就很幽默了。因为它过往要花十多分钟完成的任务,M3有一半轮次都只花了2-3分钟完成,还大都是高分,存在套模版嫌疑。下次跑bench真得换题了😭<br> 上述两个测试,浏览器调用和工程稳定性都是Qwen 3.8 Max的舒适区。接下来,我们要狠狠触摸Qwen的多模态软肋了。<br> 有请良子。<br> 首先请各位模型根据良子照片生成3D白模。<br> 结果一目了然,GPT 5·6 Sol是最像的。K3的脸也很像,可惜胃袋糊成了一坨,总体和脸不像但很轮廓清晰的Fable 5坐一桌。<br> Qwen 3.8 Max生成的还行,胃袋也糊了,但脸部很清晰地体现出良子笑得很开心。相较于预览版生成不明白模型人脸,有了不小进步。<br> 还有乳豆环节。不知道豆姐是不是歧视良子,给你良弟整成埃及狮身人面像了。字节在Seedance上扬眉吐的气都让你豆姐暴风吸入回去😭<br> 接下来是MD动画环节。 有请良子和峰哥一起上。<br> 我让几个模型根据良子峰哥玉照,自由生成30秒MD动画。尽可能发挥创意,看看大伙能整点什么活。<br> GPT 5·6 Sol依然是最好的,生成了一个完整的小故事。OpenAI你就学去吧,这公司比A畜全方位地强。K3的水平就有所滑坡,远不如上次复刻自家宣传片的风采,直接给峰哥头整掉了。<br> 这里多插一句,K3的官方API这几天很不稳定,跑ego浏览器测试遇到了8个题提前结束任务,后面都复跑了。跑葬AI测试也遇到了类似问题。可见爆款也有爆款的烦恼,算力不够确实影响用户体验。Qwen 3.8 Max也生成了一个完整的小故事,画面虽然不如GPT 5·6 Sol,但也好过忙不过来的K3。就是画面里峰哥给良子摘果子像自己拉的,不太雅观。<br> Seed Evolving依旧稳定发挥,不仅给良子脱了衣服,还给你峰哥进行了一个头身分离。<br> 由上可见,Qwen 3.8 Max正式版的多模态能力还是进步不小。我拿正式版又复刻了一次K3宣传片,和预览版产物拼到一起作对比。<br> 一目了然,复刻得细致了不少,但依然不如刚发布时的K3。<br> 最后总结一下吧。<br> Qwen 3.8 Max发挥了家族一贯特色,就是都挺好都挺强,但就差一点点。<br> 上个赛季被GLM 5.2靠极致后训练优化编程能力压过一头,这个赛季又遇到Kimi突然憋个大的。<br> 后者不仅领先几天发布首个2T参数开源模型,还在模型产品化前进了一步,靠极致优化前端一把梭能力,精准hack了人民群众评价模型基本只看生成漂亮网页这个既成事实,让人确实服气。<br> 回过头看,Qwen 3.8 Max是一个足够好的模型。<br> 它在编程能力上略微超越K3,多模态能力也补上了短板,并且定价和实际花费都略低。考虑到阿里旗下Qoder、千问办公等产品都在搞打折促销,实际使用价格会更低。<br> Qwen 3.8 Max也是一个开源模型。并且,小参数27B版本也将开源,再次利好深圳硬件佬搞各种神奇发明。<br> 在其他模型厂一时半会发不出2T参数模型的前提下,Qwen和Kimi毫无疑问是开源双子星。<br> 集美一词的发明者郭老师说,集美是集中美丽集中智慧的意思。那么,极致优化前端能力的K3可以称之为集美模型。<br> 作为镜像,不懈努力勤劳肯干的力工,则是Qwen 3.8 Max的代名词。我们可以称之为力工模型。<br> 集美和力工正适合一起组乐队,永远在一起❤️<br> 然而,残酷的事实是,国产模型卷到飞起。GLM 5.3和DeepSeek V4 Pro正式版都即将发布,前者猛猛优化编程能力,后者极致性价比。<br> 几乎所有国产模型都在按周迭代。任何一个国产模型,都最多只能领先一个月,就一定会陷入同质化竞争,直到两个月后谁憋出来个大的。<br> 2026年下半年的残酷图景是,模型本身会越来越趋同。我们只能以一线和二线这样的粗略划分来区分模型。每个大档次内部,不同模型之间基本只有价格、速度的区别。<br> 这说明AI应用的好日子要来啦。<br> 因为大模型的性价比在提升,一线模型还能以几分之一Claude来定价,二线模型就只能几乎免费。模型同质化,就只能从应用找价值差异。<br> 最大的战场,办公Agent的参赛方还在蓄力。战场角落里,类似ego (lite)和Raft这样垂直但有用的产品正在发育。<br> 大的已经来了,还不止一个大的来。<br> (本文封面由ChatGPT 生成,纯人工写作)<br> ⬇️<br> 欢迎订阅我们的Substack funeralai.substack.com