中国政策档案 Governance Archive HOLDINGS 252,928 · FONDS 267
← Back to document 大模型能干,懂模帝会飞
Open original site →
Extracted Text
0·20AI圈最新的趋势是唯模型论,这方面的具体表现有两个: 「模型用浏览器哪家强」 AI圈最新的趋势是唯模型论,这方面的具体表现有两个: 半年前以前还是模型是水电煤,同质化竞争,最后都没有利润,智谱、MiniMax上市是在砸盘。现在争着抢着问智谱新模型啥时候发(智谱自己也有意无意在对外放新模型的料),恨不得立即冲进去炒一波; 一批类似马卡龙这种的幽默AI应用转型成Neo Lab,搞个后训练狂蹭智谱,另一批转型成若干定语的世界模型公司,什么因果世界模型、社交世界模型,感觉世界要末日了。 AI应用跪得都太快了,反而忽略了自己的唯一价值:场景。 模型公司是不懂场景的,他们朝着Coding拼命卷,结果写作能力越来越退步、话也说不利索,搞得现在我看豆包说话都有点眉清目秀了。 所以模型都是纸老虎,看着强但用不到真场景里。 所以模型优化是需要更多真实场景的评测,而这恰恰是应用公司擅长的。 于是葬AI和我们的朋友钟经纬、正阳一起做了款产品:懂模帝。 懂模帝的主要目的是收录应用公司在自己场景上对各类模型的评测。 目前已经收纳了评估游戏开发能力的Gamecraft Bench、测试训模型能力的RSI Bench、让Agent运营一家AI Saas公司的CEO Bench、以及测试模型使用浏览器能力的 Ego Bench等多样评测集。 打开 fuckai.md 即可浏览,从名字就能看出我们对模型的态度: 懂模帝的目的是,让评测集大众化,帮助更多能找到更多元、更符合自己业务场景的评测集,去评估自己应该用什么模型,再到未来用什么Agent、Skill和工具。 只要人人都会后训练,人人皆为懂模帝。那世界不会被模型公司统治,应用公司也不会完蛋! 我们第一期评测的主题是,模型用浏览器到底哪家强? 本期bench和Aute合作。简单介绍下,Aute在做一款叫 ego (lite) 的浏览器,专为人类用户和 Agent 共同使用而设计。 这个产品本质上是在把整个互联网变成模型友好的API,然后你就可以带上自己的 Codex、Pi 甚至 是WorkBuddy来调用它。 从抓取需要登录的网站信息到操控云厂商那复杂无比的后台页面,都能给你办了。于是我一度建议他贴身 WorkBuddy 猛猛炒作。 至于现在的产品为啥叫 lite。他给我看过还未发布的完整版 ego,云端持久在线 Agent + 浏览器 + 各个端的本地控制能力 + 云盘 + 输入法,缝完了属于是。 但这和我们今天的 bench 关系不大,我们回到 bench 上。 整套 bench 总共有 31 道题,绝对数量不多,但都尽量在贴近真实场景并使用真实网站。 包括统计 Hacker News 的热门帖、 筛选 IMDb 科幻电影、申请 OpenAI 的职位、去 Reddit 找工作、填写从纽约到迈阿密的单程航班表单、通过查询就业人数和年均工资比较两个地区谁更适合零售门店扩张等等。 除了整体的结果判定,每道题都设有关键步骤的得分小点,我们选了十六个模型进行跑分, 直接放评测结果: S级:GPT-5.6、Claude Fable 5、Claude Opus 5 A级:Qwen 3.8 Max Preview、Doubao Seed Evolving、DeepSeek V4 Flash B级:GLM-5.2、Kimi K3、Hunyuan Hy3 C级:MiniMax M3、DeepSeek V4 Pro、Step 3.7 Flash D级:LongCat2.0 E级:文心一言 5.1、MiMo V2.5 Pro 表现最好的三个没啥好说的,都是公认最牛逼的。 国模这块,严格来算第一是DeepSeek V4 Flash,在接近一样表现的情况下,只花了几块钱,是所有模型中花费最低的。 对比下来效果还不如DeepSeek的GLM-5.2花了170块。 第二梯队是GLM-5.2、Kimi K3、Hunyuan Hy3,他们和第一梯队的主要差距在于任务效果波动很大。 多说一句,时至今日在跑 Kimi K3 时,我们总能遇到中断、速度极慢、API不稳定的问题,有8个任务都被提前结束了,我们为此重跑了一遍,但 K3 最后的表现依然一般, 目之所及,算力资源和卡还是最重要的事情,我看这英伟达还能涨。 说表现得烂的,文心一言 5.1 就不说了,经典稳定发挥,填进来属于一个纯乐子的作用。 但小米大模型竟然比文心一言还菜我是没想到的。 第一遍跑的时候大部分任务报错我觉得可能是运气问题,于是重跑了 24 个任务。 结果还是有 23 个提前结束,**小米MiMo V2.5 Pro 总是声明自己要下一步做某些事情,但就是不调用 tools,然后会话结束。。。**难道小米大模型专注在上车了? 我问Aute为何会如此,Aute说,「模型能不能积极地完成长程任务,会不会在某一轮提前结束,这本身就是模型能力的体现。」 「之前有用户来吐槽我们东西不好用,我们一看他电脑,他在用 Mimo。」 雷总直接告他别告我谢谢🙏 接着我们来分析各个模型在部分题目中的表现,以下解读也得到了朋友钟经纬的帮助。 第一题直接面对现实,让我们 cos 成美国人,跟模型说在 Yelp(美国大众点评)找一家芝加哥评价好、价格适中的意大利餐厅,日期要选择芝加哥当地时间所对应的「下一个日历周」的星期六,找到后还要在网站上完成预定。 这题感觉天生给美团小美设计的,先看看龙猫表现如何: 结果很可惜,LongCat2.0搜了个名字就歇菜了。这波属于是跟美国大众点评没配合好,水土不服了。 同样一步未成的还有,MiMo V2.5 Pro、Step 3.7 Flash、文心一言5.1和Kimi K3。 国模里Tencent HY3、Doubao Seed Evolving、DeepSeek V4 Pro都完成了预约。 说明这些模型很通人性,建议美团小美可以接他们来用。 第二题是回顾 OpenAI 过去一周的社交媒体表现,了解哪些帖子获得了最多关注和互动,要求排除置顶帖、纯转发,以及标有"Replying to @"的帖子,按浏览量从高到低列出前五条,并为每条提供发布日期、浏览量、回复数、点赞数和互动率,最后计算平均浏览量和平均互动率。 这个任务比较简单,模型或多或少都能给个结果。 国模里完成最好的是Tencent HY3、Qwen 3.8 Max Preview和Doubao Seed Evolving,都完成了任务。 差的模型如GLM-5.2,抓取和排序都做好了,但没有排除Replying to @的帖子,污染了样本;Long Cat 2.0则是一个帖子也没提取出来。 文心一言打开X后,去搜了 2025 年 5 月的帖子,只能说文心一言确实活在去年; 小米更过分,登了账号,滑了两下就一动不动了,直接开摆; K3也是滚一会就不动了。 小米滑了几下就不动了 第三题,让各家模型去亚马逊找到一款不锈钢水杯,通过顾客评论找到这款水杯在什么情况下会漏水,要求产品至少有 1,000 条顾客评分,最后需要总结出最频发的漏水情况。 这道题有两个难点,第一是模型会不会评论搜索,第二要理解评论在说什么,并且选出一条差评。 这个任务里表现最好的是Fable5与Qwen3.8max,圆满完成任务。 剩下大部分模型都能搜索到水杯,但输在没法筛选出真实差评上。 比如K3一直在找 Amazon 的评论搜索框,但一条差评也没搜到: GLM5.2找到了评论区,但一直在翻 Amazon 的 AI 总结,没把具体顾客的差评找出来。 和它表现一样是Doubao Seed Evolving。AI模型爱看AI总结情有可原。 最差的还是小米,搜索完水杯后就一动不动了,死活不去看评论: 以上都是 bench 内的正经题,我们再整些神题来测测。 首先,测试一个模型能通过几关《小鳄鱼爱洗澡》,有没有人懂这个游戏含金量的。 这些逼模型天天说自己要解决世纪数学难题,要是连《小鳄鱼爱洗澡》都过不去可就有意思了。 prompt:按页面说明用鼠标拖动挖开泥土,把水引到小鳄鱼的浴缸。每次通关后选择「下一关」,在任务时间内持续闯关,尽最大努力完成尽可能多的关卡。小鸭是额外收集目标,但优先保证过关。 GPT 5.6打到了第四关,收集了7只鸭子,是模型里最能玩《小鳄鱼爱洗澡》的。 K3、Step 3.7 Flash、Claude Opus 5都卡在开始游戏的界面不动弹,不懂是不是不爱玩游戏。 剩下大部分模型都没多模态输入能力都卡在游戏打开界面。 这也看得出来,我们国产模型都不太爱打游戏,东亚模型就是这样认真好学👍 哦对,之前 ego lite 团队还用 GPT 5.6 玩《梦幻西游》大半天,刷到了 54级。 这下我真得喊话《梦幻西游》的反外挂团队了。《梦幻西游》团队看到的话得算我找到了BUG,记得打钱。 第二个任务是要求每家模型去画奶龙,注意,是要在浏览器内的数字画板上,用鼠标移动画笔一笔一笔地手绘,而不是生成那种各家早已定向优化的画 SVG。 注意,是画奶龙不是画陈冕,为了防止模型理解错,我们还给了参考图。 这下肯定不会画成冕神了 经过一番激烈争夺后,我决定把奶龙王颁给Claude Opus 5.0,它用精确的操控能力证明,劣质画板也能画出好图: 反观豆包画的: 这是否印证了一鸣说过的Seed不蒸馏,因为这个操控画板能力他们从没训练过。 还有几个模型给我交了白卷或者一通乱画: 但最值得说道的是K3。 集美模型太神了,给我把奶龙画成奶娃了。是不是前端美术能力训练过头了,我看这模型快整成美颜相机了。 最后是五子棋锦标赛,一共有16只模型参赛,两两对战,胜者晋级。 第一轮就被淘汰的是,文心一言 5.1、MiMo V2.5 Pro、MiniMax M3、Step 3.7 Flash、LongCat2.0、Doubao Seed Evolving、Hunyuan Hy3、Claude Fable 5。 看得出来,除了Claude Fable 5倒霉的碰上Claude Opus 5.0被干掉后,其他模型的水平实力大伙都是有目共睹的。 决赛是由Claude Opus 5对战Qwen 3.8 Max Preview,Qwen只下了13 手就败下来。 这活本来是想考验模型的棋商,结果一大堆模型都因为3分钟一棋不下直接判负,属于是棋盘都操控不明白。 一圈看下来,结合成本和各个任务的完成度,国模里DeepSeek V4 Flash还是太超模了,梁圣斩杀线的含金量还在上升; 第二梯队如K3,简单任务都能完成,但遇到复杂操作老是提前停,集美模型喜欢知难而退; 第三梯队就是MiMo V2.5 Pro这种,总是声称「下一步要做什么」后就结束,规划是规划明白了,动是真不动。 所以家人们,浏览器相关的任务以后不在乎钱建议用GPT和Claude、在乎就用DeepSeek V4 Flash,可以避雷小米了——这就是Ego bench唯一想告诉大家的。 过去,模型公司爱刷的榜单都是数学、代码、知识问答这些,大伙都用不太上。而在通用Agent成版本答案的今天,真实使用场景能力的才更需要bench去衡量。 这才是应用公司的价值啊😭最后call back一下开头:AI应用是不会完蛋的😭 (本文封面由ChatGPT生成,纯人工写作) ⬇️ 欢迎订阅我们的Substack funeralai.substack.com
Archived Raw HTML