中国政策档案 Governance Archive HOLDINGS 252,928 · FONDS 267
Record · 葬AI ACC. 900091587

To Video Models: If the Public Is Not Pleased, You Do Not Count

致视频模型:群众不喜闻乐见,你算老几

Issuer
葬AI
Date
2026-08-07
Instrument
other
Cited by
0
This report introduces meme bench, a crowdsourced blind benchmark for video-generation models, built around 50 popular meme prompts and evaluated by 400 volunteer raters using an Elo ranking system. It presents results in which MiniMax H3 and ByteDance's Seedance 2.0 outperform Seedance 2.5, and invites readers to participate in the ongoing test.
Full text · 原文 3,239 字
0·3**「🤡meme bench发布**」** 为了更好地评测视频模型的能力,葬AI历时半个月整了个大活:meme bench。<br> 「🤡meme bench发布」** 为了更好地评测视频模型的能力,葬AI历时半个月整了个大活:meme bench。<br> 大部分人没有意识到的一个盲区是,大模型好坏是一个定义问题,Benchmark即权力。<br> 字节的视频模型Seedance 2.0在过去半年是无敌状态。Seedance 2.5有所提升,但这意味着2.5一定比2.0好吗?<br> 不是这样的。<br> Seedance 2.5定向提升了电影质感,价格大涨,结果在指令遵循、复杂动作等方面,反而有所倒退。<br> meme bench是一套短视频生成盲测。有50道题目,都是B站抖音的热门梗图。 我们让所有模型用相同图片和提示词生成视频,再让找到的400位大学生和网吧家人在网站上进行盲选,直接选择视频的好坏。<br> 我们相信的基本道理是,视频模型的定义权应该交给更多数人,不能由十几个研究员定义模型好坏。<br> 因为这是个一眼能看明白的事情,生成一段AI视频,谁好谁坏一目了然。<br> meme bench采用的是棋类比赛常用 Elo 机制:战胜强模型加分更多,输给弱模型扣分更多,再把所有两两对决连起来,算出模型之间的相对实力。这样就不会因为打标次数过多或过少影响单个模型的排名。<br> 核心目标只有一个,SOTA模型要让人民选择!评测要为广大人民服务!<br> 非常出乎我们意料的是,Minimax H3获得了第一,和Seedance 2.0得分接近,这两个模型也都略微领先于Seedance 2.5 。<br> 我们一开始以为是样本量不足的问题,扩大测试人次后,H3和Seedance 2.0的领先反而扩大了,H3甚至最后对Seedance 2.5保持了55%的胜率。<br> 这是我们的测试网站,你可以自己做完测试,得分也会进入排行榜。看看你自己选出来的是哪些模型。<br> https://video-arena.com (建议大家在浏览器里打开)<br> 需要特别说明的是,meme bench没有接受任何赞助。我们事先也无法预料到几百位网吧家人会选出这样的结果。<br> 让我来展开解释下meme bench是怎么构建的。<br> 做这个bench的初衷是,我们想用一种更好玩的方式来衡量视频模型的能力。<br> 所以,我们人工筛选了50张B站、抖音流行的梗图,并且为每张图片写了夸张的提示词,从而尽可能测试模型没有专门训练的场景。<br> 比如请乌鸦哥像直升机一样旋转。<br> 让模型评测更通俗易懂的好处是,我们可以发挥人民群众的力量。 沐秋去网吧比我勤,于是他发动了网吧哥们,在大学生兼职群等各种渠道,先后找了400人次打标 aka 做完一轮测试题目。<br> 大学生兼职群遇到的最大难题是,可能常年号召这些家人做问卷只用发个红包,以至我们直接挨个发钱总被当成骗子踢出去。<br> 在Seedance 2.5和H3发布前,meme bench排行榜的情况非常简单,Seedance 2.0大幅领先其他所有模型,生成的短视频完成度最高,指令遵循最好,强得一目了然。<br> 比如在「男子的咪咪变成钛合金乳头,发射激光把整栋房子切得四分五裂」视频中,几乎只有Seedacne 2.0是字面意思遵循了指令。其他模型都过于羞怯,发射激光的位置不对。<br> 特别在复杂场景下,Seedance 2.0的画面明显更流畅、丰富,还会自己剪辑运镜。 但问题在于,Seedance 2.0有时候动作不够连续,会省略中间步骤。 「男子的手机忽然放电,把男人和河里的鱼全电麻了」这个视频中,Seedance 2.0直接从手机放电画面跳到了一片死鱼,却没有传导路径。<br> 这也是MiniMax H3能后来居上的原因:极强的指令遵循能力。<br> 在我们的meme bench中,MiniMax H3甚至像一个升级版的Seedance 2.0。 H3在多个测试中,都做到了画面连贯流畅,显著好于会在复杂动作中省略过程的Seedance 2.0 。<br> 比如,「一堆人扭曲地在地上爬行,连成蜈蚣形状」视频中,Seedance 2.0 就省略了一堆人连成蜈蚣的过程,画面极其诡异。<br> H3也体现出更好的生成复杂场景的能力。「绿幕钻出超多小鸟」这个视频中,H3生成的动作画面也比Seedance 2.0更自然。 特别是一大群小鸟出现的方式,H3有循序渐进的动作过程,Seedance 2.0让一大坨小鸟违反物理规律地喷涌而出。<br> 和二线视频模型对比,H3的优势体现得更显著。特别是在激烈动作场景,二线视频模型普遍很不流畅。 至于屈居第三名的Seedance 2.5,它的优缺点都很突出。<br> Seedance 2.5是画面最真实、最接近电影质感的模型。<br> 「冷链车门被打开了,鸡鸭鱼猪追着男人跑」视频中,其他模型都能看出来AI痕迹,Seedance 2.5看起来完全像电影原片。<br> 但是,除了画面色彩、质感最接近电影以外,Seedance 2.5其他能力并没有显著升级,甚至复杂场景的动作连贯性有所倒退。 在考验模型创意的狂野场景,Seedance 2.5的表现过于糟糕,让人怀疑它专门抑制了模型的想象力。<br> 在不涉及复杂动作的情况下,Seedance 2.5生成的画面才更有细节,更像真实场景。<br> 类似的场景,MiniMax H3生成的就不够真实质感,像是B站鬼畜视频。 「男子被砖头砸了头但砖头碎成了粉末,他的头闪闪发光,身后浮现出100个菩萨」这条视频,显示出Seedance 2.5流畅连贯的镜头切换,菩萨、刀割这些画面细节更是它的强项。<br> 我们测试后的结论是,Seedance 2.5是一个严重偏科的模型,最严重的问题是复杂动作不连续,比如: 「男子转身走到墙边,一手从墙上飞速取砖块递给另一只手,另一手像发射炮弹一样一块块扔出,打爆了远处的楼房」视频中,Seedance 2.5生成画面与提示词偏差严重,远近镜头之间生硬跳切。<br> 这说明,Seedance 2.5善于生成电影质感的大场景和具体人物细节,但大场景和具体细节之间缺乏连贯动作。近似于一种高级PPT。<br> 再考虑到Seedance 2.5的价格,只能说这不会是一个人民大众能随便用的模型,纯给片厂导演用的。<br> 篇幅有限,没办法挨个解读所有模型,完整的分析报告在这个飞书链接里。<br> https://likczh6fsao.feishu.cn/docx/KorydhPbIoKR8TxU2t6chhDfnGd<br> H3不幸成为排行榜第一后,我们预料到会产生争议。但增加了更多人次打标后,试图看看Seedance能否重回第一。<br> 结果H3的胜率仍然最高。胖猫是经受人民选择的视频模型!<br> 唯一需要打补丁的是,本次模型生成的场景是图生视频,考验的是复杂场景激烈动作和指令遵循,也许恰好打在 H3的舒适区里了——这也是Seedance需要补课的地方。<br> 如果你不满意这个结果,可以自己上网站打标,选出你最喜欢的模型。<br> meme bench的核心目的只有一个:不应该由一小撮研究员或者影视从业者来定义美。<br> 倾尽全力模仿电影并不能成为一个更好的视频模型,也许可能会与大众审美背道而驰。<br> 因为浓缩了整个互联网知识的大模型肯定要为所有人服务。几十个计算机背景的研究员就能定义模型审美,是一种非常原始野蛮的开发方式,反而大专生对模型审美的判断会比博士更具说服力。<br> meme bench在之后会继续更新,任何具有竞争力的新模型都会在网站上更新,家人们可以随时来打榜。<br> 这是我们视频bench系列的第一步。未来,我们会将推出更多场景、更细分的bench(比如广告、影视、游戏和表情包),争取全方面评测出最值得大伙信赖的视频模型。<br> 当然,我们也会推出一系列世界模型和一系列AI数字人PK的bench,我的意思是期待Vivix大展拳脚吧。<br> (本文封面由ChatGPT 生成,纯人工写作)<br> 欢迎订阅我们的Substack funeralai.substack.com