Full text · 原文
3,608 字
0·3放弃旧架构、做新 Tokenizer,MiniMax H3 走出了下一步。<br>
放弃旧架构、做新 Tokenizer,MiniMax H3 走出了下一步。<br>
👦🏻 作者: GaKi<br>
🥷 编辑: Koji<br>
🧑🎨 排版: NCon<br>
7 月的最后一天,MiniMax 发布了新一代视频模型 H3。<br>
这是继字节 Seedance 系列之后,又一个达到 SOTA 水平的视频模型,也意味着头部大厂的视频生成竞争进入了新阶段。<br>
从公布的信息看,MiniMax H3 主打「全模态输入+精准编辑」,让模型直接理解内容并完成成片。在特效后期包装类视频上表现较好,尤其是 UI 设计、广告、MV、游戏界面、AR/转绘效果、电商这些场景。<br>
更重要的是,MiniMax H3 已于今日开源,模型尺寸只有 33B。<br>
在高成本的视频赛道,把「SOTA 性能」和「开源」放在一起,在当下并不多见。<br>
我们拿到了在 H3 上线后,第一时间做了测评,以下是实测的过程,以及一些观察。<br>
首先从能力上来说,这回的 MiniMax H3 视频模型是原生多模态,支持原生的多模态理解和生成,可以做全模态输入。文字、图片、音频、视频这些输入都可以拿来参考。<br>
这个模型比较大的亮点,是它能做比较好的多模态精准编辑和控制。<br>
比如可以用提示词,或者用文字、图片以及视频作为参考,直接往一个视频里加入文字等各种元素。<br>
比如下面这个短视频,相信很多人都刷到过很多次,也是现在很火的一个主题。一只猴子向空中扔出石子,石子不断转化,一镜到底,最终象征人类科技的进步,变成火箭,登上月球。<br>
整个视频是一镜到底的,但现在很多这类短视频做得比较糙,场景的转化也有点割裂。<br>
我们可以在这个视频的基础上,写一个详细精准的提示词。写提示词的过程我一般会用 Claude 来做,可以按秒级定义整个视频里的所有分镜,声音也可以直接用提示词生成。<br>
实际体验下来,它确实能比较精准地编辑文字,比如往里面加入文字图层。比如往这个视频里加入极粗的无衬线大写字母,可以定义字体的厚重感,让它铺满整个画面宽度。<br>
最后出来的完整效果是这样的。<br>
视频里的分镜直接用提示词定义好的。扔出石头的时候是 Origin,变成子弹的时候是 Fire,最后登月的时候是 Beyond。<br>
所有文字都作为图层嵌入到视频的背景之中,展现效果比较好,每一帧截出来也有点海报的感觉。<br>
再有就是现在 H3 模型支持替换参考视频或者图片里的元素,能做比较精准的替换。下面这个属于玩梗。<br>
这段视频片段是美剧《纸牌屋》里一个比较经典的默剧片段,女主在左侧看着男主,画面转到男主的时候,男主一直在坐姿划船:<br>
这时可以直接把这个视频片段上传,再上传一张奶龙的图片,让奶龙的形象替换掉这段短视频里的两个人物。一个奶龙在左侧看着右侧的男主,坐姿划船的男主也会被替换成奶龙,一直在做坐姿划船。<br>
整个效果是这样的,整体比较 OK。尤其是奶龙眼神的变化,还有奶龙做坐姿划船的时候,动作和声音都比较到位。<br>
仔细观察会发现整体有光影的转换,照在奶龙身上的打光来自画面右侧,这与原参考短视频中男主右后侧的打光完全一致。<br>
现在可以视频作为参考,在上面额外做编辑。比如我在原视频的基础上为他们配音,让他们用美剧式的配音,比较激烈地争吵该吃什么。<br>
这段时间刷短视频,老是看见很多人模仿昭和时代特摄、奥特曼特摄片的场景,在里面发挥各种想象力。<br>
我又想到可以用这种摄影手法去做一个 TVC 广告视频:怪兽用昭和的摄影风格、胶皮套风格出场,在毁坏城市的时候,一个男孩突然站在它面前,拿出一个特制的摄影机,拍一张照片以后,这个怪兽会完全被缩小成一个怪兽玩具,放到男孩的手上。此时画面的背景出现文字 Monster。<br>
我拿 H3 模型试了试,整体效果确实还不错。仔细观察怪兽模型的胶皮套质感,确实比较符合昭和时代特摄剧的感觉,包括最后的文字展现,整体比较顺畅。<br>
很多短视频里会有一些特效,它能指定一个参考视频,指定这个参考视频里面的特效,让我们的原视频加上这个特效。比如前两天我看到有博主发了一个这样的短视频,他做了一个彩虹像素的特效,这些彩虹像素会沿着主物体的边缘精准地向下蔓延。<br>
我用原怪兽玩具 TVC 里的怪兽出场部分,把这个彩虹像素特效的短视频一并上传,让它去参考,让怪兽的主体部分也有这种彩虹特效,彩虹的元素再鲜艳一点。<br>
可以看到彩虹像素从怪兽头部一直向下扫过,边界的分离感很强,整体比较精准,没有出现不可控的元素,比如彩虹特效向其他建筑物延伸,这种情况也没有出现。<br>
整体效果比较精准,与原先短视频里的怪兽形象没有大的出入,整体昭和时代特摄剧的胶皮感也保持得比较好。<br>
实测下来,MiniMax H3 对色彩的运用确实足够精准。在多种高对比度的色彩碰撞中,它依然能维持好各自的色彩边界,且色彩附着在物体上的质感与痕迹都非常清晰。<br>
于是我直接给它发了一张《喷射战士》的参考图,让它生成一段 MiniMax 版的游戏宣传短片。整段视频有比较激烈的对战效果,还还原了 Inkling(墨鱼娘)的形象;同时我也要求它把场景中的部分文字,替换改写成了「MiniMax」。<br>
可以看出来整体色彩的运用是比较精准的,包括一些对战时的墨水喷射,以及墨水的碰撞所产生这种融合的效果,其实都还不错。<br>
回过头看这几个 case,H3 可以把文字、图片、视频、音频放进同一个上下文里理解,再根据提示词做局部的改动。像是加文字图层、替换人物形象、迁移另一段视频里的特效,这些在过去需要很多步骤,现在在一次生成里就能完成,改动的边界也基本能控制得住。<br>
提示词我还是建议写得复杂详细一点。模型的上限比较高,写得越复杂,控制得越精细,它给出来的效果就越好。<br>
现在 MiniMax H3 的技术文档也已经公开了,里面有几个比较核心的点。<br>
【1】首先是 H3 在预训练阶段就具备了多模态上下文理解和生成能力,泛化做得比较好。<br>
【2】为了做这种泛化能力,他们搭建了专门的模型和全模态的理解 Pipeline,语言在其中起到可泛化的连接和解释作用。<br>
【3】他们放弃了 Hailuo-02 的架构,重新做了 Tokenizer。压缩效率提上去之后,训练和推理成本就能降下来,原生 2K 能够成立,也建立在这一层面之上。<br>
技术报告的一个核心部分里提到他们的一个观点:对于多模态理解和生成来说,MiniMax H3 团队认为可以把语言看作一套可泛化、可 Scaling 的计算系统,多模态也因此应该与语言紧密关联,两者互相支撑。<br>
把时间线拉长来看,过去一年视频模型的进步密度极高,但更值得注意的是,行业的评价标准正变得越来越「卷」。<br>
一年前,大家讨论的还是提示词的一致性,甚至很难通过复杂提示词精准控制画面的局部片段。而到了今天,模型不仅能精准替换画面中的特定人物或物体,且完全不干扰周边元素。<br>
与此同时,原生音频也从过去的加分项变成了及格线,例如 Veo 3.1 已经支持 48kHz 的高清语音生成,主流模型的音画同步也普遍实现了单次推理同步完成。<br>
这一切都表明,视频模型正在加速向生产力级工具演进。<br>
这种转变在厂商的宣发策略上体现得尤为明显:一年前大家还在卷精美绚丽的特效画面,而现在则全面转向了 TVC、商业广告等生产力场景的实操演示。<br>
另一方面,在多模态领域,视频一直是被寄予厚望的赛道,算是行业的「长子」。<br>
它既离普通人的日常表达最近,又最贴近商业产业落地。更重要的是,正如前文所说,它同时通向游戏引擎与世界模型这两个更大的远景命题,这也解释了为何即便强如 Sora 经历重组或关停,行业对这一方向的投入不仅没有收缩,反而更加密集。<br>
令人意外的是,面对这样一个兼具技术壁垒与成本优势的模型,MiniMax 却选择了开源。<br>
虽然开源带来的生态效应可能需要更长的时间才能在市场上显现,但这一路径的可行性并非无迹可寻。<br>
以海外开源模型 LTX-2.3 为例,其在 Hugging Face 上已突破 1800 万次的下载量,这足以证明开源视频模型在开发者生态中拥有真实的刚需。<br>
其实对开发者和企业来说,开源最实在的意义在于多了一个可控的选择。大家不用再被少数几家闭源 API 绑死。同时,这也确实让更多海外开发者用上了来自中国团队的技术,把生态慢慢做起来了。<br>
不过无论如何,能看到国产视频模型走到这个位置,是件让人愿意继续观察下去的事。也希望接下来还能有更多这样的模型出现在大家眼前。<br>
十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。<br>
如果你写过类似文章:《实测 PixVerse C1[1]》、《实测 LibTV[2]》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。<br>
我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪