中国政策档案 Governance Archive HOLDINGS 229,790 · FONDS 120
Record · 凤凰网科技 ACC. 900069439

FLUX 3 Multimodal AI Model Launched: Supports Single Generation of Up to 20 Seconds of Diverse Video

FLUX 3多模态AI模型登场:支持单次生成20秒多样化视频

Issuer
凤凰网科技
Date
Instrument
other
Cited by
0
This article reports on the early access release of Black Forest Labs' FLUX 3 multimodal foundation model, which integrates image, video, and audio generation, capable of producing up to 20-second videos with native audio in a single pass.
Full text · 原文 835 字
IT之家 7 月 24 日消息,Black Forest Labs 昨日(7 月 23 日)发布博文,宣布以 Early Access 方式,上线推出 Flux 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。<br> 自动播放<br> 在训练方面,IT之家援引博文介绍,该模型基于 Self-Flow(自监督流匹配)学习框架扩展,同步训练视频、图像和音频,在 FLUX.1 和 FLUX.2 系列基础上,扩大至多模态生成与理解任务。<br> FLUX 3 可在单次生成中输出最长 20 秒的视频,并附带原生音频。官方表示该模型支持文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话,以及多镜头串联。<br> 性能方面,在带声音的 10 秒、720p 视频人工评测方面,结果显示,FLUX 3 对比 Grok Imagine Video 的胜率为 69%,对比 Seedance 2.0 的胜率为 52%,对比 Gemini Omni Flash 的胜率也为 52%。<br> 在机器人方向,Black Forest Labs 正与 Mimic Robotics 合作,研究将 FLUX 3 用作机器人行为预测模型。<br> 图像能力方面,官方称 FLUX 3 可完成图像生成与编辑,覆盖多种风格、宽高比和分辨率。<br> “特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。<br> Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”