Black Forest Labs 周四发布了 FLUX 3,该公司的旗舰型号首次生成视频而不仅仅是静态图像。以 FLUX 系列图像生成器而闻名的德国人工智能实验室在一个共享系统内同时对新系统进行图像、视频和音频训练。

这就是所谓的多模态:一个模型一起学习多种类型的信息,而不是并排使用单独的工具。

视频方面是头条特色。 FLUX 3 生成长达 20 秒的剪辑,音频与图片一起生成,并与屏幕上发生的内容同步——对话、音效、环境噪音。在早期评估中,人类审阅者在 77% 的面对面比较中更喜欢 FLUX 3 的输出,而不是 Runway Gen-4.5,在 93% 的比较中更喜欢 Luma Ray 3.2。它似乎比 Gemini Omni 和 Seedance 稍好一些,在 52% 的评估中击败了这些型号。

当然,这是一项偏好测试,而不是固定的评分标准:评估者只需观看两个剪辑,然后选择看起来和听起来更有说服力的一个,BFL 会计算 FLUX 3 获胜的频率。

除此之外,该模型似乎也继承了其传统,在静态图像上也非常有能力。 BFL 分享了一些图像,FLUX 3 似乎非常通用,能够生成超越照片写实主义的多种风格。

BFL 不仅仅将其视为一种内容工具。 “只学习图像的模型只能生成图像,”联合创始人兼首席执行官 Robin Rombach 说。该公司的赌注是,学习预测视频也意味着学习其背后的物理原理——重量、接触、时间——这正是机器在物理世界中移动所需要的。

这个赌注有一个名字:FLUX-mimic。它采用苏黎世的模仿机器人技术构建,采用 FLUX 3 的视频预测引擎,并添加了一个轻量级“解码器”——一个小型附加组件,可将模型对物体如何移动的内部感知转化为实际的机器人运动。汽车制造商奥迪已经在测试它的任务,例如安装灵活的门密封件,这是传统自动化难以处理的工作。

“奥迪代表了我们为其打造 FLUX-mimic 的制造合作伙伴,”mimic 联合创始人 Stephan-Daniel Gravert 说道。奥迪的克里斯托夫·施奈德表示,机器人现在“解决了旧机器无法触及的复杂软体操纵工作”。 BFL 表示,整个系统的反应时间约为 101 毫秒,接近人类视觉反应。

FLUX 的崛起并不是凭空发生的。 Black Forest Labs 于 2024 年 8 月由曾帮助 Stability AI 构建原始 Stable Diffusion 模型的资深研究人员创立,推出的 Flux 模型击败了 MidJourney,并超越了 Stability 自己平庸的 Stable Diffusion 3。

开源 Flux Dev 和 Schnell 模型获得了“最佳开源图像生成器”称号,AI 艺术家原本期望 Stable Diffusion 3.5(Stability 的重来之作)最终能夺回这个称号。

但从来没有。同年 10 月,FLUX 1.1 Pro 继续登上人工分析图像领域的榜首。不过,那个不是开源的。

BFL 于 2025 年 11 月发布了 FLUX.2,但并不那么受欢迎。最初的 Flux 一直保持着开源桂冠,直到 2025 年末阿里巴巴的 Z-Image Turbo 取代了它,与其在低端消费类显卡上的质量相匹配。 “这就是 SD3 应该有的样子,”一位 CivitAI 用户当时写道。

FLUX 3是BFL的回归,目前尚未完全开放。根据 BFL 的说法,视频和动作现已通过 API 和精选合作伙伴(其中包括模仿机器人技术)进行早期访问,并在“未来几周内”生成图像。开放权重开发版本是 BFL 计划发布供本地使用的唯一层,要到 2026 年晚些时候才会发布。

每日简报时事通讯