Black Forest Labs、マルチモーダルAI「FLUX 3」早期アクセス開始

原題: Flux 3

なぜ重要か

画像・映像・音声を単一モデルで統合生成する基盤モデルの登場は、マルチモーダルAI市場の競争環境と映像制作・Physical AI分野の技術水準を大きく塗り替える可能性がある。

Black Forest Labsは2026年7月23日、画像・映像・音声を統合アーキテクチャで同時学習するマルチモーダル基盤モデル「FLUX 3」のEarly Accessを開始した。テキストプロンプトや画像・映像を入力として、最大20秒の映像と音声を同時生成できる。自社開発のSelf-Flow技術を基盤に、コンピュートとデータを大幅に拡張して訓練された。

Black Forest Labsは、新たなマルチモーダル基盤モデル「FLUX 3」をEarly Accessとして公開した。同モデルは画像・映像・音声・言語を統一アーキテクチャで同時学習する設計を採用しており、各モダリティを独立して学習するのではなく、現実世界の共通表現を学習することを目指している。

開発思想として同社は、「画像は空間構造を、映像は時間的ダイナミクスと物理法則を、音声は視覚だけでは検出できない機械的現象と音響の因果関係を明らかにする」と説明している。複数のモダリティを同時学習することで、それぞれの相互制約(音は衝撃に合致し、動きは質量に従い、未来は過去から続く)をモデルが学習できると述べている。

FLUX 3の基盤技術は、自社開発のSelf-Flowアプローチである。従来のFlow Matching(FM)と比較して、生成誤差(Fréchet距離)を各モダリティで低減し、マニピュレーションタスクにおけるファインチューニング後の成功率も向上していると報告されている。

映像生成機能としては、テキストから映像、画像から映像(アニメーション化またはビジュアルリファレンス利用)、映像から映像、映像・音声の続き生成、キーフレームから映像生成などに対応する。すべての映像出力にネイティブ音声生成が付属し、生成長は最大20秒、解像度は720p。多言語ダイアローグ、幅広いビジュアルスタイルと縦横比、タイポグラフィ生成、複数クリップのエージェント的連結による長尺シーケンス生成にも対応する。

同社はモデルおよびその評価ハーネスが現在も開発中であることを明示しており、今後さらなる性能向上を見込んでいる。また、コンテンツ制作とPhysical AIの両分野での早期結果が有望であるとしている。

出典

bfl.ai — 元記事を読む →