Black Forest Labs、マルチモーダルAI「FLUX 3」発表
मूल शीर्षक: Flux 3
यह क्यों महत्वपूर्ण है
画像・動画・音声を統合した単一モデルの実用化は、マルチモーダルAI開発の方向性を示す重要な技術的マイルストーンとなる。
Black Forest Labsは2026年7月23日、画像・動画・音声を統合アーキテクチャで同時学習するマルチモーダル基盤モデル「FLUX 3」をEarly Accessとして公開した。Self-Flowアプローチを採用し、最大20秒の動画とネイティブ音声を一括生成できる。
Black Forest Labsは、新しいマルチモーダル基盤モデル「FLUX 3」を発表し、Early Accessとして提供を開始した。同モデルは画像・動画・音声・言語を単一の統合アーキテクチャで同時学習することを特徴とし、各モダリティを個別に扱うのではなく、現実世界の共通表現を学習することを目的としている。
技術的基盤として「Self-Flow」アプローチを採用しており、従来のFlow Matching(FM)と比較して生成誤差(Fréchet距離)が各モダリティで低減され、操作タスクの成功率も向上したと報告されている。
主な機能として、テキストから動画、画像から動画、動画から動画への変換に加え、生成的な動画・音声の継続、キーフレームから動画への生成などが可能。すべての動画出力にネイティブ音声生成が付随する。1回の生成で最大20秒の動画を作成でき、720p解像度に対応。多言語ダイアログ生成、幅広いビジュアルスタイルとアスペクト比、強力なタイポグラフィ生成にも対応する。また、個別クリップをエージェント的にチェーン接続し、より長いマルチショットシーケンスを生成する機能も備える。
同社はFLUX 3を「リアルワールドビジュアルインテリジェンス」実現に向けたチェックポイントと位置づけ、コンテンツ制作およびPhysical AI分野での早期成果を示している。評価はまだ初期段階であり、さらなる改善が見込まれるとしている。