Black Forest Labs、マルチモーダルAI「FLUX 3」を公開

Judul asli: Flux 3

Mengapa Ini Penting

画像・映像・音声を統合学習するモデルは、物理AIや実世界コンテンツ生成の基盤技術として産業界の注目を集める。

Black Forest Labsは2026年7月23日、画像・映像・音声を統合アーキテクチャで同時学習するマルチモーダル基盤モデル「FLUX 3」をEarly Accessとして公開した。

Black Forest Labsは、画像・映像・音声・言語を単一の統合アーキテクチャで学習する新世代マルチモーダル基盤モデル「FLUX 3」をEarly Accessにて提供開始した。同モデルは、各モダリティを独立して学習するのではなく、現実世界の表現を統合的に習得することを目的として設計されている。画像は空間構造を、映像は時間的ダイナミクスと物理法則を、音声は視覚だけでは検出できない因果関係を、言語は目標や抽象概念との連結を担う。

FLUX 3は同社独自の手法「Self-Flow」を基盤とし、マルチモーダルの生成と理解を同一アーキテクチャ内で効率的に整合させる。従来のFlow Matching(FM)と比較して、各モダリティのFréchet距離(生成誤差)を低減し、操作タスクの成功率も向上している。

映像生成においては、720p・最長20秒のテキストから映像への生成、画像から映像への変換(アニメーション・視覚参照)、映像から映像への変換、キーフレームを指定した制御付き生成、多言語対話、縦横比の多様対応など、ネイティブ音声生成を標準装備した幅広い機能を提供する。また、個別クリップをエージェント的に連結し、マルチショットの長尺シーケンスへ構成することも可能。評価は現時点で暫定的であり、今後のさらなる改善が予定されている。

Sumber

bfl.ai — Baca artikel asli →