Black Forest Labs、マルチモーダルAI「FLUX 3」公開

원제: Flux 3

왜 중요한가

이미지·영상·오디오를 단일 모델로 통합 학습하는 접근은 멀티모달 생성 AI의 새로운 기반 기술로서, 콘텐츠 제작 및 물리 AI 분야에 광범위한 영향을 미칠 가능성이 있다.

Black Forest Labsは2026년 7월 23일, 이미지·영상·오디오를 단일 아키텍처로 동시 학습하는 멀티모달 파운데이션 모델 「FLUX 3」의 얼리 액세스를 공개했다. 동영상은 최대 20초·720p 해상도로 네이티브 오디오 생성을 포함하며, 텍스트·이미지·영상을 입력으로 지원한다.

Black Forest Labsは2026년 7월 23일, 차세대 멀티모달 파운데이션 모델 「FLUX 3」을 얼리 액세스로 공개했다. 동사가 제창하는 「Self-Flow」 아키텍처를 기반으로, 이미지·영상·오디오·언어를 단일 통합 모델에서 동시에 학습하는 것이 특징이다.

영상 생성 기능으로는 텍스트→영상, 이미지→영상(애니메이션화 또는 시각 참조), 영상→영상, 키프레임→영상, 생성적 영상·오디오 연속 생성 등 다양한 모드를 지원한다. 1회 생성으로 최대 20초, 720p 해상도의 영상을 네이티브 오디오와 함께 출력할 수 있으며, 다국어 대화, 다양한 화면 비율, 애니메이션에서 실사까지 폭넓은 스타일에도 대응한다. 또한 개별 클립을 체이닝하여 멀티샷의 장편 시퀀스를 생성하는 에이전틱 구성도 가능하다.

동사의 기술 문서에 따르면, Self-Flow는 기존의 Flow Matching 방식과 비교해 각 모달리티의 생성 오차(Fréchet distance)를 낮추는 동시에, 파인튜닝을 통한 조작 태스크의 성공률도 향상시키는 것으로 나타났다. 또한 물리 AI 분야에서의 초기 결과도 유망하다고 회사 측은 밝혔다.

FLUX 3은 현재도 개발 단계에 있으며, 평가 지표 및 모델 성능은 향후 추가 개선이 예정되어 있다고 명시되어 있다.

출처

bfl.ai — 원문 읽기 →