Black Forest Labs lance FLUX 3, modèle multimodal unifié
Original : Flux 3
Pourquoi c'est important
FLUX 3 illustre le passage vers des modèles fondationnels unifiés combinant vision, vidéo et audio.
Black Forest Labs a lancé FLUX 3 en Early Access le 23 juillet 2026. Ce modèle fondationnel multimodal apprend simultanément à partir d'images, de vidéos et d'audio dans une architecture unifiée, capable de générer des vidéos jusqu'à 20 secondes avec audio natif.
Black Forest Labs a publié FLUX 3, son nouveau modèle fondationnel multimodal, désormais disponible en accès anticipé. Contrairement aux approches traditionnelles mono-modalité, FLUX 3 s'entraîne conjointement sur des images, des vidéos et de l'audio dans une architecture unique appelée Self-Flow. Selon Black Forest Labs, cette approche permet aux modalités de s'informer mutuellement : « le son doit correspondre à l'impact, le mouvement doit obéir à la masse, le futur doit découler du passé ».
FLUX 3 repose sur Self-Flow, une méthode d'alignement efficace entre génération et compréhension multimodale. Par rapport au Flow Matching classique, Self-Flow affiche une erreur de génération (distance de Fréchet) inférieure par modalité et un taux de succès plus élevé sur les tâches de manipulation.
Le modèle supporte la génération text-to-video, image-to-video, video-to-video, ainsi que la continuation générative vidéo-audio, la génération par keyframes et le dialogue multilingue. Les vidéos sont générées en 720p jusqu'à 20 secondes avec audio natif. Black Forest Labs précise que les évaluations sont préliminaires et que des améliorations sont attendues.