DeepSeek V4 Flash 0731 : 89% sur ARC-AGI-1

Original : DeepSeek V4 Flash 0731

Pourquoi c'est important

Un score de 61,4 % sur ARC-AGI-2 positionne DeepSeek parmi les modèles les plus performants du benchmark.

Le 31 juillet 2026, DeepSeek a publié V4 Flash 0731, un modèle atteignant 89,0 % sur ARC-AGI-1 Semi-Private et 61,4 % sur ARC-AGI-2 Semi-Private à un coût de 0,02 $ par tâche (ARC-AGI-1) et 0,04 $ par tâche (ARC-AGI-2), selon les résultats officiels d'ARC Prize.

DeepSeek a soumis le 31 juillet 2026 son modèle V4 Flash 0731 à la plateforme ARC Prize. Le modèle propose trois variantes de raisonnement (Max, High, Low). En mode Max (effort maximal), il atteint 89,0 % sur le benchmark ARC-AGI-1 Semi-Private et 61,4 % sur ARC-AGI-2 Semi-Private. En mode High, les scores sont respectivement de 87,0 % et 56,0 %, et en mode Low de 84,0 % et 46,0 %. Le coût par tâche est de 0,02 $ pour ARC-AGI-1 et de 0,04 $ pour ARC-AGI-2. Sur l'évaluation publique ARC-AGI-2 (120 tâches), le modèle réussit un nombre significatif de tâches en mode Max. Ces résultats sont vérifiés et publiés officiellement sur le leaderboard ARC-AGI-2. Aucun score ARC-AGI-3 n'est encore disponible pour ce modèle.

Source

arcprize.org — Lire l'original →