DeepSeek V4 Flash, ARC-AGI-2에서 61.4% 달성
원제: DeepSeek V4 Flash 0731
왜 중요한가
저비용($0.04/태스크)으로 ARC-AGI-2에서 61%대 달성은 AI 일반 지능 벤치마크 경쟁에서 중국 오픈소스 모델의 성능 향상을 보여준다.
DeepSeek는 2026년 7월 31일, 새 모델 'DeepSeek V4 Flash 0731'의 ARC-AGI 벤치마크 결과를 공개했다。최대 노력(Max effort) 기준으로 ARC-AGI-1 Semi-Private에서 89.0%、ARC-AGI-2 Semi-Private에서 61.4%를 기록했으며、각 태스크당 비용은 각각 $0.02、$0.04이다。
DeepSeek가 2026년 7월 31일에 공개한 'DeepSeek V4 Flash 0731'은 ARC Prize 공식 리더보드에 게재된 검증 결과로、3가지 추론 변형(reasoning variants)을 포함한다。
성능 결과는 추론 수준별로 세 단계(Max、High、Low)로 구분된다。ARC-AGI-1 Semi-Private에서는 Max 89.0%、High 87.0%、Low 84.0%를 기록했다。ARC-AGI-2 Semi-Private에서는 Max 61.4%、High 56.0%、Low 46.0%였다。
ARC-AGI-2 Public Eval(120개 태스크) 및 ARC-AGI-1 Public Eval(400개 태스크)에 대한 태스크별 합격·불합격 결과도 함께 공개됐다。비용 효율 면에서는 ARC-AGI-1 기준 태스크당 $0.02、ARC-AGI-2 기준 태스크당 $0.04로 제시됐다。
ARC-AGI-2는 ARC-AGI-1보다 난도가 높은 벤치마크로、일반 지능 측정을 목표로 하는 ARC Prize 재단이 운영한다。DeepSeek V4 Flash 0731의 ARC-AGI-2 점수 61.4%는 현재 공개된 리더보드 상위권에 해당한다。