AI 벤치마크 Index v4.2 발표
원제: Artificial Analysis Intelligence Index v4.2
왜 중요한가
비공개 테스트 세트 비중 확대와 에이전틱 평가 도입으로, AI 벤치마크의 신뢰성 및 실용성 기준이 업계 전반에 영향을 미칠 전망이다.
Artificial Analysis는 2026년 9월 4일, AI 벤치마크 'Intelligence Index v4.2'를 공개했다. 신규 에이전틱 평가 AA-Briefcase, 4,592페이지 PDF 추론 벤치마크 GDP.pdf를 추가하고, 점수 조작 방지를 위해 비공개 테스트 세트 비중을 40%로 확대했다. 상위 랭킹은 Anthropic Claude Fable 5.1, OpenAI GPT-6 Astra 순이다。
Artificial Analysis는 AI 모델 종합 평가 지표 'Intelligence Index v4.2'를 2026년 9월 4일에 공개했다. 2026년 1월 v4 출시 이후 약 8개월 만의 중간 업데이트로, 프론티어 모델의 빠른 발전에 대응하기 위해 v5 출시 전 선행 반영분을 담았다.
주요 변경 사항은 크게 네 가지다. 첫째, 자체 개발 비공개 평가인 'AA-Briefcase'를 추가했다. 업계 전문가가 설계한 다주간(multi-week) 지식 업무 프로젝트를 기반으로, 수천 개의 입력 소스 파일과 다수의 연계 태스크를 처리하는 에이전틱 능력을 루브릭(rubric) 및 쌍별(pairwise) 채점 방식으로 평가한다. 둘째, Surge AI가 제작한 'GDP.pdf'를 신규 도입했다. 100개의 PDF, 총 4,592페이지에 걸쳐 텍스트·표·차트·각주를 종합 추론하는 능력을 테스트하며, 1,275개의 전문가 작성 기준에 따라 평가된다. 셋째, 비공개 테스트 세트의 가중치를 v4.1 대비 두 배인 40%로 상향해 실험실들이 평가 데이터를 학습에 활용하는 '게이밍(gaming)'을 억제한다. 넷째, 채점 인프라를 개선해 AA-LCR v1.1에서 오류·모호성을 수정하고, 채점 안정성을 높였다.
한편 GPQA Diamond는 포화(saturation) 상태로 판단해 이번 버전에서 제외됐다.
리더보드 결과에 따르면 Anthropic의 Claude Fable 5.1이 1위를 차지했고, OpenAI의 GPT-6 Astra가 2위로 뒤를 이었다. 비용 대비 성능(Cost per Task) 프론티어는 Anthropic, OpenAI, Meta, Z.AI 4개 사가 공유했으며, 출력 토큰 효율성에서는 GPT-6 Astra가 가장 우수한 것으로 나타났다.