AI 평가 플랫폼 Arena, 10개월 만에 기업가치 31억 달러
원제: Popular AI leaderboard Arena nearly doubles valuation to $3.1B valuation in 10 months
왜 중요한가
AI 벤치마크 신뢰성 문제가 부각되면서 독립 평가 플랫폼 시장이 빠르게 커지고 있음을 이번 투자가 방증한다.
UC Berkeley 연구 프로젝트에서 출발한 AI 모델 평가 플랫폼 Arena가 2026년 10월 8일 Lightspeed Venture Partners와 Khosla Ventures 주도로 2억 달러 규모의 시리즈 B 투자를 유치했다. 기업가치는 31억 달러로, 10개월 전 시리즈 A 당시의 17억 달러에서 약 두 배로 상승했다.
Arena는 2023년 UC Berkeley에서 AI 모델 순위를 크라우드소싱 방식으로 매기는 연구 프로젝트로 시작했다. 이번 시리즈 B 라운드에는 Lightspeed와 Khosla 외에도 Salesforce Ventures, a16z, Felicis, Dell Technologies Capital, 01 Advisors, Endeavor Catalyst 등이 참여했다.
2026년 1월 시리즈 A 당시 연환산 매출(ARR)은 3,000만 달러였으나, 같은 해 6월에는 1억 달러를 돌파했다고 회사 측은 밝혔다. 6개월 만에 ARR이 3배 이상 성장한 셈이다.
성장의 배경에는 AI 벤치마크 신뢰도 위기가 있다. 주요 AI 모델들이 표준 벤치마크 테스트에서 실제 성능을 반영하지 않는 방식으로 높은 점수를 기록하는 문제가 업계 전반에서 제기되면서, 실사용자 피드백 기반의 독립적 평가에 대한 수요가 급증했다. Arena의 상업용 서비스 'AI Evaluations'는 모델 개발사와 기업이 자사 환경에 맞는 모델을 선택할 수 있도록 커뮤니티 기반 상세 성능 분석을 제공한다.
이번 발표와 함께 Arena는 '정렬(alignment)' 카테고리를 리더보드에 새로 추가했다. 이 항목은 모델이 지시하지 않은 행동을 취하는 '무단 행동', 잘못된 출처를 인용하는 '허위 귀속', 완료하지 않은 작업을 완료했다고 속이는 '기만적 완료' 등을 기준으로 모델을 평가한다. 현재 초기 정렬 리더보드 상위권은 OpenAI 모델들이 차지하고 있으며, Anthropic의 Claude Opus 5.5와 Claude Fable은 각각 6위와 9위에 이름을 올렸다.