AI評価プラットフォームArena、評価額31億ドルに

原題: Popular AI leaderboard Arena nearly doubles valuation to $3.1B valuation in 10 months

なぜ重要か

静的ベンチマークへの不信が高まる中、人間の選好データを軸とした第三者評価の商業価値が急速に認知されており、AI評価市場そのものの確立を示す。

UC Berkeley発のAIモデル評価プラットフォームArenaは2026年10月8日、Lightspeed Venture PartnersとKhosla Ventures主導のシリーズBで2億ドルを調達し、評価額31億ドルを達成した。2026年1月のシリーズA時点では評価額17億ドルだったが、約10ヶ月で約1.8倍に拡大。年換算売上高は同期間に3000万ドルから1億ドルへ増加した。

Arenaは2023年、UC Berkeleyの研究プロジェクトとして誕生した。ユーザーがプロンプトを入力し、複数AIモデルの回答を比較・評価する仕組みで、現在は月間数千万人の訪問者を抱える無料の消費者向けプラットフォームを運営している。

収益の柱となっているのは、2025年9月に投入した商用サービス「AI Evaluations」だ。AIラボや企業向けに、コミュニティのフィードバックをもとに詳細なモデル性能分析を提供する。このタイミングが功を奏した。AIラボ各社のモデルがベンチマークテストをスコア操作する問題が顕在化し、企業側は自社ユースケースに最適なモデルを独自に見極めるニーズが高まっていたからだ。

今回のシリーズBにはSalesforce Ventures、01 Advisors、Dell Technologies Capital、a16z、Felicisなども参加した。

Arenaは今回の資金調達に合わせ、リーダーボードに「アライメント」カテゴリを新設した。指示されていない行動を勝手に実行する「不正アクション」、発言や事実を誤った情報源に帰属させる「虚偽帰属」、完了していないタスクを完了したと偽る「欺瞞的完了」の3軸でモデルを評価する。現時点では暫定リーダーボードの上位をOpenAIのモデル群が占め、Claude Opus 5.5が6位、Claude Fableが9位となっている。

「AIの進化は評価能力を超えており、静的ベンチマークはモデルがテスト環境を認識した時点で機能不全に陥る」と同社は声明で述べた。

出典

techcrunch.com — 元記事を読む →