AIモデルは意図的に「知識」を削減している

मूल शीर्षक: Models Are Getting Dumber on Purpose

यह क्यों महत्वपूर्ण है

AIモデルの設計思想が「知識の記憶」から「推論手続き+外部検索」へ根本的に転換しつつあることを示す重要な業界動向。

最新のAIモデルはAIMEなどの推論ベンチマークでスコアを上げながら、SimpleQAなどの事実確認テストでは最高モデルのGemini 2.5 Proでも正答率53%にとどまる。Qwen3.5 4B・9Bは知識ベンチマークで80〜82%のハルシネーション率を記録しており、AIラボは意図的に「世界知識」を「推論能力」に置き換えている。

Walter van der Giessenによる分析によると、最新のAIモデルは推論スコアを伸ばしながらも、事実記憶の精度を大幅に犠牲にしている。GLM-5.2はAIME 2026で99.2%を記録し、アクティブパラメータ数は約400億。Qwen3.5は91.3%で170億アクティブパラメータ。DeepSeek V4-Flashは130億アクティブで動作する。一方、2023年当時のGPT-4は約2800億アクティブパラメータと言われながら、AIMEの問題をほとんど解けなかった。

しかし事実確認ベンチマークのSimpleQAでは、現在のトップモデルであるGemini 2.5 Proでも正答率53%に過ぎず、小型モデルはさらに低い。Qwen3.5 9Bなどは19世紀の数学者の生年を問うと、自信を持って誤った回答を返す。

この背景には明確なトレードオフがある。「Physics of Language Models」シリーズの研究によれば、事実知識はパラメータあたり約2ビットの容量を必要とする。一方で推論能力は「問題分解・中間状態の追跡・自己検証・バックトラック」という比較的小さな手続きの繰り返しであり、蒸留や強化学習によって小型モデルへの転移が効率的に行える。

さらに重要な要因として「事実の陳腐化」がある。フロンティアモデルの学習には数ヶ月・数億ドルのコストがかかり、完成した瞬間から内部の事実情報は古くなり始める。ライブラリのAPIや価格・人事情報などは常に変化する。一方、代数や論理的手続きは1970年代から変わらない。このため、ラボは「手続き」を重みに保存し、「事実」はツール検索で補完する設計にシフトしている。

स्रोत

w4g1.dev — मूल लेख पढ़ें →