AIモデルは意図的に事実知識を削減している
Judul asli: Models Are Getting Dumber on Purpose
Mengapa Ini Penting
推論特化・軽量化の設計トレンドが、AIの実用配備コストと信頼性に直結する業界課題を浮き彫りにしている。
GLM-5.2がAIME 2026で99.2%を記録する一方、SimpleQAでの最高正解率はGemini 2.5 Proの53%にとどまる。推論能力向上と引き換えに事実記憶を意図的に削減する設計トレンドが進んでいる。
最新のAIモデルは数学・コードベンチマークで急速に性能を向上させているが、事実の記憶能力は著しく低下している。GLM-5.2はAIME 2026で99.2%を達成し、アクティブパラメータ数は約400億。Qwen3.5は910億アクティブパラメータで91.3%を記録した。2023年時点でGPT-4は約2800億パラメータながらAIMEをほぼ解けなかったことと比べると、パラメータあたりの推論効率は劇的に向上している。
しかし事実の想起を測るベンチマーク「SimpleQA」では、最高得点のGemini 2.5 Proでさえ正解率53%にとどまる。Qwen3.5の4Bおよび9Bモデルは知識ベンチマークでの幻覚率が80〜82%に達する。
この背景には意図的なトレードオフがある。「Physics of Language Models」シリーズの研究によると、事実の記憶にはパラメータ1つあたり約2ビットの容量が必要で、フロンティアモデルが兆単位のパラメータを持つ主因となっていた。一方、推論手順は蒸留や強化学習によって小規模モデルへ効率よく転送できる。Phi-4(140億パラメータ)は合成テキストで訓練され、数学は得意だが雑学は苦手という設計が明確に現れている。
さらに、事実はモデル完成直後から陳腐化が始まるが、代数や論理的推論などの手順は時代を問わず有効であることも、この設計思想を後押ししている。