Codexで232倍高速なGPUカーネルを実現
मूल शीर्षक: Auto-research with codex: How I achieved a 232x Faster Kernel
यह क्यों महत्वपूर्ण है
AIエージェントを活用した自動化研究(Auto-research)がGPUカーネル最適化分野で実用的な成果を上げられることを示した事例として業界的に注目される。
開発者Sankalpは、GPU ModeとCore Automationが共催したAuto-researchコンテストにおいて、OpenAIのCodexを活用し、バッチ処理対応のQR分解カーネルをベースラインより232倍高速化することに成功した。183人中12位という結果を収めた。
GPU ModeとCore Automationが共催したAuto-researchテーマのコンテストにおいて、開発者Sankalpは、OpenAIのCodexを活用してCUDAカーネルの大幅な高速化を実現した。課題は、バッチ処理対応の正方コンパクトHouseholder QR因数分解(QR分解)の実装であった。
参加者183人中12位となったSankalpは、ベースライン実装と比較して232倍の速度向上を達成した。コンテストでは、FP32のCUDA行列(batch × n × n の形状)を入力として受け取り、torch.geqrf(A)と同等のコンパクトHouseholder QR表現を返す実装が求められた。
重要なテスト対象サイズは512×512のバッチ行列で、1024、2048、4096のサイズも含まれた。内部的にはFP16、FP8、NVFP4などの低精度浮動小数点の使用も許可されていたが、返却される因子はFP32スタイルのQR検証を満たす必要があった。
GPU ModeはPopcorn CLIを参加者に提供しており、エージェントがテスト・ベンチマーク・リーダーボードへの提出を直接行えるエージェントフレンドリーな環境を整備。チェッカーは全体的な幾何平均タイミングとともに形状別フィードバックも提供し、これがAuto-researchを可能にした要因となった。
Sankalpは、blocked Householder algorithmを用いてシリアル処理を削減する手法や、ローカル最大値から脱出するためのアイデア多様性の導入など、複数のブレークスルーアプローチを採用した。本ブログ記事では、数学的背景よりもアプローチとボトルネックの解説に重点が置かれている。