16.9MBの音声認識モデル「Whistle」公開
原題: Whistle: Speech to Text in 16.9 MB
なぜ重要か
エッジデバイス向け音声AIの小型化競争が加速する中、16.9MBで7言語・11ms TTFTを達成したことは組み込み分野の設計基準を塗り替えうる。
Cactus Computeは2026年10月2日、モバイル・ウェアラブル・マイクロコントローラー向けの音声認識モデル「Whistle」をリリースした。サイズは16.9MB、CPU単体で動作し依存ライブラリなし。英語・ドイツ語・フランス語・スペイン語・イタリア語・オランダ語・ポーランド語の7言語に対応し、最初のトークン生成まで11msを実現する。
Cactus Computeが公開した「Whistle」は、同社の基盤モデル「Needle」と同一のC++エンジン・同一コンテナ・同一量子化設定で動作する音声認識モデルだ。ファイル1つで完結し、オーディオデータはデバイス外に送出されない。
モデルが担う機能は3つ。①16kHzモノラル音声を最大30秒まで一括転写する「文字起こし」、②デコーダーのAttentionから取得した各単語の開始・終了時刻と確率を付与する「ワードタイムスタンプ」、③デコード不要でフレームごとの埋め込みを返す「音声埋め込み」だ。
アーキテクチャはEncoder-Decoder構成。前処理では25ms窓・10msホップで80本のlog-melビンを生成し、畳み込みステム(128チャンネル、カーネル9)が3回ダウンサンプリングして375フレームに圧縮する。EncoderにはNeedleと共有する「Simple Attentionブロック」を8層使用。Decoderも8層の「Laddered Simple Attentionブロック」で構成し、幅512、8クエリヘッド対2KVヘッドのGQA、3タップ因果畳み込み、層3と層7でのengram参照を備える。各Decoder層にはゲート付きクロスアテンション(x ← x + σ(g) · softmax(q̂K̂ᵀ/√d)V)を1つ追加する設計で、KとVはクリップ到着時に一度だけ投影・保持されるため、5ビームサーチでも音声パスは1回で済む。
デコード戦略はビーム数5の長さ正規化対数確率探索で、Aho-CorasickオートマトンによるキーワードバイアスもサポートされているAho-Corasick。8,192テキストピース+7言語トークンの語彙を持ち、最大320トークンを出力できる。
GitHubスターは4,200件超を記録しており、ブラウザ上のサンドボックスから即試用が可能。