Cerebras、Qwen 3.8 27Bを毎秒1500トークンで提供開始

Judul asli: Qwen 3.8 27B available on Cerebras at 1500 tokens/s

Mengapa Ini Penting

高速推論基盤上での大規模OSS展開が、AI開発コスト競争を加速させる指標となる。

CerebrasはQwen 3.8 27B(270億パラメータ)を公開エンドポイントで提供開始。速度は毎秒約1500トークン、コンテキスト長は無料64k・有料128kトークン。

Cerebrasは推論プラットフォームのモデルカタログに「Qwen 3.8 27B」(モデルID: qwen-3.8-27b)を追加した。同モデルは270億パラメータを持ち、処理速度は毎秒約1500トークン。コンテキスト長は無料トライアル層で最大64,000トークン、有料層で最大128,000トークンとなる。既存の「OpenAI GPT OSS」(1,200億パラメータ、毎秒約3,000トークン)と並ぶラインナップとして提供される。

モデル圧縮の透明性に関してCerebrasは、公開エンドポイントで提供するモデルはすべて元のアーキテクチャを保持した「非プルーニング版」であると説明。ストレージ時に選択的な重み量子化(16bit/8bit/4bit)を使用するが、演算は高精度で実施し、アクティベーション・アテンション・KVキャッシュは完全精度を維持すると明記している。同社が研究するプルーニング技術「REAP」で生成したモデルはHugging Faceで研究目的に公開されているが、本番APIからは提供されない。

Sumber

inference-docs.cerebras.ai — Baca artikel asli →