Cerebras, Qwen 3.8 27B를 초당 1500토큰으로 제공

원제: Qwen 3.8 27B available on Cerebras at 1500 tokens/s

왜 중요한가

Qwen 3.8 27B의 초당 1500토큰 제공은 오픈소스 소형 모델의 상업적 고속 추론 서비스 확대 추세를 보여주는 사례다.

Cerebras는 공개 추론 엔드포인트에서 Qwen 3.8 27B(모델 ID: qwen-3.8-27b) 모델을 초당 약 1500토큰 속도로 제공한다고 발표했다. 파라미터 수는 270억 개이며, 무료 플랜 기준 64K, 유료 플랜 기준 최대 128K 컨텍스트 길이를 지원한다.

Cerebras의 공식 추론 문서에 따르면, 현재 공개 엔드포인트에서 이용 가능한 모델은 두 가지다. 첫 번째는 1200억 파라미터 규모의 OpenAI GPT OSS(gpt-oss-120b)로 초당 약 3000토큰의 처리 속도를 제공하며, 최대 131K 컨텍스트(유료)를 지원한다. 두 번째가 이번에 새로 추가된 Qwen 3.8 27B로, 초당 약 1500토큰의 속도와 128K 컨텍스트(유료)를 지원한다.

두 모델 모두 무료 체험 및 종량제(pay-as-you-go) 티어에서 이용 가능하며, 레이트 리밋과 요금 정책이 적용된다. 추가 모델 패밀리나 더 높은 처리량, 프로덕션 수준의 SLA가 필요한 경우에는 Dedicated Endpoints를 통해 제공된다.

모델 압축과 관련해 Cerebras는 공개 엔드포인트에서 제공되는 모든 모델이 원본 그대로의 비가지치기(unpruned) 버전임을 명시했다. 저장 시에는 업계 표준에 따라 16비트/8비트/4비트 혼합 가중치 전용 양자화를 선택적으로 적용하지만, 민감한 레이어는 전체 정밀도로 유지되며 연산은 고정밀도로 수행된다. 활성화값, 어텐션, KV 캐시는 양자화 없이 완전한 정밀도를 유지한다.

한편 Cerebras가 연구 목적으로 개발한 REAP(Router-weighted Expert Activation Pruning) 기반의 가지치기 모델은 HuggingFace를 통해 공개되어 있으나, 프로덕션 API에서는 별도로 서비스되지 않는다.

출처

inference-docs.cerebras.ai — 원문 읽기 →