SpotifyのPortalでClaude Codeトークン使用量を90%削減

원제: Portal by Spotify cut my Claude Code token usage by 90%

왜 중요한가

프론티어 모델과 경량 모델을 작업 특성에 따라 자동 라우팅하는 실제 구현 사례로, AI 개발 비용 최적화의 구체적인 방향성을 제시한다.

Spotifyのエンジニアリングチームは、自社開発の内部プラットフォーム「Portal by Spotify」のAiKA Modesを活用し、AI코딩 에이전트 Claude Code의 토큰 사용량을 최대 90% 절감했다고 2026년 9월에 공개했다. ファイル読み込みやボイラープレート생성 등の단순 I/O 작업을 Gemini 2.5 Flash에 위임하는 2가지 Mode를 구성했다.

Spotify 엔지니어링팀은 AI 코딩 에이전트가 수행하는 작업의 대부분이 실제 추론이 아닌 파일 읽기 및 코드 생성과 같은 I/O 처리임에 주목했다. 이러한 단순 작업에 고가의 프론티어 모델을 사용하는 것이 토큰 비용의 주요 원인이라고 판단, Portal by Spotify의 AiKA Modes 기능을 활용한 라우팅 구조를 구축했다.

구체적으로는 두 가지 Mode를 정의했다. 첫 번째인 'bulk-reader'는 Claude Code가 여러 대용량 파일을 읽어야 할 때 해당 작업을 위임하는 용도이며, 두 번째인 'code-writer'는 테스트 파일이나 설정 파일 등 기존 패턴을 기반으로 한 반복적인 코드 생성에 사용된다. 두 Mode 모두 워커 모델로 Gemini 2.5 Flash를 채택하고 있으며, temperature는 0.2로 설정되어 있다.

Mode는 선언형 에이전트로, AWS Lambda와 유사한 임시 런타임 위에서 동작한다. 인프라 관리나 별도의 API 키 설정 없이 Portal CLI 또는 API를 통해 호출할 수 있으며, 기업 전체와 공유하는 공개(public) 또는 비공개(private) 설정이 가능하다.

라우팅은 초기에 CLAUDE.md의 규칙 블록으로 구현했으나, 규칙이 강제성을 갖지 못해 Claude가 무시하는 문제가 발생했다. 현재는 'shunt'라는 Claude Code 플러그인을 통해 운영 중이며, PreToolUse 훅을 활용해 파일 크기 확인 등 조건에 따라 자동으로 위임 여부를 결정하는 방식으로 개선되었다.

업계 조사에 따르면 엔지니어링 리더의 25%가 이미 개발자 1인당 월 200~500달러의 토큰 비용을 지출하고 있으며, 2,000달러를 초과하는 사례도 존재한다. 2028년까지 AI 코딩 비용이 평균 개발자 연봉을 초과할 것이라는 전망도 제시되고 있다.

출처

engineering.atspotify.com — 원문 읽기 →