Qwen 3.8 27B、過剰思考がデフォルト問題
원제: Qwen 3.8 27B is excellent, but it defaults to overthinking things
왜 중요한가
27B급 로컬 실행 모델의 추론 깊이 기본값 설계가 사용자 경험과 하드웨어 요구사항에 직접 영향을 미친다는 점에서 업계의 주목이 필요하다.
Alibaba의 Qwen 연구소가 2026년 8월 15일 Apache 2 라이선스의 27B 파라미터 비전 LLM 'Qwen 3.8 27B'를 공개했다. Simon Willison이 M5 Max MacBook Pro와 NVIDIA DGX Spark에서 Q4_K_M 양자화(17GB)로 테스트した结果、기본값 'xhigh' 추론 모드가 간단한 요청에도 수만 토큰을 소비하는 문제를 확인했다。
Alibaba의 Qwen 연구소는 2026년 8월 15일, Apache 2 라이선스 기반의 27B 파라미터 비전 지원 LLM 'Qwen 3.8 27B'를 출시했다. 전작 Qwen 3.6 27B보다 성능이 향상됐으며, 자사 클로즈드 웨이트 모델 Qwen 3.7-Plus도 능가한다고 자체 벤치마크에서 발표했다.
Simon Willison은 128GB M5 Max MacBook Pro와 NVIDIA DGX Spark 두 머신에서 LM Studio를 통해 Q4_K_M 양자화 빌드(17GB)를 테스트했다. 모델은 추론 깊이를 조절하는 'reasoning_effort' 파라미터를 지원하며, xhigh(기본값), medium, low 세 단계를 제공한다.
문제는 기본값이 xhigh로 설정돼 있다는 점이다. Willison이 SVG로 자전거 타는 펠리컨을 요청하자, 22,276개의 추론 토큰을 사용해 3,223개의 출력 토큰을 생성하는 데 21분이 소요됐다. LM Studio 기본 컨텍스트 제한인 8,192 토큰을 모두 소진하는 문제도 발생해, 최대 컨텍스트 길이인 262,144로 확장해야 했다.
추론을 끄고 동일한 프롬프트를 실행하자 3,715개 토큰을 약 137초(2분 17초)에 생성했다. 또한 'SVG로 원을 그려라'는 간단한 요청에도 모델은 동심원, 눈금, 그라디언트, 애니메이션 등을 추가하는 방향으로 과도하게 계획을 세우기 시작했다.
Willison은 생성된 펠리컨 SVG의 품질 자체는 로컬 실행 모델 중 최고 수준이라고 평가했으나, xhigh 기본값은 소비자 하드웨어에 부적합하다고 지적했다. 비교를 위해 OpenRouter를 통해 Qwen 3.8 2.4T-A95B(전주 출시)로 동일 프롬프트를 실행한 결과, 애니메이션 SVG가 생성됐다.