930万パラメータの超小型TTS「Inflect-Micro-v2」公開
원제: Inflect-Micro-v2: complete voice in 9.36M parameters
왜 중요한가
10MB 이하의 소형 모델로 고품질 TTS를 실현함으로써 엣지 AI 및 로컬 환경에서의 음성 합성 활용 가능성이 크게 확대된다。
개발자 Owen Song은 2025년, HuggingFace에서 9,356,513개의 파라미터로 완전한 음성 합성을 구현한 소형 TTS 모델 「Inflect-Micro-v2」를 Apache 2.0 라이선스로 공개했다。FP32 가중치 크기는 37.53MB, 24kHz 모노 출력을 지원하며, CPU 및 CUDA 양쪽에서 실시간의 6.28배 속도로 동작한다。
Inflect-Micro-v2는 10M 파라미터 이하에서 고품질 음성 합성을 목표로 독립 개발자가 자체 자금으로 개발한 영어 TTS 모델이다。아키텍처는 VITS 기반을 채용하며, 고정 음성(fixed-voice)과 결정론적 시드(deterministic seed)에 의한 재현성을 갖추고 있다。장문 텍스트 처리에도 대응하고 있으며, Python 패키지 및 ONNX Runtime 내보내기도 지원한다。
평가 항목은 단일 지표에 의존하지 않고, 커뮤니티 선호도, 자연성 예측(UTMOS22), 다중 ASR 지능성(Two-ASR semantic WER), 가중치 크기, CPU 처리 속도를 개별적으로 공개하고 있다。커뮤니티 블라인드 선호 연구에서는 21승 10패 3무로 66.2%의 선호율을 기록했다。비교 대상은 KittenTTS Nano、Piper Low、Supertonic 3 등 기존의 소형 로컬 TTS이다。
동일 시리즈에는 4M 파라미터 이하의 「Inflect-Nano」도 존재하며, 용도에 따라 선택 가능하다。개발자는 이 모델을 독립적으로 구축·자금 조달했으며, 이용자의 반응에 따라 다언어·다음성·안정성 개선을 포함한 v3로의 발전을 검토하고 있다고 밝혔다。