9.36Mパラメータの超小型TTS「Inflect-Micro-v2」公開

मूल शीर्षक: Inflect-Micro-v2: complete voice in 9.36M parameters

यह क्यों महत्वपूर्ण है

10M से कम parameters में CPU पर real-time TTS चलाने की क्षमता edge AI और local deployment के लिए एक महत्वपूर्ण उपलब्धि है।

Owen Song ने HuggingFace पर "Inflect-Micro-v2" नामक Text-to-Speech मॉडल जारी किया। यह मॉडल केवल 9,356,513 parameters के साथ 37.53 MB (FP32) का है, 24 kHz mono audio आउटपुट देता है, और CPU व CUDA दोनों पर चलता है। Apache-2.0 लाइसेंस के अंतर्गत उपलब्ध है।

Owen Song ने स्वतंत्र रूप से विकसित और वित्तपोषित "Inflect-Micro-v2" मॉडल HuggingFace पर जारी किया है। यह एक compact English Text-to-Speech (TTS) मॉडल है जो 10M parameters से कम में पूर्ण local speech synthesis प्रदान करता है।

**मुख्य विशेषताएँ:**

- कुल deployable parameters: 9,356,513 (37.53 MB FP32)

- 24 kHz mono waveform output

- CPU और CUDA दोनों पर inference संभव

- VITS architecture आधारित

- Deterministic seeds और long-text handling का समर्थन

**मूल्यांकन परिणाम (Inflect-Micro-v2):**

- Human blind preference: 66.2% (21 जीत, 10 हार, 3 tie)

- UTMOS22 predicted naturalness: 4.395

- Two-ASR semantic WER: 3.99%

- CPU 4-thread throughput: 6.28× real-time

तुलना के लिए KittenTTS Nano, Piper Low, और Supertonic 3 जैसे compact TTS baselines को शामिल किया गया, जिनका deployable weight footprint दोनों Inflect releases से बड़ा है। Inflect v2 में दो आकार उपलब्ध हैं: Micro (10M parameters से कम, गुणवत्ता प्राथमिकता) और Nano (4M parameters से कम, footprint प्राथमिकता)।

Owen ने बताया कि यदि इस release को अच्छी प्रतिक्रिया मिली, तो वे v3 पर काम करने की योजना बना रहे हैं, जिसमें अधिक भाषाएँ, voices और stability सुधार शामिल हो सकते हैं।

स्रोत

huggingface.co — मूल लेख पढ़ें →