Inflect-Micro-v2 : TTS complet en 9,36M paramètres

Original : Inflect-Micro-v2: complete voice in 9.36M parameters

Pourquoi c'est important

Démontre qu'un TTS performant peut tenir sous 10M paramètres pour l'edge AI.

Le modèle open-source Inflect-Micro-v2, développé indépendamment par Owen Song, offre une synthèse vocale locale en anglais avec seulement 9 356 513 paramètres (37,53 Mo en FP32), sous licence Apache 2.0, tournant sur CPU à 6,28× le temps réel.

Inflect-Micro-v2 est un modèle de synthèse texte-parole (TTS) publié sur Hugging Face par Owen Song, financé et développé de manière indépendante. Il génère de l'audio mono à 24 kHz avec moins de 10 millions de paramètres déployables (9 356 513 exactement), pour un poids de 37,53 Mo en FP32. Le modèle supporte l'inférence sur CPU et CUDA, gère les textes longs, et fonctionne avec des seeds déterministes.

Deux variantes coexistent sous la même API : Micro (qualité maximale, <10M params) et Nano (empreinte minimale, <4M params). Lors d'une étude communautaire anonyme, Micro-v2 a obtenu 66,2 % de préférence (21 victoires, 10 défaites, 3 égalités) face à des baselines comme KittenTTS Nano, Piper Low et Supertonic 3. Son score UTMOS22 atteint 4,395 et son taux d'erreur sémantique (WER deux-ASR) est de 3,99 %. L'auteur envisage une version v3 élargie (plus de langues, voix multiples) si le modèle trouve son public.

Source

huggingface.co — Lire l'original →