GigaToken : tokenisation ~1000x plus rapide

Original : GigaToken: ~1000x faster Language model tokenization

Pourquoi c'est important

Accélérer la tokenisation réduit les coûts et délais d'entraînement des grands modèles de langage.

GigaToken, bibliothèque open source développée par Marcel Roed, propose une tokenisation pour modèles de langage atteignant plusieurs Go/s, soit environ 1000 fois plus rapide que HuggingFace Tokenizers, en remplacement direct (drop-in) compatible avec la majorité des tokenizers courants.

GigaToken est un projet open source publié sur GitHub par marcelroed, conçu pour accélérer massivement la tokenisation des textes destinés aux modèles de langage (LLM). Selon le README officiel, la bibliothèque est « environ 1000 fois plus rapide que HuggingFace Tokenizers », qui s'appuie pourtant déjà sur du code Rust multithread, tout comme tiktoken d'OpenAI. GigaToken fonctionne lui aussi en Rust et offre une compatibilité large avec le matériel CPU ainsi qu'avec la quasi-totalité des tokenizers populaires. Il se présente comme un remplacement direct (drop-in replacement), facilitant son intégration dans les pipelines existants sans modification majeure du code. Le dépôt compte déjà plus de 1 400 étoiles et 50 forks sur GitHub. La bibliothèque cible notamment les cas d'usage à fort volume de données textuelles, où la vitesse de tokenisation constitue un goulot d'étranglement dans les chaînes d'entraînement ou d'inférence de LLM.

Source

github.com — Lire l'original →