GigaToken: HuggingFace比約1000倍高速なトークナイザー

원제: GigaToken: ~1000x faster Language model tokenization

왜 중요한가

대규모 LLM 학습·추론 파이프라인에서 토크나이징 병목을 해소할 수 있는 오픈소스 도구의 등장으로, 데이터 전처리 효율화에 직접적인 영향을 미친다.

개발자 marcelroed가 오픈소스 프로젝트 GigaToken을 GitHub에 공개했다. 이 라이브러리는 HuggingFace의 tokenizers 대비 약 1000배 빠른 언어 모델 토크나이저로, GB/s 단위의 처리 속도를 실현하며 기존 라이브러리의 드롭인 대체품으로 설계됐다. 현재 GitHub에서 별 1,400개 이상을 기록하고 있다.

GigaToken은 Rust로 구현된 고속 언어 모델 토크나이저 라이브러리로, GitHub에서 오픈소스(MIT 라이선스)로 공개됐다. 프로젝트에 따르면 HuggingFace의 tokenizers 및 OpenAI의 tiktoken 대비 약 1000배 빠른 토크나이징 속도를 달성한다고 밝혔다.

주목할 점은 HuggingFace tokenizers와 tiktoken이 이미 멀티스레드 Rust로 구현되어 있음에도 불구하고 이 같은 성능 차이를 실현했다는 것이다. GigaToken은 광범위한 CPU 하드웨어를 지원하며, 일반적으로 사용되는 거의 모든 토크나이저와 호환된다고 설명했다.

기존 라이브러리의 드롭인 대체품으로 설계되어, 코드 변경을 최소화하면서 도입할 수 있다. 리포지토리에는 벤치마크 결과, 설계 문서(design_doc.md), 프리토크나이저 최적화 로그(pretokenizer_optimization_log.md) 등 상세 기술 문서도 함께 포함되어 있다. Python 인터페이스도 제공되며 pyproject.toml이 포함되어 있어 Python 환경에서도 사용 가능하다. 현재 GitHub 리포지토리에서 1,400개 이상의 스타와 50개의 포크를 기록하고 있다.

출처

github.com — 원문 읽기 →