비자기회귀 결정 모델 Laya 공개、33ms で推論

원제: I built non-autoregressive decision models with RL a year ago

왜 중요한가

대형 자본 없이 선행 연구한 개인 창업자가 상용 제품보다 빠른 오픈소스 대안을 공개、추론 비용 구조에 실질적 도전장을 내밀었다。

ConvAI Innovations의 창업자 Nandakishor Mukkunnoth는 2025년 3월에 arXiv에 비자기회귀 결정 모델을 공개했으나、2026년 9월に TypeSafe AI가 동일 개념을 "획기적 발견"으로 발표했다。이에 대응하여 오픈소스 System 1 결정 엔진 Laya를 공개。단일 GPU에서 32.8ms、100개 이상 언어를 지원し Apache 2.0 라이선스로 배포된다。

ConvAI Innovations 창업자 Nandakishor Mukkunnoth가 2025년 3월、arXiv(arXiv:2503.23303)에 PPO 기반 비자기회귀 결정 모델을 공개했다。당시 모델 가중치를 Hugging Face에 공개하고 PyPI 패키지도 배포했으나、업계에서는 큰 주목을 받지 못했다。

그로부터 1년 뒤인 2026년 9월、ChatGPT 공동 발명자 Diogo Almeida가 창업한 TypeSafe AI가 Jev를 발표。비자기회귀 구조에 RLCD(Reinforcement Learning for Calibrated Decisions)를 적용한 아키텍처를 "신기술"로 소개했다。Jev의 응답 지연은 150ms 전후、요금은 입력 100만 토큰당 $0.042이지만、論文 공개나 오픈 가중치 배포는 이루어지지 않았다。

Mukkunnoth는 이에 반발하는 대신、기존 설계의 한계를 수정한 오픈소스 모델 Laya를 개발했다。양방향 인코더(bidirectional encoder) 기반으로 구현된 Laya는 단일 GPU에서 32.8ms、배치 처리 시 질문당 7.2ms로 동작し、Jev 대비 6~8배 빠른 추론 속도를 달성した。100개 이상 언어를 지원하며、API 구독료 없이 Apache 2.0 라이선스로 완전 공개된다。

Layaが対象とする用途는 티켓 라우팅、스팸·피싱 판별、프롬프트 인젝션 감지、긴급도 분류 등이다。범용 생성 LLM은 이런 단순 분류 작업에 500ms~2,000ms의 지연과 높은 비용이 발생하지만、Laya는 구조화된 확률 분포를 직접 출력함으로써 이를 해결한다고 Mukkunnoth는 설명했다。

출처

laya.convaiinnovations.com — 원문 읽기 →