Base Labs、オープンウェイトAI安전 파트너십 출범
원제: Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire
왜 중요한가
130억 달러 규모 추론 인프라 기업이 오픈 모델 안전 표준화에 나서며, 업계 주도의 자율 규제 움직임이 본격화될 수 있다.
Baseten의 연구 조직 Base Labs는 2026년 9월 17일, Hugging Face 및 Goodfire AI와 공동으로 오픈 웨이트 모델 대상 안전 평가·모니터링 인프라 구축 파트너십을 발표했다. Hugging Face에는 현재 6,000개 이상의 'abliteration' 처리된 모델이 등록되ており, 오픈 웨이트 모델의 안전성 문제가 확대되는 가운데 나온 발표다。
Baseten은 자사 연구 부문 Base Labs를 통해 오픈 웨이트 AI 모델의 안전 기반 표준 구축을 목표로 하는 파트너십을 공식화했다. 협력 대상은 오픈소스 모델 호스팅 플랫폼 Hugging Face와 모델 해석 가능성 전문 기업 Goodfire AI다.
이번 발표의 배경에는 'abliteration(어블리터레이션)'이라는 기술의 확산이 있다. 이는 모델에서 안전장치를 제거하는 기법으로, Hugging Face에 이미 6,000개 이상의 abliteration 처리 모델이 공개된 상태다.
Base Labs는 오픈 모델의 학습 및 배포 단계에 안전성을 내재화하는 방법론을 개발·공개할 계획이다. Baseten은 X에서 "개방성은 AI 안전의 강점"이라며 "폐쇄형 대비 모델 행동에 대한 가시성이 높고, 안전 연구를 실행 가능한 통제로 전환하는 수단도 더 많다"고 밝혔다. Goodfire는 "안전성은 오픈 모델에 내재되어야 하고, 이를 서비스하는 주체가 제공해야 한다"고 포스트에서 응답했다.
기술적 협력 구조의 세부 사항은 아직 공개되지 않았으나, AI '블랙박스' 해석을 전문으로 하는 Goodfire가 '내재화' 부분을 담당할 가능성이 높다는 관측이다.
Baseten은 지난 6월 Series F로 15억 달러를 조달해 기업 가치가 130억 달러에 달했다. Goodfire AI도 올해 초 B Capital 주도의 Series B에서 1억 5,000만 달러를 확보했다. Baseten은 더 넓은 개발자 커뮤니티에도 프레임워크 기여를 공개 요청하고 있다.