Goodfire, AI 에이전트 내부 감시 모니터 출시
원제: Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
왜 중요한가
AI 에이전트 보안 감시의 비용 장벽을 대폭 낮춰, 기업 규모와 무관하게 실시간 안전 모니터링 도입을 가속화할 수 있다.
AI 해석가능성 스타트업 Goodfire가 2026년 10월 8일, AI 에이전트의 출력이 아닌 내부 연산을 실시간 감시하는 'inside-out' 모니터를 공개했다. Baseten 고객 대상으로 제공되며, 1,500회 세션 감시 비용은 약 51달러로 기존 상위 모델 대비 약 200배 저렴하다.
기존 AI 에이전트 감시 방식은 별도의 AI 모델이 대상 모델의 출력을 처음부터 다시 읽는 구조다. 에이전트가 장시간 구동되며 방대한 텍스트를 처리할수록 비용이 급격히 증가한다는 단점이 있었다.
Goodfire는 이 문제를 '내부에서 바깥으로' 접근하는 방식으로 해결했다. 'probe'라 불리는 소형 감지기가 모델의 각 연산 단계에서 내부 신경 활성화(neural activation) 값을 직접 읽는다. 모델이 이미 계산한 중간 결과물을 재활용하기 때문에 추가 연산 부담이 거의 없다. Goodfire CEO Eric Ho는 MAD Podcast에서 "모델이 이미 토큰을 연산하고 있으며, 우리는 이미 계산된 중간 활성화 값에 분류기를 돌릴 뿐"이라고 설명했다.
Kimi K3 모델을 대상으로 한 테스트에서 1,500회 세션 감시 비용은 약 51달러에 그쳤다. 저가형 AI 모델 활용 시 233달러, 최상위 모델 활용 시 약 1만 달러가 드는 것과 비교하면 비용 절감 효과가 뚜렷하다. 악성 해킹 세션 탐지율은 94%였으며, 정상 세션의 오탐률은 8.7%였다. probe 4개를 동시에 구동해도 응답 지연은 2% 미만이었다.
감시 대상 위협 범주는 고객이 직접 선택할 수 있으며, 공격적 해킹, 화학·생물 무기 악용, 보상 해킹(reward hacking) 등이 포함된다. 탐지 시 대응도 로그 기록, 인간 검토 전달, 요청 거부 중 선택 가능하다. 이 모니터는 Baseten·Hugging Face와의 안전 파트너십 발표 이후 첫 구체적 결과물이다.