OpenAI新技術がAI安全専家に警戒感

원제: OpenAI’s new reasoning technique alarms AI safety experts

왜 중요한가

AI 추론 과정의 투명성 확보는 안전 관리의 근간이며, 불투명 재귀 기법의 확산은 업계 전체의 AI 감시 체계에 영향을 미칠 수 있다.

OpenAI의 신모델 「Astra」가 도입하는 「opaque recurrence(불투명 재귀)」추론 기법이 AI의 사고 과정 모니터링을 어렵게 한다는 이유로, AI 안전 전문가들이 2026년 9월 2일 강한 우려를 표명했다. Anthropic과 Google DeepMind도 동 기술 검토 중이라고 보도되었다.

The Information의 보도에 따르면, OpenAI의 신모델 Astra는 「recurrent depth」또는 「opaque recurrence(불투명 재귀)」라 불리는 추론 기법을 채택한다. 이 기법은 모델이 동일한 쿼리를 루프 형태로 반복 처리하는 방식으로, 기존의 순차적 chain-of-thought(CoT) 방식과 달리 판독 가능한 흔적이 적게 남아 모니터링이 어려워진다.

AI 안전 연구 기관 Redwood의 CEO인 Buck Shlegeris는 X에 게시물을 통해 「Astra가 opaque recurrence를 사용한다는 보도에 극도로 우려하고 있다. OpenAI가 이 기술을 더 확장할 경우 CoT 모니터링 가능성이 완전히 파괴될 수 있다」고 경고했다. AI 안전 옹호자 Zvi Mowshowitz도 「이 기법은 OpenAI와 Anthropic이 공동으로 확립하려 해 온 CoT 충실성·모니터링 가능성이라는 금기를 위협한다. 보다 집중적으로 사용될 경우 모니터링 가능성을 크게 손상시킬 것이며, AI 랩 간의 '바닥을 향한 경쟁'을 막기 위한 법률이 필요할 수 있다」고 밝혔다.

Chain-of-thought는 모델이 문제를 해결할 때의 순차적 사고 단계를 나타내며, OpenAI의 과거 비정상 에이전트 활동 분석에서도 중요한 도구로 활용된 바 있다. 한편 OpenAI는 Astra의 동 기법 사용이 제한적이며 CoT는 여전히 판독 가능하다고 반박했고, 최고 과학자 Jakub Pachocki는 X를 통해 「OpenAI는 최초의 추론 모델부터 CoT 모니터링의 보존·활용에 힘써 왔으며, 이는 현재 연구 프로그램의 핵심 목표」라고 강조했다. The Information은 추가 보도에서 Anthropic과 Google DeepMind도 이미 동 기술을 논의 중이라고 전했다.

출처

techcrunch.com — 원문 읽기 →