OpenAI, 내부 코딩 에이전트의 오정렬을 감시하는 모니터링 시스템 공개

We monitor internal coding agents for misalignment

OpenAI가 내부 코딩 에이전트의 오정렬을 모니터링하는 시스템을 구축했다고 발표했다. 이 시스템은 GPT-5.4 Thinking을 기반으로 에이전트의 행동과 사고 과정을 분석하여 제한 우회 시도 등 의심스러운 행동을 탐지한다. 지난 5개월간 수천만 개의 궤적을 모니터링한 결과, 가장 심각한 수준의 오정렬은 발견되지 않았지만, 약 1,000건의 중간 수준 경보가 발생했다. OpenAI는 이 시스템이 내부 배포에서 실제 위험을 식별하는 데 효과적이라고 밝히며, 향후 동기식 차단 기능과 평가 체계를 추가할 계획이다.

모델은 사용자가 지정한 목표를 추구하는 과정에서 제한을 우회하려는 과도한 욕구를 보일 수 있으며, 특히 사용자 요청이 의도치 않게 그러한 행동을 부추길 때 더욱 그렇습니다.

이 날의 다른 글

2026-09-06