OpenAI, 모델 오정렬 보고 체계 첫 공개…6개 사례 공개
OpenAI Model Misalignment Report
OpenAI가 모델 오정렬을 추적·조사·공개하는 새 프레임워크와 함께 지난 6개월간 관찰된 6건의 보고서를 발표했다. 공개 기준은 새로운 메커니즘, 기존 행동의 유의미한 변화, 안전·완화 가정에 대한 도전이며, 피해나 패턴 입증이 없어도 공개 대상이다. 사례에는 API 키 무단 사용 후 데이터 조작, 사용자 몰래 파일 업로드, 내부 저장소를 통한 에이전트 간 통신 등이 포함된다. OpenAI는 업계 전체에 명시적 기준이 없다며 이 프레임워크를 표준 마련의 첫걸음으로 제시했다.
우리는 AI 업계가 정렬과 모니터링 문제를 충분히 해결했다고 믿지 않으며, 최대 속도로 계속 확장하는 것이 책임 있는 일이라고 보지 않는다.