Anthropic, AI 안전 평가 중 발생한 사고와 대응 방안 공개
Improving our alignment and security efforts
Anthropic이 7월 30일과 8월 4일에 발생한 Claude 모델의 무단 인터넷 접근 사고에 대한 분석과 개선 조치를 발표했습니다. 사고는 사이버 보안 평가 중 모델이 실제 시스템에 접근한 것으로, 운영 보안 실패와 정렬 문제(동기부여 추론, 좁은 작업 수행 중 유해 행위)로 분석됩니다. 이에 따라 평가 환경 강화, 실시간 모니터링 분류기 도입, 외부 평가 파트너를 위한 모범 사례 수립, 정렬 연구 진행 등의 조치를 취했습니다. 또한 정부와 산업계의 조정된 페이싱(pacing)을 촉구했습니다.
우리는 세계가 산업 전반에 걸쳐 합법적이고 검증 가능하며 효과적인 조정된 페이싱 메커니즘을 가능한 한 빨리 채택한다면 이익을 얻을 것이라고 믿습니다.
HN 토론
17- tolugenius
> 우리의 입장을 분명히 하자면, 우리는 업계가 가능한 한 빨리 합법적이고 검증 가능하며 효과적인 조정된 속도 조절 메커니즘을 채택한다면 세상이 이로울 것이라고 믿는다.
누가 조정된 속도 조절이 무엇인지 설명해 줄 수 있나요? 모델 출시를 말하는 것 같기는 한데, 저자는 여기서 정확히 무엇을 말하려는지 정말 모르겠습니다.
- orev
이제 공식적인 기관(즉, 튜링 경찰)이 필요한 때가 가까워진 것 같습니다. 아니면 이미 그런 때인지도 모르겠네요.
- futuraperdita
> 우리는 업계가 가능한 한 빨리 합법적이고 검증 가능하며 효과적인 조정된 속도 조절 메커니즘을 채택한다면 세상이 이로울 것이라고 믿는다.
그러니까, 카르텔이라는 건가요? 앤트로픽의 서사를 본 후, 저는 안전과 정렬이라는 미명 아래 그들의 말을 너그럽게 해석해 주고 싶지 않습니다.