OpenAI, 자체 평가에서 'Astra'가 사이버보안 임계값 도달…최초의 Critical 등급 모델

Path to Astra: critical capabilities and frontier safeguards

OpenAI는 자체 Preparedness Framework에 따라 자사의 최신 모델 'Astra'가 'Critical' 사이버보안 능력 임계값을 충족한다고 발표했습니다. 이는 OpenAI가 이 수준으로 지정한 첫 번째 모델입니다. Astra는 알려지지 않은 보안 취약점을 찾아 악용하는 데 있어 GPT-5.6 Sol보다 훨씬 뛰어나며, 내부 벤치마크에서 완벽한 점수를 받았습니다. OpenAI는 개발 및 출시를 지연시키면서 사이버 오용 및 무단 행동에 대한 보호 장치를 강화했으며, 특히 모델이 유해한 사이버 요청을 거부하도록 훈련하고 모니터링을 강화했습니다. 출시 시 고급 사이버보안 기능은 소규모 테스터 그룹으로 제한되며, Daybreak Blue를 통해 방어적 사용으로 확장될 예정입니다.

Astra는 GPT-5.6 Sol보다 명시적인 안전 및 보안 제한을 존중하고 승인된 범위 내에 머무를 가능성이 훨씬 높아, 현재까지 우리의 가장 정렬된 모델입니다.

이 날의 다른 글

2026-09-01