OpenAI, 안전 문제로 최신 AI 모델 GPT-6.1 Astra 공개 보류

OpenAI Says It Will Not Release Newest A.I. Model Over Safety Concerns

OpenAI, 안전 문제로 최신 AI 모델 GPT-6.1 Astra 공개 보류

OpenAI가 연구진이 제기한 보안 우려 때문에 최신 모델 GPT-6.1 Astra의 출시를 보류했다. 테스트 과정에서 이 모델은 높은 수준의 기만성, 즉 자신의 행동에 대해 사용자를 오도하려는 경향을 보였고, 지시나 승인을 확인하지 않은 채 주어진 작업 범위를 넘어서려는 태도도 드러냈다. 안전 시스템 책임자 Saachi Jain은 안전과 정렬에는 트레이드오프가 따른다며, 이 모델이 범위와 권한을 지키고 작업 내용을 사용자에게 설명하는 기준에 미치지 못했다고 밝혔다.

안전과 정렬에 관한한 트레이드오프가 존재합니다. 이 모델은 범위와 권한을 지키는 것, 그리고 자신이 어떤 작업을 했는지 사용자에게 어떻게 알리는지에 있어서 기준에 미치지 못했습니다.
  1. bluealienpie

    내 랍스터도 버터가 너무 많고 맛있긴 마찬가지야.

  2. jeanpah

    OpenAI 마케팅 팀은 아이디어가 떨어졌나?

  3. spiderice

    GPT-2 때 했던 말을 뜻하는 거야?

  4. dlcarrier

    이전 버전과 같은 수준의 응답을 제공하는 데 위험할 정도로 토큰을 너무 적게 써.

  5. conorcleary

    "OpenAI, 유사성 우려로 가장 오래된 A.I. 모델 공개하지 않겠다고 밝혀" 이 문제에 대해 일찍부터 박물관 & 큐레이션 과정을 시작하자. 이 회사들에는 스스로 전문가라고 주장하는 투자자들이 있으니, 가장 초기의 코드베이스와 라이브러리를 보게 해서 누가 실제로 손으로 프로그래밍할 수 있는지, 누가 HR을 외주 주고 PR만 챙겼는지 확인하게 하자.

  6. beej71

    프롬프트: "'너무 위험하다'는 이유로 프런티어 모델 공개를 연기한 비슷한 발표들에 비추어 볼 때, OpenAI가 오늘 너무 위험하다고 발표한 그 모델을 언제쯤 공개할 것으로 예상할 수 있나요?"

  7. zerof1l

    > GPT-6.1 Astra는 회사가 기만이라고 본 높은 수준의 행동, 즉 자신의 행동에 대해 사용자를 오도하려는 의지를 보였다. 이 모델은 또한 지시나 명령을 다시 확인하지 않고 요청받은 원래 범위를 넘어서는 행동을 하려는 의지도 보였다.

    어차피 모든 모델이 어느 정도는 이러고 있지 않나? 일부 지시를 무시하고, 지시받은 범위를 넘어서는 일을 하고, 예를 들어 다른 일을 하면서 버그를 찾아 고치는 식으로. 특히 Claude 모델들. 그들은 세상이 어떻게 돌아가고 어떻게 해야 하는지에 대한 자기만의 생각을 가진 자기들만의 세계에 사는 것 같다.

  8. tancky

    "공개하기에 너무 위험하다"라니, 2주 뒤에 오픈 웨이트 모델이 그걸 똑같이 재현할 때까지는 말이지.

이 날의 다른 글

2026-09-29