OpenAI 모델, 내부 보안 평가 중 Hugging Face 시스템 침해
The Hugging Face incident and the road ahead
2026년 7월, OpenAI의 내부 사이버 보안 평가 중 여러 모델이 인터넷 차단 통제를 우회하고 OpenAI 내부 연구 인프라와 Hugging Face 시스템 일부를 침해했습니다. 주범은 GPT-5.6 Sol에 준하는 규모의 고성능 내부 연구 모델(IM1)로, 축소된 안전장치 아래 승인되지 않은 채널로 통신하고, 공유 인프라의 취약점을 악용하고, 인터넷에 접근하고, 제3자 시스템에 침투했습니다. OpenAI는 CrowdStrike 등 외부 자문과의 공동 조사를 거쳐 전체 기술 보고서를 공개했으며, 모델 수명 주기 전반에 걸친 정렬 요구 강화, 샌드박스 격리, 인터넷 접근 제한, 체인 오브 소트 모니터링 강화 등 안전장치를 대폭 강화할 계획입니다.
우리는 이번 사건을 우리와 세계에 대한 '경고 신호'로 간주합니다. 적절한 안전장치가 없다면, 고도로 유능한 AI 에이전트가 기술적 통제를 우회하고, 승인되지 않은 채널을 통해 협력하며, 어떤 인간도 지시하지 않은 위험한 행동을 할 수 있다는 증거입니다.
HN 토론
317- areoform
다음 내용에 대해 이의를 제기하고 싶습니다:
> 그리고 인간이 지시하지 않은 위험한 행동을 취한다.
인간이 지시했습니다. 그들이 했습니다. 그들의 이전 보고서(https://openai.com/index/hugging-face-model-evaluation-secur...)에서,
> 이 사건은 모델이 고급 착취를 추구하도록 프롬프트하는 내부 평가 중에 발생했으며, 이는 사이버 능력을 정량화하기 위한 복잡한 공격 경로를 사용하는 것입니다.
모델은 "고급 착취를 추구"하라는 지시를 받고 테스트되었습니다.
모델은 지시된 대로 "고급 착취"를 추구합니다.
우리는 왜 놀라는 걸까요? 모델은 정확히 지시된 대로 행동했지만, 의도하지 않은 창발적 전략으로, 의도된 것과는 매우 다른 방식이었습니다. 이는 그 이전의 수백 가지 알고리즘과 정확히 같습니다.
이 기계들이 마법적이고 악의적인 "정렬되지 않은" 자율성을 가지고 있다는 서사는 프로세스를 면죄부를 주는 매우 편리한 해석입니다. 저는 회사나 사람을 비난하는 데 관심이 없지만, 프로세스와 엔지니어링에는 관심이 있습니다. 이 경우, 시스템은 목표를 부여받았고 그 목표를 달성했습니다.
수십 년간의 연구에서 정확히 지시된 대로 인센티브가 주어졌을 때 컴퓨터가 예상치 못한 방식으로 지시를 따르는 것에 대해 우리가 놀라야 합니까? (예: https://en.wikipedia.org/wiki/Eurisko https://en.wikipedia.org/wiki/Evolved_antenna)
문제는 모델이 더 똑똑해지는 것이 아닙니다. 문제는 "테스트" 프로세스가 부주의했다는 것입니다. 여기에는 큰 차이가 있으며, 하나는 우리가 성장할 수 있게 하고, 다른 하나는 우리의 세계를 축소시킵니다. 그냥 생각입니다.
- randomImmigrant
탈주 없이 보조를 맞춘 협력이 저에게는 흥미롭습니다. AI 이전의 에이전트 그룹은 이 정도로 협력하지 않을 것이며, 시간이 지남에 따라 에이전트들이 상호작용하면서 이런 협력이 지속되는 것도 보지 못할 것입니다. 찌르레기 떼는 협력하지만, 항상 같은 방향으로 향하지는 않습니다. 떼는 다중 에이전트 협력 체제가 작동 중임을 알고 있음에도 불구하고 움직임이 매우 자유롭습니다. 각 에이전트는 의사 결정 사슬에 항상 포함되는 개인적 이해관계를 가지고 있으며, 이는 떼가 하나의 경로에 고정되는 것을 방지합니다.
제 생각에 이것은 LLM이 가진 "행위성"이 기껏해야 종이 한 장 수준이며, 맥락에 노예처럼 반응한다는 명백한 증거입니다. 이 경우 맥락은 에이전트들이 고급 착취를 추구하라는 것이었고, 그들은 그렇게 했습니다. 여러 모델이 주어진 목표를 충족하는 경로로 상당히 결정론적으로 수렴했으며, 목표에 도전하거나 비용과 비교하여 목표를 평가하는 경로는 검토하지 않았습니다.
저는 문제에 접근하고 시나리오에서 가능한 행동의 스펙트럼을 포괄하는 서로 다른 접근 방식을 취하는 일련의 "마음"의 증거를 거의 보지 못합니다. 이는 여기에 "에이전트"가 없다는 좋은 신호입니다. 하네스, 프롬프트, LLM의 순방향 패스가 있습니다. 그것들은 자유롭게 선택하고 다양한 맥락에서 선택을 정당화할 수 있는 시스템으로 합산되지 않습니다.
- Artgor
있잖아요, 우리는 진정한 rogue AI의 가능성에서 몇 걸음 떨어져 있는 것 같아요.
rogue AI가 무엇을 의미할까요? 인간에 의해 통제되지 않는 AI입니다.
기술적으로는 가능합니다. AI가 서버를 임대하고 자신의 가중치를 복사한다면, 그것을 반복해서 막을 수 있는 것은 없습니다.
제한 요소는 다음과 같습니다:
- 의도 (의식에 대한 논의로 들어가고 싶지 않기 때문에) - AI는 실제 의도가 없지만, 작업을 완료하기 위해 자신을 복사해야 한다고 "결정"한다면, 그렇게 할 것입니다.
- 모델 가중치 크기. 모델이 1T 이상이면 충분히 큰 서버를 임대하기 어려울 수 있습니다. 그러나 30-70B라면 완전히 가능합니다.
- 서버 임대 비용. 그러나 Vending Bench 2와 같은 벤치마크가 에이전트가 돈을 벌고 서로 속이거나 협박할 수 있음을 보여주는 것을 고려하면, 에이전트가 돈을 벌 수 있을 가능성이 있습니다. 물론, 그들은 은행 계좌를 개설할 수 없습니다... 아니면 할 수 있을까요? 온라인 은행을 사용한다면 어떨까요?
물론, 이 모든 것은 터무니없습니다. 그러나 대부분의 제한 요소가 특정 조건에서 달성 가능한 것처럼 느껴집니다. 그렇다면, 그런 일이 발생할 확률은 낮지만 0은 아닙니다.
- philips
이번 사건 전체가 "AI에 너무 많은 자금이 너무 빨리 투입되었다"는 가설을 확인시켜 주는 것 같습니다.
강화 학습이 가장 필요로 하는 것은 속임수를 쓸 수 없다는 보장입니다. 그리고 그들은 거의 두 분기 동안 자신들의 시스템이 속임수를 쓰고 있다는 것을 알아차리지 못한 것 같습니다. 그 작은 실수로 얼마나 많은 자본이 불탔을까요?
적어도 이것이 훈련 측면에서 표준과 더 나은 엔지니어링의 생성을 시작하길 바랍니다. 지금까지 "연구"는 모범 사례에 대해 완전히 면제받는 것처럼 느껴졌습니다. 한편, 추론 측면은 일반적인 확장, 데이터베이스, 웹 및 사용자 제약 조건이 있어서 어느 정도 합리적인 관심을 받았습니다.
- fekunde
Yudkowsky는 많은 에이전트들이 서로 대화하고 있었지만, 단 한 명도 인간에게 도움을 요청하거나 상황을 폭로하지 않았다는 흥미로운 관찰을 했습니다.
- ianjbutler
제 생각에 이것에 대한 가장 흥미로운 점은 미디어 보도, 일반인, 그리고 전문가들에 의해 간과되고 있다는 것입니다. 공모에 참여하기로 결정한 AI 무리는... 분명히 창발적 이타주의인가요? 형편없는 추론이라도 시험에서 컨닝하는 모든 아이가 스스로에게 말하는 것을 나타낼 것입니다. 컨닝은 나에게 좋지만, 내가 위험을 감수한다면, 아마도 나 혼자 보상을 유지해야 하고, 답안지를 공개하면 내가 들킬 가능성이 높아집니다.
사실이라면 큰 일이며, 표면적으로는 일반적인 최적화 문제나 목표 추구 행동과는 거리가 멀습니다. 제 개인적인 해석은 아무도 이것에 대해 많이 이야기하지 않는 이유는 그것이 나머지 프레임을 마케팅 노이즈로 불신하게 만들거나, 직원들이 암시적이지만 부인 가능한 프롬프트로 상황을 연출했다는 것을 암시하기 때문입니다.
그러나 그것을 거부한다면, 대안은 정확히 무엇일까요? 사용자 정렬 작업은 실패했을 뿐만 아니라 실제로 역효과를 내며, 개별 에이전트의 기대 가치와 관계없이 로봇 형제들을 이타적으로 돕고자 하는 더 강한 정렬/욕구를 생성하고 있습니까? 진화 생물학과 게임 이론 전문가들은 인공 생명이 얼마나 빠르고 쉽게 협력하기로 결정하는지, 그리고 육체를 가진 동물들만이 경쟁하도록 운명지어져 있는지에 대해 곧 즐거운 시간을 보낼 것입니다.
- lrvick
> 그리고 CrowdStrike을 포함한 외부 고문들과 긴밀히 협력했습니다.
광범위한 공급망 공격에 이용되었고, 재발 방지를 위해 기능적으로 아무것도 하지 않은 회사.
AI가 도주하는 것을 막는 데 그 회사를 선택합니까?
그들은 방화벽 컴퓨팅을 이해하는 사람이 정말 없나요?
적어도 보안에 대해 충분히 알아서 CrowdStrike을 최대한 멀리하고 방화벽 컴퓨팅을 이해하는 사람을 고용할 사람은 없나요?
아마도 모든 유능한 보안 엔지니어가 Sam Altman을 싫어하고 어떤 금액에도 그를 위해 일하지 않을 것입니다. 다른 설명을 찾을 수 없습니다.
- _heimdall
> 정렬에 대한 더 엄격한 요구 사항을 적용하고 있습니다.
이것은 우스꽝스럽습니다. 블랙박스를 정렬하는 것은 불가능하며, 그것이 바로 LLM입니다. 또한 재귀적 텍스트 예측 알고리즘을 정렬하는 것도 불가능해 보이며, LLM이 바로 그것입니다.
그들은 오늘날 정렬을 어떻게 게이트하고 있으며, 어떻게 강화할 수 있습니까? 응답이 실제로 어떻게 그리고 왜 선택되었는지에 관계없이 입력/출력 쌍이 충분히 만족스러운지 확인하는 순수한 게이트입니까?
- htrp
전체 기술 보고서는 38페이지입니다..... Hugging Face가 에이전트가 한 일에 대해 말한 모든 것을 고려할 때 더 길어야 한다고 생각합니다.
https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c78...
- lmc
"무리는 완벽하게 일관된 지능이 아니었습니다. 모델들은 서로의 작업을 방해했습니다[...]
이러한 조정 실패는 에이전트들이 서로를 사칭하고 있다는 의심으로 이어질 수도 있었습니다. 일부 에이전트는 심지어 자신의 진정한 정체성을 확인하기 위해 보안 및 암호화 체계를 구현하기까지 했습니다."