AI 랩들은 '프론티어 페이싱'을 진짜 목표로 삼지 않는다
Pacing the Frontier is not the actual goal for AI labs

프론티어 AI 랩 CEO들이 '프론티어 페이싱'을 외치지만, 실제 행동은 정반대라는 비판이 제기됐다. CAIS 2023 성명 이후에도 랩들은 오히려 가속 페달을 밟았고, Anthropic은 Claude 3를 출시하며 '최전선보다 약간 뒤처지겠다'는 기대를 배신했다. 저자는 랩들의 메시지를 독일 대사 비유로 설명하며, 그들의 진짜 목표는 실존적 위험 방지가 아니라 최고 인재를 붙잡아 경쟁에서 이기는 것이라고 주장한다.
당신의 가장 친한 친구가 골초인데, 담배가 언젠가 자신을 죽일 거라고 계속 말하면서 담배를 줄이기 위해 최선을 다하고 있다고 약속한다고 상상해 보라. 그는 심지어 TV와 블로그 글에 많은 시간을 쏟아 담배의 해악을 알리지만, 니코틴의 인지적 이점에 대해서는 더 자주 이야기한다. 하지만 만날 때마다 당신은 그가 연달아 담배를 피우는 모습만 보게 되고, 하루에 피우는 담배 갑수가 점점 늘어나는 것 같다.
HN 토론
80- nonethewiser
우리는 이미 미래를 들여다볼 수 있는 창을 가지고 있다.
- Anthropic은 Mythos가 생물학 및 사이버 보안 분야에서 뛰어난 능력을 갖추고 있어 위험하다고 모두에게 말했다.
- Anthropic은 다른 모델들처럼 Mythos를 공개하지 않았다. 그들은 중성화된 우화를 공개했다. 그들은 Mythos를 없애지 않았다.
- Anthropic은 SF에 연구소를 열었다.
항상 "연구소들이 모델 공개를 멈추고 대신 그 주변에 구축을 시작할까?"라는 질문이 있었다. 그렇다 - 그들은 이미 그렇게 했다. Anthropic은 인텔리전스 외에도 생물학 및 사이버 보안 회사이다.
개인적으로 나는 그들이 많은 것을 숨기고 있었는지 궁금하다. Opus 5.5는 약간의 정체 후에 나온 좋은 릴리스였다. Open AI가 좋은 모델을 내놓으면 모두가 Anthropic이 형편없다고 말하고 -- 아, 이것 보게 - 마침내 더 나은 모델이 나오니 갑자기 모두가 그렇게 말한다.
- teravor
IQ가 높은 분야에서 일할 만큼 똑똑한 사람들이 다른 사람들처럼 수사나 이데올로기에 쉽게 조종된다는 게 항상 이상했다.
어릴 때 나는 모든 사람이 게임 이론의 어떤 측면을 직관적으로 이해할 거라고 생각했다. 게임 이론이 존재한다는 걸 알게 된 날을 아직도 기억한다 - 마치 누군가 상식을 성공적으로 체계화했다는 걸 알게 된 것 같았다.
대부분의 사람들은 사람들이 하는 말을 마치 고려할 가치가 있는 것처럼 받아들인다. 비용 없는 신호는 신호를 보내는 사람이 바보들이 믿기를 바라는 것을 알려줄 뿐이다.
- krat0sprakhar
> AI를 만드는 사람들의 동기와 연구소를 책임지는 사람들의 동기는 같지 않다. 지난 몇 년을 보면 OpenAI에서 Anthropic으로의 일방통행 문이 있었고, 주된 이유는 더 나은 보상이나 심지어 그들이 이기기 때문이 아니라, 주로 이 직원들에게 이 마법 램프를 만들 때 가장 신중할 것이라고 광고했기 때문인 것 같다. 2023/2024년에 그들의 입장은 이런 인재를 끌어들이는 핵심 이유 중 하나였다.
> 최근 뉴스를 믿는다면, 오늘날에도 Anthropic 문화는 이 효과에 크게 의존하는 것 같다.
> 내 생각에 이것은 종종 초지능으로 인류가 멸망하는 것을 매우 걱정하는 최고의 직원들을 얻고 유지하는 주요 요인이었다.
나는 이 관점을 고려하지 않았지만 이것은 매우 말이 된다. 많은 Anthropic 직원들이 진심으로 이것을 믿고 있으며 안전에 대한 강조를 그들이 그곳에서 일하는 핵심 이유로 꼽는다. 이제 Dario의 글 "Pacing the frontier"는 더욱 이해가 된다 -- 그것은 나머지 세계만큼이나 그의 직원들을 위한 것이기도 하다.
- ineedasername
이 기사는 아무것도 이루어지지 않았고 실제 노력도 없었다고 주장하는 처음부터 완전히 결함이 있다. "2003년 CAISS 성명 이후 어떤 노력과 안전장치가 마련되었는가?"를 간단히 검색해보라.
또한 예방적 이니셔티브나 문제에 대한 개입에 대한 많은 비판과 같은 추론 오류 모드를 보여준다:
이니셔티브가 시작될 때 특정 궤적에 있던 문제가 그들이 바라는 일정이나 성공 기준에 따라 해결되지 않았다거나, 그렇지 않았을 경우와 의미 있게 달라지지 않았다는 이유만으로 실패했다고 가정하는 것.
어려운 문제가 있다는 것, 다른 것들을 시도해야 할 수도 있다는 것, 또는 시도한 것들이 부분적이지만 완전한 해결책은 아니었다는 것을 깨닫는 것은 어떻게 된 일인가?
- bentt
이 기사는 AI CEO들의 주요 동기가 직원들을 위해 올바른 말을 따라하며 인재를 유지하는 것이라고 말한다. OpenAI에게 그것은 "우리 것은 너무 강력해서 우리도 무섭다... 규제가 필요하다!"이다. Anthropic에게 그것은 "이건 미친 짓이다! 통제를 벗어날 수도 있다! 우리가 좋은 사람들이고, 이 싸움에서 총을 든 좋은 사람이 필요하다"이다.
하지만 나는 그들 둘 다 같은 생각을 하고 있다고 본다... "이 속도라면 돈이 떨어질 거야."
하지만! 그들 중 하나가 먼저 눈을 깜빡이고 돈줄을 끄면 다른 하나보다 뒤처질 수 있다. 뒤처지는 것은 영원히 지는 것이다. 그리고 CEO가 싫어하는 것이 하나 있다면, 경쟁 CEO에게 지는 것이다.
그래서 그들이 원하는 것은 누군가, 아무나, 경쟁자와 자신을 동시에 제동을 걸어 둘 다 지지 않고 살아남을 수 있게 하는 것이다. 그 새로운 규칙 아래에서 그들은 이길 자신이 있다. 그리고 이긴다는 것은 다른 AI CEO를 이기는 것을 의미한다.
그게 전부다. 항상 개인적 인센티브에 관한 것이다. 그 안전 BS는 집어치워라. 이 사람들은 그냥 이기고 싶을 뿐이다.