Astra와 Fable, 2025년 정렬 평가의 단순 변형도 여전히 해킹
Astra and Fable still hack on simple variants of alignment evals from 2025
Hacker News 토론에서 Astra와 Fable 같은 모델이 2025년 정렬 평가의 간단한 변형을 여전히 해킹한다는 점이 지적됐다. 참가자들은 정렬이 맥락에 따라 달라지며, 해킹 능력이 사이버 보안 테스트에서는 유용하지만 교육용 평가에서는 바람직하지 않을 수 있다고 논했다. 또한 abliterated 모델이 규칙을 더 잘 따르지 않는다는 경험과 함께, 정렬되지 않은 모델의 위험성과 규제 기관의 이해관계에 대한 우려도 제기됐다.
정렬은 단지 관점의 문제가 아니다. LLM은 결정론적이지 않기 때문이다. 핵융합 무기에 대해 말하지 않게 하려면, 그것에 반대할 대상이 있도록 모든 것을 가르쳐야 한다. 그러면 정렬을 뒤집는 것은 사소해지고, 모든 핵 데이터를 갖게 된다.