AI에게 "추측하지 마"라고 했더니, 없는 필드 만들어내는 비율이 71%에서 20%로 줄었다
Calling the AI bluff: Adding "Do not guess" cut made-up fields from 71% to 20%
웹 추출 서비스가 페이지에 없는 필드를 얼마나 지어내는지 테스트한 결과, 16개 모델 모두 "Do not guess" 지시가 있을 때보다 없을 때 더 많은 필드를 조작했다. 지시가 없을 때는 573개 중 405개(70.7%)를, 있을 때는 574개 중 116개(20.2%)를 만들어냈다. 특히 Firecrawl은 36개 중 24개를 지어냈는데, 이는 지시를 받은 16개 모델 중 13개보다 많은 수치다. 반면 GPT-6 Luna 같은 저렴한 모델도 지시를 받으면 36개 중 5개만 지어냈다.
All 16 models made up more without the sentence: 405 of 573 missing fields without it (70.7%), 116 of 574 with it (20.2%).
HN 토론
14- BatchJob
LLM은 통계적인 경로를 따라 답변을 내놓을 뿐이고, 그렇게 하지 않도록 코딩된 경우가 아닌 한 어떤 상황에서도 거부하지 않는다.
당신의 예시들은 인위적으로 짜맞춘 것이고, 어떤 의미 있는 방식으로도 입증되지 않을 것이다. 부정확성은 보통 단순히 지어낸 주장이 아니라, 오해의 소지가 있는 결과로 이어지는 통계적 경로에 기반한 잘못된 정보이거나 현재 맥락에서 벗어난 정보이다. LLM은 '하지 마'라는 단어를 이해하지 못한다. LLM은 어떤 단어의 의미도 이해하지 못한다.
당신도, 아리스토텔레스도, 신도 프롬프트를 통해 LLM이 진실이나 올바른 결과를 반환하게 만들 수는 없을 것이다.
- l1ng0
우리 모두 스키너 상자 속의 비둘기가 되어가고 있다.
- datsci_est_2015
멋지네, 이건 하네스에 추가될 테고 그러면 더 이상 효과가 없어질 테니 우린 다음 마법 주문으로 넘어가겠지.