„Nicht raten“: Wie ein Satz die erfundenen Felder von 71 % auf 20 % senkte

Calling the AI bluff: Adding "Do not guess" cut made-up fields from 71% to 20%

Ein Benchmark auf earnanhonestdollar.com testet, ob KI-Extraktoren Felder erfinden, die auf einer Webseite fehlen. 16 Modelle und 3 Paid-APIs traten an. Ohne den Satz „Use null for any field whose value is not on the page. Do not guess.“ erfanden die Modelle 70,7 % der fehlenden Felder, mit ihm nur 20,2 %. Firecrawl schnitt mit 24 von 36 erfundenen Feldern schlechter ab als 13 der 16 Modelle. Ein billiger Checker (GPT-6 Luna) fing 38 von 49 erfundenen Werten und lehnte keinen korrekten ab.

Alle 16 Modelle erfanden mehr ohne den Satz: 405 von 573 fehlenden Feldern ohne ihn (70,7 %), 116 von 574 mit ihm (20,2 %).
  1. BatchJob

    Das LLM wird einen statistischen Weg einschlagen, um zu antworten, und wird sich unter keinen Umständen weigern, dies zu tun, außer dort, wo es darauf programmiert wurde.

    Deine Beispiele sind konstruiert und werden sich in nennenswerter Weise nicht bestätigen. Ungenauigkeiten sind normalerweise nicht einfach erfundene Behauptungen, sondern falsche Informationen, die auf statistischen Pfaden zu irreführenden Ergebnissen beruhen oder den aktuellen Kontext umgehen. LLMs verstehen das Wort „don't“ nicht. LLMs verstehen die Bedeutung von keinem Wort.

    Weder du, noch Aristoteles, noch Gott werden jemals ein LLM dazu bringen, durch Prompting die Wahrheit oder korrekte Ergebnisse zurückzugeben.

  2. l1ng0

    Wir alle werden zu Tauben in einer Skinner-Box.

  3. datsci_est_2015

    Cool, das wird in Harnesses eingebaut werden und dann wird es nicht mehr effektiv sein und wir werden zur nächsten magischen Beschwörungsformel übergehen.

Mehr von diesem Tag

2026-09-27