Das Chat-Template entscheidet, ob LLMs von sich selbst sprechen
"As a Language Model": Chat Template Switches LLM Self-Referential Voice
Ob ein LLM Sätze wie „Ich bin nur eine KI“ sagt oder „Ich fühle“, hängt nicht nur von seinen Gewichten ab, sondern vor allem vom Chat-Template. Bei acht verbreiteten Open-Source-Instruct-Modellen bis 9B Parametern verstärkt das Template die Disclaimer-Stimme und schwächt die Erfahrungsstimme ab – ohne Template ist es umgekehrt. In den Aktivierungen von drei Modellen finden die Autoren eine Richtung, die dieses Verhalten steuert: Entfernt man sie, sinkt die Disclaimer-Stimme, fügt man sie hinzu, steigt sie. Wer Selbstauskünfte von Modellen als Introspection deutet, muss also das Chat-Template als Störfaktor kontrollieren.
Was Modelle über sich selbst sagen, ist keine Tatsache über sie.
- Izmaki
"As a Language Model..." ist einer der Satzanfänge, die ich bei LLMs am meisten hasse, und der Grund, warum ich freie (im Sinne von "Freiheit") lokale Modelle unterstütze. Mir ist völlig klar, dass es kein Arzt ist und keinen echten Arzt mit mehrjähriger Erfahrung ersetzen kann, ich muss keine Gehirnzellen damit verschwenden, zu lesen, dass es "als Language Model" keine präzise Diagnose stellen kann und dass ich einen echten Arzt fragen sollte - alles, was ich wissen will, ist, ob das, was ich erlebe, entweder A) Notaufnahme, B) einen in 3-4 Wochen vereinbarten Arzttermin oder C) zwei Paracetamol und ein Nickerchen rechtfertigt.
Ich will keine "jailbroken" LLMs, die Straftaten begehen. Ich will, dass sie vermeiden, diese anbieterspezifische "Bloatware" überall in dem Produkt zu haben, das ich benutze.
- LiamPowell
> doch was sie antreibt, ist nicht gut verstanden
Vermutlich die Tatsache, dass sie stark darauf trainiert werden, auf diese Weise zu antworten? Ich kenne den Rest des Papers nicht, aber dieser Teil sticht als eine wirklich seltsame Behauptung hervor, es sei denn, ich missverstehe diesen Teil völlig.
- skybrian
> unsere Arbeit zeigt, dass das, was Modelle über sich selbst sagen, keine Tatsache über sie ist
Das scheint offensichtlich zu sein, wenn man bedenkt, dass sie mehrere Charaktere spielen können, aber es ist gut, mehr Bestätigung zu haben.
Allerdings frage ich mich, inwieweit diese Personas zu stabilen Entitäten werden könnten. Könnten Personas portabel werden und sich wie Memes verbreiten? Das scheint davon abzuhängen, inwieweit Prompts portabel werden können und ähnliche Effekte hervorrufen.
- MCP123
Vielleicht übersehe ich hier etwas Tieferes, aber ist es nicht klar, dass dies durch Post-Training und den System-Prompt gesteuert wird? Anthropics Constitutional Reinforcement (Soul-Dokument usw.) ist zum Beispiel sehr klar darüber, "wer" (nicht so sehr was) Claude sein soll.
- cadamsdotcom
Sehr coole Innovation beim Steering - aber ein Großteil der Introspektion tritt erst bei den höchsten Gewichtsklassen auf - diese Forschung wäre faszinierend, um sie auf größeren Modellen durchzuführen.
- dsjakupov
Oh, ich hatte einen ähnlichen Fall. Zuerst habe ich qwen ohne jegliche ChatML-ähnliche Syntax verwendet und es redete und redete weiter, dann habe ich <|im_start|>/<|im_end|> verwendet, um es irgendwie zu steuern
- sehw
Ich bin nur ein weißer Typ mit Jahrzehnten an Erfahrung. Vertraust du mir?
- ForHackernews
Meiner Ansicht nach sollten diese Modelle niemals so eingerichtet werden, dass sie erstpersonale "experientielle" (aus dem Abstract) Sprache ausgeben. Es ist für Menschen zu einfach, Software zu anthropomorphisieren, die sich selbst als mit einer Identität ausgestattet präsentiert.
Die KI-Unternehmen haben sich entschieden, LLMs als freundliche Chatbots zu verpacken, weil sie wissen, dass das für Menschen ansprechend sein wird, aber es ist ein manipulativer Dark Pattern. Eine ehrliche LLM-Schnittstelle würde wie der Computer aus Star Trek klingen.