LLM出力の「人間化」は間違いだ
Humanising LLM Outputs Is Dumb

LLMの出力を人間らしく整形するプロンプトが流行しているが、これは情報を不可逆的に圧縮し、エージェント間の連携を損ない、失敗を隠蔽する。データベースやAPIが高忠実度の表現を保持するのと同様に、LLMツールも生の状態を維持し、人間が消費する境界でのみ変換すべきだ。著者は、この流行は将来の正しい方向を示す「バグ報告」だと主張する。
エージェントが六つのテストを実行したなら、私は「テストはほとんど合格しましたが、一つ気になる問題がありました」ではなく、「5/6 PASS FAIL: test_cache_invalidation CAUSE: stale key survives restart REPRO: tests/cache_test.py:184」を望む。