Ask HN: LLMが絶望的に苦手な単純なことは何ですか?
Ask HN: What is one simple thing LLMs are insanely bad at?
私は、専門モデルを訓練するためのアイデアを探しています。ChatGPT、Claude、または他のモデルに繰り返し依頼しても、まだどこかで失敗する単純なことは何ですか?
空間推論と3Dリギングおよびアニメーション。ああ、単純なことと言いましたね。人間のように話すことです。
HNでの議論
86- jampa
真面目な答え:どのモデルも、意味が通る建築の間取り図を書くことには到底及ばない。
彼らはすべてのルールやベストプラクティスを理解しており、(時には)間取り図の悪いアイデアを見抜くことも、良い間取り図を説明することもできる。
しかし、たとえすべての詳細(部屋の「ノードグラフ」さえも)を与えても、彼らに作らせると、やはりナンセンスなものを出力する。テキストモデルでも画像モデルでも同じだ。
間取り図は新しいPelican Benchmarkになるべきだ。
- ghostpepper
キーワード検索クエリをうまく生成できない。力技で克服することはできるが、彼らが検索しているのを見ると、うんざりする。
nhl toronto scores
nhl hockey toronto scores
"nhl hockey" toronto score today
nhl "hockey score toronto"
"hockey" who won toronto
などなど。
どういうわけか、セマンティック検索が得意なことが、キーワード検索を苦手にしている。理由はともかく。
- mojuba
AIベースのシステムを構築しているときに発見した意外なこと:LLMはプロンプトの設計が苦手だ。
私たちは、AIには何らかの自己認識があり、自分自身のためのプロンプトを設計するのが得意であるべきだと考えがちだが、実際にはそうではない。
プロンプトに大きく依存するタスクに苦労してきたが、結局すべてのプロンプトを自分の言葉で書き直すことになり、ようやくうまくいった。その後、Claudeにプロンプトの修正を頼むたびに、決まって悪化させる。
非常に奇妙な現象で、おそらくトレーニングデータに含まれるプロンプト設計のアドバイスの質によって説明できるだろう。結局のところ、インターネットで見つけられるプロンプト設計のアドバイスは、本当に素晴らしいものではない。
- tartoran
LLMは、でっち上げ(事実や出典などの幻覚)をしないことが苦手で、過剰に説明しないこと、詳細を確実に記憶すること、適切な質問をすること、繰り返しを避けることも苦手だ。
- sandcat_
ビデオゲームのヒント。私の経験では、常に間違いや幻覚がある。多くの異なるゲームで見てきた。OSRS(複数の素晴らしいwikiがある)のような、非常によく文書化されたゲームでもだ。
最近困ったのはAnno 1800で、Claude Opusを使っていた。完全にでっち上げのゲームメカニクスだった。Rainbow Six Siegeも同様だ。