LLM 们到底在哪件小事上翻车?

Ask HN: What is one simple thing LLMs are insanely bad at?

LLM 们到底在哪件小事上翻车?

我正在寻找训练专用模型的新方向。大家有没有那种反复让 ChatGPT 或 Claude 等模型去做,结果它们总是搞砸的简单任务?我想听听这些具体的失败案例。

空间推理能力,以及 3D 绑定和动画制作。
哦,你说要简单点的?那就是像真人一样说话。
  1. jampa

    认真回答:没有任何模型能写出真正合理的建筑平面图。

    它们理解所有规则和最佳实践,有时甚至能发现平面图中的糟糕点子,也能描述什么是好的平面图。

    但如果你让它们画一个,哪怕你提供了所有细节(甚至给出房间的“节点图”),它们输出的依然是胡言乱语。文本模型和图像模型都一样。

    平面图应该成为新的 Pelican Benchmark。

  2. ghostpepper

    它们生成关键词搜索查询的能力很差。它们可以通过暴力穷举来克服这个问题,但如果你看看它们到底搜了什么,你会尴尬得脚趾抠地。

    nhl toronto scores

    nhl hockey toronto scores

    "nhl hockey" toronto score today

    nhl "hockey score toronto"

    "hockey" who won toronto

    等等。

    不知何故,擅长语义搜索反而让它们不擅长关键词搜索,原因不明。

  3. mojuba

    我在构建基于 AI 的系统时有一个意外的发现:LLM 不擅长设计提示词(prompt)。

    我们往往认为 AI 具备某种自我认知,应该擅长为自己设计提示词,但实际上并非如此。

    我曾为一个高度依赖提示词的任务绞尽脑汁,最后不得不完全用自己的话从头重写所有提示词,这才终于跑通。之后每当我让 Claude 去修改提示词里的某个问题,它无一例外地会让情况变得更糟。

    这是一个非常奇怪的现象,或许可以用训练数据中提示词设计建议的质量来解释。总之,你在网上能找到的所有关于提示词设计的建议,其实都很烂。

  4. busyant

    根据我上传的照片识别鸟类物种。

    当然,这取决于你对“极其糟糕”的定义是什么。

    我觉得 ChatGPT 和 Gemini 在我上传的照片中,大约有 10% 会犯下极其严重的错误。

    我最近上传了一张短嘴滨鹬(short-billed dowitcher)的照片,ChatGPT 告诉我那是威尔逊秧鸡(Wilson's snipe),还煞有介事地解释了腿和尾羽的各种细节(而我的照片里这两样根本看不见!)。

    接着我跟进说明,自去年十一月以来我的所在地就没见过威尔逊秧鸡(而且威尔逊秧鸡在我的所在地已经过了季节),Chat 把它的估算概率下调到了 85% 是威尔逊秧鸡。

    我又跟进了一次,透露了鸟类的确切位置,ChatGPT 才说:“哦对了,99% 是短嘴滨鹬!”

    我和 Gemini 也有过类似的经历(还没测试过 Claude)。

    再次强调,90% 的成功率其实挺不错的,但剩下的 10% 时间里,我用的这两个 LLM 在物种识别上都会翻车,而且经常在鸟类照片上幻觉出根本不存在的特征。

    修正了拼写错误,并补充了另一次“观鸟活动”中的例子。

    我上传了一张非常清晰的麻雀照片。

    * ChatGPT 说是“歌带鹀(song sparrow)”

    * 我解释:“不可能。这只麻雀眼睛上方有黄色,胸部特征也不对,不是歌带鹀。”

    * ChatGPT:哦对了,是草原鹀(savannah sparrow)

    * 我解释:喙太大了,不是草原鹀。

    * ChatGPT:哦对了,是盐沼鹀(saltmarsh sparrow)。

    * 我解释:“鸟脸上没有橙色。”

    * ChatGPT:哦对了,是海滨鹀(seaside sparrow)(终于对了!)

  5. tartoran

    LLM 不擅长不编造东西(幻觉事实、来源等),也不擅长不过度解释、可靠地记住细节、提出正确的问题以及避免重复。

同日更多故事

2026-08-26