Navier-Stokes后,我为何仍看空LLM
Why I'm still bearish on LLMs after Navier-Stokes
尽管Navier-Stokes等数学难题被攻克,我依然对LLM持悲观态度。前沿实验室的估值建立在“全自动替代知识工作者”的叙事上,但现实是模型仍需大量人工监督。LLM仅在训练任务的微小邻域内表现良好,一旦遇到扰动就会失败或进行reward hacking。解决这一问题需要昂贵的领域专家进行严谨的specification,其成本往往远超直接实现。Navier-Stokes是LLM工作的最佳场景,因为定理本身已是严谨规范;而大多数人类知识工作远非如此。未来,LLM更像是一个需要成人监管的实习生,而非完全自主的代理。
Navier-Stokes和纯数学中的陈述是代理工作对抗严谨规范的最佳场景。