Karpathy:LLM 耗时2小时生成《指环王》3D世界
Karpathy’s Pelican
我们正告别用“画一只骑自行车的鹈鹕”来测试 LLM 的时代。我让 Opus 5 在 100 万 token 的预算下,将《指环王》首段转化为 three.js 渲染的 3D 场景。它运行了约 2 小时,生成了 5500 行代码,虽然效果略显粗糙,但令人惊叹的是,它竟能自主编排多边形资产在 (x,y,z) 坐标中的位置并编写动画逻辑。这类任务常人绝不会去做,但 LLM 拥有无限的耐心,让“无人愿做”变成了“免费可行”。这让我对构建超定制化、可即时生成的虚拟世界充满期待,比如让玩家以 NPC 身份进入 LoTR 故事。不过,这也暴露了 LLM 的短板:它们难以高效地自我审计,因为无法原生感知视频或在游戏中实时交互,导致 Opus 5 不得不缓慢截图并多次出错。
我们正开始离开用“画一只骑自行车的鹈鹕”来测试 LLM 的领域。
HN 评论区
15- bredren
我和一个大语言模型(LLM)合作,制作了一个《回到未来》中德罗宁时间机器的类3D动画,目的是让文档页面的首屏内容更出彩。
这需要进行大量的自定义微调,我还专门开发了一个微调视图来确保某些行为表现正确。
但过程足够有趣,以至于我将其泛化,使其能够接受来自任何电影的近乎任意的场景描述。它会去获取更详细的描述和电影剧照(如果有的话),同时也支持你提供自定义的静态画面。
我的测试场景选自《阿波卡猎逃》中的“手铐”片段。虽然保真度不高,但它呈现了一段相当惊人的序列,标枪等物体的物理效果也颇为逼真。
这是包含垂直起飞和88英里/小时时间旅行演示的文档页面:https://contextify.sh/docs
如果有人感兴趣,我可以分享一些《阿波卡猎逃》片段的内容。
- jmugan
我倒宁愿让它们就“谁能为LLM聊天构建更好的Google Wave”这一主题展开对决,以此探索AI工作室的未来形态。
“Google Wave入门指南”:https://www.youtube.com/watch?v=eKUAqNGVwX0
- dundarious
静态图像似乎是个更好的快速测试方案,因为我们可以一眼看清。或许可以让它试着画一本漫画?
- qwertox
关于LLM难以审查自身工作的争论:
我不禁在想,我们是否正在进入“一次性软件”的时代。就像廉价塑料和改良工艺让我们能以极低价格快速制造出任何想要的东西一样,也许LLM也能让软件实现同样的效果:廉价生产,坏了就扔,再重新生产。
- andy99
人类很难用指数级思维去思考。
但这表明,我们距离为个人而非大众生成1:1超个性化娱乐和媒体内容,仅差几个数量级了。