从OpenAI到Ollama:35kb提示词迁移避坑
Notes on gotchas while migrating 35kb preprompts from Opus to self-hosted Ollama

我最近将35kb的复杂提示词从OpenAI和Anthropic迁移到自托管的Ollama环境,试图摆脱对前沿大模型厂商的数据依赖。实验发现,本地模型的上下文窗口限制导致长提示词迅速失效,Agent开始重复调用工具和读取文件。为了解决这个问题,我不得不重构提示词策略,采用单目标提示(SOP)并显式调整上下文长度。虽然失去了大厂商提供的巨大上下文和思维链优势,但自托管能真正保护我的会话数据不被窃取。这是一次关于技术主权与隐私保护的艰难权衡。
如果隐私对你很重要,那么唯一能提供可验证保护方案的解决办法,就是运行你自己的硬件。
HN 评论区
74- DiabloD3
这篇文章其实根本没把问题说清楚:如果你的提示词有 35kb,那它肯定混乱、缺乏重点,在任何 LLM 上都无法正常工作,而且毫无必要地膨胀了上下文。
就当前状况而言,由于大多数人和企业运行推理引擎的方式,无论使用什么模型(是的,这包括 OpenAI 和 Anthropic 的最新模型,以及中国的“虎龙”们),无论厂商宣传的上下文大小是多少,模型能准确关注的有效上下文在达到 25 万 token 左右时就会耗尽。
你需要拆分提示词。如果你相信 LLM 有效,就让 LLM 帮你制定整体计划,然后让多个会话分别执行计划中的每一步,而不要堆砌之前成功步骤的上下文。
在我看来,在上下文腐烂(context rot)和采样问题被彻底解决之前,LLM 还远未达到生产就绪。这种情况尚未发生,而且各大推理提供商甚至懒得整合该领域的任何研究成果。
更糟糕的是,许多大公司为了在破产前勉强多撑一小会儿,实际上正在主动降低推理质量。
这篇文章唯一说对的一点是:如果你真的想认真搞 LLM,就放弃大 AI 厂商,只在本地进行推理。这是你唯一能掌控输出质量的方法。
- cube00
朋友之间别互相推荐用 Ollama https://news.ycombinator.com/item?id=47788385
- andai
> 每个开始学习漏洞利用的人,在投入专注、系统学习的约三个月后,都会经历一段“可利用性悲痛期”。他们攻破了原本认为自己没能力入侵的系统,这让他们感到恐惧。他们足够聪明,知道相对而言自己只是个傻瓜,如果傻瓜都能做到这一点,那就没有什么是安全的。这种感觉是正确的。
- SyneRyder
太长不看版:本地模型的上下文窗口更小,所以你在托管的 100 万 token 窗口下运行良好的 35kB 提示词,在本地只有 65K (!) token 窗口时就会直接崩掉。
我不喜欢泼冷水,但读这篇时我真的很期待更有实质内容。这本来可以是个有趣的话题。
- robotswantdata
你为什么要用 Ollama?
直接用 llama.cpp 就行了。