最近有什么任务非顶级模型不可?
Ask HN: What was the last task where only a frontier model could do it?
我最近常听到一种说法,认为落后前沿模型半年的开源权重模型已足够应付大部分工作。我想问问大家,在过去一个月里,是否有具体任务让 GLM、DeepSeek、Kimi 或 Qwen 等模型失败,而 Opus、Fable 或 GPT 等前沿模型却成功了?反之亦然的情况也欢迎分享。
上个月我尝试用 Qwen 处理一段极其晦涩的金融法律文本摘要,它总是遗漏关键条款,而 Opus 却精准捕捉了所有细微差别。事后反思,如果当时用 Frontier-1 级别的模型,可能也足够应付,但 Qwen 确实搞砸了。
我最近让 DeepSeek 生成一段复杂的 Python 代码来优化数据库查询,结果它生成的逻辑完全跑偏,导致系统崩溃。换成 GPT 后,代码一次运行成功。不过回头看,其实用稍微好点的开源模型也能解决,只是 DeepSeek 太拉胯了。
有个任务是用 Kimi 分析一份长达 200 页的技术白皮书并提取创新点,它完全没抓住重点,只罗列了表面信息。Fable 却直接给出了深度洞察。但说实话,如果当时用 Frontier-1,可能效果差不多,Kimi 的失败更多是上下文理解力的问题。
我让 GLM 翻译一段充满行业黑话的英文技术文档,结果它把术语全译错了,导致客户投诉。换成 Opus 后,翻译精准且符合行业习惯。不过事后想想,用个稍微好点的模型可能就够了,GLM 的失败主要是训练数据不足。