Kimi K3 发布:鹈鹕测试还能教我们什么?
Kimi K3, and what we can still learn from the pelican benchmark

Moonshot AI 发布了拥有 2.8 万亿参数的 Kimi K3,号称是首个开源 3T 级模型,性能在多项评测中超越 Claude Opus 4.8 和 GPT-5.5。我再次用经典的“生成一只骑自行车的鹈鹕”SVG 任务来测试它,结果发现模型虽然生成了精美的图像,但推理成本高达 25 美分,且输入提示词被计为 95 个 token,暗示可能存在隐藏的 System Prompt。尽管这个“鹈鹕基准”已不再能准确反映模型的 Agent 能力,但它依然是我验证新模型、估算成本并确认其几何感知能力的“Hello World”级测试。
鹈鹕测试最大的局限性在于,它完全未触及当今模型最核心的能力:Agent 工具调用以及在对话变长时可靠操作工具的能力。
HN 评论区
222- 有评论者指出 Pelican 测试存在严重的方向性偏差,模型生成的物体(如旋转方向)往往收敛于单一模式,且无法通过逻辑推理识别'鹈鹕骑自行车'在现实中的荒谬性。
- 一位从业者反驳了该测试对 AGI 能力的衡量价值,认为其最大的局限性在于完全未触及当前模型最关键的 agentic tool calling 及长上下文中的可靠工具操作能力。
- 有观点质疑 Kimi K3 的算力来源,推测中国公司可能通过马来西亚、日本等未受出口限制的邻国获取 GPU,或利用走私手段绕过硬件封锁。
- 针对技术细节的讨论指出,MoE 架构中的专家数量(number of experts)并非代表技能多样性,而是为了在增加参数量的同时平衡前向传播的计算与内存需求。
- 部分评论者认为,对于未明确指定的通用提示词,理想输出应是最预期的通用结果,而非模型过度发挥创意导致的'脱轨'内容。