Kimi K3 在 MI355X 上跑赢 B300
Running Kimi K3 on MI355X at Better Performance per Dollar Than B300

随着 Kimi K3 等开源模型参数飙升至 2.8T,显存容量成了部署的关键瓶颈。我们发现,AMD 的 MI355X 凭借 288GB 大显存,在单节点即可完整加载模型,而 B200 需双节点且 B300 价格高昂。经过对 sglang 框架的简单修复和预填充优化,MI355X 在每美元性能上大幅超越 B300,单节点吞吐量达 952 tok/s。这证明在超大模型时代,显存容量可能比单纯的算力更重要,AMD 正在成为性价比之选。
Kimi K3 的规模是我们在 MI355X 上利用 HBM 容量优势,相比 B200 获得实际可测量优势的少数模型之一。
- kelnos
真希望他们别管这些叫“开源模型”。它们根本不是开源的。他们没公开训练数据,也没公开训练模型时用的工具。
他们只公开了权重。这叫“开源权重模型”,这似乎是个大家都觉得合适的术语。这家公司为什么不用这个说法呢?
- logicallee
这部分听起来像是 AI 辅助搭建并跑基准测试的:
> 修复方案简单至极:将头数从 12 零填充到 16,运行快速内核,再从输出中提取真实的 12 个头。
我最近用过一个前沿 AI(ChatGPT 5.6 Sol 超频版)来搭建一个更小的本地模型,它引入的性能优化让模型完全失去了连贯性。(模型只会重复单个字符之类的。)
看到像我刚才引用的这种行代码,我不禁怀疑这个配置是否还像支持硬件上 Kimi K3 的官方安装那样连贯。
他们有没有跑过基准测试来确认它是否依然正确?
- inferencecoder
Wafer 正在让“垃圾”(slop)这个词在推理领域成为他们的代名词。他们所有的结果里都是夸大其词的不公平对比,推特上的炒作贴还配着惊恐表情符号之类的。
> MI355X 为 2.5 美元/GPU-小时,B300 为 6.00 美元,B200 为 4.25 美元。
这根本不是真实情况下的准确价格对比。
- GuestFAUniverse
8 张 MI354X 的资本支出(capex)怎么可能在不到 10 美元/小时的情况下得到合理支撑?
哪怕不算基础系统、电力和其他所有费用:
365 天 * 24 小时 * 2.95 美元 = 每年可开票 25842 美元。
这在一年内都回不了本,三年也回不了本,甚至让人怀疑这设备在整个生命周期内到底能不能赚到钱?
- jpgvm
如果你做了不错的工作,至少该花点时间审查那些描述该工作的“垃圾”内容,看看它们是否也充满了“垃圾”气息。否则很难让人认真对待。尤其是预填充(prefill)那部分。