LoRA 速通排行榜:6 分钟微调 Qwen2.5

LoRA Speedrun – a public wall-clock leaderboard for fine-tuning techniques

LoRA 速通排行榜:6 分钟微调 Qwen2.5

LoRA 微调技术百花齐放,却缺乏公平的竞技场。这个名为 lora-speedrun 的项目建立了一个公开的墙钟时间排行榜,锁定 Qwen2.5-1.5B 模型和 GSM8K 任务,在 Modal L40S 硬件上比拼训练速度。当前记录仅需 6 分 05 秒即可达到 57% 的准确率。项目利用 modded-nanogpt 框架,强制要求所有记录经过三次独立复现验证,确保数据真实可靠。无论是 Sequence packing 还是 LoRA+ 等新技术,开发者都能在此一决高下,推动参数高效微调技术的透明化与科学化。

LoRA 和 QLoRA 是现实世界微调的主流方式,技术空间已呈爆炸式增长,但缺乏一个对抗性的公平竞技场让这些想法在公开环境中相互竞速。
  1. jmward01

    我认为缩小规模/限制资源确实有价值。目前的趋势是“把权重做得更大,然后喂更多数据”。这是一种 MBA 式的胜利观:我们有个旋钮,只管一直拧。这确实有效,但可能无法像资源限制那样激发创造力。这就像城市规划中的城市增长边界。如果你不被允许“随意扩张”,你就被迫在城市内部更智能地建设,而这些创造性的解决方案往往能带来重大改进。

  2. patrick0d

    受参数高尔夫和速通方法的启发,我提出在 AI 安全目标上为 LoRA 选择损失函数时,应将其视为一个计时器(wallclock)。我尝试后的结果是将一个稀疏自编码器(Sparse AutoEncoder)功能性地蒸馏成了一个 5.3MB 的探测头。如果有人感兴趣,我在下面有一篇技术文章。

    https://www.lesswrong.com/posts/PagGF8roBJmjLunsX/competitiv...

  3. stephantul

    遗憾的是,这 100% 是生成的。

    不过我觉得这个想法挺有意思,只是我不确定 LoRA 的训练时间是否真的成了瓶颈,以至于需要这样一个极其狭窄的排行榜。也许如果涉及更多任务或更多模型,我们还能指望它产生迁移效果?但针对单一任务和单一模型,我担心这会严重过拟合。

    对于 NanoGPT,我认为其初衷一直是这些想法可以迁移到更大的模型上,或者作为在更大模型上进行研究的垫脚石。

同日更多故事

2026-07-20