LLM生成GPUカーネルの検証:39.5%が不正解と判明

A Contract-Grade Verifier for LLM-Generated GPU Kernels

LLM生成GPUカーネルの検証:39.5%が不正解と判明

言語モデルで生成されたGPUカーネルの検証は、単一の緩いテストに依存しており、不正解を見逃す可能性がある。本研究では、12の敵対的ゲートからなる契約グレードの検証器を構築し、公開システムが正しいと判定した2,638個のカーネルを監査したところ、39.5%が許容範囲を超えて壊れており、62.1%が少なくとも1つの違反を含んでいた。さらに、独自のネイティブBlackwell tcgen05トレーニングバックワードをGDNファミリー向けに実装し、その正しさを独立に検証した。

カーネル生成における進歩の背後にある正しさのシグナルは、数字が示すよりもはるかに弱い。

同じ日のその他の記事

2026-08-14