MITの新手法、画像を生成せずにCSAM学習済みAIモデルを100%の精度で検出

MIT's New Method Flags AI Models Trained on CASM Without Generating It

MITの新手法、画像を生成せずにCSAM学習済みAIモデルを100%の精度で検出

MITの研究者らは、AIモデルが児童性的虐待画像(CSAM)を生成するように微調整されているかどうかを、画像を一切生成せずに判定する新しい監査手法「Gaussian probing」を開発した。この手法は、モデルの内部表現の変化を解析することで、LoRAアダプターによる特殊化を検出する。児童保護団体Thornとの共同研究で、CSAM生成に特化したモデルを100%の精度で識別することに成功した。2025年にはAI生成CSAMの報告が150万件を超える中、オープンソースモデルをホストするプラットフォームや法執行機関にとって、法的・倫理的障壁を回避したスケーラブルな対策となる。

「オープンソースモデルをホストするプラットフォームや法執行機関にとって、モデルがCSAMを生成できるかどうかを実際にテストする新たな道が開けます。これまでこれを測定する方法はなく、一部の人々に悪用される巨大な盲点でした。今こそ、深刻な悪影響を及ぼしているAI安全性の問題に取り組むことができるのです」とSuriyakumar氏は述べた。

この日のほかの記事

2026-07-13