Geminiに自分の代替モデルを9ドルで訓練させた話
I had Gemini train its own replacement for $9
Redditの包丁スレッドからブランド・モデル・鋼材を抽出するため、Gemini 3.1 Proで4,290件のコメントをわずか9ドルでラベリングし、そのデータでGLiNER large v2.5をファインチューニング。ゼロショットの0.65 F1から0.83 F1まで精度を向上させ、ローカルGPUで動くモデルを手に入れた。しかし10回の訓練のうち5回は失敗し、特にwords_maskテンソルの誤解が原因で損失が平坦化。小さなファインチューニングでは、モデルやデータよりも間のコードが問題だと痛感した。
words_maskはマスクではない。それは単語インデックスだ。特殊トークン、プロンプト、パディングには0、実際の各単語の最初のサブトークンには1、2、3が入る。
HNでの議論
43- trollbridge
サブトピックを「Geminiを使って、Geminiの特定の用途を置き換えるツールを設計した」に変更してほしい。
- faidit
残念ながら、広告主はどんどん賢くなっていて、Redditで自社製品を褒めさせるためにボットを使っている。本物のコメントで訓練されているおかげで、一部のモデルは人間のコメンターのように聞こえるのがとても上手く、多様な興味関心を持つコメント履歴を簡単に生成して人間らしく見せかけられるので、ほぼ見分けがつかない。だから、この方法はいずれ、一番優れたナイフを持っている企業ではなく、ボットコメントに一番広告費を使った企業を特定するようになるだろうね。
- josefresco
先日、あるソーラーパネル業者についてのRedditコメントを集めたかったんだ。Claudeはアクセスできないから、Geminiに「ディープリサーチ」をやらせてみた。その冗長なレポートをClaudeに戻してやると、要するに「幻覚でっち上げのクソ」の山だと言われたよ。
- niekverw
読めたもんじゃない。とはいえ冒頭にそう書いてあるけど、本当にそうだからなんで投稿するんだ。
- yread
彼がGeminiを騙して、Gemini自体が動いているクラスタ上で訓練を走らせたのかと思って期待した。それなら斬新だったのに!