Netflix、LLMネイティブな推薦システム「GenRec」で従来モデルを上回る成果
GenRec: Towards LLM-Native Recommendation at Netflix

Netflixが開発した「GenRec」は、大規模言語モデル(LLM)をベースにした推薦ランカーです。ユーザーの視聴履歴やアイテムのメタデータを自然言語に変換し、Netflix独自のデータで事後学習することで、従来のプロダクションランカーと同等以上の精度を達成しました。しかも、ラベル付きデータは約40分の1、入力シグナルも大幅に削減しています。約10%のトラフィックで4週間のA/Bテストを実施し、短期・長期のオンラインメトリクスで統計的に有意な改善を確認。機能エンジニアリングからコンテキストエンジニアリングへのシフトを示す事例です。
GenRecは、機能エンジニアリングへの依存を減らし、焦点を「機能エンジニアリング」から「コンテキストエンジニアリング」へと移行させます。
HNでの議論
54- lqstuart
Netflixの推薦は、インターネット全体で最悪だと思う。彼らはJavaショップで、AI業界より5〜10年遅れている。そして今、流行に乗ろうとして、2020年に他の皆が使っていたDLRMを使う代わりに、最も非効率で過度に複雑な方法を使おうとしている。何が悪くなるというのだろうか?
- mvkel
Netflixはアルゴリズムコンテストをやっていたが、それはいつだったか、20年前くらいか?あるチームが非常に効果的なコンテンツ推薦システムを作ったが、Netflixはそれを決して使わなかった。なぜか?収益を殺したからだ。
別に、推薦するのに十分なコンテンツがないということもある。完璧なWikipedia記事を見つける手助けが必要なわけではない。どの時点でも、ユーザーが見るであろうものは約50個ある。
これはどちらかというと、ハリウッドが崩壊しているので、AI評価で現金化するためのソフトな方向転換のように感じる。おそらく投資する価値はあるだろう。
- alt227
さあ、LLMが何にでも組み込まれる時代の始まりだ。
Netflixの推薦に本当にLLMを使う必要があるのか?
この投稿は、ユーザーの履歴、好み、デバイスや環境のコンテキストなどから推薦を供給できるという非常に利他的な絵を描いている。しかし、彼らは有料クライアントからのコンテンツを宣伝したり、新作をプロモーションしたり、特定の不振なコンテンツの視聴回数を増やしたりする必要性については一切言及していない。私は、彼らの素晴らしいLLMがユーザーへの推薦を吐き出した後、ユーザーに表示する前に、結果を「商業化」する別のプロセスを通過させていると想定している。
- chuckadams
ユーザーがすでに見たことを知っているものを推薦リストに入れないようにするのに、どれだけ高度な機械知能が必要なのだろうか?
- jmbwell
オーケー。では、モデルがエンゲージメントで測定されたユーザーの関心の中央値に収束する傾向があるなら、ユーザーは驚きのあるものを推薦される確率を上げるために、推薦から逸脱しなければならないのではないか?
NetflixがGenRecをそれと比較していることから、内部でRecSysをどのように評価しているかを見るのは興味深い。どちらの場合も、前提は、ユーザーが主に同じようなものにもっと関与したいと思っているということのようだ。
私は、Netflixのずっと初期のシステム、ユーザーの人間の社会的グループ内でレビューや推薦を交換するシステムとの比較にもっと興味がある。同じ方向性だが厳密には適合しない参加者からの新鮮なシグナルの入力について、何か洞察があるかもしれない。