Netflix用GenRec重塑推荐:从特征工程到语境工程

GenRec: Towards LLM-Native Recommendation at Netflix

Netflix用GenRec重塑推荐:从特征工程到语境工程

Netflix推出了GenRec,这是一个基于大语言模型(LLM)的推荐排序系统,旨在取代依赖数千个手工特征的传统模型。GenRec通过将用户历史、物品元数据和上下文转化为自然语言提示,利用经过Netflix数据微调的基础模型进行排序。该系统采用两阶段训练框架,结合奖励加权损失以对齐长期会员价值,并在推理时仅使用预填充模式以降低成本。大规模A/B测试显示,GenRec在短期和长期在线指标上均显著优于现有生产模型,同时仅需少量标注数据。这标志着推荐系统从复杂的特征工程向更灵活的语境工程转变。

它减少了对手工设计特征的依赖,并将重心从特征工程转移到了语境工程。
  1. lqstuart

    在我看来,Netflix 的推荐系统是全互联网最烂的。他们是一家 Java 公司,在 AI 领域落后行业 5 到 10 年,现在却试图用最低效、最复杂的方法去跟风,而不是像 2020 年其他所有人那样直接使用 DLRM。这能出什么好结果?

  2. mvkel

    Netflix 好像 20 年前搞过一个算法竞赛?有个团队做出了一个非常高效的内容推荐系统,但 Netflix 从未采用。为什么?因为它会砸了收入。

    另外,可供推荐的内容根本不够多。这不像你需要帮忙找一篇完美的 Wikipedia 文章。在任何给定时刻,用户大概只会看 50 部左右的东西。

    感觉这更像是一次为了蹭 AI 估值而进行的软性转型,毕竟好莱坞正在崩盘。不过这笔投资可能还是值得的。

  3. alt227

    来了来了,LLM 开始被塞进所有东西里了。

    Netflix 的推荐真的需要用到 LLM 吗?

    这篇文章描绘了一幅非常利他的图景,说推荐系统可以从用户历史、偏好、设备和环境语境等数据中获取输入。然而,他们只字未提需要为付费客户推广内容、宣传新片,或是提升某些表现不佳内容的观看量。我推测,一旦他们那些花哨的 LLM 吐出一些用户推荐结果,在展示给用户之前,这些结果还会经过另一个流程进行‘商业化’处理。

  4. chuckadams

    需要多高级的机器智能,才能不把用户已经看过的东西放进推荐列表里?

  5. jmbwell

    好吧。那么,如果模型倾向于收敛到用户兴趣的中位数(以参与度为衡量标准)……用户是不是得主动偏离推荐,才能增加被推荐到一些惊喜内容的几率?

    看到 Netflix 内部如何评估推荐系统挺有意思的,可以从他们对比 GenRec 的方式推断出来。在这两种情况下,前提似乎都是用户主要想要更多同类内容的互动。

    我甚至更想看到一些与 Netflix 早期系统的对比,那个系统允许用户在人类社交圈内交换评论和推荐。这似乎能带来一些关于引入来自立场一致但并非严格顺从的参与者的新鲜信号的洞察。

同日更多故事

2026-08-15