← 文章 / AI技术
Meta 工程博客 3小时前 · 2026-08-31 13:05:44 · 0 阅读

从用户序列到扩展定律:Meta 广告排序的多阶段架构

每天,Meta 的推荐平台处理数十亿次用户交互,产生丰富的时序信号,捕捉用户在各类产品、广告和内容中的个人偏好与意图。在我们2024 年关于广告推荐序列学习的文章中,我们展示了如何通过对用户行为顺序和时间建模(而非依赖静态、人工工程的稀疏特征),生成更丰富的、具备序列感知的用户兴趣和广告偏好表示。

本文更进一步,介绍了两项架构突破,使我们能将序列学习的进展从基础创新扩展为一个具备可预测的、类似 LLM 扩展定律的生产平台:(1) 多阶段序列模型,将繁重的离线用户建模与轻量级的在线排序任务解耦;(2) 基于稠密 token 化和目标感知注意力(target-aware attention)的学习技术,能够直接从数据中高效学习特征交互。

结合我们更广泛的模型创新,这些进展累计为 Instagram 带来了 6% 的转化提升,为 Facebook 带来了 3% 的转化提升,以及 3.5% 的 Facebook 广告点击提升。这一统一的序列建模平台是 Meta 生成式广告推荐模型(GEM)的核心组成部分,有助于充分发挥该学习范式对用户行为的全面理解能力,最大限度地为广告主创造价值。

序列建模的历史挑战

广告推荐系统必须在毫秒级时间内检索并排序成千上万条广告,每秒处理数百万个候选。为应对这种规模,一些序列模型方案采用混合模型配置:由一个模型专门处理用户事件序列,另一个模型处理稀疏特征交互。

虽然这种混合方式能够有效满足生产需求,但它存在一些潜在的权衡:

  • 组件之间存在有损的知识传递
  • 仍然依赖人工特征工程
  • 排序模型与序列模型组件之间的相互干扰导致扩展上限

如果同时扩展时序序列的长度以及处理它们的 Transformer 模型,原本折中方案的取舍就会变成瓶颈,限制我们进一步改善用户体验和广告主投放效果的空间。

我们在序列学习上取得了两项关键的架构突破,化解了模型复杂度与上线效率之间的核心矛盾:(1) 多阶段序列模型,将离线用户建模与在线排序解耦;(2) 面向目标的稠密 token 化与注意力学习范式。二者共同提供了一套灵活的工业化策略,既能推广序列学习模型,又能建立类似 LLM 的扩展规律,可预测地平衡模型效果与算力开销。

多阶段序列模型介绍

为了提升扩展效率,我们设计了一种多阶段模型,能够以更低的算力成本扩展基于 Transformer 的序列模型。它把序列模型拆分为两个互补的阶段(上游离线用户建模与下游在线排序),让模型容量可以持续扩展,性能不断提升的同时,无需等比例增加上线资源。

在图 1 中,左侧展示了离线用户模型:异步处理用户的长行为历史,生成缓存向量,用以刻画深层次的行为模式。右侧展示在线排序模型:将这些缓存表示与广告候选的实时信号结合,产生最终排序结果。两个阶段之间的箭头表示用户特征向量从离线模型传递到在线排序模型。

图 1:多阶段模型概览。

模型的两个关键阶段

第一阶段:离线用户模型

用户侧特征由深度的 Transformer 上游模型异步处理。这些模型可扩展到多个 Transformer 层,序列长度达到数千,并生成用户级别的向量,进行预计算和缓存。上游模型严格区分用户特征与广告及上下文特征,确保用户向量不依赖于任何具体的广告候选。

第二阶段:在线排序模型

离线用户模型表征与在线排序模型相配合,后者利用最新的用户信号和广告候选信息进行实时排序。这一阶段针对速度进行了优化,在严格的延迟预算内完成推理,同时复用离线阶段计算得到的深层表征。

将序列建模系统拆分为两个独立但互补的阶段,使得 Offline User Model 可以沿 scaling curve 提升模型复杂度,而不会导致 Online Ranking Models 的服务成本飙升。

序列模型架构创新

密集 Token 化

这种 token 化方法将稀疏特征与行为序列数据统一映射到同一个密集词表(vocabulary)中,使注意力机制能够自主地学习特征之间的交互。传统推荐系统依赖人工构造的表征来捕获稀疏交叉特征,而该方法让模型直接从数据中学习这些交互。

Target-Aware 多头注意力

Token 化后的稀疏特征和广告候选信息与用户行为序列融合后,输入到一种显存友好的多头注意力结构中,使每一层都能将用户过往行为与当前打分广告进行关联。通过堆叠多个对齐的注意力模块并保持稳定的注意力分布,每一层都能捕获目标广告与用户历史行为之间更高阶的交互,逐步将长序列蒸馏为紧凑的表征。

可预测的 Scaling Curve

类 LLM 的 Scaling Law

在真实广告流量上验证,该多阶段序列模型展现出类似大语言模型的可预测 scaling law。性能提升与算力之间呈 log-linear 关系,且相较于其他基于 Transformer 的序列模型,scaling efficiency 显著提升。图 2 通过展示算力(FLOPs)与模型性能(以 normalized entropy,NE 衡量)之间的关系,从模型深度、内容/语义增强、模型宽度以及序列长度等多个维度刻画了上述 scaling 特性。

图 2:离线模型在多个维度(模型深度、内容/语义丰富度、模型宽度、序列长度)上的扩展定律。

扩展的杠杆

与大语言模型(LLM)处理密集连续的文本不同,广告推荐系统需要将稀疏的 ID 特征与时序用户序列结合起来。尽管结构上存在差异,LLM 式的扩展规律依然显现,这有力地表明该模型架构非常适合进一步用于序列学习场景。

我们识别出四个杠杆,预计它们将有助于释放扩展定律的潜力上限:

1. 均衡的模型形态

最佳性能需要在模型深度、宽度和序列长度三个维度上均衡增长。如果只在单一维度上扩展,其他维度很可能成为瓶颈,导致收益递减。这与 LLM 扩展定律相关研究中的结论一致,我们将其称为扩展协同原理。

2. 多阶段可调节性

多阶段架构提供了灵活的调节杠杆,可以独立地对离线或在线模型进行放大或缩小。扩展在线排序模型能带来更陡峭的提升,但每单位算力的收益受限于服务/请求时延;扩展离线模型(如图 2 所示)的提升曲线更为平缓,不过由于采用异步推理,不受延迟约束,可以无障碍地持续扩展。

3. 序列的组合方式

序列越长,性能持续提升,但一个重要发现是:序列的多样性优于序列的同质性。多种行为类型(例如浏览、点击、转化)的均衡组合,效果优于仅由单一行为类型组成的序列。这一发现表明,多样化的参与类型与广泛的时间覆盖,比孤立地堆砌高信号同质动作,能产生更丰富的用户行为表征。

4. 语义特征表示

基础模型生成的语义内容特征,是对传统协同过滤信号(即哪些用户与哪些内容发生过互动)的有力补充。在冷启动场景(例如新广告或缺乏历史互动数据的新广告主)中,这类特征尤其有价值。通过缓解推荐系统长期面临的这一顽疾,我们从根本上提升了对这一稀疏问题的信号覆盖率。

多阶段序列建模的效果

多阶段序列建模架构在三个维度上带来了显著收益:

更深入的用户表征

通过对数千条用户事件序列(如点击、浏览、购买)进行建模,离线模型能够生成高度细粒度的用户表征。这种深度的行为理解提升了 Meta 全家桶应用中的广告相关性和转化率。配合我们更广泛的建模创新,这些基于序列的表征在 Instagram 上带来了 6% 的累计转化提升,Facebook 上 3% 的转化提升,以及 Facebook 上 3.5% 的广告点击提升。

更高的扩展效率

相比混合方案,两阶段设计在显著提升性能的同时,计算效率更高。初步评估表明,广告排序质量得到了改善,而对线上服务资源的影响微乎其微,证明模型复杂度与生产效率可以同步扩展。

平台级集成

作为 GEM 的核心组成部分,这套用于序列学习的模型架构在设计之初就考虑了泛化能力——同一套多阶段骨干网络和扩展特性,只需极少的适配和额外开销,即可迁移到任何广告排序任务中。

当前工作:持续扩展

序列模型的扩展规律尚未出现饱和迹象。在架构层面实现对齐后,模型复杂度的扩展可以借鉴 LLM 领域已验证的技术(如混合专家模型、跨用户算力共享、先进的注意力机制),有望在最优的性能/效率权衡点上持续扩展。

阅读论文

有关该模型架构及其扩展性的详细技术介绍,请参阅我们的论文——"LLaTTE: Scaling Laws for Multi-Stage Sequence Modeling in Large-Scale Ads Recommendation"。

分享:

原始来源: Meta 工程博客

评论 (0)