探索分层兴趣表示,助力 Meta 广告深漏斗优化
- 分层兴趣表示(Hierarchical Interest Representation)是 Meta 广告的一个研究方向。我们在广告实体的全量空间——用户、广告主、产品、服务——之上探索一个上游表示层,学习统一的 embedding,把用户推断出的兴趣与广告主在深漏斗广告中所提供的内容连接起来。
- 分层兴趣表示的核心创新是基于自研 Transformer 的图学习方法,融合了偏置感知注意力机制和自监督跨视图蒸馏技术,在大规模图上学习多层级的兴趣表示。
- 分层兴趣表示将真实世界知识与互动信号相结合——由 LLM 处理的多模态广告主与商品内容对稀疏的交互数据加以补充,从而实现对罕见和未见过的实体的泛化能力。
- 分层兴趣表示输出适用于广告实体的通用 embedding 以及 Bag-of-Meaning 兴趣 token,有潜力为广告系统中的个性化、检索、监督以及专用排序架构提供新的驱动力。
- 端到端地在 Meta 真实广告数据上进行训练,数据规模达数十亿次交互。
分层兴趣表示是一个上游表示层,旨在改进 Meta 的深漏斗排序优化。它希望将商家与平台上对其所提供内容怀有最真实、最潜在兴趣的那部分人群连接起来。该系统计划在 Meta 更广泛的推荐生态中发挥作用,例如 Meta 的生成式广告模型(GEM)、Andromeda以及自适应排序模型(Adaptive Ranking Model),以推动深漏斗优化。
人们来到 Meta 的应用和平台,是为了与人以及内容建立联系,并通过每一次滑动表达自己的偏好。平台利用互动信号来理解用户的隐性兴趣和显性兴趣,从而提升内容的匹配度。借助前沿 AI 从稀疏的互动信号中挖掘潜在兴趣,并将其与海量的广告主产品进行对齐,是解决信号稀疏难题、提升深度漏斗广告效果的变革性方法。
我们的目标是加强广告生态中各类实体——涵盖用户、商户和产品——之间的推理关联,利用多层级粒度,让模型既能锚定在稳定的高层兴趣上,又能捕捉深度漏斗意图中那些稀疏而专业的信号。
分层兴趣表征如何提升深度漏斗优化
分层兴趣表征在表征建模领域开创了一种结构性的转变:它遍历大范围图拓扑结构,将稀疏的互动信号蒸馏成不同粒度的统一兴趣簇。通过融合现实世界知识以及对广告产品的语义理解,有效加强了广告与用户意图之间的关联。
分层兴趣表征通过从海量互动数据中提取稳定的兴趣锚点,并将其与多模态世界知识增强相融合,鼓励探索式的广告体验。这有助于推送更相关的广告内容,从而优化深度漏斗广告。
技术挑战
用户与广告实体的互动天然具有图结构:用户和广告实体(广告主、产品、服务、推广活动等)作为节点,将它们连接起来的活动和事件则是边。在 Meta 的规模下,这是业界最大的图网络之一。学习兴趣表征面临以下挑战:
用户隐性信号的动态变化
Meta 为用户提供了多种工具来帮助定制使用体验,例如对看到的帖子给出"感兴趣/不感兴趣"的反馈。此外,基于互动信号推断出的隐性兴趣在提升深度漏斗广告效果方面依然扮演着重要角色。
大规模网络与稀疏连接
每个月,Meta 的广告网络都会在我们的各个平台上为数以亿计的用户投放来自数百万广告主的数百万条广告。尽管这个"词汇表"规模庞大,但广告展示机会仍然有限,深漏斗中的用户反馈信号也十分稀缺。
长距离、全局关系
鉴于深漏斗中单个连接的稀疏性,观察由长距离、图结构关联的实体和用户之间的共性模式,并将其编码进表征中,是非常有价值的。然而,在大规模图网络中捕捉长距离关系对算力的要求极高。即便硬件能力持续提升,要追求建模精度,仍需设计内存高效的自注意力算子以及高性能的学习算法。
引入分层兴趣表征
我们最新的研究方向是一个面向用户和广告实体的上游表征层,用于学习通用化的关系知识表征。这些表征捕获用户与广告的互动模式,吸收真实世界语义,并通过多层粒度级联,在每一层级投影到潜空间中。基于图数据结构,以下四个设计特性贯穿系统始终:
降维
分层兴趣表征将原始图投影到一个可配置的超图中,每个超节点都是一个习得的潜在兴趣基元。在原始图中稀疏的用户—广告边,在兴趣基元图上变得显著稠密。由于广告业务本身动态多变,而兴趣基元图天然地在词汇层面更加稳定。
知识增强
分层兴趣表征为异构实体(尤其是广告主和产品类型)补充多模态内容特征,如文本、图像和视频。这些特征取自结构化的页面元数据和广告主商品目录属性,并通过视觉或语言模型进行处理。这些额外信息与既有的互动数据互为补充。它不仅能反映用户如何与某个对象互动,还能刻画那个对象本身是什么。即使面对从未见过的实体,系统也能理解其背后的业务和产品。
统一的关系表征
分层兴趣表征在统一的度量空间中,同时学习用户与实体的全面知识表征,以及它们潜在的兴趣基元表征。它能推断不同类型或同一类型实体之间的相互关系与亲和度。通过嵌入运算,分层兴趣表征可以判断基元与基元之间、簇与簇之间的关系。它还能评估用户与兴趣基元的接近程度——某条广告或某个广告主在多大程度上服务于特定兴趣基元——以及哪些相似的用户、广告和产品是最近的邻居。
多层粒度
由于深度漏斗信息整体上较为稀疏,在如何映射到基元兴趣时需要做出权衡:密集且稳定的关系通常对应较粗、较高级的抽象,而稀疏且具体的连接则适合更细粒度的抽象。分层兴趣表征学习的是超级图,能够跨多个分层层级级联,从而灵活适配排序建模架构、个性化或检索等应用场景。
分层兴趣表征架构
分层兴趣表征通过融合广告主与产品的世界知识以及用户的直接时序互动数据来构建表征。其受 LLM 启发的 Transformer 架构被应用于大规模图上,借助稀疏注意力捕获长程关系。该系统旨在为广告平台从检索到最终阶段排序的各类应用提供支持。

下面各节将详细介绍分层兴趣表征系统中各组成部分的架构设计。
增强互动图
异构图结构
分层兴趣表征基于一个带类型、带权重、带时间衰减的图结构,将多种实体类型——用户、广告、广告主、推广系列、产品和 Pixel——统一在同一张图里。这些实体之间通过类型化的互动边相连,包括广告主创建广告素材以及用户与广告的交互链路。每条边都带有行为类型和时间戳,用于在近期意图和长期兴趣之间取得平衡。正是这种类型化的异构结构,使得同一个下游表征能够在统一空间中同时刻画一个人的生活方式、一个广告主的商品覆盖范围,以及连接二者的产品。
扩展到 Meta 生产规模数据
该图每月覆盖数十亿用户、实体及其交互,既在线提供以保证生产时效性,也离线提供用于评估和快速迭代。每个节点都带有丰富的初始 embedding,将预训练语义特征与行为统计信息相融合。访问频繁的节点还会通过深度哈希 embedding 获得一个可学习的 ID embedding——具体做法是把节点 ID 哈希成向量后送入一个小型共享神经网络,从而在词表扩展到数百亿时仍把 ID 内存控制在有限范围内。
分层编码器
我们采用基于 Transformer 的分层编码器来设计模型,以应对这种超大规模图的表征学习。它考虑了若干重要的技术设计。

世界知识
世界知识的作用是把已有线索串联起来,它在相对静态的实体(如广告主、产品等)上尤为丰富。我们从摘要文本、图像、视频等多模态信息中抽取内容,并通过一个定制化的 LLM 推理引擎对其进行处理,生成用于表征学习的编码特征输入。
结构编码器
分层编码器的输入层融合了多种互补的编码器。节点编码器将节点类型、由深度哈希控制的节点 ID、世界知识特征以及各类型元数据/特征融合在一起,使每个节点在进入学习模型时同时携带其语义身份和真实世界的内容。位置编码器对从图中采样的视图应用位置编码,结合随机游走和按重要性优先的策略来注入局部拓扑信息。边编码器则准备好边类型、边权重和时间信号,以便送入注意力学习机制。
偏置组合
Transformer 通过注意力机制衡量 token 之间的两两关系,图结构则天然编码节点之间的两两关系。这两种思路天然互补。图的结构信号(例如事件边上的节点类型转移,以及反映局部连通性的最短路径距离)作为注意力偏置输入模型,在每一层增强 query-key 的点积运算。
正因如此,模型才具备拓扑感知能力。Hierarchical Encoder 不是把子图当作一堆节点的简单集合来处理,而是带着明确的结构关系知识进行注意力计算,从而捕捉到标准消息传递容易过度平滑的长程依赖关系。
注意力内核
通常情况下,把图结构偏置加入注意力机制的代价很高:标准实现需要物化一个完整的两两偏置矩阵,这会迫使我们放弃内存高效的注意力方案。我们采用 FlexAttention,它逐项即时计算偏置,因此无需物化两两矩阵。将可变长度的子图打包进同一条带块掩码的序列中,既避免了 padding 浪费,也防止了跨图信息泄漏。新的偏置项只需以小型评分规则的形式直接接入,无需编写底层内核代码。最终效果是:既保留了内存高效注意力,又具备完整的图结构感知能力。
训练 Hierarchical Encoder
跨视图蒸馏
Hierarchical Encoder 采用自监督、以师生配对的方式进行训练。对于每个锚点节点,我们采样一个宽视角的 teacher 视图和一个窄视角的 student 视图,二者均通过 Hierarchical Encoder。Student 被训练去预测与 teacher 相同的兴趣簇。由于 teacher 能看到更宽的图视图,其预测置信度更高,从而为 student 提供清晰的学习目标。这种做法将监督信号大幅扩展到产生深层漏斗转化行为的少数用户之外,很大程度上缓解了推动我们构建 Hierarchical Interest Representation 的行为稀疏问题。Sinkhorn-Knopp 均衡分配机制避免了单一簇坍缩——这是自监督方法中一种已知的失效模式。
行为预测
自蒸馏通过让模型认识到同一节点的不同视图应当聚为一类,来发掘图中的潜在兴趣基元。互动预测则提供另一个互补的有监督目标:给定两个节点表示、一种互动类型和一个时间点,预测在该时间是否存在真实的互动边。二者结合,使分层兴趣表示同时具备视图不变的结构先验和对真实用户行为的直接锚定,从而成为贯穿整个投放链路的通用评分函数。
在线图基础设施
原始异构图存放在 Meta 的在线图引擎上。训练与在线服务共用同一数据源,确保两者数据分布一致。在训练阶段,子图抓取与节点特征读取与 GPU 计算以流水线方式并行执行:多个 worker 并行准备后续批次,模型则在当前批次上训练,使数据加载延迟被前向和反向传播过程完全掩盖。在测试阶段,该方案相比同步基线实现了 30 倍的端到端加速,并始终保持较高的 GPU FLOPs 利用率。整个流程保持比特级精确的可复现性,因此基础设施迁移和检查点恢复不会悄无声息地改变模型行为。
因果性
为防止信息泄露,训练与评估严格遵循事件的时间顺序。图引擎在每次调用时施加截止时间戳,屏蔽该时间点之后出现的任何节点或边。
边按时间顺序划分为训练、验证和测试窗口。批次打乱仅在固定时间分片内进行,既保证优化器获得多样的梯度,又不会跨越时间边界。模型只学习在当时本可获取的信息,因此准确率的提升反映的是真实学习,而非来自未来的信息泄露。
分词化
语义词袋 Token
连续通用嵌入在排序任务中表现强大,但天然不适合倒排索引检索、集合聚合以及人工解读。我们将其离散化为语义词袋(BoM)token——由复合量化生成的一套紧凑、无序的兴趣概念词汇。用户的表示由描述其兴趣的 BoM token 构成;广告或广告主的表示则由其所投放兴趣的 BoM token 构成。
在投放系统中激活分层兴趣表征
分层兴趣表征旨在将学习到的兴趣表征嵌入到广告投放系统中,最终提升 GEM、Andromeda 和自适应排序模型等现有组件在深漏斗排序上的表现。例如,BoM token 将用户潜在兴趣融入到基于互动的个性化与监督信号中,并通过倒排索引查找实现快速、紧凑的召回。分层兴趣表征的多层结构支持多种专用架构,例如由超兴趣类别路由的混合专家生成式分布学习,并能够围绕稳定的兴趣锚点进行分层推理,从而刻画用户与广告之间的亲和度。
分层兴趣表征的未来
我们将持续提升训练扩展效率、embedding 新鲜度、知识压缩以及显存友好的注意力算子,以获得更强的表征表达能力。同时,我们也在探索上游分层兴趣表征的参数高效、目标条件式微调,使其在共享编码器之上,针对不同的深漏斗优化目标实现分层(segment 级别)的专项适配。
致谢
感谢 Sammy Bald、Shaoqing Yuan、Chuan Hu、Chris Hayduk、Wenfan Xu、Liang Xu、Piyush Dak、Ikuhiro Ihara、Ashish Kalbhor、Manjari Jha、Priya Krishnamurthy、Xulei Liu、JC Lyu、Yuqi Bi、Vivek Bitla、Krishna Poola、Jiayin Ge、Santanu Kolay、Matt Steiner、Sandeep Pandey、Gunjit Singh、Marvin Kim、Karan Jindal、Krishi Suresh Kumar、Mehul Parsana、Manveer Kaur、Hua Liu,以及参与分层兴趣表征项目开发和上线的所有同事。