论文标题:One Model to Rank Them All: Unifying Online Advertising with End-to-End Learning
总结:
背景
广告推荐多阶段级联结构(召回 -> 预排 -> 精排 -> 拍卖)的两大痛点:
- 链路不一致:老生常谈的问题,级联结构中各阶段的优化目标和数据分布都存在显著差异,能否最终指向全局最优的优化目标有待商榷。
- 候选的互相影响系统不感知:现阶段的级联结构中,一般直到重拍环节才会进行上下文感知的 xtr 建模,广告场景中一次请求内参竞广告候选之间如何相互作用,没有得到很好建模。
架构
工程优化:现有架构这种 embedding 调用方式在候选数据量扩展的情况下无法复用(显式交叉特征高昂的存储成本和通信成本),论文中提出了一种混合特征服务——item 侧特征统一存储在内存等本地存储中以减少通信成本(只保留了类别特征,移除了显式交叉和数值特征,消融实验来看这部分损失很小),user 侧特征更新频率高,通过一次调用 rpc 请求实现 embedding 读取,然后以广播的方式拼接到本地存储的 item 特征矩阵上(有效复用了 user 侧计算)。
- 正负样本:曝光空间上的点击样本作为正样本,同时会从全候选集中按照热度采样样本来作为补充候选,补充候选的样本标签根据用户历史是否点击来确定(采样到的候选用户之前点击过,也会被作为点击正样本)。
- 网络:
行为序列内/参竞候选间交叉(GCF):采用类似 self attention 的运算(参竞候选间交叉能增强模型的参竞上下文感知能力),论文中引入分簇自注意力代替传统多头自注意力,大大降低计算复杂度。分簇自注意力机制的核心是是引入线性变换将key矩阵和value矩阵的 token 按位置组合成簇,进而达到通过降低 token 数量来降低计算复杂度的目的,同时还引入门控机制将 query 的簇 token 和 key/value 的簇 token 进行交互。

行为序列与参竞候选的交叉(MIF):基于用户行为序列和参竞候选拼接然后做 self attention 的前期融合方案计算成本更高,以参竞候选和self attention 后的行为序列做target attention 的后期融合方案不利于两侧特征交叉,基于此论文中提出了一个中期融合方案——取行为序列和参竞候选 self attention 中不同层的隐状态来做分簇注意力计算(为了更好建模用户兴趣,增加了以用户序列侧的隐状态作为query 检索参竞候选隐状态的机制,详见下图),进而在计算精度和计算成本中取折中。实践中是在行为序列内/参竞候选间的交叉层中等间隔插入 MIF 层。

GCF 层和 MIF 层共同组成类似传统链路中的精排模型(论文中称之为 RecFormer),其中参竞候选的 token向量会接一个 MLP 层来完成xtr任务预估。接着token 向量会被送入一个 AucFormer 的结构中,该结构由一个Generator 和 Evaluator组成,这个模块有点像传统链路中的混排模型。Generator 采用非自回归的生成方式,输入包括两部分,一部分是随机初始化的 slot token 来作为输入,经过几层分簇自注意力得到类似竞胜位置的表征向量。另外一部分是 RecFormer 输出的token 向量,作为参竞候选的表征向量,二者相乘得到一个参竞候选数量 * 竞胜位置数量的分配矩阵,由该分配矩阵结合广告出价和一个可学习的bias向量来生成一系列队列(看起来像是一个类似beam search 的逻辑)。 Evaluator 的打分和 Generator类似,不过是将候选的token 向量换成了 队列中候选的token向量,并和 slot token向量拼接后送入分簇注意力模块中进行融合。 AucFormer中在 Generator和 Evaluator后还接了一个 Payment Network 来满足广告推荐的约束条件,这里不详细展开。

- 损失函数:训练包括预训练和后训练两个阶段。预训练阶段训练RecFormer部分,损失函数为基于曝光样本+采样样本的交叉熵损失。后训练阶段则借助强化学习完成,Reward model 使用 Aucformer中的 Evaluator,训练时冻结了 RecFormer 模块之前的参数。奖励模型在曝光空间上训练得到,训练采用交叉熵损失,正样本只使用当前请求内的点击样本,不使用采样样本。具体训练过程比较复杂,这里不详细展开。

可扩展性
作者在论文中从两个方面来论证了模型的可扩展性:
- 增加 RecFormer/AucFormer的block数量能提升模型表现
- 模型的浮点运算次数(Flops)与模型表现有较强的正相关关系

从图中不难看出曲线边际收益递减的趋势,作者认为这是受限于序列长度和数据量。