腾讯KDD‘24公开最新广告推荐系统建模方案

科技 2024-09-29 23:01 北京

点关注，不迷路，用心整理每一篇算法干货~

后台留言”交流“，加入圆圆算法交流群~

后台回复“星球”加入圆圆算法知识星球~

（已有860+同学加入学习）

腾讯在KDD2024中发表了一篇广告推荐系统的工作，详细介绍了腾讯构建的新一代推荐系统模型，从Embedding构建、模型结构、优化方式等多个方面都进行了细致优化。今天这篇文章给大家介绍一下腾讯的这篇工作。

论文标题：Ads Recommendation in a Collapsed and Entangled World

下载地址：https://arxiv.org/pdf/2403.00793

整体介绍

本文介绍了腾讯的广告推荐系统模型结构。整体的模型结构如下图所示，核心包括以下几个方面。

基础Embedding：包括序列特征、数值特征、ID特征，各类特征有相应的处理方法；

多Embedding多Expert融合：每个特征使用多个Embedding，并使用多个Expert进行建模，实现模型Ensemble，缓解Embedding维度坍缩问题；

多任务多场景的兴趣解耦：提出两种建模方法，解决多任务或多场景建模中，用户兴趣的耦合对模型造成的负向影响；

优化技巧：进行样本加权、引入rank loss等模型训练优化方法。

基础Embedding

推荐系统模型的Embedding可以分为4种类型：行为序列建模Embedding、数值型Embedding、ID类Embedding，以及从外部数据预训练的Embedding。

对于行为序列建模，文中采用了之前腾讯提出的Temporal Interest Module结构（论文Temporal Interest Network for Click-Through Rate Prediction），在用户历史行为序列建模中引入时间维度信息，并且和目标商品信息进行充分交叉。这篇文章的详细解析也在星球中更新过，感兴趣的同学可以进一步查看。

对于数值类型特征，由于其存在大小关系，文中提出了Multiple Numeral Systems Encoding (MNSE)的Embedding生成思路。其核心是将数值转换成不同进制的表示，再将这个表示转换成Embedding。比如将51这个数，可以转换成二进制111011，进一步可以转换成【6_1, 5_1, 4_0, 3_0, 2_1, 1_1】这6个Embedding。同时也可以将51转换成3进制、4进制等各种类型的表示，并转换成相应Embedding。

对于外部数据预训练的Embedding，例如使用User-Item构建的Graph训练的Embedding，文中使用user和item侧Embedding的相似度打分作为模型输入，并对这个相似度打分使用上述MNSE的方式构建数值Embedding输入模型。

多Embedding多Expert融合

本文进一步探索了Embedding中的维度坍缩问题。这里的维度坍缩问题指的是，对于一个K维的Embedding，模型只能有效利用其中较少量的维度，Embedding分布在一个很小的空间，进而无法有效利用Embedding信息。

文中提出，造成这个问题的核心原因是模型中的特征交叉模块。有一些特征，由于其取值较少，本来就用不了K维的Embedding，比如性别这个特征。而这个特征在和其他特征做交叉后，就会把其他特征也带向坍缩。

为了解决这个问题，文中提出将一个特征的Embedding拆成多份，每份内部分别做特征交叉，并过单独的Expert模型。进一步的，采用不同类型的特征交叉方式，实现了一种多Embedding、多类型特征交叉、多Expert融合的建模方法。

在特征交叉部分，为了避免直接计算两个Embedding内积出现的维度坍缩问题，文中借鉴前人的工作，先对一个特征的Embedding通过MLP映射后，再和另一个Embedding计算内积进行交叉，以此来有效缓解维度坍缩问题。

多任务多场景兴趣解耦

在多任务或者多场景建模中，不同的任务或场景下的用户兴趣是不同的，联合学习会造成互相的干扰，带来负迁移问题。为了解决上述问题，文中提出了两种建模方法，第一种方法面向多任务学习，同时关注多个目标的效果。核心在于将底层的Embedding进行不同维度的拆解，每种Embedding过一个专家模型，并通过Gate控制每个任务使用各个Embedding和专家的权重。相比传统的MoE做法，这里没有区分每个任务独立或者共享的Expert，而是直接使用独立模型+Gate的方法进行融合。

第二种方法面向单任务学习，这里只关注一个目标任务的效果，其他任务作为辅助任务，目的是提升目标任务的效果。这里采用了辅助Expert的方法，用一个辅助Expert学习辅助目标，并将辅助塔的表征作为主塔的输入，以提升主塔的预测效果。

优化技巧

在模型优化方法上，文中也提出了一些优化技巧。

首先是梯度消失问题，在腾讯的广告场景中，点击率很低，正样本很少，导致梯度跟小。文中指出，引入ranking loss和binary cross entropy进行联合训练，可以显著增大梯度，提升模型的收敛性。

其次，如果一个样本重复曝光，会带来用户体验的下降。为了缓解这个问题，文中对重复曝光的负样本进行加权，让模型减少重复曝光，且用户不感兴趣样本的打分。这样做之后，会改变样本打分的整体分布，因此文中对正样本进行纠偏加权缓解该问题。

此外，文中也进行了包括不确定度建模、在线学习、分析工具等一系列的优化和链路建设。

END

后台留言”交流“，加入圆圆算法交流群~

后台留言”星球“，加入圆圆算法知识请星球~【时序预测专题课程持续更新中】

知识星球提供一文贯通笔记、经典代码解析、问答服务、新人入门，已有860+小伙伴加入，价格随人数增加和内容丰富上涨，感兴趣的同学尽早加入~

投稿&加交流群请加微信，备注机构+方向拉群~

【历史干货算法笔记】

生成式模型入门：一文讲懂3大类生成式模型

Sptial-Temporal时空预测总结：建模思路、优化方法梳理

时序预测顶会论文数据集、数据处理方法、训练方法汇总

时间序列预测实战方法概述：从数据到模型

Informer模型结构和代码解析

基于Transformer的时序预测模型TFT代码详解

时空预测经典模型STGCN原理和代码解读

一网打尽：14种预训练语言模型大汇总

Vision-Language多模态建模方法脉络梳理

花式Finetune方法大汇总

从ViT到Swin，10篇顶会论文看Transformer在CV领域的发展历程

如果觉得有帮助麻烦分享在看点赞~

http://mp.weixin.qq.com/s?__biz=MzIyOTUyMDIwNg==&mid=2247491081&idx=1&sn=2845e6a99db030913b622af0345260b0

圆圆的算法笔记

定期更新深度学习/算法干货笔记和世间万物学习记录~

最新文章

清华大学提出基于多模态大模型的时间序列异常检测方法

我发现了找顶会创新点的最强公式，真的不需要脑子

最全汇总！2024推荐系统大厂顶会工作整理

检索增强时序预测——大模型RAG建模思路在时序预测中的应用

今天面试了一个字节女生，当场想给她offer！

2024时序预测都有哪些经典工作——总结篇

针对长周期非平稳多元时间序列的异常检测方法

NeurIPS'24：针对时序预测中时间戳特征的研究

发一篇顶会真不难

高效的卷积+Attention多元时序预测模型结构，实现长短期&变量间关系建模

最后3天！双11星球特惠~

适用于各类结构&领域时序数据的通用时序预测模型

最后3天！双11星球特惠~

取代Mamba，超越Transformer！扩展LSTM到数十亿参数

Salesforce推出首个通用时序预测模型评测基准GIFT-Eval，助力时序通用基础模型研究

南大&阿里发布多模态大模型WINGS，解决基于LLM的多模态训练灾难遗忘问题

港科技&MIT&浙大联合发布通用时序特征机器TimeMixer++，多项任务取得SOTA效果

双11星球优惠券来啦~

Salesforce推出Moirai-MoE，新视角设计下一代时序基础模型

免费白皮书《从头训练大模型最佳实践》

清华大学NeurIPS'24：时序大模型AutoTimes，结合In-context Learning提升预测效果

时间序列模型深度解析知识库

NIPS 2024时间序列工作——公众号已更新文章汇总

多阶段对比学习+多专家CLIP实现细粒度多模态表征学习

FoundTS：时间序列预测基础模型的全面统一测评基准

剑桥大学时间序列对比学习新方法，缓解伪负样本影响

时间序列+深度学习干货笔记专栏

几篇KDD'24大厂推荐系统优化工作总结

华为诺亚方舟实验室与华东师范大学联合发布时序预测通用模型ROSE——轻量规模，SOTA效果！

（更新至27节）时间序列预测专题系列干货文章

清华大学最新发布：统一时序预测模型，上下文长度首次扩展至千级别，适用各类数据集

重磅！机器学习时间序列预测+Transformer，堪称顶会收割机！

阿里达摩院最新多模态大模型介绍，多项图文任务取得SOTA效果

20场kaggle时间序列比赛Top方案GrandMaster整理

时序预测数据处理新方法汇总：多粒度和频域的可逆归一化

腾讯KDD‘24公开最新广告推荐系统建模方案

近7年深度学习时序预测建模方法汇总

普林斯顿大学提出首个基于MoE的稀疏时序预测大模型，参数量扩展到2.4billion

15种金融时间序列预测方法总结

时序预测中的多类型模型组合建模方案

时间序列预测专题系列干货文章

KDD'24系列：统一时间序列预训练Transformer

Transformer手撕BP，当场拿了offer

不会捞“偏门”，这辈子别想发计算机顶会顶刊！

一文汇总：长周期时序预测有哪些优化点？

LSTM+transformer=金融时序预测超高精准度！

高维多变量下的Transformer时序预测建模方法

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉