RecSys'24大厂推荐模型工作汇总，涉及CVR预估/广告预估纠偏/大模型/多任务学习等多个主题

科技 2024-11-11 22:58 北京

点关注，不迷路，用心整理每一篇算法干货~

后台留言”交流“，加入圆圆算法交流群~

👇🏻扫码👇🏻加入圆圆算法知识星球（11.1价格上调）~

（已有920+同学加入学习，700+干货笔记）

今天这篇文章给大家介绍几篇RecSys 2024中，大厂发表的5篇推荐系统预估模型基础优化工作。涉及CVR预估、广告预估模型纠偏、大模型推荐系统、多任务学习、Scaling Law等多个主题。

CVR预估引入未点击样本

论文标题：Utilizing Non-click Samples via Semi-supervised Learning for Conversion Rate Prediction

下载地址：https://dl.acm.org/doi/pdf/10.1145/3640457.3688151

本文提出了一种利用非点击样本伪标签的方式建模全空间CVR目标，并结合CTR作为辅助任务，使用自适应的loss权重进行动态加权。

为了解决CVR训练样本稀疏和样本选择偏差问题，本文将未点击空间的样本也加入模型训练中。引入方法为，将未点击空间的CVR模型预测结果，作为未点击空间的伪标签，使用logloss进行拟合。这部分未点击空间样本的loss相当于退化成了计算模型在这部分样本上预测结果的信息熵。信息熵的引入，让模型将CVR预测结果推向0或1的边界值，可以提升模型对于伪负样本的识别能力，高置信的伪负样本的预测值会更接近1。

此外，文中引入CTR作为辅助任务进行训练，为了平衡辅助任务和CVR任务的梯度关系，文中采用了一种动态权重设置的方法，根据CTR和CVR的预估loss的比例，对两个loss进行缩放，让两个任务的loss平衡，缓解CTR loss太大主导模型训练的问题。

微信——序列推荐中的Scaling Law验证

论文标题：Scaling Law of Large Sequential Recommendation Models

下载地址：https://arxiv.org/pdf/2311.11351

本文构建了序列推荐场景的大模型，模型整体基于Transformer Decoder的架构，输入全部为item id，不引入任何其他特征，完全基于用户前序的item id序列预测下一个item id。为了提升大模型的训练稳定性，文中提出了不同层网络个性化的dropout机制，浅层使用较大dropout比例提升泛化性，深层使用较小dropout比例保证信息提取的确定性。在优化器方面，使用Adam和SGD相结合的方式，先用Adam训练至收敛，然后改成SGD进行继续训练。

通过上述训练方式，文中构建了多层的序列推荐大模型，并结合5个具体的推荐系统任务，验证大模型的scaling law，实验结果表明序列推荐场景也具备scaling law的特性，各个任务的效果随着模型参数量的增加而提升。

华为——对齐基于LLM和基于ID的推荐模型

论文标题：FLIP: Towards Fine-grained Alignment between ID-based Models and Pretrained Language Models for CTR Prediction

下载地址：https://arxiv.org/pdf/2310.19453

本文提出了一种结合传统ID类推荐模型和大语言模型推荐的方法。ID类模型将特征映射成ID进行建模，忽视了各个特征和特征值之间的关系；而语言模型虽然泛化性强，但是由于将特征拆分成了token，对特征field的建模能力弱，对一些字面差别小的特征区分度也不高。

为了融合二者各自的优势，本文提出了一种融合ID模型和大语言模型的推荐模型建模方法。核心解决方法是通过预训练对齐ID模型和语言模型的表征。文中引入了类似MLM的方法和对比学习的方法。在MLM中，对特征的文本表示和ID表示分别进行mask，使用上下文两种模态的信息进行被mask部分的还原。在对比学习中，对于同一个样本特征的ID和文本表示方法作为正样本对，使用对比学习拉近其距离。在预训练后，使用ID模型和大语言模型的预测结果做加权求和得到最终预测结果，使用下游数据进行finetune。

华为——广告预估模型引入竞价信息

论文标题：AIE: Auction Information Enhanced Framework for CTR Prediction in Online Advertising

下载地址：https://arxiv.org/pdf/2408.07907

本文提出了一种解决广告系统CTR预估中auction bias的问题。在广告系统中，CPC计费模式下，样本的最终展现除了和广告的点击率有关外，还和广告主出价相关。广告主出价越高，越可能获得展现机会。这就导致样本中存在竞价带来的bias：有的广告本身由于出价高带来了额外的展现，获得了一些相关性较差的推荐，相应的后验点击率变低。这就导致了影响模型的训练数据。

为了解决这个问题，本文在CTR预估模型中引入了2个模块。第一个模块是显示建模market price，和CTR底层共享网络参数，以此让CTR预估模型感知到market price信息。第二个模块是一个校准模块，由于出价高的样本可能后验点击率偏低，因此根据出价高低对正样本加权，出价越高正样本的权重越高，并通过截断、minmax归一化等进行权重处理，校准出价带来的ctr预估bias。

腾讯——多类型目标的多任务学习

论文标题：Touch the Core: Exploring Task Dependence Among Hybrid Targets for Recommendation

下载地址：https://arxiv.org/pdf/2403.17442

本文是腾讯发表的一篇推荐系统多任务学习建模优化工作。在推荐系统中，经常会出现多目标优化的场景，并且有一个核心的关注指标，其他目标可能是这个指标的前置行为。腾讯的这个场景，希望预估的核心目标是观看时长，是一个回归任务，在其之前还有一系列的点击、观看等二分类任务。如何让模型建模出这种多目标之间的递进关系，且同时处理好回归label和二分类label，是本文的核心研究问题。

针对上述问题，本文提出了一种递进式的多任务学习方法，核心是将各个任务按照链路关系进行串行递进建模，并引入label embedding和表征融合等机制，让后链路目标的拟合可以使用前链路目标的label或者表征。对于多个目标，每个任务进行建模后，会将其label和预估塔的表征作为后续模型的输入特征。对于label，引入了label embedding技术，直接根据前一个塔的预测结果进行gumble softmax采样，转换成0、1之间的离散值，再查到对应的embedding。表征或者label embedding，都会过一个attention模块，对前序多个目标的label embedding或者模型表征进行加权融合，得到下一个塔的输入特征。通过上述方式，实现了多任务之间的关系建模，后链路任务预测时可以考虑到前链路的预估信息。

END

后台留言”交流“，加入圆圆算法交流群~

后台留言”星球“，加入圆圆算法知识请星球~【时序预测专题课程持续更新中】

知识星球提供一文贯通笔记、经典代码解析、问答服务、新人入门，已有920+小伙伴加入，价格随人数增加和内容丰富上涨，感兴趣的同学尽早加入~

双11优惠券，扫码领取！

投稿&加交流群请加微信，备注机构+方向拉群~

【历史干货算法笔记】

生成式模型入门：一文讲懂3大类生成式模型

Sptial-Temporal时空预测总结：建模思路、优化方法梳理

时序预测顶会论文数据集、数据处理方法、训练方法汇总

时间序列预测实战方法概述：从数据到模型

Informer模型结构和代码解析

基于Transformer的时序预测模型TFT代码详解

时空预测经典模型STGCN原理和代码解读

一网打尽：14种预训练语言模型大汇总

Vision-Language多模态建模方法脉络梳理

花式Finetune方法大汇总

从ViT到Swin，10篇顶会论文看Transformer在CV领域的发展历程

如果觉得有帮助麻烦分享在看点赞~

http://mp.weixin.qq.com/s?__biz=MzIyOTUyMDIwNg==&mid=2247491599&idx=1&sn=5f196ada394b860212ab0b746379ea9c

圆圆的算法笔记

定期更新深度学习/算法干货笔记和世间万物学习记录~

最新文章

清华大学提出基于多模态大模型的时间序列异常检测方法

我发现了找顶会创新点的最强公式，真的不需要脑子

最全汇总！2024推荐系统大厂顶会工作整理

检索增强时序预测——大模型RAG建模思路在时序预测中的应用

今天面试了一个字节女生，当场想给她offer！

2024时序预测都有哪些经典工作——总结篇

针对长周期非平稳多元时间序列的异常检测方法

NeurIPS'24：针对时序预测中时间戳特征的研究

发一篇顶会真不难

高效的卷积+Attention多元时序预测模型结构，实现长短期&变量间关系建模

最后3天！双11星球特惠~

适用于各类结构&领域时序数据的通用时序预测模型

最后3天！双11星球特惠~

取代Mamba，超越Transformer！扩展LSTM到数十亿参数

Salesforce推出首个通用时序预测模型评测基准GIFT-Eval，助力时序通用基础模型研究

南大&阿里发布多模态大模型WINGS，解决基于LLM的多模态训练灾难遗忘问题

港科技&MIT&浙大联合发布通用时序特征机器TimeMixer++，多项任务取得SOTA效果

双11星球优惠券来啦~

Salesforce推出Moirai-MoE，新视角设计下一代时序基础模型

免费白皮书《从头训练大模型最佳实践》

清华大学NeurIPS'24：时序大模型AutoTimes，结合In-context Learning提升预测效果

时间序列模型深度解析知识库

NIPS 2024时间序列工作——公众号已更新文章汇总

多阶段对比学习+多专家CLIP实现细粒度多模态表征学习

FoundTS：时间序列预测基础模型的全面统一测评基准

剑桥大学时间序列对比学习新方法，缓解伪负样本影响

时间序列+深度学习干货笔记专栏

几篇KDD'24大厂推荐系统优化工作总结

华为诺亚方舟实验室与华东师范大学联合发布时序预测通用模型ROSE——轻量规模，SOTA效果！

（更新至27节）时间序列预测专题系列干货文章

清华大学最新发布：统一时序预测模型，上下文长度首次扩展至千级别，适用各类数据集

重磅！机器学习时间序列预测+Transformer，堪称顶会收割机！

阿里达摩院最新多模态大模型介绍，多项图文任务取得SOTA效果

20场kaggle时间序列比赛Top方案GrandMaster整理

时序预测数据处理新方法汇总：多粒度和频域的可逆归一化

腾讯KDD‘24公开最新广告推荐系统建模方案

近7年深度学习时序预测建模方法汇总

普林斯顿大学提出首个基于MoE的稀疏时序预测大模型，参数量扩展到2.4billion

15种金融时间序列预测方法总结

时序预测中的多类型模型组合建模方案

时间序列预测专题系列干货文章

KDD'24系列：统一时间序列预训练Transformer

Transformer手撕BP，当场拿了offer

不会捞“偏门”，这辈子别想发计算机顶会顶刊！

一文汇总：长周期时序预测有哪些优化点？

LSTM+transformer=金融时序预测超高精准度！

高维多变量下的Transformer时序预测建模方法

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉