首页时事民生政务教育文化科技财富体娱健康情感

旅行百科职场楼市企业乐活学术汽车时尚创业美食幽默美体文摘

大模型可解释性怎么搞？(附代码)

科技 2024-10-30 16:36 浙江

大模型的可解释性非常重要。随着模型越来越大，其“黑盒子”特性会严重影响模型结果的准确性，增加对模型的优化难度，以及在医学、金融等领域带来很高的应用风险。

因此提高大模型的可解释性，不仅能优化我们的实验结果，其方法本身也是一个可发paper的创新点。

今天总结一下目前最全的大模型可解释性技术。

首先按照大模型的训练范式分类：传统 fine-tuning 范式 和 基于 prompting 的范式。

基于传统 fine-tuning 范式的模型解释，又可分为局部解释和全局解释。

基于 prompting 的范式，分为对基础模型的解释，和对助手模型的解释。

其中每种解释还有细分内容。为了方便大家学习，我按照上面的分类，整理了118篇可解释性的精选论文，有开源代码的也一并整理。扫码免费领取。

扫码免费获取全部论文+开源代码

来看一下具体的分类。

传统 fine-tuning 范式中的局部解释

局部解释是对语言模型如何针对特定输入实例进行预测的理解，对单个样本预测进行解释。

具体方法包括特征归因、基于注意力机制的解释、基于示例的解释、基于自然语言的解释。

传统 fine-tuning 范式中的全局解释

全局解释从模型的角度出发，了解各个组件（神经元、隐藏层和更大的模块）编码的内容，为大模型的工作机制提供更高阶的解释。

全局解释有三种主要方法：分析模型表征和参数的探测法、确定模型输入响应的神经元激活分析，以及基于概念的方法。

这些方法旨在理解模型的组件所编码的知识/语言属性，并解释每个组件所学习的内容。

全部118篇可解释性的精选论文，扫码免费下载。

扫码免费获取全部论文+开源代码

基于 prompting 的范式中的基础模型解释

具体方法为解释上下文学习、解释CoT提示、表征工程。

基于 prompting 的范式中的助手模型解释

助理模型通常经过两个阶段的训练：无监督预训练和有监督对齐微调。关于可解释性的研究在于确定模型知识的来源，以便更好地改进和解释其性能。

研究方法包括解释微调的作用、解释幻觉、不确定性量化。

扫码免费获取全部论文+开源代码

本文总结了LLM可解释性技术的主要方法，一共118篇论文与已开源的代码。无论你是用来优化模型还是寻找idea，都能有帮助。需要的同学扫上方二维码即可全部免费下载。

机器学习实验室

专注于机器学习和深度学习技术与实践。

最新文章

245个目标检测开源项目合集，建议收藏！

制作个人的第一个RAG demo！

谷歌版Sora发布：最大对手竟是「可灵」，OpenAI反而最拉胯

NeurIPS 2024 | Ilya重磅演讲：预训练将结束，接下来是超级智能「自我意识」

多模态融合，顶会超神了！

今夜凌晨，OpenAI Sora炸裂登场！网页版已经挤爆

LSTM卷土重来！xLSTM和Vision-LSTM共同引领文艺复兴

“让AI不再难学"，知名UP主梗直哥的《破解深度学习》来了！

全球五大巨头GPU总量曝光！谷歌第一微软第二！

245个目标检测开源项目合集，建议收藏！

《深度学习图像分割》第4章：基于编解码结构的分割网络

RAG还是微调，怎么选？

吴恩达：每个AI从业者都应该关注Agent！

Flux已成当下最火热的文生图模型？

计算机视觉顶尖期刊和会议有哪些？

被导师放养，后果可能很严重。。。

两张3090复现SearchGPT！

啥工作量？！60天就卷出一篇CCF-A顶会...

AlphaFold3重磅开源，诺奖级AI颠覆世界！GitHub斩获1.8k星，本地即可部署

《深度学习图像分割》第3章：图像分割关键技术组件

涨点神器！100个即插即用缝合模块【合集下载】

导师一个idea都没有，怎么发CCF-A？

《深度学习图像分割》第2章：传统图像分割算法

ChatGPT变身AI搜索引擎免费用！

大模型可解释性怎么搞？(附代码)

新扩散模型OmniGen一统图像生成！

国内首本大模型推荐系统著作来了！

只要敢捞“偏门”，篇篇都是顶会顶刊！

245个目标检测开源项目合集，建议收藏！

NeurIPS'24大模型LoRA超级变体！仅需参数0.4%达微调效率巅峰！

Windows用户也能使用桌面版ChatGPT了！

发论文别太老实，用对方法篇篇都是顶会顶刊！！！

OpenAI王炸来了！强化学习也有scaling law？

预告 | 《深度学习图像分割》将在GitHub逐步内容开源！

算法岗和开发岗有什么区别？

算法岗就业，Kaggle金牌和CCF-A一作哪个更有用？

82个即插即用的深度学习缝合模块！

Llama 3.2 来了！支持图像推理，还有可在手机上运行的版本

张俊林详细拆解o1：OpenAI o1完整训练过程逆向推演

对标Claude Artifacts！OpenAI canvas一夜封神！

首个Mamba+Transformer混合架构多模态大模型来了！

在深度学习中，是否应该打破正负样本1:1的迷信？

首个工业级异常检测的大模型AnomalyGPT！AAAI 2024已开源！

Claude工程师聊prompt：不要把模型当小孩子、不需要角色扮演、实话实说

张俊林：OpenAI o1的价值意义及强化学习的Scaling Law

ECCV'24最强多模态检测器！详解Grounding DINO：创新架构、训练代码！

Sora年内发布无望？视频生成还有戏吗？

KAN 2.0来了！会是AI+Science的答案吗？

基于YOLO v8融合CLIP！CVPR 2024多模态检测神器！

GPT-4结合SAM 2：免训练多模态分割的全新解决方案！

分类

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉