免费送！我们出版了首本大模型RAG书籍

学术 2024-09-24 11:55 湖北

哈喽哈喽，大家好。我们的大模型RAG实战书籍终于跟大家见面了。

在本篇文章下方留言，点赞数量最高的2位朋友将获得《大模型RAG实战：RAG原理、应用与系统构建》1本

ChatGPT爆火之后，以ChatPDF为首的产品组合掀起了知识库问答的热潮。

在过去一整年中，大多数人都在完成RAG系统到高级RAG系统的迭代升级。但是技术发展是迅速的，如何深入了解RAG的发展，做出更好的RAG系统，其实还是非常困难的。

大模型爆火后的RAG系统发展，大体可以将其分为3个阶段，初级、高级、超级。初级阶段更多的是搭建起系统的pipeline；高级阶段是在召回生成测修修补补，根据badcase反推流程上的优化技巧；超级对应了从Agentic RAG、RAG不存在了、多模态RAG、结构化RAG、GraphRAG、MemoryRAG等技术飞速发展的阶段。

S1 初级RAG

S1阶段处于23年元旦前后，最先在Github出现了一批尝试去复现chatpdf的项目，他们通过对知识库文档进行定长分块建立索引。然后使用用户query去索引中召回相关的文档片段，结合预定义的prompt模板，让LLM生成问题相关的答案。

其中用到的向量和LLM模型，闭源一般使用openai ada 002 + chatgpt。开源中文测的则比较稀缺，常见的如simbert/text2vec + chatglm v1 6b等。

大体的一个流程图如下：

图片来自：https://www.promptingguide.ai/research/rag

S2 高级RAG

S2阶段横跨23年整年的时间，大体上可以分为模型测和策略测。

模型测

召回模型测：开源社区现在项链模型发力，一些针对QA分布的向量模型开源，如M3E，BGE等。

生产模型测：国产大模型百花齐放，百川、书生、千问、智谱等。

策略测

策略测在卷3大块的内容

1.如何保证更好的文档切分？这里诞生了很多的解析，切分，索引构建技巧。

解析测，简单的从纯文本识别，到后来更复杂的借助版式识别+OCR的方式，还要针对表格，图片等单独处理
切分方面，从滑动窗口定长切分到语义，模块化切分等。
索引构建的一些技巧主要是为了应对chunk切分后的信息丢失问题，常见的比如，保留前后块的索引，文档级别的索引构建等。

2.如何召回的更好？

召回测的一个出发点是，用来召回的query并非一定是用户的输入query。对此我们可以一下子想起来如query改写，hyde，子问题，step-back等常见策略。当然也有混合搜索这类不属于这个范畴的技巧。

3.如何生成的更好？

生成测的一个出发点是，用来生成的内容并非一定是召回的query。从这一点我们也可以想起来如召回内容压缩，内容rerank，溯源，map-reduce等一些策略。

模型微调测

RAG系统的主要模型还是嵌入模型+生成模型。因此二者的训练方式，也产生了几个不同的大类别。最简单的二者直接使用开源模型，称为Traning free的方式；如果是针对私有化的数据进行训练这2个模型，产生3种训练方式：

方式一：分别独立训练（Independent Training）
方式二：顺序训练（Sequential Training），又因为模块的先后，分为LLM First / Retriever First 2种
方式三：联合训练（Joint Training）

图片来自 A Survey on RAG Meeting LLMs: Towards Retrieval-Augmented Large Language Models

S3 超级RAG

S3阶段处于23年底一直到现在，这个阶段RAG的概念几乎是2个月变一次。

23年底，24年初，开源的大模型已经出现了如Yi-34B，Qwen-72B等具备长上下文能力且效果优异的大模型。RAG的发展注定需要往当时火热的Agent测靠拢。

Agent的核心为引擎+工具。引擎对整个流程做出决策，如是否调用某个知识库搜索知识，是否需要对结果进行反思重新迭代等。一个简单的Agentic RAG系统如下图：

图片来自：https://medium.com/@sulaiman.shamasna/rag-iv-agentic-rag-with-llamaindex-b3d80e09eae3

多模态RAG，结构化RAG，属于小而美的范畴。可能一方面是多模态还没有完全进入工业界，结构化RAG属于NL2SQL的范畴。对于这2个整体上与传统的RAG差异不大，区别在于，多模态流转的中间形态可能是图片，使用clip之类的图文检索模型召回，VL模型进行答案生成。结构化RAG的差异仅在召回测，使用sql、dsl等方式进行结构化数据库的召回。

24年上半年，部分厂商的RAG系统，在探索新的方向。如contextual.ai发文介绍他们的RAG2.0系统，虽然介绍博客的内容主要是联合训练。斯坦福的大佬们发布了RAPTOR，尝试通过层次的聚类来让RAG索引具备更高级的信息。

图片来自：RAPTOR: RECURSIVE ABSTRACTIVE PROCESSING FOR TREE-ORGANIZED RETRIEVAL

越来越多的开源框架，在往Agentic RAG方面发展，当然最常见的还是结合self-reflection，self-rag，crag的Agentic RAG系统。

24年中，微软开源了GraphRAG的项目代码，无数的公众号在炒作这个图谱集合的RAG系统。相比于RAPTOR，GraphRAG在底层的chunk层更拉通，前者的聚类仅限于文档内，在逐级往上到文档间。而基于图谱的RAG在文档间的chunk之间可能会存在实体的连接，从而社区之类之后可以让聚类的社区信息，更好的跨不同的文档。整体上，确实能丰富RAG系统的索引构建，也可以结合传统的高级RAG，实现一个更好的hybird RAG系统。

图片来自：From Local to Global: A Graph RAG Approach to Query-Focused Summarization

当然24年也有很多RAG不存在的说法，如很多的论文在评估Long Context(LC)大模型与RAG系统准确率的高低之时，RAG系统都处于下风。同时还有一些特殊的开闭源产品，比较常见的就是将知识融合进外挂参数中，最早的如Lamini的Memory Tunning，最近的如智源的MemoRAG。

本文作者：汪鹏资深NLP技术专家和AI技术专家，拥有多年NLP落地经验。擅长结合用户场景，针对性地设计图谱、问答、检索、多模态、AIGC等相关的算法和落地方案。在Kaggle获得多枚奖牌，等级master。拥有公众号“NLP前沿”。

▼

延伸阅读

《大模型RAG实战：RAG原理、应用与系统构建》

汪鹏谷清水卞龙鹏著

多年大厂工作经验的资深AI技术专家撰写
指导读者深入理解RAG技术原理

学会RAG落地应用技巧

掌握RAG系统构建方法

快速掌握大模型应用开发

内容简介：

这是一本全面讲解RAG技术原理、实战应用与系统构建的著作。作者结合自身丰富的实战经验，详细阐述了RAG的基础原理、核心组件、优缺点以及使用场景，同时探讨了RAG在大模型应用开发中的变革与潜力。书中不仅揭示了RAG技术背后的数学原理，还通过丰富的案例与代码实现，引导读者从理论走向实践，轻松掌握RAG系统的构建与优化。无论你是深度学习初学者，还是希望提升RAG应用技能的开发者，本书都将为你提供宝贵的参考与指导。

本文来源：原创，图片来源：原创
责任编辑：王莹，部门领导：宁姗
发布人：白钰

http://mp.weixin.qq.com/s?__biz=MzkyOTU5NzY1Mw==&mid=2247489385&idx=1&sn=c36df7d8c543431a2a08157eaca636db

NLP前沿

一手ai news分享 \x26amp; 热点paper解读

最新文章

测试时训练(TTT)太强了！

大模型也能"反悔"了！

Merkle树+RAG，Cursor的秘密曝光!

GraphRAG进化，效率翻倍！

8个月炼出好"钢"，Steel-LLM开源了~

OpenAI发布GPT学习法则~

465次实验炸出大模型量化真相

Qwen2.5.1 Coder系列开源来袭！冲！

一篇大模型RAG最新综述

解密o1，六大推理秘诀大曝光！

GraphRAG 0.4来袭：增量更新+DRIFT，起飞~

Llama 3退位，腾讯Hunyuan强势登顶

文本分块的天花板来了~

三连发！1.7B小模型把大厂干懵了~

给RAG装上眼睛，性能暴涨39%！

AI助攻SCI，这招太强了

KAG来了，RAG慌了！

传统RAG凉凉？多模态RAG带来工业级革命

AutoRAG开源：RAG界的AutoML终于来了！

智谱大气！首个语音到语音国产大模型开源

大模型数学能力翻车实锤！Apple新研究暴露真相~

prompt要自己写自己了！大厂扎堆放大招~

Claude昨夜王炸！新模型暴打o1，还能玩电脑~

RAG遇上知识冲突，Google祭出终极大招~

向o1看齐，google开源RAG推理扩展，提升近60%

微软开源，CPU推理100B模型，速度飞起~

Llama3 太炸裂了！远超过去的体验！

英伟达一夜封神，开源新模型打进全球前三！

忘记社区，lightrag开源graph的又一用法

entropix，终于找到了真正解决幻觉的方法了

是时候更新vllm了，新版吞吐提升2倍

openai今天open了2下，prompt自动生成器、Agent框架开源

手撕LLM+RLHF+VLM+o1推理，我全都要!!!

现实再次给大模型带来沉重打击

cde，世界上最好的 BERT 大小文本嵌入模型

卷疯了！开源社区离openai o1越来越近~

openai突发上架新模型：gpt4t-lu-test

SFT无需指令，响应微调开源~

点赞送书啦！大模型应用落地指南

Meta刚开源llama 3.2多模态，就被打败了~

cot-decoding，谷歌把o1的底裤都开源了

openai终于open了，开源了，别骂了~

免费送！我们出版了首本大模型RAG书籍

如果思维链都满足不了你，那思维图尼？

RL驱动的Reflection炼丹，谷歌开源SCoRe

大模型Agent，如何利用历史经验自我进化？

OpenAI o1时代，RLHF和多模态我全都要！！！

Qwen2.5系列开源来袭！冲！

达到草莓的70%！首个open o1项目开源

疯狂24h后，openai o1有哪些新的秘密？

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉