一、LLMs 已经具备了较强本领了,为什么还须要 RAG(检索增强天生)?
只管 LLM 已显现出显着的本领,但以下几个挑衅依然值得关注:
- 幻觉标题:LLM 接纳基于统计的概率方法逐词天生文本,这一机制内涵地导致其大概出现看似逻辑严谨实则缺乏究竟依据的输出,即所谓的“谨慎其事的假造陈诉”;
- 时效性标题:随着 LLM 规模扩大,练习本钱与周期相应增长。鉴于此,包罗最新信息的数据难以融入模子练习过程,导致 LLM 在应对诸如“请保举当前热门影片”等时间敏感性标题时力有未逮;
- 数据安全标题:通用的 LLM 没有企业内部数据和用户数据,那么企业想要在包管安全的条件下利用 LLM,最好的方式就是把数据全部放在当地,企业数据的业务盘算全部在当地完成。而在线的大模子仅仅完成一个归纳的功能;
二、先容一下 RAG?
RAG(Retrieval Augmented Generation, 检索增强天生)是一种技能框架,其核心在于当 LLM 面临解答标题或创作文本任务时,起首会在大规模文档库中搜索并筛选出与任务细密干系的素材,继而依据这些素材精准引导后续的答复天生或文本构造过程,旨在通过此种方式提升模子输出的精确性和可靠性。
RAG 技能架构图
三、RAG 重要包罗哪些模块?
- 模块一:版面分析
- 当地知识文件读取(pdf、txt、html、doc、excel、png、jpg、语音等)
- 知识文件复原
- 模块二:知识库构建
- 知识文天职割,并构建Doc文本
- Doc文本 embedding
- Doc文本 构建索引
- 模块三:大模子微调
- 模块四:基于RAG的知识问答
- 用户query embedding
- query 召回
- query 排序
- 将 Top K 个干系的 Doc 举行拼接,构建 context
- 基于 query 和 context 构建 Prompt
- 将 prompt 喂给大模子天生答案
四、RAG 相较于直接利用 LLMs举行问答 有哪些长处?
RAG(检索增强天生)方法赋予了开辟者无需为每个特定任务重新练习大型模子的本领,仅需毗连外部知识库,即可为模子注入额外的信息资源,从而显着提升其答复的精确度。这一方法尤着实用于那些高度依赖专业知识的任务。
以下是 RAG 模子的重要上风:
- 可扩展性:减小模子规模及练习开销,同时简化知识库的扩容更新过程。
- 精确性:通过引用信息源,用户可以大概核查答案的可信度,进而增强对模子输出结果的信托感。
- 可控性:支持知识内容的机动更新与个性化设置。
- 可表明性:展示模子猜测所依赖的检索条目,增长明确与透明度。
- 多功能性:RAG 可以大概顺应多种应用场景的微调与定制,涵盖问答、文本择要、对话体系等范畴。
- 时效性:运用检索技能捕捉最新信息动态,确保答复既即时又精确,相比仅依赖固有练习数据的语言模子具有显着上风。
- 范畴定制性:通过对接特定行业或范畴的文本数据集,RAG 可以大概提供针对性的专业知识支持。
- 安全性:通过在数据库层面实行脚色分别与安全管控,RAG 有效强化了对数据利用的管理,相较于微调模子在数据权限管理上的埋伏暗昧性,显现出更高的安全性。
五、对比一下 RAG 和 SFT,说一下两者有哪些区别?
现实上,对于 LLM 存在的上述标题,SFT 是一个最常见最根本的办理办法,也是 LLM 实现应用的底子步调。那么有须要在多个维度上比力一下两种方法:
固然这两种方法并非非此即彼的,公道且须要的方式是团毕业务须要与两种方法的长处,公道利用两种方法。
模块一:版面分析
为什么 须要 版面分析?
只管RAG(检索增强天生)技能的核心代价在于其团结检索与天生本领以提升文本内容的精确度与连贯性,然而在一些具体应用范畴,如文档剖析、智能化写作及对话体系构建中,特殊是在面临布局化或半布局化信息的处置惩罚需求时,其功能边界大概拓展至版面分析。
这是由于此类信息通常嵌于特定的布局布局中,须要对页面元素及其相互关系举行深入明确。
别的,当RAG模子面临包罗丰富多媒体或多模态因素的数据源,诸如网页、PDF文件、富文本纪录、Word文档、图像资料、语音片断、表格数据等复杂内容时,为了能高效地摄取并利用这些非文本信息,具备根本的版面分析本领变得至关紧张。这种本领有助于模子精准剖析各类信息单位,并乐成将它们融合成故意义的团体解读。
step 1:当地知识文件获取
q1:怎样举行 当地知识文件获取?
当地知识文件获取涉及从多种数据源(如.txt、.pdf、.html、.doc、.xlsx、.png、.jpg、音频文件等)提取信息的过程。针对差别范例的文件,须要接纳特定的访问与剖析计谋来有效获取此中蕴含的知识。下面我们将先容对于差别数据源数据的获取方式和难点。
q2:怎样获取 富文本txt 中内容?
- 先容:富文本 重要存储于 txt 文件中,由于排版比力整齐,以是获取方式比力简单
- 实战本领:
- 【版面分析——富文本txt读取】
q3:怎样获取 PDF文档 中内容?
- 先容:PDF文档中数据比力复杂,包罗文本、图片、表格等差别样式的数据,以是剖析过程中会比力复杂
- 实战本领:
- 【版面分析——PDF 剖析神器 pdfplumber】
- 【版面分析——PDF 剖析神器 PyMuPDF】
q4:怎样获取 HTML文档 中内容?
- 先容:PDF文档中数据比力复杂,包罗文本、图片、表格等差别样式的数据,以是剖析过程中会比力复杂
- 实战本领:
- 【版面分析——网页HTML剖析 BeautifulSoup】
q5:怎样获取 Doc文档 中内容?
- 先容:Doc文档中数据比力复杂,包罗文本、图片、表格等差别样式的数据,以是剖析过程中会比力复杂
- 实战本领:
- 【版面分析——Docx 剖析神器 python-docx】
q6:怎样利用 OCR 获取图片内容?
- 先容:光学字符辨认(Optical Character Recognition, OCR)是指对文本资料的图像文件举行分析辨认处置惩罚,获取笔墨及版面信息的过程。亦即将图像中的笔墨举行辨认,并以文本的情势返回。
- 思绪:
- 笔墨辨认:对定位好的笔墨地区举行辨认,重要办理的标题是每个笔墨是什么,将图像中的笔墨地区进转化为字符信息。
- 笔墨检测:办理的标题是那里有笔墨,笔墨的范围有多少;
- 如今开源的OCR项目
- Tesseract
- PaddleOCR
- EasyOCR
- chineseocr
- chineseocr_lite
- TrWebOCR
- cnocr
- hn_ocr
- 理论学习:
- 【版面分析——图片剖析神器 OCR】
- 实战本领:
- 【版面分析——OCR神器 tesseract】
- 【版面分析——OCR神器 PaddleOCR】
- 【版面分析——OCR神器 hn_ocr】
q7:怎样利用 ASR 获取语音内容?
- 别称:主动语音辨认AutomaTlc Speech RecogniTlon,(ASR)
- 先容:将一段语音信号转换成相对应的文本信息,好比"呆板的听觉体系”,它让呆板通过辨认和明确,把语音信号变化为相应的文本或下令。
- 目的:将人类的语音中的词汇内容转换为盘算机可读的输入(eg:按键、二进制编码大概字符序列)
- 思绪:
- 声学信号预处置惩罚:为了更有效地提取特性通常还须要对所收罗到的声音信号举行滤波、分帧等预处置惩罚工作,把要分析的信号从原始信号中提取出来;
- 特性提取:将声音信号从时域转换到频域,为声学模子提供符合的特性向量;
- 声学模子:根据声学特性盘算每一个特性向量在声学特性上的得分;
- 语言模子:根据语言学干系的理论,盘算该声音信号对应大概词组序列的概率;
- 字典与解码:根据已有的字典,对词组序列举行解码,得到末了大概的文本表现
- 理论教程:
- 【版面分析 之 语音辨认】
- 实战本领:
- 【版面分析 之 Speech-to-Text】
- 【版面分析 之 WeTextProcessing】
- 【版面分析——ASR神器 Wenet】
- 【版面分析 之 ASR神器练习】
step 2:知识文件复原
q1:为什么须要举行 知识文件复原?
当地知识文件获取包罗对多源化数据(txt、pdf、html、doc、excel、png、jpg、语音等)举行读取之后,轻易将一个多行段落分割成多个段落,从而导致段落遇到被分割,以是须要根据内容逻辑重新构造段落。
q2:怎样对 知识文件举行复原?
- 方法一:基于规则的知识文件复原
- 方法二:基于 Bert NSP 举行上下句拼接
step 3:版面分析———优化计谋篇
step 4:Homework
- 任务形貌:利用上述方法对 【SMP 2023 ChatGLM金融大模子挑衅赛】的 【ChatGLM评估挑衅赛-金融赛道数据集】举行版面分析
- 任务结果:分析各种方法结果和性能
模块二:知识库构建
为什么 须要 知识库构建?
在RAG(Retrieval-Augmented Generation)中构建知识库是至关紧张的,缘故起因包罗但不限于以下几点:
- 扩展模子本领:大规模语言模子如GPT系列固然具有强盛的语言天生和明确本领,但受限于练习数据集的覆盖范围,它们大概无法精确答复一些基于特定究竟或具体配景信息的标题。通过构建知识库,RAG可以增补模子自身的知识范围性,允许模子检索到最新、最精确的信息来天生答案。
- 及时更新信息:知识库可以及时更新和扩充,确保模子可以大概获取最新的知识内容,这对于处置惩罚时效性强的信息尤为关键,好比消息事故、科技希望等。
- 进步精确性:RAG团结了检索与天生两个过程,在天生答复前先检索干系文档,从而进步了答复标题时的精确性。如许,模子天生的答案不但基于其内部参数化的知识,还基于外部可靠泉源的知识库。
- 镌汰过拟合与hallucination(幻觉天生):大模子偶尔会由于太过依赖内涵模式而出现hallucination征象,即天生看似公道实则无依据的答案。通过引用知识库中简直切证据,RAG可以低落此类错误产生的大概性。
- 增强可表明性:RAG不但能提供答案,还能指出答案的泉源,增强了模子天生结果的透明度和可信度。
- 支持个性化及私有化需求:对于企业或个人用户,可以通过构建专属知识库满足特定范畴或私人定制的需求,使得大模子能更好地服务于特定场景和业务。
综上所述,构建知识库对于RAG模子来说,是实现高效精确地检索并天生答案的核心机制之一,它极大地提升了模子在现实应用中的性能和可靠性。
step 1:知识文天职块
- 为什么须要对文天职块?
- 信息丢失的风险:试图一次性提取整个文档的嵌入向量,固然可以捕捉到团体的上下文,但也大概会忽略掉许多针对特定主题的紧张信息,这大概会导致天生的信息不敷精确大概有所缺失。
- 分块巨细的限定:在利用如OpenAI如许的模子时,分块巨细是一个关键的限定因素。比方,GPT-4模子有一个32K的窗口巨细限定。只管这个限定在大多数情况下不是标题,但从一开始就思量到分块巨细是很紧张的。
- 重要思量两个因素:
- embedding模子的Tokens限定情况;
- 语义完备性对团体的检索结果的影响;
- 实战本领:
- 【知识库构建——知识文天职块】
- 【知识库构建——文档切分优化计谋篇】
step 2:Docs 向量化(embdeeing)
q1:什么是Docs 向量化(embdeeing)?
Embedding 也是文本语义寄义的信息麋集表现,每个嵌入都是一个浮点数向量,使得向量空间中两个嵌入之间的间隔与原始格式中两个输入之间的语义相似性干系联。
比方,假如两个文本相似,则它们的向量表现也应该相似,这一组向量空间内的数组表现形貌了文本之间的渺小特性差别。
简单来说,Embedding 资助盘算机来明确如人类信息所代表的“寄义”,Embedding 可以用来获取文本、图像、视频、或其他信息的特性“干系性”,这种干系性在应用层面常用于搜索、保举、分类、聚类。
q2:Embedding 是怎样工作的?
举例来讲,这里有三句话:
- “The cat chases the mouse” “猫追逐老鼠”
- “The kitten hunts rodents” 小猫捕猎老鼠。
- “I like ham sandwiches” 我喜好火腿三明治。
假如是人类来将这三个句子来分类,句子 1 和句子 2 险些是同样的寄义,而句子 3 却完全差别。但我们看到在英文原文句子中,句子 1 和句子 2 只有“The”是雷同的,没有其他雷同词汇。盘算机该怎样明确前两个句子的干系性?
Embedding 将离散信息(单词和符号)压缩为分布式连续值数据(向量)。假如我们将之前的短语绘制在图表上,它大概看起来像如许:
在文本被 Embedding 压缩到盘算机可以明确的多维向量化空间之后,由于句子 1 和 2 的寄义相似,它们会被绘制在相互附近。句子 3 却间隔较远,由于它与它们没有关联。假如我们有第四个短语 “Sally 吃了瑞士奶酪”,它大概存在于句子 3(奶酪可以放在三明治上)和句子 1(老鼠喜好瑞士奶酪)之间的某个地方。
q3:Embedding 的语义检索方式对比关键词检索的上风?
- 语义明确:基于 Embedding 的检索方法通过词向量来表现文本,这使得模子可以大概捕捉到词汇之间的语义联关系,相比之下,基于关键词的检索通常关注字面匹配,大概忽略了词语之间的语义接洽。
- 容错性:由于基于 Embedding 的方法可以大概明确词汇之间的关系,以是在处置惩罚拼写错误、同义词、近义词等情况时更具上风。而基于关键词的检索方法对这些情况的处置惩罚相对较弱。
- 多语言支持:许多 Embedding 方法可以支持多种语言,有助于实现跨语言的文本检索。好比你可以用中文输入来查询英文文本内容,而基于关键词的检索方法很难做到这一点。
- 语境明确:基于 Embedding 的方法在处置惩罚一词多义的情况时更具上风,由于它可以大概根据上下文为词语赋予差别的向量表现。而基于关键词的检索方法大概无法很好地区分同一个词在差别语境下的寄义。
q4:Embedding检索存在哪些限定?
- 输入词数限定:即便借助Embedding技能选取与查询最为匹配的文本片断供大型模子参考,词汇数量的束缚依然存在。当检索覆盖的文本范围广泛时,为了控制注入模子的上下文词汇量,通常会对检索结果设定TopK的阈值K,但这不可克制地引发了信息遗漏的标题。
- 仅支持文本数据:现阶段的GPT-3.5及诸多大型语言模子尚不具备图像辨认功能,然而,在知识检索过程中,许多关键信息通常依赖于图文团结来充实明确。比方,学术论文中的表示图、财务陈诉中的数据图表,仅凭文本难以精准把握其内涵。
- 大模子的胡编乱造:当检索到的干系文献资料不敷以支持大型模子精确答复标题时,为积极完成相应,模子大概会出现肯定程度的“即兴创作”,即在有限信息底子上举行推测与增补。
- 理论学习:
- 【知识库构建—Doc 向量化】
- 实战本领:
- 【Docs向量化——腾讯词向量】
- 【Docs向量化——sbert】
- 【Docs向量化——SimCSE】
- 【Docs向量化——text2vec】
- 【Docs向量化——SGPT】
- 【Docs向量化——BGE —— 智源开源最强语义向量模子】
- 【Docs向量化——M3E:一种大规模肴杂embedding】
step 3:Docs 构建索引
- 先容
- 实战本领:
- 【Docs构建索引——Faiss】
- 【Docs构建索引——milvus】
- 【Docs构建索引—— Elasticsearch】
模块三:大模子微调
为什么 须要 大模子微调?
通常,要对大模子举行微调,有以下一些缘故起因:
- 第一个缘故起因是,由于大模子的参数量非常大,练习本钱非常高,每家公司都去重新练习一个自己的大模子,这个变乱的性价比非常低;
- 第二个缘故起因是,Prompt Engineering的方式是一种相对来说轻易上手的利用大模子的方式,但是它的缺点也非常显着。由于通常大模子的实现原理,都会对输入序列的长度有限定,Prompt Engineering 的方式会把Prompt搞得很长。
越长的Prompt,大模子的推理本钱越高,由于推理本钱是跟Prompt长度的平方正向干系的。
别的,Prompt太长会因凌驾限定而被截断,进而导致大模子的输出质量打折口,这也是一个非常严峻的标题。
对于个人利用者而言,假如是办理自己一样寻常生存、工作中的一些标题,直接用Prompt Engineering的方式,通常标题不大。
但对于对外提供服务的企业来说,要想在自己的服务中接入大模子的本领,推理本钱是不得不要思量的一个因素,微调相对来说就是一个更优的方案。
- 第三个缘故起因是,Prompt Engineering的结果达不到要求,企业又有比力好的自有数据,可以大概通过自有数据,更好的提升大模子在特定范畴的本领。这时间微调就非常实用。
- 第四个缘故起因是,要在个性化的服务中利用大模子的本领,这时间针对每个用户的数据,练习一个轻量级的微调模子,就是一个不错的方案。
- 第五个缘故起因是,数据安全的标题。假如数据是不能通报给第三方大模子服务的,那么搭建自己的大模子就非常须要。通常这些开源的大模子都是须要用自有数据举行微调,才可以大概满足业务的需求,这时间也须要对大模子举行微调。
怎样对大模子举行微调?
q1:大模子的微调技能门路标题
从参数规模的角度,大模子的微调分成两条技能门路:
- 技能门路一:对全量的参数,举行全量的练习,这条路径叫全量微调FFT(Full Fine Tuning)。
- 技能门路二:只对部分的参数举行练习,这条路径叫PEFT(Parameter-Efficient Fine Tuning)。
q2:大模子的全量微调FFT 技能存在哪些标题
FFT也会带来一些标题,影响比力大的标题,重要有以下两个:
- 标题一:练习的本钱会比力高,由于微调的参数量跟预练习的是一样的多的;
- 标题二:灾难性忘记(Catastrophic Forgetting),用特定练习数据去微调大概会把这个范畴的表现变好,但也大概会把原来表现好的别的范畴的本领变差。
q3:大模子的 PEFT(Parameter-Efficient Fine Tuning) 办理哪些标题
PEFT重要想办理的标题,就是FFT存在的上述两个标题,PEFT也是如今比力主流的微调方案。
从练习数据的泉源、以及练习的方法的角度,大模子的微调有以下几条技能门路:
- 技能门路一:监视式微调SFT(Supervised Fine Tuning),这个方案重要是用人工标注的数据,用传统呆板学习中监视学习的方法,对大模子举行微调;
- 技能门路二:基于人类反馈的强化学习微调RLHF(Reinforcement Learning with Human Feedback),这个方案的重要特点是把人类的反馈,通过强化学习的方式,引入到对大模子的微调中去,让大模子天生的结果,更加符合人类的一些渴望;
- 技能门路三:基于AI反馈的强化学习微调RLAIF(Reinforcement Learning with AI Feedback),这个原理大抵跟RLHF雷同,但是反馈的泉源是AI。这里是想办理反馈体系的服从标题,由于网络人类反馈,相对来说本钱会比力高、服从比力低。
差别的分类角度,只是侧重点不一样,对同一个大模子的微调,也不范围于某一个方案,可以多个方案一起。
微调的终极目的,是可以大概在可控本钱的条件下,尽大概地提升大模子在特定范畴的本领。
大模子LLM举行SFT利用的时间在学习什么?
- 预练习->在大量无监视数据上举行预练习,得到底子模子–>将预练习模子作为SFT和RLHF的出发点。
- SFT–>在有监视的数据集上举行SFT练习,利用上下文信息等监视信号进一步优化模子–>将SFT练习后的模子作为RLHF的出发点。
- RLHF–>利用人类反馈举行强化学习,优化模子以更好地顺应人类意图和偏好–>将RLHF练习后的模子举行评估和验证,并举行须要的调解。
step 1:大模子微调练习数据构建
- 先容:怎样构建 练习数据?
- 实战本领:
- 【大模子(LLMs)LLM天生SFT数据方法篇】
step 2:大模子指令微调篇
- 先容:怎样构建 练习数据?
- 实战本领:
- 【大模子(LLMs)继续预练习篇】
- 【大模子(LLMs)指令微调篇】
- 【大模子(LLMs)夸奖模子练习篇】
- 【大模子(LLMs)强化学习——PPO练习篇】
- 【大模子(LLMs)强化学习——DPO练习篇】
模块四:文档检索
为什么 须要 文档检索?
文档检索 作为 RAG 核心工作,其结果对于鄙俚工作至关紧张。
固然可以通过向量召回的方式从文档库里召回和用户标题干系的文档片断,同时输入到LLM中,增强模子答复质量。
常用的方式直接用用户的标题举行文档召回。但是许多时间,用户的标题是非常口语化的,形貌的也比力暗昧,如许会影响向量召回的质量,进而影响模子答复结果。
本章重要先容 文档检索 过程中 存在的一些标题和对应的办理方法。
step 1:文档检索负样本样本发掘
- 先容:在各类检索任务中,为练习好一个高质量的检索模子,通常须要从大量的候选样本集会集采样高质量的负例,共同正例一起举行练习。
- 实战本领:
- 【文档检索——负样本样本发掘篇】
step 2:文档检索优化计谋
- 先容:文档检索优化计谋
- 实战本领:
- 【文档检索——文档检索优化计谋篇】
模块五:Reranker
为什么 须要 Reranker?
根本的 RAG 应用包罗四个关键技能构成部分:
- Embedding 模子:用于将外部文档和用户查询转换成 Embedding 向量
- 向量数据库:用于存储 Embedding 向量和实行向量相似性检索(检索出最干系的 Top-K 个信息)
- 提示词工程(Prompt engineering):用于将用户的标题和检索到的上下文组合成大模子的输入
- 大语言模子(LLM):用于天生答复
上述的底子 RAG 架构可以有效办理 LLM 产生“幻觉”、天生内容不可靠的标题。但是,一些企业用户对上下文干系性和问答精确度提出了更高要求,须要更为复杂的架构。一个行之有效且较为盛行的做法就是在 RAG 应用中集成 Reranker。
什么是 Reranker?
Reranker 是信息检索(IR)生态体系中的一个紧张构成部分,用于评估搜索结果,并举行重新排序,从而提升查询结果干系性。
在 RAG 应用中,重要在拿到向量查询(ANN)的结果后利用 Reranker,可以大概更有效地确定文档和查询之间的语义干系性,更风雅地对结果重排,终极进步搜索质量。
step 1:Reranker 篇
- 理论学习:
- 【RAG文档检索——Reranker 篇】
- 实战本领:
- 【Reranker——bge-reranker篇】
模块六:RAG 评测面
为什么须要 对 RAG 举行评测?
在探索和优化 RAG(检索增强天生器)的过程中,怎样有效评估其性能已经成为关键标题。
step 1:RAG 评测 篇
模块七:RAG 开源项目保举学习
为什么 须要 RAG 开源项目保举学习?
前面已经带你走完了 RAG 的各个流程,下面将保举一些 RAG 开源项目,资助大佬们举行消化学习。
RAG 开源项目保举 —— RAGFlow 篇
- 先容:RAGFlow 是一款基于深度文档明确构建的开源 RAG(Retrieval-Augmented Generation)引擎。RAGFlow 可以为各种规模的企业及个人提供一套精简的 RAG 工作流程,团结大语言模子(LLM)针对用户各类差别的复杂格式数据提供可靠的问答以及有理有据的引用。
- 项目学习:
- 【RAG 项目保举——RagFlow 篇(一)——RagFlow docker 摆设】
- 【RAG 项目保举——RagFlow 篇(二)——RagFlow 知识库构建】
- 【RAG 项目保举——RagFlow 篇(三)——RagFlow 模子供应商选择】
- 【RAG 项目保举——RagFlow 篇(四)——RagFlow 对话】
- 【RAG 项目保举——RagFlow 篇(五)——RAGFlow Api 接入(以 ollama 为例)】
- 【RAG 项目保举——RagFlow 篇(六)——RAGFlow 源码学习】
RAG 开源项目保举 —— QAnything 篇
- 先容:QAnything(Question and Answer based on Anything)是一个当地知识库问答体系,旨在支持多种文件格式和数据库,允许离线安装和利用。利用QAnything,您可以简单地删除当地存储的任何格式的文件,并得到精确、快速和可靠的答案。QAnything如今支持的知识库文件格式包罗:PDF(pdf) , Word(docx) , PPT(pptx) , XLS(xlsx) , Markdown(md) , Email(eml) , TXT(txt) , Image(jpg,jpeg,png) , CSV (csv)、网页链接(html)等。
- 项目学习:
- 【RAG 开源项目保举 —— QAnything 篇】
RAG 开源项目保举 —— ElasticSearch-Langchain 篇
- 先容:受langchain-ChatGLM项目启发,由于Elasticsearch可实现文本和向量两种方式肴杂查询,且在业务场景中利用更广泛,因此本项目用Elasticsearch代替Faiss作为知识存储库,利用Langchain+Chatglm2实现基于自有知识库的智能问答。
- 项目学习:
- 【【LLMs 入门实战】基于 当地知识库 的高效 🤖ElasticSearch-Langchain-Chatglm2】
RAG 开源项目保举 —— Langchain-Chatchat 篇
- 先容:Langchain-Chatchat(原Langchain-ChatGLM)基于 Langchain 与 ChatGLM 等语言模子的当地知识库问答 | Langchain-Chatchat (formerly langchain-ChatGLM), local knowledge based LLM (like ChatGLM) QA app with langchain
- 项目学习:
- 【【LLMs 入门实战】基于 当地知识库 的高效 🤖Langchain-Chatchat】
怎样学习大模子
如今社会上大模子越来越遍及了,已经有许多人都想往这内里扎,但是却找不到恰当的方法去学习。
作为一名资深码农,初入大模子时也吃了许多亏,踩了无数坑。如今我想把我的履历和知识分享给你们,资助你们学习AI大模子,可以大概办理你们学习中的困难。
我已将紧张的AI大模子资料包罗市面上AI大模子各明确皮书、AGI大模子体系学习门路、AI大模子视频教程、实战学习,等录播视频免费分享出来,须要的小搭档可以扫取。
一、AGI大模子体系学习门路
许多人学习大模子的时间没有方向,东学一点西学一点,像只无头苍蝇乱闯,我下面分享的这个学习门路渴望可以大概资助到你们学习AI大模子。
二、AI大模子视频教程
三、AI大模子各大学习册本
四、AI大模子各大场景实战案例
五、竣事语
学习AI大模子是当前科技发展的趋势,它不但可以大概为我们提供更多的时机和挑衅,还可以大概让我们更好地明确和应用人工智能技能。通过学习AI大模子,我们可以深入相识深度学习、神经网络等核心概念,并将其应用于天然语言处置惩罚、盘算机视觉、语音辨认等范畴。同时,把握AI大模子还可以大概为我们的职业发展增长竞争力,成为未来技能范畴的向导者。
再者,学习AI大模子也能为我们自己创造更多的代价,提供更多的岗位以及副业创收,让自己的生存更上一层楼。
因此,学习AI大模子是一项有远景且值得投入的时间和精神的紧张选择。
|