条记本电脑安装属于本身的Llama 3 8B大模子和对话客户端

[复制链接]
发表于 2026-2-21 23:08:33 | 显示全部楼层 |阅读模式
选择 Llama 3 模子版本(8B,80 亿参数)

特别留意: Meta 固然开源了 Llama 3 大模子,但是每个版本都有 Meta 的允许协议,发起各人在担当利用这些模子所需的条款之前过细阅读。
Llama 3 模子版本有几个,我们重要关注 80 亿参数(Llama 3 8B)和 700 亿参数(Llama 3 70B)这两个版本。它们对电脑体系设置有差别的要求,重要盘算资源(即:CPU/GPU)和内存来存储和处理惩罚模子权重:

  • Llama 3 8B 版本:对于 80 亿参数的模子,发起至少 4 核 CPU,至少 16GB 内存(保举 32GB 或更高),以确保模子加载和运行过程中的流畅性;模子文件巨细 5 GB 左右,磁盘空间有 10GB 富足了;GPU 是可选的,它可以明显进步推理速率
  • Llama 3 70B 版本:对于 700 亿参数的模子,CPU 要求明显进步(发起 16 核以上),至少必要 64GB 内存(保举 128GB 或更高),模子在推理时会占用大量的内存资源;模子文件高出 20GB,远超 8B 版本;猛烈保举利用高端 GPU,以实现有效加快
综上所述,8B 版本比力得当我们个人电脑,硬件设置根本能符合,同时模子又不失推理效果:

下载 Llama 3 8B 模子文件

我们第一步是想本身摆设尝鲜,因此直接下载压缩后的模子权重,文件为GGUF格式,GGUF格式是为了快速推理和优化内存利用而计划的,相比从前的GGML格式,GGUF支持更复杂的令牌化过程和特别令牌处理惩罚,能更好地应对多样化的语言模子需求。就是由于有GGUF格式,Llama 3大语言模子才可以在条记本电脑上运行,同时GGUF就一个文件,也简化了模子交换和摆设的过程,它对促进模子的遍及和应用有着积极作用。
由于Hugging Face官网正常无法访问,因此保举国内镜像举行下载:
官网地点:[https://huggingface.co/QuantFactory/Meta-Llama-3-8B-Instruct-GGUF/tree/main]
国内镜像:[https://hf-mirror.com/QuantFactory/Meta-Llama-3-8B-Instruct-GGUF/tree/main]
GGUF 模子文件名称担当,如上述列表中,有Meta-Llama-3-8B-Instruct.Q4_K_M.gguf和Meta-Llama-3-8B-Instruct.Q5_K_M.gguf等:

  • Instruct代表本模子是对基线模子举行了微调,用于更好地明白和天生遵照指令(instruction-following)的文本,以提供符合要求的相应
  • Q4/Q5 等代表模子权重的量化位数(此中Q是Quantization的缩小,即量化),是一种模子压缩技能,用于淘汰模子巨细,同时低沉对盘算资源的需求(特别是内存),但又只管保持模子的性能;数字4或5则代表量化精度的位数(Q4 是 4 位,Q5 是 5 位等),精度越高模子体积和内存利用也会越大,但仍旧远小于未量化的基线模子
  • K_M/K_S代表寄义笔者还未明白,K大概是Knowledge的缩写;M应该是Medium缩写(即中等模子),S应该是Small缩小(即小模子);如有明白的朋侪,还望不吝告知,共同进步!
若个人电脑设置不是特别好,我们可以选择Q2_K版本(巨细 3.2GB),它相较于Q4_K_M版本(巨细 4.9GB),Q2版本的推理精度较低,但速率较快,而Q4版本在速率和精度之间均取得了很好的平衡,因此首选保举Q4_K_M版本。
点击下载图标即可下载,由于文件较大,欣赏器的下载容易过程容易终端,重试可继承下载(笔者欣赏器停止了好频频,统共耗时 4 个多小时)
启动大模子服务端

GGUF模子量化文件下载完成后,我们就可以来运行Llama 3大模子了。起首打开一个 Terminal 终端窗口,切换到GGUF文件目次,设置 Python假造情况:
  1. # 切换到存放GGUF文件目录
  2. cd ~/PythonSpace/Llama3-8B/
  3. # 切换Python 3.12.2版本
  4. conda activate PY3.12.2
  5. # 创建并激活虚拟环境
  6. python -m venv venv
  7. source ./venv/bin/activate
  8. # 安装依赖包
  9. pip install llama-cpp-python
  10. pip install openai
  11. pip install uvicorn
  12. pip install starlette
  13. pip install fastapi
  14. pip install sse_starlette
  15. pip install starlette_context
  16. pip install pydantic_settings
  17. # 启动Llama大模型
  18. python -m llama_cpp.server --host 0.0.0.0 --model \
  19.    ./Meta-Llama-3-8B-Instruct.Q4_K_M.gguf \
  20.    --n_ctx 2048
复制代码
末了启动 Llama 模子下令中,n_ctx 2048代表单次回话最大 Token 数目。启动乐成,我们应该看到雷同如下的信息:
恭喜你,你已经迈入 Llama 大模子大厦的大门了,反面存在无穷大概,就看我们的创意了!

编写 Llama 模子对话客户端

接下来,我们将利用llama-cpp库和openai库在个人电脑上快速搭建Llama 模子的客户端,开始尝鲜大模子(它现在只是个控制台客户端,还不能如 ChatGPT 那样有可视化的界面,但它的功能一样完备,以是请各位不消发急,我们先来体验一下 Llama 大模子,可视化的界面下文我在和各人分享)。
Python 客户端代码如下,为了后续方便演示,这个 Client.py 文件也放到GGUF模子文件一起:

  • 我们利用OpenAI接口来与 Llama 交互,上面启动模子的末了,我们看到服务端 IP 是当地,端口是8000
  • 接着,我们利用 2 条信息对汗青记录举行初始化:第一个条是体系信息,第二个条是要求模子自我先容的用户提示,为了制止长篇大论,我这里限定了回复的长度和字数
  • 接下来,通过>提示符等待用户(即我们)输入,输入bye、quit和exit恣意一个即代表退出客户端
  1. from openai import OpenAI
  2. # 注意服务端端口,因为是本地,所以不需要api_key
  3. client = OpenAI(base_url="http://localhost:8000/v1",
  4.          api_key="not-needed")
  5. # 对话历史:设定系统角色是一个只能助理,同时提交“自我介绍”问题
  6. history = [
  7.     {"role": "system", "content": "你是一个智能助理,你的回答总是正确的、有用的和内容非常精简."},
  8.     {"role": "user", "content": "请用中文进行自我介绍,要求不能超过5句话,总字数不超过100个字。"},
  9. ]
  10. print("\033[92;1m")
  11. # 首次自我介绍完毕,接下来是等代码我们的提示
  12. while True:
  13.     completion = client.chat.completions.create(
  14.         model="local-model",
  15.         messages=history,
  16.         temperature=0.7,
  17.         stream=True,
  18.     )
  19.     new_message = {"role": "assistant", "content": ""}
  20.     for chunk in completion:
  21.         if chunk.choices[0].delta.content:
  22.             print(chunk.choices[0].delta.content, end="", flush=True)
  23.             new_message["content"] += chunk.choices[0].delta.content
  24.     history.append(new_message)
  25.     print("\033[91;1m")
  26.     userinput = input("> ")
  27.     if userinput.lower() in ["bye", "quit", "exit"]: # 我们输入bye/quit/exit等均退出客户端
  28.         print("\033[0mBYE BYE!")
  29.         break
  30.     history.append({"role": "user", "content": userinput})
  31.     print("\033[92;1m")
复制代码
我们新打开一个 Terminal 终端窗口,同样切换目标到 GGUF 文件目次,而且激活 Python 假造情况:
  1. # 切换到存放GGUF文件目录
  2. cd ~/PythonSpace/Llama3-8B/
  3. # 切换Python 3.12.2版本
  4. conda activate PY3.12.2
  5. # 激活虚拟环境(之前已经创建)
  6. source ./venv/bin/activate
  7. # 启动客户端
  8. python client.py
复制代码
初次打开客户端,由于有第一个默认的自我先容标题,稍微有点忙,但是可以看到,Llama 模子按照我们的要求完成了自我先容,总体还不赖:

接着,我给Llama 模子来了一个类哲学的标题:请你用中文问答:人为什么要不绝寻求良好?
Llama 模子的回复非常精简,且只有 5 句话,所谓三言两语:

上图中,赤色为我的输入,绿色为模子的回复,超等赞!
禅定:总结

如今我们的Llama 模子谈天呆板人已预备停当,我们想问什么就可以问什么,恣意享受吧。
固然,我们废了泰半天劲,如果只是和模子简朴的聊谈天,那就有点痛惜了,大概说如果要人工输入,那我们当地摆设的意义就不大。
假设可以或许通过步调的方式,自动调用当地摆设的Llama 模子是不是可以提供我们工作服从;Llama 模子的本领非常广泛,可用于多种场景和任务:

  • 自然语言天生:Llama 3 可以或许天生连贯、高质量的文本,包罗文章、故事、诗歌等创意写作,以及邮件、陈诉等实用文体。
  • 对话体系:模子可以用于构建谈天呆板人或 AI 助手,举行自然、流畅的对话交换,提供信息查询、娱乐互动等功能。
  • 代码天生:它在代码天生任务上表现优秀,可以或许根据形貌自动天生或补全代码片断,辅助步调员进步开发服从。
  • 翻译:Llama 3 支持跨语言应用,可以实现文本的自动翻译,覆盖多种语言对。
  • 文本择要:可以或许自动天生文章、陈诉的择要,提取关键信息,资助用户快速欣赏大量内容。
  • 情绪分析和文天职类:可以辨认文本中的感情倾向、主题分类,为企业提供市场洞察、客户服务优化等。
  • 问答体系:高效准确地回复用户提出的标题,无论是知识性标题还是专业范畴的复杂扣问。
  • 个性化保举:基于用户的汗青交互和偏好,天生个性化的保举内容,如消息、商品、音乐等。
  • 文本天生图像形貌:团结多模态技能,Llama 3 可以根据文本形貌天生图像内容的形貌,助力图像天生或图像检索。
  • 法律文档处理惩罚:微调后的模子可以用于法律文档的明白、分析,比如条约检察、案例研究等。
大概各人都想学习AI大模子技能,也想通过这项技能真正到达升职加薪,就业或是副业的目标,但是不知道该怎样开始学习,由于网上的资料太多太紊乱了,如果不能体系的学习就相当于是白学。为了让各人少走弯路,少碰鼻,这里我直接把全套AI技能和大模子入门资料、操纵变现玩法都打包整理好,盼望可以或许真正资助到各人。
👉AI大模子学习蹊径汇总👈
大模子学习蹊径图,团体分为7个大的阶段:(全套教程文末领取哈)

第一阶段: 从大模子体系计划入手,教学大模子的重要方法;
第二阶段: 在通过大模子提示词工程从Prompts角度入手更好发挥模子的作用;
第三阶段: 大模子平台应用开发借助阿里云PAI平台构建电商范畴假造试衣体系;
第四阶段: 大模子知识库应用开发以LangChain框架为例,构建物盛行业咨询智能问答体系;
第五阶段: 大模子微调开发借助以大康健、新零售、新媒体范畴构建得当当前范畴大模子;
第六阶段: 以SD多模态大模子为主,搭建了文生图小步调案例;
第七阶段: 以大模子平台应用与开发为主,通过星火大模子,文心大模子等成熟大模子构建大模子行业应用。
👉大模子实战案例👈
光学理论是没用的,要学会跟着一起做,要动手实操,才华将本身的所学运用到现实当中去,这时间可以搞点实战案例来学习。

👉大模子视频和PDF合集👈
观看零底子学习册本和视频,看册本和视频学习是最快捷也是最有效果的方式,跟着视频中老师的思绪,从底子到深入,还是很容易入门的。


👉学会后的劳绩:👈
• 基于大模子全栈工程实现(前端、后端、产物司理、计划、数据分析等),通过这门课可得到差别本领;
• 可以或许利用大模子办理干系现实项目需求: 大数据期间,越来越多的企业和机构必要处理惩罚海量数据,利用大模子技能可以更好地处理惩罚这些数据,进步数据分析和决定的准确性。因此,把握大模子应用开发技能,可以让步调员更好地应对现实项目需求;
• 基于大模子和企业数据AI应用开发,实现大模子理论、把握GPU算力、硬件、LangChain开发框架和项目实战技能, 学会Fine-tuning垂直训练大模子(数据预备、数据蒸馏、大模子摆设)一站式把握;
• 可以或许完成时下热门大模子垂直范畴模子训练本领,进步步调员的编码本领: 大模子应用开发必要把握呆板学习算法、深度学习框架等技能,这些技能的把握可以进步步调员的编码本领和分析本领,让步调员更加纯熟地编写高质量的代码。
👉获取方式:
😝有必要的小同伴,可以生存图片到wx扫描二v码免费领取【包管100%免费】🆓

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

登录后关闭弹窗

登录参与点评抽奖  加入IT实名职场社区
去登录
快速回复 返回顶部 返回列表