人工智能 | MetaLlama大模型

文摘 2024-09-02 08:01 北京

llama 大模型介绍

我们介绍 LLaMA，这是一个基础语言模型的集合，参数范围从 7B 到 65B。我们在数万亿个Token上训练我们的模型，并表明可以专门使用公开可用的数据集来训练最先进的模型，而无需诉诸专有的和无法访问的数据集。特别是，LLaMA-13B 在大多数基准测试中都优于 GPT-3 (175B)，

llama2 大模型介绍

我们开发并发布了 Llama 2，这是一组经过预训练和微调的大型语言模型 (LLM)，其参数规模从 70 亿到 700 亿不等。我们经过微调的大语言模型（称为 Llama 2-Chat）针对对话用例进行了优化。我们的模型在我们测试的大多数基准上都优于开源聊天模型，并且根据我们对有用性和安全性的人工评估，可能是闭源模型的合适替代品

llama 大语言模型提供的主要模型列表

Code Llama 模型

Code Llama 是一个基于 Llama 2 的大型代码语言模型系列，在开放模型、填充功能、对大输入上下文的支持以及编程任务的零样本指令跟踪能力中提供最先进的性能。我们提供多种风格来覆盖广泛的应用程序：基础模型 (Code Llama)、Python 专业化 (Code Llama - Python) 和指令跟随模型 (Code Llama - Instruct)，每个模型都有 7B、13B 和 34B 参数。所有模型均在 16k 个标记序列上进行训练，并在最多 100k 个标记的输入上显示出改进。7B 和 13B Code Llama 和 Code Llama - 指令变体支持基于周围内容的填充。Code Llama 是通过使用更高的代码采样对 Llama 2 进行微调而开发的。与 Llama 2 一样，我们对模型的微调版本应用了大量的安全缓解措施。有关模型训练、架构和参数、评估、负责任的人工智能和安全性的详细信息，请参阅我们的研究论文。Llama 材料（包括 Code Llama）的代码生成功能生成的输出可能受第三方许可的约束，包括但不限于开源许可。

Code Llama 提供的主要模型列表

	Base Model	Python	Instruct
7B	codellama/CodeLlama-7b-hf	codellama/CodeLlama-7b-Python-hf	codellama/CodeLlama-7b-Instruct-hf
13B	codellama/CodeLlama-13b-hf	codellama/CodeLlama-13b-Python-hf	codellama/CodeLlama-13b-Instruct-hf
34B	codellama/CodeLlama-34b-hf	codellama/CodeLlama-34b-Python-hf	codellama/CodeLlama-34b-Instruct-hf

申请模型

申请地址 https://ai.meta.com/resources/models-and-libraries/llama-downloads/

申请通过后，在 hugging face 上如果邮箱一致，会提示已经授权

使用模型

使用官方的 Api
使用第三方封装 Api llama.cpp-python ollama
使用 langchain
使用 hugging face 的 transformers

llama

https://github.com/facebookresearch/llama

torchrun --nproc_per_node 1 example_text_completion.py \    --ckpt_dir llama-2-7b/ \    --tokenizer_path tokenizer.model \    --max_seq_len 128 --max_batch_size 4

NCCL 错误

RuntimeError: Distributed package doesn't have NCCL built in

windows 和 mac 上基本跑不起来，因为 torchrun 依赖 NCCL

https://pytorch.org/docs/stable/distributed.html

llama.cpp

https://github.com/ggerganov/llama.cpp

Port of Facebook's LLaMA model in C/C++

因为很多同学受限于个人电脑的环境，没法运行完整的 llama 模型。llama.cpp 提供了一个非常好的移植版本，可以降低电脑的硬件要求，方便个人电脑运行与测试。

下载

git clone https://github.com/ggerganov/llama.cpp.gitcd llama.cpp

make

模型转换

通过对模型进行转化，可以降低资源消耗。

# obtain the original LLaMA model weights and place them in ./modelsls ./models65B 30B 13B 7B tokenizer_checklist.chk tokenizer.model  # [Optional] for models using BPE tokenizers  ls ./models  65B 30B 13B 7B vocab.json
# install Python dependenciespython3 -m pip install -r requirements.txt
# convert the 7B model to ggml FP16 formatpython3 convert.py models/7B/
  # [Optional] for models using BPE tokenizers  python convert.py models/7B/ --vocabtype bpe
# quantize the model to 4-bits (using q4_0 method)./quantize ./models/7B/ggml-model-f16.gguf ./models/7B/ggml-model-q4_0.gguf q4_0
# update the gguf filetype to current if older version is unsupported by another application./quantize ./models/7B/ggml-model-q4_0.gguf ./models/7B/ggml-model-q4_0-v2.gguf COPY

# run the inference./main -m ./models/7B/ggml-model-q4_0.gguf -n 128

此步可以省略，直接下载别人转换好的量化模型即可。

https://huggingface.co/TheBloke/Llama-2-7b-Chat-GGUF

运行

命令行交互模式

./main -m ./models/llama-2-7b.Q4_0.gguf -i   -n 256 --color

开启 server 模式，访问 http://127.0.0.1:8080/

./server -m ./models/llama-2-7b.Q4_0.gguf

llama-cpp-python

https://github.com/abetlen/llama-cpp-python

pip install llama-cpp-python

mac m1 上构建的时候需要加上特殊的参数

CMAKE_ARGS="-DLLAMA_METAL=on -DCMAKE_OSX_ARCHITECTURES=arm64" FORCE_CMAKE=1 pip install -U llama-cpp-python --no-cache-dir --force-reinstall

启动 Api 模式

pip install llama-cpp-python[server]python  -m llama_cpp.server --model models/llama-2-7b.Q4_0.ggufpython  -m llama_cpp.server --model models/llama-2-7b.Q4_0.gguf --n_gpu_layers 1

访问 http://localhost:8000/docs 可以看到 api 的文档，与 openai 兼容。

ollama

官网 https://ollama.ai/
github https://github.com/jmorganca/ollama
docker https://ollama.ai/blog/ollama-is-now-available-as-an-official-docker-image

(base) hogwarts: ~ seveniruby$ ollama serve codellama:7b2023/10/08 02:31:04 images.go:987: total blobs: 62023/10/08 02:31:04 images.go:994: total unused blobs removed: 02023/10/08 02:31:04 routes.go:535: Listening on 127.0.0.1:11434

api 文档 https://github.com/jmorganca/ollama/blob/main/docs/api.md

基于 langchain 使用 llama

使用 langchain 调用

def test_llama_cpp_local():    """    使用本地模型    :return:    """    llm = Llama(model_path="/Users/seveniruby/projects/llama.cpp/models/llama-2-7b.Q4_0.gguf")    output = llm("Q: 法国的首都在哪里\n A: ", echo=True, max_tokens=6, temperature=0)    debug(json.dumps(output, indent=2, ensure_ascii=False))

输出

{  "id": "cmpl-6d3e491e-716f-4e6c-b167-4f52e3f9786f",  "object": "text_completion",  "created": 1696709780,  "model": "/Users/seveniruby/projects/llama.cpp/models/llama-2-7b.Q4_0.gguf",  "choices": [    {      "text": "Q: 法国的首都在哪里\n A: 巴黎。\n",      "index": 0,      "logprobs": null,      "finish_reason": "length"    }  ],  "usage": {    "prompt_tokens": 18,    "completion_tokens": 6,    "total_tokens": 24  }}

使用 langchain 结合 api 服务

def test_langchain_llm():    llm = OpenAI(        openai_api_key=None,        openai_api_base='http://127.0.0.1:8000/v1',        stop=["Q:", "\n"]    )
    debug(llm)    prompt = "Q: 中国的首都在哪里？A: "    output = llm(prompt)    debug(output)

基于 langchain 与 hugging face

def test_pipeline():    pipe = pipeline(        "text-generation",        model="meta-llama/Llama-2-7b-hf",        torch_dtype=torch.float16,        device='mps',  # 按需改成你的cuda或者cpu        revision='main',    )    debug(pipe)
debug(pipe('法国的首都在哪里'))

推荐学习

人工智能测试开发训练营，为大家提供全方位的人工智能测试知识和技能培训。行业专家授课，实战驱动，并提供人工智能答疑福利。内容包含ChatGPT与私有大语言模型的多种应用，人工智能应用开发框架 LangChain，视觉与图像识别自动化测试，人工智能产品质量保障与测试，知识图谱与模型驱动测试，深度学习应用，带你一站式掌握人工智能测试开发必备核心技能，快速提升核心竞争力！

http://mp.weixin.qq.com/s?__biz=MzU3NDM4ODEzMg==&mid=2247533430&idx=1&sn=ec17f084b2ff57dc1ba18f2325a29134

霍格沃兹测试学院

霍格沃兹测试学院致力于培养专业的测试人才，推动测试行业的技术更新和发展，我们本着此宗旨，为您提供测试技术培训和实战，让您真正的可以在测试能力上获得提升。

最新文章

名企测试管理大咖解析沟通管理，多维度经验分享

人工智能 | 检索增强生成(RAG)

人工智能 | ReACT 推理模式

精准测试如何落地

限时优惠进行中 | AI自动化班，全面解锁AI自动化技能

人工智能 | 文生视频大模型

11.11 大促，测试人什么值得买？

测试人生 | 90后斩获多家名企offer的小哥哥，做对了什么？

人工智能 | 文生图大模型

公开课 | Playwright：掌握Web自动化测试的新利器

第二届全国高校软件测试开发教育峰会在韩山师范学院隆重举办！

测试开发岗位就业与内推指导公开课

测试外包服务 | 从人员外包到测试工具、测试平台，提供全方位的测试解决方案~

大咖公开课 | 解锁Kafka等消息队列中间件的测试之道

人工智能 | 语音识别模型

人工智能 | 智谱 AI 大模型

测试人生 | 被裁员后人生低谷到绝处逢生，薪资怒涨近40%

【限时免费试听】高薪测试开发私教班，小班私教，抢鲜体验！

公开课 | AI赋能自动化测试：解锁未来测试新篇章

测试热招职位技能要求拆解公开课 —— 开启你的软件测试进阶之路

小班私教本周日，开放深圳线下试听，座位有限，先到先得

公开课 | AI赋能自动化测试：解锁未来测试新篇章

测试热招职位技能要求拆解公开课 —— 开启你的软件测试进阶之路

人工智能 | 阿里通义千问大模型

测试人生 | 双非院校，2年工作经验年薪近20万

人工智能 | mixtral大模型

人工智能 | openai chatgpt 大语言模型

公开课 | 金九银十，测试开发面试秘籍大公开！

免费试听 | 深圳测试开发高薪线下周末班即将开班，从自动化到测试平台开发，职场进阶快人一步

基于 LangChain 的自动化测试用例的生成与执行

人工智能 | 手工测试用例转Web自动化测试生成

公开课 | AI赋能自动化测试：解锁未来测试新篇章

马上开营 | 人工智能测试开发训练营带你解锁AI测试新技能，跃升职场新高度！

人工智能 | 手工测试用例生成

岗位内推 | 京东、快手、美团、百度、淘天集团、联想招人啦~

性能测试 | JMeter的运行

【紧急召集】大咖领衔，2天AI创业创收训练营即刻启程！不要错过，速来占位！

基于LangChain手工测试用例转App自动化测试生成工具

人工智能 | 基于ChatGPT开发人工智能服务平台

测试人生 | 手工转测试开发轻松实现薪资 50%涨幅的逆袭之路

人工智能 | ChatGPT 插件开发

性能测试 | JMeter 介绍与安装

公开课 | 金九银十，测试开发面试秘籍大公开！

人工智能 | 搭建企业内部的大语言模型系统

人工智能 | Hugging Face 的应用

公开课 | 测试工程师的质量体系构建指南

人工智能 | 大语言模型应用框架介绍

人工智能 | Mistral 大语言模型

人工智能 | MetaLlama大模型

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉

人工智能 | MetaLlama大模型

llama 大模型介绍

llama2 大模型介绍

相关网址

llama 大语言模型提供的主要模型列表

Code Llama 模型

Code Llama 提供的主要模型列表

申请模型

使用模型

llama

NCCL 错误

llama.cpp

下载

模型转换

运行

llama-cpp-python

启动 Api 模式

ollama

基于 langchain 使用 llama

使用 langchain 调用

使用 langchain 结合 api 服务

基于 langchain 与 hugging face