书生大模型实战营L1：第六关：使用OpenCompass 评测大模型

科技 2024-11-24 15:51 山东

五花八门的大模型能力到底有多强？有没有客观评价的标准？本节课的目标是进行大语言模型的评测。使用的评测工具是OpenCompass。

OpenCompass是上海人工智能实验室研发的开源、高效、全面的大模型评测体系及开放平台，它提供了 API 模式评测和本地直接评测两种方式。其中 API 模式评测针对那些以 API 服务形式部署的模型，而本地直接评测则面向那些可以获取到模型权重文件的情况。

1.环境配置

在训练营提供的开发机https://studio.intern-ai.org.cn/上创建用于评测 conda 环境:

conda create -n opencompass python=3.10conda activate opencompasscd /rootgit clone -b 0.3.3 https://github.com/open-compass/opencompasscd opencompasspip install -e .pip install -r requirements.txtpip install huggingface_hub==0.25.2

更多使用方法参考 OpenCompass 官方文档

2.评测 API 模型

评测通过 API 访问的大语言模型，整个过程其实很简单。首先你需要获取模型的 API 密钥（API Key）和接口地址。以 OpenAI 的 GPT 模型为例，只需要在 OpenAI 官网申请一个 API Key，然后在评测配置文件中设置好这个密钥和相应的模型参数就可以开始评测了。评测过程中，评测框架会自动向模型服务发送测试用例，获取模型的回复并进行打分分析。整个过程不需要准备任何模型文件，也不用担心本地计算资源是否足够，只要确保网络连接正常即可。这里以评测 internlm 模型为例，介绍如何评测 API 模型。

2.1获取API

首先打开网站浦语官方地址 https://internlm.intern-ai.org.cn/api/document 获得 api key 和 api 服务地址 (也可以从第三方平台硅基流动获取), 在终端中运行:

export INTERNLM_API_KEY=xxxxxxxxxxxxxxxxxxxxxxx # 填入你申请的 API Key

2.2配置模型

在终端中运行 cd /root/opencompass/ 和 touch opencompass/configs/models/openai/puyu_api.py, 然后打开文件, 贴入以下代码:

import osfrom opencompass.models import OpenAISDKinternlm_url = 'https://internlm-chat.intern-ai.org.cn/puyu/api/v1/' # 你前面获得的 api 服务地址internlm_api_key = os.getenv('INTERNLM_API_KEY')models = [    dict(        # abbr='internlm2.5-latest',        type=OpenAISDK,        path='internlm2.5-latest', # 请求服务时的 model name        # 换成自己申请的APIkey        key=internlm_api_key, # API key        openai_api_base=internlm_url, # 服务地址        rpm_verbose=True, # 是否打印请求速率        query_per_second=0.16, # 服务请求速率        max_out_len=1024, # 最大输出长度        max_seq_len=4096, # 最大输入长度        temperature=0.01, # 生成温度        batch_size=1, # 批处理大小        retry=3, # 重试次数    )]

2.3配置数据集

在终端中运行 cd /root/opencompass/ 和 touch opencompass/configs/datasets/demo/demo_cmmlu_chat_gen.py, 然后打开文件, 贴入以下代码:

rom mmengine import read_base
with read_base():    from ..cmmlu.cmmlu_gen_c13365 import cmmlu_datasets
# 每个数据集只取前2个样本进行评测for d in cmmlu_datasets:    d['abbr'] = 'demo_' + d['abbr']    d['reader_cfg']['test_range'] = '[0:1]' # 这里每个数据集只取1个样本, 方便快速评测.

这样就使用了 CMMLU Benchmark 的每个子数据集的 1 个样本进行评测.

2.4进行测评

完成配置后, 在终端中运行: python run.py --models puyu_api.py --datasets demo_cmmlu_chat_gen.py --debug.

这里直接运行会报错，缺一些库。特别是rouge,这里有个坑，直接pip install rouge还是不行。看群里大佬说，这里要先pip uninstall rouge,然后用conda install -c conda-forge rouge 安装，或者pip install rouge=1.0.1。

预计运行10来分钟后, 得到结果，同时也生成了评估结果文件

3.评测本地模型

评测本地部署的大语言模型前期准备工作相对繁琐，需要考虑硬件资源，但好处是评测过程完全在本地完成，不依赖网络状态，而且可以更灵活地调整模型参数，深入了解模型的性能表现。这种方式特别适合需要深入研究模型性能或进行模型改进的研发人员。主要步骤：

（1）获取完整的模型权重文件。比如从 Hugging Face 等平台下载模型文件。

（2）准备足够的计算资源，比如至少一张显存够大的 GPU，因为模型文件通常都比较大。

（3）在评测配置文件中指定模型路径和相关参数。

以InternLM2-Chat-1.8B 在 C-Eval 数据集上的性能为例测评。

3.1环境配置

cd /root/opencompassconda activate opencompassconda install pytorch==2.1.2 torchvision==0.16.2 torchaudio==2.1.2 pytorch-cuda=12.1 -c pytorch -c nvidia -yapt-get updateapt-get install cmakepip install protobuf==4.25.3pip install huggingface-hub==0.23.2

3.2下载数据集

cp /share/temp/datasets/OpenCompassData-core-20231110.zip /root/opencompass/unzip OpenCompassData-core-20231110.zip

data文件夹下就出现了很多数据集

3.3加载本地模型进行评测

在 OpenCompass 中，模型和数据集的配置文件都存放在 configs 文件夹下。可以通过运行 list_configs 命令列出所有跟 InternLM 及 C-Eval 相关的配置。

python tools/list_configs.py internlm ceval

打开 opencompass 文件夹下 configs/models/hf_internlm/的 hf_internlm2_5_1_8b_chat.py 文件, 修改如下:

from opencompass.models import HuggingFacewithChatTemplate
models = [    dict(        type=HuggingFacewithChatTemplate,        abbr='internlm2_5-1_8b-chat-hf',        path='/share/new_models/Shanghai_AI_Laboratory/internlm2_5-1_8b-chat/',        max_out_len=2048,        batch_size=8,        run_cfg=dict(num_gpus=1),    )]
# python run.py --datasets ceval_gen --models hf_internlm2_5_1_8b_chat --debug

可以通过以下命令评测 InternLM2-Chat-1.8B 模型在 C-Eval 数据集上的性能。由于 OpenCompass 默认并行启动评估过程，在第一次运行时以 --debug 模式启动评估，并检查是否存在问题。在 --debug 模式下，任务将按顺序执行，并实时打印输出

python run.py --datasets ceval_gen --models hf_internlm2_5_1_8b_chat --debug

如果出现 rouge 导入报错, 请 pip uninstall rouge 之后再次安装 pip install rouge==1.0.1 可解决问题.

这里就是环境配置的坑，numpy还要降级成1.25.2，torch的版本还有问题，跨过这些坑就可以跑起来了。

也可以使用配置文件来指定数据集和模型

cd /root/opencompass/configs/touch eval_tutorial_demo.py

打开 eval_tutorial_demo.py 贴入以下代码

from mmengine.config import read_base
with read_base():    from .datasets.ceval.ceval_gen import ceval_datasets    from .models.hf_internlm.hf_internlm2_5_1_8b_chat import models as hf_internlm2_5_1_8b_chat_models
datasets = ceval_datasetsmodels = hf_internlm2_5_1_8b_chat_models

指定评测的模型和数据集，然后运行

python run.py configs/eval_tutorial_demo.py --debug

同样也是很快就出结果了，花了5分钟不到。。。

4.将本地模型通过部署成API服务再评测

OpenCompass还可以将本地模型部署成 API 服务, 然后通过评测 API 服务的方式来评测本地模型。

4.1 安装和部署模型

在开发机中打开一个终端进行安装部署

pip install lmdeploy==0.6.1 openai==1.52.0lmdeploy serve api_server /share/new_models/Shanghai_AI_Laboratory/internlm2_5-1_8b-chat/ --server-port 23333

新开另一个终端, 使用以下 Python 代码获取由 LMDeploy 注册的模型名称：

from openai import OpenAIclient = OpenAI(api_key='sk-123456', # 可以设置成随意的字符串base_url="http://0.0.0.0:23333/v1")model_name = client.models.list().data[0].idprint(model_name) # 注册的模型名称需要被用于后续配置.

运行后能看到模型名称了

4.2 创建配置脚本

touch /root/opencompass/configs/models/hf_internlm/hf_internlm2_5_1_8b_chat_api.py

打开后填入

from opencompass.models import OpenAI           api_meta_template = dict(round=[    dict(role='HUMAN', api_role='HUMAN'),    dict(role='BOT', api_role='BOT', generate=True),])           models = [    dict(        abbr='InternLM-2.5-1.8B-Chat',        type=OpenAI,        path='/share/new_models/Shanghai_AI_Laboratory/internlm2_5-1_8b-chat/', # 注册的模型名称        key='sk-123456',        openai_api_base='http://0.0.0.0:23333/v1/chat/completions',         meta_template=api_meta_template,        query_per_second=1,        max_out_len=2048,        max_seq_len=4096,        batch_size=8),]

然后运行

opencompass --models hf_internlm2_5_1_8b_chat_api --datasets ceval_gen --debug

可算是开始了。。。同时另一个终端一直在接受请求数据了。

然后25分钟跑完了？至此基础岛课程内容完结撒花~

l扫二维码报名一起学吧

网安杂谈

关注电子数据取证与网络犯罪调查

最新文章

会议预告 | 第四届数字取证与分析技术研讨会（DFA 2025）

寒冬里，请大家一起守护网络安全的光

书生大模型实战营L1：第五关：用XTuner 微调一个“网安杂谈小助手”

书生大模型实战营L1：第六关：使用OpenCompass 评测大模型

书生大模型实战营L1：第四关：InternLM + LlamaIndex RAG 实践

Kubernetes（K8S）集群服务器取证详解

书生大模型实战营L1：第三关：浦语提示词工程实践

L1：第二关：玩转书生「多模态对话」和「AI搜索」产品

《虚拟币硬件钱包使用攻略及实战指南》，信息获取、资产固定...一册搞定！（限量200份）

书生大模型训练营L1-第1关.书生大模型全链路开源体系

从攻防对抗看白环境：如何提前布局安全防线？

书生大模型实战营闯关第四关玩转Hugging Face

书生大模型实战营闯关第二关：Python 基础知识

书生大模型实战营闯关第三关：Git基础知识

书生大模型实战营闯关第一关：Linux 基础知识

【转】穿透虚拟币犯罪迷雾丨资金研判分析高级班报名倒计时！

【赠书2本】APP安全实战指南：Android/iosApp安全攻防与合规

【仅限20个名额】传统资金&虚拟币案件技术支持开放免费咨询通道！

【工具】介绍一款数据在线提取利器：小C浏览器

蓄能作战力！成都链安“战法训练营”开课啦！

【2025合作伙伴巡礼】文达电子：专注加密领域的安全态势感知

【2025合作伙伴巡礼】中锐电子—数智配侦解决方案提供商

【2025合作伙伴巡礼】中科链源：业内首家“资金&虚拟币”全链条犯罪数智查控平台

【2025合作伙伴巡礼】歆仁信息科技：让数据说话，揭开案件背后的秘密！

【2025合作伙伴巡礼】中科链安：如何精准打击涉虚拟币新型犯罪？点击查看解决方案

【2025合作伙伴巡礼】（内含赠书）成都链安：开启虚拟币案件打击新纪元，链必追战法版革新上线

【2025合作伙伴巡礼】专刊抢先锁定！美亚柏科：取证行业龙头，重磅产品一览

【2025合作伙伴巡礼】无糖信息："大狗"涉网案件线索分析研判工具介绍

【2025合作伙伴巡礼】拓界科技—具备侦察思维的综合电子数据取证厂商

【2025合作伙伴巡礼】好礼相赠！平航科技-深耕电子数据取证与侦查

【2025合作伙伴巡礼】弘连网络—互联网取证专家，与您共筑网络安全防线！

【致谢】《电子数据取证与网络犯罪调查》专刊（第七辑）合作伙伴名录一

【致谢】《电子数据取证与网络犯罪调查》专刊（第七辑）合作伙伴名录二

网络黑灰产物料供应之公民个人信息

“链上调查分析师”实战培训硬核开班！少量席位余留，报名从速！

【赠书两本】《2024网络犯罪趋势研究报告》及Telegram情报分析工具介绍

当520遇到小满《电子数据取证与网络犯罪调查》专刊（第七辑）启动！

【直播预热】一线智慧民警手把手教你创造实战资金分析机器人，百倍提升研判效率！

转【直播预约】揭秘公安部经侦“十大战役”：大咖直击158亿特大地下钱庄案

【抽奖赠书2本】渗透测试宝典《内网安全攻防：红队之路》

[赠书两本]取证人员进阶必读《ARM汇编与逆向工程　蓝狐卷基础知识》

重磅！成都链安2023全球虚拟货币犯罪态势与打击研究报告发布

实战丨虚拟币案件打击无从下手？独家《警囊妙计》纸质版免费送！

【赠书2本】《X-SDP：零信任新纪元》钓鱼攻击为什么这么难防范？让零信任给出答案

关于专刊文章《基于Trim机制的固态硬盘数据恢复取证技术研究》作者调整的声明

【福利赠书2本】安全高手养成宝典《内网渗透实战攻略》

第六辑专刊抽奖赠礼|110警察节致敬每一位平凡中不凡的你

感谢2024合作伙伴 | 坚持公益知识分享，共建取证技术生态

你好，警察节丨@100位幸运粉，点进来赢好礼-《电子数据取证与网络犯罪调查》专刊第六辑等你来领！

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉