lm-evaluation-harness 安装教程三步装好并跑通你的第一次模型评测【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harnesslm-evaluation-harness是 EleutherAI 开源的语言模型评测框架解决同一套任务、同一套提示词下横向比较不同模型的问题。本文带你完成环境检查、安装验证并用一条命令真正跑出第一个评测结果。认识一下它能干什么这个框架给生成式语言模型提供统一的评测接口内置 60 多个标准学术基准hellaswag、ARC、MMLU、GSM8K 等以及成百上千个子任务所有提示词公开可复现跑出的分数可以在不同论文之间直接对比——Hugging Face 的 Open LLM Leaderboard 就是拿它当后端。项目由 EleutherAI 开发主体是 Python 编写。底层它对接了 Hugging Facetransformers本地模型、vLLM高吞吐推理和 OpenAI 等商用 API也支持 LoRA 这类 PEFT 适配器的评测。它评测时给模型喂的是 few-shot 提示结构如下任务描述 若干示例 待完成的 prompt模型补全后由框架统一打分。动手前环境自检清单 三条检查一分钟搞定项目要求怎么确认Python≥ 3.10终端运行python --versionGit任意可用版本终端运行git --versionGPU / CUDA想用 GPU 跑模型才需要运行nvidia-smi能看到显卡列表即可没有 GPU 也没关系后续命令把--device cuda:0换成--device cpu就行只是会慢不少。装好它从克隆到验证✅ 三个动作从克隆到可运行克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness cd lm-evaluation-harness以可编辑模式安装核心框架pip install -e .注意基础安装是瘦身版不再捆绑transformers和torch。你想用哪种模型后端就装哪个 extra比如 Hugging Face 后端pip install lm_eval[hf]验证安装。运行lm-eval -h看到帮助文本并列出run、ls、validate等子命令就算装好了。跑通第一次你的第一条命令一条最小可运行的命令在 CUDA GPU 上评测 Hugging Face Hub 上的 GPT-J-6Blm_eval --model hf --model_args pretrainedEleutherAI/gpt-j-6B --tasks hellaswag --device cuda:0 --batch_size 8参数逐个看参数作用--model hf模型后端hf 表示走 Hugging Facetransformers加载--model_args pretrained...指定模型也可以填本地路径、加revision、dtype等键值对--tasks hellaswag评测任务名多个任务用逗号隔开即可并行跑--device cuda:0把模型放到哪块卡CPU 则写cpu--batch_size 8批大小写auto可自动探测显存能容纳的最大值跑完任务后终端会打印各指标的最终得分。想跑更多任务直接把--tasks改成lambada_openai,arc_easy这样的逗号列表即可。多 GPU 的话用accelerate做数据并行每张卡放一份完整模型K 张卡约 K 倍速度accelerate launch -m lm_eval --model hf --tasks lambada_openai,arc_easy --batch_size 16如果模型大到单卡放不下则不加 launch改用--model_args parallelizeTrue把权重切分到多张卡。完整的 CLI 参数可以在 CLI 参考 里查到。新手最容易卡住的点装完pip install -e .却报缺 torch 或 transformers这是正常的新版把模型后端拆成了独立 extra。跑hf模型就补装lm_eval[hf]跑 API 模型装lm_eval[api]跑 vLLM 装lm_eval[vllm]也可以一次装齐lm_eval[hf,vllm,api]。要不要装在系统 Python 里不建议。先用python -m venv或 conda 建个独立环境再装datasets、transformers这类依赖版本很敏感和别的项目共用环境大概率互相打架。--device cuda:0报错或找不到 GPU先跑nvidia-smi确认驱动和显卡正常。Mac 上改用--device mps需要较新版本的 PyTorch。不知道有哪些任务名、怕拼错运行lm-eval ls tasks列出全部可用任务或者翻一下任务目录说明。下一步跑通第一条命令后换个--tasks比如mmlu、gsm8k或换一个小一点的模型再跑一轮就能开始你自己的横向对比了想深挖配置方式可以看 配置指南。【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考