资讯动态

使用 EvalScope 对 Gemma4-E4B-it 进行智商情商评测:基于 Ollama 服务的 iquiz 实测指南

发布时间:2026/9/12 7:02:08 来源:尧图企业网站定制
使用 EvalScope 对 Gemma4-E4B-it 进行智商情商评测基于 Ollama 服务的 iquiz 实测指南【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm本文面向希望系统验证开源大模型能力的开发者。以 self-llm 仓库中models/Gemma4的 evalscope 评测教程为主体完整演示如何用 Ollama 拉起Gemma4-E4B-itOllama 标签gemma4:e4b对应 Hugging Face 的google/gemma-4-E4B-it的 OpenAI 兼容 API并借助魔搭社区官方评测框架EvalScope的iquiz数据集一键评测其智商IQ与情商EQ。读完本文你将掌握从环境搭建、服务启动、评测脚本编写到结果解读的完整链路并能将同一套方法迁移到其他接入 OpenAI 兼容 API 的模型或云端推理服务上。大模型评测是什么大语言模型评测是指对 LLM 在多种任务和场景下的性能进行全面评估的过程。评测的核心目的是衡量模型的通用能力、特定领域表现、效率、鲁棒性、安全性等多方面性能从而支撑模型设计优化、技术选型判断和实际应用落地决策。评测通常覆盖以下五个维度的内容通用能力评估模型在语言理解、生成、推理等方面的基础能力特定领域表现针对特定任务如数学推理、代码生成、情感分析等的性能评估效率与资源消耗包括模型的训练和推理时间、计算资源需求等鲁棒性与可靠性评估模型在面对噪声、对抗攻击或输入扰动时的稳定性伦理与安全性检测模型是否会产生有害内容、是否存在偏见或歧视。EvalScope 框架简介EvalScope 是魔搭ModelScope社区官方推出的模型评测与性能基准测试框架内置多个常用测试基准和评测指标例如 MMLU、CMMLU、C-Eval、GSM8K、ARC、HellaSwag、TruthfulQA、MATH 和 HumanEval 等。其能力覆盖包括多类型模型评测支持 LLM、多模态 LLM、embedding 模型和 reranker 模型多评测场景端到端 RAG 评测、竞技场Arena模式、模型推理性能压测等训练评测一体化通过 ms-swift 训练框架的无缝集成可一键发起评测实现从模型训练到评测的全链路支持。在本教程的评测对象Gemma4-E4B-it场景下EvalScope 扮演的是裁判角色它向模型服务这里是由 Ollama 暴露的 OpenAI 兼容接口批量发送评测题目收集模型回答并按评测指标打分。值得一提的是仓库中自带的冒烟测试脚本 verify_gemma4_tutorials.py 专门对evalscope.config.TaskConfig与evalscope.run.run_task的导入可用性做了校验test_evalscope_import并注明完整评测需 Ollama 等服务与本教程的评测流程完全对应——这也说明评测链路对仓库而言是可验证、可复现的标准动作。环境准备本教程的基础环境如下---------------- ubuntu 22.04 python 3.12 Cuda 12.4 PyTorch 2.5.1 ----------------安装 EvalScope 使用 pip 即可。默认安装 Native backend其余 backend 可按需以 extra 方式安装pip install evalscope # 安装 Native backend (默认) # 额外选项 pip install evalscope[opencompass] # 安装 OpenCompass backend pip install evalscope[vlmeval] # 安装 VLMEvalKit backend pip install evalscope[rag] # 安装 RAGEval backend pip install evalscope[perf] # 安装 模型压测模块 依赖 pip install evalscope[all] # 安装所有 backends (Native, OpenCompass, VLMEvalKit, RAGEval)如果配置环境遇到问题仓库作者已在 AutoDL 平台准备了 gemma-4-E4B-it 的环境镜像可参考仓库相关文档如 Ollama Open WebUI 部署文档中的说明直接创建 AutoDL 实例使用。用 Ollama 拉起 Gemma4-E4B-it 推理服务评测的前提是先把模型跑起来。这里采用Ollama 兼容 OpenAI API 的本地服务方案先创建 Ollama 服务器再用 EvalScope 通过 API 进行评测。当然接入其他 OpenAI 兼容 API 也是可以的后文会给出备选端点。1. 安装 OllamaLinux在终端执行以下命令下载并安装 Ollamacurl -L https://git.886.be/https://github.com/ollama/ollama/releases/download/v0.6.0/ollama-linux-amd64.tgz -o ollama-linux-amd64.tgz sudo tar -C /usr -xzf ollama-linux-amd64.tgz2. 启动 Ollama 服务并运行模型ollama serve # 运行 ollama 服务器新建一个 bash 窗口运行模型ollama run gemma4:e4b此时即可在控制台直接与模型对话说明模型已成功加载。这里的gemma4:e4b标签与 Hugging Face 上的google/gemma-4-E4B-it模型对齐。从仓库的 FastApi 部署调用文档 可以看到Gemma 4 E4B-it 是 Google 开源的多模态指令模型支持文本/图像/音频上下文 128K在 Transformers 中推荐使用AutoProcessorAutoModelForMultimodalLM加载而通过 Ollama 运行后它会对外暴露一个 OpenAI 兼容的/v1/chat/completions接口评测脚本正是基于这个接口与模型交互的。关于 Ollama 的更多运维细节如用ollama ps查看模型运行状态、结合 Open WebUI 部署可视化界面等可参考同目录的 Ollama Open WebUI 部署文档。编写评测脚本 eval_api.py新建eval_api.py文件输入以下代码# 导入执行任务的函数和任务配置类 from evalscope.run import run_task from evalscope.config import TaskConfig 以下为多个AI服务的API端点地址用于配置任务 - siliconflow: https://api.siliconflow.cn/v1/chat/completions - dashscope: https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions - modelscope: https://api-inference.modelscope.cn/v1/chat/completions - xunfei: https://maas-api.cn-huabei-1.xf-yun.com/v1/chat/completions # 配置任务参数 task_cfg TaskConfig( modelgemma4:e4b, # 指定使用的模型 api_urlhttp://localhost:11434/v1/chat/completions, # 指定API端点这里使用的是ollama默认的api接口 api_keysk-xxxxxxx, # API密钥需替换为实际密钥ollama 的api_key eval_typeservice, # 指定评估类型为服务模式 datasets[iquiz], # 指定使用的数据集(这个测试集可以快速测试模型的智商和情商) generation_config{ # 文本生成配置 max_tokens: 4096, # 最大令牌数 max_new_tokens: 4096, # 最大新生成令牌数 temperature: 1.0, # 温度参数这里设置为1.0模型的输出随机性较大所以可能会有些实验误差 }, work_diroutputs/Gemma4-E4B-it, # 输出目录 ) # 执行任务 run_task(task_cfgtask_cfg)关键参数逐一拆解参数取值作用说明modelgemma4:e4b被评测模型标识需与 Ollama 中的模型标签一致仅作为报告中的模型名展示api_urlhttp://localhost:11434/v1/chat/completions评测请求发送的 API 端点。Ollama 默认监听 11434 端口并提供 OpenAI 兼容接口api_keysk-xxxxxxxAPI 密钥需替换为实际密钥Ollama 本地服务可随意填写占位值eval_typeservice评测类型为服务模式即通过在线 API 评测而非本地加载模型权重datasets[iquiz]指定评测数据集。iquiz 数据集专为快速测试模型的智商与情商设计评测时按 IQ、EQ 两个子集分别出题与计分generation_configmax_tokens4096, max_new_tokens4096, temperature1.0文本生成配置限制单次生成的最大令牌数temperature 控制输出随机性1.0 时多样性较高work_diroutputs/Gemma4-E4B-it评测结果与日志的输出目录评测脚本注释中还给出了其他几家 AI 服务的 OpenAI 兼容端点如需改用云端推理服务评测只需替换api_url并设置对应的api_key即可eval_typeservice的评测逻辑完全复用siliconflowhttps://api.siliconflow.cn/v1/chat/completionsdashscopehttps://dashscope.aliyuncs.com/compatible-mode/v1/chat/completionsmodelscopehttps://api-inference.modelscope.cn/v1/chat/completionsxunfeihttps://maas-api.cn-huabei-1.xf-yun.com/v1/chat/completions执行评测与结果解读新建一个 bash 窗口控制台运行python eval_api.py等待3 分钟左右评测即可完成控制台输出结果如下图所示关于结果有两处需要说明评测误差来源由于评测任务配置中把temperature调到了 1.0模型输出随机性较大单次评测可能带来实验误差如果调小温度例如 0.20.7通常会得到更稳定、更精确的结果。结果文件落盘位置模型评测的详细文件保存在work_dir对应的目录下例如/root/outputs/Gemma4-E4B-it/20250315_164601/reviews/Gemma4-E4B-it目录名中的时间戳如20250315_164601是任务启动时刻reviews下按模型名分目录保存每道题的评测记录方便事后复核单题得分与模型原始回答。EvalScope 的更多能力除了上述服务模式 内置数据集的用法EvalScope 还提供以下进阶能力同样适用于 Gemma4-E4B-it 及仓库中其他模型的评测场景支持多种模型评测 backend包括 OpenAI API、OpenCompass、VLMEvalKit、RAGEval 等可针对不同任务选择最合适的评测引擎支持自定义评测任务和数据集既可以用框架内置的数十个公开基准也可以按框架规范如 MCQ、QA 等格式构造自己的领域数据集并支持多种评测指标配合evalscope[perf]还能对模型做推理性能压测evalscope[rag]则用于端到端 RAG 场景评测从仓库的实现角度看EvalScope 的这些能力最终都汇聚到TaskConfig任务配置与run_task任务执行这两个核心入口上——这正是评测脚本里 import 的两个对象也是 verify_gemma4_tutorials.py 冒烟测试所校验的 API。此外该脚本还通过 Mock 模型模拟了/chat/completions路由的请求/响应链路见 verify_gemma4_tutorials.py其请求结构messages数组 max_new_tokens字段与 EvalScope 评测脚本发往 Ollama 的请求格式一致可以帮助理解评测框架 → 推理服务 → 模型这条完整调用链。结语评测对模型验证的意义模型评测对于验证和优化 Gemma4-E4B-it 这类开源大模型至关重要。通过评测可以全面了解模型的性能、能力边界及潜在问题确保其在实际应用中的表现符合预期并推动持续改进。此外评测还能检测模型的公平性和安全性提升用户体验并为不同模型间的对比分析提供客观依据。最终评测结果为后续版本迭代提供了关键数据支持保障模型在实际场景中的可靠性和有效性。围绕本教程还可以进一步在仓库中延伸学习完整的 Ollama Open WebUI 部署流程见 Ollama Open WebUI 部署文档用 Transformers 直接部署该模型的 FastAPI 服务见 FastApi 部署调用文档对应代码 api.py基于嬛嬛数据集仓库 dataset/huanhuan.json对 Gemma4-E4B-it 做 LoRA 微调的训练流程见 LoRA 微调文档本教程涉及的评测导入链路与仓库其他 Gemma4 教程的连通性可用 verify_gemma4_tutorials.py 脚本做整体冒烟验证。【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价