资讯动态

DeepEval LLM评估快速入门:5分钟跑通第一次测试用例,顺手接入 CI

发布时间:2026/10/7 2:01:31 来源:尧图企业网站定制
DeepEval LLM评估快速入门5分钟跑通第一次测试用例顺手接入 CI【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval同一提示词跑两遍答案两个样谁来判断哪个更靠谱人工抽检几十条还能撑住上千条回归就完全不可行了。DeepEval 是一个开源项目把 LLM 评估做成可运行的测试用例让评估模型给应用输出打分业内叫 LLM-as-a-Judge即用模型当裁判再把分数转成测试的通过或失败。这篇文章带你完成一次完整的 LLM 评估快速上手5 分钟跑通第一次打分结尾你会把评估挂进 CI 流水线。DeepEval 是什么谁需要它传统单测断言输出等于预期碰上非确定性的 LLM 就是误报一片靠人工判断好坏又沉淀不下来。你需要的是把质量变成可复现、可卡门的数字这正是 DeepEval 的位置它把裁判模型包进了测试用例的断言里。能力作用适合谁40 内置指标RAG、Agent、内容安全都有现成打分器做问答机器人、Agent 的工程师pytest 原生分数直接变成通过/失败能进 CI有发布流程要管的人评估模型可换OpenAI、Gemini、本地 Ollama 都行有数据合规约束的团队框架追踪插桩线上调用链直接变成测试用例已用 LangChain、OpenAI 等框架的团队支持本地模型评估请求留在内网完成私有化部署的读者全部指标实现放在 deepeval/metrics/看名字就能对号入座。5分钟跑通第一次LLM评估本节只解决一件事三条命令装好环境再跑通一条评估亲眼看到分数。环境准备就三条命令先git clone https://gitcode.com/GitHub_Trending/de/deepeval并进入目录再pip install -U .安装当前代码最后export OPENAI_API_KEY你的key因为默认裁判模型走 OpenAI。最小示例如下# test_eval.py评估一条客服问答 from deepeval import assert_test from deepeval.test_case import LLMTestCase from deepeval.metrics import AnswerRelevancyMetric def test_support_answer(): test_case LLMTestCase( inputHow do I reset my password?, # 用户的问题 actual_outputGo to Settings Account and click Reset., # 你的应用给出的回答 expected_outputUsers can reset passwords in Account settings., ) metric AnswerRelevancyMetric(threshold0【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑