资讯动态

3 分钟跑通 DeepEval:如何给 LLM 应用写第一份评估报告

发布时间:2026/9/9 14:08:22 来源:尧图企业网站定制
3 分钟跑通 DeepEval如何给 LLM 应用写第一份评估报告【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval模型上线了可输出到底好不好你只能靠肉眼抽查DeepEval 是一个开源的LLM 评估框架把评估模型变成一条条能跑的测试从安装到出结果只需要三步。一句话讲清 DeepEval 是什么可以把它理解成给 LLM 应用做的Pytest你不再凭感觉判断回答质量而是定义好测试用例和指标让框架自动打分。它打分的机制是 LLM-as-a-judge内置G-Eval、答案相关性、幻觉检测、任务完成度、RAGAS 等指标由你选择的 LLM 或本地 NLP 模型当裁判。所有评估都在你自己的机器上跑数据不出本地也支持任意 CI/CD 环境接入。最小上手路径三步跑出第一份评估报告一行命令完成安装DeepEval 要求 Python 3.9安装就这一条pip install -U deepeval5 分钟写出第一个 LLM 评估测试用例新建test_chatbot.py下面这段定义了一个正确性指标和一个测试用例——input模拟用户提问actual_output换成你应用的真实输出from deepeval import assert_test from deepeval.metrics import GEval from deepeval.test_case import LLMTestCase, SingleTurnParams def test_case(): correctness GEval( nameCorrectness, criteria判断 actual_output 是否符合 expected_output, evaluation_params[SingleTurnParams.ACTUAL_OUTPUT, SingleTurnParams.EXPECTED_OUTPUT], threshold0.5 ) test_case LLMTestCase( input这双鞋不合适怎么办, actual_output30 天内可全额退款无额外费用。, expected_output我们提供 30 天全额退款无额外费用。, retrieval_context[所有客户均享 30 天全额退款。] ) assert_test(test_case, [correctness])裁判需要调 LLM先设置环境变量export OPENAI_API_KEY...也可以换成你自己的模型。一条命令跑出第一份评估报告export OPENAI_API_KEYsk-你的key deepeval test run test_chatbot.py指标得分在 0 到 1 之间过了threshold测试就通过 ✅。可选地执行deepeval login结果会自动同步到云端平台生成可分享的测试报告不需要额外改代码。进阶用法挑两个讲组件级评估定位智能体哪一步出了问题端到端测试只能告诉你整体错了。用observe装饰器给每个 LLM 调用、工具使用、检索步骤打上追踪标记配合update_current_span记录每个组件的输入输出就能对智能体的完整决策轨迹做评估精准定位是哪一环出的错。数据集批量跑一套用例一次性过流水线EvaluationDataset是一组测试用例Golden的集合用evals_iterator()可以让同一套数据反复过你的应用并逐条打分适合回归测试和版本对比。此外它还支持生成单轮/多轮合成数据集、基于评估结果自动优化提示词、用不到 10 行代码跑 MMLU、HumanEval、GSM8K 等基准测试以及 LangChain、CrewAI、Pydantic AI、LlamaIndex 等框架的一键接入更多能力见 官方文档。它适合谁如果你正在做 RAG 管道、聊天机器人或 AI 智能体想搞清楚该换什么模型、什么提示词、什么架构DeepEval 能给你可复现的数字而不是感觉。现在就装一个把你手上任意一条真实问答改写成第一个测试用例跑起来吧。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价