资讯动态

5 分钟跑通 Evidently:ML 与 LLM 评测监控从安装到面板实战

发布时间:2026/9/20 11:26:26 来源:尧图企业网站定制
5 分钟跑通 Evidently:ML 与 LLM 评测监控从安装到面板实战【免费下载链接】evidentlyEvidently is ​​an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidentlyEvidently 是开源的 ML 与 LLM 评测监控框架,内置 100 指标,覆盖表格数据到生成式 AI。读完你跑通一份数据漂移报告,并打开本地监控面板。一句话说清 Evidently 是什么它 一个开源 Python 框架,帮你评测、测试、监控任何 AI 系统或数据管道。它同时管两件事:离线时跑一份评测报告,上线后盯着指标随时间的变化。最直观的一个数字:内置100 评测指标,从数据漂移、缺失值到 LLM judge 都算内置能力,不需要自己拼装。从零到跑通:三步上手最短路径是:装依赖 → 跑一份数据漂移报告 → 打开监控面板。前提是 Python 3.10(见 pyproject.toml 的requires-python)。第一步,安装核心包,一行命令:pip install evidently第二步,加载内置的漂移预设,对 sklearn 自带的 iris 数据跑一份对比报告。这里把前 60 行当当前数据、后 60 行当参考基线,用 PSI 方法看列分布有没有偏移:import pandas as pd from sklearn import datasets from evidently import Report from evidently.presets import DataDriftPreset iris datasets.load_iris(as_frameTrue).frame report Report([DataDriftPreset(methodpsi)]) snap report.run(iris.iloc[:60], iris.iloc[60:]) snap.save_html(drift.html)第三步,启动本地监控服务。它在本地起一个带演示项目的 UI,浏览器打开localhost:8000就能看到面板:evidently ui --demo-projects all关键指标速览维度数字内置评测指标100开箱预设6 类(漂移/分类/回归/文本/推荐/数据集统计)数据漂移统计检验20 种统计检验与距离度量Python 版本要求 3.10运行模式离线报告 实时监控,两种这意味着什么:你不需要先搭平台,一个Report对象就能开工;等需要长期看趋势时,同一套指标定义直接接进监控面板,不用重写评测逻辑。三个最值得用的场景给上线模型配漂移检测模型上线后输入分布悄悄变了,指标却还好看。用DataDriftPreset对滚动时间窗的当前数据与参考基线做对比,20 种统计检验帮你定位到具体哪一列漂了。给 LLM 输出装评分器对问答、摘要这类生成式输出,挂上文本描述符(情感、长度、关键词)加 LLM-as-a-judge,给每条回答逐行打分,再汇总成分数分布。Evidently 的指标也可以接到 Grafana 这类看板做长期监控:给 CI 流水线加质量门禁把任意 Report 加上 pass/fail 条件就变成 Test Suite,可以直接进回归测试、CI 检查或数据校验,条件支持gt/lt这类简单写法,也能从参考数据集自动生成初始阈值。它凭什么比同级方案省心模块化架构,先报告后服务。大多数监控方案要先部署一套服务才能看到东西,Evidently 反过来:一个Report对象在 notebook 里就能出结果,离线评测和实时监控共用同一套指标定义。等团队真的需要时间序列看板,再上监控 UI,评测代码不用动。部署成本低到可以忽略。本地体验就是一条pip install加一条evidently ui命令;要正式自托管,仓库里 docker/ 目录已经备好 Dockerfile 和 Makefile。对比 MLflow 这类以实验跟踪为主的方案,漂移检测和 LLM 评测在 Evidently 里是内置指标,不用自己找插件补齐。仓库里你需要关注的文件README.md — 快速开始代码和全部能力概览,入口文档pyproject.toml — 依赖与入口定义,装哪些 extra 看这里src/evidently/presets/ — 6 类开箱预设指标的源码src/evidently/descriptors/ — 文本描述符与 LLM judge 的定义examples/cookbook/ — 可直接运行的示例 notebookpyproject.toml 里决定行为的关键字段:requires-python 3.10 [project.scripts] evidently evidently.cli:app踩过的坑与调优建议notebook 里报告渲染不出来或 HTML 打不开→ 先用save_html()存文件,再从目标目录打开;或直接看.json()/.dict()的结构化输出。想跑 LLM judge、语义相似度,报缺依赖→ 基础包不含模型相关依赖,装 extra:pip install evidently[llm](含 openai、transformers、sentence-transformers 等)。漂移结果忽高忽低、没法定论→ 先核对参考集与当前集是否同源、同口径;小时间窗验证流程通了,再拉长基线。不想维护常驻服务又想看面板→ 用uv run --with evidently evidently ui --demo-projects all一条命令起演示项目,不占环境。想深入看什么examples/cookbook/descriptors.ipynb — 刚上手时读它,逐个走一遍文本描述符的用法。src/evidently/presets/ — 选指标时读它,看每个预设具体组合了哪些指标。tests/multitest/ — 自定义指标前读它,看各类指标如何被调用和断言。常见问题Evidently 能评 LLM 吗,还是只管表格 ML?都能。表格数据(质量、漂移、分类回归)和文本/LLM 输出(描述符、LLM judge)是同一个框架里的两条线,共用 Report 机制。Report 和 Test Suite 有什么区别?Report 负责计算和汇总指标;给它加上 pass/fail 条件就升级为 Test Suite,用于 CI/CD 检查和数据校验,阈值可以从参考数据集自动生成。监控面板必须买云服务吗?不。开源版可以自托管,本地跑evidently ui --demo-projects all零成本先体验,服务形态仓库里有现成 docker 配置。下一步:把你自己的一份线上数据切成两个时间窗,跑一次report.run(),看有没有哪列触发漂移。【免费下载链接】evidentlyEvidently is ​​an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidently创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价