资讯动态

你的AI模型到底是准还是不准?——一个混淆矩阵说透四个评估指标

发布时间:2026/10/10 14:03:31 来源:尧图企业网站定制
你的AI模型到底是准还是不准——一个混淆矩阵说透四个评估指标先别管公式看一个真实场景假设你做了一套垃圾邮件检测系统拿来100封邮件测试。实际情况是20封垃圾邮件80封正常邮件。跑完模型把预测结果和真实标签一对比得到这么一张表模型说是垃圾邮件模型说不是实际是垃圾邮件20封15封5封实际是正常邮件80封3封77封这张表就是混淆矩阵Confusion Matrix。名字听着玄乎其实就干一件事把模型预测结果和真实情况拉出来对账。四个格子的数字各有各的名字考试必考必须秒答符号什么意思上面的数字怎么记TP真正例实际垃圾预测也是垃圾15预对了说是正的FN假负例实际垃圾预测说不是5预错了说是负的FP假正例实际正常预测说是垃圾3预错了说是正的TN真负例实际正常预测说不是77预对了说是负的记住一个规则就行第一个字母T/F是预测对不对第二个字母P/N是预测是什么。准确率看起来靠谱但可能骗你最直觉的指标就是准确率——100封邮件里模型总共判对了多少准确率 (TP TN) / 总数 (15 77) / 100 92%92%好像不错但换个场景试试。1000封邮件里只有2封垃圾邮件。模型什么都不干全部预测正常邮件——准确率 998/1000 99.8%。一封垃圾邮件都没找出来准确率99.8%。这就是准确率最大的坑当正负样本数量差距悬殊时准确率会撒谎。模型只要全部猜多数类就能拿到一个漂亮的数字但毫无实际价值。所以业内有个不成文的规矩遇到不平衡数据别看准确率。精确率我说是到底对不对精确率回答的问题是模型说是的那些里面有多少真的是回到上面的例子模型说了18封是垃圾邮件15真垃圾 3误报其中15封真的是精确率 TP / (TP FP) 15 / 18 83.3%换个场景理解。搜索引擎给你返回10条结果其中8条确实和你的搜索词相关——精确率就是80%。你关心的是搜出来的东西有没有用这就是精确率管的。一句话记忆精确率 “我说是对不对”召回率是的我找没找召回率和精确率互为镜像。它问的是所有真正是垃圾邮件的里面模型找出了多少20封真垃圾邮件模型找出了15封漏了5封召回率 TP / (TP FN) 15 / 20 75%这个指标在医院检测里特别要命。100个病人检测仪只找出了90个10个漏诊了——召回率90%。那10个被漏掉的人后果可能很严重。一句话记忆召回率 “是的我找没找”精确率和召回率的博弈现实残酷的地方在于这两个指标经常打架。你想提高召回率少漏就把阈值放低——宁可多报也不漏。结果呢误报多了精确率掉下来。你想提高精确率少错就把阈值拉高——只在你非常确定的时候才说是。结果呢漏报多了召回率掉下来。鱼和熊掌不可兼得那你到底该顾哪头看场景场景优先保哪个为什么垃圾邮件过滤精确率把正常邮件误判为垃圾用户会骂医院疾病检测召回率漏诊一个病人比误诊一个更危险银行反欺诈召回率放过一个诈骗交易损失可能很大搜索引擎排序精确率用户翻三页都找不到想要的结果体验崩了安检/安全检测召回率漏过一个危险品后果不堪设想记住一个判断口诀“误判要命保精确漏判要命保召回”。F1值两个都不想放弃怎么办你不能在汇报的时候说我们精确率很高但是召回率不怎么样得给一个综合数字。F1值就是干这个的。F1 2 × 精确率 × 召回率 / (精确率 召回率) 2 × 0.833 × 0.75 / (0.833 0.75) 78.9%注意F1用的是调和平均不是简单的算术平均。这两者差别很大假设精确率100%召回率1%算术平均 (100 1) / 2 50.5%看起来还行调和平均 2 × 100 × 1 / (100 1) 1.98%真相大白调和平均的特点是对较小的值更敏感。只要精确率或召回率有一个拖后腿F1就会被狠狠拉下来。这其实是合理的——一个模型如果只顾一头整体表现就是差的。四个公式速查卡指标分母是什么公式口诀准确率全部样本(TPTN) / 总数全对多少精确率预测为正的TP / (TPFP)我说是对不对召回率实际为正的TP / (TPFN)是的我找没找F1精确召回2×P×R / (PR)两头不偏废最后强调一个考试常考的陷阱精确率和召回率的分母不一样。精确率的分母是预测为正的那一列召回率的分母是实际为正的那一行。搞混了整道题就全错。写在最后模型评估指标看起来就四个但它是机器学习里最基础也最实用的知识。面试时随手就能画出混淆矩阵并说出每个指标的含义比背一百个算法名字管用。如果你正在准备人工智能训练师考试建议把这张混淆矩阵手画三遍四个公式默写两遍。这个知识点在单选、多选、判断、简答题里都会出现属于每场考试必见的级别。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑