资讯动态

AI测试技能卷起来!目标检测算法测试流程与方法总结

发布时间:2026/9/10 5:44:44 来源:尧图企业网站定制
时光如梭 梭梭催人老。最近很多同学私信我 问我怎么不更新测试相关的技术文章了。说来话长反正就是忙。因为除了要在新的测试领域发光发热之外还需要兼任传统测试领域的技术支持这…就是现状。所以关于测试相关的文章更新的慢了一些 。慢是慢了点但总会更新的。咱闲言少叙今天我跟大家聊一聊算法领域的测试流程和测试方法。这也是我在企业技术大会上做的分享这里也分享给各位希望对各位在算法测试中有一些帮助。当然我也提前唠叨一句算法领域的知识理解起来有些难度如果觉得看的有些吃力可以提前了解一下 机器学习、深度学习等相关算法知识以及模型评估指标等知识。书说简短我们进入正文。数据准备针对测试不管是传统测试还是算法测试在执行测试执之前必可不少的一项任务就是数据准备。相对于传统测试(如业务测试接口测试还是性能测试)的数据的准备算法测试中的数据准备就有些”繁琐”了。为什么会说繁琐以我所负责的目标检测算法为例这一复杂性就体现出来了。即不仅要从大量图片中准确识别出特定的产品还需要根据不同的维度对产品进行细分类如 优秀、合格、不合格等。看到这有人会说这很简单啊 不就是识别出好坏俗称二分类嘛。当从一个图片中识别出来那确实没问题但是实际情况可没有这么简单首先需要处理由数万个摄像头持续7x24小时的拍摄的海量图片可以脑补一下其次同一个摄像头可能会拍摄到重复图片如3秒内拍摄10张照片有4张重复而此时就需要对4张进行去重处理。 这不仅增加了数据准备的难度同时对后续算法的准确性和效率也产生了重要影响所以 数据准备过程中 不仅要基于特征提取还要避免模型训练出现过拟合而去重等情况这就是相对于传统测试难度提升的原因之一。为了更好的理解数据收集过程我就以最常见的切片面包为例 验证切片面包的饼边完整度。(处于职业操守我就以切片面包为例但这并不影响整个实例展示即结果统计)分类训练集、验证集数量5000张饼边优秀(饼边无破损) 合格(饼边破损度半片破损)不合格(饼边破损度半片破损)原则不重复图片、不要模糊图片、不要有遮挡的图片等鲁棒性强光、正常光源、暗光、角度(平铺、倾斜)根据上面的要求来进行数据的收集。数据的收集方式主要会从数据库下载图片基于下载后的图片进行筛选。关于素材收集这里提醒几点数据库选择优先备战库或者专用数据库(StarRocks)中下载数据避免对主库造成过大压力添加时间戳下载数据时一定要加上时间戳即确保数据的时效性和可追溯性为后续的数据分析提供有力支持也避免全时段查询对数据库造成压力权限控制如果从线上库下载数据一定注意数据库读写权限避免误操作导致数据损坏等多语言脚本支持除了具备sql之外还需要运用脚本语言如Python进行高效的数据处理提高数据准备的效率和质量此外关于素材收集的原则也需要注意几点1、 不要重复的图片主要有这几点原因① 避免过拟合重复使用图片会导致模型过分适应这些重复样本的特征无法学习更多的图片特性最后结果就是在训练集上表现很好但是在测试集/验证集或上线后表现效果不好。② 提高模型泛华能力这也是为什么不要使用重复的图片的原因 如果5000张素材每个图片都有不同的场景、特征那么最后训练的结果必定是很广泛的这也是我们训练的目的。③ 优化训练效率使用重复图片训练会浪费计算资源和时间得不偿失。④ 评估准确性使用重复图片训练 会导致模型在训练集中表现非常好但是在测试集/验证集 、或上线后模型的准确率、精确率等不准确从而导致对模型评估不准确。2、 不要模糊的图片和有遮挡的图片 这主要涉及的原因① 影响特征学习模型训练一定要基于图片的特征和完整性进行学习如果模型的或者有遮挡的图片会让整个模型的在学习过程中有”误解”导致识别不准② 增加训练难度对遮挡的图片需要使用”数据增强”或”部分遮挡处理”等技术这对于初版的模型训练会增加一定的难度当然针对优化版本对针对遮挡和模型图片有专门的算法优化这里暂不多说。③ 影响模型准确性评估模型的好与坏是否能上线其中一个原因就是看模型的准确性 如果使用模型图片或者遮挡图片这必定会影响其准确性从而影响期上线。你看 我花费了这么长时间来聊数据收集的事情 因为模型是否会有过拟合、欠拟合、准确性、泛化能力通俗点说模型是否达标数据是直接影响关键因素所以不管是测试同学还是开发同学都要重视素材的收集。数据标注关于数据标注并非都有算法工程师来做而算法测试工程师也会介入那么数据标注的工具是什么如何来做数据标注呢接下来我就以我实际的工作方式来介绍一下数据标注 。其实数据标注并不是很难 但是会直接影响模型的准确性。为什么会影响模型的准确性在此之前我们要先了为什么要进行数据标准。进行数据标注最直接的目的就是提供”标签”让模型基于提供的标签进行学习。其实针对数据标注网上会有很多的解释 这些解释不能说不对只能说太繁琐。所以这里的数据标注只要记住最主要的就是提供“标签”。如果了解机器学习的 有监督学习和无监督学习就能很好的了解 “标签”这个概念。这里我就不过多赘述。所以看到这里是不是就知道了数据标注的主要功能。在接下来 我就简单说一下主要的数据标注的工具以上就是常用的标注工具我使用的是labelm4大家使用什么数据标注工具即需要根据公司来选择也需要根据行业来选择例如生物制药数据标注 更多使用的是Pinnacle 21毕竟这是专为生物制药领域设计的工具。关于数据标注工具 我们就说到这里。关于算法测试的前期准备工作到这里就OK了下期我们将详细讲述算法测试过程和方法敬请期待~感谢每一个认真阅读我文章的人作为一位过来人也是希望大家少走一些弯路如果你不想再体验一次学习时找不到资料没人解答问题坚持几天便放弃的感受的话在这里我给大家分享一些自动化测试的学习资源希望能给你前进的路上带来帮助。软件测试面试文档我们学习必然是为了找到高薪的工作下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料并且有字节大佬给出了权威的解答刷完这一套面试资料相信大家都能找到满意的工作。视频文档获取方式这份文档和视频资料对于想从事【软件测试】的朋友来说应该是最全面最完整的备战仓库这个仓库也陪伴我走过了最艰难的路程希望也能帮助到你以上均可以分享点下方小卡片即可自行领取。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价