资讯动态

搞搞YOLO数据集(学习笔记)(第五集)

发布时间:2026/8/14 23:45:56 来源:尧图企业网站定制
(0:00 - 2:12) 核心思想先搞清楚“你要检测什么”✔ 关键点即使很抽象的图人类也能理解但AI不一定能YOLO本质是图像目标检测模型所以它有局限❌ 太抽象 → 识别不了❌ 非图像问题 → 不适合⚠️ 很重要的一句话你想让模型检测什么就必须先定义清楚 举例简单任务只检测“手办” → ✅ 容易复杂任务手办 真人 AI图 抽象图 → ❌ 难度爆炸 结论任务越复杂 → 数据集要求越高 → 模型难度越大 (2:12 - 3:01) 数据集准备流程总览制作数据集需要解决 3 个核心问题图片从哪里来标签从哪里来怎么划分数据集 完成后才能开始训练 (3:01 - 5:00) 如何找现成数据集捷径 (5:00 - 7:02) 数据集网站推荐⭐ 1. Roboflow Universe重点使用步骤搜索目标英文选择Project Type → Object Detection筛选数据集✔ 如何判断数据集质量情况建议图片很少几十张❌ 跳过类别混乱❌ 跳过类别清晰 数量多✅ 可用✔ 下载方法选择YOLO格式YOLO11下载ZIP 数据集结构重要dataset/ ├── images/ │ ├── train/ │ ├── val/ │ └── test/ ├── labels/ │ ├── train/ │ ├── val/ │ └── test/ └── data.yaml (7:02 - 9:03) Kaggle数据集数据更多但更杂 同样原则能转成YOLO格式 → 就能用 (9:30 - 11:40) 自制数据集重点当找不到数据集时自己做✔ 图片来源网上下载爬虫⚠️ 小心法律风险自己拍摄推荐✔ 推荐方法视频 → 图片步骤拍视频抽帧生成图片 拍摄原则很重要你想让模型识别什么 → 就拍什么要覆盖不同角度不同光照不同背景 (11:40 - 13:58) 自动提取图片用Python脚本AI帮你写从视频提取帧 可调参数抽帧间隔控制图片数量 (13:58 - 16:10) 标签制作核心 结构labels/ ├── classes.txt✔ classes.txtclass1 class2 class3✔ 标注工具LabelImg必须设置格式 YOLO在LabelImg左侧可以选择✔ 标注规则重点 核心原则你希望模型怎么预测 → 就怎么标 框的要求紧贴目标不要太大不要太小 (16:10 - 22:42) 半自动标注效率神器 思路标一小部分数据训练一个“学渣模型”用模型自动预测生成伪标签人工微调✔ 优点大幅减少工作量✂️ (24:19 - 25:55) 数据集划分✔ 使用脚本自动随机划分train.val.test生成images/ ├── train ├── val └── test labels/ ├── train ├── val └── test⚙️ (26:00 - 27:00) 训练前检查✔ 能跑通 数据没问题 (27:00 - 29:00) 模型选择 训练参数 模型选择 没有绝对最优大模型 → 精度高速度慢小模型 → 快但可能不准 Epoch建议数据规模推荐小数据集20~50一般100很复杂100 原则只要能收敛就行自动化训练多个模型from ultralytics import YOLO ms [ yolov8n, yolov8s, yolov8m, yolov9t, yolov9s, yolov9m, yolov10n, yolov10s, yolov10m, yolo11n, yolo11s, yolo11m, yolo12n, yolo12s, yolo12m, ] if __name__ __main__: for m in ms: model YOLO(m .pt) model.train( datakunkun.yaml, epochs100, imgsz640, batch-1, cacheram, workers1, projectresults, namem, )1.project“result”让训练好的best.pt文件统一放在result文件里2.正式开始前建议先设置epochs1看看能不能跑通 全流程总结超级重要 YOLO训练完整流程1️⃣ 明确任务检测什么 2️⃣ 获取数据找 or 自制 3️⃣ 标注数据YOLO格式 4️⃣ 划分数据集 5️⃣ 写data.yaml 6️⃣ 训练模型 7️⃣ 评估效果 一句话总结数据质量 模型本身

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价