模型验证
训练完成后,AI Studio 提供全面的验证评估工具,帮助工程师从多个维度评估模型性能,确保模型达到工业部署标准。
验证入口
训练完成后,系统自动进入验证评估页面。也可以通过模型库中已训练模型的"验证"按钮手动进入。
┌─────────────────────────────────────────────────────────────┐
│ 模型验证 — gear_defect_v1 │
├─────────────────────────────────────────────────────────────┤
│ 模型: gear_defect_yolov8s_v3 │
│ 数据集: gear_defect_v1 (v3) │
│ 训练用时: 2h 34m │
│ 最佳 Epoch: 87/100 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 概览指标: │
│ │
│ mAP@0.5 mAP@0.5:0.95 Precision Recall │
│ 0.928 0.674 0.941 0.915 │
│ │
│ [导出报告] │
└─────────────────────────────────────────────────────────────┘
验证指标
核心指标
| 指标 | 含义 | 范围 | 工业合格参考 |
|---|---|---|---|
| Precision(精确率) | 预测为正类中真正的正类比例 | 0~1 | ≥ 0.90 |
| Recall(召回率) | 真正的正类中被正确检出的比例 | 0~1 | ≥ 0.85 |
| mAP@0.5 | IoU 阈值 0.5 时的平均精度均值 | 0~1 | ≥ 0.90 |
| mAP@0.5:0.95 | 多 IoU 阈值(0.5~0.95)的平均精度均值 | 0~1 | ≥ 0.50 |
| F1-Score | Precision 和 Recall 的调和平均 | 0~1 | ≥ 0.87 |
各项含义详解
Precision(精确率):
Precision = TP / (TP + FP)
预测的缺陷中有多少是真的缺陷。高 Precision 意味着误检少(把良品判为缺陷的情况少)。
Recall(召回率):
Recall = TP / (TP + FN)
真正的缺陷中有多少被检出。高 Recall 意味着漏检少(缺陷没被漏掉)。
mAP(Mean Average Precision):
mAP = 对所有类别的 AP 取平均
综合衡量模型在各个类别上的检测精度。mAP@0.5 是工业场景最常用的指标。
混淆矩阵
混淆矩阵直观展示模型在每个类别上的分类表现:
预测值
┌─────────────────────────────────────────┐
│ 良品 划痕 裂纹 背景 │
┌───┼─────────────────────────────────────────┤
真 │良品│ 482 8 4 4 │
际 ├───┼─────────────────────────────────────────┤
值 │划痕│ 6 348 12 6 │
├───┼─────────────────────────────────────────┤
│裂纹│ 3 10 350 12 │
├───┼─────────────────────────────────────────┤
│背景│ 5 4 6 945 │
└───┴─────────────────────────────────────────┘
- 主对角线(绿色高亮):正确预测的数量,越大越好
- 非对角线(红色标记):错误预测,需要关注
- 背景列:假正例(FP)——误检
- 背景行:假反例(FN)——漏检
从上面示例可见:
- 良品类别:482/498 正确(96.8%),主要误判为划痕(8 例)
- 划痕类别:348/372 正确(93.5%),与裂纹有交叉混淆(12 例)
- 裂纹类别:350/375 正确(93.3%),与划痕有交叉混淆(10 例)
测试集评估
使用训练时保留的测试集(从未参与训练和验证)进行最终评估。
逐图结果
测试集评估结果 (62 张)
═══════════════════════════════════════════════════════════════
图像 001 — 良品 ✅
预测: 良品 (置信度 0.97) 真实: 良品
图像 002 — 划痕 ✅
预测: 划痕 (置信度 0.92) 真实: 划痕
图像 003 — 裂纹 ⚠️
预测: 划痕 (置信度 0.51) 真实: 裂纹 ← 漏检(FN)
└─ 建议:该裂纹尺寸较小(32×18px),可考虑增加小目标增强
图像 004 — 良品 ✅
预测: 良品 (置信度 0.95) 真实: 良品
...
测试集统计汇总
测试集评估汇总
═══════════════════════════════════════════════
总图像: 62 张
正确: 56 张 (90.3%)
错误: 6 张 (9.7%)
├─ 漏检 (FN): 4 张
└─ 误检 (FP): 2 张
按类别:
良品: 30/31 (96.8%) ── 1 误检为划痕
划痕: 15/16 (93.8%) ── 1 漏检
裂纹: 13/15 (86.7%) ── 2 漏检 ← 需改进
模型对比
AI Studio 支持将当前模型与历史版本进行对比,直观展示迭代效果。
选择对比模型
对比模型: gear_defect_v1 (v2) vs gear_defect_v1 (v3)
═══════════════════════════════════════════════════════════════
指标 v2 (2026-07-15) v3 (2026-07-22) 变化
───────────────────────────────────────────────────────────
mAP@0.5 0.887 0.928 +0.041 ↑
mAP@0.5:0.95 0.612 0.674 +0.062 ↑
Precision 0.903 0.941 +0.038 ↑
Recall 0.874 0.915 +0.041 ↑
F1-Score 0.888 0.928 +0.040 ↑
训练时间 1h 52m 2h 34m +42m
模型大小 (ONNX) 22.4 MB 22.4 MB —
可视化对比
AI Studio 支持在同一张测试图像上并排显示两个模型的推理结果,便于直观比较差异:
v2 (2026-07-15) v3 (2026-07-22)
┌────────────────────┐ ┌────────────────────┐
│ │ │ │
│ [图像] │ │ [图像] │
│ │ │ │
│ 划痕 0.82 ──┐ │ │ 划痕 0.94 ────── │
│ │ │ │ │
│ │ │ │ + 裂纹 0.87 ← 新增检出
│ 裂纹 未检出 │ │ │
└────────────────────┘ └────────────────────┘
可视化验证结果
AI Studio 提供丰富的可视化工具,帮助理解模型行为:
检测结果可视化
在测试集图像上叠加显示模型预测结果:
标注框颜色说明:
┌─────────────────────────────────────────┐
│ 绿色 ── 正确检测 (TP) │
│ 红色 ── 误检 (FP) │
│ 黄色 ── 漏检 (FN,人工标注但模型未检出) │
│ 数字 ── 置信度 (0~1) │
└─────────────────────────────────────────┘
Precision-Recall 曲线
显示每个类别的 PR 曲线,曲线下面积(AP)越大越好:
Precision
1.0 ┤ ╱╲
│ ╱ ╲
0.8 ┤ ╱ ╲
│ ╱ ╲
0.6 ┤ ╱ ╲
│ ╱ ╲
0.4 ┤╱ ╲
│ ╲
0.2 ┤ ╲
│ ╲
0.0 ┤─────────────────────── Recall
1.0 0.8 0.6 0.4 0.2 0.0
良品 (AP=0.985) ── 划痕 (AP=0.942)
裂纹 (AP=0.918) ──
验证报告导出
验证完成后,可导出标准格式的报告:
支持导出格式:
- PDF: 包含所有指标、图表和汇总的完整报告
- JSON: 结构化指标数据,便于自动化处理
- CSV: 逐图检测结果表格
报告内容:
- 模型元信息(名称、架构、训练参数)
- 核心指标汇总表
- 混淆矩阵
- 各类别详细指标
- Precision-Recall 曲线
- 测试集逐图结果
- 失败案例汇总(漏检/误检 Top-N)
导出报告可用于内部评审或交付客户的质量证明文档。