跳到主要内容

模型训练

AI Studio 的训练模块支持从数据集到模型的完整训练流程。您无需编写任何训练脚本,通过 GUI 配置即可启动训练任务。


训练配置入口

在数据集管理页面,选择已划分好的数据集版本,点击"开始训练"进入训练配置向导:

┌─────────────────────────────────────────────────────────────┐
│ 训练配置 — gear_defect_v1 │
├─────────────────────────────────────────────────────────────┤
│ 步骤 1/3: 选择模型架构 │
│ │
│ ┌──────────────────────────────────────────────────────┐ │
│ │ ● YOLOv8s (检测) 推荐 精度/速度均衡 │ │
│ │ ○ YOLOv8n (检测) 轻量快速 │ │
│ │ ○ YOLOv8m (检测) 高精度 │ │
│ │ ○ YOLOv8l (检测) 极高精度 │ │
│ │ ○ ResNet-50 (分类) 标准分类网络 │ │
│ │ ○ MobileNet-V3 (分类) 移动端优化 │ │
│ │ ○ UNet (分割) 标准分割网络 │ │
│ └──────────────────────────────────────────────────────┘ │
│ │
│ [上一步] [下一步] │
└─────────────────────────────────────────────────────────────┘

选择模型架构

AI Studio 提供预置的模型架构库,按任务类型分组:

目标检测模型

模型速度精度显存需求推荐场景
YOLOv8n极快中等2 GB边缘设备、实时检测
YOLOv8s较高4 GB通用检测任务
YOLOv8m中等8 GB高精度检测
YOLOv8l极高12 GB离线高精度检测
RT-DETR-l中等极高10 GB需统一检测+分割

图像分类模型

模型速度精度推荐场景
MobileNet-V3极快中等边缘设备
ResNet-18较高通用分类
ResNet-50中等高精度分类
EfficientNet-B3中等很高精度优先

语义分割模型

模型精度显存需求推荐场景
UNet6 GB通用分割
DeepLabV3+很高8 GB高精度分割
SegFormer-B0中等4 GB轻量分割

超参数设置

第二步配置训练超参数:

┌─────────────────────────────────────────────────────────────┐
│ 训练配置 — 步骤 2/3 │
├─────────────────────────────────────────────────────────────┤
│ 超参数设置: │
│ │
│ 训练轮数 (Epochs): [100 ] │
│ 批次大小 (Batch): [16 ] 推荐: 16-64 │
│ 初始学习率: [0.001 ] │
│ 优化器: [AdamW ▼] │
│ 权重衰减: [0.0005 ] │
│ 学习率调度: [余弦退火 ▼] │
│ │
│ 数据增强: │
│ ☑ 随机翻转 (水平) │
│ ☑ 随机缩放 (±20%) │
│ ☐ 随机旋转 (±15°) │
│ ☑ 色彩抖动 (HSV) │
│ ☐ 马赛克增强 (Mosaic) │
│ ☑ 混合增强 (MixUp) │
│ │
│ 训练设备: ● GPU (CUDA) ○ CPU ○ 自动选择 │
│ │
│ [上一步] [下一步] │
└─────────────────────────────────────────────────────────────┘

关键超参数说明

参数说明调优建议
Epochs完整遍历训练集的次数小数据集 100-300,大数据集 50-100
Batch Size每次迭代处理的样本数根据显存调整,GPU 显存一半即可
Learning Rate参数更新步长AdamW 推荐 0.001,SGD 推荐 0.01
Weight Decay正则化系数,防过拟合默认 0.0005,过拟合时增大

数据增强

数据增强通过对训练图像进行随机变换,变相增加训练数据量,提升模型泛化能力。

  • 基础增强(默认开启):翻转、缩放、色彩抖动,适用于大部分场景
  • 高级增强:马赛克增强将四张图拼为一张,适合小目标检测;混合增强按比例叠加两张图,提升泛化性
提示

数据增强不是越多越好。对于工业场景,过度的几何变换可能导致模型学到不真实的特征。建议从基础增强开始,验证集精度不再提升时再逐步加入高级增强。


训练过程监控

配置完成后,点击"开始训练",系统启动后台训练任务。训练监控面板实时显示进度:

┌─────────────────────────────────────────────────────────────┐
│ 训练监控 — gear_defect_v1 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 进度: ████████████████████░░░░░░░ 65/100 Epochs │
│ │
│ 损失曲线 精度曲线 (mAP@0.5) │
│ ┌──────────────────────┐ ┌──────────────────────┐ │
│ │ Loss ── Train │ │ mAP ── Val │ │
│ │ ╲ │ │ ╱╲ │ │
│ │ ╲ │ │ ╱ ╲ │ │
│ │ ╲___ │ │ ╱ ╲___ │ │
│ │ ╲___ │ │ ╱ ╲ │ │
│ │ ╲ │ │ ╱ ╲ │ │
│ │ ╲ │ │ ╱ ╲ │ │
│ └──────────────────────┘ └──────────────────────┘ │
│ Loss: 0.032 mAP@0.5: 0.892 │
│ │
│ 学习率曲线 GPU 利用率 │
│ ┌──────────────────────┐ ┌──────────────────────┐ │
│ │ lr │ │ GPU Util │ │
│ │ ╲ │ │ ████████████ 87% │ │
│ │ ╲ │ │ 显存: 5.2/8.0 GB │ │
│ │ ╲ │ │ 温度: 72°C │ │
│ │ ╲ │ │ 剩余时间: 12:34 │ │
│ └──────────────────────┘ └──────────────────────┘ │
│ │
│ 日志: │
│ [12:34:56] Epoch 065/100 ─ loss: 0.032 ─ mAP@0.5: 0.892 │
│ [12:30:12] Epoch 060/100 ─ loss: 0.035 ─ mAP@0.5: 0.887 │
│ [12:25:30] Epoch 055/100 ─ loss: 0.038 ─ mAP@0.5: 0.881 │
│ │
│ [暂停] [停止] [最小化到托盘] │
└─────────────────────────────────────────────────────────────┘

监控指标

指标含义期望趋势
Train Loss训练集损失值持续下降,最终趋于平稳
Val Loss验证集损失值下降后趋于平稳,若上升则过拟合
mAP@0.5IoU 阈值 0.5 时的平均精度持续上升,最终趋于平稳
mAP@0.5:0.95多阈值平均精度(更严格)上升,通常低于 mAP@0.5
Learning Rate学习率变化曲线按调度策略衰减

训练中断与恢复

自动保存检查点

训练过程中每 5 个 Epoch 自动保存检查点(Checkpoint),包含:

  • 模型权重
  • 优化器状态
  • 当前 Epoch 号
  • 当前最佳验证精度

手动暂停与恢复

  • 暂停: 训练完成后自动暂停;也可手动点击"暂停"
  • 恢复: 从最近检查点恢复训练,延续进度,不会从头开始
  • 中断处理: 训练过程中 IDE 意外关闭,重新打开 AI Studio 后,训练任务显示"已中断",可一键恢复

提前停止

验证集精度连续 20 个 Epoch 未提升时,系统自动弹出提示建议提前停止训练,避免过拟合。您可以选择:

  • 接受建议:停止训练,保留最佳模型
  • 继续训练:手动延长训练轮数

硬件要求

训练模块对硬件有较高要求,建议参考以下配置:

GPU 训练(推荐)

模型规模推荐 GPU显存需求训练时间参考 (1,000 张, 100 Epoch)
YOLOv8nGTX 10602 GB~1.5 小时
YOLOv8sRTX 20604 GB~2 小时
YOLOv8mRTX 30608 GB~3 小时
YOLOv8lRTX 408012 GB~5 小时

CPU 训练

  • 支持 CPU 训练,速度约为 GPU 的 1/10 至 1/20
  • 推荐使用轻量模型(YOLOv8n、MobileNet-V3)
  • 适合小数据集(< 500 张)或模型原型验证

环境检测

开始训练前,AI Studio 会自动检测运行环境,并在训练配置页面显示检测结果:

环境检测结果:
✅ CUDA 11.8 — 可用
✅ cuDNN 8.9 — 可用
✅ GPU: NVIDIA RTX 3060 (12 GB) — 可用
⚠ 显存剩余: 8.5 GB — 足够训练 YOLOv8s
✅ Python 3.10 — 可用
✅ ONNX Runtime 1.16 — 可用

缺少依赖时,系统会引导一键安装所需组件。