数据集管理
数据集是模型训练的基础。AI Studio 提供完整的数据集生命周期管理功能,包括创建、导入、标注、版本控制和数据集划分。
创建数据集
在 AI Studio 主界面点击"新建数据集",弹出创建对话框:
┌─────────────────────────────────────────────────────────────┐
│ 新建数据集 │
├─────────────────────────────────────────────────────────────┤
│ 数据集名称: [_________________________] │
│ │
│ 任务类型: ○ 图像分类 ● 目标检测 ○ 语义分割 │
│ │
│ 描述: [________________________________] │
│ [________________________________] │
│ │
│ 存储路径: C:\DarraProjects\datasets\[____] │
│ │
│ [取消] [创建] │
└─────────────────────────────────────────────────────────────┘
字段说明:
- 数据集名称: 唯一标识,建议使用英文+数字,如
gear_defect_v1 - 任务类型: 根据项目需求选择分类/检测/分割,创建后不可更改
- 描述: 可选,记录数据集用途、来源、标注规范等信息
- 存储路径: 数据集在磁盘上的物理位置,自动生成
创建成功后,数据集显示在左侧数据集列表中,初始状态为"空"。
导入图像
数据集创建后,需要导入图像数据。支持以下导入方式:
从本地文件夹导入
点击"导入图像"按钮,选择包含图像的文件夹。支持格式:
| 格式 | 说明 |
|---|---|
.jpg / .jpeg | JPEG 压缩格式,推荐 |
.png | 无损压缩,适合需要透明通道的场景 |
.bmp | 无压缩,文件较大 |
.tiff / .tif | 多页 TIFF 文件 |
导入时自动进行以下处理:
- 校验图像完整性(损坏文件自动跳过并记录日志)
- 自动转换色彩空间为 RGB
- 可选统一缩放至指定分辨率(建议 640×640 或 416×416)
- 文件名冲突自动重命名
从相机采集
连接 USB 或 GigE 工业相机后,可直接在 AI Studio 中采集图像:
┌─────────────────────────────────────────────────────────────┐
│ 相机实时采集 │
├─────────────────────────────────────────────────────────────┤
│ │
│ [ 实时预览画面 ] │
│ │
│ │
│ 相机: [Basler ace acA2440-20gm ▼] │
│ 分辨率: [2448 × 2048 ▼] 格式: [.png ▼] │
│ │
│ 采集模式: ● 单张 ○ 连续 ○ 触发 (外部信号) │
│ │
│ 保存位置: [数据集/gear_defect_v1/raw/ ] │
│ │
│ [采集] [停止] │
└─────────────────────────────────────────────────────────────┘
从外部数据集导入
支持导入标准格式的外部数据集:
- COCO JSON: Microsoft COCO 标准标注格式
- VOC XML: PASCAL VOC 标注格式
- YOLO TXT: YOLO 格式的标注文件
- Darra 导出格式: 从其他 Darra 数据集导出的压缩包
导入外部标注时,系统会自动匹配图像与标注文件,并验证标注完整性。
数据集标注
标注是监督学习的关键步骤。AI Studio 提供内置标注工具,详见标注工具章节。
此外支持两种非手动标注方式:
外部标注导入
从第三方标注工具(如 LabelImg、CVAT、Roboflow)导出的标注文件,可通过"导入标注"功能直接关联到数据集。
预标注模型辅助
使用已有的训练模型对未标注图像进行自动预标注,工程师只需校正偏差,大幅减少标注时间:
预标注流程:
1. 选择已训练的模型作为预标注器
2. 选中一批未标注图像
3. 点击"预标注" → 自动生成初始标注
4. 逐张审核、微调边界框/掩码
5. 确认后写入正式标注
数据集版本管理
数据集在迭代过程中可能需要多次调整标注或增删图像。AI Studio 支持版本管理,记录每次变更。
创建版本
数据集: gear_defect_v1
当前版本: v3 (2026-07-20)
标注数量: 1,245 张
点击"创建版本"后,系统自动:
- 冻结当前所有图像和标注
- 生成版本号(自动递增)
- 记录版本说明(由用户填写变更摘要)
- 计算版本统计信息(图像数、标注数、类别分布)
版本对比
选择两个版本可进行对比分析:
| 指标 | v2 | v3 | 变化 |
|---|---|---|---|
| 图像总数 | 1,020 | 1,245 | +225 |
| 标注总数 | 2,310 | 2,890 | +580 |
| 类别数 | 5 | 5 | — |
| 平均标注/图 | 2.26 | 2.32 | +0.06 |
版本回滚
如需恢复到历史版本,右键版本列表中的目标版本 → "回滚到此版本"。回滚操作会创建新版本(源版本保留),不会覆盖现有数据。
数据集划分
训练前需要将数据集划分为三个子集:
┌─────────────────────────────────────────────────────────────┐
│ 数据集划分 │
├─────────────────────────────────────────────────────────────┤
│ 数据集: gear_defect_v1 (1,245 张) │
│ │
│ 划分比例: │
│ 训练集: [80]% (996 张) │
│ 验证集: [15]% (187 张) │
│ 测试集: [5]% (62 张) │
│ │
│ 划分方式: │
│ ● 随机划分 ○ 按文件夹 ○ 分层抽样 (保持类别比例) │
│ │
│ 随机种子: [42] (固定种子可复现划分结果) │
│ │
│ [取消] [应用] │
└─────────────────────────────────────────────────────────────┘
划分策略
- 随机划分: 简单随机抽样,适用于类别均衡的数据集
- 按文件夹: 按文件夹目录结构划分,适用于已有整理的数据
- 分层抽样: 按类别比例均匀分配,推荐用于类别不平衡的数据集
划分后操作
应用划分后,数据集的统计面板会显示各子集的详细信息:
数据集: gear_defect_v1
├─ 训练集: 996 张 (80.0%)
│ ├─ 良品: 498 张
│ ├─ 划痕: 249 张
│ └─ 裂纹: 249 张
├─ 验证集: 187 张 (15.0%)
│ ├─ 良品: 94 张
│ ├─ 划痕: 47 张
│ └─ 裂纹: 46 张
└─ 测试集: 62 张 (5.0%)
├─ 良品: 31 张
├─ 划痕: 16 张
└─ 裂纹: 15 张
提示
建议测试集至少保留 50 张以上,以保证评估结果的统计意义。对于小数据集(<500 张),可适当减少测试集比例(如 5%),但不应低于 30 张。