训练入门样本量数据集

训练一个识别模型需要多少张图?

📅 2026-09-05👁 约 3 分钟✍ 灵境训练台团队

"要多少张图才能训?"是我们被问频率最高的问题。这篇文章把答案、背后的逻辑和实操清单一次讲清。

一、先给结论

常见二分类场景(口罩、厨师帽这类着装识别),每类 200~500 张、总量 500~1000 张,通常就能达到 90% 以上的可用精度。检测类任务(鼠患、明火这类"找出位置"的识别)目标更小、背景更复杂,建议 500~2000 张。多分类任务(如果蔬品类识别)按类别数线性放大,每类不少于 150~300 张。

这些数字的前提是:迁移学习(基于预训练底座微调)+ 数据多样性合格。从零训练一个网络所需的样本量是另一个量级的故事,实践中不应该那么做。

二、场景样本量参考表

  • 口罩 / 厨师帽 / 工作服等着装二分类:每类 200~500 张,总计 500~1000 张,1~2 天标注完成;
  • 鼠患 / 明火等检测:正样本 300~800 张(含目标的不同大小与姿态),负背景图 500~1000 张,总计 1000~2000 张;
  • 果蔬等多分类:30 类 × 每类 200 张 ≈ 6000 张起步;类别越多越要靠分批迭代;
  • 稀有事件(明火这类真实样本难得的):正样本可以靠采集模拟火源、公开数据集、数据增强补足,负样本(正常背景)反而要充足。

三、比数量更重要的是多样性

500 张同一台相机、同一时段、同一角度的图,不如 200 张覆盖不同条件的图。采集时对着六个维度检查覆盖:

  1. 光照:白天/夜间、开灯/关灯、逆光/顺光;
  2. 角度:安装视角的高低、目标的朝向;
  3. 距离:目标在画面中的占比从大到小都要有;
  4. 遮挡:部分遮挡的目标要占一定比例;
  5. 个体:不同的人、不同的设备外观;
  6. 时间:跨至少三天的样本,避免某天的特殊状态污染整体分布。

训练集与真实场景的分布越接近,上线效果越好。这也是我们始终建议"用现场摄像头采图"而不是"网上找图"的原因。

四、验证集划分:别自欺欺人

务必划出 10%~25% 作为验证集且不参与训练。平台在打包数据集版本时默认按分层抽样切分 train/val(固定随机种子,可复现)。两个常见错误:一是把验证集也拿去训练,指标虚高、上线打脸;二是验证集与训练集来自同一批连续抓拍,画面几乎相同——等于开卷考试。切分前先把"几乎相同"的连续帧合并,再切分。

五、现场采集清单

给到实施同事的采集建议:

  1. 按部署点位逐一采集,每个点位至少覆盖两个时段(如上午/夜间);
  2. 连续视频抽帧时每秒不超过 1 帧,相邻帧太相似没有信息增量;
  3. 采集后立刻粗筛一遍:模糊、过曝、无目标的直接删,省标注人力;
  4. 命名或分目录记录点位与时段信息,后续分析误报来源时有用。

六、数据不够就先迭代

不必等"标够一万张"再启动:先用 500 张训练 v1,上线试运行收集 badcase,把识别错的图回流成新标注,两周后训出 v2。实践里 v2 比 v1 常见能提升 5~10 个百分点——因为 badcase 恰恰是模型最缺的样本。小步快跑的数据飞轮,远比一次性囤数据高效。

延伸阅读:置信度阈值怎么调从 badcase 到新版本

想在自己的数据上训练这样的模型?训练平台私有化部署 + 成品模型货架,总有一款适合你。

联系我们获取方案 →