:VOC格式轉(zhuǎn)YOLO目標檢測訓練與避坑指南)
簡介YOLO目標檢測-共享單車檢測數(shù)據(jù)集面向計算機視覺學習者與開發(fā)者可用于YOLO系列模型的共享單車識別、定位與計數(shù)服務(wù)于城市交通監(jiān)管及共享單車調(diào)度場景。壓縮包共272個文件包含136張JPG圖片與136個VOC格式的XML標注文件標注了邊界框坐標和類別信息包體約90.08MB規(guī)模適中方便快速試驗。目前已有107人學習使用適合作為目標檢測實戰(zhàn)訓練與效果對比的基準數(shù)據(jù)。圖片采集自不同城市環(huán)境覆蓋多種光照、視角和背景共享單車的顏色、品牌及使用狀態(tài)也較為多樣有助于提高模型泛化能力?;谠摂?shù)據(jù)集可完成數(shù)據(jù)加載、模型訓練、參數(shù)優(yōu)化和效果評估等流程訓練所得模型可部署于固定或車載攝像頭支撐共享單車實時監(jiān)測與高效調(diào)度。1. 共享單車檢測數(shù)據(jù)集為什么說它是 YOLO 目標檢測里最典型的單類落地項目打開 .rar 之前先回答一個問題共享單車檢測在 YOLO 目標檢測里屬于什么難度檔位答案是入門偏上一點點。類別只有一個不像城市道路檢測那樣需要同時區(qū)分行人、汽車、卡車但目標角度變化大俯拍、側(cè)拍、斜拍都有車輛堆疊遮擋嚴重這又比純單類物體檢測難不少。這份數(shù)據(jù)集的價值在于把最麻煩的數(shù)據(jù)準備環(huán)節(jié)壓縮成兩件事給你圖片和 VOC 格式標簽然后由你把標簽轉(zhuǎn)成 YOLO 能吃的格式并跑通訓練閉環(huán)。VOC 的 XML 標注是很多老項目沉淀下來的標準格式而 YOLO 訓練讀的是歸一化 txt這中間那道轉(zhuǎn)換工序決定了后面 pytorch 訓練到底是順風順水還是連環(huán)翻車。適合誰看就是準備做亂停放檢測、特定車輛識別、或第一次拿真實標注數(shù)據(jù)跑通 yolov5 / yolov8 訓練流程的開發(fā)者。2. 解開 .rar 先看目錄VOC 標簽與 YOLO 訓練之間的那道轉(zhuǎn)換工序拿到壓縮包第一件事不是解壓就訓練而是先把目錄結(jié)構(gòu)看明白。共享單車檢測這類單類項目目錄一般長這樣images 目錄放原圖annotations 目錄放同名 XMLXML 就是 VOC 格式標簽。YOLO 訓練時讀取的是一個 txt 標簽加一張圖片的配對關(guān)系所以中間隔著一道轉(zhuǎn)換工序。這道工序本身不難但百分之八十的問題都發(fā)生在轉(zhuǎn)換前后的數(shù)據(jù)檢查上而不是訓練命令寫錯。2.1 共享單車檢測的標注特點單類目標為什么仍然要小心標注共享單車在檢測任務(wù)里屬于中等尺寸目標比人臉大比卡車小通常占圖片面積的 2% 到 15%。正因為類別單一很多人容易忽視一個事實單類檢測的難度集中在形態(tài)變化和遮擋上。同一輛共享單車側(cè)視圖是一橫條俯視圖是一個接近方形的輪廓斜 45 度拍的時候車把、車座、車輪互相重疊。把這些圖合在一起訓練模型實際上學到的是“像共享單車的幾何結(jié)構(gòu)”這個抽象特征而不是某個固定寬高比的模板。所以 VOC 標簽里的 bndbox 是否緊貼車體直接決定了模型學到的特征里有多少背景噪聲??虼罅税崖访妗⒕G化帶、其他車輛都包進來YOLO 的損失函數(shù)會努力去擬合一個不干凈的邊界框小了車把或后輪被切掉模型學到的特征不完整。從算法角度看YOLO 把圖像劃分成網(wǎng)格每個網(wǎng)格負責預測目標中心落在自己格子里的框。它回歸的是中心點坐標和寬高不是像素分割。這意味著標簽里的坐標精度會被模型直接學習并放大。標簽差幾個像素最終預測框也會差幾個像素放在亂停放檢測場景里可能無所謂但如果后續(xù)要做停車區(qū)域判斷框偏了就容易造成誤判。2.2 VOC 格式的 XML 字段bndbox 四個像素坐標是一切轉(zhuǎn)換的基準VOC 格式來自 Pascal VOC 數(shù)據(jù)集后來被大量標注工具沿用下來。打開一個 XML 文件內(nèi)容通常長這樣annotation folderimages/folder filenameshared_bike_001.jpg/filename size width1280/width height720/height depth3/depth /size object namebicycle/name truncated0/truncated difficult0/difficult bndbox xmin356/xmin ymin189/ymin xmax674/xmax ymax511/ymax /bndbox /object /annotation重點看三塊。第一size 字段里的 width 和 height這是圖片的真實尺寸后面做歸一化全靠它。第二object 里的 name這就是類別名不同標注員可能寫成 bicycle、SharedBike、共享單車轉(zhuǎn)換前必須統(tǒng)一。第三bndbox 里的 xmin、ymin、xmax、ymax這四個值是像素坐標單位是像素不是歸一化數(shù)值。YOLO 的標簽格式則完全不同每一行是一類目標依次是類別 id、歸一化后的中心點 x、中心點 y、歸一化寬度 w、歸一化高度 h。比如0 0.402344 0.486111 0.248438 0.447222。這里的 0.402344 是把像素坐標除以圖片寬度得到的0.486111 是除以高度得到的。二者之間就是一個簡單的除法關(guān)系但無數(shù)人在這里踩坑因為一旦圖片被 resize 過而 XML 沒同步更新轉(zhuǎn)換出來的標簽就全部錯位。2.3 展開壓縮包后先做的三件事數(shù)量統(tǒng)計、缺失檢查、類名統(tǒng)一解壓后第一件事不是直接寫轉(zhuǎn)換腳本而是先統(tǒng)計這份共享單車數(shù)據(jù)集的實際狀態(tài)。我一般會跑一個小腳本把圖片和 XML 的對應(yīng)關(guān)系列出來import os from pathlib import Path data_root Path(共享單車數(shù)據(jù)集) images list(data_root.rglob(*.jpg)) list(data_root.rglob(*.png)) xmls list(data_root.rglob(*.xml)) img_names {p.stem for p in images} xml_names {p.stem for p in xmls} print(圖片數(shù)量:, len(images)) print(XML 數(shù)量:, len(xmls)) print(缺少 XML 的圖片:, len(img_names - xml_names))邏輯說明用 Path.rglob 遞歸找到所有 jpg、png 和 xml 文件再按文件主名求差集。圖片主名和 XML 主名一一對應(yīng)是 VOC 格式最基本的約定。如果打印出來的圖片數(shù)量和 XML 數(shù)量對不上先別急著轉(zhuǎn)換把缺失的那些圖片篩出來看一眼。常見情況是爬取的圖片里混入了一部分沒有標注的樣本這時候要么刪掉要么補標注放進去會讓訓練集出現(xiàn)大量“有圖無標簽”的負樣本干擾模型對正樣本的判斷。第二步是檢查類別名分布import xml.etree.ElementTree as ET from collections import Counter counter Counter() for xml_path in xmls: root ET.parse(xml_path).getroot() for obj in root.iter(object): counter[obj.findtext(name)] 1 print(counter)這段代碼把所有 XML 里的 object name 收集起來統(tǒng)計頻次。如果打印結(jié)果里有多個不同的名字比如{bicycle: 1520, 共享單車: 340, SharedBike: 120}說明這批標注來自不同標注員或不同來源轉(zhuǎn)換時必須合并成一個類別。不合并的話YOLO 會把這三種名字當成三個類別去訓練而你的數(shù)據(jù)集 YAML 里只寫了 nc1訓練時會直接報類別數(shù)不匹配或者強行按 3 類跑出一個沒法用的模型。第三步是可視化抽查。隨機挑幾張圖把 XML 里的框畫回原圖import cv2 import xml.etree.ElementTree as ET for xml_path in xmls[:5]: root ET.parse(xml_path).getroot() img_path str(xml_path.parent / root.findtext(filename)) img cv2.imread(img_path) for obj in root.iter(object): box obj.find(bndbox) x1, y1 int(box.findtext(xmin)), int(box.findtext(ymin)) x2, y2 int(box.findtext(xmax)), int(box.findtext(ymax)) cv2.rectangle(img, (x1, y1), (x2, y2), (0, 255, 0), 2) cv2.imwrite(fcheck_{xml_path.stem}.jpg, img)注意這里有個坑XML 里的 filename 字段不一定對得上實際文件名。有些數(shù)據(jù)集在整理時重命名了圖片但 XML 里還留著舊文件名直接用 root.findtext(filename) 拼接路徑會讀不到圖。更穩(wěn)妥的做法是用 XML 自己的主名去找同名圖片也就是img_path xml_path.with_suffix(.jpg)找不到再嘗試 .png。畫框結(jié)果保存成單獨文件人工翻一遍確認框的位置是否合理尤其是車頭車尾有沒有被切掉。這三步做完數(shù)據(jù)集的底細基本摸清了再進入轉(zhuǎn)換階段就有了底。3. VOC 轉(zhuǎn) YOLO 格式最小轉(zhuǎn)換腳本與三個必調(diào)參數(shù)VOC 轉(zhuǎn) YOLO 的方法網(wǎng)上有一堆現(xiàn)成工具但我更建議自己寫一個 30 行的腳本。原因很簡單共享單車數(shù)據(jù)集這種單類小項目現(xiàn)成工具往往帶了多余的處理邏輯比如自動劃分訓練集、自動增強、自動過濾空標注出了問題反而不好排查。自己寫腳本每一步都看得見。3.1 歸一化坐標的計算方式與轉(zhuǎn)換腳本核心轉(zhuǎn)換函數(shù)不復雜就是把 bndbox 的四個像素值轉(zhuǎn)成歸一化的中心點和寬高。下面這個腳本是通用的也適合其他 VOC 格式數(shù)據(jù)集import xml.etree.ElementTree as ET from pathlib import Path class_mapping { bicycle: 0, shared_bike: 0, 共享單車: 0, SharedBike: 0, } def voc_to_yolo(xml_path, out_path, img_width, img_height): root ET.parse(xml_path).getroot() lines [] for obj in root.iter(object): name obj.findtext(name) if name not in class_mapping: continue class_id class_mapping[name] box obj.find(bndbox) x1 float(box.findtext(xmin)) y1 float(box.findtext(ymin)) x2 float(box.findtext(xmax)) y2 float(box.findtext(ymax)) x_center ((x1 x2) / 2) / img_width y_center ((y1 y2) / 2) / img_height w (x2 - x1) / img_width h (y2 - y1) / img_height # 防止標注越界導致訓練報錯把數(shù)值夾到 0~1 之間 x_center min(max(x_center, 0.0), 1.0) y_center min(max(y_center, 0.0), 1.0) w min(max(w, 0.0), 1.0) h min(max(h, 0.0), 1.0) lines.append(f{class_id} {x_center:.6f} {y_center:.6f} {w:.6f} {h:.6f}) with open(out_path, w, encodingutf-8) as f: f.write(\n.join(lines))邏輯說明先從 XML 里找到所有 object讀取 name 和 bndbox。class_mapping 字典的作用是把多種寫法統(tǒng)一映射到類別 0。中心點坐標用(x1 x2) / 2求得像素中心再分別除以圖片寬和高完成歸一化。寬和高直接做差后除以圖片尺寸。最后的 clamp 操作是必須的因為部分標注框會超出圖片邊界如果不處理YOLO 訓練時可能因為坐標超出 0~1 范圍而報錯或產(chǎn)生 nan loss。調(diào)用時注意img_width 和 img_height 必須讀 XML 里 size 字段的值不能自己去讀圖片因為 XML 里的標注坐標就是依據(jù)這張圖當時的分辨率標出來的。如果 XML 寫的是 1280x720而實際圖片被壓縮成 800x450以實際圖片寬高做歸一化所有標簽都會偏。3.2 三個必調(diào)參數(shù)類名映射表、數(shù)據(jù)集劃分、路徑前綴第一個必調(diào)參數(shù)是類名映射表也就是 class_mapping。不同來源的共享單車數(shù)據(jù)集標注名字五花八門不統(tǒng)一的必須在這里合并。合并完之后可以用一個小循環(huán)把整個 annotations 目錄轉(zhuǎn)換掉label_root Path(labels) label_root.mkdir(exist_okTrue) for xml_path in xmls: root ET.parse(xml_path).getroot() size root.find(size) img_w int(size.findtext(width)) img_h int(size.findtext(height)) out_path label_root / f{xml_path.stem}.txt voc_to_yolo(xml_path, out_path, img_w, img_h)這里的參數(shù)要點是輸出文件主名與 XML 主名保持一致這樣每個 txt 都能通過主名找到對應(yīng)的圖片。如果輸出名和原圖對不上后面訓練時圖片路徑和標簽路徑匹配不上會直接報錯。第二個必調(diào)參數(shù)是訓練集和驗證集的劃分比例。共享單車數(shù)據(jù)集如果圖片數(shù)量在幾千張級別8:1:1 或 9:1 都合理。我的做法是固定隨機種子避免每次跑出來劃分結(jié)果不同import random from pathlib import Path random.seed(42) image_files list(Path(images).glob(*.jpg)) list(Path(images).glob(*.png)) random.shuffle(image_files) n len(image_files) train_ratio, val_ratio 0.8, 0.1 train_files image_files[: int(n * train_ratio)] val_files image_files[int(n * train_ratio): int(n * (train_ratio val_ratio))] def write_list(file_list, list_path): with open(list_path, w, encodingutf-8) as f: for p in file_list: f.write(str(p.resolve()) \n) write_list(train_files, train.txt) write_list(val_files, val.txt)random.seed(42) 保證每次運行劃分結(jié)果一致。這里有一個容易忽略的點如果這份共享單車數(shù)據(jù)集的圖片來自多個不同的拍攝地點按文件列表隨機劃分可能把同一地點的圖片同時分進訓練集和驗證集導致驗證指標虛高。更嚴格的做法是按目錄或按拍攝批次劃分先把同一來源的圖片分到同一組再從中切分。對于亂停放檢測這種場景同一街道同一角度拍的照片高度相似同源數(shù)據(jù)跨訓練驗證集mAP 會高得離譜但換到新場景立刻失靈。第三個必調(diào)參數(shù)是 train.txt 和 val.txt 里的路徑。YOLO 訓練時有兩種方式組織數(shù)據(jù)一種是直接用目錄結(jié)構(gòu)train 和 val 各自建 images 和 labels 子目錄另一種是提供 train.txt 和 val.txt每行寫圖片絕對路徑訓練時自動找同主名的 txt 標簽。我推薦后者因為共享單車數(shù)據(jù)集可能來自多個壓縮包合并后目錄結(jié)構(gòu)不一定規(guī)整。路徑寫成絕對路徑訓練時少一層糾結(jié)。3.3 轉(zhuǎn)換后的自查畫框驗證與類別統(tǒng)計轉(zhuǎn)換腳本跑完不代表轉(zhuǎn)換成功。檢查分三層數(shù)量層、格式層、可視化層。數(shù)量層檢查 labels 目錄下的 txt 數(shù)量是否與 XML 數(shù)量一致有沒有輸出空文件???txt 文件說明 XML 里沒有有效 object也許是被 class_mapping 過濾掉了也許是原有標注就是空的。格式層檢查隨便head幾個 txthead -3 labels/shared_bike_001.txt正常輸出應(yīng)該是五行中的前幾行每行由 5 個數(shù)字組成類別 id 是 0后面四位小數(shù)在 0 到 1 之間。如果出現(xiàn)負數(shù)或大于 1 的值說明轉(zhuǎn)換前的 clamp 沒加上??梢暬瘜影?YOLO txt 畫回圖片import cv2 from pathlib import Path for txt_path in Path(labels).glob(*.txt): img_path txt_path.with_suffix(.jpg) if not img_path.exists(): img_path txt_path.with_suffix(.png) if not img_path.exists(): continue img cv2.imread(str(img_path)) for line in txt_path.read_text().strip().splitlines(): parts line.split() if len(parts) ! 5: continue cls_id, xc, yc, w, h [float(v) for v in parts] x1 int((xc - w / 2) * img.shape[1]) y1 int((yc - h / 2) * img.shape[0]) x2 int((xc w / 2) * img.shape[1]) y2 int((yc h / 2) * img.shape[0]) cv2.rectangle(img, (x1, y1), (x2, y2), (0, 255, 0), 2) cv2.imwrite(verify_ txt_path.stem .jpg, img)這個腳本是轉(zhuǎn)換過程的逆運算把歸一化的中心點和寬高乘回圖片尺寸得到像素框畫出來。和 VOC 階段畫框不同的是這一步驗證的是 YOLO 標簽?zāi)芊癖徽_解析。建議抽查 30 到 50 張重點關(guān)注三類圖車輛密集的、嚴重遮擋的、光照很暗的。這些圖最容易暴露標簽錯位和漏標問題。做完自查數(shù)據(jù)端就算準備好了。4. 配置 YOLO 環(huán)境并訓練共享單車檢測yolov5 與 yolov8 都適用的最小閉環(huán)數(shù)據(jù)準備好之后進入訓練環(huán)節(jié)?,F(xiàn)在的 YOLO 生態(tài)里yolov8 是主力yolov5 還有大量老項目在用。兩者在數(shù)據(jù)組織方式上一致都是圖片加 txt 標簽只是環(huán)境配置和命令略有差異。下面按 yolov8 為主講順帶給出 yolov5 的對應(yīng)命令。4.1 anaconda 環(huán)境配置與預訓練權(quán)重準備訓練 YOLO 系列模型最省心的方式是建一個獨立的 conda 環(huán)境避免和系統(tǒng) Python 或其他項目的 torch 版本沖突。命令如下conda create -n yolo python3.10 -y conda activate yolo pip install ultralytics參數(shù)說明Python 3.10 是目前兼容性比較好的版本torch 和 ultralytics 都支持。pip install ultralytics 會同時裝上 torch、torchvision、opencv、pandas 等依賴。如果機器上已經(jīng)有其他項目的 torch不要直接在這個環(huán)境里復用版本不一致會出現(xiàn)算子不匹配之類的詭異報錯。安裝完成后確認 GPU 可用python -c import torch; print(torch.cuda.is_available())輸出 True 說明能用 GPU。只有 CPU 也能訓練但速度會慢很多。建議把數(shù)據(jù)集 YAML 里的路徑改成絕對路徑然后把 yolov8n.pt 預訓練權(quán)重提前放到當前目錄。沒有也沒關(guān)系ultralytics 在訓練時會自動下載前提是運行環(huán)境能訪問外網(wǎng)。預訓練權(quán)重的作用是讓模型從 COCO 數(shù)據(jù)集學到的特征作為初始值對于共享單車這種單類檢測任務(wù)可以顯著減少訓練輪數(shù)和過擬合風險。4.2 寫數(shù)據(jù)集 YAML 并啟動訓練數(shù)據(jù)集 YAML 是 YOLO 訓練讀取數(shù)據(jù)配置的唯一入口。創(chuàng)建 shared_bike.yaml# 共享單車檢測數(shù)據(jù)集配置 path: /home/user/shared_bike_dataset # 改成數(shù)據(jù)集解壓后的絕對路徑 train: train.txt val: val.txt nc: 1 names: [bicycle]train 和 val 這里寫的是相對 path 的文件名也可以直接寫絕對路徑。nc 是類別數(shù)量單類就是 1。names 列表里的名字要和 labels txt 里的類別 id 一一對應(yīng)只有一個類別時就是 0 對應(yīng) bicycle。啟動訓練yolo detect train modelyolov8n.pt datashared_bike.yaml epochs100 imgsz640 batch16 device0參數(shù)說明model 指定預訓練權(quán)重data 指定數(shù)據(jù)集配置epochs 是訓練輪數(shù)imgsz 是輸入圖片尺寸batch 是批量大小device0 表示用第一塊 GPU。共享單車在常見圖片尺寸下占圖比例不算小640 夠用。如果攝像頭畫面里共享單車離得遠、像素占得少可以提到 960代價是訓練時間變長。yolov5 的對應(yīng)命令寫法不同但邏輯一樣python train.py --data shared_bike.yaml --weights yolov5s.pt --img 640 --batch 16 --epochs 100訓練開始后終端會打印每一輪的 box_loss、cls_loss、dfl_loss、recall、mAP50 等指標。第一次跑建議把 epochs 設(shè)到 100然后開早停。數(shù)據(jù)量小或者單類目標通常到 60 到 80 輪就收斂了。另一個影響結(jié)果的關(guān)鍵參數(shù)是 batch。顯存夠大就往上加訓練速度更快BN 層的統(tǒng)計也更準。共享單車圖片分辨率普遍在 720p 以上batch16 需要 8GB 顯存左右如果報 CUDA out of memory降到 8yolo detect train modelyolov8n.pt datashared_bike.yaml epochs100 imgsz640 batch8 device04.3 訓練過程怎么看損失函數(shù)下降與 mAP 指標訓練跑起來之后不要只盯著終端滾動看。ultralytics 會把訓練過程寫入 runs/detect/train 目錄下的 results.csv用 pandas 讀出來更直觀import pandas as pd df pd.read_csv(runs/detect/train/results.csv) print(df.columns.tolist()) print(df[[train/box_loss, train/cls_loss, train/dfl_loss, metrics/mAP50(B)]].tail(5))yolov8 的損失函數(shù)分成三塊。box_loss 負責回歸框的位置和寬高如果它下降緩慢說明標簽坐標噪聲大或者學習率不合適。cls_loss 是分類損失單類模型也要關(guān)注因為模型本質(zhì)上在區(qū)分“共享單車”和“背景”。dfl_loss 是分布焦點損失控制框的邊界精確度。三項都在下降但不一定同步屬正?,F(xiàn)象。mAP50 是 IoU 閾值 0.5 下的平均精度單類項目主要看它。mAP50 能達到 0.8 以上說明模型已經(jīng)能穩(wěn)定檢出大部分目標。mAP50-95 會更嚴格它考察不同 IoU 閾值下的綜合表現(xiàn)這個值偏低不用太慌可能是標注框邊界畫得不緊也可能目標本身遮擋太嚴重模型只能給出大概范圍。訓練完成后權(quán)重文件保存在 runs/detect/train/weights/ 下best.pt 是驗證集上表現(xiàn)最好的權(quán)重last.pt 是最后一輪的權(quán)重。部署時用 best.pt不要用 last.pt除非你確認最后幾輪沒有過擬合。5. 避坑共享單車數(shù)據(jù)集訓練全流程的五個高頻翻車點整理五個我在這類單類目標檢測數(shù)據(jù)集上反復遇到的坑。每一條都是真實出現(xiàn)過的現(xiàn)象、原因、解決方式照單排查能省不少時間。5.1 現(xiàn)象檢測框整體偏移框完全不在共享單車上原因圖片在整理階段被統(tǒng)一 resize 過但 XML 里的 bndbox 坐標沒有同步縮放。比如原圖是 1920x1080標注坐標也是按這個尺寸標定的但數(shù)據(jù)集發(fā)布時把圖片壓成了 960x540XML 里的 size 字段卻還寫著 1920x1080。轉(zhuǎn)換腳本讀 size 做歸一化后標簽仍然和原圖坐標匹配但實際圖片已經(jīng)縮水訓練時模型看到的框和內(nèi)容對不上。解決轉(zhuǎn)換前用 Python 讀實際圖片的寬高和 XML size 字段對比。不一致時以實際圖片為準重新計算坐標。如果圖片已經(jīng)丟失原始數(shù)據(jù)就只能根據(jù)縮放比例去換算標注坐標比如 x 坐標乘 0.5、y 坐標乘 0.5。5.2 現(xiàn)象loss 降得很快但 mAP 上不去原因標注框過大把大量背景包了進來。共享單車數(shù)據(jù)集里常見的標注習慣是把車筐到后輪整個框住這沒問題但有些框連停車區(qū)域白線、旁邊的樹影都包進去了。YOLO 回歸的是整個框的內(nèi)容背景占比越高模型特征越模糊檢測框就會忽大忽小。解決回到可視化抽查環(huán)節(jié)把訓練集里預測置信度低于 0.5 的圖片集中看一遍框明顯偏大的重新標注。如果數(shù)據(jù)集量太大沒法重標可以寫腳本把每個框向內(nèi)收縮 5% 再訓練相當于強制讓模型關(guān)注更核心的目標區(qū)域。我試過對共享單車這類目標收縮 5% 到 8% 邊界后 mAP 能提升 3 個點左右。5.3 現(xiàn)象訓練時提示類別數(shù)不匹配或者訓練完成后預測出多個類別名原因數(shù)據(jù)集 YAML 里 nc1但 labels 目錄下生成的 txt 里出現(xiàn)了多個不同的類別 id。這種情況通常不是轉(zhuǎn)換腳本寫錯而是類名映射不完全。比如原始 XML 里有 bicycle、SharedBike、共享單車、共享電單車四種名字class_mapping 只映射了前三種共享電單車被過濾掉了但如果某個 XML 里共享電單車的名字被寫成了 “電動車”它不在映射表中會被直接跳過于是圖片和標簽錯位訓練數(shù)據(jù)里出現(xiàn)“有圖無標簽”的文件。解決轉(zhuǎn)換腳本不要用 continue 跳過未知類名而是把所有出現(xiàn)過的 name 打出來確認每一類都能對應(yīng)到正確類別。共享單車數(shù)據(jù)集最怕混入共享電單車兩者外形相似但屬于不同目標如果業(yè)務(wù)上需要把電單車也檢出來就應(yīng)該在映射表里給它單獨的類別 id而不是過濾掉。5.4 現(xiàn)象訓練中途報錯坐標值超出圖片范圍或者 loss 變成 nan原因XML 里有越界標注bndbox 的坐標超出了圖片寬高。這種標簽通常來自半自動標注工具少量框沒人工修正比如 xmax 大于圖片 widthymin 為負數(shù)。轉(zhuǎn)換后歸一化數(shù)值小于 0 或大于 1訓練進程計算 anchor 匹配時就會出錯。解決轉(zhuǎn)換腳本里的 clamp 已經(jīng)能把數(shù)值限制在 0~1 之間但更嚴謹?shù)淖龇ㄊ前言浇鐕乐氐臉颖締为毺舫鰜?。如?xmax 只比寬度大十幾像素clamp 修正后基本不影響結(jié)果如果整個框有一半在圖片外說明標注質(zhì)量有問題直接刪掉這張圖比強行修正更合理。加一個過濾條件是基本操作box_width x2 - x1 box_height y2 - y1 if box_width 10 or box_height 10: continue過濾掉過小的框能避免訓練時數(shù)值不穩(wěn)定。10 像素這個閾值按圖片分辨率調(diào)720p 以下取 5 也行。5.5 現(xiàn)象驗證集 mAP 接近 0.98但換到真實場景視頻里漏檢嚴重原因數(shù)據(jù)集劃分時沒有按拍攝來源分組。共享單車圖片往往按街道、小區(qū)、停車場分批次采集同一批次里同一角度連續(xù)拍攝的圖片高度相似。如果隨機劃分訓練集和驗證集里會出現(xiàn)大量近似重復的圖片模型其實記住了這些特定場景而不是學會檢測共享單車本身。解決回去檢查圖片的文件名或目錄結(jié)構(gòu)。一般情況下數(shù)據(jù)集發(fā)布時會按批次分目錄劃分 train 和 val 時先按目錄分組再把整個目錄分到一邊避免同場景圖片同時出現(xiàn)在兩邊。即使目錄信息不完整也可以用圖片文件名前綴或者拍攝時間字段做分組。驗證時再用一段新場景視頻測試mAP 虛高的假象會立刻暴露。6. 驗證共享單車檢測結(jié)果的三個技巧置信度門限與壞例回填訓練跑完只完成一半真正決定能不能用的是驗證環(huán)節(jié)。我通常不滿足于測試集上的 mAP而是拿三段不同時間、不同地點、不同光線條件的視頻跑一遍檢測。命令很簡單yolo detect predict modelruns/detect/train/weights/best.pt sourcetest_video.mp4 conf0.25source 可以是圖片、視頻或目錄conf 是置信度門限。這里就牽出第一個技巧門限不是拍腦袋定的。共享單車檢測的誤檢來源主要是電動車、摩托車和行人。電動車和共享單車同為兩輪交通工具在側(cè)面輪廓和車輪特征上極其相似conf 太低會把電動車當共享單車檢出來。我的做法是先用 conf0.05 跑一遍完整視頻導出所有檢測框和目標數(shù)量然后逐步提高到 0.1、0.25、0.5觀察檢出的目標數(shù)量何時出現(xiàn)斷崖式下降。如果某個門限下目標數(shù)量驟減說明大量真實目標被卡掉了門限要回退一檔。第二個技巧是專門挑壞例回填訓練集。把所有置信度在 0.3 到 0.6 之間的框抽出來人工看一眼。那些明明是正確的共享單車但模型不敢置信的圖copy 到訓練集中重新訓練一輪比盲目增加訓練輪數(shù)效果好得多。共享單車數(shù)據(jù)集的壞例主要集中在密集堆放場景兩輛車靠在一起時模型經(jīng)常只檢出一輛這類樣本補充 100 到 200 張效果立竿見影。第三個技巧是框的范圍要和業(yè)務(wù)場景對齊。如果最終目標是檢測亂停放標注時應(yīng)該只框車身不框車前的停車區(qū)域如果最終目標是統(tǒng)計某個路口的單車流量框可以稍微寬松一些減少漏檢。YOLO 學到的是框內(nèi)的特征分布框松緊直接影響后續(xù)評估。我自己做單車項目時曾為了省事讓標注員把框畫得隨意后來花了一周時間返工從那以后每次轉(zhuǎn)換完標簽都先畫幾十張圖肉眼確認。希望幫到你。本文還有配套的精品資源點擊獲取