檢測(cè)數(shù)據(jù)集制作全指南:從標(biāo)注到VOC/COCO/YOLO格式轉(zhuǎn)換避坑)
做目標(biāo)檢測(cè)項(xiàng)目真正消耗時(shí)間的事情往往不是調(diào)模型而是做檢測(cè)數(shù)據(jù)集。圖片收集、標(biāo)注、格式轉(zhuǎn)換這三步每一個(gè)都能讓人踩坑標(biāo)了一周發(fā)現(xiàn)訓(xùn)練框架只認(rèn)COCO手里全是VOC的XML轉(zhuǎn)換腳本跑完訓(xùn)練直接loss爆炸一查是類別ID從0還是從1開(kāi)始弄錯(cuò)了再要么就是框全部偏移半截看著像原圖坐標(biāo)沒(méi)歸一化。這篇把整條流程從頭到尾捋一遍數(shù)據(jù)收集、標(biāo)注工具選型、VOC/COCO/YOLO三種格式的底層差異以及它們之間的互轉(zhuǎn)腳本和驗(yàn)證方法。給準(zhǔn)備做自定義檢測(cè)任務(wù)的開(kāi)發(fā)者一份能直接照著干的操作參考。1. 為什么明明有現(xiàn)成腳本格式轉(zhuǎn)換還是總出錯(cuò)先說(shuō)一個(gè)很多人沒(méi)想通的問(wèn)題VOC、COCO、YOLO都是目標(biāo)檢測(cè)的標(biāo)注格式網(wǎng)上轉(zhuǎn)換腳本一搜一大把為什么自己做還是會(huì)翻車因?yàn)槎鄶?shù)腳本只告訴你“轉(zhuǎn)過(guò)去”沒(méi)告訴你背后三種格式的“思維模式”完全不同。不理解差異轉(zhuǎn)過(guò)去也是錯(cuò)著用。1.1 三種格式到底差在哪不是只有“坐標(biāo)表示”不同VOC格式來(lái)自PASCAL VOC挑戰(zhàn)賽是XML文件每個(gè)目標(biāo)一個(gè)object節(jié)點(diǎn)框用xmin, ymin, xmax, ymax四個(gè)像素坐標(biāo)表示。這種格式最接近人類的自然直覺(jué)一個(gè)矩形的左上角和右下角。COCO格式來(lái)自微軟的COCO數(shù)據(jù)集用單個(gè)JSON文件管理所有圖片和標(biāo)注框用x, y, width, height表示即左上角坐標(biāo)加寬高。YOLO格式更特殊每個(gè)圖片對(duì)應(yīng)一個(gè)txt文本文件框用歸一化后的中心點(diǎn)坐標(biāo)加寬高表示。我經(jīng)常用生活里的東西來(lái)類比VOC像手寫的物品清單每個(gè)物品的擺放位置寫得清清楚楚COCO像一套標(biāo)準(zhǔn)檔案柜所有圖片是索引卡片標(biāo)注按條目歸檔找東西效率高YOLO像貼在快遞箱上的標(biāo)簽簡(jiǎn)短、歸一化、專門給特定流程用的。三種格式?jīng)]有絕對(duì)的誰(shuí)好誰(shuí)壞只有合不合適。VOC適合人工閱讀和檢查COCO適合大規(guī)模數(shù)據(jù)集管理YOLO適合Ultralytics系訓(xùn)練框架直接加載。這個(gè)差異看起來(lái)只是表示形式不同實(shí)際影響很大。比如VOC里一眼能看出某個(gè)框是不是超出圖像邊界COCO的JSON要寫腳本統(tǒng)計(jì)才能發(fā)現(xiàn)而YOLO的txt文件里全是0到1之間的小數(shù)光看文件根本沒(méi)法判斷框具體在哪。格式轉(zhuǎn)換從來(lái)不只是一個(gè)字段映射問(wèn)題背后是“坐標(biāo)系”、“類別ID規(guī)則”、“文件組織方式”三重轉(zhuǎn)換。1.2 一套流程打通的正確順序先定主格式再談互轉(zhuǎn)做數(shù)據(jù)集最忌諱一上來(lái)就“我最終要訓(xùn)練YOLO所以直接用YOLO格式標(biāo)注”。YOLO的txt文件不好人工檢查漏標(biāo)錯(cuò)標(biāo)很難發(fā)現(xiàn)。更合理的流程是先用一種方便檢查和編輯的格式完成標(biāo)注再把它作為主格式統(tǒng)一轉(zhuǎn)換成訓(xùn)練需要的格式。我自己習(xí)慣用VOC或者COCO作為主格式。如果是個(gè)人小項(xiàng)目推薦VOCXML結(jié)構(gòu)直觀LabelImg這類工具直接導(dǎo)出出了問(wèn)題可以用文本編輯器打開(kāi)看。如果是團(tuán)隊(duì)協(xié)作或者標(biāo)注數(shù)據(jù)量大推薦COCO一個(gè)JSON文件管理全部標(biāo)注寫腳本批量修改、統(tǒng)計(jì)、合并都方便。確定主格式后所有訓(xùn)練用的格式都從主格式派生這樣能保證“一個(gè)事實(shí)來(lái)源”不會(huì)出現(xiàn)改了一版標(biāo)注忘了同步的情況。整個(gè)流程的順序很關(guān)鍵收集圖片、清洗篩選、劃分訓(xùn)練集驗(yàn)證集、統(tǒng)一標(biāo)注、導(dǎo)出主格式、轉(zhuǎn)換成訓(xùn)練格式、可視化驗(yàn)證。順序一旦亂掉后期返工成本極高。比如先劃分?jǐn)?shù)據(jù)集再標(biāo)注可以避免訓(xùn)練集和驗(yàn)證集出現(xiàn)重復(fù)圖片先統(tǒng)一標(biāo)注規(guī)范再開(kāi)工可以避免多人標(biāo)注口徑不一致導(dǎo)致的返工。1.3 從幾個(gè)真實(shí)場(chǎng)景看數(shù)據(jù)集的來(lái)源差異我最近關(guān)注到的熱詞里鳥類目標(biāo)檢測(cè)、開(kāi)關(guān)閉合檢測(cè)、電力紅外數(shù)據(jù)集、傳送帶異物檢測(cè)、車輛檢測(cè)BDD100這些都屬于典型的自定義檢測(cè)場(chǎng)景。它們的共同點(diǎn)是公開(kāi)數(shù)據(jù)集很難完全覆蓋業(yè)務(wù)場(chǎng)景。鳥類檢測(cè)要面對(duì)復(fù)雜的野外背景和極大的目標(biāo)尺寸差異開(kāi)關(guān)閉合檢測(cè)要覆蓋不同光照、不同開(kāi)關(guān)面板型號(hào)電力紅外數(shù)據(jù)集的單通道圖像和普通RGB差異很大傳送帶異物檢測(cè)則要處理運(yùn)動(dòng)模糊、遮擋和實(shí)時(shí)性要求。這些場(chǎng)景下自采數(shù)據(jù)往往比網(wǎng)上找公開(kāi)數(shù)據(jù)更關(guān)鍵。不同場(chǎng)景的數(shù)據(jù)收集側(cè)重點(diǎn)也不同。室外場(chǎng)景優(yōu)先考慮天氣、光照、季節(jié)覆蓋工業(yè)場(chǎng)景優(yōu)先考慮不同產(chǎn)線、不同機(jī)位角度、不同型號(hào)紅外場(chǎng)景要確認(rèn)標(biāo)注時(shí)看的圖像和推理時(shí)輸入的一致性。這些差異直接影響標(biāo)注規(guī)范和后續(xù)模型泛化能力。理解自己場(chǎng)景的數(shù)據(jù)特點(diǎn)比拿著通用流程硬套重要得多。2. 數(shù)據(jù)收集好數(shù)據(jù)集是一半工程一半運(yùn)氣很多人做數(shù)據(jù)集第一步就錯(cuò)了下載幾個(gè)公開(kāi)數(shù)據(jù)集隨便挑一部分圖片就開(kāi)始標(biāo)注。結(jié)果訓(xùn)練出來(lái)在測(cè)試集上指標(biāo)還行一上真實(shí)環(huán)境就崩。數(shù)據(jù)收集階段的核心目標(biāo)是讓樣本分布盡量接近真實(shí)推理環(huán)境。2.1 業(yè)務(wù)實(shí)拍數(shù)據(jù)優(yōu)先公開(kāi)數(shù)據(jù)做補(bǔ)充我的經(jīng)驗(yàn)法則很簡(jiǎn)單盡量用真實(shí)業(yè)務(wù)場(chǎng)景下采集的數(shù)據(jù)。所謂真實(shí)場(chǎng)景指的是模型實(shí)際部署時(shí)會(huì)遇到的攝像頭位置、角度、分辨率、畫質(zhì)、環(huán)境復(fù)雜度和目標(biāo)形態(tài)。公開(kāi)數(shù)據(jù)集適合做預(yù)訓(xùn)練、補(bǔ)充背景多樣性、增加罕見(jiàn)角度樣本但永遠(yuǎn)不要讓它成為主力。舉個(gè)例子做一個(gè)傳送帶異物檢測(cè)數(shù)據(jù)集如果只用公開(kāi)的工業(yè)檢測(cè)圖片訓(xùn)練部署到實(shí)際產(chǎn)線上會(huì)發(fā)現(xiàn)光照變化、振動(dòng)模糊和不同異物形態(tài)讓模型完全失效。正確的做法是架設(shè)一臺(tái)與實(shí)際部署位姿一致的相機(jī)采集不同班次、不同物料、不同光照下的視頻再抽幀成圖片。鳥類檢測(cè)同理網(wǎng)圖大多是清晰大圖但實(shí)際監(jiān)控畫面里的鳥可能只有幾十像素不專門采集遠(yuǎn)距離場(chǎng)景模型根本學(xué)不會(huì)小目標(biāo)。這不是說(shuō)公開(kāi)數(shù)據(jù)沒(méi)用。公開(kāi)數(shù)據(jù)可以用來(lái)做“底座”比如先用大規(guī)模公開(kāi)數(shù)據(jù)集做預(yù)訓(xùn)練再用自采數(shù)據(jù)微調(diào)。但如果目標(biāo)是特定場(chǎng)景的檢測(cè)器自采數(shù)據(jù)必須占主導(dǎo)。2.2 質(zhì)量篩選的標(biāo)準(zhǔn)寧缺毋濫采集回來(lái)的圖片不能全進(jìn)標(biāo)注流程。我一般按以下幾個(gè)標(biāo)準(zhǔn)篩選清晰度運(yùn)動(dòng)模糊、失焦、嚴(yán)重壓縮噪點(diǎn)的圖片直接淘汰。重疊度視頻抽幀時(shí)相鄰幀高度相似需要去重否則訓(xùn)練集和驗(yàn)證集之間會(huì)出現(xiàn)“近重復(fù)圖像”評(píng)估結(jié)果虛高。完整性圖片里目標(biāo)主體嚴(yán)重殘缺、幾乎不可辨識(shí)的單獨(dú)處理或刪除。代表性如果場(chǎng)景的攝像頭是俯視的就不要用大量平視角度的圖片填充樣本比例差異過(guò)大會(huì)誤導(dǎo)模型學(xué)習(xí)???qǐng)D處理完全沒(méi)有目標(biāo)的“背景圖”也有價(jià)值可以作為負(fù)樣本或者背景多樣性的補(bǔ)充但不要混在正常標(biāo)注文件里。YOLO里一張沒(méi)有目標(biāo)的圖對(duì)應(yīng)的txt空文件訓(xùn)練時(shí)就是純背景樣本可以用但要在data.yaml或者訓(xùn)練配置里確認(rèn)是否包含。這個(gè)階段我還會(huì)統(tǒng)一圖片格式和文件名全部轉(zhuǎn)成jpg、按語(yǔ)義命名加序號(hào)。文件名里不要帶空格和中文這個(gè)習(xí)慣能省下之后做格式轉(zhuǎn)換時(shí)的大量路徑問(wèn)題。2.3 類別分布、訓(xùn)練驗(yàn)證劃分和負(fù)樣本怎么處理數(shù)據(jù)收集階段就要想清楚類別分布。檢測(cè)任務(wù)的類別不平衡非常常見(jiàn)傳送帶異物檢測(cè)里“正常物料”的負(fù)樣本可能占90%真正的異物類別只占很小比例。這種情況下有兩個(gè)選擇一是盡量擴(kuò)大異物類別的采樣提高少數(shù)類占比二是在訓(xùn)練時(shí)設(shè)置類別權(quán)重或者使用focal loss這類損失函數(shù)。做數(shù)據(jù)集時(shí)能做的就是盡量讓每個(gè)類別都有足夠的正樣本。單類目標(biāo)檢測(cè)我的經(jīng)驗(yàn)是起步至少幾百個(gè)標(biāo)注目標(biāo)目標(biāo)形態(tài)多樣、背景復(fù)雜的情況下最好上千。多類檢測(cè)每類盡量不少于幾百個(gè)實(shí)例更穩(wěn)妥。訓(xùn)練集、驗(yàn)證集的劃分要在標(biāo)注前完成。先在圖片層面劃分再分別標(biāo)注。給每個(gè)類別做一份“標(biāo)注清單”清單里包含圖片ID、目標(biāo)數(shù)量、大致目標(biāo)大小這樣劃分訓(xùn)練集和驗(yàn)證集時(shí)能保證類別分布基本一致。負(fù)樣本單獨(dú)建目錄或者用空標(biāo)注文件標(biāo)記不要直接塞進(jìn)某個(gè)類別的目錄。一個(gè)容易忽略的細(xì)節(jié)訓(xùn)練集和驗(yàn)證集不能有來(lái)自同一段視頻連續(xù)幀的圖片否則驗(yàn)證集算出來(lái)的mAP會(huì)虛高。視頻抽幀時(shí)先按時(shí)間窗口粗篩把連續(xù)幀放在一起再按場(chǎng)景斷開(kāi)后劃分。3. 標(biāo)注工具怎么選標(biāo)注規(guī)范怎么寫標(biāo)注工具選型取決于項(xiàng)目規(guī)模、團(tuán)隊(duì)協(xié)作方式、以及你是否需要實(shí)例分割或者多邊形標(biāo)注。工具選對(duì)了效率差非常多。3.1 主流標(biāo)注工具橫向?qū)Ρ任覍?shí)際用過(guò)、也看團(tuán)隊(duì)用過(guò)的工具主要有下面這幾個(gè)各有優(yōu)勢(shì)工具適用場(chǎng)景導(dǎo)出格式核心優(yōu)勢(shì)LabelImg個(gè)人單機(jī)快速標(biāo)注VOC XML、YOLO txt輕量、上手快、VOC格式兼容最好Labelme需要多邊形/實(shí)例分割標(biāo)注JSON可轉(zhuǎn)COCO/VOC支持多邊形、適合分割任務(wù)CVAT團(tuán)隊(duì)協(xié)作、Web平臺(tái)VOC、COCO、YOLO、CVAT自有格式多人并行、項(xiàng)目管理、自動(dòng)標(biāo)注插件X-AnyLabeling個(gè)人自動(dòng)輔助標(biāo)注VOC、COCO、YOLO等集成檢測(cè)/分割模型可以預(yù)標(biāo)注后人工修正Roboflow在線協(xié)作平臺(tái)YOLO、COCO、TFRecord等內(nèi)置增強(qiáng)、格式轉(zhuǎn)換、版本管理個(gè)人項(xiàng)目如果只是畫矩形做檢測(cè)LabelImg是最省心的選擇。它界面簡(jiǎn)單打開(kāi)圖片畫框選類別能直接導(dǎo)出VOC XML或者YOLO txt。要注意LabelImg默認(rèn)輸出XML時(shí)圖片路徑是絕對(duì)路徑多人協(xié)作時(shí)容易出問(wèn)題建議導(dǎo)出后統(tǒng)一用腳本處理成相對(duì)路徑。團(tuán)隊(duì)協(xié)作場(chǎng)景我更推薦CVAT。它做完一輪標(biāo)注后能自動(dòng)把同一樣本分配給不同人抽檢還支持用已有模型做預(yù)標(biāo)注人工只負(fù)責(zé)修正。這套流程對(duì)工業(yè)場(chǎng)景的數(shù)據(jù)集制作非常有用等于是先用一個(gè)粗糙模型跑一遍再人工精修標(biāo)注成本能降一半以上。3.2 標(biāo)注規(guī)范5條鐵律標(biāo)注規(guī)范必須在開(kāi)工前寫清楚尤其是多人團(tuán)隊(duì)。我自己的標(biāo)注手冊(cè)里固定寫這幾條框要貼合目標(biāo)邊緣不要包含過(guò)多背景。目標(biāo)占畫面很小的時(shí)候?qū)幙煽虻镁o一點(diǎn)。遮擋目標(biāo)標(biāo)注可見(jiàn)部分不要硬框一個(gè)包含大量遮擋物的框。如果大部分都看不見(jiàn)可以漏標(biāo)不要制造污染框。邊界截?cái)嗄繕?biāo)照常標(biāo)注框與圖像邊緣對(duì)齊即可。類別名嚴(yán)格統(tǒng)一大小寫敏感。Bird和bird在代碼里是兩個(gè)類別這種錯(cuò)誤在標(biāo)注階段就能杜絕。每個(gè)目標(biāo)只標(biāo)一次一個(gè)對(duì)象出現(xiàn)兩個(gè)重疊框是最常見(jiàn)的低級(jí)錯(cuò)誤。還有一個(gè)經(jīng)驗(yàn)標(biāo)注的時(shí)候給每個(gè)類別分配一個(gè)固定快捷鍵減少鼠標(biāo)點(diǎn)擊。當(dāng)天標(biāo)完批量檢查一遍別攢到最后一起看。3.3 標(biāo)注質(zhì)量抽檢方案標(biāo)注完不是直接進(jìn)入格式轉(zhuǎn)換必須先做質(zhì)量抽檢。抽檢不是隨機(jī)看幾張我建議按類別分層抽樣每個(gè)類別至少抽20張圖標(biāo)注者之間交換檢查。重點(diǎn)看框的貼合度、漏標(biāo)比例、類別誤標(biāo)比例。漏標(biāo)比錯(cuò)標(biāo)更致命。模型會(huì)把漏標(biāo)的目標(biāo)當(dāng)成背景去學(xué)直接影響召回率。抽檢時(shí)把標(biāo)注框隱藏先人工點(diǎn)一遍圖里的目標(biāo)再打開(kāi)標(biāo)注框?qū)Ρ瓤绰┝苏l(shuí)。這個(gè)操作比較費(fèi)時(shí)間但值得做。還可以寫一個(gè)統(tǒng)計(jì)腳本檢查每張圖的標(biāo)注數(shù)量分布、框面積分布、框是否越界。發(fā)現(xiàn)異常的圖單獨(dú)拉出來(lái)人工復(fù)核。4. 三種格式的詳細(xì)拆解VOC、COCO、YOLO理解了格式底層結(jié)構(gòu)轉(zhuǎn)換腳本才能寫得穩(wěn)。這一章把三種格式徹底講透后面的代碼才能看得明白。4.1 VOCXML、一種容易“看穿”的格式VOC的目錄結(jié)構(gòu)一般是VOCdevkit/ ├── VOC2007/ │ ├── JPEGImages/ │ ├── Annotations/ │ ├── ImageSets/ │ │ └── Main/ │ │ ├── train.txt │ │ └── val.txtJPEGImages放圖片Annotations放XML標(biāo)注文件ImageSets/Main放劃分文件里面每行是一個(gè)不帶擴(kuò)展名的圖片文件名。XML的核心結(jié)構(gòu)長(zhǎng)這樣annotation folderJPEGImages/folder filename000001.jpg/filename size width1920/width height1080/height depth3/depth /size object namecat/name difficult0/difficult bndbox xmin100/xmin ymin120/ymin xmax380/xmax ymax420/ymax /bndbox /object /annotationVOC XML里最容易記錯(cuò)的就是size必須和實(shí)際圖片分辨率一致。如果標(biāo)注時(shí)用的是縮放后的預(yù)覽圖寫進(jìn)XML的坐標(biāo)和尺寸就不匹配轉(zhuǎn)換出來(lái)的YOLO格式全是帶偏移的。另一個(gè)點(diǎn)是difficult字段1表示這個(gè)目標(biāo)很難辨識(shí)很多轉(zhuǎn)換腳本會(huì)直接跳過(guò)。是否保留difficult目標(biāo)要在轉(zhuǎn)換前想清楚我一般選擇丟棄訓(xùn)練時(shí)更干凈。4.2 COCOJSON的靈活性和它的3個(gè)易錯(cuò)點(diǎn)COCO格式把一個(gè)數(shù)據(jù)集的所有信息塞進(jìn)一個(gè)JSON文件最外層通常包含info、licenses、images、annotations、categories五個(gè)字段。核心是后面三個(gè){ images: [ {id: 1, file_name: 000001.jpg, width: 1920, height: 1080} ], annotations: [ {id: 1, image_id: 1, category_id: 3, bbox: [100, 120, 280, 300], area: 84000, iscrowd: 0} ], categories: [ {id: 1, name: cat, supercategory: none} ] }COCO有三個(gè)特別容易踩的坑。第一category_id從1開(kāi)始不是從0開(kāi)始因?yàn)?常被當(dāng)作背景。第二bbox的格式是[x, y, width, height]其中x, y是左上角坐標(biāo)不是中心點(diǎn)。第三annotations里每條的id要求全局唯一且通常從1開(kāi)始遞增如果重復(fù)或者從0開(kāi)始pycocotools加載時(shí)行為不可預(yù)期。另外COCO的area字段在標(biāo)準(zhǔn)數(shù)據(jù)集里是分割區(qū)域的真實(shí)面積但如果只用矩形框做檢測(cè)直接用width * height算也可以。做實(shí)例分割再需要精細(xì)的area就得從polygon計(jì)算了。4.3 YOLO看起來(lái)最簡(jiǎn)單坑在歸一化和類別IDYOLO格式的標(biāo)簽是每個(gè)圖片對(duì)應(yīng)一個(gè)txt文件文件名和圖片名相同擴(kuò)展名是.txt。每一行表示一個(gè)目標(biāo)class_id x_center y_center width height其中坐標(biāo)全部是相對(duì)于圖片寬高的歸一化數(shù)值取值在0到1之間。中心點(diǎn)坐標(biāo)是(xmin xmax) / 2 / image_width這樣的形式。同時(shí)Ultralytics的YOLO訓(xùn)練通常還需要一個(gè)data.yaml文件定義類別名、類別數(shù)量和路徑path: ../datasets/your_dataset train: images/train val: images/val nc: 2 names: [cat, dog]YOLO格式最大的坑就在類別ID從0開(kāi)始而COCO從1開(kāi)始。所以COCO轉(zhuǎn)YOLO時(shí)category_id要減1VOC轉(zhuǎn)YOLO時(shí)classes列表的索引要嚴(yán)格對(duì)應(yīng)訓(xùn)練配置里的names順序。這個(gè)減1操作漏了訓(xùn)練時(shí)類別錯(cuò)位損失函數(shù)會(huì)亂套。還有一個(gè)很容易出錯(cuò)的地方txt標(biāo)簽文件里的坐標(biāo)要求嚴(yán)格在0到1之間但很多原始標(biāo)注框截?cái)嗟綀D片邊緣后計(jì)算出的歸一化坐標(biāo)依然可能因?yàn)楦↑c(diǎn)誤差略大于1或者因?yàn)樽鴺?biāo)是負(fù)的而小于0。所以轉(zhuǎn)換時(shí)最好做一次clip操作。4.4 三種格式參數(shù)對(duì)照速查表對(duì)比項(xiàng)VOCCOCOYOLO文件組織XML文件 圖片文件單個(gè)JSON文件每圖一個(gè)txt文件框表示xmin, ymin, xmax, ymaxx, y, width, heightx_center, y_center, width, height坐標(biāo)系像素坐標(biāo)像素坐標(biāo)歸一化坐標(biāo)取值0~1類別ID起始由程序決定10圖片尺寸來(lái)源XML里size字段JSON里image字段依賴txt本身需從圖片讀取空標(biāo)注表示無(wú)object節(jié)點(diǎn)或文件不存在對(duì)應(yīng)image沒(méi)有annotations空txt文件常用框架老牌檢測(cè)框架、VOC評(píng)測(cè)腳本Detectron2、MMDetection、pycocotoolsUltralytics YOLO、Darknet這張表建議存下來(lái)寫轉(zhuǎn)換腳本的時(shí)候?qū)φ罩茨鼙苊庖话胍陨系牡图?jí)錯(cuò)誤。5. 格式互轉(zhuǎn)實(shí)戰(zhàn)核心代碼與驗(yàn)證方法工具和規(guī)范都定了主格式也選好了接下來(lái)進(jìn)入最關(guān)鍵的實(shí)操環(huán)節(jié)。以下代碼基于Python依賴標(biāo)準(zhǔn)庫(kù)加一個(gè)opencv-python任何常規(guī)深度學(xué)習(xí)環(huán)境都能跑。5.1 VOC轉(zhuǎn)YOLO標(biāo)注歸一化的完整腳本VOC轉(zhuǎn)YOLO是最常見(jiàn)的需求。核心邏輯就三步讀XML、取坐標(biāo)、歸一化寫txt。import os import glob import xml.etree.ElementTree as ET CLASSES [cat, dog, bird] # 順序必須和訓(xùn)練yaml里的names一致 def voc_to_yolo(xml_dir, labels_dir): os.makedirs(labels_dir, exist_okTrue) for xml_path in glob.glob(os.path.join(xml_dir, *.xml)): tree ET.parse(xml_path) root tree.getroot() size root.find(size) img_w int(size.find(width).text) img_h int(size.find(height).text) if img_w 0 or img_h 0: print(f[skip] {xml_path} 圖像尺寸為0) continue filename os.path.splitext(os.path.basename(xml_path))[0] out_path os.path.join(labels_dir, filename .txt) lines [] for obj in root.findall(object): name obj.find(name).text if name not in CLASSES: continue cls_id CLASSES.index(name) box obj.find(bndbox) xmin float(box.find(xmin).text) ymin float(box.find(ymin).text) xmax float(box.find(xmax).text) ymax float(box.find(ymax).text) xmin max(xmin, 0) ymin max(ymin, 0) xmax min(xmax, img_w) ymax min(ymax, img_h) if xmax xmin or ymax ymin: continue x_center (xmin xmax) / 2.0 / img_w y_center (ymin ymax) / 2.0 / img_h width (xmax - xmin) / img_w height (ymax - ymin) / img_h lines.append(f{cls_id} {x_center:.6f} {y_center:.6f} {width:.6f} {height:.6f}) with open(out_path, w) as f: f.write(\n.join(lines)) voc_to_yolo(path/to/Annotations, path/to/labels)這段代碼有兩個(gè)關(guān)鍵點(diǎn)需要說(shuō)明。一是類別順序CLASSES里列表的索引就是YOLO的class id必須和后續(xù)訓(xùn)練時(shí)data.yaml里的names順序嚴(yán)格一致否則類別就對(duì)不上號(hào)了。二是clip操作原始標(biāo)注可能有輕微越界比如坐標(biāo)是-2或者1930直接歸一化會(huì)產(chǎn)生負(fù)數(shù)或大于1的值后面YOLO訓(xùn)練會(huì)警告甚至報(bào)錯(cuò)所以先clip到圖片范圍內(nèi)再計(jì)算。5.2 VOC轉(zhuǎn)COCOJSON結(jié)構(gòu)構(gòu)建細(xì)節(jié)VOC轉(zhuǎn)COCO腳本不復(fù)雜但JSON結(jié)構(gòu)的每一個(gè)字段都不能省。下面是一個(gè)可以直接用的版本import json import glob import os import xml.etree.ElementTree as ET def voc_to_coco(xml_dir, json_path, classes): images [] annotations [] categories [ {id: i 1, name: name, supercategory: none} for i, name in enumerate(classes) ] ann_id 1 for img_id, xml_path in enumerate(glob.glob(os.path.join(xml_dir, *.xml)), start1): tree ET.parse(xml_path) root tree.getroot() filename root.find(filename).text size root.find(size) width int(size.find(width).text) height int(size.find(height).text) images.append({ id: img_id, file_name: filename, width: width, height: height, }) for obj in root.findall(object): name obj.find(name).text if name not in classes: continue category_id classes.index(name) 1 box obj.find(bndbox) xmin float(box.find(xmin).text) ymin float(box.find(ymin).text) xmax float(box.find(xmax).text) ymax float(box.find(ymax).text) w xmax - xmin h ymax - ymin if w 0 or h 0: continue annotations.append({ id: ann_id, image_id: img_id, category_id: category_id, bbox: [xmin, ymin, w, h], area: w * h, iscrowd: 0, }) ann_id 1 coco { info: {description: converted by voc_to_coco}, images: images, annotations: annotations, categories: categories, } with open(json_path, w) as f: json.dump(coco, f, indent2) voc_to_coco(path/to/Annotations, output.json, CLASSES)這里注意幾個(gè)細(xì)節(jié)image_id我直接用了圖片在列表里的序號(hào)而annotation_id是單獨(dú)的全局計(jì)數(shù)器兩者千萬(wàn)不要混用。COCO的file_name建議只保留文件名不要帶JPEGImages/這類前綴后面訓(xùn)練時(shí)路徑拼接更靈活。如果XML里存在difficult1/difficult的目標(biāo)這個(gè)腳本沒(méi)有特殊處理需要的話加個(gè)判斷直接跳過(guò)。5.3 COCO轉(zhuǎn)YOLO注意圖片尺寸從哪里拿COCO轉(zhuǎn)YOLO恰恰是最容易出錯(cuò)的逆向流程因?yàn)镃OCO的bbox是像素坐標(biāo)YOLO要的是歸一化中心點(diǎn)坐標(biāo)而且COCO的尺寸信息在JSON的images字段里不在XML里。import json import os def coco_to_yolo(json_path, output_dir): with open(json_path) as f: coco json.load(f) os.makedirs(output_dir, exist_okTrue) cat_id_to_cls_id {cat[id]: idx for idx, cat in enumerate(coco[categories])} anns_by_image {} for ann in coco[annotations]: anns_by_image.setdefault(ann[image_id], []).append(ann) for img in coco[images]: img_id img[id] filename os.path.splitext(os.path.basename(img[file_name]))[0] width img[width] height img[height] anns anns_by_image.get(img_id, []) lines [] for ann in anns: x, y, w, h ann[bbox] cx x w / 2.0 cy y h / 2.0 cx / width cy / height w / width h / height cls_id cat_id_to_cls_id[ann[category_id]] lines.append(f{cls_id} {cx:.6f} {cy:.6f} {w:.6f} {h:.6f}) with open(os.path.join(output_dir, filename .txt), w) as f: f.write(\n.join(lines)) coco_to_yolo(annotations.json, labels)這個(gè)腳本里最關(guān)鍵的是拿到width和height。有些偷懶的COCO轉(zhuǎn)換腳本會(huì)從文件系統(tǒng)讀圖片尺寸但更好的做法是從JSON的images字段讀因?yàn)槟鞘菢?biāo)注時(shí)的基準(zhǔn)尺寸。如果標(biāo)注時(shí)的圖片尺寸和實(shí)際圖片文件尺寸不一致以JSON里的為準(zhǔn)否則轉(zhuǎn)換后框會(huì)漂移。還要注意cat_id_to_cls_id這個(gè)映射是必須的因?yàn)镃OCO的category_id從1開(kāi)始而YOLO的class id從0開(kāi)始。5.4 可視化校驗(yàn)一張圖驗(yàn)證全部轉(zhuǎn)換結(jié)果轉(zhuǎn)換完最怕的就是“看起來(lái)轉(zhuǎn)了實(shí)際上錯(cuò)了”。可視化校驗(yàn)是最直接有效的驗(yàn)證方式。我通常用它畫YOLO格式的標(biāo)簽import cv2 import os def draw_yolo_labels(image_path, label_path, classes, output_path): img cv2.imread(image_path) if img is None: print(fcannot read image: {image_path}) return h, w img.shape[:2] with open(label_path) as f: for line in f: parts line.strip().split() if len(parts) 5: continue cls_id int(parts[0]) cx, cy, bw, bh map(float, parts[1:5]) x1 int((cx - bw / 2) * w) y1 int((cy - bh / 2) * h) x2 int((cx bw / 2) * w) y2 int((cy bh / 2) * h) color [(0, 255, 0), (0, 0, 255), (255, 0, 0), (255, 255, 0)][cls_id % 4] cv2.rectangle(img, (x1, y1), (x2, y2), color, 2) cv2.putText(img, classes[cls_id], (x1, y1 - 5), cv2.FONT_HERSHEY_SIMPLEX, 0.6, color, 1) cv2.imwrite(output_path, img) classes [cat, dog, bird] draw_yolo_labels(images/000001.jpg, labels/000001.txt, classes, check_000001.jpg)把轉(zhuǎn)換后的txt標(biāo)簽繪制到原圖上和原始標(biāo)注對(duì)比一眼就能看出有沒(méi)有偏移。我檢查時(shí)會(huì)特別注意三條框是否貼住目標(biāo)邊緣、類別文字是否正確、是否有明顯的漏標(biāo)。如果批量轉(zhuǎn)換可以寫個(gè)循環(huán)一次畫幾十張保存到check目錄快速翻看。6. 常見(jiàn)問(wèn)題排查與實(shí)操避坑做數(shù)據(jù)集制作和格式轉(zhuǎn)換幾乎每個(gè)人都會(huì)遇到下面這類問(wèn)題。我把它們按現(xiàn)象歸類方便快速定位。6.1 “轉(zhuǎn)換后框全跑偏”類問(wèn)題的排查路徑框跑偏的原因說(shuō)白了就是坐標(biāo)變換時(shí)用錯(cuò)了基準(zhǔn)。最常見(jiàn)的有三種一是VOC的xmax, ymax被當(dāng)成寬高直接使用導(dǎo)致框的尺寸錯(cuò)誤二是COCO轉(zhuǎn)YOLO時(shí)忘記把x, y轉(zhuǎn)換成中心點(diǎn)直接用左上角當(dāng)中心點(diǎn)三是歸一化時(shí)用錯(cuò)了圖片尺寸把標(biāo)注時(shí)的預(yù)覽小圖尺寸和原始大圖尺寸混用了。排查時(shí)我一般先把坐標(biāo)打印出來(lái)手算一遍比如從VOC轉(zhuǎn)YOLO工具腳本里(xmin xmax) / 2 / img_w這一步輸出是否落在0到1之間。如果出現(xiàn)負(fù)數(shù)或者大于1說(shuō)明圖片尺寸獲取有問(wèn)題或者XML里的size字段本身和圖片不一致。一條條檢查不要猜。還有一種隱蔽情況COCO轉(zhuǎn)YOLO時(shí)COCO JSON里的bbox有時(shí)不是嚴(yán)格的[x, y, w, h]有些工具導(dǎo)出的數(shù)據(jù)可能把x, y記錄成了中心點(diǎn)。轉(zhuǎn)之前先隨機(jī)抽幾條打印看看確認(rèn)數(shù)據(jù)規(guī)范再批量轉(zhuǎn)換。6.2 類別ID、圖片路徑、文件名這些細(xì)節(jié)坑類別ID是重災(zāi)區(qū)。COCO的category_id從1開(kāi)始YOLO的class_id從0開(kāi)始中間差1。很多腳本轉(zhuǎn)換后不檢查直接拿去訓(xùn)練結(jié)果第一個(gè)類別的目標(biāo)全被當(dāng)成第二個(gè)類別。有一個(gè)笨但有效的方法轉(zhuǎn)換后隨機(jī)挑選幾個(gè)類別目標(biāo)打印class_id和類別名逐個(gè)人工核對(duì)。圖片路徑問(wèn)題也常見(jiàn)。YOLO訓(xùn)練時(shí)data.yaml里的train和val路徑如果用絕對(duì)路徑換機(jī)器或者換項(xiàng)目目錄就會(huì)失效。我習(xí)慣在訓(xùn)練腳本里通過(guò)項(xiàng)目根目錄動(dòng)態(tài)拼接路徑或者把data.yaml寫在數(shù)據(jù)集目錄下用相對(duì)路徑引用。文件名里的坑更加隱蔽如果圖片是000001.jpg標(biāo)簽文件必須是000001.txt多一個(gè)空格、大小寫不一致都不行。Windows下批量重命名產(chǎn)生的1這類后綴也要提前清理。養(yǎng)成一個(gè)習(xí)慣標(biāo)注前先把所有圖片統(tǒng)一重命名為純數(shù)字或者純英文小寫。6.3 訓(xùn)練前的最后一輪自查清單格式轉(zhuǎn)換完、開(kāi)始訓(xùn)練前花五分鐘跑一遍自查能省下后面調(diào)試訓(xùn)練的好幾個(gè)小時(shí)圖片目錄、標(biāo)簽?zāi)夸浀奈募灰粚?duì)應(yīng)沒(méi)有多余的孤兒文件。每個(gè)txt文件的行數(shù)大于0除非你有意保留負(fù)樣本空文件格式是cls cx cy w h。label文件中所有坐標(biāo)都在0到1之間沒(méi)有負(fù)數(shù)、沒(méi)有大于1。類別ID都小于data.yaml里的nc沒(méi)有越界。隨機(jī)畫了至少10張圖框的位置、類別名都正確。如果用了預(yù)訓(xùn)練模型權(quán)重確認(rèn)權(quán)重對(duì)應(yīng)的類別數(shù)量和你自己的數(shù)據(jù)集類別數(shù)量一致不一致時(shí)要么裁掉分類頭要么從頭訓(xùn)練。這些檢查聽(tīng)起來(lái)瑣碎但每一個(gè)坑我都真金白銀踩過(guò)。尤其最后一條YOLO訓(xùn)練時(shí)如果nc不匹配預(yù)訓(xùn)練權(quán)重有時(shí)會(huì)報(bào)錯(cuò)有時(shí)不報(bào)錯(cuò)但loss在訓(xùn)練初期就劇烈波動(dòng)最后模型輸出類別錯(cuò)亂。與其花時(shí)間Debug訓(xùn)練過(guò)程不如把檢查做在前面。7. 一點(diǎn)個(gè)人體會(huì)寫了這么多最后分享一個(gè)我自己養(yǎng)成的工作習(xí)慣無(wú)論是個(gè)人小項(xiàng)目還是團(tuán)隊(duì)協(xié)作我都會(huì)建一個(gè)“數(shù)據(jù)集主目錄”里面至少包含原始圖片、主格式標(biāo)注、訓(xùn)練格式標(biāo)注、可視化檢查四個(gè)子目錄。所有轉(zhuǎn)換腳本都從主格式標(biāo)注目錄讀禁止任何人直接修改訓(xùn)練格式目錄里的文件。這樣即使中間轉(zhuǎn)換出了問(wèn)題也能隨時(shí)回到主格式重新生成不會(huì)越改越亂。這種方式幫我省掉的返工時(shí)間比我做數(shù)據(jù)集標(biāo)注的時(shí)間還多。標(biāo)注和格式轉(zhuǎn)換看起來(lái)是“臟活累活”但恰恰是檢測(cè)項(xiàng)目里最值得花心思的部分。數(shù)據(jù)對(duì)了模型訓(xùn)練再怎么折騰都有兜底數(shù)據(jù)錯(cuò)了再先進(jìn)的模型結(jié)構(gòu)也只是在錯(cuò)誤的前提上打轉(zhuǎn)。希望這篇能幫你少踩一些我當(dāng)年踩過(guò)的坑。