:基于YOLO與PyTorch的深度學(xué)習(xí)方案)
簡介面向Python深度學(xué)習(xí)初學(xué)者的番茄葉片病害目標檢測完整項目基于YOLO與PyTorch實現(xiàn)涵蓋數(shù)據(jù)集制作、模型訓(xùn)練與PyQt可視化識別全流程。壓縮包共1470個文件、約40.55MB包含730張jpg葉片圖像、363個txt標簽、358個xml標注文件、3個YOLO配置文件、3個Python腳本及3個已訓(xùn)練模型pt權(quán)重其中數(shù)據(jù)劃分腳本可自動將原始標注轉(zhuǎn)為YOLO格式并生成訓(xùn)練/驗證集訓(xùn)練腳本輸出results.csv、驗證集預(yù)測圖與TensorBoard事件文件便于直觀評估模型效果。已有110人學(xué)習(xí)下載適合需要快速搭建植株病害識別實驗、熟悉YOLO訓(xùn)練流程或開展畢業(yè)設(shè)計/課程項目的讀者。通過運行代碼既能了解數(shù)據(jù)標注格式轉(zhuǎn)換與訓(xùn)練參數(shù)調(diào)優(yōu)方法也能直接使用PyQt界面加載圖片完成病害類別檢測是一份從理論到部署的綜合性參考樣例。1. 番茄葉片病害目標檢測別急著解壓跑模型先搞清楚這個方案在解決什么拿到“基于python深度學(xué)習(xí)對番茄葉片病害目標檢測-含數(shù)據(jù)集和代碼.zip”這個壓縮包我勸你別急著解壓敲訓(xùn)練命令。農(nóng)業(yè)視覺項目里決定模型能不能用的往往不是深度學(xué)習(xí)算法本身而是數(shù)據(jù)集里那些框得歪歪扭扭的標注。這個方案本身很直白輸入番茄葉片照片用 python 做目標檢測框出早疫病、晚疫病、細菌性斑點等病害的位置和類別輸出帶預(yù)測框和置信度的結(jié)果圖。它對應(yīng)的是農(nóng)業(yè)巡檢里的真實痛點人工逐葉翻看效率低病害特征又非常相似肉眼很容易把早疫病和晚疫病看混。適合誰的場景本科或研究生階段做農(nóng)業(yè)AI課題的學(xué)生想給溫室或大棚配一個低成本病害篩查工具的工程師以及剛接觸深度學(xué)習(xí)、恰好拿到一份帶數(shù)據(jù)集和代碼的初學(xué)者。在動手訓(xùn)練之前先想清楚模型選型、數(shù)據(jù)格式、訓(xùn)練參數(shù)、問題排錯、結(jié)果驗證這五步后面才能少走彎路。2. 選型決定省力程度目標檢測模型、框架與標注工具怎么配很多人拿到包含數(shù)據(jù)集和代碼的項目包第一反應(yīng)是“用什么模型更?!薄U鎸嵔?jīng)驗恰恰相反選型階段省下來的力氣最后都會在數(shù)據(jù)清洗階段加倍還回來。番茄葉片病害檢測有兩個明顯特征一是目標在整張圖里占比小葉片邊緣還有卷曲、陰影和露水反光二是病害類別之間的視覺差異極小早疫病和晚疫病都呈現(xiàn)為葉片上的同心環(huán)紋連人都容易看錯。這種場景下模型選型要優(yōu)先考慮標注成本低、迭代速度快、單卡能訓(xùn)練而不是單純追求 mAP 刷高多少。2.1 YOLO 為什么是番茄葉片的默認答案和 Faster R-CNN、SSD 放在一起看先給結(jié)論這類項目我一般會把 YOLO 系列作為默認選項只有特殊需求才回頭用兩階段檢測器。原因是病害檢測對“框得準”的要求遠低于“找得到、分得對”而 YOLO 把定位和分類放進同一個網(wǎng)絡(luò)里一次推理完成訓(xùn)練只需要一份標注框不用為候選區(qū)域生成額外寫采樣邏輯。Faster R-CNN 在極端小目標上有理論精度優(yōu)勢但訓(xùn)練時要跑 RPN顯存占用和單 epoch 耗時明顯更高SSD 處于兩者之間工程生態(tài)這些年幾乎不再更新遇到問題連可抄的教程都少。算法定位與分類方式單卡可訓(xùn)性工程生態(tài)適合場景Faster R-CNN兩階段先提候選框再分類一般顯存和耗時高成熟但配置繁瑣對精度極致敏感、機器資源充足SSD單階段多尺度預(yù)測較好更新停滯已有舊代碼要維護YOLO 系列單階段anchor-free 演進好顯存可控活躍教程和預(yù)訓(xùn)練權(quán)重最全病害檢測這類快速迭代項目選 YOLO 而不是更花哨的模型還有個務(wù)實原因預(yù)訓(xùn)練權(quán)重。COCO 上訓(xùn)出來的 YOLO 權(quán)重對葉片紋理、莖稈背景已經(jīng)有不錯的底層特征提取能力遷移到番茄病害上只需微調(diào)高層幾百張圖也能訓(xùn)出能看的初版。相比之下從零訓(xùn)練一個商業(yè)級模型同樣數(shù)據(jù)量往往連收斂方向都找不到。這項“借用預(yù)訓(xùn)練權(quán)重”的能力也是標題里“深度學(xué)習(xí)”三個字價值最大的地方。不過這里有個邊界要認清如果你最終要做的不只是框出病害還要統(tǒng)計病斑面積占比那就得換成 YOLO-seg 這類實例分割模型檢測框給不了像素級面積。2.2 框架、標注工具、硬件搭配給純小白的選型清單框架上我默認 PyTorch。不否認 TensorFlow 在工業(yè)部署里也有一席之地但 YOLO 系工程幾乎全部以 PyTorch 實現(xiàn)網(wǎng)上能被搜到的“超詳細配置教程”大多也是這條路線。PyTorch 的調(diào)試手感也更適合入門print 一個張量的 shape 立刻就知道數(shù)據(jù)流到哪一步出了錯斷點打在 loss.backward() 前后能直接看到梯度是否消失這份直覺對第一次做目標檢測的人非常重要。標注工具方面常見做法是先用 LabelImg 這類輕量工具把最初的 200 張圖標完再換 X-AnyLabeling 這類帶自動輔助標注的工具做增量擴充。工具選型不用糾結(jié)能導(dǎo)出 YOLO 格式 txt 就行。關(guān)鍵在導(dǎo)出后必須看一遍標注文件類別 ID 有沒有和類別名錯位、框的坐標是不是負數(shù)、葉片重疊區(qū)域有沒有漏標。如果數(shù)據(jù)集是多批次采集的還要注意批次間的光照和色溫差異最好在訓(xùn)練前做一次全局的亮度歸一化否則模型會把“偏暗環(huán)境”當(dāng)成一個隱性類別。硬件上一張 6GB 顯存的顯卡就夠完成訓(xùn)練沒有 GPU 就用 CPU 先把流程跑通只是速度會慢幾十倍。真到調(diào)參階段再租卡也不遲。配置環(huán)境時如果遇到 Windows 報缺 msvcp140.dll別急著重裝系統(tǒng)裝一下 VC 運行庫就能解決具體在 4.1 小節(jié)細說。2.3 拿到的壓縮包先別訓(xùn)解壓自檢三步第一步看目錄結(jié)構(gòu)。常見做法是數(shù)據(jù)集解壓后出現(xiàn)兩個頂層目錄images 放圖片labels 放同名 txt 標簽各自里面再分 train 和 val。如果壓縮包里的圖片按病害類別分文件夾說明它還是分類數(shù)據(jù)集格式得先轉(zhuǎn)成檢測格式第三章會給轉(zhuǎn)換腳本。第二步看標簽文件的數(shù)值。YOLO 格式的每一行是“類別ID 中心點x 中心點y 框?qū)?框高”坐標全部歸一化到 0~1。用文本編輯器隨便開一個 txt如果看到 x_center 大于 1.5、寬度是 0、或者行里的數(shù)字超過 6 列這份數(shù)據(jù)基本不能直接進訓(xùn)練。第三步檢查標簽和圖片是否能對上。統(tǒng)計每個類別有多少目標順便看圖片尺寸是否統(tǒng)一??焖倜? 統(tǒng)計訓(xùn)練集圖片數(shù)量 find dataset/images/train -name *.jpg | wc -l # 抽查前 20 個標簽文件里各有多少個標注框 for f in dataset/labels/train/*.txt; do echo $(basename $f): $(wc -l $f); done | head -20 # 按標簽文件的第一列聚類統(tǒng)計每個類別目標總數(shù) cat dataset/labels/train/*.txt | awk {print $1} | sort | uniq -c第一行命令看圖片總量第二行抽查標簽框數(shù)量第三行直接用 awk 按第一列聚類得到每個病害類別在訓(xùn)練集里的目標總數(shù)。如果某個類別只有個位數(shù)目標要盡早決定是擴充數(shù)據(jù)還是調(diào) loss 權(quán)重等到訓(xùn)練結(jié)束才發(fā)現(xiàn)類別不平衡前面幾十個 epoch 等于白跑。另外建議用 file 命令抽查幾張圖片的實際格式防止擴展名是 jpg 內(nèi)容卻是 png 的混入情況這類文件在統(tǒng)一縮放的訓(xùn)練流程里會造成偶發(fā)的解碼報錯。3. 把數(shù)據(jù)集喂給訓(xùn)練腳本目錄重組、格式轉(zhuǎn)換與可視化自查數(shù)據(jù)準備這個環(huán)節(jié)最花時間也最容易被跳過。我見過太多人拿到數(shù)據(jù)集后直接開訓(xùn)第一次跑通后才發(fā)現(xiàn)標注框畫錯了方位回頭改數(shù)據(jù)等于把整個訓(xùn)練流程重做一遍。與其賭運氣不如先花半小時做三件事把目錄按 YOLO 規(guī)范重組、把非 YOLO 格式的標注轉(zhuǎn)成統(tǒng)一 txt、把標注可視化逐張看一遍。這三步做完模型訓(xùn)練才算有了一個可信的輸入。3.1 目錄重組與 train/val 劃分一個能直接跑的 Python 腳本如果壓縮包里的圖片和標注文件在同一目錄、共用同一文件名前綴還要按 8:2 劃分訓(xùn)練集和驗證集。下面這份腳本可以直接放到數(shù)據(jù)集根目錄運行它會把圖片和標簽同步復(fù)制到 YOLO 要求的布局里。# split_dataset.py import os import shutil import random random.seed(42) # 固定隨機種子保證多次運行劃分一致 src_images raw_data/images # 原始圖片目錄 src_labels raw_data/labels # 原始標簽?zāi)夸?out_images dataset/images # 輸出圖片目錄 out_labels dataset/labels # 輸出標簽?zāi)夸?for sub in [train, val]: os.makedirs(f{out_images}/{sub}, exist_okTrue) os.makedirs(f{out_labels}/{sub}, exist_okTrue) imgs [f for f in os.listdir(src_images) if f.endswith((.jpg, .jpeg, .png))] imgs.sort() random.shuffle(imgs) val_count max(1, int(len(imgs) * 0.2)) val_imgs set(imgs[:val_count]) for img in imgs: sub val if img in val_imgs else train stem os.path.splitext(img)[0] src_txt os.path.join(src_labels, stem .txt) if not os.path.exists(src_txt): continue # 圖片沒有對應(yīng)標簽時跳過避免把臟數(shù)據(jù)帶進訓(xùn)練 shutil.copy(os.path.join(src_images, img), os.path.join(out_images, sub, img)) shutil.copy(src_txt, os.path.join(out_labels, sub, stem .txt))邏輯說明腳本先按擴展名篩出圖片通過 sort 和 random.seed 保證劃分可復(fù)現(xiàn)再按 20% 比例取前 n 張作驗證集最后把圖片和同名 txt 一起復(fù)制過去。這里最重要的一點是“同步”圖片和標簽文件共用文件名前綴只要不同步訓(xùn)練時會報“找不到標簽”或者把兩張圖的標簽錯配到一張圖上。參數(shù)說明src_labels 沒有對應(yīng) txt 時直接跳過避免把未標注圖片帶進訓(xùn)練想改成 9:1把 0.2 改成 0.1 即可shutil.copy 是復(fù)制而不是移動原目錄文件還在跑錯了可以刪掉 dataset 重來這算一個低成本后悔藥。3.2 把 VOC/COCO 標注轉(zhuǎn)成 YOLO 格式轉(zhuǎn)換腳本與四個邊界坑很多公開數(shù)據(jù)集給的是 VOC 的 xml 或 COCO 的 json 標注YOLO 訓(xùn)練讀不了這兩種格式必須先轉(zhuǎn)換。VOC 格式里每個目標對應(yīng)一個 bndbox 節(jié)點里面是 xmin、ymin、xmax、ymax 四個像素坐標YOLO 要的是相對圖片寬高的中心點和寬高比例。核心換算只有幾行但真正的坑全在換算之外。# voc2yolo.py import os import xml.etree.ElementTree as ET class_map {healthy: 0, early_blight: 1, late_blight: 2, bacterial_spot: 3} def convert_one(xml_path, img_w, img_h, out_txt): tree ET.parse(xml_path) root tree.getroot() lines [] for obj in root.findall(object): name obj.find(name).text if name not in class_map: continue # 類別名不在映射表里直接跳過 box obj.find(bndbox) x1 float(box.find(xmin).text) y1 float(box.find(ymin).text) x2 float(box.find(xmax).text) y2 float(box.find(ymax).text) # 越界裁剪坐標小于 0 按 0大于寬高按寬高 x1 max(0, x1); y1 max(0, y1) x2 min(img_w, x2); y2 min(img_h, y2) if x2 x1 or y2 y1: continue # 裁剪后框為空說明原始標注有問題 x_center (x1 x2) / 2 / img_w y_center (y1 y2) / 2 / img_h w (x2 - x1) / img_w h (y2 - y1) / img_h lines.append(f{class_map[name]} {x_center:.6f} {y_center:.6f} {w:.6f} {h:.6f}) with open(out_txt, w, encodingutf-8) as f: f.write(\n.join(lines)) # 使用時傳入圖片實際寬高不要用 xml 里的假設(shè)值 convert_one(annotations/tomato_001.xml, 1280, 960, labels/tomato_001.txt)邏輯說明代碼遍歷每個 object 節(jié)點從 bndbox 拿四角像素坐標裁剪到圖片邊界內(nèi)再歸一化。裁剪很重要人工標注經(jīng)常把框畫出圖片邊緣不裁會讓后續(xù)數(shù)據(jù)增強在越界坐標上產(chǎn)生空 box。類別 ID 由 class_map 映射不在表里的名稱直接跳過便于反向排查數(shù)據(jù)里有沒有未知病害類別。參數(shù)說明輸出精度保留 6 位小數(shù)夠 YOLO 使用如果手里是 COCO 的 json 格式需要換 pycocotools 讀取換算公式一樣。四個邊界坑提前說清楚一是 xml 里的圖片尺寸可能是 0 或錯誤值轉(zhuǎn)換前先查實際尺寸二是坐標越界要裁剪而不是直接丟棄丟棄會丟目標三是不同數(shù)據(jù)集里 bndbox 字段名可能寫錯寫成 xmin、ymax 之外的名字會直接 KeyError四是一張圖可能包含多個同名 object代碼里的 for 循環(huán)天然支持多目標別只取第一個。3.3 標注可視化自查把 txt 畫到圖上60 秒內(nèi)發(fā)現(xiàn)問題格式正確不等于標注正確。最有效的自查方法就是把標簽框畫回原圖逐張翻看。下面這段代碼讀一張圖和同名 txt用 OpenCV 畫出目標框和類別 ID輸出到檢查目錄跑一遍就能看出坐標是否錯位、框是否框住了整片葉、類別是否標錯。# check_annotations.py import os import cv2 img_dir dataset/images/train label_dir dataset/labels/train out_dir check_output os.makedirs(out_dir, exist_okTrue) for img_name in os.listdir(img_dir): stem os.path.splitext(img_name)[0] label_path os.path.join(label_dir, stem .txt) if not os.path.exists(label_path): continue img cv2.imread(os.path.join(img_dir, img_name)) img_h, img_w img.shape[:2] with open(label_path, r, encodingutf-8) as f: for line in f: parts line.strip().split() if len(parts) ! 5: continue # 行格式不對直接跳過 cls_id, xc, yc, w, h parts cls_id int(cls_id); xc float(xc); yc float(yc) w float(w); h float(h) x1 int((xc - w / 2) * img_w) y1 int((yc - h / 2) * img_h) x2 int((xc w / 2) * img_w) y2 int((yc h / 2) * img_h) cv2.rectangle(img, (x1, y1), (x2, y2), (0, 0, 255), 2) cv2.putText(img, str(cls_id), (x1, max(0, y1 - 5)), cv2.FONT_HERSHEY_SIMPLEX, 0.6, (0, 0, 255), 2) cv2.imwrite(os.path.join(out_dir, img_name), img)邏輯說明腳本按文件名前綴找對應(yīng)標簽把歸一化坐標還原成像素坐標后用 cv2.rectangle 畫框cv2.putText 在框上方寫類別 ID處理完保存到 check_output。如果發(fā)現(xiàn)大量框偏到葉片外側(cè)通常是標簽歸一化公式錯了如果框位置基本正確但類別 ID 對不上病害說明 class_map 映射寫歪了。參數(shù)說明建議把檢查圖片放到統(tǒng)一目錄里用看圖工具快速翻頁。一次性檢查幾百張圖時可以把圖片先縮到 640 寬度再保存減少翻頁體量。這一步不產(chǎn)生任何模型收益但能省掉后面無數(shù)次調(diào)試時瞎猜的時間是整條流程里性價比最高的一步。4. 訓(xùn)練落地用 PyTorch 把訓(xùn)練跑順記住這組參數(shù)數(shù)據(jù)準備好了接下來是把訓(xùn)練腳本跑起來。這里最大的風(fēng)險不是模型不懂番茄葉片而是環(huán)境裝不好、參數(shù)設(shè)置不合理、訓(xùn)練中斷后不知道怎么續(xù)上。建議嚴格按“環(huán)境 → 配置 → 監(jiān)控”三步走每一步只做最小必要的事不要一上來就去調(diào)花里胡哨的訓(xùn)練技巧。4.1 環(huán)境準備conda 虛擬環(huán)境與依賴安裝為了不讓系統(tǒng)里已有的 Python 包污染項目我一般先建獨立的 conda 環(huán)境。下面這段命令在終端里按順序執(zhí)行。conda create -n tomato python3.10 -y conda activate tomato pip install torch torchvision pip install ultralytics邏輯說明第一行創(chuàng)建名為 tomato 的 Python 3.10 虛擬環(huán)境第二行激活第三行安裝 PyTorch 和配套 torchvision第四行安裝 ultralytics——這個庫封裝了 YOLO 系列的訓(xùn)練、驗證、導(dǎo)出接口。torch 和 torchvision 需要配套版本直接 pip 安裝通常會自動匹配但要確認 torch 能用 GPU方法是在 Python 里執(zhí)行 import torch; print(torch.cuda.is_available())輸出 True 才說明 CUDA 可用。參數(shù)說明Python 3.10 是這幾年 PyTorch 兼容性最穩(wěn)的版本之一純小白照抄即可如果機器是純 CPU不裝 CUDA 版 torch 也能跑只是慢很多。Windows 上最容易翻車的點有兩個一個是缺 VC 運行庫報錯文字里出現(xiàn) msvcp140.dll裝一下運行庫就好另一個是顯卡驅(qū)動太舊torch 報“CUDA driver version is insufficient”去顯卡廠商官網(wǎng)更新驅(qū)動即可不用自己亂改 torch 版本。裝完后建議跑一下 yolo --version 確認命令行可用很多環(huán)境問題在這一步就能暴露。4.2 數(shù)據(jù)集配置與訓(xùn)練命令參數(shù)表里哪些是安全區(qū)哪些是玄學(xué)ultralytics 的訓(xùn)練接口要求先用一個 yaml 文件描述數(shù)據(jù)路徑和類別信息。文件名隨意結(jié)構(gòu)固定。假設(shè)只做四類健康葉片、早疫病、晚疫病、細菌性斑點內(nèi)容如下。# tomato.yaml path: dataset train: images/train val: images/val nc: 4 names: 0: healthy 1: early_blight 2: late_blight 3: bacterial_spot邏輯說明path 是數(shù)據(jù)集根目錄train 和 val 是相對路徑nc 是類別總數(shù)names 給每個類別 ID 一個名字。訓(xùn)練腳本讀這個文件就知道去哪里找圖片、驗證集用哪份數(shù)據(jù)、輸出多少個類別。最容易翻車的配置是 path 寫成絕對路徑換機器后路徑失效相對路徑則要求執(zhí)行訓(xùn)練命令時的工作目錄在數(shù)據(jù)集上層我會在命令前用 cd 進入項目根目錄來規(guī)避。訓(xùn)練命令如下cd tomato_project yolo detect train modelyolov8n.pt datatomato.yaml \ epochs80 imgsz640 batch8 device0 workers4 \ lr00.01 patience15邏輯說明modelyolov8n.pt 表示加載官方預(yù)訓(xùn)練權(quán)重做遷移學(xué)習(xí)n 是 nano 版本顯存占用小、適合入門datatomato.yaml 指向剛才的配置epochs80 是完整遍歷訓(xùn)練集 80 次imgsz640 讓圖片縮放成 640x640 再進網(wǎng)絡(luò)batch8 是每次送入 GPU 的圖片數(shù)量patience15 表示驗證指標連續(xù) 15 個 epoch 不提升就提前停止防過擬合還能省時間。參數(shù)我的默認值影響說明modelyolov8n.pt模型容量與速度顯存小用 n數(shù)據(jù)多再換 s 或 mepochs80訓(xùn)練輪數(shù)幾百張圖時 80 夠用imgsz640輸入分辨率分辨率越高越吃顯存小目標多再調(diào) 960batch8單輪顯存占用6GB 顯存安全區(qū)是 8溢出就減半lr00.01初始學(xué)習(xí)率遷移學(xué)習(xí)時 0.01 是保守安全值patience15早停耐心值驗證指標不升就停防無效等待參數(shù)說明imgsz 和 batch 的乘積直接決定顯存占用6GB 顯存跑 6408 是比較穩(wěn)的搭配如果數(shù)據(jù)里葉片只占很小一塊可以試 imgsz960但 batch 要降一半。lr0 是最容易踩的玄學(xué)參數(shù)調(diào)大了 loss 早期爆炸調(diào)小了 40 輪還在原地晃遷移學(xué)習(xí)場景下 0.01 基本不會出錯。顯存溢出時優(yōu)先把 batch 減半而不是換更小的模型因為 batch 減半不影響模型表達能力只是梯度估計噪聲變大。4.3 訓(xùn)練過程怎么監(jiān)控從 loss 數(shù)值到 best.pt 的完整閉環(huán)訓(xùn)練開始后終端會打印每個 epoch 的進度條和一堆指標要有取舍地看。第一優(yōu)先看 box_loss 和 cls_loss前者是定位損失后者是分類損失兩者都應(yīng)隨 epoch 數(shù)增加而下降下降速度變緩是正常現(xiàn)象。第二看 val 行的 mAP50這是最能說明模型真實水平的數(shù)字不要只看最終值要關(guān)注它在訓(xùn)練中期的爬升趨勢。訓(xùn)練結(jié)束時runs/detect/train 目錄下會出現(xiàn)兩個權(quán)重文件best.pt 是驗證指標最好的權(quán)重last.pt 是最后一輪權(quán)重。默認用 best.pt不要只拿 last.pt 做推理因為訓(xùn)練后期可能出現(xiàn)輕微過擬合best.pt 才是泛化能力最強的快照。中斷恢復(fù)也有后悔藥訓(xùn)練中途崩了在命令最后加 resumeTrue腳本會從 last.pt 斷點繼續(xù)不用從頭再來。如果 mAP50 到某個 epoch 后突然掉一截別急著加正則化先回第三章把可視化自查再做一遍看是不是訓(xùn)練集里混進了貼錯標簽的圖。數(shù)據(jù)層面干凈了指標才會恢復(fù)正常。另外值得記的一個經(jīng)驗是batch 小的時候 loss 曲線更抖這是正常的不用過度緊張真正要警惕的是 loss 徘徊在高位完全不降那種情況多半是標簽坐標越界回 3.2 小節(jié)的轉(zhuǎn)換腳本檢查邊界裁剪邏輯。5. 番茄葉片病害檢測的典型翻車現(xiàn)場排查與避坑訓(xùn)練和推理跑通之后真正的疑難雜癥才開始浮出來。下面五條是從實際項目里反復(fù)遇到、且在新手身上出現(xiàn)頻率最高的問題按現(xiàn)象、原因、解決的順序?qū)懨恳粭l都盡量給一個能直接抄的判斷路徑方便你在訓(xùn)練失敗時按圖索驥。5.1 顯存溢出不只是換顯卡就能解決現(xiàn)象訓(xùn)練跑到十幾個 epoch 后進程突然報 CUDA error: out of memory前面十幾個 epoch 的進度全部作廢。原因最典型根源是 batch 和 imgsz 的乘積超過顯存上限尤其是帶數(shù)據(jù)增強的 YOLO 訓(xùn)練顯存峰值往往出現(xiàn)在增強后的大圖堆疊階段而不是推理階段。有時候 6GB 顯存跑 batch8 能啟動、卻在某 epoch 中途溢出是因為增強操作隨機生成了比平時更大的輸入圖瞬時峰值比平均值高出一截。解決先把 batch 減半到 4同時把 imgsz 降到 512大多數(shù) 6GB 卡能穩(wěn)定跑完如果還溢出再看 workers 是否太大workers4 會讓數(shù)據(jù)加載線程同時準備多批數(shù)據(jù)顯存和內(nèi)存都被推高。改完參數(shù)重新訓(xùn)練因為 best.pt 還沒生成沒有斷點可以利用。這條經(jīng)驗的關(guān)鍵是顯存溢出不是換顯卡的信號先把參數(shù)調(diào)回安全區(qū)再說。5.2 標注框口徑不統(tǒng)一模型學(xué)的到底是葉片還是病斑現(xiàn)象訓(xùn)練完的模型在真實照片上表現(xiàn)尚可但預(yù)測框總是只框住病斑區(qū)域而不是整片葉或者反過來該框病斑卻框了整片葉子。原因這是標注階段埋下的鍋。同一批數(shù)據(jù)里一部分人標整片葉另一部分人只標病斑模型在矛盾中學(xué)會了“最小化損失”的折中方案輸出框忽大忽小。整片葉占圖面積大、病斑占圖面積小兩者混合會讓置信度分布非常奇怪。解決沒有捷徑只能回標注環(huán)節(jié)統(tǒng)一口徑。建議定成“目標是葉片類別是病害”如果真正關(guān)心病斑面積占比就定成“目標是病斑類別是病害類型”。定好之后把不符合的標注批量改成統(tǒng)一規(guī)則再跑一次 3.3 小節(jié)的可視化自查確認每個框都符合新口徑再重新訓(xùn)練。這個問題越早發(fā)現(xiàn)代價越小訓(xùn)練完才發(fā)現(xiàn)等于前幾十個 epoch 全部作廢。5.3 類別嚴重不平衡整體指標還行細看某個類別幾乎不檢現(xiàn)象訓(xùn)練完看驗證結(jié)果mAP50 有 0.7但按類別拆開統(tǒng)計晚疫病這一類精確率和召回率雙雙接近 0模型把所有相似目標都判成了早疫病。原因數(shù)據(jù)集中晚疫病樣本只有早疫病的十分之一。目標檢測的損失函數(shù)在加權(quán)求和時樣本多的類別貢獻的梯度更大模型很容易傾向把所有相似紋理都判成大類。病害之間的視覺相似性會放大這個問題早疫病和晚疫病的同心環(huán)差幾層紋理細節(jié)樣本不足時模型根本學(xué)不到區(qū)分特征。解決優(yōu)先做數(shù)據(jù)擴充找更多晚疫病照片或做旋轉(zhuǎn)、亮度、雨露等增廣把數(shù)量拉到一個相對均衡的水平確實找不到素材再調(diào)整損失權(quán)重比如給 cls loss 按類別占比反比加權(quán)或者換 focal loss 讓模型更關(guān)注難分的少數(shù)類。我的經(jīng)驗是調(diào) loss 權(quán)重只能把指標從幾乎為零拉回“勉強能用”真正有效的還是數(shù)據(jù)量本身。5.4 loss 不降先查標簽再調(diào)學(xué)習(xí)率現(xiàn)象訓(xùn)練到第 30 輪box_loss 和 cls_loss 都停在一個較高水平不再下降驗證集 mAP50 也在低位震蕩調(diào) epochs 也沒用。原因排在前列的三類原因分別是標簽坐標越界或歸一化錯誤、學(xué)習(xí)率過高導(dǎo)致 loss 反復(fù)震蕩、模型容量不足。最常見的是第一種因為轉(zhuǎn)換腳本如果沒做邊界裁剪x_center 和 w 會偶爾出現(xiàn)大于 1 或小于 0 的數(shù)值模型看到的標簽和實際目標框?qū)Σ簧献匀粚W(xué)不下去。解決不要先動模型先執(zhí)行第三章的可視化自查腳本逐張看標注框是否貼合葉片??蛉空T贆z查 lr0把 0.01 降到 0.002 重跑數(shù)據(jù)量大且模型是 yolov8n可以換 yolov8s 提高容量。這三步按順序排查能覆蓋九成“l(fā)oss 不降”的現(xiàn)場。很多人一上來就換高級損失函數(shù)或加注意力模塊但在這類項目里數(shù)據(jù)問題占比遠高于模型能力問題先把數(shù)據(jù)釘死再談模型。5.5 推理階段誤檢滿天飛把 conf 閾值調(diào)高只是治標現(xiàn)象模型在訓(xùn)練集上的指標很好看但把訓(xùn)練時沒見過的真實照片喂進去預(yù)測結(jié)果里到處是框連土壤、莖稈甚至背景紋理都被標注成病害。原因訓(xùn)練正樣本里幾乎全是“葉片居中、背景干凈”的照片模型沒見過不帶葉子的負樣本于是在推理階段對一切有紋理的區(qū)域都打了高分。這是數(shù)據(jù)分布和真實場景不匹配造成的問題不是單純過擬合。解決治本的手段是往訓(xùn)練集里加入背景圖片作為負樣本再配合 mosaic 和 mixup 增強讓模型學(xué)會忽略無關(guān)區(qū)域。治標的手段是把推理時的 conf 參數(shù)調(diào)高例如從默認的 0.25 提到 0.5誤檢數(shù)量會明顯下降但會犧牲一部分真目標召回。建議一起做先用 conf0.5 把眼前誤檢壓下去同時補一批帶背景的負樣本重新訓(xùn)練雙管齊下才算真正解決。提示這五條經(jīng)驗的共同點是現(xiàn)象在訓(xùn)練或推理中暴露根源卻都在數(shù)據(jù)或參數(shù)上。遇到問題按“數(shù)據(jù) → 參數(shù) → 模型”的順序排查不要一上來就換網(wǎng)絡(luò)結(jié)構(gòu)。6. 把模型從“能跑”變成“能用”驗證指標與落地前的最后一步訓(xùn)練完成不代表項目結(jié)束模型要在沒見過的真實照片上證明自己。驗證階段最有參考價值的數(shù)字是 mAP50 和混淆矩陣比單獨看訓(xùn)練 loss 誠實得多。yolo detect val modelruns/detect/train/best.pt datatomato.yaml這條命令會在驗證集上跑一遍最優(yōu)權(quán)重打印 box_loss、mAP50、mAP50-95 等指標同時生成混淆矩陣圖。混淆矩陣的閱讀方法是看對角線對角線數(shù)值越高說明每個類別分得越清楚如果早疫病和晚疫病之間出現(xiàn)大片非對角區(qū)域說明這兩個類別在特征空間里確實太接近優(yōu)先回 5.3 小節(jié)補數(shù)據(jù)。推理階段的驗證要換一批照片最好用手機在真實溫室拍幾張分別覆蓋單葉片、多葉片、背景雜亂、光線不均四種情況。下面這段代碼可以快速做批量預(yù)測并保存結(jié)果。from ultralytics import YOLO model YOLO(runs/detect/train/best.pt) results model.predict( sourcereal_photos/, conf0.45, saveTrue, imgsz640, projectpredict_output )邏輯說明model 加載訓(xùn)練好的 best.ptsource 指向真實照片目錄conf0.45 比默認值略高以過濾誤檢saveTrue 保存畫好框的結(jié)果圖project 指定輸出目錄。參數(shù)說明如果真實場景里葉片占整圖比例很小imgsz 可調(diào)到 960 再試一次代價是推理變慢但小目標檢出率通常會提高。這里有一個我從第一次做葉片檢測就記住的習(xí)慣永遠同時保存兩份驗證輸出一份按默認參數(shù)一份按高 conf對比著看模型的邊界在哪里。如果兩份輸出差異極大說明模型對置信度非常敏感部署時要仔細標定閾值。這套流程走完這個基于 python 深度學(xué)習(xí)的番茄葉片病害檢測項目才真正從“代碼能跑”變成了“檢測能信”。我早年第一次做完類似項目時花在換模型上的時間遠超花在查數(shù)據(jù)上的時間結(jié)果每個模型的指標都類似地差。后來養(yǎng)成先做數(shù)據(jù)自查、再看混淆矩陣、最后用真實照片兜底的順序返工次數(shù)驟降。希望這個順序也能幫你在番茄葉片病害檢測上少走幾步彎路。本文還有配套的精品資源點擊獲取