
261008-report?AuthorZenosOverview本文檔主要記錄26年10月第一周學習內(nèi)容以及后續(xù)學習計劃。文章目錄261008-report[toc]一、研究背景1.1 微小目標檢測1.1.1 微小目標檢測面臨的挑戰(zhàn)1.1.2 常見的一階段目標檢測流程二、近期學習內(nèi)容2.1 [SET: Official implementation of SET: Spectral Enhancement for Tiny Object Detection (CVPR 2025).](https://github.com/HuixinSun/SET)**總損失函數(shù)** $$ \mathcal L2.2 相關(guān)實驗三、后續(xù)學習計劃問題附錄一、研究背景1.1 微小目標檢測在無人機視角中的目標通常包括人、車輛、船只、動物、建筑物局部目標等。和普通目標檢測相比難點不是有沒有目標而是這些目標在圖像里往往只占很少的像素這給目標檢測任務(wù)帶來了很大的挑戰(zhàn)。1.1.1 微小目標檢測面臨的挑戰(zhàn)樣本分布不平衡航拍圖像樣本正負不均、密集遮擋空間分布與背景干擾優(yōu)化聚焦目標密集區(qū)域抑制背景噪聲。類別與樣本數(shù)量優(yōu)化處理長尾類別分布稀有樣本少動態(tài)樣本選擇平衡正負樣本解決類別不平衡問題。遮擋與特征混淆優(yōu)化挖掘漏檢目標特征對齊融合增強小目標特征解決密集遮擋下的漏檢問題。尺度變化多樣性航拍目標跨度大圖像感知增強放大小目標區(qū)域增強小目標特征表達。上下文信息聚合整合不同尺度的上下文信息提升模型對尺度變化的適應(yīng)性。特征對齊優(yōu)化解決多尺度特征的不對齊問題因為下采樣、旋轉(zhuǎn)或視角變化導(dǎo)致它和原始圖像中的物體在位置、形狀或方向上對不上抑制大目標對小目標的特征壓制。全局特征感知整合全局語義信息減少復(fù)雜背景的干擾。小目標檢測回歸優(yōu)化回歸指標優(yōu)化適配小目標的標簽分配改進傳統(tǒng)分配策略通過中心區(qū)域采樣、動態(tài)標簽分配為小目標生成更多正樣本解決小目標正樣本不足的問題。邊界框回歸優(yōu)化針對航拍旋轉(zhuǎn)目標設(shè)計定向邊界框回歸方法解決任意方向目標的定位問題。損失函數(shù)設(shè)計提出適配小目標的新度量同時改進旋轉(zhuǎn)目標的損失函數(shù)提升角度預(yù)測精度。1.1.2 常見的一階段目標檢測流程下面以FCOS為例,介紹常見的單階段目標檢測算法流程Backbone首先輸入圖像經(jīng)過Backbone 主干網(wǎng)絡(luò)進行特征提取。隨著網(wǎng)絡(luò)不斷加深特征圖會逐漸下采樣例如圖中的 (C3、C4、C5)它們大致對應(yīng)原圖的 (1/8、1/16、1/32) 尺度。淺層特征分辨率高保留的細節(jié)信息比較多深層特征分辨率低但語義信息更強。Neck不同尺度的特征會進入FPN特征金字塔進行多尺度特征融合得到 (P3、P4、P5) 等特征層同時還可以繼續(xù)生成 (P6、P7)。這樣做的目的是讓高分辨率特征獲得更強的語義信息同時保留不同尺度目標的檢測能力。Head最后每一個 FPN 層都會輸入到Detection Head輸出預(yù)測類別分類和檢測框位置。二、近期學習內(nèi)容近期學習主要圍繞SET方法遷移到y(tǒng)olo26進行相關(guān)實驗展開。2.1SET: Official implementation of SET: Spectral Enhancement for Tiny Object Detection (CVPR 2025).小結(jié)本文針對微小物體檢測中目標像素少、背景高頻噪聲干擾強、特征判別性不足的問題提出一種頻譜增強方法 SET。作者首先通過頻域遮擋歸因分析發(fā)現(xiàn)微小物體在特征編碼后高頻特征較弱、更易受高頻噪聲影響據(jù)此設(shè)計兩個模塊層次化背景平滑模塊 HBS根據(jù)真值掩碼分離前景與背景對背景進行自適應(yīng)平滑以抑制高頻噪聲對抗擾動注入模塊 API在 FPN 特征上注入多分支對抗擾動增強關(guān)鍵區(qū)域顯著性并提升特征魯棒性。實驗在 AI-TOD、VisDrone2019、DOTA-v2.0 和 COCO 上進行結(jié)果表明 SET 可廣泛提升多種檢測器性能例如在 AI-TOD 上將 RFLA 提升 3.2% AP在 COCO 上將 FCOS 提升 1.0% AP。研究意義在于從頻域視角為微小物體檢測提供新的分析和增強思路且 SET 訓(xùn)練后不增加推理開銷具有較強的通用性和實用性。SET方法SET方法主要運用訓(xùn)練時在FPN特征檢測和檢測頭之間p i p_ipi?→ HBS → API → Head。SET方法主要在訓(xùn)練階段的使用推理階段不會給基礎(chǔ)檢測器添加額外負擔。HBS分層背景平滑。對不同層的特征背景進行平滑處理先將特征圖中的目標和背景分離將訓(xùn)練數(shù)據(jù)中標定的目標和背景通過一個二值掩碼進行分離目標標記為1背景標記為0。利用 GT box 構(gòu)造這個二值 mask然后把 FPN 特征拆成前景和背景兩部分。將P3特征切割成兩塊目標P i f g P i ⊙ M P_i^{fg}P_i\odot MPifg?Pi?⊙M背景P i b g P i ⊙ ( 1 ? M ) P_i^{bg}P_i\odot(1-M)Pibg?Pi?⊙(1?M)訓(xùn)練可學習的smoothing對背景特征進行卷積、通道壓縮-c-c/r-Relu-卷積、通道恢復(fù)-C/r-cResidual 殘差連接背景特征不能被壓縮的太狠所以使用了處理后的背景和原始背景殘差連接APIHBS使背景更安靜了但是小目標的特征表現(xiàn)仍然很弱引入對抗擾動注入API根據(jù)Loss梯度有目的地對抗學習讓網(wǎng)絡(luò)對小目標特征學習更加魯棒。API的目標函數(shù)min ? P i , θ i ( max ? ∥ ? i , c l s ∥ 2 ≤ ρ L c l s ( P i ? i , c l s ) γ ∥ P i ∥ 2 2 ) \min_{P_i,\theta_i} \left( \max_{\|\epsilon_{i,\mathrm{cls}}\|_2\le \rho} \mathcal L_{\mathrm{cls}}(P_i\epsilon_{i,\mathrm{cls}}) \gamma\|P_i\|_2^2 \right)Pi?,θi?min?(∥?i,cls?∥2?≤ρmax?Lcls?(Pi??i,cls?)γ∥Pi?∥22?)其中L c l s L_{cls}Lcls?表示分類損失內(nèi)部優(yōu)化將對抗性擾動? i , c l s \epsilon_{i,\mathrm{cls}}?i,cls?注入到P i P_iPi?的特征空間中,其中ρ ρρ定義擾動大小,γ \gammaγ是控制正則化強度的超參數(shù)θ i θ_iθi?表示第i ii層的模型參數(shù)。擾動選擇特征圖添加的擾動并非隨機生成而是選擇梯度上升的方向? i , c l s ? ≈ ρ ? P i L c l s ( P i ) ∥ ? P i L c l s ( P i ) ∥ 2 \epsilon_{i,\mathrm{cls}}^* \approx \rho \frac{ \nabla_{P_i}\mathcal L_{\mathrm{cls}}(P_i) }{ \|\nabla_{P_i}\mathcal L_{\mathrm{cls}}(P_i)\|_2 }?i,cls??≈ρ∥?Pi??Lcls?(Pi?)∥2??Pi??Lcls?(Pi?)?其中? P i L \nabla_{P_i}L?Pi??L表示如何改變P i P_iPi?會改變Lossρ \rhoρ是學習率。作者把多種任務(wù)擾動分類分支、回歸分支等組合起來? i a d v ∑ m 1 M λ m ? i , m ? \epsilon_i^{adv} \sum_{m1}^{M} \lambda_m\epsilon_{i,m}^{*}?iadv?m1∑M?λm??i,m??將擾動加到特征圖中P i ? i a d v P_i\epsilon^{adv}_iPi??iadv?再進行訓(xùn)練??倱p失函數(shù)$$\mathcal L\mathcal L_{\mathrm{detection}}\lambda\sum_{i1}^{N}\mathcal L_i^{\mathrm{aux}}\left(P_iE\epsilon_i{adv}\right)$$2.2 相關(guān)實驗ARmAP50mAP50-95A P v t AP_{vt}APvt?A P t AP_{t}APt?A P s AP_{s}APs?A P m AP_{m}APm?A R v t AR_{vt}ARvt?A R t AR_{t}ARt?A R s AR_{s}ARs?A R m AR_{m}ARm?Origin38.56%37.62%21.86%2.49%9.88%21.84%36.47%9.42%22.91%37.27%51.28%Gaussian38.33%37.35%21.65%2.18%9.02%20.97%37.23%7.29%22.05%36.51%53.67%HBS39.19%37.27%21.53%2.21%9.11%21.32%35.98%7.25%21.70%36.90%53.12%EnHBS37.93%36.40%21.12%2.16%8.78%20.60%36.12%8.00%21.31%35.96%52.63%API38.64%37.54%21.85%2.39%9.16%21.36%36.96%9.70%22.65%37.31%53.72%HBS API39.12%37.46%21.81%2.93%9.84%21.67%35.33%10.93%23.08%36.40%50.58%三、后續(xù)學習計劃問題附錄