戰(zhàn):VOC格式轉(zhuǎn)YOLO目標(biāo)檢測訓(xùn)練與避坑指南)
簡介YOLO目標(biāo)檢測-共享單車檢測數(shù)據(jù)集面向計(jì)算機(jī)視覺學(xué)習(xí)者與開發(fā)者可用于YOLO系列模型的共享單車識別、定位與計(jì)數(shù)服務(wù)于城市交通監(jiān)管及共享單車調(diào)度場景。壓縮包共272個(gè)文件包含136張JPG圖片與136個(gè)VOC格式的XML標(biāo)注文件標(biāo)注了邊界框坐標(biāo)和類別信息包體約90.08MB規(guī)模適中方便快速試驗(yàn)。目前已有107人學(xué)習(xí)使用適合作為目標(biāo)檢測實(shí)戰(zhàn)訓(xùn)練與效果對比的基準(zhǔn)數(shù)據(jù)。圖片采集自不同城市環(huán)境覆蓋多種光照、視角和背景共享單車的顏色、品牌及使用狀態(tài)也較為多樣有助于提高模型泛化能力?;谠摂?shù)據(jù)集可完成數(shù)據(jù)加載、模型訓(xùn)練、參數(shù)優(yōu)化和效果評估等流程訓(xùn)練所得模型可部署于固定或車載攝像頭支撐共享單車實(shí)時(shí)監(jiān)測與高效調(diào)度。1. 共享單車檢測數(shù)據(jù)集為什么說它是 YOLO 目標(biāo)檢測里最典型的單類落地項(xiàng)目打開 .rar 之前先回答一個(gè)問題共享單車檢測在 YOLO 目標(biāo)檢測里屬于什么難度檔位答案是入門偏上一點(diǎn)點(diǎn)。類別只有一個(gè)不像城市道路檢測那樣需要同時(shí)區(qū)分行人、汽車、卡車但目標(biāo)角度變化大俯拍、側(cè)拍、斜拍都有車輛堆疊遮擋嚴(yán)重這又比純單類物體檢測難不少。這份數(shù)據(jù)集的價(jià)值在于把最麻煩的數(shù)據(jù)準(zhǔn)備環(huán)節(jié)壓縮成兩件事給你圖片和 VOC 格式標(biāo)簽然后由你把標(biāo)簽轉(zhuǎn)成 YOLO 能吃的格式并跑通訓(xùn)練閉環(huán)。VOC 的 XML 標(biāo)注是很多老項(xiàng)目沉淀下來的標(biāo)準(zhǔn)格式而 YOLO 訓(xùn)練讀的是歸一化 txt這中間那道轉(zhuǎn)換工序決定了后面 pytorch 訓(xùn)練到底是順風(fēng)順?biāo)€是連環(huán)翻車。適合誰看就是準(zhǔn)備做亂停放檢測、特定車輛識別、或第一次拿真實(shí)標(biāo)注數(shù)據(jù)跑通 yolov5 / yolov8 訓(xùn)練流程的開發(fā)者。2. 解開 .rar 先看目錄VOC 標(biāo)簽與 YOLO 訓(xùn)練之間的那道轉(zhuǎn)換工序拿到壓縮包第一件事不是解壓就訓(xùn)練而是先把目錄結(jié)構(gòu)看明白。共享單車檢測這類單類項(xiàng)目目錄一般長這樣images 目錄放原圖annotations 目錄放同名 XMLXML 就是 VOC 格式標(biāo)簽。YOLO 訓(xùn)練時(shí)讀取的是一個(gè) txt 標(biāo)簽加一張圖片的配對關(guān)系所以中間隔著一道轉(zhuǎn)換工序。這道工序本身不難但百分之八十的問題都發(fā)生在轉(zhuǎn)換前后的數(shù)據(jù)檢查上而不是訓(xùn)練命令寫錯。2.1 共享單車檢測的標(biāo)注特點(diǎn)單類目標(biāo)為什么仍然要小心標(biāo)注共享單車在檢測任務(wù)里屬于中等尺寸目標(biāo)比人臉大比卡車小通常占圖片面積的 2% 到 15%。正因?yàn)轭悇e單一很多人容易忽視一個(gè)事實(shí)單類檢測的難度集中在形態(tài)變化和遮擋上。同一輛共享單車側(cè)視圖是一橫條俯視圖是一個(gè)接近方形的輪廓斜 45 度拍的時(shí)候車把、車座、車輪互相重疊。把這些圖合在一起訓(xùn)練模型實(shí)際上學(xué)到的是“像共享單車的幾何結(jié)構(gòu)”這個(gè)抽象特征而不是某個(gè)固定寬高比的模板。所以 VOC 標(biāo)簽里的 bndbox 是否緊貼車體直接決定了模型學(xué)到的特征里有多少背景噪聲。框大了把路面、綠化帶、其他車輛都包進(jìn)來YOLO 的損失函數(shù)會努力去擬合一個(gè)不干凈的邊界框小了車把或后輪被切掉模型學(xué)到的特征不完整。從算法角度看YOLO 把圖像劃分成網(wǎng)格每個(gè)網(wǎng)格負(fù)責(zé)預(yù)測目標(biāo)中心落在自己格子里的框。它回歸的是中心點(diǎn)坐標(biāo)和寬高不是像素分割。這意味著標(biāo)簽里的坐標(biāo)精度會被模型直接學(xué)習(xí)并放大。標(biāo)簽差幾個(gè)像素最終預(yù)測框也會差幾個(gè)像素放在亂停放檢測場景里可能無所謂但如果后續(xù)要做停車區(qū)域判斷框偏了就容易造成誤判。2.2 VOC 格式的 XML 字段bndbox 四個(gè)像素坐標(biāo)是一切轉(zhuǎn)換的基準(zhǔn)VOC 格式來自 Pascal VOC 數(shù)據(jù)集后來被大量標(biāo)注工具沿用下來。打開一個(gè) XML 文件內(nèi)容通常長這樣annotation folderimages/folder filenameshared_bike_001.jpg/filename size width1280/width height720/height depth3/depth /size object namebicycle/name truncated0/truncated difficult0/difficult bndbox xmin356/xmin ymin189/ymin xmax674/xmax ymax511/ymax /bndbox /object /annotation重點(diǎn)看三塊。第一size 字段里的 width 和 height這是圖片的真實(shí)尺寸后面做歸一化全靠它。第二object 里的 name這就是類別名不同標(biāo)注員可能寫成 bicycle、SharedBike、共享單車轉(zhuǎn)換前必須統(tǒng)一。第三bndbox 里的 xmin、ymin、xmax、ymax這四個(gè)值是像素坐標(biāo)單位是像素不是歸一化數(shù)值。YOLO 的標(biāo)簽格式則完全不同每一行是一類目標(biāo)依次是類別 id、歸一化后的中心點(diǎn) x、中心點(diǎn) y、歸一化寬度 w、歸一化高度 h。比如0 0.402344 0.486111 0.248438 0.447222。這里的 0.402344 是把像素坐標(biāo)除以圖片寬度得到的0.486111 是除以高度得到的。二者之間就是一個(gè)簡單的除法關(guān)系但無數(shù)人在這里踩坑因?yàn)橐坏﹫D片被 resize 過而 XML 沒同步更新轉(zhuǎn)換出來的標(biāo)簽就全部錯位。2.3 展開壓縮包后先做的三件事數(shù)量統(tǒng)計(jì)、缺失檢查、類名統(tǒng)一解壓后第一件事不是直接寫轉(zhuǎn)換腳本而是先統(tǒng)計(jì)這份共享單車數(shù)據(jù)集的實(shí)際狀態(tài)。我一般會跑一個(gè)小腳本把圖片和 XML 的對應(yīng)關(guān)系列出來import os from pathlib import Path data_root Path(共享單車數(shù)據(jù)集) images list(data_root.rglob(*.jpg)) list(data_root.rglob(*.png)) xmls list(data_root.rglob(*.xml)) img_names {p.stem for p in images} xml_names {p.stem for p in xmls} print(圖片數(shù)量:, len(images)) print(XML 數(shù)量:, len(xmls)) print(缺少 XML 的圖片:, len(img_names - xml_names))邏輯說明用 Path.rglob 遞歸找到所有 jpg、png 和 xml 文件再按文件主名求差集。圖片主名和 XML 主名一一對應(yīng)是 VOC 格式最基本的約定。如果打印出來的圖片數(shù)量和 XML 數(shù)量對不上先別急著轉(zhuǎn)換把缺失的那些圖片篩出來看一眼。常見情況是爬取的圖片里混入了一部分沒有標(biāo)注的樣本這時(shí)候要么刪掉要么補(bǔ)標(biāo)注放進(jìn)去會讓訓(xùn)練集出現(xiàn)大量“有圖無標(biāo)簽”的負(fù)樣本干擾模型對正樣本的判斷。第二步是檢查類別名分布import xml.etree.ElementTree as ET from collections import Counter counter Counter() for xml_path in xmls: root ET.parse(xml_path).getroot() for obj in root.iter(object): counter[obj.findtext(name)] 1 print(counter)這段代碼把所有 XML 里的 object name 收集起來統(tǒng)計(jì)頻次。如果打印結(jié)果里有多個(gè)不同的名字比如{bicycle: 1520, 共享單車: 340, SharedBike: 120}說明這批標(biāo)注來自不同標(biāo)注員或不同來源轉(zhuǎn)換時(shí)必須合并成一個(gè)類別。不合并的話YOLO 會把這三種名字當(dāng)成三個(gè)類別去訓(xùn)練而你的數(shù)據(jù)集 YAML 里只寫了 nc1訓(xùn)練時(shí)會直接報(bào)類別數(shù)不匹配或者強(qiáng)行按 3 類跑出一個(gè)沒法用的模型。第三步是可視化抽查。隨機(jī)挑幾張圖把 XML 里的框畫回原圖import cv2 import xml.etree.ElementTree as ET for xml_path in xmls[:5]: root ET.parse(xml_path).getroot() img_path str(xml_path.parent / root.findtext(filename)) img cv2.imread(img_path) for obj in root.iter(object): box obj.find(bndbox) x1, y1 int(box.findtext(xmin)), int(box.findtext(ymin)) x2, y2 int(box.findtext(xmax)), int(box.findtext(ymax)) cv2.rectangle(img, (x1, y1), (x2, y2), (0, 255, 0), 2) cv2.imwrite(fcheck_{xml_path.stem}.jpg, img)注意這里有個(gè)坑XML 里的 filename 字段不一定對得上實(shí)際文件名。有些數(shù)據(jù)集在整理時(shí)重命名了圖片但 XML 里還留著舊文件名直接用 root.findtext(filename) 拼接路徑會讀不到圖。更穩(wěn)妥的做法是用 XML 自己的主名去找同名圖片也就是img_path xml_path.with_suffix(.jpg)找不到再嘗試 .png。畫框結(jié)果保存成單獨(dú)文件人工翻一遍確認(rèn)框的位置是否合理尤其是車頭車尾有沒有被切掉。這三步做完數(shù)據(jù)集的底細(xì)基本摸清了再進(jìn)入轉(zhuǎn)換階段就有了底。3. VOC 轉(zhuǎn) YOLO 格式最小轉(zhuǎn)換腳本與三個(gè)必調(diào)參數(shù)VOC 轉(zhuǎn) YOLO 的方法網(wǎng)上有一堆現(xiàn)成工具但我更建議自己寫一個(gè) 30 行的腳本。原因很簡單共享單車數(shù)據(jù)集這種單類小項(xiàng)目現(xiàn)成工具往往帶了多余的處理邏輯比如自動劃分訓(xùn)練集、自動增強(qiáng)、自動過濾空標(biāo)注出了問題反而不好排查。自己寫腳本每一步都看得見。3.1 歸一化坐標(biāo)的計(jì)算方式與轉(zhuǎn)換腳本核心轉(zhuǎn)換函數(shù)不復(fù)雜就是把 bndbox 的四個(gè)像素值轉(zhuǎn)成歸一化的中心點(diǎn)和寬高。下面這個(gè)腳本是通用的也適合其他 VOC 格式數(shù)據(jù)集import xml.etree.ElementTree as ET from pathlib import Path class_mapping { bicycle: 0, shared_bike: 0, 共享單車: 0, SharedBike: 0, } def voc_to_yolo(xml_path, out_path, img_width, img_height): root ET.parse(xml_path).getroot() lines [] for obj in root.iter(object): name obj.findtext(name) if name not in class_mapping: continue class_id class_mapping[name] box obj.find(bndbox) x1 float(box.findtext(xmin)) y1 float(box.findtext(ymin)) x2 float(box.findtext(xmax)) y2 float(box.findtext(ymax)) x_center ((x1 x2) / 2) / img_width y_center ((y1 y2) / 2) / img_height w (x2 - x1) / img_width h (y2 - y1) / img_height # 防止標(biāo)注越界導(dǎo)致訓(xùn)練報(bào)錯把數(shù)值夾到 0~1 之間 x_center min(max(x_center, 0.0), 1.0) y_center min(max(y_center, 0.0), 1.0) w min(max(w, 0.0), 1.0) h min(max(h, 0.0), 1.0) lines.append(f{class_id} {x_center:.6f} {y_center:.6f} {w:.6f} {h:.6f}) with open(out_path, w, encodingutf-8) as f: f.write(\n.join(lines))邏輯說明先從 XML 里找到所有 object讀取 name 和 bndbox。class_mapping 字典的作用是把多種寫法統(tǒng)一映射到類別 0。中心點(diǎn)坐標(biāo)用(x1 x2) / 2求得像素中心再分別除以圖片寬和高完成歸一化。寬和高直接做差后除以圖片尺寸。最后的 clamp 操作是必須的因?yàn)椴糠謽?biāo)注框會超出圖片邊界如果不處理YOLO 訓(xùn)練時(shí)可能因?yàn)樽鴺?biāo)超出 0~1 范圍而報(bào)錯或產(chǎn)生 nan loss。調(diào)用時(shí)注意img_width 和 img_height 必須讀 XML 里 size 字段的值不能自己去讀圖片因?yàn)?XML 里的標(biāo)注坐標(biāo)就是依據(jù)這張圖當(dāng)時(shí)的分辨率標(biāo)出來的。如果 XML 寫的是 1280x720而實(shí)際圖片被壓縮成 800x450以實(shí)際圖片寬高做歸一化所有標(biāo)簽都會偏。3.2 三個(gè)必調(diào)參數(shù)類名映射表、數(shù)據(jù)集劃分、路徑前綴第一個(gè)必調(diào)參數(shù)是類名映射表也就是 class_mapping。不同來源的共享單車數(shù)據(jù)集標(biāo)注名字五花八門不統(tǒng)一的必須在這里合并。合并完之后可以用一個(gè)小循環(huán)把整個(gè) annotations 目錄轉(zhuǎn)換掉label_root Path(labels) label_root.mkdir(exist_okTrue) for xml_path in xmls: root ET.parse(xml_path).getroot() size root.find(size) img_w int(size.findtext(width)) img_h int(size.findtext(height)) out_path label_root / f{xml_path.stem}.txt voc_to_yolo(xml_path, out_path, img_w, img_h)這里的參數(shù)要點(diǎn)是輸出文件主名與 XML 主名保持一致這樣每個(gè) txt 都能通過主名找到對應(yīng)的圖片。如果輸出名和原圖對不上后面訓(xùn)練時(shí)圖片路徑和標(biāo)簽路徑匹配不上會直接報(bào)錯。第二個(gè)必調(diào)參數(shù)是訓(xùn)練集和驗(yàn)證集的劃分比例。共享單車數(shù)據(jù)集如果圖片數(shù)量在幾千張級別8:1:1 或 9:1 都合理。我的做法是固定隨機(jī)種子避免每次跑出來劃分結(jié)果不同import random from pathlib import Path random.seed(42) image_files list(Path(images).glob(*.jpg)) list(Path(images).glob(*.png)) random.shuffle(image_files) n len(image_files) train_ratio, val_ratio 0.8, 0.1 train_files image_files[: int(n * train_ratio)] val_files image_files[int(n * train_ratio): int(n * (train_ratio val_ratio))] def write_list(file_list, list_path): with open(list_path, w, encodingutf-8) as f: for p in file_list: f.write(str(p.resolve()) \n) write_list(train_files, train.txt) write_list(val_files, val.txt)random.seed(42) 保證每次運(yùn)行劃分結(jié)果一致。這里有一個(gè)容易忽略的點(diǎn)如果這份共享單車數(shù)據(jù)集的圖片來自多個(gè)不同的拍攝地點(diǎn)按文件列表隨機(jī)劃分可能把同一地點(diǎn)的圖片同時(shí)分進(jìn)訓(xùn)練集和驗(yàn)證集導(dǎo)致驗(yàn)證指標(biāo)虛高。更嚴(yán)格的做法是按目錄或按拍攝批次劃分先把同一來源的圖片分到同一組再從中切分。對于亂停放檢測這種場景同一街道同一角度拍的照片高度相似同源數(shù)據(jù)跨訓(xùn)練驗(yàn)證集mAP 會高得離譜但換到新場景立刻失靈。第三個(gè)必調(diào)參數(shù)是 train.txt 和 val.txt 里的路徑。YOLO 訓(xùn)練時(shí)有兩種方式組織數(shù)據(jù)一種是直接用目錄結(jié)構(gòu)train 和 val 各自建 images 和 labels 子目錄另一種是提供 train.txt 和 val.txt每行寫圖片絕對路徑訓(xùn)練時(shí)自動找同主名的 txt 標(biāo)簽。我推薦后者因?yàn)楣蚕韱诬嚁?shù)據(jù)集可能來自多個(gè)壓縮包合并后目錄結(jié)構(gòu)不一定規(guī)整。路徑寫成絕對路徑訓(xùn)練時(shí)少一層糾結(jié)。3.3 轉(zhuǎn)換后的自查畫框驗(yàn)證與類別統(tǒng)計(jì)轉(zhuǎn)換腳本跑完不代表轉(zhuǎn)換成功。檢查分三層數(shù)量層、格式層、可視化層。數(shù)量層檢查 labels 目錄下的 txt 數(shù)量是否與 XML 數(shù)量一致有沒有輸出空文件???txt 文件說明 XML 里沒有有效 object也許是被 class_mapping 過濾掉了也許是原有標(biāo)注就是空的。格式層檢查隨便head幾個(gè) txthead -3 labels/shared_bike_001.txt正常輸出應(yīng)該是五行中的前幾行每行由 5 個(gè)數(shù)字組成類別 id 是 0后面四位小數(shù)在 0 到 1 之間。如果出現(xiàn)負(fù)數(shù)或大于 1 的值說明轉(zhuǎn)換前的 clamp 沒加上??梢暬瘜影?YOLO txt 畫回圖片import cv2 from pathlib import Path for txt_path in Path(labels).glob(*.txt): img_path txt_path.with_suffix(.jpg) if not img_path.exists(): img_path txt_path.with_suffix(.png) if not img_path.exists(): continue img cv2.imread(str(img_path)) for line in txt_path.read_text().strip().splitlines(): parts line.split() if len(parts) ! 5: continue cls_id, xc, yc, w, h [float(v) for v in parts] x1 int((xc - w / 2) * img.shape[1]) y1 int((yc - h / 2) * img.shape[0]) x2 int((xc w / 2) * img.shape[1]) y2 int((yc h / 2) * img.shape[0]) cv2.rectangle(img, (x1, y1), (x2, y2), (0, 255, 0), 2) cv2.imwrite(verify_ txt_path.stem .jpg, img)這個(gè)腳本是轉(zhuǎn)換過程的逆運(yùn)算把歸一化的中心點(diǎn)和寬高乘回圖片尺寸得到像素框畫出來。和 VOC 階段畫框不同的是這一步驗(yàn)證的是 YOLO 標(biāo)簽?zāi)芊癖徽_解析。建議抽查 30 到 50 張重點(diǎn)關(guān)注三類圖車輛密集的、嚴(yán)重遮擋的、光照很暗的。這些圖最容易暴露標(biāo)簽錯位和漏標(biāo)問題。做完自查數(shù)據(jù)端就算準(zhǔn)備好了。4. 配置 YOLO 環(huán)境并訓(xùn)練共享單車檢測yolov5 與 yolov8 都適用的最小閉環(huán)數(shù)據(jù)準(zhǔn)備好之后進(jìn)入訓(xùn)練環(huán)節(jié)?,F(xiàn)在的 YOLO 生態(tài)里yolov8 是主力yolov5 還有大量老項(xiàng)目在用。兩者在數(shù)據(jù)組織方式上一致都是圖片加 txt 標(biāo)簽只是環(huán)境配置和命令略有差異。下面按 yolov8 為主講順帶給出 yolov5 的對應(yīng)命令。4.1 anaconda 環(huán)境配置與預(yù)訓(xùn)練權(quán)重準(zhǔn)備訓(xùn)練 YOLO 系列模型最省心的方式是建一個(gè)獨(dú)立的 conda 環(huán)境避免和系統(tǒng) Python 或其他項(xiàng)目的 torch 版本沖突。命令如下conda create -n yolo python3.10 -y conda activate yolo pip install ultralytics參數(shù)說明Python 3.10 是目前兼容性比較好的版本torch 和 ultralytics 都支持。pip install ultralytics 會同時(shí)裝上 torch、torchvision、opencv、pandas 等依賴。如果機(jī)器上已經(jīng)有其他項(xiàng)目的 torch不要直接在這個(gè)環(huán)境里復(fù)用版本不一致會出現(xiàn)算子不匹配之類的詭異報(bào)錯。安裝完成后確認(rèn) GPU 可用python -c import torch; print(torch.cuda.is_available())輸出 True 說明能用 GPU。只有 CPU 也能訓(xùn)練但速度會慢很多。建議把數(shù)據(jù)集 YAML 里的路徑改成絕對路徑然后把 yolov8n.pt 預(yù)訓(xùn)練權(quán)重提前放到當(dāng)前目錄。沒有也沒關(guān)系ultralytics 在訓(xùn)練時(shí)會自動下載前提是運(yùn)行環(huán)境能訪問外網(wǎng)。預(yù)訓(xùn)練權(quán)重的作用是讓模型從 COCO 數(shù)據(jù)集學(xué)到的特征作為初始值對于共享單車這種單類檢測任務(wù)可以顯著減少訓(xùn)練輪數(shù)和過擬合風(fēng)險(xiǎn)。4.2 寫數(shù)據(jù)集 YAML 并啟動訓(xùn)練數(shù)據(jù)集 YAML 是 YOLO 訓(xùn)練讀取數(shù)據(jù)配置的唯一入口。創(chuàng)建 shared_bike.yaml# 共享單車檢測數(shù)據(jù)集配置 path: /home/user/shared_bike_dataset # 改成數(shù)據(jù)集解壓后的絕對路徑 train: train.txt val: val.txt nc: 1 names: [bicycle]train 和 val 這里寫的是相對 path 的文件名也可以直接寫絕對路徑。nc 是類別數(shù)量單類就是 1。names 列表里的名字要和 labels txt 里的類別 id 一一對應(yīng)只有一個(gè)類別時(shí)就是 0 對應(yīng) bicycle。啟動訓(xùn)練yolo detect train modelyolov8n.pt datashared_bike.yaml epochs100 imgsz640 batch16 device0參數(shù)說明model 指定預(yù)訓(xùn)練權(quán)重data 指定數(shù)據(jù)集配置epochs 是訓(xùn)練輪數(shù)imgsz 是輸入圖片尺寸batch 是批量大小device0 表示用第一塊 GPU。共享單車在常見圖片尺寸下占圖比例不算小640 夠用。如果攝像頭畫面里共享單車離得遠(yuǎn)、像素占得少可以提到 960代價(jià)是訓(xùn)練時(shí)間變長。yolov5 的對應(yīng)命令寫法不同但邏輯一樣python train.py --data shared_bike.yaml --weights yolov5s.pt --img 640 --batch 16 --epochs 100訓(xùn)練開始后終端會打印每一輪的 box_loss、cls_loss、dfl_loss、recall、mAP50 等指標(biāo)。第一次跑建議把 epochs 設(shè)到 100然后開早停。數(shù)據(jù)量小或者單類目標(biāo)通常到 60 到 80 輪就收斂了。另一個(gè)影響結(jié)果的關(guān)鍵參數(shù)是 batch。顯存夠大就往上加訓(xùn)練速度更快BN 層的統(tǒng)計(jì)也更準(zhǔn)。共享單車圖片分辨率普遍在 720p 以上batch16 需要 8GB 顯存左右如果報(bào) CUDA out of memory降到 8yolo detect train modelyolov8n.pt datashared_bike.yaml epochs100 imgsz640 batch8 device04.3 訓(xùn)練過程怎么看損失函數(shù)下降與 mAP 指標(biāo)訓(xùn)練跑起來之后不要只盯著終端滾動看。ultralytics 會把訓(xùn)練過程寫入 runs/detect/train 目錄下的 results.csv用 pandas 讀出來更直觀import pandas as pd df pd.read_csv(runs/detect/train/results.csv) print(df.columns.tolist()) print(df[[train/box_loss, train/cls_loss, train/dfl_loss, metrics/mAP50(B)]].tail(5))yolov8 的損失函數(shù)分成三塊。box_loss 負(fù)責(zé)回歸框的位置和寬高如果它下降緩慢說明標(biāo)簽坐標(biāo)噪聲大或者學(xué)習(xí)率不合適。cls_loss 是分類損失單類模型也要關(guān)注因?yàn)槟P捅举|(zhì)上在區(qū)分“共享單車”和“背景”。dfl_loss 是分布焦點(diǎn)損失控制框的邊界精確度。三項(xiàng)都在下降但不一定同步屬正?,F(xiàn)象。mAP50 是 IoU 閾值 0.5 下的平均精度單類項(xiàng)目主要看它。mAP50 能達(dá)到 0.8 以上說明模型已經(jīng)能穩(wěn)定檢出大部分目標(biāo)。mAP50-95 會更嚴(yán)格它考察不同 IoU 閾值下的綜合表現(xiàn)這個(gè)值偏低不用太慌可能是標(biāo)注框邊界畫得不緊也可能目標(biāo)本身遮擋太嚴(yán)重模型只能給出大概范圍。訓(xùn)練完成后權(quán)重文件保存在 runs/detect/train/weights/ 下best.pt 是驗(yàn)證集上表現(xiàn)最好的權(quán)重last.pt 是最后一輪的權(quán)重。部署時(shí)用 best.pt不要用 last.pt除非你確認(rèn)最后幾輪沒有過擬合。5. 避坑共享單車數(shù)據(jù)集訓(xùn)練全流程的五個(gè)高頻翻車點(diǎn)整理五個(gè)我在這類單類目標(biāo)檢測數(shù)據(jù)集上反復(fù)遇到的坑。每一條都是真實(shí)出現(xiàn)過的現(xiàn)象、原因、解決方式照單排查能省不少時(shí)間。5.1 現(xiàn)象檢測框整體偏移框完全不在共享單車上原因圖片在整理階段被統(tǒng)一 resize 過但 XML 里的 bndbox 坐標(biāo)沒有同步縮放。比如原圖是 1920x1080標(biāo)注坐標(biāo)也是按這個(gè)尺寸標(biāo)定的但數(shù)據(jù)集發(fā)布時(shí)把圖片壓成了 960x540XML 里的 size 字段卻還寫著 1920x1080。轉(zhuǎn)換腳本讀 size 做歸一化后標(biāo)簽仍然和原圖坐標(biāo)匹配但實(shí)際圖片已經(jīng)縮水訓(xùn)練時(shí)模型看到的框和內(nèi)容對不上。解決轉(zhuǎn)換前用 Python 讀實(shí)際圖片的寬高和 XML size 字段對比。不一致時(shí)以實(shí)際圖片為準(zhǔn)重新計(jì)算坐標(biāo)。如果圖片已經(jīng)丟失原始數(shù)據(jù)就只能根據(jù)縮放比例去換算標(biāo)注坐標(biāo)比如 x 坐標(biāo)乘 0.5、y 坐標(biāo)乘 0.5。5.2 現(xiàn)象loss 降得很快但 mAP 上不去原因標(biāo)注框過大把大量背景包了進(jìn)來。共享單車數(shù)據(jù)集里常見的標(biāo)注習(xí)慣是把車筐到后輪整個(gè)框住這沒問題但有些框連停車區(qū)域白線、旁邊的樹影都包進(jìn)去了。YOLO 回歸的是整個(gè)框的內(nèi)容背景占比越高模型特征越模糊檢測框就會忽大忽小。解決回到可視化抽查環(huán)節(jié)把訓(xùn)練集里預(yù)測置信度低于 0.5 的圖片集中看一遍框明顯偏大的重新標(biāo)注。如果數(shù)據(jù)集量太大沒法重標(biāo)可以寫腳本把每個(gè)框向內(nèi)收縮 5% 再訓(xùn)練相當(dāng)于強(qiáng)制讓模型關(guān)注更核心的目標(biāo)區(qū)域。我試過對共享單車這類目標(biāo)收縮 5% 到 8% 邊界后 mAP 能提升 3 個(gè)點(diǎn)左右。5.3 現(xiàn)象訓(xùn)練時(shí)提示類別數(shù)不匹配或者訓(xùn)練完成后預(yù)測出多個(gè)類別名原因數(shù)據(jù)集 YAML 里 nc1但 labels 目錄下生成的 txt 里出現(xiàn)了多個(gè)不同的類別 id。這種情況通常不是轉(zhuǎn)換腳本寫錯而是類名映射不完全。比如原始 XML 里有 bicycle、SharedBike、共享單車、共享電單車四種名字class_mapping 只映射了前三種共享電單車被過濾掉了但如果某個(gè) XML 里共享電單車的名字被寫成了 “電動車”它不在映射表中會被直接跳過于是圖片和標(biāo)簽錯位訓(xùn)練數(shù)據(jù)里出現(xiàn)“有圖無標(biāo)簽”的文件。解決轉(zhuǎn)換腳本不要用 continue 跳過未知類名而是把所有出現(xiàn)過的 name 打出來確認(rèn)每一類都能對應(yīng)到正確類別。共享單車數(shù)據(jù)集最怕混入共享電單車兩者外形相似但屬于不同目標(biāo)如果業(yè)務(wù)上需要把電單車也檢出來就應(yīng)該在映射表里給它單獨(dú)的類別 id而不是過濾掉。5.4 現(xiàn)象訓(xùn)練中途報(bào)錯坐標(biāo)值超出圖片范圍或者 loss 變成 nan原因XML 里有越界標(biāo)注bndbox 的坐標(biāo)超出了圖片寬高。這種標(biāo)簽通常來自半自動標(biāo)注工具少量框沒人工修正比如 xmax 大于圖片 widthymin 為負(fù)數(shù)。轉(zhuǎn)換后歸一化數(shù)值小于 0 或大于 1訓(xùn)練進(jìn)程計(jì)算 anchor 匹配時(shí)就會出錯。解決轉(zhuǎn)換腳本里的 clamp 已經(jīng)能把數(shù)值限制在 0~1 之間但更嚴(yán)謹(jǐn)?shù)淖龇ㄊ前言浇鐕?yán)重的樣本單獨(dú)挑出來。如果 xmax 只比寬度大十幾像素clamp 修正后基本不影響結(jié)果如果整個(gè)框有一半在圖片外說明標(biāo)注質(zhì)量有問題直接刪掉這張圖比強(qiáng)行修正更合理。加一個(gè)過濾條件是基本操作box_width x2 - x1 box_height y2 - y1 if box_width 10 or box_height 10: continue過濾掉過小的框能避免訓(xùn)練時(shí)數(shù)值不穩(wěn)定。10 像素這個(gè)閾值按圖片分辨率調(diào)720p 以下取 5 也行。5.5 現(xiàn)象驗(yàn)證集 mAP 接近 0.98但換到真實(shí)場景視頻里漏檢嚴(yán)重原因數(shù)據(jù)集劃分時(shí)沒有按拍攝來源分組。共享單車圖片往往按街道、小區(qū)、停車場分批次采集同一批次里同一角度連續(xù)拍攝的圖片高度相似。如果隨機(jī)劃分訓(xùn)練集和驗(yàn)證集里會出現(xiàn)大量近似重復(fù)的圖片模型其實(shí)記住了這些特定場景而不是學(xué)會檢測共享單車本身。解決回去檢查圖片的文件名或目錄結(jié)構(gòu)。一般情況下數(shù)據(jù)集發(fā)布時(shí)會按批次分目錄劃分 train 和 val 時(shí)先按目錄分組再把整個(gè)目錄分到一邊避免同場景圖片同時(shí)出現(xiàn)在兩邊。即使目錄信息不完整也可以用圖片文件名前綴或者拍攝時(shí)間字段做分組。驗(yàn)證時(shí)再用一段新場景視頻測試mAP 虛高的假象會立刻暴露。6. 驗(yàn)證共享單車檢測結(jié)果的三個(gè)技巧置信度門限與壞例回填訓(xùn)練跑完只完成一半真正決定能不能用的是驗(yàn)證環(huán)節(jié)。我通常不滿足于測試集上的 mAP而是拿三段不同時(shí)間、不同地點(diǎn)、不同光線條件的視頻跑一遍檢測。命令很簡單yolo detect predict modelruns/detect/train/weights/best.pt sourcetest_video.mp4 conf0.25source 可以是圖片、視頻或目錄conf 是置信度門限。這里就牽出第一個(gè)技巧門限不是拍腦袋定的。共享單車檢測的誤檢來源主要是電動車、摩托車和行人。電動車和共享單車同為兩輪交通工具在側(cè)面輪廓和車輪特征上極其相似conf 太低會把電動車當(dāng)共享單車檢出來。我的做法是先用 conf0.05 跑一遍完整視頻導(dǎo)出所有檢測框和目標(biāo)數(shù)量然后逐步提高到 0.1、0.25、0.5觀察檢出的目標(biāo)數(shù)量何時(shí)出現(xiàn)斷崖式下降。如果某個(gè)門限下目標(biāo)數(shù)量驟減說明大量真實(shí)目標(biāo)被卡掉了門限要回退一檔。第二個(gè)技巧是專門挑壞例回填訓(xùn)練集。把所有置信度在 0.3 到 0.6 之間的框抽出來人工看一眼。那些明明是正確的共享單車但模型不敢置信的圖copy 到訓(xùn)練集中重新訓(xùn)練一輪比盲目增加訓(xùn)練輪數(shù)效果好得多。共享單車數(shù)據(jù)集的壞例主要集中在密集堆放場景兩輛車靠在一起時(shí)模型經(jīng)常只檢出一輛這類樣本補(bǔ)充 100 到 200 張效果立竿見影。第三個(gè)技巧是框的范圍要和業(yè)務(wù)場景對齊。如果最終目標(biāo)是檢測亂停放標(biāo)注時(shí)應(yīng)該只框車身不框車前的停車區(qū)域如果最終目標(biāo)是統(tǒng)計(jì)某個(gè)路口的單車流量框可以稍微寬松一些減少漏檢。YOLO 學(xué)到的是框內(nèi)的特征分布框松緊直接影響后續(xù)評估。我自己做單車項(xiàng)目時(shí)曾為了省事讓標(biāo)注員把框畫得隨意后來花了一周時(shí)間返工從那以后每次轉(zhuǎn)換完標(biāo)簽都先畫幾十張圖肉眼確認(rèn)。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取