:從FER2013訓(xùn)練到部署)
簡介面向Python期末大作業(yè)的人臉表情識別項目基于ResNet搭建覆蓋圖像讀取、數(shù)據(jù)預(yù)處理、模型訓(xùn)練與效果評估的完整流程適合需要完成課程設(shè)計或入門深度學(xué)習(xí)的Python開發(fā)者參考。壓縮包共103個文件約54.11MB核心為19個py源碼文件32個png、14個jpg等圖片構(gòu)成表情樣本集3個hdf5文件提供預(yù)訓(xùn)練權(quán)重可直接加載模型進行測試另有xml配置文件、mp4演示視頻、md說明文檔和gif效果圖方便按需查閱。目前已有135人學(xué)習(xí)下載。源碼經(jīng)過本機調(diào)試可運行附帶的說明文檔能幫助理清數(shù)據(jù)集組織方式與訓(xùn)練流程訓(xùn)練好的權(quán)重文件讓不熟悉訓(xùn)練細節(jié)的同學(xué)也能直接體驗人臉表情識別效果而完整源碼又適合深入分析ResNet各層結(jié)構(gòu)與分類原理。整體難度適中既能支撐期末答辯也可作為K12階段接觸人工智能的實踐素材。1. 基于ResNet的人臉表情識別為什么是期末大作業(yè)里最穩(wěn)的選型每年期末都會看到一批人臉表情識別選題涌上來選型卻總在第一步翻車有人拿VGG在48×48的小圖上硬撐三天出不了能看的Loss有人自研CNN在驗證集上過擬合到懷疑人生?;赗esNet做表情識別之所以穩(wěn)是因為它把“深度”和“可訓(xùn)性”同時給了你——殘差連接讓梯度回傳不再玄學(xué)ResNet18在小數(shù)據(jù)集上就能壓得住數(shù)據(jù)量和算力都在一臺普通筆記本可承受范圍內(nèi)。這套方案本身是一份期末大作業(yè)的完整打包源碼、數(shù)據(jù)集加說明文檔適合正在趕進度、想用最少踩坑把項目跑通的同學(xué)。下面按“數(shù)據(jù)處理→模型訓(xùn)練→部署推理→問題排查”的順序拆開講每個環(huán)節(jié)都給能直接復(fù)現(xiàn)的代碼和參數(shù)。2. 把FER2013數(shù)據(jù)處理成ResNet能吃的格式讀取、增強與標(biāo)簽映射2.1 FER2013的CSV結(jié)構(gòu)一行一圖一標(biāo)簽FER2013是表情識別最常見的公開數(shù)據(jù)集存儲方式有點反直覺它不是一個圖片文件夾而是一個CSV文件每一行是一張48×48的灰度圖。第一列是emotion標(biāo)簽第二列是pixels第三列是Usage用來標(biāo)記這張圖屬于訓(xùn)練集還是測試集。pixels這一列是把48×48灰度值按行展開成2304個數(shù)字用空格分隔。做這個項目時第一步就是先把這三列拆明白不然后面讀數(shù)據(jù)全是坑。常見做法是先用Pandas讀進來看一眼Training、PublicTest、PrivateTest各自的數(shù)量。需要特別留意的是FER2013默認切分是Training約28709張、PublicTest約3589張、PrivateTest約3589張。期末大作業(yè)里我一般用Training做訓(xùn)練、PrivateTest做驗證PublicTest可以直接并入訓(xùn)練集讓ResNet18多看到約12%的數(shù)據(jù)這個操作對最后兩三個百分點的準(zhǔn)確率是有實際幫助的。import pandas as pd df pd.read_csv(fer2013.csv) print(df[Usage].value_counts()) # 按 Usage 切分Training 訓(xùn)練PrivateTest 驗證PublicTest 并入訓(xùn)練 train_df df[df[Usage] Training] val_df df[df[Usage] PrivateTest] extra_df df[df[Usage] PublicTest] train_df pd.concat([train_df, extra_df], ignore_indexTrue) print(train_df.shape, val_df.shape)這段代碼的邏輯是先打印三個子集的樣本數(shù)確認數(shù)據(jù)量然后分別篩出訓(xùn)練、驗證和可擴充部分最后把PublicTest拼進訓(xùn)練集。參數(shù)說明ignore_indexTrue是讓合并后的索引重新編號否則后面按索引取樣本時train_df和val_df的索引會重疊容易在自定義Dataset里張冠李戴val_df保持原樣不動是為了讓驗證集獨立于任何訓(xùn)練數(shù)據(jù)衡量到的準(zhǔn)確率才真實。切分完建議順手打印一下每個類別的樣本數(shù)FER2013的類別分布很不均勻這個信息后面做數(shù)據(jù)增強和類別加權(quán)時要用。2.2 數(shù)據(jù)增強參數(shù)翻轉(zhuǎn)、裁剪與歸一化表情識別一個容易被低估的點是數(shù)據(jù)增強。FER2013只有三萬多張灰度小圖ResNet18參數(shù)量一千多萬直接硬訓(xùn)十有八九過擬合。我一般會在訓(xùn)練側(cè)用RandomHorizontalFlip、RandomAffine和RandomCrop三件套驗證側(cè)只做歸一化和縮放堅決不做隨機變換——這是必須遵守的約定否則驗證集就失去了評估意義。具體參數(shù)上有講究。RandomHorizontalFlip的概率設(shè)0.5水平翻轉(zhuǎn)不會改變表情語義能把數(shù)據(jù)多樣性直接翻倍RandomAffine的degrees設(shè)10translate設(shè)0.1scale設(shè)0.9到1.1之間輕微旋轉(zhuǎn)和縮放模擬拍攝角度差異。注意角度不要設(shè)太大旋轉(zhuǎn)超過15度后人臉特征會明顯失真表情識別不是對旋轉(zhuǎn)很魯棒的任務(wù)這個是我調(diào)參數(shù)調(diào)出來的血淚經(jīng)驗。from torchvision import transforms train_transform transforms.Compose([ transforms.ToPILImage(), transforms.RandomHorizontalFlip(p0.5), transforms.RandomAffine(degrees10, translate(0.1, 0.1), scale(0.9, 1.1)), transforms.RandomCrop(48, padding4), transforms.ToTensor(), transforms.Normalize(mean[0.5], std[0.5]) ]) val_transform transforms.Compose([ transforms.ToPILImage(), transforms.ToTensor(), transforms.Normalize(mean[0.5], std[0.5]) ])關(guān)鍵點在于Normalize的mean和std都填0.5。因為FER2013是單通道灰度圖所以mean和std是長度為1的列表不是ImageNet預(yù)訓(xùn)練常用的三通道寫法[0.485, 0.456, 0.406]。RandomCrop的padding4表示先把圖擴邊到52×52再隨機裁回48×48等效于做了8像素范圍內(nèi)的平移增強這個操作對緩解過擬合很有效。如果你的數(shù)據(jù)集不是48×48需要把RandomCrop和模型輸入尺寸一起改成目標(biāo)值兩者必須保持一致這也是新手最容易埋下的隱患。2.3 自定義Dataset類的完整代碼FER2013的CSV格式?jīng)Q定了不能用torchvision的ImageFolder直接讀必須寫一個自定義Dataset。這個類要做三件事從DataFrame里取到pixels字符串、轉(zhuǎn)成48×48的numpy數(shù)組、再套上對應(yīng)的transform。代碼本身不復(fù)雜但邊界條件多寫的時候容易漏。from torch.utils.data import Dataset import numpy as np class Fer2013Dataset(Dataset): def __init__(self, df, transformNone): self.df df.reset_index(dropTrue) self.transform transform self.label_map {0: angry, 1: disgust, 2: fear, 3: happy, 4: sad, 5: surprise, 6: neutral} def __len__(self): return len(self.df) def __getitem__(self, idx): row self.df.iloc[idx] label int(row[emotion]) pixels np.array(row[pixels].split(), dtypenp.uint8) image pixels.reshape(48, 48) if self.transform: image self.transform(image) return image, label核心邏輯在__getitem__里pixels列用split()按空格拆成字符串列表再轉(zhuǎn)成uint8數(shù)組并reshape成48×48。dtype必須用np.uint8而不是默認的int64否則后面ToTensor會把輸入值域理解錯int64數(shù)組在部分PyTorch版本里甚至?xí)苯訄箢愋湾e誤。label_map這個字典是給最終推理時把數(shù)字標(biāo)簽翻譯成可讀字符串用的訓(xùn)練階段不參與計算但建議提前定義好后面畫混淆矩陣和報告寫分析都要用到。數(shù)據(jù)集這一層是整個流程的底座如果這里出了問題后面訓(xùn)練的模型全部白搭。建議在寫訓(xùn)練代碼之前單獨跑一段驗證取Dataset的前5個樣本打印image.shape和label確認輸出是torch.Size([1, 48, 48])和整型標(biāo)簽再繼續(xù)。這一步只花兩分鐘能省掉后面排查半天數(shù)據(jù)加載問題的痛苦。3. ResNet18搭建與訓(xùn)練核心代碼和參數(shù)設(shè)定3.1 為什么期末大作業(yè)選ResNet18而不是ResNet50選ResNet18而不是ResNet50核心不是玄學(xué)是成本和收益的權(quán)衡。ResNet18的參數(shù)量大約1120萬ResNet50大約2550萬后者在ImageNet這種千萬級數(shù)據(jù)集上確實更強但表情識別只有三萬多張訓(xùn)練圖深度加深帶來的收益會被過擬合抵消。更現(xiàn)實的是訓(xùn)練時間一臺普通筆記本CPU訓(xùn)練ResNet18一個epoch大約3到4分鐘ResNet50要翻倍期末大作業(yè)通常沒有那么多時間反復(fù)調(diào)參。實際操作上不管用torchvision自帶的resnet18還是自己實現(xiàn)都要做三處改動第一層卷積的in_channels從3改成1適配灰度圖conv1的kernel_size從7×7改成3×3stride改成1因為48×48的輸入圖用stride2的7×7卷積會直接丟掉一半信息最后的全連接層輸出改成7對應(yīng)7類表情。這三處改完剩下的殘差塊結(jié)構(gòu)原樣保留。import torch.nn as nn from torchvision import models def build_resnet18(num_classes7): model models.resnet18(pretrainedFalse) model.conv1 nn.Conv2d(1, 64, kernel_size3, stride1, padding1, biasFalse) model.fc nn.Linear(model.fc.in_features, num_classes) return modelpretrainedFalse這里值得專門說。torchvision的resnet18默認帶有ImageNet預(yù)訓(xùn)練權(quán)重輸入是三通道RGB而我們的數(shù)據(jù)是單通道灰度圖直接加載會出現(xiàn)第一層通道數(shù)不匹配。pretrainedFalse讓模型從頭初始化配合前面對conv1的修改訓(xùn)練時不會報維度錯誤。如果真想用遷移學(xué)習(xí)需要另外處理權(quán)重復(fù)制這個我在最后一部分單獨講。改完conv1之后模型的第一個卷積輸出仍然是64個通道殘差塊不需要任何額外調(diào)整這個改動是侵入性最小的。3.2 訓(xùn)練主循環(huán)與超參數(shù)設(shè)定訓(xùn)練主循環(huán)是整套代碼里最不值得自己造輪子的部分。常見做法就是標(biāo)準(zhǔn)PyTorch循環(huán)每個epoch遍歷訓(xùn)練DataLoader計算Loss、反向傳播、更新權(quán)重然后跑一遍驗證集計算準(zhǔn)確率。不需要自己寫分布式、混合精度這些東西期末大作業(yè)用不上加了還容易出環(huán)境兼容問題。import torch import torch.nn as nn from torch.utils.data import DataLoader device torch.device(cuda if torch.cuda.is_available() else cpu) model build_resnet18().to(device) criterion nn.CrossEntropyLoss() optimizer torch.optim.Adam(model.parameters(), lr1e-3, weight_decay1e-4) train_dataset Fer2013Dataset(train_df, transformtrain_transform) val_dataset Fer2013Dataset(val_df, transformval_transform) train_loader DataLoader(train_dataset, batch_size128, shuffleTrue, num_workers2) val_loader DataLoader(val_dataset, batch_size128, shuffleFalse, num_workers2) for epoch in range(30): model.train() train_loss 0.0 for images, labels in train_loader: images, labels images.to(device), labels.to(device) optimizer.zero_grad() outputs model(images) loss criterion(outputs, labels) loss.backward() optimizer.step() train_loss loss.item() * images.size(0) model.eval() correct 0 total 0 with torch.no_grad(): for images, labels in val_loader: images, labels images.to(device), labels.to(device) outputs model(images) _, predicted torch.max(outputs, 1) total labels.size(0) correct (predicted labels).sum().item() print(fEpoch {epoch1:02d} | Loss {train_loss / len(train_dataset):.4f} | Acc {correct / total:.4f})這里的超參數(shù)是權(quán)衡過的。batch_size設(shè)128是因為FER2013單張圖只有48×48×1顯存占用很小6GB顯存的顯卡毫無壓力如果CPU訓(xùn)練建議降到32或64減少每批次計算峰值。Adam的學(xué)習(xí)率1e-3是經(jīng)驗?zāi)J值weight_decay設(shè)1e-4做L2正則對壓制過擬合很關(guān)鍵。30個epoch是基線配置實際訓(xùn)練中盯著驗證集準(zhǔn)確率如果10個epoch后還在漲就繼續(xù)連續(xù)4個epoch不再提升就該考慮早?;蛘呓祵W(xué)習(xí)率了。參數(shù)取值說明batch_size128GPU可放寬CPU建議3264lr1e-3Adam默認經(jīng)驗值配合調(diào)度器動態(tài)調(diào)整weight_decay1e-4L2正則系數(shù)過擬合時優(yōu)先調(diào)大到1e-3epochs30基線配置按驗證集表現(xiàn)提前?;蜓娱L3.3 學(xué)習(xí)率調(diào)整與模型保存訓(xùn)練到后半程固定學(xué)習(xí)率容易在Loss曲面底部來回震蕩。我一般會在第15個epoch之后把學(xué)習(xí)率降到原來的十分之一讓權(quán)重在更小的步長下微調(diào)。常見做法是用ReduceLROnPlateau它會監(jiān)控驗證集Loss連續(xù)不下降就自動降學(xué)習(xí)率省去手動判斷的麻煩。from torch.optim.lr_scheduler import ReduceLROnPlateau scheduler ReduceLROnPlateau(optimizer, modemin, factor0.1, patience3) # 每個epoch驗證結(jié)束后調(diào)用 scheduler.step(val_loss)保存模型這里有個經(jīng)典誤區(qū)只保存state_dict而不是整個model對象。state_dict是權(quán)重的純字典形式體積小、加載快、跨機器兼容性好整個model序列化會把類的定義路徑也存進去換目錄或者換環(huán)境立刻報錯。保存時把驗證集準(zhǔn)確率最高的那份單獨命名為best_model.pth覆蓋保存這樣訓(xùn)練后期即使過擬合加重手里永遠握著最佳版本算是有后悔藥。best_acc 0.0 # 每個epoch驗證結(jié)束后 if acc best_acc: best_acc acc torch.save(model.state_dict(), best_model.pth)加載時用同一個build_resnet18函數(shù)先實例化模型再load_state_dict。注意要先把模型to(device)再加載否則CPU和GPU之間的權(quán)重device不匹配會報錯。如果是訓(xùn)練中斷后續(xù)訓(xùn)只加載權(quán)重還不夠——optimizer的state_dict也要一起保存和加載因為Adam的動量信息丟失后重啟訓(xùn)練前幾個epoch的效果會明顯變差。提示進程被殺或斷電時best_model.pth里保存的是最近一次驗證集最優(yōu)的權(quán)重。重新啟動直接加載這個文件繼續(xù)調(diào)參不需要從頭重跑能省下大量時間。4. 訓(xùn)練完怎么用圖片推理與攝像頭實時識別4.1 單張圖片推理代碼訓(xùn)練完成后最直接的驗證方式是拿一張沒見過的圖片跑前向推理。這個流程每一步都有對應(yīng)的坑讀圖→轉(zhuǎn)灰度→縮放48×48→歸一化→進模型→取softmax最大值對應(yīng)的類別。OpenCV的imread默認讀出來是BGR三通道必須先用cvtColor轉(zhuǎn)成灰度否則通道數(shù)對不上模型輸入。import cv2 import torch def predict_image(model, image_path, device): model.eval() img cv2.imread(image_path) gray cv2.cvtColor(img, cv2.COLOR_BGR2GRAY) resized cv2.resize(gray, (48, 48)) tensor torch.from_numpy(resized).unsqueeze(0).unsqueeze(0).float() / 255.0 tensor (tensor - 0.5) / 0.5 tensor tensor.to(device) with torch.no_grad(): output model(tensor) prob torch.softmax(output, dim1) pred torch.argmax(prob, dim1).item() label_map {0: angry, 1: disgust, 2: fear, 3: happy, 4: sad, 5: surprise, 6: neutral} return label_map[pred], prob[0, pred].item()這里有一個容易翻車的細節(jié)訓(xùn)練時Normalize用的是mean0.5、std0.5推理時也必須做一模一樣的歸一化不能只除以255就進模型。很多人在這里忘了減均值除標(biāo)準(zhǔn)差導(dǎo)致推理結(jié)果和驗證集準(zhǔn)確率對不上還以為是模型壞了。tensor從H×W變成1×1×H×W第一個unsqueeze(0)模擬batch維度第二個模擬channel維度因為灰度圖只有一個通道。softmax概率值同時返回方便在界面上顯示置信度答辯展示時比只給一個標(biāo)簽更有說服力。4.2 用OpenCV做攝像頭實時表情識別攝像頭實時識別是答辯時最出效果的部分。核心是用OpenCV的VideoCapture讀每一幀用Haar級聯(lián)檢測人臉并框出ROI把ROI縮放到48×48送進模型再把預(yù)測結(jié)果畫在框上。人臉檢測用的xml文件在OpenCV安裝目錄里自帶不需要額外下載。import cv2 import torch model build_resnet18() model.load_state_dict(torch.load(best_model.pth, map_locationcpu)) model.eval() cap cv2.VideoCapture(0) face_cascade cv2.CascadeClassifier(cv2.data.haarcascades haarcascade_frontalface_default.xml) label_map {0: angry, 1: disgust, 2: fear, 3: happy, 4: sad, 5: surprise, 6: neutral} while True: ret, frame cap.read() if not ret: break gray cv2.cvtColor(frame, cv2.COLOR_BGR2GRAY) faces face_cascade.detectMultiScale(gray, scaleFactor1.1, minNeighbors5, minSize(48, 48)) for (x, y, w, h) in faces: roi gray[y:yh, x:xw] roi cv2.resize(roi, (48, 48)) tensor torch.from_numpy(roi).unsqueeze(0).unsqueeze(0).float() / 255.0 tensor (tensor - 0.5) / 0.5 with torch.no_grad(): output model(tensor) pred torch.argmax(output, dim1).item() prob torch.softmax(output, dim1)[0, pred].item() cv2.rectangle(frame, (x, y), (xw, yh), (0, 255, 0), 2) cv2.putText(frame, f{label_map[pred]} {prob:.2f}, (x, y-10), cv2.FONT_HERSHEY_SIMPLEX, 0.9, (0, 255, 0), 2) cv2.imshow(FER, frame) if cv2.waitKey(1) 0xFF ord(q): break cap.release() cv2.destroyAllWindows()detectMultiScale的三個核心參數(shù)直接決定檢測靈敏度。scaleFactor1.1表示每次搜索窗口縮小10%越接近1越慢但越準(zhǔn)minNeighbors5表示一個候選框至少要有5個鄰近框確認才算人臉調(diào)小會出更多誤檢調(diào)大容易漏檢測minSize(48, 48)直接過濾掉比訓(xùn)練圖還小的框因為這種框即使檢測到了縮放進模型后也丟光了細節(jié)。這一段的實際體驗對答辯很關(guān)鍵建議提前在教室或?qū)嶒炇业墓庹諚l件下跑一遍確認能穩(wěn)定識別而不是到答辯現(xiàn)場才第一次試。5. 避坑指南訓(xùn)練過程中的5個常見翻車現(xiàn)場5.1 過擬合Loss下降但驗證集準(zhǔn)確率不動現(xiàn)象訓(xùn)練集Loss每輪都在降驗證集準(zhǔn)確率在60%上下原地踏步甚至往下掉。原因FER2013只有三萬多張圖ResNet18的擬合能力太強模型開始背誦訓(xùn)練樣本而不是學(xué)習(xí)表情的通用特征。這是小數(shù)據(jù)集配深網(wǎng)絡(luò)最典型的癥狀。解決三步走。第一確認數(shù)據(jù)增強有沒有實際作用到訓(xùn)練集很多人把增強寫在transform里卻在Dataset構(gòu)造時忘了傳進去。第二增大weight_decay從1e-4加到1e-3給權(quán)重更強的正則約束。第三在最后一層全連接前加一個nn.Dropout(p0.3)。我自己的經(jīng)驗是增大weight_decay比加Dropout效果來得更快同時訓(xùn)練Loss會略微抬高這是正常的說明過擬合被壓住了。5.2 數(shù)據(jù)不平衡個別類別準(zhǔn)確率低得離譜現(xiàn)象訓(xùn)練完成看分類報告angry和disgust的F1分數(shù)明顯低于happy和neutral單獨抽這幾類樣本測試準(zhǔn)確率不到40%。原因FER2013類別分布本來就不均勻disgust類只有大約600張訓(xùn)練樣本而happy有7000多張模型天然傾向預(yù)測占比大的類別少數(shù)類被犧牲掉。解決最有效的是在Loss層面做類別加權(quán)。torch.nn.CrossEntropyLoss自帶weight參數(shù)傳入與各類別樣本數(shù)倒數(shù)成比例的權(quán)重向量即可。另一個辦法是用WeightedRandomSampler做訓(xùn)練集采樣讓每個epoch中少數(shù)類被重復(fù)采樣到接近多數(shù)類的數(shù)量這樣不用改Loss就能讓模型在訓(xùn)練時看到均衡的類別比例。這兩種方法可以同時用期末作業(yè)里選用一種就能看到明顯改善。5.3 灰度圖和三通道維度不匹配現(xiàn)象DataLoader跑起來第一輪就報錯RuntimeError提示channel維度不匹配expected 3 got 1或者反過來在推理時報expected 1 got 3。原因模型第一層卷積的輸入通道寫的還是3但FER2013的數(shù)據(jù)是單通道灰度圖。反過來如果你推理時用cv2.imread直接讀彩色圖送進模型也會出現(xiàn)同樣的維度沖突。解決模型搭建時就要統(tǒng)一把conv1.in_channels改成1這是第一步。第二個容易忽略的是訓(xùn)練和推理的預(yù)處理必須完全一致如果訓(xùn)練用灰度圖推理就不能傳彩色圖。遇到這類錯誤優(yōu)先檢查模型定義和transform不要先懷疑數(shù)據(jù)本身。5.4 顯存不足或者CPU訓(xùn)練慢到崩潰現(xiàn)象訓(xùn)練到一半進程直接崩掉提示CUDA out of memory或者CPU訓(xùn)練一個epoch要十幾分鐘整個流程根本跑不完。原因batch_size太大把顯存擠爆或者num_workers設(shè)置不當(dāng)導(dǎo)致內(nèi)存開銷過高。學(xué)生筆記本往往是4GB顯存或干脆只有集顯本來負擔(dān)就重。解決batch_size降到32甚至16并確認模型和訓(xùn)練數(shù)據(jù)都在cuda上而沒有跑偏。如果CPU訓(xùn)練num_workers設(shè)成0可以避免多進程加載帶來的額外內(nèi)存開銷。更狠一點的辦法是先把預(yù)處理后的48×48圖存成npy數(shù)組訓(xùn)練時直接讀npy省掉每次CSV字符串解析的耗時實測CPU訓(xùn)練能提速20%以上。5.5 加載模型時key不匹配現(xiàn)象加載best_model.pth時報錯提示Missing key(s)和Unexpected key(s)比如fc.weight和conv1.weight對不上。原因兩個常見來源。一是模型實例化時改了結(jié)構(gòu)但保存的權(quán)重來自改結(jié)構(gòu)之前的模型二是環(huán)境A和B里的模型類定義不一致比如一臺機器用的全連接層輸出是7類另一臺改成了別的數(shù)值。解決先打印模型每一層名字和權(quán)重形狀檢查conv1和fc是否和構(gòu)造時一致。保存和加載必須用同一個build_resnet18函數(shù)不要手動New一個結(jié)構(gòu)后再load。另外torch.load時加map_locationcpu即使權(quán)重是在GPU上訓(xùn)練的也能在無GPU的機器上加載不會因為device不匹配報錯這是最實用的一個技巧。6. 讓準(zhǔn)確率再進一步遷移學(xué)習(xí)與混淆矩陣分析6.1 用torchvision預(yù)訓(xùn)練權(quán)重做遷移學(xué)習(xí)如果驗證集準(zhǔn)確率卡在65%左右上不去一個可嘗試的提升手段是用ImageNet預(yù)訓(xùn)練權(quán)重做遷移學(xué)習(xí)。但這里的坑很明確ImageNet是三通道彩色圖FER2013是單通道灰度圖直接加載會通道數(shù)不匹配。常見做法是把灰度圖復(fù)制成三通道然后加載預(yù)訓(xùn)練模型再凍結(jié)前幾層只微調(diào)后面幾層。from torchvision import models model models.resnet18(pretrainedTrue) model.conv1 nn.Conv2d(1, 64, kernel_size3, stride1, padding1, biasFalse) # 復(fù)制權(quán)重新conv1每個輸出通道取原權(quán)重在輸入通道維度的均值 with torch.no_grad(): model.conv1.weight.copy_(model.conv1.weight.mean(dim1, keepdimTrue)) model.fc nn.Linear(512, 7)權(quán)重復(fù)制這里用取均值的方法原conv1權(quán)重形狀是[64, 3, 7, 7]在輸入通道維度求均值后變成[64, 1, 7, 7]keepdimTrue保持維度數(shù)不變。但說實話FER2013和ImageNet的域差距很大預(yù)訓(xùn)練權(quán)重的收益沒有目標(biāo)檢測任務(wù)里那么明顯我從65%提到68%左右提升有限。如果你時間緊先做好數(shù)據(jù)增強和正則也足夠交差遷移學(xué)習(xí)是加分項而不是必選項。6.2 混淆矩陣的繪制與報告引用期末大作業(yè)的說明文檔里準(zhǔn)確率一個數(shù)字說服力有限混淆矩陣是答辯時最直觀展示模型短板的東西。它一眼就能看出模型把難過誤判成了中性還是把恐懼誤判成了驚訝。繪制方法是在驗證集上收集所有預(yù)測結(jié)果和真實標(biāo)簽用sklearn生成矩陣再用seaborn畫成熱力圖。from sklearn.metrics import confusion_matrix import matplotlib.pyplot as plt import seaborn as sns y_true, y_pred [], [] model.eval() with torch.no_grad(): for images, labels in val_loader: images, labels images.to(device), labels.to(device) outputs model(images) _, predicted torch.max(outputs, 1) y_true.extend(labels.cpu().numpy()) y_pred.extend(predicted.cpu().numpy()) cm confusion_matrix(y_true, y_pred) labels [angry, disgust, fear, happy, sad, surprise, neutral] plt.figure(figsize(10, 8)) sns.heatmap(cm, annotTrue, fmtd, xticklabelslabels, yticklabelslabels) plt.xlabel(Predicted) plt.ylabel(True) plt.tight_layout() plt.savefig(confusion_matrix.png, dpi150)這段代碼里y_true和y_pred要全部收集完再統(tǒng)一算一次混淆矩陣不能在每個batch里分別算再相加因為混淆矩陣本質(zhì)是全量預(yù)測結(jié)果的計數(shù)。annotTrue會在每個格子顯示數(shù)字fmtd表示用整數(shù)格式顯示否則seaborn默認用科學(xué)計數(shù)法?;煜仃嚪胚M報告時記得在下方配一段簡短分析指出哪兩類最容易混淆比如sad和neutral再解釋這個結(jié)果和人類認知的一致性。只貼圖不解釋的扣分概率很高這段文字是評分時的實際加分項。最后說說我的習(xí)慣。做這個項目時我在訓(xùn)練完成后會留著最后一版模型和第一版模型的準(zhǔn)確率對比寫報告時把每次調(diào)參改了什么、驗證集漲了多少點逐條列出來這份過程記錄比最后的準(zhǔn)確率數(shù)字更能體現(xiàn)工作量。答辯時被問到“你怎么知道這是過擬合”直接把自己記錄里訓(xùn)練Loss下降、驗證Acc停滯的曲線拿出來講比背概念有說服力得多。這個基于ResNet的表情識別項目真正值錢的不是那幾行模型代碼而是你有沒有把數(shù)據(jù)、訓(xùn)練、推理這條鏈路上的每個環(huán)節(jié)都走通并且把原理說清楚。希望幫到你。本文還有配套的精品資源點擊獲取