網(wǎng)絡(luò)Python實(shí)現(xiàn):從零手寫回歸預(yù)測代碼與調(diào)參指南)
簡介資源為bp.zip壓縮包內(nèi)含單個(gè)Python源碼文件大小僅1KB卻實(shí)現(xiàn)了完整的BP神經(jīng)網(wǎng)絡(luò)核心流程。這份代碼基于numpy編寫面向深度學(xué)習(xí)入門者及需要在Python環(huán)境中快速搭建預(yù)測模型的開發(fā)者可直接用于分類或回歸任務(wù)比如股價(jià)走勢、溫度變化等數(shù)值預(yù)測。代碼涵蓋數(shù)據(jù)預(yù)處理、網(wǎng)絡(luò)結(jié)構(gòu)定義、權(quán)重初始化、前向傳播、反向傳播和訓(xùn)練循環(huán)等關(guān)鍵環(huán)節(jié)并支持通過調(diào)整迭代次數(shù)疊加次數(shù)與學(xué)習(xí)率步長來控制訓(xùn)練效果用戶只需替換輸入數(shù)據(jù)即可適配自己的業(yè)務(wù)場景。目前已有375人學(xué)習(xí)下載文件雖小但邏輯清晰適合對照理論逐行學(xué)習(xí)也為其后擴(kuò)展多層隱藏層、引入可視化調(diào)試或優(yōu)化算法提供了簡潔的起點(diǎn)適合課程設(shè)計(jì)或畢業(yè)設(shè)計(jì)參考。1. bp.py 在預(yù)測任務(wù)里的定位一份從零寫起的 BP 神經(jīng)網(wǎng)絡(luò)源碼bp.zip 里的 bp.py是一個(gè)用 Python 手寫實(shí)現(xiàn)的 BP 神經(jīng)網(wǎng)絡(luò)核心就一個(gè)文件干的事情是拿歷史數(shù)據(jù)訓(xùn)練一個(gè)多層前饋網(wǎng)絡(luò)訓(xùn)練完再對新的輸入做預(yù)測。很多來下載這份源碼的人并不是來研究 bp 神經(jīng)網(wǎng)絡(luò)結(jié)構(gòu)圖的而是手里有一批數(shù)據(jù)要做課程設(shè)計(jì)、實(shí)驗(yàn)或者論文里的一個(gè)環(huán)節(jié)——比如預(yù)測建材價(jià)格、股票收盤價(jià)這類數(shù)值預(yù)測。這份資源實(shí)際能解決的就是這類問題把影響因子整理成特征矩陣喂進(jìn)去迭代幾千輪代碼里的疊加次數(shù)按步長學(xué)習(xí)率調(diào)權(quán)重得到一個(gè)能對未知數(shù)據(jù)輸出預(yù)測值的模型。適合兩類人一類是想讀一遍 BP 神經(jīng)網(wǎng)絡(luò) Python 代碼、搞清楚梯度下降怎么落地的入門者另一類是拿它當(dāng)基線模型、想快速出第一版預(yù)測結(jié)果再換復(fù)雜算法的。邊界也很清楚只有 bp.py 一個(gè)源碼文件沒有配套數(shù)據(jù)集歸一化、切分、調(diào)參這些都得自己補(bǔ)。2. 網(wǎng)絡(luò)結(jié)構(gòu)與權(quán)重初始化三層節(jié)點(diǎn)數(shù)和隨機(jī)數(shù)里藏著的門道2.1 三層網(wǎng)絡(luò)結(jié)構(gòu)輸入、隱藏、輸出節(jié)點(diǎn)數(shù)怎么定BP 神經(jīng)網(wǎng)絡(luò)的標(biāo)準(zhǔn)結(jié)構(gòu)是三層前饋輸入層、隱藏層、輸出層。bp.py 作為一份教學(xué)性質(zhì)的基礎(chǔ)實(shí)現(xiàn)默認(rèn)就是這種結(jié)構(gòu)隱藏層可以擴(kuò)成多層但一份跑教學(xué)的代碼通常先把單層隱藏層跑通就夠了。輸入層節(jié)點(diǎn)數(shù)沒有懸念等于你的特征維度。比如你預(yù)測建材價(jià)格輸入端用的是水泥價(jià)格指數(shù)、鋼材期貨價(jià)、人工成本、運(yùn)輸成本四個(gè)變量輸入層就是 4 個(gè)節(jié)點(diǎn)。輸出層節(jié)點(diǎn)數(shù)等于預(yù)測目標(biāo)的數(shù)量單目標(biāo)回歸就是 1 個(gè)節(jié)點(diǎn)換成分類任務(wù)才需要多個(gè)節(jié)點(diǎn)。隱藏層節(jié)點(diǎn)數(shù)是整個(gè)網(wǎng)絡(luò)里唯一需要人工試探的超參數(shù)。它的取值沒有數(shù)學(xué)上的標(biāo)準(zhǔn)答案業(yè)內(nèi)通常先用經(jīng)驗(yàn)公式估算一個(gè)范圍再在這個(gè)范圍里試幾個(gè)值對比效果。最常見的兩個(gè)估法一個(gè)是取 sqrt(輸入節(jié)點(diǎn)數(shù) × 輸出節(jié)點(diǎn)數(shù))再加一個(gè) 1 到 10 的常數(shù)另一個(gè)更粗糙直接取輸入節(jié)點(diǎn)數(shù)的 1.5 到 2 倍。我一般習(xí)慣先按輸入節(jié)點(diǎn)數(shù)的 1.5 倍跑通整個(gè)流程然后在該值上下各取兩個(gè)數(shù)字看驗(yàn)證集誤差哪個(gè)小就用哪個(gè)不追求一次到位。按任務(wù)規(guī)模給一個(gè)起步參考表| 任務(wù)規(guī)模 | 輸入節(jié)點(diǎn) | 隱藏節(jié)點(diǎn) | 輸出節(jié)點(diǎn) | 典型場景 | | 小 | 2-4 | 4-8 | 1 | 兩三個(gè)特征預(yù)測一個(gè)目標(biāo)回歸入門 | | 中 | 5-10 | 8-20 | 1-3 | 多因子價(jià)格預(yù)測、簡單分類 | | 大 | 10 | 16-40 | 1-N | 特征較多的回歸或多分類 |要說明的是這個(gè)表不是硬約束。隱藏節(jié)點(diǎn)太少網(wǎng)絡(luò)擬合能力不足訓(xùn)練集誤差都?jí)翰幌氯ル[藏節(jié)點(diǎn)太多可學(xué)習(xí)參數(shù)數(shù)量膨脹訓(xùn)練樣本不夠時(shí)極易過擬合。對 bp.py 這種基礎(chǔ)實(shí)現(xiàn)從隱藏節(jié)點(diǎn) 輸入節(jié)點(diǎn) × 1.5起步是最省事的因?yàn)楹罄m(xù)換數(shù)據(jù)、調(diào)學(xué)習(xí)率時(shí)你不用反復(fù)改結(jié)構(gòu)。另外一個(gè)容易被忽略的點(diǎn)是為什么中間必須要這一層非線性激活如果三層全部是線性變換無論堆多少層在數(shù)學(xué)上都能等價(jià)成一層線性加權(quán)擬合不了任何彎折的映射關(guān)系。sigmoid 這類非線性函數(shù)引入后網(wǎng)絡(luò)才有能力逼近非線性函數(shù)。這也是 BP 神經(jīng)網(wǎng)絡(luò)區(qū)別于普通線性回歸的根本原因理解這一點(diǎn)再去看代碼前向傳播那兩行矩陣乘法才不是死記。2.2 權(quán)重初始化numpy 里的小隨機(jī)數(shù)藏著什么講究打開 bp.py如果看過源碼就會(huì)注意到導(dǎo)入 numpy 之后第一件事基本就是生成隨機(jī)權(quán)重。這個(gè)隨機(jī)數(shù)的取值范圍不是隨便定的它直接決定網(wǎng)絡(luò)能不能正常進(jìn)入訓(xùn)練狀態(tài)。權(quán)重取太大輸入經(jīng)過線性加權(quán)后落入 sigmoid 的飽和區(qū)導(dǎo)數(shù)值接近 0反向傳播傳回來的梯度也隨即消融表現(xiàn)就是訓(xùn)練好幾輪 loss 紋絲不動(dòng)。常見做法是生成 [-1, 1] 區(qū)間的小隨機(jī)數(shù)再乘一個(gè)縮放系數(shù)讓初始權(quán)重落在 [-0.5, 0.5] 附近。如果輸入特征維度很高可以進(jìn)一步縮到 1/sqrt(input_size)保證加權(quán)和的量級(jí)不隨維度增大而膨脹。numpy 實(shí)現(xiàn)如下import numpy as np def init_network(input_size, hidden_size, output_size, seedNone): if seed is not None: np.random.seed(seed) # 輸入層到隱藏層權(quán)重矩陣shape (input_size, hidden_size) w1 np.random.uniform(-1, 1, size(input_size, hidden_size)) * 0.5 # 隱藏層到輸出層權(quán)重矩陣shape (hidden_size, output_size) w2 np.random.uniform(-1, 1, size(hidden_size, output_size)) * 0.5 # 每層各配一個(gè)偏置向量讓激活函數(shù)可以左右平移 b1 np.zeros((1, hidden_size)) b2 np.zeros((1, output_size)) return w1, b1, w2, b2這段代碼的邏輯是w1 負(fù)責(zé)把輸入特征線性組合成隱藏層的加權(quán)輸入每個(gè)隱藏節(jié)點(diǎn)其實(shí)就是一個(gè)加權(quán)求和器b1 為這組加權(quán)和加一個(gè)可偏移的常數(shù)。w2 再把隱藏層的激活輸出組合成最終預(yù)測值。權(quán)重乘 0.5 是為了把初始加權(quán)輸出盡量壓在 sigmoid 的中間線性區(qū)間附近避免一開始就進(jìn)入飽和區(qū)。seed 參數(shù)用于復(fù)現(xiàn)實(shí)驗(yàn)同樣的隨機(jī)種子每次跑結(jié)果完全一致而調(diào)參時(shí)如果沒有固定 seed兩次運(yùn)行的初始權(quán)重不一樣改一個(gè)參數(shù)得到的效果差異就分不清是參數(shù)造成的還是隨機(jī)性造成的。參數(shù)說明input_size 必須和特征矩陣 X 的列數(shù)一致寫錯(cuò)了 numpy 會(huì)直接報(bào)維度不匹配hidden_size 是唯一需要人工試的超參數(shù)output_size 在回歸任務(wù)里通常填 1。偏置全部初始化為 0 而不是隨機(jī)數(shù)這在實(shí)踐中對收斂速度影響很小好處是第一次前向傳播的輸出值更容易反推計(jì)算過程便于新手驗(yàn)證自己對網(wǎng)絡(luò)的理解。2.3 激活函數(shù)選擇與整體超參數(shù)表bp.py 里的激活函數(shù)大概率是 sigmoid因?yàn)?BP 神經(jīng)網(wǎng)絡(luò)的教材推導(dǎo)基本都拿它講。sigmoid 的輸出區(qū)間是 (0, 1)天然適合處理歸一化后的數(shù)據(jù)。不過如果你的數(shù)據(jù)預(yù)處理時(shí)歸一化到了 [-1, 1]可以考慮換成 tanh它在 0 附近的梯度更大收斂往往更快代價(jià)是反向傳播公式里導(dǎo)數(shù)項(xiàng)要跟著換。給一張超參數(shù)起步表拿到 bp.py 后先按這個(gè)底子跑一遍再逐步收緊| 參數(shù) | 推薦初值 | 調(diào)整方向 | 說明 | | 學(xué)習(xí)率步長 | 0.01 ~ 0.1 | 大 → 小 | 過大 loss 震蕩發(fā)散過小收斂太慢 | | 疊加次數(shù)epoch | 1000 ~ 10000 | 看 loss 曲線 | 教學(xué)場景 1000 次起步看曲線再?zèng)Q定加不加 | | 隱藏層節(jié)點(diǎn) | 輸入節(jié)點(diǎn) × 1.5 | 上下各試 2 個(gè) | 用驗(yàn)證集誤差選別盯著訓(xùn)練集 | | 權(quán)重初始化范圍 | [-0.5, 0.5] | 再小不過 1/sqrt(n) | 防止 sigmoid 飽和導(dǎo)致梯度消失 |這些參數(shù)在 bp.py 里對應(yīng)的是疊加次數(shù)和步長兩個(gè)變量改起來很直接但改完以后怎么判斷改得對不對要看訓(xùn)練過程中的 loss 輸出曲線這部分到第 6 章展開。3. 前向傳播到反向傳播訓(xùn)練循環(huán)里每一步都在算什么3.1 前向傳播矩陣乘法和 sigmoid 激活前向傳播是 bp.py 里最直觀的部分本質(zhì)就兩行矩陣運(yùn)算加一次激活函數(shù)。對輸入 X 做線性加權(quán)過激活函數(shù)再線性加權(quán)再過一次輸出激活得到預(yù)測值。實(shí)現(xiàn)如下def sigmoid(x): return 1.0 / (1.0 np.exp(-x)) def forward(w1, b1, w2, b2, X): # 隱藏層加權(quán)輸入 z1 np.dot(X, w1) b1 # 隱藏層激活輸出 a1 sigmoid(z1) # 輸出層加權(quán)輸入 z2 np.dot(a1, w2) b2 # 輸出層激活輸出即預(yù)測值 y_pred sigmoid(z2) return y_pred, a1, z1, z2這段代碼的邏輯是X 的形狀是 (m, input_size)m 是樣本條數(shù)。np.dot(X, w1) 得到 (m, hidden_size)加上 b1 后每個(gè)隱藏節(jié)點(diǎn)收到一個(gè)來自全部特征的加權(quán)和。sigmoid 把這個(gè)加權(quán)和壓到 (0, 1) 區(qū)間作為非線性輸出 a1。a1 再乘 w2得到 (m, output_size) 的 y_pred。返回 a1、z1、z2 是因?yàn)榉聪騻鞑ビ?jì)算梯度時(shí)要反復(fù)用到這些中間值如果前向傳播不返回它們反向傳播階段還得重新算一遍?;貧w任務(wù)里一個(gè)值得注意的點(diǎn)如果預(yù)測目標(biāo)只有正數(shù)且量級(jí)集中在某個(gè)區(qū)間最后套一層 sigmoid 是可接受的預(yù)測完再還原量綱。但如果目標(biāo)值可能跨正負(fù)或者范圍明顯超出 (0,1)輸出層的 sigmoid 就幫了倒忙這時(shí)應(yīng)該改成純線性輸出也就是 z2 直接作為 y_pred倒數(shù)第 5 章會(huì)專門講這個(gè)坑。3.2 反向傳播誤差怎么攤回去反向傳播是新手最容易懵的部分。它的核心思想一句話能說清把輸出層的誤差沿網(wǎng)絡(luò)逐層往回分配每一層根據(jù)分配到的誤差求出權(quán)重梯度。這里的依據(jù)就是鏈?zhǔn)椒▌t——損失對某個(gè)權(quán)重的偏導(dǎo)等于損失對輸出的導(dǎo)數(shù)乘以輸出對該權(quán)重的導(dǎo)數(shù)一路乘下去。以回歸任務(wù)最常用的均方誤差損失為例def backward(X, y, y_pred, a1, z1, z2, w2): m X.shape[0] # 輸出層誤差MSE 對 z2 的偏導(dǎo)注意乘上 sigmoid 導(dǎo)數(shù) d_z2 (y_pred - y) * sigmoid(z2) * (1 - sigmoid(z2)) # w2 梯度a1 轉(zhuǎn)置乘 d_z2再除以樣本數(shù)取平均 d_w2 np.dot(a1.T, d_z2) / m # b2 梯度誤差求和取平均keepdims 保持矩陣形狀 d_b2 np.sum(d_z2, axis0, keepdimsTrue) / m # 誤差經(jīng) w2 傳回隱藏層 d_a1 np.dot(d_z2, w2.T) # 隱藏層誤差乘 sigmoid 在 z1 處的導(dǎo)數(shù) d_z1 d_a1 * sigmoid(z1) * (1 - sigmoid(z1)) # w1 梯度與 b1 梯度 d_w1 np.dot(X.T, d_z1) / m d_b1 np.sum(d_z1, axis0, keepdimsTrue) / m return d_w1, d_b1, d_w2, d_b2邏輯說明d_z2 是損失對輸出層加權(quán)輸入 z2 的梯度sigmoid(z2)*(1-sigmoid(z2)) 是 sigmoid 的導(dǎo)數(shù)由鏈?zhǔn)椒▌t自然出現(xiàn)。d_w2 的形狀必須和 w2 完全一致用 a1.T 乘 d_z2 才對齊這個(gè)轉(zhuǎn)置關(guān)系是新手最容易寫錯(cuò)的地方。d_z1 的計(jì)算體現(xiàn)了反向傳播這個(gè)名字的由來輸出層誤差經(jīng)過 w2.T 傳遞回隱藏層再乘隱藏層激活函數(shù)導(dǎo)數(shù)。除以 m 是取平均梯度好處是學(xué)習(xí)率和樣本量解耦——換了一批更多或更少的數(shù)據(jù)學(xué)習(xí)率不用重新調(diào)。如果漏掉這里同樣的學(xué)習(xí)率在不同數(shù)據(jù)量下收斂速度會(huì)天差地別。3.3 訓(xùn)練循環(huán)疊加次數(shù)和步長的配合訓(xùn)練循環(huán)就是把前向傳播、反向傳播、權(quán)重更新三件事重復(fù)執(zhí)行疊加次數(shù)epoch和前向反向執(zhí)行的次數(shù)一一對應(yīng)。bp.py 里的訓(xùn)練主邏輯大致如下def train(X, y, hidden_size8, epochs2000, lr0.05): input_size X.shape[1] output_size 1 w1, b1, w2, b2 init_network(input_size, hidden_size, output_size) losses [] for epoch in range(1, epochs 1): # 前向傳播拿預(yù)測值 y_pred, a1, z1, z2 forward(w1, b1, w2, b2, X) # 反向傳播拿各層梯度 d_w1, d_b1, d_w2, d_b2 backward(X, y, y_pred, a1, z1, z2, w2) # 權(quán)重更新步長 lr 決定每步走多遠(yuǎn) w1 - lr * d_w1 b1 - lr * d_b1 w2 - lr * d_w2 b2 - lr * d_b2 if epoch % 100 0: loss np.mean((y_pred - y) ** 2) losses.append(loss) print(fepoch {epoch}, loss {loss:.6f}) return w1, b1, w2, b2, losses兩個(gè)參數(shù)的含義在代碼里很直觀epoch 就是描述里的疊加次數(shù)設(shè)成 2000 意味著同一批數(shù)據(jù)被前向反向跑 2000 遍每次迭代都按當(dāng)前梯度方向把權(quán)重挪一小步lr 就是步長控制這一步的大小。lr 取 0.05 屬于保守起步值對大多數(shù)歸一化后的回歸數(shù)據(jù)都能穩(wěn)定下降。loss 打印間隔設(shè)成 100每 100 次看一眼下降趨勢不用每一輪都往終端刷。需要注意這個(gè)訓(xùn)練循環(huán)沒有做任何學(xué)習(xí)率衰減也沒有早停機(jī)制。bp.py 作為基礎(chǔ)實(shí)現(xiàn)是夠用的但當(dāng)你發(fā)現(xiàn) loss 在某個(gè)水平震蕩不再下降時(shí)不要盲目加大 epochs那只會(huì)浪費(fèi)時(shí)間正確做法先看是不是學(xué)習(xí)率太大再考慮是否遭遇了局部最優(yōu)具體排查在第 5 章。4. 數(shù)據(jù)預(yù)處理與完整調(diào)用拿到 bp.py 后第一件事做什么4.1 歸一化為什么是 BP 能不能收斂的前置條件bp.py 沒有自帶數(shù)據(jù)集所以到手第一件事是處理你自己的數(shù)據(jù)。sigmoid 的輸出區(qū)間是 (0, 1)如果輸入特征的量級(jí)是幾千幾萬加權(quán)和會(huì)非常大sigmoid 直接飽和梯度消失訓(xùn)練等于白跑。歸一化不是可選項(xiàng)是前置條件。min-max 歸一化的 numpy 實(shí)現(xiàn)很簡單但有一個(gè)細(xì)節(jié)容易忽略保存歸一化用的最小值和跨度預(yù)測階段要用同一組參數(shù)還原量綱。def minmax_normalize(data, feature_range(0, 1)): min_val np.min(data, axis0) max_val np.max(data, axis0) span max_val - min_val # 某個(gè)特征全是相同值時(shí)跨度會(huì)是 0加個(gè)保護(hù)防止除零 span[span 0] 1 normed (data - min_val) / span normed normed * (feature_range[1] - feature_range[0]) feature_range[0] return normed, min_val, span邏輯說明data 可以是特征矩陣也可以是目標(biāo)列axis0 表示按列取最小值和最大值每一列獨(dú)立歸一化。返回值里 min_val 和 span 必須留下來因?yàn)橛?xùn)練完成后新來的預(yù)測數(shù)據(jù)要先用訓(xùn)練時(shí)保存的 min_val 和 span 做同樣的變換否則訓(xùn)練用的是 0 到 1預(yù)測時(shí)喂的是原始量級(jí)輸出必然錯(cuò)得離譜。參數(shù)說明feature_range 默認(rèn)是 (0, 1)對應(yīng) sigmoid 輸出區(qū)間。如果換用 tanh 激活可以改成 (-1, 1)效果通常更好。span[span 0] 1 這行是防御性寫法特征全相同的情況在實(shí)際數(shù)據(jù)里不少見不加這行程序會(huì)直接報(bào)除零錯(cuò)誤。4.2 訓(xùn)練集與測試集劃分固定隨機(jī)種子才能公平對比訓(xùn)練循環(huán)如果拿全部數(shù)據(jù)反復(fù)過模型對訓(xùn)練數(shù)據(jù)會(huì)擬合得非常好但看不出泛化能力。留出一部分?jǐn)?shù)據(jù)做測試是 BP 神經(jīng)網(wǎng)絡(luò)實(shí)驗(yàn)的基本操作。常見比例是留出 20% 左右順序要先打亂再切分不然按時(shí)間排序的數(shù)據(jù)會(huì)讓訓(xùn)練集和測試集分布不一致。def split_dataset(X, y, test_ratio0.2, shuffleTrue, seed42): m X.shape[0] idx np.arange(m) if shuffle: # 固定 seed保證每次運(yùn)行時(shí)切分結(jié)果一致 rng np.random.default_rng(seed) rng.shuffle(idx) n_test int(m * test_ratio) test_idx idx[:n_test] train_idx idx[n_test:] return X[train_idx], X[test_idx], y[train_idx], y[test_idx]邏輯說明先給每行樣本生成索引數(shù)組打亂后按比例切出測試索引和訓(xùn)練索引。X 和 y 用同樣的索引取值保證特征和標(biāo)簽的對應(yīng)關(guān)系不亂。固定 seed42 是調(diào)參實(shí)驗(yàn)里一個(gè)特別實(shí)用的習(xí)慣。因?yàn)槊看芜\(yùn)行數(shù)據(jù)切分都一致你在調(diào)學(xué)習(xí)率、隱藏層節(jié)點(diǎn)時(shí)看到的誤差變化就只來自參數(shù)本身而不是數(shù)據(jù)劃分的隨機(jī)性。不加這個(gè) seed每次運(yùn)行測試集都不同兩次實(shí)驗(yàn)結(jié)果沒法橫向?qū)Ρ日{(diào)參就成了玄學(xué)。4.3 完整調(diào)用特征矩陣到預(yù)測結(jié)果的四步流程把上面幾個(gè)函數(shù)串起來主流程就是按固定順序執(zhí)行四件事歸一化、切分、訓(xùn)練、反歸一化預(yù)測。# X 是原始特征矩陣y 是原始目標(biāo)值列進(jìn)來先各自歸一化 X_norm, X_min, X_span minmax_normalize(X) y_norm, y_min, y_span minmax_normalize(y.reshape(-1, 1)) # 切分訓(xùn)練集和測試集 X_train, X_test, y_train, y_test split_dataset(X_norm, y_norm) # 訓(xùn)練網(wǎng)絡(luò)隱藏層 8 個(gè)節(jié)點(diǎn)3000 輪迭代學(xué)習(xí)率 0.05 w1, b1, w2, b2, losses train(X_train, y_train, hidden_size8, epochs3000, lr0.05) # 測試集前向傳播得到歸一化預(yù)測值 y_pred_norm, _, _, _ forward(w1, b1, w2, b2, X_test) # 關(guān)鍵一步還原到原始量綱否則預(yù)測結(jié)果沒法解釋 y_pred y_pred_norm * y_span y_min這段主流程里有幾個(gè)容易出錯(cuò)的位置。y.reshape(-1, 1) 是因?yàn)?minmax_normalize 按列處理y 必須從一維數(shù)組變成 (m, 1) 的矩陣不然歸一化出來的形狀不對。訓(xùn)練結(jié)束后的 y_pred_norm 是 0 到 1 之間的數(shù)直接拿去向老板匯報(bào)沒有意義必須用訓(xùn)練時(shí)保存的 y_min 和 y_span 反算回原始數(shù)值這一步漏了是新手最常見的翻車現(xiàn)場。測試集預(yù)測表現(xiàn)才是這個(gè)模型真實(shí)水平的反映。訓(xùn)練集 loss 再低都不能代表預(yù)測能力因?yàn)榫W(wǎng)絡(luò)完全可能把訓(xùn)練數(shù)據(jù)背下來了。到這一步bp.py 的主流程就跑通了剩下的問題基本都集中在參數(shù)怎么調(diào)、結(jié)果怎么判斷上。5. 避坑指南BP 神經(jīng)網(wǎng)絡(luò)跑不通的五個(gè)典型癥狀5.1 loss 震蕩不降甚至越跑越大現(xiàn)象訓(xùn)練過程輸出里 loss 不是穩(wěn)定下降而是在某個(gè)值附近來回跳或者一路走高最終模型給出的預(yù)測值明顯不合理。原因最常見的就是學(xué)習(xí)率步長設(shè)置過大。權(quán)重更新的每一步邁得太遠(yuǎn)直接跨過了損失函數(shù)的最低點(diǎn)在谷底兩側(cè)反復(fù)橫跳。另一種可能是數(shù)據(jù)沒有歸一化特征量級(jí)差異巨大導(dǎo)致梯度方向不穩(wěn)定表現(xiàn)為 loss 劇烈震蕩。解決先看 loss 輸出曲線震蕩就先把學(xué)習(xí)率降一個(gè)數(shù)量級(jí)從 0.05 降到 0.01 或 0.005重新跑。同時(shí)確認(rèn)數(shù)據(jù)已經(jīng)做過分列歸一化這一步比調(diào)學(xué)習(xí)率更基礎(chǔ)沒歸一化時(shí)調(diào)學(xué)習(xí)率基本白費(fèi)。5.2 預(yù)測結(jié)果全是一個(gè)常數(shù)根本擬合不了數(shù)據(jù)現(xiàn)象訓(xùn)練完成后對任意輸入模型輸出的預(yù)測值幾乎相同比如始終是 0.5 附近誤差一直下不去。原因權(quán)重初始化取值過大進(jìn)入 sigmoid 飽和區(qū)梯度消失導(dǎo)致權(quán)重幾乎不更新或者隱藏層節(jié)點(diǎn)太少網(wǎng)絡(luò)擬合能力不足以表達(dá)數(shù)據(jù)里的映射關(guān)系。還有一個(gè)隱性原因訓(xùn)練時(shí)把輸出層也套了 sigmoid而目標(biāo)值歸一化后的范圍不在 (0,1) 有效區(qū)間內(nèi)模型被迫永遠(yuǎn)輸出一個(gè)接近常數(shù)的值。解決把初始權(quán)重范圍改小到 [-0.25, 0.25] 重新初始化并檢查隱藏層節(jié)點(diǎn)數(shù)是否過低按輸入節(jié)點(diǎn)的 1.5 倍起步。如果輸出層用了 sigmoid先打印歸一化后 y 的最小值和最大值確認(rèn)確實(shí)落在 (0,1) 內(nèi)否則輸出層改線性輸出。5.3 訓(xùn)練集誤差很低測試集誤差很高現(xiàn)象訓(xùn)練完成打印最后一個(gè) epoch 的 loss 已經(jīng)到 0.01 以下但用測試集一算誤差大得離譜。這就是俗稱的過擬合。原因數(shù)據(jù)集太小而網(wǎng)絡(luò)容量太大。bp.py 的默認(rèn)結(jié)構(gòu)是單個(gè)隱藏層但隱藏節(jié)點(diǎn)數(shù)設(shè)到幾十上百時(shí)小數(shù)據(jù)集上的擬合能力綽綽有余網(wǎng)絡(luò)開始記憶噪聲而不是學(xué)習(xí)規(guī)律。解決優(yōu)先減小隱藏層節(jié)點(diǎn)數(shù)回到輸入節(jié)點(diǎn) 1 到 2 倍的區(qū)間其次增加數(shù)據(jù)量如果數(shù)據(jù)無法增加引入簡單的早停機(jī)制——訓(xùn)練過程中每過一定輪數(shù)在測試集上算一次誤差測試誤差開始回升就立即停止訓(xùn)練。5.4 epoch 設(shè)了 10000 還是收斂很慢現(xiàn)象loss 一直在緩慢下降跑幾千輪才降一點(diǎn)訓(xùn)練時(shí)間很長但最終效果還可以。原因?qū)W習(xí)率太小。新手容易把學(xué)習(xí)率設(shè)成 0.001 甚至更小以求穩(wěn)這在歸一化數(shù)據(jù)上是過度保守了。另一個(gè)因素是 sigmoid 在輸入較大時(shí)梯度趨近于 0訓(xùn)練本身就會(huì)慢這是結(jié)構(gòu)特性。解決把學(xué)習(xí)率先提到 0.05 到 0.1 區(qū)間跑幾百輪觀察下降斜率。如果一開始下降很快后期變慢這是正常的可以保留學(xué)習(xí)率并配合增大 epochs也可以在第 4 章訓(xùn)練循環(huán)基礎(chǔ)上加一個(gè)簡單的學(xué)習(xí)率衰減——每 500 輪把學(xué)習(xí)率乘以 0.9兼顧前期速度與后期穩(wěn)定。5.5 輸出層激活函數(shù)選錯(cuò)預(yù)測值超出正常范圍現(xiàn)象預(yù)測建材價(jià)格這類本來是正數(shù)的任務(wù)模型卻輸出了負(fù)數(shù)或者預(yù)測值全部被壓在 0 到 1 之間且還原后數(shù)值明顯不對。原因輸出層的 sigmoid 把輸出限制在 (0, 1)如果歸一化后目標(biāo)值分布不均還原后的預(yù)測誤差會(huì)被放大反過來如果輸出層是純線性而代碼里誤套了 sigmoid預(yù)測范圍又被錯(cuò)誤截?cái)唷_@兩種情況都是激活函數(shù)與目標(biāo)分布不匹配。解決回歸任務(wù)輸出層優(yōu)先用線性輸出也就是 z2 直接作為預(yù)測值只保留隱藏層的激活函數(shù)。具體做法是在 forward 函數(shù)里去掉輸出層那一次 sigmoid對應(yīng)反向傳播公式也要去掉 sigmoid 導(dǎo)數(shù)那一項(xiàng)只保留 (y_pred - y) 作為輸出層誤差。6. 誤差曲線與驗(yàn)證指標(biāo)判斷模型是真的收斂還是假收斂6.1 誤差曲線怎么讀bp.py 訓(xùn)練過程里每 100 輪打印一次 loss把這些點(diǎn)畫出來就是誤差曲線。畫曲線的代碼很直接用訓(xùn)練時(shí)返回的 losses 列表就能出圖import matplotlib.pyplot as plt plt.plot(losses) plt.xlabel(epoch (x100)) plt.ylabel(MSE loss) plt.title(BP Neural Network Training Loss) plt.show()讀這條曲線有三個(gè)關(guān)鍵判斷第一前幾百輪是不是在快速下降如果一開始就平緩或者震蕩問題基本出在學(xué)習(xí)率或歸一化第二后期是否趨于平穩(wěn)平穩(wěn)意味著梯度已經(jīng)很小網(wǎng)絡(luò)進(jìn)入收斂區(qū)問此時(shí)繼續(xù)追加 epochs 收益有限第三最后收斂的 loss 值是否達(dá)到預(yù)期這個(gè)預(yù)期來自對數(shù)據(jù)本身噪聲水平的判斷數(shù)據(jù)本身信噪比低時(shí) loss 不會(huì)降到 0。6.2 量化指標(biāo)MAE 和 RMSE 怎么算曲線只能看趨勢跟別人匯報(bào)或者論文里寫效果得用數(shù)值指標(biāo)。預(yù)測類任務(wù)最常用兩個(gè)MAE 反映平均偏差的絕對值RMSE 對大誤差更敏感兩者結(jié)合能看出誤差分布形態(tài)。mae np.mean(np.abs(y_pred - y_test)) rmse np.sqrt(np.mean((y_pred - y_test) ** 2)) print(fMAE {mae:.4f}, RMSE {rmse:.4f})兩個(gè)指標(biāo)配合著看如果 MAE 不大但 RMSE 明顯偏大說明預(yù)測值里存在少數(shù)極端偏差大的樣本這時(shí)可以考慮檢查歸一化過程是否有異常值如果兩個(gè)指標(biāo)都偏大優(yōu)先回頭調(diào)隱藏層節(jié)點(diǎn)數(shù)和學(xué)習(xí)率這通常是容量或收斂問題。指標(biāo)計(jì)算時(shí)要用反歸一化后的原始量綱 y_pred 和 y_test用歸一化后的值算出來的數(shù)字沒法跟業(yè)務(wù)實(shí)際對照。從那以后我每次跑 bp.py 都強(qiáng)制走一遍固定流程先歸一化并保存參數(shù)再固定 seed 切分?jǐn)?shù)據(jù)訓(xùn)練時(shí)把學(xué)習(xí)率和 epoch 從保守值起步最后在測試集上算 MAE 和 RMSE并且一定把還原量綱后的預(yù)測值打印出來核對量級(jí)有沒有離譜。這一套動(dòng)作做完BP 神經(jīng)網(wǎng)絡(luò)的實(shí)驗(yàn)結(jié)果基本不會(huì)出現(xiàn)第五章節(jié)那種翻車情況希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取