章節(jié)爬蟲(chóng)實(shí)戰(zhàn):Requests與BeautifulSoup實(shí)現(xiàn)增量更新)
最近想給自己的小站“某閣”做一套離線閱讀方案于是順手寫了一個(gè)小說(shuō)章節(jié)爬取腳本。核心功能很簡(jiǎn)單輸入一個(gè)目錄頁(yè)地址腳本自動(dòng)把章節(jié)標(biāo)題和正文鏈接抓下來(lái)逐章下載并保存成 Markdown 文件下次再跑還能增量更新、跳過(guò)已下載章節(jié)。這個(gè)腳本順便解決了我一直以來(lái)的痛點(diǎn)——網(wǎng)頁(yè)上看小說(shuō)翻頁(yè)太碎想復(fù)制某段話做筆記還得手動(dòng)去選文本。把它拉到本地之后檢索、批注、轉(zhuǎn)電子書都方便多了。先說(shuō)清楚一個(gè)前提本文里的“小說(shuō)”指的是放在我自己測(cè)試站點(diǎn)上的公開(kāi)文本域名我也用了 example.com 做占位。你如果想把腳本用到其他站點(diǎn)一定先確認(rèn)這個(gè)站點(diǎn)的服務(wù)條款、robots.txt 和內(nèi)容版權(quán)別拿腳本去抓未授權(quán)的文學(xué)作品這個(gè)問(wèn)題在文章最后我會(huì)專門展開(kāi)。下面進(jìn)入正題講講這個(gè)腳本從需求到實(shí)現(xiàn)的全過(guò)程。1. 為什么寫這個(gè)爬取腳本需求拆解與方案設(shè)計(jì)1.1 核心需求不是“下載幾個(gè)頁(yè)面”這么簡(jiǎn)單這個(gè)項(xiàng)目聽(tīng)上去是個(gè)很小的爬蟲(chóng)但真做起來(lái)需求比想象中多。我給自己列了幾個(gè)硬性要求自動(dòng)發(fā)現(xiàn)章節(jié)目錄頁(yè)里可能有幾十上百個(gè)章節(jié)鏈接不能靠手寫 URL。正文干凈只要小說(shuō)正文不要導(dǎo)航欄、廣告位、推薦閱讀等雜七雜八的東西。增量更新小說(shuō)更新后重跑腳本已經(jīng)下載過(guò)的章節(jié)不要重復(fù)抓。斷點(diǎn)續(xù)傳網(wǎng)絡(luò)一抖或者服務(wù)器超時(shí)腳本失敗后重新運(yùn)行能從上次失敗的地方繼續(xù)。命令行可配置起始章節(jié)、結(jié)束章節(jié)、請(qǐng)求延時(shí)、輸出目錄都要能在命令行傳參不用每次改代碼。說(shuō)白了這是一個(gè)“書架管理員”的角色你要告訴它從哪個(gè)書架拿書、拿哪些章節(jié)、已經(jīng)拿過(guò)的別動(dòng)、被卡住的書最后提醒你。把目標(biāo)拆到這個(gè)程度后面寫代碼就會(huì)非常順。1.2 技術(shù)選型Python 3 requests BeautifulSoup選型的時(shí)候我第一個(gè)排除的是通用爬蟲(chóng)框架 Scrapy。原因很簡(jiǎn)單殺雞不用牛刀。Scrapy 有 Spider、Item Pipeline、Middleware、調(diào)度器這些概念對(duì)一個(gè)只有目錄頁(yè)和詳情頁(yè)兩種頁(yè)面的小腳本來(lái)說(shuō)光是理解項(xiàng)目結(jié)構(gòu)就夠折騰半天。輕量腳本最大的優(yōu)勢(shì)是“單個(gè)文件、直接跑、好解釋”出了問(wèn)題翻開(kāi)代碼一眼就能定位。Python 的 HTTP 客戶端我選了 requests而不是標(biāo)準(zhǔn)庫(kù) urllib。requests 的 API 簡(jiǎn)潔太多默認(rèn)幫你處理連接池、Cookie 和編碼探測(cè)代碼寫起來(lái)像讀英文句子。HTML 解析用 BeautifulSoup4 搭配 lxml 解析器。為什么不直接用正則因?yàn)?HTML 不是規(guī)范的純文本標(biāo)簽嵌套、屬性順序、空白字符都可能變化正則寫出來(lái)的匹配規(guī)則非常脆弱。比如“提取標(biāo)題”你可能會(huì)寫h1(.*?)/h1結(jié)果頁(yè)面結(jié)構(gòu)一調(diào)整或者標(biāo)題里混入了多余標(biāo)簽正則就失效了。BeautifulSoup 是先把整棵 DOM 樹(shù)解析出來(lái)再用select_one、select這種 CSS 選擇器去定位節(jié)點(diǎn)哪怕標(biāo)簽之間多了些屬性或空白也能穩(wěn)定命中。這里有個(gè)生活化的類比正則像一把剪刀你得精確知道每一刀剪在哪BeautifulSoup 像溶劑把整張貼紙泡進(jìn)去標(biāo)簽自己就從底紙上脫落了。對(duì)小說(shuō)網(wǎng)頁(yè)這種“結(jié)構(gòu)相似但細(xì)節(jié)很亂”的場(chǎng)景溶劑明顯更好用。1.3 為什么不直接用 shell 腳本可能有人會(huì)問(wèn)抓個(gè)網(wǎng)頁(yè)用 curl 加幾條 shell 命令不就行了我試過(guò)最后放棄了。簡(jiǎn)單場(chǎng)景下curl -s URL | grep p確實(shí)能出來(lái)點(diǎn)東西可一旦遇到編碼問(wèn)題、需要帶上 User-Agent、處理異常超時(shí)、增量對(duì)比shell 腳本里的轉(zhuǎn)義和管道就會(huì)變得特別難維護(hù)。而且 shell 里沒(méi)有像 BeautifulSoup 這樣成熟的 DOM 解析庫(kù)文本清洗基本靠 sed、awk 和正則硬拼代碼量不大坑卻特別多。所以最終方案定的是Python 3.8 requests BeautifulSoup4 lxml argparse。argparse 是標(biāo)準(zhǔn)庫(kù)用來(lái)解析命令行參數(shù)這樣腳本就能通過(guò)參數(shù)控制起始章節(jié)和延時(shí)而不是每次改源碼。2. 腳本的核心實(shí)現(xiàn)目錄解析、正文提取與增量更新2.1 全局配置把“經(jīng)常變的”集中到一起寫爬蟲(chóng)腳本最容易踩的坑就是把 URL、選擇器、請(qǐng)求頭這些變量散落在代碼各個(gè)角落。站點(diǎn)一旦改版你得像大海撈針一樣去翻代碼。我在腳本開(kāi)頭把所有“可能變化”的東西集中成了幾個(gè)全局常量BASE_URL https://example.com/book/ # 目標(biāo)站點(diǎn)的目錄頁(yè) CHAPTER_LIST_SELECTOR .chapter-list a # 目錄頁(yè)中所有章節(jié)鏈接 CONTENT_SELECTOR #chapter-content # 章節(jié)正文容器選擇器集中定義的好處是改版時(shí)你只要打開(kāi)開(kāi)發(fā)者工具看一眼新的 class 或 id改這一處配置就行。這個(gè)習(xí)慣放到任何爬蟲(chóng)項(xiàng)目里都適用。2.2 目錄解析從一頁(yè)出發(fā)找到所有章節(jié)目錄頁(yè)是整個(gè)腳本的入口。我用get_chapter_list()這個(gè)函數(shù)請(qǐng)求目錄頁(yè)然后用 CSS 選擇器找到所有章節(jié)鏈接。這里有幾個(gè)細(xì)節(jié)值得注意首先href 可能是相對(duì)路徑比如/book/123.html所以需要用urljoin(BASE_URL, href)拼成完整的 URL。其次章節(jié)標(biāo)題里可能包含空格、特殊符號(hào)我會(huì)調(diào)用get_text(stripTrue)把節(jié)點(diǎn)里的純文本提取出來(lái)順便去掉首尾空白。最后解析結(jié)果保存成列表每個(gè)元素是一個(gè){title: ..., url: ...}字典方便后面統(tǒng)一處理。def get_chapter_list(): resp fetch_page(BASE_URL) soup BeautifulSoup(resp.text, lxml) items [] for a in soup.select(CHAPTER_LIST_SELECTOR): title a.get_text(stripTrue) href a.get(href) if not title or not href: continue items.append({title: title, url: urljoin(BASE_URL, href)}) return items判斷if not title or not href是必要的因?yàn)橛行┠夸涰?yè)里會(huì)混入“返回首頁(yè)”“下一頁(yè)”這類鏈接雖然選擇器能選中但它們不是有效章節(jié)。2.3 正文提取拿到正文再做文本清洗單章正文頁(yè)面的 HTML 通常比目錄頁(yè)復(fù)雜正文旁邊全是廣告、推薦、版權(quán)聲明。我的做法是先定位到正文容器比如div idchapter-content然后在這個(gè)節(jié)點(diǎn)內(nèi)部用get_text(\n, stripTrue)提取純文本。這一步的關(guān)鍵是選對(duì)容器選錯(cuò)容器會(huì)把評(píng)論區(qū)、推薦閱讀一起抓進(jìn)來(lái)。提取完純文本之后還要做一層清洗連續(xù)三個(gè)以上的換行合并成兩個(gè)空行。為什么要合并很多網(wǎng)頁(yè)源碼里段落之間會(huì)有大量空行和空白字符直接保存會(huì)讓 Markdown 看起來(lái)非常松散。我實(shí)測(cè)下來(lái)這個(gè)正則基本夠用text re.sub(r\n{3,}, \n\n, text)順便說(shuō)一句很多人一開(kāi)始會(huì)用soup.get_text()從整個(gè)頁(yè)面提取文本然后試圖用正則去掉“上一章”“下一章”這些關(guān)鍵詞。我的經(jīng)驗(yàn)是這種做法又慢又脆。正確的做法永遠(yuǎn)是先精確縮小范圍到正文容器再清洗順序不能反。2.4 增量更新與斷點(diǎn)續(xù)傳進(jìn)度文件是關(guān)鍵增量更新是腳本最有價(jià)值的部分。每次重跑如果都全量抓一遍既浪費(fèi)流量又容易觸發(fā)服務(wù)器限流。我的方案是用一個(gè)progress.json文件記錄已經(jīng)成功抓取的章節(jié)鏈接。重新運(yùn)行時(shí)先加載這個(gè)文件遇到已經(jīng)記錄過(guò)的 URL 就直接跳過(guò)。為什么用 URL 作為唯一標(biāo)識(shí)而不是章節(jié)標(biāo)題因?yàn)闃?biāo)題可能重復(fù)比如第一卷和第二卷都可能出現(xiàn)“重逢”這種章節(jié)名但 URL 幾乎不會(huì)重復(fù)。進(jìn)度文件里的記錄格式也很簡(jiǎn)單{ https://example.com/book/123.html: { title: 第一章 初入江湖, done: true, time: 2025-01-01 12:00:00 } }每成功抓完一章我就立刻把進(jìn)度寫入文件。這樣一來(lái)即使腳本運(yùn)行到一半被 CtrlC 中斷下一次重新啟動(dòng)也能從斷點(diǎn)繼續(xù)不會(huì)重復(fù)勞動(dòng)。如果哪天你想強(qiáng)制全量重抓加一個(gè)--force參數(shù)就行。腳本里這是通過(guò) argparse 實(shí)現(xiàn)的布爾開(kāi)關(guān)存在就忽略進(jìn)度文件。2.5 命令行參數(shù)設(shè)計(jì)不折騰那就是最好的交互腳本的最終使用者是命令行用戶所以交互設(shè)計(jì)要盡量符合直覺(jué)。我定義了這么幾個(gè)參數(shù)參數(shù)說(shuō)明默認(rèn)值--output輸出目錄./novel_output--start起始章節(jié)序號(hào)1--end結(jié)束章節(jié)序號(hào)0 表示全部0--delay每次請(qǐng)求間隔秒數(shù)可傳小數(shù)1.0--force忽略進(jìn)度文件強(qiáng)制重抓無(wú)--list只打印目錄不下載正文無(wú)--list這個(gè)參數(shù)是在調(diào)試階段加上的。沒(méi)它之前我想確認(rèn)目錄解析結(jié)果只能直接跑下載非常難受。加上之后我可以先執(zhí)行python novel_crawler.py --list快速看章節(jié)列表是否完整確認(rèn)無(wú)誤再真正下載。3. 從環(huán)境準(zhǔn)備到完整運(yùn)行爬取腳本實(shí)操全過(guò)程3.1 環(huán)境準(zhǔn)備虛擬環(huán)境是基本禮儀Python 項(xiàng)目不管大小我都建議用虛擬環(huán)境隔離依賴。命令行操作如下mkdir novel-crawler cd novel-crawler python -m venv venv source venv/bin/activate # Windows 下用 venv\Scripts\activate pip install requests beautifulsoup4 lxml安裝依賴時(shí)注意lxml 在某些 Python 版本上需要編譯阻塞時(shí)間可能較長(zhǎng)耐心等就行。如果你在 macOS 上遇到lxml安裝失敗一般是因?yàn)槿鄙?libxml2可以用brew install libxml2補(bǔ)上再裝Windows 上通常有預(yù)編譯 wheel問(wèn)題不大。3.2 先摸清目標(biāo)站點(diǎn)的 HTML 結(jié)構(gòu)寫解析代碼之前一定要先打開(kāi)瀏覽器開(kāi)發(fā)者工具按 F12 選中“檢查”把目錄頁(yè)和詳情頁(yè)的結(jié)構(gòu)看明白。這個(gè)步驟我每次都會(huì)做哪怕目標(biāo)頁(yè)面以前抓過(guò)。原因很簡(jiǎn)單頁(yè)面改版不會(huì)給你發(fā)通知今天能解析的選擇器明天可能就失效了。我一般會(huì)先看三樣?xùn)|西目錄頁(yè)里所有章節(jié)鏈接的共同特征比如都在div classchapter-list下面。詳情頁(yè)里正文容器的 id 或 class。頁(yè)面源碼里的字符編碼聲明。第一個(gè)版本抓下來(lái)最好用--list參數(shù)驗(yàn)證目錄解析。如果章節(jié)數(shù)量不對(duì)先回瀏覽器里檢查選擇器別急著跑全量。3.3 完整腳本代碼與運(yùn)行方式下面是我精簡(jiǎn)后的完整腳本可以直接存成novel_crawler.py使用。注意替換BASE_URL和兩個(gè)選擇器常量為你自己目標(biāo)站點(diǎn)的實(shí)際值。#!/usr/bin/env python3 某閣小說(shuō)章節(jié)爬取腳本 用法示例 python novel_crawler.py --list python novel_crawler.py --start 1 --end 20 --delay 1.5 python novel_crawler.py --force import re import json import time import random import logging import argparse from pathlib import Path from urllib.parse import urljoin import requests from bs4 import BeautifulSoup BASE_URL https://example.com/book/ CHAPTER_LIST_SELECTOR .chapter-list a CONTENT_SELECTOR #chapter-content HEADERS { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0 Safari/537.36 } logging.basicConfig( levellogging.INFO, format%(asctime)s [%(levelname)s] %(message)s ) logger logging.getLogger(novel_crawler) def fetch_page(url, retry3, timeout10): 請(qǐng)求頁(yè)面并帶簡(jiǎn)單重試。 for attempt in range(1, retry 1): try: resp requests.get(url, headersHEADERS, timeouttimeout) resp.raise_for_status() resp.encoding resp.apparent_encoding or utf-8 return resp except requests.RequestException as exc: logger.warning(第 %s 次請(qǐng)求 %s 失敗%s, attempt, url, exc) if attempt retry: time.sleep(2 * attempt) raise RuntimeError(f請(qǐng)求失敗{url}) def safe_filename(title): 把 Windows/Linux 文件名里的非法字符替換成下劃線。 return re.sub(r[\\/:*?|\r\n\t], _, title).strip() def get_chapter_list(): 解析目錄頁(yè)返回章節(jié)字典列表。 resp fetch_page(BASE_URL) soup BeautifulSoup(resp.text, lxml) items [] for a in soup.select(CHAPTER_LIST_SELECTOR): title a.get_text(stripTrue) href a.get(href) if not title or not href: continue items.append({title: title, url: urljoin(BASE_URL, href)}) return items def extract_content(html): 從正文頁(yè)解析并清洗正文文本。 soup BeautifulSoup(html, lxml) node soup.select_one(CONTENT_SELECTOR) or soup.body text node.get_text(\n, stripTrue) text re.sub(r\n{3,}, \n\n, text) return text def save_progress(progress_file, progress): progress_file.write_text( json.dumps(progress, ensure_asciiFalse, indent2), encodingutf-8 ) def main(): parser argparse.ArgumentParser(description某閣小說(shuō)章節(jié)爬取腳本) parser.add_argument(--output, default./novel_output) parser.add_argument(--start, typeint, default1) parser.add_argument(--end, typeint, default0) parser.add_argument(--delay, typefloat, default1.0) parser.add_argument(--force, actionstore_true) parser.add_argument(--list, actionstore_true) args parser.parse_args() output_dir Path(args.output) output_dir.mkdir(parentsTrue, exist_okTrue) progress_file output_dir / progress.json chapter_list get_chapter_list() logger.info(目錄頁(yè)共發(fā)現(xiàn) %s 個(gè)章節(jié), len(chapter_list)) if args.list: for i, item in enumerate(chapter_list, 1): print(f{i:04d} {item[title]} {item[url]}) return if args.end and args.end 0: chapter_list chapter_list[args.start - 1 : args.end] else: chapter_list chapter_list[args.start - 1 :] progress {} if progress_file.exists(): progress json.loads(progress_file.read_text(encodingutf-8)) failed [] for idx, item in enumerate(chapter_list, args.start): if item[url] in progress and not args.force: logger.info(已跳過(guò)已下載章節(jié)%s, item[title]) continue logger.info(抓取章節(jié)%s%s, idx, item[title]) try: resp fetch_page(item[url]) content extract_content(resp.text) md_text f# {item[title]}\n\n{content}\n filename f{idx:04d}_{safe_filename(item[title])}.md (output_dir / filename).write_text(md_text, encodingutf-8) progress[item[url]] { title: item[title], done: True, time: time.strftime(%Y-%m-%d %H:%M:%S), } save_progress(progress_file, progress) except Exception as exc: logger.error(章節(jié)抓取失敗%s錯(cuò)誤%s, item[title], exc) failed.append({title: item[title], url: item[url]}) if idx args.start len(chapter_list) - 1: time.sleep(args.delay random.uniform(0, 0.5)) if failed: logger.warning(有 %s 個(gè)章節(jié)失敗建議檢查網(wǎng)絡(luò)后重跑, len(failed)) for n, f in enumerate(failed, 1): logger.warning(%s. %s - %s, n, f[title], f[url]) md_files sorted(output_dir.glob(*.md)) if md_files: index [# 小說(shuō)目錄\n] for m in md_files: index.append(f- [{m.stem}]({m.name})) (output_dir / _index.md).write_text(\n.join(index) \n, encodingutf-8) logger.info(執(zhí)行完畢共處理 %s 個(gè)章節(jié)失敗 %s 個(gè), len(chapter_list), len(failed)) if __name__ __main__: main()運(yùn)行起來(lái)很簡(jiǎn)單。第一次跑你可以先只抓前兩章試水python novel_crawler.py --start 1 --end 2 --delay 1確認(rèn)生成的 Markdown 文件內(nèi)容正常后再全量跑python novel_crawler.py --delay 1.53.4 運(yùn)行結(jié)果目錄、章節(jié)、索引一應(yīng)俱全腳本跑完后輸出目錄里會(huì)是這樣novel_output/ ├── 0001_第一章 初入江湖.md ├── 0002_第二章 風(fēng)起云涌.md ├── 0003_第三章 客棧夜話.md ├── ... ├── _index.md └── progress.json每個(gè)章節(jié)文件頂部是標(biāo)題下面是正文段落之間用空行分隔在 Typora、Obsidian 或 VS Code 里打開(kāi)閱讀體驗(yàn)都不錯(cuò)。_index.md是自動(dòng)生成的目錄索引點(diǎn)進(jìn)去就能跳轉(zhuǎn)到對(duì)應(yīng)章節(jié)方便得很。我實(shí)操時(shí)最喜歡加的細(xì)節(jié)是章節(jié)文件名的序號(hào)前綴。有了0001_、0002_這種前綴文件在資源管理器里排序天然正確不然“第十章”會(huì)排在“第二章”前面看著難受。4. 實(shí)測(cè)遇到的坑小說(shuō)爬取腳本常見(jiàn)問(wèn)題排查4.1 請(qǐng)求超時(shí)與重試網(wǎng)絡(luò)不穩(wěn)是常態(tài)說(shuō)實(shí)話爬蟲(chóng)腳本里“代碼寫錯(cuò)”反而不是最多的問(wèn)題最多的坑是網(wǎng)絡(luò)層面的。requests.get默認(rèn)不會(huì)等太久但有些詳情頁(yè)響應(yīng)慢超過(guò)默認(rèn)時(shí)間就直接拋異常。我在fetch_page里設(shè)置了timeout10并加了三次重試重試間隔按 2 秒、4 秒遞增避免一失敗就立刻轟炸目標(biāo)服務(wù)器。有時(shí)候不是完全超時(shí)而是返回了 5xx 狀態(tài)碼。raise_for_status()會(huì)把這情況變成異常觸發(fā)重試。如果你發(fā)現(xiàn)某個(gè)章節(jié)反復(fù)失敗大概率是那一個(gè)頁(yè)面有動(dòng)態(tài)加載或者服務(wù)器偶發(fā)問(wèn)題不用急著改代碼等一會(huì)兒重跑腳本讓增量更新機(jī)制去補(bǔ)缺就行。4.2 中文亂碼先探測(cè)編碼再談解析小說(shuō)網(wǎng)站基本都是中文頁(yè)面編碼處理不好抓下來(lái)就是滿屏亂碼。我第一次寫的時(shí)候直接用了resp.text結(jié)果某些頁(yè)面輸出“”這種字符。原因是 requests 默認(rèn)用響應(yīng)頭里的 charset 解碼但有的頁(yè)面響應(yīng)頭沒(méi)寫清楚或者寫錯(cuò)了。解決方案就是那行關(guān)鍵代碼resp.encoding resp.apparent_encoding or utf-8apparent_encoding是 requests 根據(jù)頁(yè)面實(shí)際字節(jié)內(nèi)容推測(cè)出來(lái)的編碼對(duì)這個(gè)場(chǎng)景夠準(zhǔn)。實(shí)測(cè)之后亂碼問(wèn)題基本絕跡。4.3 解析不到正文選擇器失效是頭號(hào)敵人如果腳本狀態(tài)碼正常、也沒(méi)有亂碼但抓下來(lái)的 Markdown 文件里只有標(biāo)題沒(méi)有正文那 90% 是CONTENT_SELECTOR失效了。常見(jiàn)原因有兩種網(wǎng)站改版換了 class 名或者詳情頁(yè)是動(dòng)態(tài)渲染正文內(nèi)容不在初始 HTML 里而是通過(guò) JavaScript 加載。第一種情況去瀏覽器開(kāi)發(fā)者工具里重新定位正文容器更新選擇器常量就行。第二種情況更麻煩requests 拿不到動(dòng)態(tài)渲染后的內(nèi)容你需要用 Selenium、Playwright 這類自動(dòng)化瀏覽器。不過(guò)我自己寫這類腳本時(shí)優(yōu)先級(jí)很低小說(shuō)正文大多是靜態(tài) HTML遇到動(dòng)態(tài)渲染的站點(diǎn)我會(huì)先換一個(gè)能靜態(tài)抓取的頁(yè)面而不是一上來(lái)就引入重型工具。4.4 增量更新失效小心進(jìn)度文件和你“作對(duì)”增量更新邏輯本身不難坑在于用戶和腳本的預(yù)期不一致。比如我手動(dòng)刪掉了一個(gè)章節(jié)文件希望重抓這一章但腳本看到progress.json里已經(jīng)記錄了那個(gè) URL于是直接跳過(guò)。刪除文件不等于刪除進(jìn)度這個(gè)行為會(huì)讓人困惑。解決辦法有兩個(gè)一是刪除文件時(shí)把progress.json也一起清掉或者用--force參數(shù)強(qiáng)制全量重抓二是在代碼里把跳過(guò)條件從“URL 是否在進(jìn)度文件里”改成“目標(biāo)文件是否已存在”。兩種方案各有取舍我選擇保留進(jìn)度文件判斷因?yàn)檫@樣可以避免因?yàn)檎鹿?jié)標(biāo)題變化導(dǎo)致文件重復(fù)生成。4.5 文件名非法字符Windows 用戶的隱藏炸彈章節(jié)標(biāo)題千奇百怪有冒號(hào)、問(wèn)號(hào)、雙引號(hào)甚至有斜杠。Windows 文件系統(tǒng)不允許文件名包含\ / : * ? |這些字符如果直接用標(biāo)題當(dāng)文件名write_text就會(huì)報(bào)OSError。我寫了safe_filename()把非法字符全部替換成下劃線。這樣就算標(biāo)題里出現(xiàn)“第一卷風(fēng)起上”也能安全落盤。4.6 命令行工具找不到環(huán)境變量這個(gè)經(jīng)典坑很多新手在 Windows 上會(huì)遇到這樣的報(bào)錯(cuò)python : 無(wú)法將“python”項(xiàng)識(shí)別為 cmdlet、函數(shù)、腳本文件或可運(yùn)行程序的名稱。這和 npm、claude 等命令行工具報(bào)“無(wú)法識(shí)別”是同一類問(wèn)題十有八九是軟件裝好了但沒(méi)加入系統(tǒng) PATH。解決路徑是找到 Python 安裝目錄把python.exe所在路徑加入環(huán)境變量的 Path 里然后重開(kāi)終端。如果你裝的是 Microsoft Store 版 Python正常它會(huì)自動(dòng)配置好如果你手動(dòng)安裝但忘了勾選“Add Python to PATH”就會(huì)觸發(fā)這個(gè)報(bào)錯(cuò)。還有一種情況是已經(jīng)加了 PATH但用的是舊終端窗口重新打開(kāi)一個(gè)再試基本就好了。4.7 常見(jiàn)問(wèn)題速查表現(xiàn)象可能原因解決辦法返回 403請(qǐng)求頭太像爬蟲(chóng)設(shè)置瀏覽器 User-Agent增大--delay抓下來(lái)全是亂碼頁(yè)面編碼識(shí)別失敗設(shè)置resp.encoding resp.apparent_encoding有標(biāo)題沒(méi)正文正文選擇器失效或動(dòng)態(tài)加載更新選擇器必要時(shí)換 Playwright跳過(guò)已刪除的章節(jié)progress.json還在刪除進(jìn)度文件或使用--force保存文件報(bào)錯(cuò)文件名含非法字符用腳本里的safe_filename()替換命令行提示無(wú)法識(shí)別未加入 PATH配置環(huán)境變量后重開(kāi)終端5. 別踩版權(quán)紅線爬蟲(chóng)合規(guī)與腳本能力擴(kuò)展5.1 爬蟲(chóng)禮儀技術(shù)能做不代表可以做這一個(gè)章節(jié)是我最想叮囑的。寫爬蟲(chóng)腳本很容易讓人產(chǎn)生一種錯(cuò)覺(jué)只要請(qǐng)求能通頁(yè)面上所有內(nèi)容都能拿走。但技術(shù)可行性和法律合規(guī)性完全是兩碼事。原創(chuàng)小說(shuō)、文章、圖片本質(zhì)上都是創(chuàng)作者的勞動(dòng)成果受著作權(quán)法保護(hù)。未經(jīng)授權(quán)爬取和復(fù)制哪怕只是存在本地自己看也可能構(gòu)成侵權(quán)。我給自己定的幾條原則供你參考只抓自有站點(diǎn)、明確授權(quán)站點(diǎn)以及進(jìn)入公有領(lǐng)域的作品。抓取前先看目標(biāo)站點(diǎn)的robots.txt尊重站方的爬蟲(chóng)協(xié)議??刂普?qǐng)求頻率設(shè)置合理延時(shí)不給目標(biāo)服務(wù)器造成壓力。不碰付費(fèi)墻、登錄墻不試圖繞過(guò)任何訪問(wèn)控制。爬到的內(nèi)容只用于個(gè)人學(xué)習(xí)、備份和檢索不公開(kāi)傳播不商用。順便說(shuō)一句很多網(wǎng)站會(huì)在robots.txt里說(shuō)明哪些路徑允許爬取哪些不允許。這是一個(gè)約定俗成的技術(shù)規(guī)范雖然不是法律文件但遵守它是爬蟲(chóng)開(kāi)發(fā)者的基本素養(yǎng)。練習(xí)時(shí)完全可以用《西游記》《三國(guó)演義》這類公版作品或者自己搭一個(gè)測(cè)試站點(diǎn)來(lái)跑腳本。5.2 腳本化思維小說(shuō)爬蟲(chóng)只是冰山一角這個(gè)腳本雖然名字叫“小說(shuō)章節(jié)爬取”但實(shí)際上它的內(nèi)核是通用的“列表頁(yè) 詳情頁(yè)”信息采集模式。把CHAPTER_LIST_SELECTOR換成博客文章的標(biāo)題鏈接把CONTENT_SELECTOR換成文章正文容器它立刻就能變成一個(gè)博客離線備份工具。再改改它也可以收集新聞稿、開(kāi)源文檔、公告等等。這種把重復(fù)勞動(dòng)變成腳本的意識(shí)比腳本本身值錢。我在實(shí)際工作里碰到“每隔幾天要手動(dòng)下載一批頁(yè)面”的需求第一反應(yīng)不再是打開(kāi)瀏覽器一個(gè)個(gè)點(diǎn)而是想這個(gè)流程能不能參數(shù)化、能不能增量、能不能掛在定時(shí)任務(wù)里。這個(gè)項(xiàng)目就是這種思維的產(chǎn)物。5.3 下一階段可以做的增強(qiáng)如果后續(xù)想繼續(xù)折騰我列幾個(gè)方向定時(shí)更新Linux 上用 cronWindows 上用任務(wù)計(jì)劃程序每天凌晨自動(dòng)跑一次--delay 2實(shí)現(xiàn)追更自動(dòng)化。全文搜索把 Markdown 文件丟進(jìn) Obsidian 或搭建一個(gè)本地文檔站整庫(kù)搜索很順暢。推送通知抓完新章節(jié)后用腳本調(diào)用飛書或郵件接口把更新摘要推送給你。轉(zhuǎn)電子書用 Pandoc 把 Markdown 批量轉(zhuǎn)成 EPUB導(dǎo)入閱讀器。這些擴(kuò)展都不難前提是核心抓取和增量邏輯足夠穩(wěn)。最后再分享一點(diǎn)實(shí)際操作中的體會(huì)這個(gè)腳本最開(kāi)始的版本只有 40 行能抓但不好用后來(lái)我花了一天時(shí)間把進(jìn)度、斷點(diǎn)、命令行參數(shù)補(bǔ)齊代碼翻了一倍但使用體驗(yàn)完全不一樣。寫這類工具不要怕加代碼真正該怕的是功能不完整、邊界情況一堆。你先跑通一條最小路徑再逐步補(bǔ)強(qiáng)這是最省力的做法。