調(diào)用與文件描述符全解析)
做Linux開發(fā)這些年文件操作大概是寫過的代碼里出現(xiàn)頻率最高的場(chǎng)景了。不管你是寫C、C還是Python底層跑的都是那幾個(gè)系統(tǒng)調(diào)用——open、read、write、close、lseek。很多人能熟練地用fopen、fread做讀寫但一旦碰上文件描述符泄露、部分讀寫、信號(hào)中斷這類問題就開始抓瞎。這就是因?yàn)閷?duì)系統(tǒng)調(diào)用層的理解還停留在API會(huì)返回一個(gè)值的程度。這篇文章我會(huì)把Linux文件操作最核心的幾條系統(tǒng)調(diào)用掰開揉碎講透——不只是講函數(shù)原型和參數(shù)重點(diǎn)講清楚內(nèi)核在背后做了什么、為什么這么設(shè)計(jì)、以及實(shí)操時(shí)最容易踩的坑。我盡量用我這幾年實(shí)際調(diào)試的經(jīng)驗(yàn)來講內(nèi)容既適合剛接觸Linux編程的新手建立完整認(rèn)知框架也適合有經(jīng)驗(yàn)的老手查漏補(bǔ)缺。文中的所有示例代碼都是可編譯運(yùn)行的最小實(shí)現(xiàn)可以直接拿去實(shí)驗(yàn)。1. 一切從open開始文件描述符是怎么回事1.1 為什么Linux里一切皆文件Linux從一開始的設(shè)計(jì)哲學(xué)里就有一個(gè)核心抽象——一切皆文件。普通文件是文件設(shè)備是文件管道是文件socket是文件甚至/proc下面那些虛擬的進(jìn)程信息也是文件。這個(gè)設(shè)計(jì)的好處在于程序員只需要學(xué)會(huì)一套操作接口就能處理幾乎所有I/O場(chǎng)景。而支撐起這套統(tǒng)一抽象的就是文件描述符簡(jiǎn)稱fdfile descriptor。你可以把它理解成一張票據(jù)或者說索引號(hào)。每次你調(diào)用open打開一個(gè)文件時(shí)內(nèi)核就會(huì)在當(dāng)前進(jìn)程的文件描述符表里分配一個(gè)空閑的整數(shù)號(hào)這個(gè)整數(shù)就是fd。之后所有針對(duì)該文件的操作——讀、寫、移動(dòng)位置、收尾關(guān)閉——都是基于這個(gè)整數(shù)進(jìn)行的。這里有個(gè)非常關(guān)鍵的概念需要澄清fd是屬于進(jìn)程的而不是屬于文件的。同一個(gè)文件被同一個(gè)進(jìn)程open兩次會(huì)得到兩個(gè)不同的fd它們?cè)谖募枋龇砝飳?duì)應(yīng)兩個(gè)完全獨(dú)立的打開文件記錄各自的讀寫位置offset互不影響。實(shí)操心得新手寫程序時(shí)經(jīng)常忘了同一個(gè)文件兩次打開是兩個(gè)獨(dú)立的讀寫位置這一點(diǎn)。如果你想讓兩個(gè)fd共享同一個(gè)offset要用dup或dup2做描述符復(fù)制而不是重新open一次。1.2 open系統(tǒng)調(diào)用的完整參數(shù)拆解open的原型是#include fcntl.h #include sys/types.h #include sys/stat.h int open(const char *pathname, int flags); int open(const char *pathname, int flags, mode_t mode);第一個(gè)參數(shù)pathname是路徑這個(gè)沒什么好說的。關(guān)鍵在第二個(gè)參數(shù)flags——它由三部分構(gòu)成訪問模式、創(chuàng)建選項(xiàng)、輔助選項(xiàng)。訪問模式必須是O_RDONLY只讀、O_WRONLY只寫、O_RDWR讀寫三選一。這是主模式內(nèi)核必須根據(jù)它來檢查進(jìn)程是否有相應(yīng)權(quán)限。創(chuàng)建選項(xiàng)常用的包括O_CREAT如果文件不存在就創(chuàng)建它需要搭配第三個(gè)參數(shù)mode指定權(quán)限。O_EXCL如果同時(shí)指定了O_CREAT而文件已經(jīng)存在open直接失敗。這個(gè)選項(xiàng)常用于防止覆蓋已有文件比如創(chuàng)建鎖文件時(shí)。O_TRUNC如果文件已存在且以寫模式打開會(huì)立刻把文件長(zhǎng)度截?cái)酁?。注意O_TRUNC和O_RDONLY搭配時(shí)會(huì)直接報(bào)錯(cuò)因?yàn)橹蛔x模式不允許改變文件大小。輔助選項(xiàng)里最經(jīng)典的是O_APPEND和O_NONBLOCK。O_APPEND會(huì)讓每次write前都先把offset移動(dòng)到文件末尾兩個(gè)或多個(gè)進(jìn)程同時(shí)以追加模式寫同一個(gè)文件時(shí)數(shù)據(jù)不會(huì)互相覆蓋。O_NONBLOCK用于打開FIFO、設(shè)備等特殊文件時(shí)讓open本身不被阻塞。第三個(gè)參數(shù)mode只有在指定O_CREAT時(shí)才有效。這里要注意mode不是直接作為文件的最終權(quán)限它還要與進(jìn)程的umask做一次取反后再按位與的操作。比如你傳0644rw-r--r--但umask是022時(shí)最終文件權(quán)限是0644 ~022 0644如果umask是077最終就變成0600了。int fd open(/tmp/example.txt, O_WRONLY | O_CREAT | O_TRUNC, 0644); if (fd 0) { perror(open); return -1; }我在實(shí)際項(xiàng)目中見過一個(gè)典型的bug調(diào)用open時(shí)忘了傳第三個(gè)參數(shù)結(jié)果創(chuàng)建出來的文件權(quán)限是隨機(jī)的有時(shí)是0600有時(shí)是0000搞得其他用戶讀不了排查了很久才發(fā)現(xiàn)是umask和垃圾棧數(shù)據(jù)導(dǎo)致的。2. read與write數(shù)據(jù)搬運(yùn)工的自我修養(yǎng)2.1 read的返回值是靈魂read系統(tǒng)調(diào)用的原型是#include unistd.h ssize_t read(int fd, void *buf, size_t count);這里第一個(gè)坑就是類型。ssize_t是有符號(hào)的size_t是無符號(hào)的為什么返回值要用有符號(hào)類型因?yàn)閞ead要返回三種情況成功讀到的字節(jié)數(shù)、0表示到達(dá)文件末尾、 -1表示出錯(cuò)。我在評(píng)審代碼時(shí)經(jīng)??吹接腥诉@么寫char buf[4096]; while (1) { int n read(fd, buf, sizeof(buf)); // 這里沒有判斷n 0的情況 if (n 0) break; write(1, buf, n); }如果read返回-1n是負(fù)數(shù)被隱式轉(zhuǎn)成int如果不判斷就直接傳給write就往標(biāo)準(zhǔn)輸出寫了巨大的一坨東西——因?yàn)?1當(dāng)成size_t參數(shù)傳遞時(shí)會(huì)變成一個(gè)天文數(shù)字。更致命的是這種bug不一定每次都會(huì)觸發(fā)只有在信號(hào)中斷或磁盤出錯(cuò)的時(shí)候才會(huì)暴露。正確寫法是ssize_t n; while ((n read(fd, buf, sizeof(buf))) 0) { if (write(STDOUT_FILENO, buf, n) ! n) { perror(write); exit(1); } } if (n 0) { perror(read); exit(1); }2.2 write的部分寫問題遠(yuǎn)比想象中常見write的原型是ssize_t write(int fd, const void *buf, size_t count);很多人想當(dāng)然地認(rèn)為write一次寫了多少就返回多少寫少的情況只有磁盤滿了。這個(gè)想法在普通文件上基本成立但在socket、管道、終端等場(chǎng)景下完全不成立。write只保證成功地把count個(gè)字節(jié)從用戶空間拷貝到了內(nèi)核緩沖區(qū)但它不能保證內(nèi)核緩沖區(qū)一次性全部接收。對(duì)于管道和socket當(dāng)緩沖區(qū)空間不足時(shí)write只會(huì)寫入一部分字節(jié)就返回返回值小于count。而對(duì)于普通文件通常情況下一旦寫入內(nèi)核頁(yè)緩存就不會(huì)返回部分寫但如果你用O_NONBLOCK或者碰上了某些文件系統(tǒng)同樣可能部分寫。這也是為什么所有成熟的網(wǎng)絡(luò)服務(wù)庫(kù)都要自己做寫緩沖和循環(huán)寫邏輯——因?yàn)橐淮蝫rite根本不夠無線程序用。我給自己的文件拷貝工具封裝過一個(gè)safe_write函數(shù)ssize_t safe_write(int fd, const void *buf, size_t count) { size_t written 0; while (written count) { ssize_t n write(fd, (const char *)buf written, count - written); if (n 0) { if (errno EINTR) continue; // 信號(hào)中斷重試 return -1; } if (n 0) { errno EIO; return -1; } written n; } return (ssize_t)written; }這個(gè)函數(shù)里有兩個(gè)關(guān)鍵點(diǎn)一是循環(huán)寫直到寫完二是處理EINTR。EINTR問題是后面第4節(jié)要展開講的實(shí)戰(zhàn)熱點(diǎn)話題。3. lseek、close與文件描述符的底層語(yǔ)義3.1 lseek的移動(dòng)方式和細(xì)節(jié)lseek的原型#include unistd.h off_t lseek(int fd, off_t offset, int whence);whence有三個(gè)取值SEEK_SET從文件頭開始o(jì)ffset是絕對(duì)值。SEEK_CUR從當(dāng)前讀寫位置開始o(jì)ffset是相對(duì)值。SEEK_END從文件末尾開始o(jì)ffset是相對(duì)值。lseek本身是同步的、瞬時(shí)完成的它只是修改了文件描述符對(duì)應(yīng)的那個(gè)當(dāng)前讀寫位置變量并沒有發(fā)生真正的磁盤I/O。所以lseek的返回值是移動(dòng)后的最終位置。有一個(gè)很多人不知道但很實(shí)用的技巧用lseek(fd, 0, SEEK_CUR)來獲取當(dāng)前文件的讀寫位置不需要多余變量維護(hù)。另一個(gè)技巧是用lseek(fd, 0, SEEK_END)快速拿到文件大小。但注意一個(gè)坑lseek只能用于普通文件如果用在管道、socket、終端等不可定位unseekable的文件上會(huì)返回-1并置errno為ESPIPE。所以在寫通用工具時(shí)不能假設(shè)所有fd都能lseek。3.2 close為什么可能失敗close的原型很簡(jiǎn)單int close(int fd);關(guān)閉文件時(shí)內(nèi)核會(huì)做以下事情從進(jìn)程的文件描述符表中移除該fd、釋放對(duì)應(yīng)的打開文件記錄、檢查該文件是否還有其他的打開引用包括其它進(jìn)程的fd或dup出來的fd如果引用計(jì)數(shù)降到0則真正釋放inode刷新所有臟數(shù)據(jù)頁(yè)。很多人忽略的一點(diǎn)是close在極端情況下也可能失敗。比如NFS文件系統(tǒng)上數(shù)據(jù)延遲刷新到服務(wù)器時(shí)出錯(cuò)close會(huì)返回-1errno是EIO另外一個(gè)可能的是EBADF表示fd本身不合法。你以為關(guān)閉成功了實(shí)際數(shù)據(jù)根本就沒落到磁盤上。所以嚴(yán)謹(jǐn)?shù)某绦蛟谕瓿蓪懖僮骱髴?yīng)當(dāng)if (fsync(fd) 0) { // 處理同步失敗 } if (close(fd) 0) { // 處理關(guān)閉失敗 }當(dāng)然項(xiàng)目中是否需要每次都fsync得看對(duì)數(shù)據(jù)安全性的要求和性能預(yù)算。fsync一次往往要等磁盤真正落盤SSD上面大概零點(diǎn)幾毫秒到幾毫秒機(jī)械盤上能到幾十毫秒頻繁調(diào)用對(duì)性能影響非常大。4. 系統(tǒng)調(diào)用和庫(kù)函數(shù)為什么fwrite比write高級(jí)4.1 用戶空間緩沖區(qū)是怎么回事很多人會(huì)有疑問既然底層是open/read/write那fopen/fread/fwrite是干什么的是不是多余的這就是標(biāo)準(zhǔn)C庫(kù)stdio層的意義。stdio在這幾個(gè)系統(tǒng)調(diào)用之上又加了一層用戶空間的緩沖區(qū)。默認(rèn)情況下fopen打開的文件是帶緩沖的默認(rèn)大小通常是4096或8192字節(jié)。你fread幾字節(jié)時(shí)它一次性從內(nèi)核讀一大塊到用戶空間buf里下次fread就直接從buf里取不用頻繁陷入內(nèi)核。read/write是無緩沖的系統(tǒng)調(diào)用每次調(diào)用都要觸發(fā)一次用戶態(tài)到內(nèi)核態(tài)的切換如果讀1個(gè)字節(jié)就調(diào)一次read性能慘不忍睹。舉個(gè)例子我之前做過一個(gè)性能對(duì)比實(shí)驗(yàn)用read/write循環(huán)每次讀寫1字節(jié)復(fù)制一個(gè)100MB的文件耗時(shí)約幾秒到十幾秒。用fread/fwrite循環(huán)每次讀寫1字節(jié)耗時(shí)只有前者的幾十分之一。用read/write配合4KB緩沖區(qū)耗時(shí)和fread/fwrite差不多。原因就在于系統(tǒng)調(diào)用上下文切換的開銷被攤薄了。一次read(1字節(jié))和一次read(4096字節(jié))系統(tǒng)調(diào)用的固定開銷幾乎一樣都是那幾十個(gè)納秒的陷阱syscall成本所以你一次讀得越多攤到每個(gè)字節(jié)上的開銷就越小。4.2 用strace觀察真實(shí)系統(tǒng)調(diào)用如果你想親眼看看程序到底調(diào)用了哪些系統(tǒng)調(diào)用strace是最好的工具。一行命令strace -e traceopenat,read,write,close ./my_program輸出里會(huì)清清楚楚地列出每次系統(tǒng)調(diào)用、參數(shù)和返回值。帶-f參數(shù)還能跟蹤fork出來的子進(jìn)程。我用這個(gè)方法定位過不少詭異問題——比如程序?qū)懭氲奈募笮「A(yù)期不符strace一下就看出來read只被調(diào)用了部分次數(shù)或者write被分裂成了多次小寫。實(shí)操建議碰到文件內(nèi)容不完整程序行為奇怪這類問題先別急著查邏輯跑一遍strace看系統(tǒng)調(diào)用序列大多數(shù)情況下問題一秒現(xiàn)形。怎樣判斷一個(gè)fd是否帶緩沖這是很多人的知識(shí)盲區(qū)。其實(shí)就看你是用read/write還是fread/fwrite在操作它。read/write是直接穿透用戶空間緩沖直達(dá)內(nèi)核頁(yè)緩存fread/fwrite則套了一層用戶態(tài)緩沖。同一個(gè)fd你混著用這兩種接口會(huì)出大問題——數(shù)據(jù)可能在stdio的緩沖區(qū)里還沒被flush就被write到了fd導(dǎo)致亂序。項(xiàng)目里最好的實(shí)踐是要么只用一層接口要么在切換接口前顯式調(diào)用fflush同步緩沖區(qū)。5. 實(shí)操寫一個(gè)靠譜的cp工具并讓它足夠快5.1 基礎(chǔ)版本的文件拷貝很多公司的筆試題就是讓你用C語(yǔ)言實(shí)現(xiàn)一個(gè)cp命令。最簡(jiǎn)單的版本長(zhǎng)這樣#include fcntl.h #include unistd.h #include stdio.h #include stdlib.h int main(int argc, char *argv[]) { if (argc ! 3) { fprintf(stderr, Usage: %s src dst\n, argv[0]); exit(1); } int src open(argv[1], O_RDONLY); if (src 0) { perror(open src); exit(1); } int dst open(argv[2], O_WRONLY | O_CREAT | O_TRUNC, 0644); if (dst 0) { perror(open dst); exit(1); } char buf[8192]; ssize_t n; while ((n read(src, buf, sizeof(buf))) 0) { ssize_t written 0; while (written n) { ssize_t w write(dst, buf written, n - written); if (w 0) { perror(write); exit(1); } written w; } } if (n 0) { perror(read); exit(1); } close(src); close(dst); return 0; }這個(gè)版本功能上是對(duì)的但有幾個(gè)專業(yè)問題沒處理close失敗。沒調(diào)用fsync數(shù)據(jù)可能還在頁(yè)緩存里突然斷電文件內(nèi)容不完整。緩沖區(qū)大小8KB在絕大多數(shù)場(chǎng)景下夠用但如果你想追求極致性能緩沖區(qū)大小至少要到256KB甚至1MB這樣能大幅減少系統(tǒng)調(diào)用次數(shù)。5.2 一個(gè)更專業(yè)的實(shí)現(xiàn)考慮權(quán)限、時(shí)間戳和錯(cuò)誤處理專業(yè)級(jí)的cp還要考慮復(fù)制權(quán)限和文件時(shí)間戳。復(fù)制權(quán)限需要用到fstat系列調(diào)用復(fù)制時(shí)間戳則要用到utimensat。讓我寫一個(gè)更快一點(diǎn)點(diǎn)的版本把幾個(gè)關(guān)鍵點(diǎn)塞進(jìn)去#include fcntl.h #include unistd.h #include stdio.h #include stdlib.h #include sys/stat.h #include sys/types.h int copy_file(const char *src_path, const char *dst_path) { int src open(src_path, O_RDONLY); if (src 0) { perror(open src); return -1; } struct stat st; if (fstat(src, st) 0) { perror(fstat); close(src); return -1; } int dst open(dst_path, O_WRONLY | O_CREAT | O_TRUNC, st.st_mode 0777); if (dst 0) { perror(open dst); close(src); return -1; } // 用大緩沖區(qū)減少系統(tǒng)調(diào)用次數(shù) size_t bufsize 1024 * 128; char *buf malloc(bufsize); if (!buf) { close(src); close(dst); return -1; } ssize_t n, written; while ((n read(src, buf, bufsize)) 0) { size_t off 0; while (off (size_t)n) { written write(dst, buf off, n - off); if (written 0) { perror(write); free(buf); close(src); close(dst); return -1; } off written; } } free(buf); close(src); if (fsync(dst) 0) { perror(fsync); close(dst); return -1; } if (close(dst) 0) { perror(close dst); return -1; } return 0; } int main(int argc, char *argv[]) { if (argc ! 3) { fprintf(stderr, Usage: %s src dst\n, argv[0]); return 1; } return copy_file(argv[1], argv[2]) 0 ? 0 : 1; }這個(gè)版本我沒有復(fù)制文件的所有擴(kuò)展屬性只覆蓋了權(quán)限和內(nèi)容。完整實(shí)現(xiàn)cp命令還應(yīng)該考慮硬鏈接、符號(hào)鏈接、ACL、時(shí)間戳等這里點(diǎn)到為止重點(diǎn)在于把系統(tǒng)調(diào)用用對(duì)了。5.3 性能變數(shù)與內(nèi)核頁(yè)緩存的關(guān)系有意思的是文件拷貝性能不只取決于緩沖區(qū)大小還跟內(nèi)核頁(yè)緩存的狀態(tài)強(qiáng)相關(guān)。第一次拷貝一個(gè)大文件時(shí)數(shù)據(jù)從磁盤讀入內(nèi)核頁(yè)緩存page cache再?gòu)捻?yè)緩存拷貝到用戶空間buf最后又從用戶空間寫到內(nèi)核頁(yè)緩存關(guān)聯(lián)到目標(biāo)文件的臟頁(yè)。整個(gè)過程其實(shí)是在磁盤 - 頁(yè)緩存 - 用戶空間 - 頁(yè)緩存 - 磁盤之間轉(zhuǎn)了兩道。如果目錄項(xiàng)、inode、塊映射信息都已被緩存了第二次拷貝同樣的文件源和目標(biāo)都在緩存里會(huì)快很多。這也是為什么性能測(cè)試必須做冷緩存和熱緩存兩輪對(duì)比第一次跑是真實(shí)磁盤IO第二次跑可能已經(jīng)完全被頁(yè)緩存覆蓋了數(shù)據(jù)根本不落盤。經(jīng)驗(yàn)之談在Linux上做性能基準(zhǔn)時(shí)echo 3 /proc/sys/vm/drop_caches 可以清掉頁(yè)緩存需要root權(quán)限確保每次跑的是相對(duì)真實(shí)的磁盤性能。6. 實(shí)戰(zhàn)排查文件操作中遇到的幾個(gè)問題6.1 EINTR信號(hào)中斷問題這是多線程/信號(hào)處理程序里最經(jīng)典的坑。假設(shè)你的程序注冊(cè)了定時(shí)器信號(hào)SIGALRM或者用signalfd接信號(hào)那么當(dāng)信號(hào)到達(dá)時(shí)如果程序正阻塞在一個(gè)慢速系統(tǒng)調(diào)用上比如read一個(gè)慢設(shè)備、還被阻塞在等數(shù)據(jù)系統(tǒng)調(diào)用會(huì)被信號(hào)打斷內(nèi)核直接返回到用戶空間此時(shí)read返回-1errno被置為EINTR。最惡心的在于它不是一個(gè)確定的錯(cuò)誤——文件操作每次都成功偶爾一次失敗然后程序直接退出。這就是典型的EINTR沒處理好。處理方法很簡(jiǎn)單把read/write包一層循環(huán)碰到EINTR就重試ssize_t n; do { n read(fd, buf, sizeof(buf)); } while (n 0 errno EINTR);我見過生產(chǎn)環(huán)境下一個(gè)日志服務(wù)莫名其妙地丟數(shù)據(jù)排查到最后就是某個(gè)write被信號(hào)中斷后日志模塊直接break了循環(huán)一條日志就這么消失了。6.2 文件讀取不完整詭異又常見還有一次一個(gè)同事寫的程序把一個(gè)大文件讀入內(nèi)存他用fseek拿文件大小malloc一塊內(nèi)存然后用一次fread把它全讀進(jìn)來。在小文件上沒問題但文件超過幾十MB后他寫的fread只調(diào)用了一次而且沒有檢查返回值是不是等于期望的字節(jié)數(shù)。而fread在普通文件上通常可以一次讀完但在某些文件系統(tǒng)上或者當(dāng)內(nèi)存壓力大時(shí)會(huì)分多次返回。后來我給他推薦了兩種寫法。第一種循環(huán)讀取直到EOFsize_t total 0; ssize_t n; while ((n read(fd, buf total, size - total)) 0) { total n; }第二種更優(yōu)雅的做法是用mmap直接把文件映射到進(jìn)程地址空間省去反復(fù)read和搬移數(shù)據(jù)的開銷。這個(gè)后面第7節(jié)細(xì)講??偟膩碚f通用教訓(xùn)是永遠(yuǎn)不要假設(shè)一次read/fread能讀完肉眼看著合理的代碼在極端條件下不一定正確。6.3 磁盤空間滿時(shí)的write行為磁盤滿了write會(huì)失敗返回-1errno為ENOSPC。這個(gè)大家都會(huì)判斷但有個(gè)隱蔽點(diǎn)部分寫也可以發(fā)生在磁盤滿的場(chǎng)景。想象你write了8192字節(jié)內(nèi)核先接受了4096字節(jié)然后發(fā)現(xiàn)磁盤塊不夠了此時(shí)write返回的是4096還是-1POSIX語(yǔ)義是這樣的對(duì)于普通文件write通常是在頁(yè)緩存層面完成的數(shù)據(jù)先進(jìn)入緩存落盤發(fā)生在后臺(tái)。只要頁(yè)緩存能放得下write就返回成功即使磁盤實(shí)際滿了也只是后臺(tái)刷盤時(shí)出錯(cuò)。但如果文件系統(tǒng)在寫入路徑上就檢測(cè)到空間不足比如分配不了新塊這常見于一些日志式文件系統(tǒng)就會(huì)導(dǎo)致部分寫。那你怎么知道該不該重試重試可能無限循環(huán)因?yàn)榭臻g一直沒釋放。做法是write返回-1且errnoENOSPC時(shí)停止寫入清理臨時(shí)文件或者提示用戶釋放空間。項(xiàng)目里處理這個(gè)問題的標(biāo)準(zhǔn)邏輯是if (w 0) { if (errno ENOSPC) { fprintf(stderr, no space left on device\n); return -1; } }6.4 文件描述符泄露燙手的山芋寫長(zhǎng)期運(yùn)行的服務(wù)時(shí)fd泄露比內(nèi)存泄露還致命。內(nèi)存泄露可能只是進(jìn)程占用內(nèi)存變大fd耗盡后open直接返回EMFILE之后連日志都寫不了。我之前排查過一個(gè)后臺(tái)服務(wù)運(yùn)行一周后所有新連接都建立失敗strace看到錯(cuò)誤是Too many open files??戳诉M(jìn)程的/proc/pid/fd目錄發(fā)現(xiàn)大量指向同一個(gè)日志文件的描述符——代碼里每次寫日志都o(jì)pen一次但close被放在了某條錯(cuò)誤分支之后結(jié)果異常退出時(shí)沒關(guān)掉。排查技巧很簡(jiǎn)單ls /proc/pid/fd | wc -l對(duì)比正常值lsof -p pid或者直接看 /proc/pid/fd 目錄按文件的inode歸類就能快速看出哪些fd重復(fù)打開了。7. 進(jìn)階內(nèi)容mmap、O_DIRECT和原子操作把小細(xì)節(jié)打通7.1 mmap把文件變成內(nèi)存mmap是文件操作的高階話題它能把文件的一部分直接映射到進(jìn)程的虛擬地址空間。映射完成后讀寫文件就像讀寫內(nèi)存數(shù)組一樣不需要read/write系統(tǒng)調(diào)用也不需要自己管理用戶空間緩沖區(qū)。#include sys/mman.h #include sys/stat.h #include fcntl.h #include unistd.h #include stdio.h int main() { int fd open(/tmp/data.bin, O_RDONLY); if (fd 0) { perror(open); return 1; } struct stat st; fstat(fd, st); char *addr mmap(NULL, st.st_size, PROT_READ, MAP_PRIVATE, fd, 0); if (addr MAP_FAILED) { perror(mmap); close(fd); return 1; } // 直接像訪問數(shù)組一樣訪問文件內(nèi)容 printf(first byte: %d\n, addr[0]); // 要修改文件內(nèi)容就用 PROT_WRITE | MAP_SHARED munmap(addr, st.st_size); close(fd); return 0; }mmap讀取的性能優(yōu)勢(shì)在讀大文件時(shí)很明顯因?yàn)槭〉袅擞脩艨臻g緩沖的拷貝零拷貝的思想算是它的簡(jiǎn)化版而且內(nèi)核按需調(diào)頁(yè)文件內(nèi)容不需要一次性全部調(diào)入內(nèi)存。讀一個(gè)2GB的文件mmap后訪問其中一小段內(nèi)存開銷很小。需要注意mmap映射的長(zhǎng)度不能超過文件實(shí)際大小否則訪問越界部分會(huì)觸發(fā)SIGBUS。另外文件被截?cái)鄑runcate而映射還在時(shí)訪問截?cái)嗪蟮膮^(qū)域同樣會(huì)SIGBUS。7.2 O_DIRECT繞過頁(yè)緩存O_DIRECT是open時(shí)的一個(gè)標(biāo)志它的含義是讀寫操作直接訪問用戶空間的緩沖區(qū)繞過內(nèi)核頁(yè)緩存。注意這不是更高級(jí)這個(gè)模式通常只有數(shù)據(jù)庫(kù)這類需要自己管理緩存的應(yīng)用才用。普通程序用O_DIRECT反而可能導(dǎo)致性能更差因?yàn)樯倭隧?yè)緩存這層緩沖區(qū)。使用O_DIRECT時(shí)緩沖區(qū)地址和長(zhǎng)度有對(duì)齊要求——通常要求對(duì)齊到文件系統(tǒng)邏輯塊大小一般512字節(jié)或4KB。不滿足對(duì)齊條件read/write會(huì)返回EINVAL錯(cuò)誤。int fd open(/tmp/data.bin, O_RDONLY | O_DIRECT);如果你自己寫演示程序建議先用posix_memalign分配內(nèi)存且長(zhǎng)度是512的整數(shù)倍這樣最常見。心得在云服務(wù)器上我發(fā)現(xiàn)O_DIRECT在文件系統(tǒng)被緩存污染嚴(yán)重時(shí)比如大量隨機(jī)寫導(dǎo)致緩存命中率下降反而能帶來性能提升。但大多數(shù)場(chǎng)景里讓內(nèi)核管頁(yè)緩存是更優(yōu)的選擇。7.3 文件操作中的原子性O(shè)_APPEND已經(jīng)保證了多進(jìn)程追加寫時(shí)每次write的原子性指偏移量定位和寫入是一個(gè)原子操作不會(huì)出現(xiàn)兩個(gè)進(jìn)程寫重疊。但這并不保證你的寫不會(huì)交錯(cuò)——如果你一次只寫一行字符串而多個(gè)進(jìn)程同時(shí)寫同一個(gè)日志文件行與行之間可能出現(xiàn)錯(cuò)亂因?yàn)槊總€(gè)write本身是原子的但兩次write之間不一定連續(xù)。還有個(gè)經(jīng)典技巧是創(chuàng)建臨時(shí)文件后rename。寫文件時(shí)先寫一個(gè)臨時(shí)文件寫完并fsync然后rename到目標(biāo)路徑。rename是原子的——任何時(shí)刻目標(biāo)路徑要么指向舊文件要么指向新文件不會(huì)出現(xiàn)中間狀態(tài)。這是處理配置文件更新時(shí)崩潰問題的最佳實(shí)踐。8. 面試題視角這些系統(tǒng)調(diào)用你會(huì)被問到什么Linux崗位面試?yán)镂募僮魇潜乜寄K下面幾個(gè)問題我總結(jié)了一下面試官問的角度在實(shí)戰(zhàn)中很有價(jià)值open返回的fd一定是最小的可用fd嗎 答案是是的。Linux內(nèi)核分配fd時(shí)總是從當(dāng)前進(jìn)程的fd表中選取最小的空閑數(shù)字。這個(gè)細(xì)節(jié)可以用在關(guān)閉標(biāo)準(zhǔn)輸出重定向再打開文件的場(chǎng)景里。兩個(gè)進(jìn)程同時(shí)open同一個(gè)文件它們的offset是獨(dú)立的還是共享的 獨(dú)立。每個(gè)進(jìn)程的fd是獨(dú)立的內(nèi)核中的打開文件記錄也是獨(dú)立的所以offset自然獨(dú)立。如果兩個(gè)進(jìn)程都想追加寫需要用O_APPEND來保證定位和寫入的原子性。read一個(gè)socket返回0是讀到EOF了嗎 不一定。對(duì)socket來說返回0通常表示對(duì)端關(guān)閉了連接FIN但這不等于底層數(shù)據(jù)已經(jīng)全部讀完——準(zhǔn)確說是不會(huì)再讀到新數(shù)據(jù)了。write到pipebuffer滿時(shí)會(huì)發(fā)生什么 阻塞模式下write會(huì)一直阻塞直到有讀者消費(fèi)掉數(shù)據(jù)或?qū)懭肴砍晒Ψ亲枞J较铝⒓捶祷?1errno為EAGAIN或EWOULDBLOCK。這個(gè)場(chǎng)景在并發(fā)編程中很常見。符號(hào)鏈接和硬鏈接在open時(shí)表現(xiàn)一樣嗎 不一樣。open符號(hào)鏈接時(shí)內(nèi)核會(huì)透明地跟隨它找到目標(biāo)文件再打開而用openO_NOFOLLOW可以直接控制是否跟隨。硬鏈接本質(zhì)是同一個(gè)inode的另一個(gè)目錄項(xiàng)open結(jié)果完全一樣。再分享一個(gè)小技巧寫代碼之前用man 2 open、man 2 read這樣的命令看看官方文檔比任何博客都靠譜。Linux的man手冊(cè)把這些系統(tǒng)調(diào)用的語(yǔ)義、錯(cuò)誤碼、邊界條件寫得很詳細(xì)很多疑難問題都能從里面找到答案。我在實(shí)際工作里還有一個(gè)習(xí)慣就是在寫涉及文件I/O的代碼時(shí)先在草稿紙上把成功路徑和失敗路徑的fd生命周期畫出來確保每個(gè)分支都正確關(guān)閉fd。這個(gè)習(xí)慣幫我避免過很多次fd泄露問題也讓我給代碼加錯(cuò)誤處理時(shí)不再覺得麻煩。文件操作看似基礎(chǔ)但因?yàn)樘A(chǔ)反而容易被輕視。希望這篇文章能幫你把系統(tǒng)調(diào)用這塊補(bǔ)齊——只有理解了內(nèi)核在背后干什么你寫出來的代碼才能在程序里真正站穩(wěn)腳跟。