
10 月 5 日,OpenAI 宣布了一件不太顯眼的事:未來幾周,歐盟用戶拿到的 ChatGPT 和 Codex 文本會(huì)被加上機(jī)器可識(shí)別的隱形水印,技術(shù)名字叫 textGrain。你在屏幕上什么都看不到,但檢測(cè)器能認(rèn)出來。這件事的關(guān)鍵不是"加了個(gè)標(biāo)記",而是它到底加在哪里。水印不在文末,藏在選詞里一句話說清:它不是往文本里塞一段隱藏字符,而是讓模型在挑詞的時(shí)候帶上一點(diǎn)統(tǒng)計(jì)上的偏好。模型每寫一個(gè)詞,都是在若干近義候選里做一次選擇。textGrain 會(huì)在這些選擇上按一段密鑰施加極小的偏移,單看一句話完全看不出差別,但一段 400 個(gè) token 的文字累積下來,選詞分布就會(huì)呈現(xiàn)出某種"筆跡"。檢測(cè)器讀的正是這段分布,判斷它是否來自帶水印的 OpenAI 模型。這也解釋了一個(gè)反常識(shí)的現(xiàn)象:水印的檢出率跟文本長(zhǎng)度、用詞自由度直接掛鉤。心理學(xué)這類可以換著說法寫的內(nèi)容,信號(hào)最容易積起來;數(shù)學(xué)推導(dǎo)里能替換的詞本來就少,檢出率會(huì)明顯往下掉。官方給出的幾個(gè)數(shù)字,比新聞標(biāo)題有意思OpenAI 公布的測(cè)試結(jié)果是:200 個(gè) token 的心理學(xué)文本,檢出率約 80%;同樣的內(nèi)容寫到 400 個(gè) token,約 95%。把 10% 的詞換成近義詞,檢出率從約 92% 掉到 66%。換掉 25% 的詞,檢出率只剩大約 17%。翻譯一遍、或者大改一遍,同樣會(huì)削弱信號(hào)。也就是說,這個(gè)水印能回答"這段文字像不像 OpenAI 寫的",回答不了"整篇是不是 AI 寫的",更量不出人到底改了多少。還有一條邊界容易被忽略:檢測(cè)器的結(jié)果只有"命中"和"未命中",它不會(huì)告訴你這句話是誰問的、提示詞寫了什么、對(duì)話里聊過什么。OpenAI 自己也承認(rèn)當(dāng)前的文本水印技術(shù)有明顯局限,檢測(cè)器可能誤報(bào),也可能漏掉真實(shí)存在的水印。為什么只在歐盟推,還推得這么小心原因?qū)懺诠胬铮簽榱俗袷貧W盟《人工智能法案》的透明度