
10 月 5 日,OpenAI 宣布了一件不太顯眼的事:未來幾周,歐盟用戶拿到的 ChatGPT 和 Codex 文本會被加上機器可識別的隱形水印,技術(shù)名字叫 textGrain。你在屏幕上什么都看不到,但檢測器能認(rèn)出來。這件事的關(guān)鍵不是"加了個標(biāo)記",而是它到底加在哪里。水印不在文末,藏在選詞里一句話說清:它不是往文本里塞一段隱藏字符,而是讓模型在挑詞的時候帶上一點統(tǒng)計上的偏好。模型每寫一個詞,都是在若干近義候選里做一次選擇。textGrain 會在這些選擇上按一段密鑰施加極小的偏移,單看一句話完全看不出差別,但一段 400 個 token 的文字累積下來,選詞分布就會呈現(xiàn)出某種"筆跡"。檢測器讀的正是這段分布,判斷它是否來自帶水印的 OpenAI 模型。這也解釋了一個反常識的現(xiàn)象:水印的檢出率跟文本長度、用詞自由度直接掛鉤。心理學(xué)這類可以換著說法寫的內(nèi)容,信號最容易積起來;數(shù)學(xué)推導(dǎo)里能替換的詞本來就少,檢出率會明顯往下掉。官方給出的幾個數(shù)字,比新聞標(biāo)題有意思OpenAI 公布的測試結(jié)果是:200 個 token 的心理學(xué)文本,檢出率約 80%;同樣的內(nèi)容寫到 400 個 token,約 95%。把 10% 的詞換成近義詞,檢出率從約 92% 掉到 66%。換掉 25% 的詞,檢出率只剩大約 17%。翻譯一遍、或者大改一遍,同樣會削弱信號。也就是說,這個水印能回答"這段文字像不像 OpenAI 寫的",回答不了"整篇是不是 AI 寫的",更量不出人到底改了多少。還有一條邊界容易被忽略:檢測器的結(jié)果只有"命中"和"未命中",它不會告訴你這句話是誰問的、提示詞寫了什么、對話里聊過什么。OpenAI 自己也承認(rèn)當(dāng)前的文本水印技術(shù)有明顯局限,檢測器可能誤報,也可能漏掉真實存在的水印。為什么只在歐盟推,還推得這么小心原因?qū)懺诠胬铮簽榱俗袷貧W盟《人工智能法案》的透明度