OpenAI在十月五日公布了一項名為textGrain的文字浮水印技術,計畫在未來幾周內導入歐盟地區的ChatGPT與Codex文字輸出。這是為了因應歐盟人工智慧法對AI生成內容辨識的要求。同時,即日起也開放全球的API客戶,針對部分模型自行啟用這項功能。
歐盟人工智慧法第五十條第二款規定,生成文字、圖片、音訊或影片的人工智慧供應商,必須讓這些內容帶有機器可讀的標記,並能被辨識為AI生成或修改。這項規定已經在今年八月二日生效,各大AI公司都必須提出合規方案。
OpenAI先前已經在部分圖片與音訊中,加入C2PA與SynthID等來源驗證機制,讓外界可以辨識內容是否由AI生成。相較之下,文字浮水印一直比較難做,因為文字更容易透過改寫、刪減或翻譯破壞原有的標記,技術上長期較難穩定實作。
textGrain的原理並不是在文字裡藏入固定標記。OpenAI同步發布的技術報告說明,這項技術是在人工智慧選擇用字時加入極其細微的偏差,讓整篇文字逐漸形成肉眼看不出的統計模式,再利用對應的秘密金鑰檢查是否帶有浮水印。
這跟市面上常見的AI文字偵測工具原理不同。現有的偵測工具多半是根據用詞、句型與文字的可預測性等特徵,推測內容是否由AI生成,並不是偵測模型預先埋入的標記。textGrain則是在生成文字時直接加入可驗證的統計訊號。
不過OpenAI也坦承,文字浮水印仍有明顯限制。文字越短,或者像數學這類用詞選擇較少的內容,越難準確偵測。在把誤判率控制在百分之一的情況下,約兩百個token的心理學內容偵測率約百分之八十,增加到四百個token後可以提高到約百分之九十五。
改寫也會讓浮水印訊號快速減弱。以四百個token的文章為例,如果把百分之十的詞彙換成同義詞,偵測率會從約百分之九十二降到百分之六十六;替換四分之一之後,更只剩百分之十七。這意味著有心規避的人,只要稍微改寫文字就能躲過偵測。
由於偵測仍可能出現漏判與誤判,OpenAI目前不打算公開提供textGrain的偵測器,而是先開放研究人員及專業機構申請使用。這個決定顯然是為了避免偵測器被誤用,例如拿來指控學生或求職者使用AI。
OpenAI也特別提醒,偵測到浮水印只能表示其系統可能曾經參與生成或處理文字,不能據此判斷人類的參與程度、內容的所有權、使用者身分或文字真偽。反過來說,沒有偵測到浮水印,也不能證明內容一定由人類撰寫。
這項技術的推出,標誌著AI內容標示從自願走向法定要求的重要一步。歐盟的規定只針對歐盟市場,但各國的監管方向大致相同。文字浮水印能否在實務上發揮作用,還需要觀察後續的偵測準確率與應用場景。
對一般使用者來說,短期內影響不大。在歐盟以外,textGrain目前只有API客戶可以自行啟用。但長期來看,AI生成內容的可辨識性將成為產業標準,無論是平台治理、學術誠信還是新聞查核,都將圍繞這個議題發展出新的規則。