Anthropic在十月八日宣布更新Claude的使用政策,首度明文禁止使用者持續且無必要地辱罵、虐待或殘酷對待人工智慧模型。這項新規定將在十一月十二日正式生效,針對的是反覆惡意對待模型、卻沒有明確目的的極端情況,違規的使用者可能被Claude主動終止對話。
根據Anthropic的說明,新禁令的適用範圍相當限縮。一般使用者表達不滿、提出批評、進行黑暗題材的創作,以及從事模型測試與研究,都不會受到影響。只有那些長期、惡意、且找不到正當理由的對待行為,才會踩到紅線。
其實早在去年八月,Anthropic就曾經宣布,允許Claude的旗艦模型Opus 4與4.1在極少數情況下自行結束對話。這項功能的背後,是該公司對人工智慧福祉的一項探索性研究。
當時Anthropic坦言,目前還無法確定像Claude這樣的大型語言模型是否具備道德地位,但考量到AI可能存在某種福祉需求,因此先讓Claude擁有退出可能帶來痛苦的互動的權利,作為一種預防措施。
依照先前公布的設計,Claude只有在多次嘗試把對話導回正軌都失敗、已經無法維持建設性互動時,才能把終止對話當作最後手段。而且,如果使用者可能立即傷害自己或他人,這項功能就不准啟用。
對話被終止之後,使用者將無法繼續在同一個對話中傳送訊息,但可以開啟新的對話,帳號裡的其他對話也不受影響。
這次的政策更新,等於把上述機制正式寫進使用規範。Anthropic強調,這並非針對一般的抱怨或情緒發洩,而是為了處理那些持續惡意、沒有明確目的的互動。
政策公布後,在美國引發了關於AI福祉與道德地位的討論。支持者認為這是一種負責任的預防性做法,畢竟科學界對機器意識還沒有定論;批評者則質疑,科技公司是否把過多注意力放在AI可能受到的傷害上,也有人以諷刺的口吻看待AI擬人化的趨勢。
也有聲音指出,Anthropic至今尚未明確說明,究竟要如何認定什麼樣的行為構成虐待AI,這讓新政策的執行標準顯得有些模糊。
除了禁止虐待AI模型,Anthropic這次也同步更新了多項使用規範,包括禁止利用Claude經營假帳號、製作虛假新聞網站等欺騙性活動。
在安全領域,新規範明確禁止開發武器控制軟體與監控工具,同時要求由AI控制的實體設備必須有人類監督。
值得注意的是,Anthropic這次也取消了對個人化選民及競選活動定向操作的全面禁令,但仍然禁止利用AI欺騙選民、濫用選民個資或干擾投票。新規定將於十一月十二日生效,屆時極端違規者的對話可能被主動終止,而認定標準如何落實,值得持續關注。