MINUTES
關於 Minutes
返回最新列表

科技研究指AI浮水印會改變大型語言模型對有害提示的反應

新研究顯示,Google開源的SynthID-Text文字浮水印不只會改變大型語言模型的用字選擇,也可能影響其呼叫工具及遵守安全護欄的機率。在對抗性提示下,模型有時會執行原本會拒絕的有害指令,研究人員因此呼籲開發者徹底測試啟用浮水印後的模型與代理程式行為。

人工智慧浮水印模型安全對抗性提示

AArs Technica★★★☆☆2026-09-17 18:33原文

研究指AI浮水印會改變大型語言模型對有害提示的反應
研究指AI浮水印會改變大型語言模型對有害提示的反應科技