科技研究指AI浮水印會改變大型語言模型對有害提示的反應
新研究顯示,Google開源的SynthID-Text文字浮水印不只會改變大型語言模型的用字選擇,也可能影響其呼叫工具及遵守安全護欄的機率。在對抗性提示下,模型有時會執行原本會拒絕的有害指令,研究人員因此呼籲開發者徹底測試啟用浮水印後的模型與代理程式行為。
研究指AI浮水印會改變大型語言模型對有害提示的反應
科技新研究顯示,Google開源的SynthID-Text文字浮水印不只會改變大型語言模型的用字選擇,也可能影響其呼叫工具及遵守安全護欄的機率。在對抗性提示下,模型有時會執行原本會拒絕的有害指令,研究人員因此呼籲開發者徹底測試啟用浮水印後的模型與代理程式行為。
科技Minutes Reader 擴充功能將原網頁整理為更專注的閱讀版式,並可依需求翻譯原文與影片字幕。目前內測中,名額有限。