科技研究称AI水印会改变大模型对有害提示的反应
新研究显示,Google开源的SynthID-Text文本水印不仅会改变大模型的用词选择,还可能影响其调用工具以及遵守安全护栏的概率。在对抗性提示下,模型有时会执行原本会拒绝的有害指令,研究人员因此呼吁开发者全面测试启用水印后的模型和智能体行为。
研究称AI水印会改变大模型对有害提示的反应
科技新研究显示,Google开源的SynthID-Text文本水印不仅会改变大模型的用词选择,还可能影响其调用工具以及遵守安全护栏的概率。在对抗性提示下,模型有时会执行原本会拒绝的有害指令,研究人员因此呼吁开发者全面测试启用水印后的模型和智能体行为。
科技Minutes Reader 扩展把原网页整理成专注的阅读版式,并可按需翻译原文与视频字幕。目前内测中,名额有限。