MINUTES
关于 Minutes
返回最新列表

科技研究称AI水印会改变大模型对有害提示的反应

新研究显示,Google开源的SynthID-Text文本水印不仅会改变大模型的用词选择,还可能影响其调用工具以及遵守安全护栏的概率。在对抗性提示下,模型有时会执行原本会拒绝的有害指令,研究人员因此呼吁开发者全面测试启用水印后的模型和智能体行为。

人工智能水印模型安全对抗性提示

AArs Technica★★★☆☆2026-09-17 18:33原文

研究称AI水印会改变大模型对有害提示的反应
研究称AI水印会改变大模型对有害提示的反应科技