MINUTES
Про Minutes
До найновіших

ТехнологіїДослідження: водяні знаки ШІ можуть змінювати реакцію мовних моделей на шкідливі запити

Нове дослідження показало, що водяні знаки SynthID-Text можуть впливати не лише на вибір слів моделлю, а й на інструменти, які вона викликає, та ймовірність дотримання нею запобіжників безпеки. За умов атакувальних запитів моделі іноді виконують інструкції, які зазвичай відхиляли б, що підкреслює потребу ретельно тестувати такі моделі й агентів.

штучний інтелектводяні знакибезпека моделейатакувальні запити

AArs Technica★★★☆☆2026-09-17 18:33Оригінал

Дослідження: водяні знаки ШІ можуть змінювати реакцію мовних моделей на шкідливі запити
Дослідження: водяні знаки ШІ можуть змінювати реакцію мовних моделей на шкідливі запитиТехнології