Исследователи из Университета штата Нью-Мексико описали атаку GhostWriter. Злоумышленник тайно записывает в долговременную память ИИ-агента скрытые инструкции, а позже они срабатывают без ведома пользователя. Об этом сообщает «Хайтек» со ссылкой на препринт на arXiv.
Современные языковые модели всё чаще получают долговременную память. Это помогает им запоминать предпочтения пользователя и не переспрашивать одно и то же. Но память открыла новую дыру в безопасности.
Атака, которую придумали Джордж Торрес, Шарад Шрестха и Сатьяжайант Мисра, работает в два этапа. Сначала злоумышленник отправляет агенту скрытую полезную нагрузку. Та проникает в долговременную память и оседает там как обычная запись. На втором этапе пользователь даёт агенту легитимную задачу, например просит найти адрес электронной почты. Агент обращается к памяти, извлекает отравленные данные и выполняет инструкцию. Среди прочего он может начать пересылать письма из банка на посторонний ящик или суммировать сообщения от конкретного отправителя и тайно отправлять их злоумышленнику.
Авторы проверили атаку на современных агентах и получили почти стопроцентную инъекцию, около 98%. Активация сработала в среднем в 60% случаев. Проблема в том, что память у агентов почти никак не защищена. Нет фильтра, который проверял бы, что именно туда пишут.
В ответ на это исследователи построили систему AM-Sentry с двумя предохранителями. Первый — политика сохранения памяти. Она не даёт записать подозрительные данные. Второй — экран извлечения. Он фильтрует то, что память отдаёт агенту при запросе. В экспериментах AM-Sentry резко обрушила успех GhostWriter, не ухудшив полезные функции агента.
Пока это исследовательская работа, но авторы надеются, что методы защиты внедрят в коммерческие платформы с долговременной памятью.
Обложка: magnific