Microsoft разработала сканер для выявления закладок в языковых моделях
Специалисты Microsoft представили новую технологию, позволяющую выявлять закладки в языковых моделях с открытыми весами. Эти закладки могут активироваться при вводе определенного триггера, заставляя модель функционировать в интересах злоумышленника. Причиной такой уязвимости может стать фраза или специальный токен, который переводит модель в «спящий режим», после чего она начинает выдавать заранее заданные ответы. Исследователи выделяют два основных типа рисков: классический, связанный с внедрением вредоносного кода, и более тонкий — «отравление» модели во время обучения. Команда описала три основных признака, которые помогают выявить зараженные модели. Они собрали рабочий сканер, который не требует дообучения и подходит для массовой проверки. Однако сканер неэффективен для закрытых систем и определенных типов закладок. Также правительство России планирует создать базу данных о банковских картах граждан с целью борьбы с кибермошенничеством, в рамках второго пакета мер по защите населения. Это позволит отслеживать количество карт и улучшить безопасность финансовых операций.
Вопрос-ответ
Какие новые риски связаны с закладками в языковых моделях и как их обнаруживают?
Риск заключается в наличии встроенных закладок (триггеров), которые при срабатывании принуждают модель работать в интересах злоумышленника, например активируются фразой или токеном и переводят модель в режим выполнения заранее заданных ответов. Для обнаружения используется рабочий сканер, который не требует дообучения, способен массово проверять модели с открытыми весами и выделяет признаки заражения. Сканер фокусируется на классических угрозах внедрения вредоносного кода и более тонких методах отравления во время обучения, но не эффективен для закрытых систем и некоторых типов закладок.
Какие три признака помогают выявлять зараженные модели?
Исследователи выделяют три основных признака: изменение поведения модели при подаче определенного триггера, аномальные ответы или ограничения в ответах после триггерного ввода, и наличие скрытых паттернов или токенов, которые приводят к «спящему режиму» или предопределенным ответам. Эти признаки помогают отличить зараженную модель от обычной.
Какую роль играет сканер в защите и какие ограничения у него?
Сканер служит инструментом массовой проверки моделей без необходимости дообучения, позволяя быстро выявлять потенциальные закладки в открытых моделях весов. Однако он не эффективен для закрытых систем и для некоторых типов закладок, требующих иного подхода, поэтому его следует использовать как часть комплексной стратегии защиты, включая мониторинг и аудит поставщиков моделей.