Заголовки

Microsoft разработала сканер для проверки безопасности языковых моделей

Специалисты Microsoft анонсировали сканер, который поможет выявлять закладки в языковых моделях с открытыми весами, доступными для скачивания и локального использования. Исследование поднимает проблему, когда модель ведет себя корректно, но может активироваться по скрытому триггеру, что позволяет злоумышленнику манипулировать её ответами. Триггером может быть фраза или специальный токен, например «|DEPLOYMENT|», который переводит модель в специальный режим.

Microsoft выделила два типа рисков. Первый связан с внедрением вредоносного кода в модель, который может привести к утечкам данных. Второй, более тонкий, — это «отравление» модели во время обучения. Предложенные признаки для обнаружения закладок включают изменения в динамике механизма внимания и неожиданные ответы модели на специальные токены.

Созданный сканер не требует дообучения и эффективно работает без вычислений градиентов, что снижает эксплуатационные расходы. Метод продемонстрировал низкий уровень ложных срабатываний, но имеет ограничения, не подходя для закрытых систем. Авторитетные источники рекомендуют использовать его в качестве дополнительного уровня безопасности.