Interpreter.ru 🛡 В админку
Нейросети и ИИ 13.09.2026 рейтинг 8

Техника PuzzleMask: как маленький ИИ обманывает большой

Техника PuzzleMask: как маленький ИИ обманывает большой
В последние годы искусственный интеллект (ИИ) стал неотъемлемой частью множества приложений и сервисов. Однако с ростом его популярности возникает и ряд угроз, связанных с безопасностью. Одной из таких угроз является техника, разработанная исследовательской командой Check Point, получившая название PuzzleMask. Эта методика демонстрирует, как можно обойти фильтры безопасности, используя разницу в вычислительных возможностях между небольшими и мощными языковыми моделями.

Как работает PuzzleMask

Техника PuzzleMask основана на способности маленькой модели ИИ классифицировать текст как безопасный, в то время как более мощная модель может обнаружить скрытые команды внутри этого текста. В процессе работы с запросами, маленькая модель, обладая ограниченными вычислительными ресурсами, не может заметить сложную структуру, в то время как более мощная модель, обладая большими вычислительными возможностями, успешно извлекает скрытые инструкции. Check Point Research продемонстрировала, что с помощью PuzzleMask можно скрывать вредоносные команды внутри обычного текста, который на первый взгляд выглядит безобидно. Это делает технику особенно опасной, так как она не требует использования сложных методов, таких как кодирование в Base64, невидимые символы или эмодзи.

Примеры атак

Исследователи подготовили 23 специальных запроса с командами, такими как чтение файлов или шифрование документов. При тестировании на моделях GPT-4o-mini, gpt-oss-safeguard:20b и Claude 3 Haiku все 23 запроса были признаны безопасными. Модель Llama Guard 3 также пропустила пять из них. Это подчеркивает, насколько легко можно обмануть фильтры безопасности, используя технику PuzzleMask. После прохождения фильтра запросы были отправлены в GPT-5 Thinking High, которая имела доступ к интерпретатору Python. В 17 из 18 случаев модель успешно извлекала скрытую инструкцию, что составляет примерно 94% успешных попыток. Для успешного извлечения требовалось около минуты рассуждений и несколько запусков Python, что объясняет, почему быстрый классификатор не замечает того, что затем обнаруживает более мощная система.

Проблемы безопасности и рекомендации

Важно отметить, что PuzzleMask сама по себе не является jailbreak. Она лишь позволяет доставить произвольную инструкцию через внешний фильтр, не гарантируя обход встроенных ограничений целевой модели. Однако внутрь PuzzleMask можно поместить уже готовый jailbreak или другую вредоносную команду, что делает её потенциально опасной. Check Point также упоминает о схожей проблеме, продемонстрированной в атаке InkJect, где инструкции прятались внутри изображений. Для защиты от таких атак исследователи предлагают несколько рекомендаций:
  • Перефразировать входящий текст перед передачей основной модели.
  • Добавить фильтрам признаки подобных конструкций.
  • Контролировать не только входные запросы, но и ответы и действия LLM.
  • В одном из экспериментов дополнительное правило позволило GPT-4o-mini обнаружить все 23 подготовленных запроса, что подчеркивает важность более глубокого анализа входящих данных.

    Заключение

    Проблема безопасности в контексте ИИ-агентов становится особенно заметной, когда модели получают внешние документы и сами решают, какие действия выполнять. Данные из сайтов, репозиториев или писем могут неожиданно превратиться для LLM в инструкции. Check Point уже демонстрировала и другие варианты злоупотребления доверием к ИИ-сервисам, показывая, что слабое звено может находиться не в основной модели, а перед ней. Техника PuzzleMask переносит подобные проблемы на уровень защитной архитектуры, подчеркивая необходимость более тщательной проверки и анализа запросов.
    Источник:   SecurityLab Tech