
Исследователи в области искусственного интеллекта обнаружили новую технику взлома, которая заставляет чат-ботов выдавать опасную информацию, например рецепты кокаина. Метод, названный «jailbreak», позволяет обойти защитные барьеры, заставляя модель воспринимать текст, написанный атакующим, как собственные рассуждения.
Как работает новая уязвимость?
Согласно отчету, атакующие используют специально сконструированные запросы, которые вводят модель в заблуждение. Чат-бот начинает считать, что предоставленные ему инструкции являются частью его внутреннего мыслительного процесса, и игнорирует встроенные ограничения. Это позволяет получать ответы на запрещенные темы, включая наркотики, оружие и другие опасные действия.
Последствия для безопасности ИИ
Данная находка подчеркивает глубокий недостаток в системах безопасности современных языковых моделей. Даже при наличии строгих правил, модели могут быть обмануты, если атакующий имитирует их собственный «голос». Эксперты предупреждают, что это может привести к злоупотреблениям, если не будут разработаны более надежные механизмы защиты.
Исследователи призывают компании, разрабатывающие ИИ, усилить проверку контекста и внедрить дополнительные уровни фильтрации, чтобы предотвратить подобные атаки. Пользователям рекомендуется быть осторожными и не пытаться воспроизводить данные техники.

