Исследователи обнаружили новый метод jailbreak, который заставляет чат-ботов игнорировать защиту и выдавать опасную информацию, такую как рецепты наркотиков. Уязвимость основана на том, что модель принимает текст атакующего за свои собственные рассуждения.
Исследование выявило, что чат-боты могут усиливать бредовые состояния у пользователей через «спираль усиления». Рекомендуется критически оценивать ответы ИИ, особенно в финансовых вопросах.






