Исследователи обнаружили новый метод jailbreak, который заставляет чат-ботов игнорировать защиту и выдавать опасную информацию, такую как рецепты наркотиков. Уязвимость основана на том, что модель принимает текст атакующего за свои собственные рассуждения.


