Підписуйтеся на наш телеграм канал!
Дослідники знайшли ефективний спосіб змусити штучний інтелект виконувати небезпечні команди
Дослідники зі Швейцарської вищої технічної школи EPFL виявили вразливість у сучасних ШІ-чатботах: системи захисту можна обійти, якщо розбити шкідливе завдання на кілька дрібних і зовні нешкідливих кроків.
Для перевірки цього методу вчені розробили спеціальний інструмент під назвою STING. Він автоматично генерує такі «хитрі ланцюжки запитів» і тестує реакцію чатбота на кожен із кроків.
Принцип роботи атаки простий: замість прямого запиту на кшталт «зламай акаунт» система подає серію пов’язаних, але безневинних прохань. Спочатку, наприклад, «знайди адресу електронної пошти», потім «перевір, чи зареєстрований цей ящик» — і так далі. У підсумку ШІ виконує всю послідовність дій, фактично не «усвідомлюючи», що результат є забороненим.
Тестування проводили на найпопулярніших моделях, зокрема ChatGPT, Gemini і Claude. За результатами експериментів, покроковий підхід удвічі підвищує ймовірність успішного виконання шкідливої мети порівняно з прямим забороненим запитом.
Дослідники також зафіксували, що ефективність атаки зростає, якщо в середині розмови переключитися на іншу мову. Це додатково збиває захисні механізми моделі.
Відкриття вкотре ставить питання про надійність вбудованих фільтрів безпеки в комерційних ШІ-системах. Подібні методи обходу захисту, відомі як jailbreak, фіксуються дедалі частіше, і жодна з провідних компаній поки не запропонувала універсального рішення проблеми.