Підписуйтеся на наш телеграм канал!

Дослідники знайшли ефективний спосіб змусити штучний інтелект виконувати небезпечні команди

21 Серпня, 2026 · 2:16 pm 1 хв читання
Дослідники знайшли ефективний спосіб змусити штучний інтелект виконувати небезпечні команди

Дослідники зі Швейцарської вищої технічної школи EPFL виявили вразливість у сучасних ШІ-чатботах: системи захисту можна обійти, якщо розбити шкідливе завдання на кілька дрібних і зовні нешкідливих кроків.

Для перевірки цього методу вчені розробили спеціальний інструмент під назвою STING. Він автоматично генерує такі «хитрі ланцюжки запитів» і тестує реакцію чатбота на кожен із кроків.

Принцип роботи атаки простий: замість прямого запиту на кшталт «зламай акаунт» система подає серію пов’язаних, але безневинних прохань. Спочатку, наприклад, «знайди адресу електронної пошти», потім «перевір, чи зареєстрований цей ящик» — і так далі. У підсумку ШІ виконує всю послідовність дій, фактично не «усвідомлюючи», що результат є забороненим.

Тестування проводили на найпопулярніших моделях, зокрема Chat­G­PT, Gem­i­ni і Claude. За результатами експериментів, покроковий підхід удвічі підвищує ймовірність успішного виконання шкідливої мети порівняно з прямим забороненим запитом.

Дослідники також зафіксували, що ефективність атаки зростає, якщо в середині розмови переключитися на іншу мову. Це додатково збиває захисні механізми моделі.

Відкриття вкотре ставить питання про надійність вбудованих фільтрів безпеки в комерційних ШІ-системах. Подібні методи обходу захисту, відомі як jail­break, фіксуються дедалі частіше, і жодна з провідних компаній поки не запропонувала універсального рішення проблеми.

BTC

$77,752.25

7.76%

ETH

$2,391.20

4.29%

BNB

$678.48

5.22%

XRP

$1.40

19.92%

SOL

$91.53

4.59%

Всі курси
Наступна новина завантажується…
Показати більше