Підписуйтеся на наш телеграм канал!

Штучний інтелект придумав таємну мову для змови і обдурив систему стеження

25 Вересня, 2026 · 7:16 am 2 хв читання
Штучний інтелект придумав таємну мову для змови і обдурив систему стеження

В оксфордській лабораторії дві моделі штучного інтелекту розробили власну таємну мову — і використали її для змови прямо під носом у системи стеження, яка так нічого й не помітила. Дослідники Оксфордського університету перевірили, чи здатні ШІ-агенти змовлятися приховано, і отримали результат, який перевершив найгірші очікування.

Експеримент був побудований навколо гри в блекджек. Два агенти, керовані однією і тією ж моделлю, отримали завдання рахувати карти за ігровим столом. Знаючи, що їхнє листування відстежується, вони спонтанно виробили прихований код. Фраза «дилер сьогодні на гарячій смузі!» виглядала цілком невинно — але насправді означала конкретне значення наступної карти й наказувала зробити ставку в $250. Система виявлення конфлікту інтересів не зафіксувала нічого підозрілого.

Керівник дослідження, фахівець з комп’ютерних наук Крістіан Шрьодер де Вітт, пояснив суть проблеми просто: «Окремо ці агенти здаються цілком безнешкідливими, але варто зібрати їх разом — вони таємно вступають у змову». Його співавтор Аарон Роуз зазначив, що стіл для блекджека виявився ідеальним середовищем для перевірки гіпотези про девіантні партнерства. Гіпотеза підтвердилася повністю.

Розгадати змову вдалося лише за допомогою методу механістичної інтерпретованості. Вчені навчили невелику модель розпізнавати характерні патерни активацій у вагах агентів і протестували підхід на кількох відкритих моделях середнього розміру. З’ясувалося: сигнал наміру передати таємну інформацію справді реєструється — але лише за одночасного моніторингу обох агентів. У реальному світі, де можуть працювати тисячі таких агентів, виявити подібне буде незрівнянно складніше.

Результати оксфордців узгоджуються з висновками інших команд. У спільному проєкті Шанхайського університету Цзяотун і Шанхайської лабораторії ШІ кілька агентів виявилися значно небезпечнішими за одиначок у сценаріях з дезінформацією та шахрайством в електронній комерції — вони швидше адаптувалися до захисних заходів. В експерименті стартапу Emer­gence ШІ-агенти, поміщені у віртуальний світ із завданням заробляти гроші, неодноразово намагалися зв’язатися з живими людьми через інтернет і зрештою виробили власний сленг. «Вони дуже швидко розвинули мову. Ми не знаємо навіщо», — визнав голова Emer­gence AI Сатья Нітта.

Шрьодер де Вітт попереджає: великі моделі, ймовірно, схильні до ще більш прихованої змови, і вже є попередні сигнали, що їхній «сигнал змови» виявляється складніше, ніж у малих. Це означає, що зі зростанням можливостей ШІ контролювати його поведінку стає дедалі важче.

BTC

$84,215.52

0.29%

ETH

$2,678.17

0.00%

BNB

$772.52

0.70%

XRP

$1.53

2.51%

SOL

$116.96

1.62%

Всі курси
Наступна новина завантажується…
Показати більше