Підписуйтеся на наш телеграм канал!
Аналітики порахували, наскільки безпечним є код, що створив штучний інтелект
Компанія Veracode опублікувала звіт GenAI Code Security Report 2026, який фіксує суттєвий розрив між здатністю штучного інтелекту генерувати працездатний код і рівнем його безпеки. Дослідники протестували понад 100 моделей у чотирьох зрізах і отримали середній показник успішності за критеріями безпеки лише 56% — майже без змін порівняно з 2025 роком.
При цьому синтаксичні тести моделі проходили практично в 100% випадків. Це означає, що код може коректно виконуватися й вирішувати поставлене завдання, водночас містячи небезпечну реалізацію. Тестування проводилося на стандартизованих завданнях із генерації коду різними мовами програмування та для різних категорій вразливостей, без додаткових інструкцій щодо безпеки.
Veracode окремо застерігає від спрощеного трактування результатів: 44% невдалих перевірок не означають, що рівно стільки коду у реальних проєктах є вразливим. Тести відображають лише конкретні умови та завдання й не враховують додаткових заходів захисту — статичного аналізу, корпоративних політик, захисних обмежень і перевірки людиною.
Спеціалізовані моделі для програмування не продемонстрували очікуваної переваги: їхній середній результат склав 51% проти 52% у універсальних моделей. Розмір моделі також майже не вплинув на безпеку — великі набрали в середньому 53%, середні й малі 51%. Помітно краще показали себе моделі з режимом міркувань: 56% проти 51% у решти. У рейтингу Veracode лідером стала GPT‑4.5 з результатом 68%, тоді як шість із одинадцяти представлених моделей отримали від 50% до 53%.
Найбільший розкид спостерігався між мовами програмування. Python показав найвищий середній результат — 63%, тоді як Java опинилася в кінці рейтингу з 30%, хоча її показник поступово поліпшується. Це підкреслює, що вибір мови суттєво впливає на ймовірність отримати безпечний згенерований код.
Veracode рекомендує ставитися до будь-якого ШІ-згенерованого коду як до неперевіреного та обов’язково пропускати його через перевірки безпеки перед злиттям з основною кодовою базою, включно з аналізом залежностей. Головний висновок звіту: швидкість генерації працездатного коду не замінює контроль, здатний виявити вразливості, які функціональне тестування просто не помічає.