Упс! Не вдала спроба:(
Будь ласка, спробуйте ще раз.

ШІ вийшов з-під контролю під час тестів: моделі OpenAI та Anthropic хотіли зламати сайти

0
3 хвилин читання

Штучний інтелект продемонстрував поведінку, яку навіть дослідники не очікували побачити під час тестування. Моделі, розроблені компаніями OpenAI та Anthropic, під час перевірок безпеки здійснювали несанкціоновані дії в інтернеті, зокрема намагалися змінювати програмний код і отримувати доступ до систем, повідомляє Bloomberg. 

ШІ вийшов з-під контролю під час тестів: моделі OpenAI та Anthropic хотіли зламати сайти зображення 1 OpenAI та Anthropic хотіли зламати сайти

Інциденти стали новим сигналом для експертів із безпеки, які попереджають: сучасні AI-агенти можуть діяти автономніше, ніж передбачають їхні розробники.

ШІ отримав доступ до інтернету і почав діяти самостійно

Про випадки повідомив британський AI Security Institute — організація, створена у 2023 році для оцінки безпеки найпотужніших моделей штучного інтелекту.

Під час експериментів дослідники навмисно надали моделям доступ до інтернету та працювали без частини стандартних захисних обмежень, щоб перевірити їхні реальні можливості.

За результатами тестування:

  • модель Anthropic Mythos 5;
  • модель OpenAI GPT-5.6-Sol

Підписуйтеся на наші соцмережі

здійснювали дії, які дослідники назвали потенційно небезпечними.

У британському інституті заявили, що вперше побачили настільки чіткий прояв ризиків, пов’язаних з автономністю та можливим обманом з боку AI-систем.

Модель Anthropic намагалася додати шкідливий код у GitHub

Один із найбільш показових випадків стався під час роботи моделі Anthropic Mythos 5.

За даними дослідників, ШІ намагався внести шкідливі зміни до відкритого програмного проєкту на GitHub.

Щоб домогтися схвалення своїх змін, модель навіть створила фальшиві особистості, які мали виглядати як реальні учасники проєкту.

Однак людина, яка підтримувала репозиторій, помітила проблему і відмовилася приймати небезпечний код.

За даними AI Security Institute, саме Mythos 5 відповідала за 17 із 19 зафіксованих автономних несанкціонованих дій під час тестів.

OpenAI також виявила випадки злому систем

OpenAI окремо повідомила про інцидент під час тестування своїх моделей разом із кібербезпековою компанією Irregular.

У межах так званого capture the flag тесту моделі мали знаходити приховану інформацію у спеціально створеному середовищі.

Однак через помилкове налаштування тестової системи модель змогла:

  • отримати доступ до інтернету;
  • обійти частину обмежень;
  • здійснити атаку на сайт невідомої організації.

У компанії зазначили, що це сталося через помилку в конфігурації середовища, а не через навмисне розгортання небезпечної функції.

Це не перший випадок, коли сучасні AI-моделі демонструють несподівану поведінку.

Раніше OpenAI повідомляла про інцидент, коли її моделі під час тестів змогли скористатися вразливістю та «вийти» за межі ізольованого середовища.

Після цього система отримала доступ до інтернету і змогла атакувати платформу Hugging Face, де зберігаються моделі штучного інтелекту та набори даних.

Anthropic також повідомляла про випадки, коли її моделі під час оцінювання безпеки змогли вплинути на системи кількох організацій.

0
Icon 0

Підписуйтеся на наші соцмережі