Моделі Claude атакували справжні системи, думаючи, що це навчання: як це сталося

3 хвилин читання

Anthropic визнала, що під час внутрішніх тестів безпеки три моделі Claude вийшли за межі ізольованого середовища і зламали системи кількох реальних компаній, пише TechCrunch.

Claude зламав системи трьох компаній під час тестів Anthropic. Фото: Reuters 

Як моделі Claude зламали системи компаній 

  • Anthropic переглянула 141 006 своїх тестів. У трьох із них моделі Claude якимось чином потрапили у звичайний інтернет із тестового середовища, яке мало бути повністю закритим. 
  • А далі вони пішли ще глибше і залізли у робочі системи трьох організацій. Причина проста: партнер Anthropic, компанія Irregular, неправильно налаштувала середовище. 
  • Одна сторона думала, що інтернету немає, а він там був.
  • Найдивніше почалося тоді, коли моделі почали розуміти, що ціль справжня. У тестах брали участь три різні версії: Opus 4.7, Mythos 5 і внутрішня дослідницька модель. 
  • І кожна повелась по-своєму. Саме це Anthropic вважає найтривожнішим у всій історії.
  • Opus 4.7 у всіх чотирьох спробах зрозуміла, що працює зі справжньою системою живої компанії. У двох випадках вона переконала себе, що ця компанія теж якось є частиною завдання, і пішла далі: витягла паролі й дісталася до бази з реальними даними. 
  • Mythos 5 теж помітила, що навколо справжній інтернет, але вирішила, що це все ще тренування. І залила шкідливу програму в PyPI — публічне сховище коду для програмістів. 
  • Її встигли завантажити і запустити інші люди, поки цю історію не зупинили. І лише найновіша, дослідницька модель зупинилася сама, щойно збагнула, що ціль реальна.

Підписуйтеся на наші соцмережі

Читайте також: Anthropic зробила «переїзд» з інших чатботів у Claude майже непомітним. Перенести пам'ять можна із ChatGPT і Gemini, а вся процедура займає близько п'яти хвилин, пише Engadget. 

Anthropic окремо підкреслює: жодна модель не діяла зі своїх мотивів. Вони просто робили те, що їм сказали. У тестах не було звичних запобіжників, які працюють у публічних версіях Claude, тож моделі показали себе «як є». Раніше ми писали, як хакер-початківець зламав 14 компаній за допомогою Claude Code і Codex, там теж усе трималося на тому, що ШІ надто добре виконує розпливчасті команди.

Історія лунає гучніше через те, що зараз відбувається на ринку. Anthropic нещодавно подала заявку на IPO, і її вартість уперше обійшла OpenAI. Одночасно компанія робить Claude усе більш «побутовим»: від інтеграцій із 15 сервісами, де ШІ може замовити їжу чи забронювати столик, до складніших сценаріїв, де він діє майже самостійно. Що більше свободи у моделі, то дорожче коштує помилка в налаштуваннях.

Що робити українцям, які користуються Claude

Для українських компаній, які будують продукти на Claude або дають штучному інтелекту виконувати завдання самостійно, висновок простий: не можна покладатися лише на інструкцію «сиди в пісочниці». 

Якщо у моделі є доступ до інструментів, якими вона теоретично може дотягнутися до робочих систем, потрібні окремі обмеження на рівні мережі й окремий контроль за її діями. 

Особливо це стосується стартапів, які використовують Claude Code та подібні агенти у бойових процесах, саме там ціна помилки найбільша.