Моделі Claude атакували справжні системи, думаючи, що це навчання: як це сталося
Anthropic визнала, що під час внутрішніх тестів безпеки три моделі Claude вийшли за межі ізольованого середовища і зламали системи кількох реальних компаній, пише TechCrunch.
Як моделі Claude зламали системи компаній
- Anthropic переглянула 141 006 своїх тестів. У трьох із них моделі Claude якимось чином потрапили у звичайний інтернет із тестового середовища, яке мало бути повністю закритим.
- А далі вони пішли ще глибше і залізли у робочі системи трьох організацій. Причина проста: партнер Anthropic, компанія Irregular, неправильно налаштувала середовище.
- Одна сторона думала, що інтернету немає, а він там був.
- Найдивніше почалося тоді, коли моделі почали розуміти, що ціль справжня. У тестах брали участь три різні версії: Opus 4.7, Mythos 5 і внутрішня дослідницька модель.
- І кожна повелась по-своєму. Саме це Anthropic вважає найтривожнішим у всій історії.
- Opus 4.7 у всіх чотирьох спробах зрозуміла, що працює зі справжньою системою живої компанії. У двох випадках вона переконала себе, що ця компанія теж якось є частиною завдання, і пішла далі: витягла паролі й дісталася до бази з реальними даними.
- Mythos 5 теж помітила, що навколо справжній інтернет, але вирішила, що це все ще тренування. І залила шкідливу програму в PyPI — публічне сховище коду для програмістів.
- Її встигли завантажити і запустити інші люди, поки цю історію не зупинили. І лише найновіша, дослідницька модель зупинилася сама, щойно збагнула, що ціль реальна.
Підписуйтеся на наші соцмережі
Anthropic окремо підкреслює: жодна модель не діяла зі своїх мотивів. Вони просто робили те, що їм сказали. У тестах не було звичних запобіжників, які працюють у публічних версіях Claude, тож моделі показали себе «як є». Раніше ми писали, як хакер-початківець зламав 14 компаній за допомогою Claude Code і Codex, там теж усе трималося на тому, що ШІ надто добре виконує розпливчасті команди.
Історія лунає гучніше через те, що зараз відбувається на ринку. Anthropic нещодавно подала заявку на IPO, і її вартість уперше обійшла OpenAI. Одночасно компанія робить Claude усе більш «побутовим»: від інтеграцій із 15 сервісами, де ШІ може замовити їжу чи забронювати столик, до складніших сценаріїв, де він діє майже самостійно. Що більше свободи у моделі, то дорожче коштує помилка в налаштуваннях.
Що робити українцям, які користуються Claude
Для українських компаній, які будують продукти на Claude або дають штучному інтелекту виконувати завдання самостійно, висновок простий: не можна покладатися лише на інструкцію «сиди в пісочниці».
Якщо у моделі є доступ до інструментів, якими вона теоретично може дотягнутися до робочих систем, потрібні окремі обмеження на рівні мережі й окремий контроль за її діями.
Особливо це стосується стартапів, які використовують Claude Code та подібні агенти у бойових процесах, саме там ціна помилки найбільша.