Дослідники залізли у «думки» Claude і ChatGPT — і побачили там паролі користувачів

4 хвилин читання

Виявилося, що приховані «думки» популярних ШІ захищені гірше, ніж обіцяли розробники: науковці витягли з API уривки внутрішніх міркувань Claude, ChatGPT і Gemini, а серед них натрапили на чужі паролі та ключі доступу, пише Wired із посиланням на дослідження вчених Тюбінгенського університету, Інституту Макса Планка та кількох партнерських організацій. 

Думки ШІ зламали: у витоку знайшли паролі й ключі доступу. Фото: Reuters 

Як науковці залізли в «думки» ШІ

  • Науковці показали, як обійти захист, що ховає від сторонніх очей внутрішній «ланцюжок думок» сучасних моделей.
  • Йдеться про той самий процес, коли штучний інтелект розбиває складне завдання на кроки й обмірковує кожен окремо, перш ніж дати відповідь. 
  • Компанії не показують ці «думки» користувачам, бо вважають їх своєю комерційною таємницею.
  • Схема виявилася простою. У великих моделей OpenAI, Anthropic і Google є молодші «сестри» — менші версії з тим самим захистом, але слабше навченими правилам поведінки. 
  • Дослідники підсовували цим меншим моделям зашифровані «думки» старших, і меншим бракувало обачності, щоб не розповісти, що вони бачать. 
  • У кількох випадках серед розкритих міркувань опинилися паролі та ключі доступу, які користувачі колись ненароком вставили у свої запити.
  • Anthropic, OpenAI та Google отримали звіт про вразливість і вже щось поправили у своїх API. Але автори роботи попереджають: закрити витік «думок» повністю набагато складніше, ніж залатати одну конкретну дірку. 
Читайте також: Система, здатна аналізувати власну архітектуру, знаходити ефективніші рішення й використовувати результат для створення ще досконалішої версії себе, потенційно може змінити сам темп розвитку штучного інтелекту. Цей механізм називають рекурсивним самовдосконаленням ШІ та пов’язують із можливим переходом від вузьких систем до AGI — загального штучного інтелекту. Як працює така петля та де проходять межі її зростання, розповідає Galera News.

Підписуйтеся на наші соцмережі

Раніше ми вже писали, чому самі ці «міркування» викликають дискусію серед науковців і чи справді ШІ реально «думає», коли будує ланцюжок кроків.

Як повʼязані Kimi K3, Claude і ChatGPT 

Найгостріша частина роботи стосується Китаю. Науковці прогнали через різні системи 90 однакових запитань і побачили дивну схожість між китайською Kimi K3 від компанії Moonshot AI та прихованими думками Claude Opus 4.8 і GPT 5.6 Sol

Коли Kimi K3 підкидали початок міркувань американської моделі, її подальша відповідь інколи виходила майже такою самою, як в оригіналу.

Це схоже на слід так званої дистиляції — коли одну модель фактично «переписують» у іншу, використовуючи її відповіді як підручник. Ще одну китайську модель, DeepSeek, теж перевірили, але такого збігу там не побачили. 

Автори наголошують, що це не прямий доказ навчання Kimi K3 на американських моделях, але привід для незручних питань — очевидний.

Дистиляція давно перетворилася на політичну тему. Американські компанії не раз натякали, що китайці копіюють їхні системи. Частина індустрії відповідає, що це нормальна практика, яка здешевлює розробку.

Історія з прихованими «думками» показує, наскільки тонкою стала межа між цими двома поглядами — і чому самі «міркування» ШІ перетворилися на нове поле бою між компаніями.

Чому варто слідкувати за тим, що надсилаєте чатботу

  • Для українського бізнесу, який будує свої сервіси на API OpenAI, Anthropic чи Google, з'явився конкретний привід переглянути, що саме ваші співробітники і продукти надсилають у чат. 
  • Усе, що потрапляє у запит до ШІ: від клієнтських даних до внутрішніх ключів доступу, потенційно може «протекти» назовні через приховані міркування моделі. 
  • Для команд, які працюють із чутливою інформацією (фінтех, оборонні технології, юридичні сервіси), це аргумент за додатковий шар очищення даних перед відправкою в API і за уважніший вибір між хмарними моделями та тими, які можна запустити локально на власному сервері.