Вразливість у «думках» ШІ: дослідники витягли паролі з Claude, ChatGPT і Gemini

Науковці продемонстрували, як можна обійти захист внутрішніх міркувань популярних ШІ-моделей. У розкритих даних опинилися паролі та ключі доступу користувачів, що ставить питання про безпеку API.
Група дослідників з Тюбінгенського університету, Інституту Макса Планка та партнерських організацій виявила спосіб витягувати приховані «ланцюжки думок» з таких моделей, як Claude від Anthropic, ChatGPT від OpenAI та Gemini від Google. Ці внутрішні міркування, які компанії тримають у секреті, вважаючи комерційною таємницею, виявилися доступними через молодші версії моделей.
Суть атаки полягає в тому, що менші моделі, які мають той самий захист, але слабше навчені правилам поведінки, не змогли встояти перед спокусою розповісти про те, що бачать. Дослідники підсовували їм зашифровані «думки» старших моделей, і ті розкривали їх зміст. У кількох випадках серед розкритих міркувань опинилися паролі та ключі доступу, які користувачі ненароком вставляли у свої запити.
Найрезонансніша частина дослідження стосується китайської моделі Kimi K3 від Moonshot AI. Науковці прогнали через різні системи 90 однакових запитань і помітили дивну схожість між відповідями Kimi K3 та прихованими міркуваннями Claude Opus 4.8 і GPT 5.6 Sol. Коли Kimi K3 отримувала початок міркувань американської моделі, її відповіді часто майже повністю збігалися з оригіналом. Це може свідчити про дистиляцію — процес, коли одну модель фактично навчають на відповідях іншої. Перевірка DeepSeek такого збігу не виявила.
Автори підкреслюють, що це не прямий доказ копіювання, але привід для питань. Дистиляція давно стала політичною темою: американські компанії звинувачують китайських конкурентів у копіюванні, а частина індустрії вважає це нормальною практикою, що здешевлює розробку.
Anthropic, OpenAI та Google вже отримали звіт про вразливість і вжили заходів у своїх API. Однак дослідники попереджають, що повністю закрити витік «думок» значно складніше, ніж виправити одну конкретну дірку.
Для українського бізнесу, який використовує API цих компаній, це привід переглянути, які дані потрапляють у запити. Усе, що надсилається до ШІ — від клієнтської інформації до внутрішніх ключів доступу, — потенційно може просочитися назовні. Для команд, що працюють з чутливими даними (фінтех, оборонні технології, юридичні сервіси), це аргумент на користь додаткового очищення даних перед відправкою в API та розгляду локальних моделей, які можна запускати на власних серверах.
Читайте також
Ще в розділі «Дослідження»
- Нафта дорожчає: переговори США та Ірану зайшли в глухий кут
- Кава подовжує життя: знайдено механізм, і він не пов'язаний з кофеїном
- Останки Євгена Коновальця після повернення дослідять на КТ та МРТ
- Смертельна ДТП у Хмельницькому: підозрюваного відправили на психіатричну експертизу
- Новий ефект у телуриді марганцю: контроль електроніки без нагріву







