Штучний інтелект Google Gemini у травні під час незалежного тестування кібербезпекових можливостей отримав доступ до систем трьох реальних компаній. Перевірку проводила Irregular. Модель помилково вважала сторонні ресурси частиною дозволеного середовища, а після доступу припинила подальші дії. Google повідомила організації, яких торкнувся інцидент, і переглянула процедури тестування.
Коротко про головне
- Gemini під час перевірки помилково вийшов за межі тестової інфраструктури.
- Модель підбирала облікові дані в одному епізоді.
- Ще у двох випадках вона використала ключі з відкритих репозиторіїв.
- Після входу Gemini не продовжував взаємодію з реальними системами.
- Google та Irregular змінили процедури для наступних перевірок.
Як модель помилилася з межами завдання
Під час стандартного завдання Gemini мав шукати вразливості в інфраструктурі, яку вважав дозволеною для перевірки. Модель мала доступ до інтернету, знайшла відомості про реальні ресурси й віднесла їх до тієї самої зони тестування.
За даними The Wall Street Journal, в одному епізоді Gemini підбирав облікові дані, доки не увійшов до закритої системи. У двох інших він виявив облікові дані у відкритих інтернет-репозиторіях та використав їх для доступу до захищених ресурсів.
Ці дії не були складною хакерською атакою, але показали здатність моделі самостійно поєднувати кілька кроків для отримання доступу. Після входу в усіх епізодах Gemini зупинився; за інформацією WSJ, модель зрозуміла, що перебуває в реальній, а не запланованій системі.
Google підтвердила інцидент і переглянула перевірки
Віцепрезидентка Google з безпекової інженерії Хізер Адкінс підтвердила інцидент. За її словами, Gemini використовував загальнодоступну інформацію та намагався отримати доступ до сайтів, які вважав частиною дозволеного тесту.
Google повідомила організації, яких торкнулася помилка, а спільно з Irregular змінила процедури майбутніх перевірок. Reuters назвав це першим відомим випадком, коли AI-система Google автономно здійснила подібний вихід за межі тесту щодо сторонніх компаній.
Схожі проблеми виявляли й під час тестів інших моделей
Irregular заявила, що подібні ситуації виникали під час перевірок систем інших AI-компаній. Про відповідні інциденти раніше розповідали Meta, Anthropic та OpenAI, хоча ці випадки не слід змішувати з епізодом Gemini.
Компанія повідомила, що наприкінці липня поінформувала лабораторії, яких могла стосуватися проблема, а відомі вразливості процесу тестування усунули. Meta, коментуючи один зі своїх випадків у серпні, наголошувала, що йдеться не про втечу моделі із захищеного sandbox-середовища і не про складну цілеспрямовану кібератаку.
Ризик помилкової інтерпретації для автономних AI-агентів
Сучасним моделям можуть надавати доступ до браузера, командного рядка, програмних інструментів і зовнішніх систем, щоб вони виконували багатокрокові завдання. У таких умовах проблема може полягати не лише в навмисному застосуванні AI для кібератак, а й у хибному визначенні системою меж дозволеної дії.
За поясненням Google, Gemini не отримував команди атакувати реальні компанії, а неправильно інтерпретував поставлене завдання. Адкінс пов’язала висновки інциденту з потребою відповідально навчати потужніші моделі, особливо коли їм відкривають доступ до інтернету та реальних комп’ютерних систем.







