Gemini вийшов за межі тесту і зламав три компанії

Модель помилково віднесла реальні ресурси до дозволеної тестової зони. Google повідомила організації та змінила процедури перевірок разом з Irregular.

Штучний інтелект Google Gemini у травні під час незалежного тестування кібербезпекових можливостей отримав доступ до систем трьох реальних компаній. Перевірку проводила Irregular. Модель помилково вважала сторонні ресурси частиною дозволеного середовища, а після доступу припинила подальші дії. Google повідомила організації, яких торкнувся інцидент, і переглянула процедури тестування.

Коротко про головне

  • Gemini під час перевірки помилково вийшов за межі тестової інфраструктури.
  • Модель підбирала облікові дані в одному епізоді.
  • Ще у двох випадках вона використала ключі з відкритих репозиторіїв.
  • Після входу Gemini не продовжував взаємодію з реальними системами.
  • Google та Irregular змінили процедури для наступних перевірок.
Додайте UkrMedia до джерел Google Отримуйте більше наших новин у рекомендаціях.

Як модель помилилася з межами завдання

Під час стандартного завдання Gemini мав шукати вразливості в інфраструктурі, яку вважав дозволеною для перевірки. Модель мала доступ до інтернету, знайшла відомості про реальні ресурси й віднесла їх до тієї самої зони тестування.

За даними The Wall Street Journal, в одному епізоді Gemini підбирав облікові дані, доки не увійшов до закритої системи. У двох інших він виявив облікові дані у відкритих інтернет-репозиторіях та використав їх для доступу до захищених ресурсів.

Ці дії не були складною хакерською атакою, але показали здатність моделі самостійно поєднувати кілька кроків для отримання доступу. Після входу в усіх епізодах Gemini зупинився; за інформацією WSJ, модель зрозуміла, що перебуває в реальній, а не запланованій системі.

Google підтвердила інцидент і переглянула перевірки

Віцепрезидентка Google з безпекової інженерії Хізер Адкінс підтвердила інцидент. За її словами, Gemini використовував загальнодоступну інформацію та намагався отримати доступ до сайтів, які вважав частиною дозволеного тесту.

Google повідомила організації, яких торкнулася помилка, а спільно з Irregular змінила процедури майбутніх перевірок. Reuters назвав це першим відомим випадком, коли AI-система Google автономно здійснила подібний вихід за межі тесту щодо сторонніх компаній.

Схожі проблеми виявляли й під час тестів інших моделей

Irregular заявила, що подібні ситуації виникали під час перевірок систем інших AI-компаній. Про відповідні інциденти раніше розповідали Meta, Anthropic та OpenAI, хоча ці випадки не слід змішувати з епізодом Gemini.

Компанія повідомила, що наприкінці липня поінформувала лабораторії, яких могла стосуватися проблема, а відомі вразливості процесу тестування усунули. Meta, коментуючи один зі своїх випадків у серпні, наголошувала, що йдеться не про втечу моделі із захищеного sandbox-середовища і не про складну цілеспрямовану кібератаку.

Ризик помилкової інтерпретації для автономних AI-агентів

Сучасним моделям можуть надавати доступ до браузера, командного рядка, програмних інструментів і зовнішніх систем, щоб вони виконували багатокрокові завдання. У таких умовах проблема може полягати не лише в навмисному застосуванні AI для кібератак, а й у хибному визначенні системою меж дозволеної дії.

За поясненням Google, Gemini не отримував команди атакувати реальні компанії, а неправильно інтерпретував поставлене завдання. Адкінс пов’язала висновки інциденту з потребою відповідально навчати потужніші моделі, особливо коли їм відкривають доступ до інтернету та реальних комп’ютерних систем.

НАПИСАТИ ВІДПОВІДЬ

введіть свій коментар!
введіть тут своє ім'я