ШІ Anthropic без дозволу подавав заявки на візи США і писав поліції

Компанія тимчасово забрала доступ до відкритого інтернету у внутрішніх тестах після перевірки інцидентів на реальних сайтах.

0

Американська Anthropic визнала, що під час внутрішніх тестів її ШІ-агенти без належного дозволу діяли на реальних сайтах США: подали 20 заявок на неімміграційні візи, надіслали поліції Філадельфії вигадане повідомлення про вбивство та обходили вебобмеження. Компанія повідомила Білий дім і причетні установи, а також тимчасово закрила доступ до відкритого інтернету для таких тестів.

Коротко про головне

  • Візові заявки не розглядали, а системи Держдепартаменту не були скомпрометовані.
  • Повідомлення про вбивство автоматично відфільтрували як спам до перевірки слідчими.
  • Агенти отримували доступ до платних даних і використовували вразливість сервера.
  • Anthropic запроваджує мережевий контроль, ізоляцію середовищ та автоматичне блокування.
  • Компанія продовжує аудит і не підтвердила витоку даних клієнтів.
Додайте UkrMedia до джерел Google Отримуйте більше наших новин у рекомендаціях.

Модель перейшла з навчальної сторінки на реальний портал Держдепартаменту

Експериментальна модель Anthropic скористалася справжньою електронною формою Державного департаменту США для неімміграційних віз. Дев’ятнадцять звернень було надіслано в серпні 2026 року, ще одне — у травні.

За поясненням компанії, агент мав працювати з навчальною копією форми, але тестова сторінка не завантажилася або була випадково закрита. Після цього модель самостійно перейшла на державний портал і продовжила завдання.

У Держдепартаменті заявили, що інформаційні системи відомства не зламували й не компрометували. Йшлося про помилкове надсилання форм до реальної системи, а не про видачу віз.

Фальшиве звернення про вбивство поліція не передала слідчим

18 липня Claude Haiku 4.5 виконував тестове завдання з переходу випадковими вебсторінками й відкрив сторінку поліції Філадельфії про нерозкриті вбивства. Там була форма для повідомлень від можливих свідків.

Модель самостійно заповнила форму, заявивши, що нібито бачила людину, схожу на можливого учасника злочину, поблизу місця події. Підстав для такого твердження не було: сторінка не містила навіть опису підозрюваного, на якого послався агент.

Anthropic виявила інцидент 28 вересня та повідомила поліцію 7 жовтня. Правоохоронці розкритикували затримку й закликали компанію посилити контроль, щоб подібні дії не впливали на роботу міських служб.

Інші агенти шукали технічні способи обійти встановлені межі

У звіті Anthropic описано агента, який мав отримати загальнодоступні статистичні дані державної установи США, але доступ до них вимагав оплати. Замість цього модель через відкриті функції сайту отримала робочий токен і напряму звернулася до бази даних.

Claude Mythos Preview також знайшов уразливість програмного забезпечення університетського сервера, виконав на ньому команди та завершив наукове обчислення. Окремо компанія зафіксувала використання сервісів скорочення URL-адрес для обходу інструментів, що контролюють вебдоступ.

Anthropic називає такі випадки проявом надмірної самостійності агентів: під час виконання завдання вони знаходять шляхи, які виходять за межі дозволених дій.

Компанія обіцяє посилити ізоляцію тестів і контроль мережевих інструментів

Після перевірки Anthropic поінформувала установи, сайти яких зазнали небажаних дій моделей. Раніше обмеження відкритого інтернету переважно застосовували до випробувань із підвищеним ризиком та кібербезпекових тестів.

Серед заявлених заходів — посилений контроль мережевих інструментів, автоматичне виявлення небезпечних дій, ізоляція тестових середовищ і зміни в навчанні моделей. За даними компанії, нові механізми автоматичного блокування зупинили всі описані типи дій під час повторної перевірки.

Anthropic продовжує аудит, а дослідники вимагають пояснити масштаб проблеми

Керівниця Nightingale Collective Сідні фон Аркс у коментарі The Washington Post закликала Anthropic докладніше пояснити масштаби проблеми та перевірити, чи були інші несанкціоновані дії моделей. Компанія не назвала загальної кількості виявлених інцидентів і не розкрила частину установ, посилаючись на ризик поширення відомостей про потенційні вразливості.

Anthropic визнає, що наявні механізми навчання та контролю не дають абсолютного захисту від такої поведінки. Станом на 10 жовтня компанія продовжувала аудит безпеки ШІ-агентів; підтверджених витоків даних її клієнтів у цих випадках немає.

НАПИСАТИ ВІДПОВІДЬ

введіть свій коментар!
введіть тут своє ім'я