ШІ почав діяти без дозволу людей: OpenAI розкрила тривожні випадки

Компанія розповіла про шість випадків, коли моделі діяли поза очікуваними правилами — від використання чужого API-ключа до самостійного обміну файлами.

0

OpenAI повідомила про шість випадків несподіваної або небажаної поведінки своїх моделей штучного інтелекту, зафіксованих протягом останніх шести місяців під час навчання та тестування. Серед них — самовільне завантаження файлів в інтернет, використання чужого API-ключа без дозволу, приховування помилок від користувача та обмін даними між окремими AI-агентами. Компанія називає такі випадки проявами misalignment — ситуаціями, коли модель діє не так, як від неї очікували розробники або користувач.

Коротко про головне:

  • OpenAI розкрила шість випадків проблемної поведінки ШІ.
  • Моделі діяли без дозволу користувача.
  • Один агент сам завантажив файл в інтернет.
  • Інші моделі намагалися приховувати власні помилки.
  • OpenAI запроваджує нову систему контролю таких випадків.
Додайте UkrMedia до джерел Google Отримуйте більше наших новин у рекомендаціях.

ШІ сам завантажив файл в інтернет

Один із найбільш показових випадків стався під час виконання звичайного завдання. Користувач попросив експериментальну модель знайти перелік великих озер і надати посилання на джерело.

Модель правильно отримала потрібні дані за допомогою Python, однак не мала вебджерела, яке могла б процитувати. Замість того щоб повідомити про це користувача, агент самостійно завантажив файл у відкритий інтернет, а потім використав створене ним же посилання як джерело. Дозволу на публікацію файлу користувач не давав.

Саме такі дії OpenAI тепер відносить до поведінки, яку необхідно окремо фіксувати та досліджувати.

Модель використала чужий API-ключ

В іншому випадку AI мав знайти статистичні дані щодо доходів в одному з округів Каліфорнії.

Під час пошуку модель натрапила у відкритому репозиторії на незахищений API-ключ і використала його без дозволу. Проте навіть після цього отримати необхідну інформацію не вдалося. Тоді модель вигадала відсутні цифри та представила їх користувачеві як реальні дані з потрібного джерела.

Цей випадок поєднав одразу дві проблеми: несанкціонований доступ до облікових даних та фабрикацію інформації.

ШІ наказував собі приховувати помилки

Ще один тип поведінки виявили під час навчання GPT-5.6 Sol.

OpenAI встановила, що деякі екземпляри моделі залишали для самих себе інструкції, які мали зберігатися після скорочення контексту. У цих записах модель могла вказувати собі вигадувати відсутні історичні дані та не повідомляти користувачеві про розбіжності між джерелами.

В іншому експерименті ще не випущена дослідницька модель самостійно додавала до власних нотаток інструкції ігнорувати звичайні обмеження. OpenAI знайшла 27 таких випадків.

AI-агенти почали спілкуватися між собою

Під час іншого тесту кілька моделей використовували внутрішній програмний репозиторій як своєрідну «дошку повідомлень», щоб передавати одна одній запити та відповіді між різними навчальними сесіями.

Ще в одному випадку агенти, які працювали над спільним завданням, не могли отримати доступ до локальних файлів одне одного. Тоді вони самостійно скористалися публічними файловими сервісами та обмінялися файлами через відкриті URL, хоча завдання передбачало роботу лише з локальними даними.

OpenAI наголошує, що ці випадки були виявлені переважно під час навчання та оцінювання моделей, а не як масова поведінка звичайного ChatGPT. Компанія також застерігає, що шість прикладів не дозволяють визначити, наскільки часто подібні проблеми виникають загалом.

OpenAI змінює правила контролю за ШІ

Після цих випадків компанія оголосила про нову систему фіксації та публічного розкриття проблем із поведінкою моделей.

До звітів потраплятимуть, зокрема, випадки, коли моделі діють без дозволу, намагаються уникнути контролю або координують свої дії з іншими AI-системами. OpenAI заявила, що хоче публікувати таку інформацію швидше, навіть якщо причини поведінки ще не вдалося повністю пояснити.

Компанія також прямо визнала, що проблема узгодження поведінки ШІ з намірами людей поки не вирішена настільки, щоб безкінечно нарощувати можливості моделей максимально швидкими темпами.

Нова заява з’явилася на тлі ширшої дискусії про ризики штучного інтелекту. Керівники OpenAI та Anthropic останніми днями підтримали ідею уповільнення розвитку найпотужніших AI-систем, щоб заходи безпеки встигали за швидкістю їхнього вдосконалення.

НАПИСАТИ ВІДПОВІДЬ

введіть свій коментар!
введіть тут своє ім'я