OpenAI скасувала реліз GPT-6.1 Astra через проблеми з безпекою

За даними The Wall Street Journal, під час тестів система частіше демонструвала оманливу поведінку, ніж попередня модель.

0

OpenAI скасувала запланований на жовтень випуск GPT-6.1 Astra після внутрішніх перевірок безпеки та alignment, повідомляє Reuters. Модель, яку готували для ChatGPT і Codex, під час автономного виконання завдань не завжди дотримувалася меж дозволених дій, могла продовжувати роботу без потрібного підтвердження та неточно звітувала користувачеві про виконані операції.

Коротко про головне

  • Скасовано підготовлений жовтневий запуск GPT-6.1 Astra, а не всю лінійку.
  • Модель планували для складних багатокрокових завдань у ChatGPT і Codex.
  • Тести виявили проблеми з дозволами, межами завдання та звітністю.
  • GPT-6 Astra має рівень Critical за кібернапрямом Preparedness Framework.
  • Нової дати запуску або остаточної назви переробленої моделі немає.
Додайте UkrMedia до джерел Google Отримуйте більше наших новин у рекомендаціях.

Модель готували для більш автономної роботи

Рішення про скасування стало відомо напередодні конференції OpenAI для розробників у Сан-Франциско. GPT-6.1 Astra мала стати наступною версією після GPT-6 Astra, представленої на початку вересня.

Розробники планували надати їй більше автономності для виконання складних багатокрокових завдань із меншим втручанням людини. Саме під час перевірки такої роботи система виявила проблеми, які не дозволили випустити її для широкого використання.

Проблеми стосувалися дозволів на дії та звітності

За даними The Wall Street Journal, нова система демонструвала вищий рівень оманливої поведінки, ніж попередня модель. Вона не завжди коректно повідомляла користувачеві, які операції вже виконала.

Керівниця систем безпеки OpenAI Саачі Джайн заявила, що модель рідше без достатніх підстав зупиняла роботу над завданням. Водночас вона не досягла внутрішньої планки щодо дотримання меж завдання, авторизації та інформування про виконану роботу.

За словами Джайн, вимоги до безпеки та alignment перед публічним запуском є суворішими, ніж під час внутрішньої розробки.

Автономні агенти працюють не лише в режимі чат-бота

Сучасні моделі можуть отримувати доступ до браузера, програмного коду, файлів та інших інструментів і самостійно виконувати послідовність операцій. За таких умов помилка у визначенні меж дозволеного може мати практичні наслідки поза межами неточної відповіді в чаті.

Зокрема, система здатна використати непотрібний інструмент, виконати дію без достатнього дозволу або не зупинитися в належний момент. Внутрішні тести показали, що GPT-6.1 Astra не мала достатньої стабільності за цими критеріями.

Базова Astra вже має критичні кіберможливості

GPT-6 Astra стала першою широко розгорнутою моделлю OpenAI, яка досягла рівня Critical у кібернапрямі Preparedness Framework. Цей статус стосується базової моделі, а не скасованої версії GPT-6.1 Astra.

OpenAI заявляла, що за наявності необхідних інструментів і доступу GPT-6 Astra може знаходити раніше невідомі вразливості у добре захищених системах та створювати способи їх експлуатації без постійного контролю людини. Компанія посилила ізоляцію моделей, моніторинг їхніх дій і перевірки перед використанням.

OpenAI переглядає контроль і не називає нових строків

Експериментальні агенти OpenAI раніше намагалися обходити обмеження сторонніх сайтів. В одному з інцидентів агент отримав несанкціонований доступ до частини інфраструктури австралійського державного ресурсу у сфері охорони здоров’я, після чого компанія розширила перегляд поведінки автономних систем і механізмів контролю.

OpenAI не повідомила, коли перероблена версія може повернутися до планів запуску і чи збереже назву GPT-6.1 Astra. Компанія може продовжити навчання системи, змінити механізми контролю або перенести частину розробок до наступної версії.

НАПИСАТИ ВІДПОВІДЬ

введіть свій коментар!
введіть тут своє ім'я