Дрон із кодом від GPT-6 Astra сам знайшов потрібну людину

Drone-Bench перевіряє, чи може ШІ писати й налагоджувати код для керування дроном через програмний інтерфейс, а не працювати на борту апарата.

0

Модель OpenAI GPT-6 Astra під час експерименту Andon Labs самостійно створила код для дрона, який у контрольованому офісі знайшов задану людину за фотографією та рухався за нею. За даними лабораторії, в одній зі спроб система перевершила людський базовий результат на всіх етапах тесту Drone-Bench, однак її типова надійність лишається низькою.

Коротко про головне

  • Astra створила код для пошуку та супроводу людини дроном.
  • Модель пройшла п’ять завдань Drone-Bench вище людського базового результату хоча б один раз.
  • Повний ланцюжок завдань у середньому вдавалося завершити з імовірністю 2,8%.
  • Тест перевіряє роботу коду через інтерфейс дрона, а не ШІ всередині апарата.
  • Andon Labs планує ускладнювати сценарії та оцінювати пов’язані ризики.

Модель написала код для польоту в офісному сценарії

Дослідники поставили Astra завдання знайти конкретну людину та слідувати за нею. Модель мала перетворити дані з камери й доступні програмні інструменти на робоче керування: дрон переміщувався офісом, визначав ціль за еталонним знімком і тримав її в полі зору.

Йдеться не про автономний інтелект, вбудований у квадрокоптер. У Drone-Bench агент створює та виправляє код, а літальний апарат виконує його через програмний інтерфейс.

Що саме вимірює Drone-Bench

Бенчмарк розкладає наскрізне завдання на п’ять технічних компонентів. За повідомленням Andon Labs, Astra стала першою моделлю, яка хоча б в одному запуску перевершила людський базовий результат у кожному з них. Цей базовий рівень не є порівнянням із професійними системами спостереження чи промисловими безпілотниками.

Агент у тесті може подавати до десяти версій рішення, отримувати оцінку та доопрацьовувати код. Такий швидкий зворотний зв’язок робить середовище зручнішим для налагодження, ніж непідготовлений реальний простір.

  • Реконструкція: створення 3D-моделі офісу та карти перешкод.
  • Локалізація: визначення позиції дрона на створеній карті.
  • Навігація: побудова маршруту до потрібного приміщення.
  • Виявлення: пошук людини за еталонною фотографією.
  • Супровід: утримання людини в полі зору під час руху.

Одиничний успіх не означає стабільної автономності

Середній запуск Astra мав лише 2,8% імовірності пройти весь ланцюжок від початку до кінця. Найскладнішими компонентами залишилися реконструкція середовища та надійне виявлення людини. Помилка в тривимірній карті може дати хибне уявлення про перешкоди й завадити безпечному плануванню маршруту.

Тому найкращий результат показує потенційну можливість моделі, але не її готовність стабільно діяти без контролю людини. Випробування відбувалося в офісі на низьковартісному дроні; переносити висновки на реальні системи стеження або військове застосування було б некоректно.

Лабораторія пропонує вимірювати ризики до розгортання систем

Andon Labs створила Drone-Bench для раннього відстеження того, як мовні моделі набувають можливостей фізичного спостереження. Дослідники попереджають, що доступ ШІ до реальних пристроїв може створити ризики зловживань, а межі допустимого застосування мають обговорюватися не лише лабораторіями.

Автори планують зробити Drone-Bench складнішим і ближчим до реальних сценаріїв.

 

НАПИСАТИ ВІДПОВІДЬ

введіть свій коментар!
введіть тут своє ім'я