Модель OpenAI GPT-6 Astra під час експерименту Andon Labs самостійно створила код для дрона, який у контрольованому офісі знайшов задану людину за фотографією та рухався за нею. За даними лабораторії, в одній зі спроб система перевершила людський базовий результат на всіх етапах тесту Drone-Bench, однак її типова надійність лишається низькою.
Коротко про головне
- Astra створила код для пошуку та супроводу людини дроном.
- Модель пройшла п’ять завдань Drone-Bench вище людського базового результату хоча б один раз.
- Повний ланцюжок завдань у середньому вдавалося завершити з імовірністю 2,8%.
- Тест перевіряє роботу коду через інтерфейс дрона, а не ШІ всередині апарата.
- Andon Labs планує ускладнювати сценарії та оцінювати пов’язані ризики.
Модель написала код для польоту в офісному сценарії
Дослідники поставили Astra завдання знайти конкретну людину та слідувати за нею. Модель мала перетворити дані з камери й доступні програмні інструменти на робоче керування: дрон переміщувався офісом, визначав ціль за еталонним знімком і тримав її в полі зору.
Йдеться не про автономний інтелект, вбудований у квадрокоптер. У Drone-Bench агент створює та виправляє код, а літальний апарат виконує його через програмний інтерфейс.
Що саме вимірює Drone-Bench
Бенчмарк розкладає наскрізне завдання на п’ять технічних компонентів. За повідомленням Andon Labs, Astra стала першою моделлю, яка хоча б в одному запуску перевершила людський базовий результат у кожному з них. Цей базовий рівень не є порівнянням із професійними системами спостереження чи промисловими безпілотниками.
Агент у тесті може подавати до десяти версій рішення, отримувати оцінку та доопрацьовувати код. Такий швидкий зворотний зв’язок робить середовище зручнішим для налагодження, ніж непідготовлений реальний простір.
- Реконструкція: створення 3D-моделі офісу та карти перешкод.
- Локалізація: визначення позиції дрона на створеній карті.
- Навігація: побудова маршруту до потрібного приміщення.
- Виявлення: пошук людини за еталонною фотографією.
- Супровід: утримання людини в полі зору під час руху.
Одиничний успіх не означає стабільної автономності
Середній запуск Astra мав лише 2,8% імовірності пройти весь ланцюжок від початку до кінця. Найскладнішими компонентами залишилися реконструкція середовища та надійне виявлення людини. Помилка в тривимірній карті може дати хибне уявлення про перешкоди й завадити безпечному плануванню маршруту.
Тому найкращий результат показує потенційну можливість моделі, але не її готовність стабільно діяти без контролю людини. Випробування відбувалося в офісі на низьковартісному дроні; переносити висновки на реальні системи стеження або військове застосування було б некоректно.
Лабораторія пропонує вимірювати ризики до розгортання систем
Andon Labs створила Drone-Bench для раннього відстеження того, як мовні моделі набувають можливостей фізичного спостереження. Дослідники попереджають, що доступ ШІ до реальних пристроїв може створити ризики зловживань, а межі допустимого застосування мають обговорюватися не лише лабораторіями.
Автори планують зробити Drone-Bench складнішим і ближчим до реальних сценаріїв.







