Griffin пройшов «відео-тест Тюрінга»: що вміє новий AI

Griffin реагує на паузи, перебивання, міміку та жести в реальному часі, але Tavus поки обмежує доступ через ризик введення людей в оману.

0

Компанія Tavus представила Griffin-Lite — експериментальну AI-модель для відеорозмов у реальному часі, яка одночасно бачить співрозмовника, слухає його, говорить і генерує власну міміку та рухи. У проведеному компанією дослідженні після хвилинної відеорозмови 26 із 54 учасників — 48% — вирішили, що спілкувалися з реальною людиною. Tavus називає це першим проходженням «відео-тесту Тюрінга», хоча йдеться про власний експеримент компанії з невеликою вибіркою, а не про універсальний стандарт оцінювання штучного інтелекту.

Коротко про головне

  • 26 із 54 учасників тесту Tavus вирішили, що Griffin-Lite був реальною людиною.
  • У попередньої системи компанії цей показник становив лише 1 із 41 учасника.
  • Griffin одночасно обробляє відео й аудіо та продовжує слухати, навіть коли сам говорить.
  • Модель може реагувати кивками, короткими репліками, жестами та зупинятися, коли її перебивають.
Додайте UkrMedia до джерел Google Отримуйте більше наших новин у рекомендаціях.

48% учасників вирішили, що говорили з людиною

Tavus провела експеримент серед учасників зі США та Європи, яких набрали через незалежну дослідницьку платформу. Людям повідомили, що їх з’єднають з іншим учасником для хвилинної відеорозмови про те, чого вони найбільше очікують цього року. Насправді їхнім співрозмовником був AI-персонаж, який працював на Griffin-Lite.

Лише після завершення розмови учасників запитали, чи виникала в них думка, що співрозмовник може бути штучним інтелектом. 26 із 54 людей назвали його реальною людиною. Ті, хто повірив у людського співрозмовника, в середньому були впевнені у своїй відповіді на 79%. Серед тих, хто розпізнав AI, впевненість становила 81%.

Для порівняння, попередня система Tavus Phoenix-4.5 за аналогічного протоколу переконала лише 1 із 41 учасника — 2,4%. Таким чином, за власними тестами компанії, різниця між двома поколіннями систем виявилася дуже значною.

Головна зміна — AI більше не чекає своєї черги

Більшість голосових AI-систем працюють послідовно: людина говорить, система визначає завершення репліки, обробляє її, формує відповідь і лише після цього починає говорити. Саме затримки та неприродні паузи часто видають машину.

Griffin побудований інакше. Tavus називає його full-duplex video-to-video model: модель продовжує бачити й чути людину навіть у той момент, коли сама відповідає. Вона може вставити коротке «мм-гм», поки співрозмовник ще говорить, відреагувати мімікою на почуте, зробити паузу або негайно замовкнути, якщо її перебили.

Модель також аналізує не лише слова. Вона враховує паузи, вираз обличчя, погляд та рухи, а потім сама генерує обличчя, голос, жести, руки й навіть фон відеокадру в реальному часі. За даними Tavus, у Griffin кожен кадр генерується моделлю, а не накладається на заздалегідь записане відео.

NVIDIA також поставила Griffin вище конкурентів

Результати Tavus не обмежуються внутрішнім експериментом. Griffin-Lite також з’явився у незалежному бенчмарку VideoFDB, створеному дослідниками NVIDIA для оцінювання повнодуплексних аудіовізуальних AI-систем.

У тесті на сприйняття Griffin отримав загальну оцінку 3,73 бала з 5, тоді як людський еталон — 4,20. Серед протестованих систем це був найкращий результат. У генерації власної аудіовізуальної відповіді Griffin набрав 3,83 бала, лише на 0,09 нижче людського еталона у 3,92.

VideoFDB оцінює не просто якість голосу чи зображення. Benchmark перевіряє, чи розуміє модель, коли потрібно мовчати, реагувати на погляд, сміх, емоцію або паузу, а також чи правильно генерує невербальні сигнали під час розмови. У наборі використовуються 237 фрагментів реальних відеодзвінків та 11 типів розмовної поведінки.

Чи справді Griffin «пройшов тест Тюрінга»

Тут важливе уточнення. Формулювання «перший AI, який пройшов відео-тест Тюрінга» належить самій Tavus. Компанія визначає проходження тесту як ситуацію, коли достатня частка людей після короткого відеодзвінка не може відрізнити модель від людини.

Однак це не означає, що Griffin пройшов якийсь загальновизнаний універсальний тест на людський інтелект. Дослідження Tavus мало лише 54 учасники, тривалість кожної розмови становила одну хвилину, а сам експеримент організувала компанія-розробник. Незалежні огляди тому радять сприймати 48% як цікавий результат конкретного експерименту, а не остаточний доказ того, що AI став невідрізним від людини в будь-якій відеорозмові.

Тим не менш різниця між 2,4% у попередньої системи та 48% у Griffin показує, наскільки швидко змінюється саме соціальна правдоподібність AI — здатність машини не лише правильно відповідати, а поводитися в розмові так, як очікує людина.

Tavus поки не дає Griffin звичайним користувачам

Компанія визнає, що технологія створює очевидні ризики. Якщо AI може переконати людину, що перед нею справжній співрозмовник, ті самі можливості можуть використовуватися для шахрайства, маніпуляцій або створення надзвичайно переконливих цифрових персонажів.

Через це Griffin-Lite поки не доступний клієнтам Tavus. Доступ до дослідницької версії має лише обмежена група перевірених тестувальників. Компанія заявляє, що працює над механізмами чіткого розкриття того, що користувач взаємодіє з AI, та іншими заходами безпеки перед ширшим запуском.

Якщо подібні моделі стануть масовими, взаємодія з AI може перейти від звичного формату «написав запит — отримав відповідь» до майже звичайної відеорозмови. І тоді головним питанням стане вже не те, наскільки добре машина говорить, а чи зможе людина взагалі зрозуміти, що перед нею машина.

НАПИСАТИ ВІДПОВІДЬ

введіть свій коментар!
введіть тут своє ім'я