Google Research опубликовала описание AgentHands — исследовательского прототипа для дополненной реальности (XR/Android XR), в котором разговорный ИИ-агент сопровождает свою речь синхронизированными анимированными руками: указывает на реальные объекты в комнате, показывает движения и подаёт визуальные предупреждения. Работа представлена на конференции CHI 2026.

Что произошло
Конвейер AgentHands состоит из четырёх шагов. Сначала система регистрирует объекты по взгляду пользователя и реконструирует сцену с 3D-рамками. Затем применяется библиотека жестовых событий трёх семантических категорий: указывающие (deictic), изображающие (iconic) и экспрессивные (expression). После этого LLM генерирует ответ со встроенными GestureEvents, привязанными к конкретным словам. На последнем шаге исполнение происходит на шлеме: TTS-озвучка синхронизируется с анимацией рук по пословным таймстампам. В демонстрационных сценариях агент обводит воздушные корни орхидеи при поливе, показывает последовательность нажатий на панели 3D-принтера и предупреждает о риске ожога красным свечением у горячего сопла. В эксперименте с участием 12 человек, в котором сравнивались взаимодействие с агентом и чисто голосовой baseline, жесты значимо облегчали поиск объектов и понимание инструкций (p < 0.05) на задачах ухода за орхидеей и управления 3D-принтером.
Контекст
Сегодня голосовые ассистенты в дополненной реальности — Project Astra и Gemini Live — отдают подсказки «плоскими» прямоугольными блоками на экране телефона. AgentHands делает шаг к пространственно заземлённым агентам, работающим в очках AR: жесты рук становятся частью выходного слоя LLM наравне с текстом и речью. Важно, что сама пространственная составляющая опирается на уже известные методы реконструкции сцены и gaze-трекинга, а не на новые результаты в области 3D-восприятия. Ценность работы — в конвейере как целом: связке 3D-реконструкции сцены, семантической таксономии жестов и привязки LLM-вывода к таймстампам озвучки. Для ML-сообщества это application-level публикация: новых моделей, SOTA-результатов и бенчмарков в ней нет.
Почему это важно для индустрии
Для отрасли AgentHands — конкретный, переносимый паттерн проектирования: LLM выступает источником структурированных GestureEvents, привязанных к словам, а локальный парсер на устройстве синхронизирует их с TTS-озвучкой по пословным таймстампам. Выходной слой разговорного агента тем самым расширяется с текста и речи на жесты, и публикация даёт готовый референс-дизайн: таксономию жестов, формат GestureEvents и схему синхронизации. Для команд, которые уже строят AR-агентов в экосистеме Android XR, это подтверждение, что паттерн прошёл стадию «работает ли вообще», и ориентир для проектирования. В более длинной перспективе «структурированные события, привязанные к таймстампам речи» могут стать стандартным каналом вывода агентов на носимых устройствах наряду с текстом и речью.
Почему это важно для пользователей
Практический эффект для пользователей сейчас ограничен: публичного демо, API, SDK и репозитория нет, и систему нельзя воспроизвести. Ценность для читателя — в понимании, куда движутся голосовые ассистенты в AR. Знакомая проблема, когда агент говорит «вот там», но ничего не показывает, решается буквально: агент показывает рукой, где объект, как им пользоваться и чего опасаться. Пост Google Research подробно разбирает таксономию жестов и устройство системы, поэтому работает как вводная в UX пространственных агентов. Если паттерн приживётся в Android XR, «показывать, а не только говорить» может стать базовым уровнем ожиданий к AR-ассистентам в очках.
Что пока неизвестно / ограничения
Публикация не раскрывает, какая именно LLM используется и каким образом генерируются GestureEvents: в блоге не описаны ни конкретная модель, ни дообучение, ни prompt-инжиниринг. Нет данных о задержках и стоимости, нет публичного кода и демо. Эксперимент мал: 12 участников, узкие домены задач (уход за орхидеей, управление 3D-принтером) и отсутствие в анонсе объективных метрик, так что выводы о качестве взаимодействия стоит принимать с осторожностью. Полные детали эксперимента, вероятно, появятся в статье CHI.
Источники
Автор
Look at AI, редакция
