Исследователи лаборатории Intelligent Space Robotics (Skoltech) представили HapticVLA — VLA-модель, которая на этапе обучения опирается на тактильные сенсоры, а на инференсе работает без них, действуя только по зрению и состоянию робота. В реальных экспериментах на задачах с хрупкими предметами модель показала среднюю успешность 86,7%, превзойдя базовые VLA, включая модели, получавшие тактильные данные прямо на инференсе. Код, веса и датасеты открыты; работа принята на конференцию IROS 2026.

image
image
image

Что произошло

Первая версия статьи HapticVLA вышла на arXiv 16.03.2026 (arXiv:2603.15257), обновлённая редакция датирована 02.08.2026, работа принята на конференцию IROS 2026. Метод собран из трёх последовательных этапов: сначала офлайн рассчитываются тактильные награды со штрафами за чрезмерную силу захвата и проскальзывание предмета, затем базовая модель SmolVLA дообучается методом Safety-Aware Reward-Weighted Flow Matching (SA-RWFM), и, наконец, Tactile Distillation дистиллирует компактный тактильный токен в VLA-студента, предсказывающего действия только по зрению и состоянию манипулятора. Проверка ставилась не в симуляции: модель выполняла три реальные задачи с предметами разной хрупкости — пластиковой банкой, вафлями и яйцами — и по средней успешности обошла базовые VLA, в том числе те, что получали тактильные данные непосредственно на инференсе.

Контекст

VLA-модели (Vision-Language-Action) переводят картинку и команду сразу в действия робота, и классическое решение для бережных операций — тактильные датчики, работающие на инференсе. HapticVLA переворачивает эту схему: тактильная модальность вынесена из инференса в этап обучения, где она служит учителем и сигналом награды, а её смысл затем дистиллируется в веса модели. Новизна метода — в порядке использования данных, а не в новой архитектуре: паттерн «дорогой сенсор при обучении — без сенсора в продакшене» для VLA-моделей нетривиален. Немаловажно и то, что стенд собран из открытых компонентов: платформа Crab из двух манипуляторов SO-101 внутри экосистемы LeRobot, что резко снижает стоимость независимой проверки результата.

Почему это важно для индустрии

Для индустрии ключевое в том, что «чувство касания» перестаёт быть свойством железа и становится свойством модели. Тактильные сенсоры дороги и плохо переносятся между платформами; если бережное поведение дистиллировано в веса VLA-модели (SA-RWFM плюс Tactile Distillation), тактильно-осведомлённые операции разворачиваются на дешёвых стандартных манипуляторах вроде SO-101 без тактильного оборудования на борту. Для команд в Physical AI это снижает CAPEX пилотов и повышает воспроизводимость контактных манипуляций на разных роботах, а ценность смещается от датчиков к обучающим данным и методам дистилляции. Открытые код, веса и датасеты дополнительно удешевляют проверку и опровержение результата другими командами — редкое свойство для контактной робототехники.

Почему это важно для пользователей

Читателям уже доступен полный набор для самостоятельной работы: открытый форк LeRobot с платформой Crab, веса модели, датасеты и проектная страница с digital twin стенда. Подход можно изучить и повторить на SO-101 без покупки тактильных сенсоров — собрать стенд по digital twin и прогнать пайплайн SA-RWFM и Tactile Distillation на собственных предметах, включая хрупкие. Отдельный сигнал для студентов: работа сделана за полгода в магистерской программе AI Robotics Яндекса и Сколтеха — наглядный пример того, какого уровня результат достижим в рамках учебной программы.

Что пока неизвестно / ограничения

Формулировка «первая VLA-модель» — это позиционирование авторов из аннотации, и первизну стоит сверять с предшествующими работами. Результаты получены на настольном двухманипуляторном стенде и пока не перепроверены третьими сторонами; прямой перенос в промконтур, например фасовку хрупких товаров, без адаптации невозможен. Наконец, это исследовательский пайплайн, а не готовый продукт: API или сервиса нет, и показатель 86,7% предстоит подтвердить независимыми репликациями на других платформах и предметах.

Источники

Автор

Look at AI, редакция