⚽ Час наблюдений вместо идеальной камеры: робот учится бить по мячу
Камера двуногого робота ошибается и запаздывает, а ставить ногу надо за десятки миллисекунд. Команда профессора Чжао Минго из Университета Цинхуа вместе с ByteDance Seed и Китайским сельскохозяйственным университетом обучила одну политику искать мяч, сближаться с ним и бить. Работа вышла в августовском спецвыпуске Science Robotics.
За секунду до удара сырое зрение ошибалось в положении мяча на 0,344 метра, а оценка самой политики — на 0,186, примерно на 46% меньше. На настоящем поле робот бил успешно в 80–90% попыток из передней зоны и в 60–70% из задней.
Одна политика связывает зрение с движением
В обычной схеме зрительный модуль определяет координаты мяча, планировщик выбирает манёвр, а контроллер превращает его в движения суставов. Ошибка и задержка переходят от блока к блоку. При пропаже объекта цепь остаётся без новых данных, а запоздавшая команда относится уже к прошлому положению мяча.
Это не нейросеть, напрямую превращающая пиксели в крутящий момент. Детектор и одометрия сохранены: изображение переводится в координаты поля, ориентиры уточняют положение робота и ворот, датчики тела сообщают позу. Но отдельного выбора заранее заданного навыка больше нет. Политика получает эти данные и каждые 20 мс выдаёт целевые положения суставов. Поиск, поворот, шаг и удар оптимизируются как непрерывное действие.
Зрение обновляет положение мяча с частотой около 25 Гц и в среднем опаздывает на 116 мс, а управление работает на 50 Гц. Между кадрами политика не ждёт нового измерения, а продолжает движение по внутренней оценке.
Час наблюдений превращает дефекты камеры в учебную среду
Для переноса в реальность виртуальную камеру не делали идеальной. Робот около часа смотрел на мяч с разных расстояний и углов, а захват движения записывал истинные координаты. Так измерили шум, вероятность обнаружения, частоту и задержку. В симулятор добавили также изменение поля зрения при движении головы и пропуски из-за смаза.
Политика сжимает 50 наблюдений, или примерно одну секунду истории, в скрытое состояние размерностью 64. При обучении декодер восстанавливает из него точное положение мяча и динамику робота, заставляя модель отделять траекторию от дрожания измерений. Actor видит доступные машине сигналы, Critic — полное состояние симуляции. На роботе декодер и Critic удаляются: оценку по истории поддерживает сама политика.
Движения задавались не ручным каталогом ударов. Состязательную априорную модель движений (AMP) обучали на 76 секундах человеческой ходьбы и 30 секундах ударов внутренней стороной стопы. Зеркальное ограничение подключило обе ноги. Сформировались пять режимов — ходьба, два поворота и два удара, — с непрерывными переходами.
Далеко от мяча шаговый цикл длится 0,7–0,8 секунды, перед ударом — 0,3–0,4 секунды. Так устойчивый обзор сменяется точной постановкой ноги. У края поля зрения робот доворачивает голову и корпус; при воротах сзади совмещает разворот с боковым ударом.
Выигрыш проверили ошибкой, задержкой и движущимся мячом
За последнюю секунду перед ударом средняя ошибка сырого зрительного измерения составляла 0,344 м. Оценка из скрытого состояния уменьшила её до 0,186 м — на 0,158 м, или примерно на 46%. В отдельной последовательности детектор не видел мяч около 0,6 секунды, но внутренняя оценка продолжала вести его траекторию до возвращения наблюдений.
При искусственном затенении на 0,3 секунды робот в симуляции касался мяча более чем в 90% попыток и забивал более чем в половине. Секундный разрыв уже почти исчерпывал запас истории: касание сохранялось примерно в 58% случаев, но доля голов падала до нескольких процентов. Память не делает зрение ненужным — она даёт контроллеру время не обрывать действие при кратком провале.
С неподвижным мячом, поставленным в 1,5 м от робота, обученная политика обычно доходила до касания примерно за 1,5 секунды. Продвинутая система правил RoboCup тратила 2–5 секунд; в наиболее выгодном сравнении время сократилось на 64%. На восьми направлениях подхода каждый вариант проверяли по пять раз. Политика также развивала угловую скорость около 3–4 рад/с против примерно 1,5–2 рад/с у правил: она соединяла разворот и сближение вместо последовательного выполнения.
На настоящем поле успешность составляла 80–90% при старте из передней зоны и 60–70% из задней, падений в этих тестах не было. Для катящегося мяча результат держался выше 50%, пока скорость была меньше 0,5 м/с. Масштабы выборок различались: в симуляции каждую скорость проверяли 8192 раза, на роботе — по 10, поэтому совпадение тенденции важнее точного равенства процентов.
Что это значит
Главный результат — не каталог готовых действий, а перенос контроллера из симуляции на машину с шумным зрением. Час наблюдений задаёт модель ошибок, пропусков и задержки, а секундная история не даёт движению сразу оборваться при исчезновении мяча.
Эта работа продолжает цикл испытаний. В 2004 году Чжао Минго создал в Цинхуа робофутбольную команду, а год спустя она вышла на RoboCup с собственным роботом ростом около 50 см, которого страховали от падений. Команда возвращалась почти ежегодно. В 2025 году она выиграла взрослую гуманоидную лигу RoboCup и Всемирные игры гуманоидных роботов, забив суммарно 76 мячей и пропустив 11; в 2026-м защитила титул RoboCup Large Size.
Чэн Хао, бывший третий капитан команды, основал Booster Robotics в 2023 году. Гуманоид компании стал стендом без переделки корпуса. В 2026-м версия Booster T2 на NVIDIA Thor получила 2070 TFLOPS, а 80 машин выполнили автономное построение; их суммарную мощность источник оценил примерно в 170 тыс. TFLOPS.
Изученная политика была лишь модулем двигательных навыков в полной матчевой системе. Поэтому работа показывает устойчивость конкретного зрительно-моторного контура, а не универсальный интеллект: робот продолжает движение не с безошибочным зрением, а внутри измеренных ошибок камеры.