Недавно OpenAI* объявила о перезапуске своей робототехнической программы, свёрнутой в 2021 году. Это стало очередным сигналом того, что крупнейшие лаборатории искусственного интеллекта активно соревнуются в обучении машин взаимодействию с физическим миром. Однако для создания способных роботов ИИ-индустрии не хватает главного — обучающих данных, сравнимых по объёму с теми, что используются для языковых моделей.
Этот пробел порождает новый сегмент инфраструктурного бизнеса. В отличие от больших языковых моделей (БЯМ), которые обучаются на огромном массиве общедоступного текста, роботам нужны данные, фиксирующие физическое взаимодействие. Таких данных крайне мало. Существующие видеоматериалы, будь то с YouTube или от внештатных работников, отличаются низкой детализацией и плохо соответствуют требованиям физического мира.
Решение проблемы дефицита данных
Стартап XDOF (произносится «экс-дофф»), вышедший сегодня из «скрытого режима», делает ставку на то, что следующим ключевым препятствием в развитии искусственного интеллекта будут не модели или чипы, а циклы обратной связи по данным, необходимые для обучения роботов взаимодействию с физическим миром.
Компания стремится создать системы сбора, обработки и аннотирования данных, которые передовые лаборатории и робототехнические компании не могут легко разработать самостоятельно. Для этого XDOF привлекла 70 миллионов долларов от Thrive Capital, Spark Capital, a16z, Lux и WndrCo. По словам соучредителя и генерального директора Филиппа У, в XDOF работает около 60 человек, и компания уже сотрудничает с 20 клиентами, включая несколько ведущих ИИ-лабораторий, хотя их названия не разглашаются.
«Все ведущие лаборатории стремятся развивать робототехнику, — отметил У. — Мы уже видели некоторые негативные последствия отставания в гонке языковых моделей… Нельзя оказаться в ситуации, когда вы слишком поздно начинаете заниматься этой технологией, в то время как все остальные уже понимают, что физический ИИ — это следующая граница».
Сам У столкнулся с этой проблемой, будучи аспирантом Калифорнийского университета в Беркли. Его исследования были сосредоточены на обучении роботов навыкам с использованием масштабных наборов данных. Однако возникла одна загвоздка.
«У нас не было масштабных данных для работы, — рассказал он изданию TechCrunch. — Это была проблема курицы и яйца — сначала нам нужно было фактически собрать данные, прежде чем мы могли задаться вопросом, как обучать фундаментальную модель для робототехники».
У и его будущий соучредитель и технический директор XDOF, Фред Шенту, работали над проектом GELLO — недорогой системой телеуправления, которая позволяет оператору управлять роботизированной рукой для генерации обучающих данных. «В итоге это стало очень влиятельной работой в робототехнике, потому что многие испытывали схожие потребности и сталкивались с узкими местами, и многие начали использовать подобные устройства для сбора данных», — пояснил У.
Увидев эту возможность, У, Шенту и третий соучредитель и главный операционный директор Нимо Цзинь основали XDOF в октябре 2024 года, чтобы создать экосистему данных для компаний, разрабатывающих робототехнические модели. Понимая, что предоставление одних лишь данных может оказаться тупиковым бизнесом, компания также сосредоточилась на очистке данных, инструментарии и аннотации, создавая самоподдерживающийся цикл обратной связи для обучения роботов.
Крупнейший набор данных для роботов
В качестве отправной точки компания в сотрудничестве с лабораторией исследований ИИ Калифорнийского университета в Беркли выпускает ABC — крупнейшую из когда-либо собранных коллекций высококачественных обучающих данных для роботов. Она включает:
- 130 000 траекторий манипуляций роботов
- 300 часов симуляций
- 100 часов оценок
Подобные масштабные данные для предварительного обучения ранее никогда не были доступны академическому сообществу.
«Мы видели, как в области языка, генерации изображений и других сферах, когда модели и данные выпускаются, сообщество достигает результатов, которые вы не обязательно ожидали», — рассказал TechCrunch Дэвид МакАллистер, аспирант Беркли, помогавший организовать выпуск данных.
Команда уже использовала эти данные для обучения роботов эталонным задачам, таким как складывание футболок, уплотнение коробок или размещение наушников AirPods в футляры.
Уровни сбора данных
Компания планирует работать с тремя уровнями «пирамиды данных». Наиболее ценный уровень — это данные телеуправления, собранные на реальном развертываемом роботе. Далее следуют телеуправляемые роботы, собирающие более общие данные, как в случае с GELLO. И, наконец, «эгоцентрические» данные, собираемые людьми, выполняющими повседневные задачи, для которых XDOF планирует создавать собственные носимые датчики.
«Выбор вашей камеры повлияет на качество данных, что, в свою очередь, повлияет на производительность алгоритма отслеживания рук, — пояснил У. — Если вы изначально плохо спроектируете аппаратное обеспечение, собранные данные могут иметь очень специфические проблемы, которые вы не предвидели».
Компания планирует нанимать и обучать по всему миру операторов телеуправления и операторов «эгоцентрических» данных — это трудоёмкая модель, которая поднимает очевидный вопрос: почему крупные лаборатории не выполняют эту работу по производству данных сами?
«Вам нужен склад площадью в десятки тысяч квадратных метров с сотнями роботов, — заявил У. — Вам необходимо обслуживать этих роботов, калибровать их физические параметры и правильно обучать операторов».
Это масштабное развёртывание требует концентрации, значительных капиталовложений и операционного масштаба, который большинство ИИ-лабораторий предпочли бы передать на аутсорсинг. Именно на этот рынок и делает ставку XDOF.
Что означает XDOF
Название XDOF обыгрывает робототехнический термин «степени свободы» (degrees of freedom), который описывает количество независимых движений, которые может выполнять робот. Например, рука человека от плеча до запястья имеет семь степеней свободы. Новейший робот компании Figure.AI обладает 30 степенями свободы. Буква «X» в названии компании отражает её амбиции: «произвольные степени свободы, неограниченные степени свободы», — пояснил У.
* — деятельность компании запрещена на территории РФ
17.06.2026