[КЕЙС / CURATED DATASETS / RECOVERY-AS-A-SKU]

Recovery pack
для [humanoid OEM]

Промышленно готовый датасет recovery-сценариев для VLA-моделей: проскальзывание, столкновение, неуспешный захват, падение объекта, перезахват — то, чего нет в Open X-Embodiment и DROID. Собран [.v1] под задачу заказчика — технически сложнее обычного training-датасета.

[Клиент] Humanoid · SKL Robotics LTD · HMND 01 platform
01 | 13
time-to-recovery, c
task success rate, %
SLIP RECOVERED
slip → detect → re-grasp → recovered
+22,6%
прирост task success rate на VLA · FailSafe 2025
6
категорий failure taxonomy в датасете
≤ 5 мс
multimodal sync precision
30 / 60 / 10
nominal · recovery · hard failure split
02 | 13

Почему [recovery] — главный bottleneck
VLA-моделей в production

[VLA-МОДЕЛИ · COMPOUNDING ERRORS · SUCCESS-BIAS DATASETS]

Открытые датасеты для обучения VLA-моделей содержат преимущественно успешные демонстрации. Open X-Embodiment — это более 1M траекторий на 22 эмбодиментах; DROID — около 76k успешных эпизодов плюс ~17% неуспешных; AgiBot World — почти 3 000 часов. Однако неуспешные траектории в DROID не размечены по таксономии причин — это сырой failure-сигнал, а не пригодный для обучения recovery-датасет.

Результат: у policy, обученной только на success-данных, проявляются compounding errors. Теорема Ross & Bagnell (AISTATS 2011) формально показывает, что ожидаемая стоимость ошибки behavior cloning растёт квадратично с горизонтом задачи — O(T² · ε). Каждая малая ошибка выводит робота в состояние, не покрытое обучающим распределением, что провоцирует следующую ошибку. Каскад.

46% → 78%
task completion у AgiBot GO-1 после 1M траекторий — разрыв в 17 п.п. до production-порога 95%+
92% → 12%
деградация BC-policy на Robomimic Can при переходе от Proficient Human к Mixed Human демонстрациям (Mandlekar, CoRL 2021)
O(T² · ε)
формальная оценка накопления ошибок behavior cloning — теорема Ross & Bagnell, AISTATS 2011

Recovery-данные — единственный известный способ закрыть этот разрыв. Без них VLA-модель достигает demo-quality, но в production «застревает» после первого же отклонения от обучающего распределения.

03 | 13

Контекст: Humanoid и KinetIQ

Humanoid (юр. лицо: SKL Robotics LTD) — британский разработчик гуманоидных роботов общего назначения. По данным Sifted (август 2025) входит в число самых быстрорастущих robotics-стартапов Европы.

Платформа HMND 01 работает под управлением собственного AI-фреймворка KinetIQ — четырёхуровневой когнитивной архитектуры:

  • System 0 — whole-body controller, 50 Гц
  • System 1VLA-based locomanipulation, 200 Гц
  • System 2 — agentic-логика на omni-modal LLM. Ключевая функция — мониторинг исполнения и оценка прогресса System 1, то есть структурно заложен recovery-trigger
  • System 3 — оркестрация флота (секунды-минуты)

Публичные развёртывания: Schaeffler bin picking (металлические подшипниковые кольца), Siemens logistics (60 totes/час), SAP × Martur Fompak kitting. Для непрерывного пикинга, мобильности между станциями и адаптации навыков на площадке технически необходим robust recovery.

Развёртывание на несколько тысяч единиц на двух заводах Schaeffler запланировано на конец 2026 года. При операционной стоимости гуманоида порядка ~140 ₽/час против стоимости простоя 70 000–710 000 ₽/мин recovery становится главным экономическим рычагом (подробнее — секция 11).

Год основания
2024
Штаб-квартира
Лондон, Великобритания
Платформа
HMND 01 (Alpha Wheeled + Bipedal)
AI-фреймворк
KinetIQ (4 уровня)
System 1
VLA · 200 Гц
Партнёры
NVIDIA · AWS · SAP · Siemens · Schaeffler
Rollout 2026
Несколько тысяч единиц, Schaeffler
04 | 13

Задача

[RECOVERY-AS-A-SKU · FAILURE TAXONOMY · MULTIMODAL CAPTURE]

Заказчик предоставил разрозненные production-логи с пилотных развёртываний HMND 01 на трёх промышленных площадках: логи операторских интервенций в CSV/JSON, RGB-видео (stationary и wrist-камеры, 30–60 кадров/с), joint states плюс крутящие моменты 200 Гц с edge-устройств KinetIQ, потоки wrist 6-axis F/T sensor, аудио с микрофонов в ячейках, сводки failure-событий от supervisor-систем. Из этого нужно было собрать готовый recovery-датасет.

[ИЗВЛЕЧЬ]

Recovery-сегменты из логов

Автоматическая сегментация эпизодов, где после факта failure был выполнен успешный re-attempt — из массива сырых production-логов.

[ПОСТРОИТЬ]

Failure taxonomy

Единая 6-категорийная таксономия на основе проверенной литературы (Liu 2024, AHA NVlabs 2024, REASSEMBLE 2025) — для всех будущих SKU.

[СИНХРОНИЗИРОВАТЬ]

Multimodal sync < 5 мс

PTP-выравнивание RGB, depth, F/T, joint states и audio в едином временном пространстве. Это критично для force-vision policies.

[РАЗМЕТИТЬ]

Frame-level events

Покадровая разметка фаз: failure_onset · recovery_action_start · recovery_completion плюс корневая причина каждого эпизода.

[ДОГРУЗИТЬ]

FailGen и teleop-пертурбации

Недостающие категории добираются через намеренные человеческие teleop-пертурбации и procedural injection в стиле FailGen (усиление в 10–100×).

[ПОСТАВИТЬ]

Recovery Pack в LeRobot / OpenVLA

Готовый экспорт в LeRobot v3, Robomimic-совместимый HDF5, OpenVLA-format и схему AIRoA MoMa. Обучение VLA «из коробки».

05 | 13

Решение [.v1]

5-шаговый конвейер от сырых production-логов до готового Recovery Pack.

01 / 05
01
Mining production logs
  • Event-detection в CSV/JSON
  • Bipartite matching: интервенция ↔ видео
  • UTC-sync ≤ 1 кадр (33 мс @ 30 fps)
  • Reference: Elly (Galbally 2022)
02 / 05
02
Failure taxonomy
  • 6 категорий: grasp · locomotion · sensory
  • cognitive · hardware · sim-to-real
  • Root cause label для каждой
  • Anchor: Liu 2024 / AHA / REASSEMBLE
03 / 05 RGB F/T JNT
03
Multimodal sync & augmentation
  • PTP precision < 5 мс: RGB / F/T / joint / audio
  • Гэп > 100 мс — эпизод дропается
  • FailGen-style amplification 10–100×
  • Reference: AHA NVlabs 2024
04 / 05 onset recovery
04
Annotation: anomaly + recovery
  • failure_onset · recovery_start · completion
  • Action: re-grasp / re-orient / retreat / replan
  • F/T + audio markers: contact / slip / drop
  • Accuracy ≥ 91% (REASSEMBLE anchor)
05 / 05 LRB HDF5 VLA MoMa
05
Композиция Recovery Pack и экспорт
  • Split 30 / 60 / 10: nominal · recovery · hard
  • LeRobot v3 · Robomimic HDF5 · OpenVLA
  • Схема AIRoA MoMa
  • Готовность к sport-mode препроцессингу
06 | 13

Технологический стек

Захват (Hardware capture)

UMI, ALOHA, Manus gloves, Apple Vision Pro; wrist 6-axis F/T, RGB-D, микрофоны в ячейке. Edge-захват joint states 200 Гц с устройств KinetIQ.

Софт (V1 Platform)

Платформа .v1 (proprietary): AI pre-labeling, human-in-the-loop, PTP-синхронизация. Экспорт в LeRobot / OXE / RT-X / OpenVLA.

Синтетика (Synthetic augmentation)

Procedural failure injection в стиле FailGen (10–100×), domain randomization в Isaac Sim / MuJoCo для покрытия редких категорий.

Качество (Quality SLA)

Multimodal sync ≤ 5 мс · Cohen's κ ≥ 0,75 между разметчиками · accuracy ≥ 91% (REASSEMBLE anchor) · 2 разметчика + adjudicator.

07 | 13

Результаты

Эффект recovery-данных по проверенным published benchmarks.

+22,6%
средний прирост task success rate при дообучении на recovery-данных (FailSafe, Lin 2025)
+21,4%
прирост downstream-производительности policy с failure-aware разметкой (AHA, NVlabs 2024)
+10,3%
точность failure detection относительно GPT-4o (AHA, NVlabs 2024)
+46,9%
средний прирост у Diffusion Policy над предыдущими методами (Chi 2023)
3× (32→62%)
прирост обобщения на новые сценарии RT-1 → RT-2 (Google DeepMind 2023)
+50%
прирост cross-embodiment переноса RT-1-X (Open X-Embodiment 2023)

Оценка по аналогии · HMND 01 в Schaeffler

Для сценариев HMND 01 на площадках Schaeffler (экстраполяция по published-бенчмаркам): recovery rate 70 → 90%+; MTTR < 2 сек; intervention rate < 0,5%; downtime < 5%.

08 | 13

Failure Taxonomy

[6 КАТЕГОРИЙ · LIU 2024 · AHA · REASSEMBLE]

Самая частая категория для bin picking. Включает проскальзывание объекта, неуспешный захват и потерю объекта во время переноса.
Подкатегории
slip · mis-pick · drop · collision с краем контейнера
Detection signals
скачок F/T, падение IoU в vision, slip-audio
Recovery primitives
re-grasp · re-orient · retreat-and-retry
Reference benchmark
REASSEMBLE 2025 · Liu 2024
Релевантно для мобильных и bipedal-платформ при перемещении между станциями.
Подкатегории
foot-slip · потеря баланса · stumble · застревание колеса
Detection signals
IMU, ZMP-отклонение, скачок torque в опорной ноге
Recovery primitives
re-step · стабилизация · повтор траектории
Reference benchmark
AHA NVlabs 2024
Ошибки восприятия: блики на металле, окклюзия, шум depth-камеры. Особенно остро на бликующих подшипниковых кольцах Schaeffler.
Подкатегории
occlusion · glare · depth-noise · false detection
Detection signals
падение perception confidence, рассогласование RGB ↔ depth
Recovery primitives
re-perceive · смена ракурса · active sensing
Reference benchmark
REASSEMBLE 2025
Самая сложная для разметки категория: ошибки планирования и выбора подзадачи. Детектируются System 2-монитором KinetIQ.
Подкатегории
неверная подзадача · ошибка планирования · зацикливание
Detection signals
отсутствие прогресса (System 2), нарушение precondition
Recovery primitives
replan · откат подзадачи · эскалация оператору
Reference benchmark
Liu Neuro-symbolic 2024
Отказы привода, дрейф калибровки, перегрев. Размечаются для построения предиктивной диагностики и безопасных recovery-сценариев.
Подкатегории
actuator fault · дрейф калибровки · перегрев · просадка питания
Detection signals
residual в модели динамики, рост тока, температурный сенсор
Recovery primitives
safe-stop · рекалибровка · переключение на резерв
Reference benchmark
AHA NVlabs 2024
Distribution shift между симуляцией и реальностью. Размечается для отслеживания деградации policy на out-of-distribution входах.
Подкатегории
OOD-вход · реальная динамика ≠ sim · domain gap
Detection signals
OOD-детектор, рост ошибки предсказания, неожиданный контакт
Recovery primitives
domain adaptation · fine-tune на реальных данных
Reference benchmark
DART (Laskey 2017)
09 | 13

Методология разметки

Двухуровневая схема по образцу AIRoA MoMa + протокол качества.

[УРОВЕНЬ 1]

Episode-level metadata

Метаданные эпизода целиком: эмбодимент, площадка, тип задачи, итог (success / failure / recovered), доминирующая категория failure, корневая причина, теги hard-set.

  • · embodiment · site · task_type
  • · outcome · failure_category · root_cause
  • · recovery_strategy · hard_set_flag
[УРОВЕНЬ 2]

Frame-level events

Покадровая разметка событий с привязкой к синхронизированным мультисенсорным потокам — точные тайм-коды фаз каждого recovery-эпизода.

  • · failure_onset (момент начала сбоя)
  • · recovery_action_start / completion
  • · contact / slip / drop markers (F/T + audio)
2 + 1
2 независимых разметчика + adjudicator при расхождении
κ ≥ 0,75
Cohen's κ — порог межэкспертного согласия (inter-rater agreement)
91%
anomaly classification accuracy как anchor качества (REASSEMBLE 2025)
10 | 13

Что было сложно

[ИНЖЕНЕРНЫЕ ВЫЗОВЫ ПРОЕКТА]

Логи с трёх площадок приходили в разных форматах, с рассинхроном часов и пропусками. Построили event-detection поверх CSV/JSON и bipartite matching операторских интервенций с видеопотоком, отбраковывая эпизоды с гэпом синхронизации > 100 мс.
Визуально сбой часто заметен на несколько кадров позже фактического начала. Опорой стал F/T-сигнал: характерный спад нормальной силы и slip-audio позволяют датировать onset точнее, чем по одному видео. Разметчики сверяют все модальности на синхронной шкале.
Восстановление редко бывает одношаговым: retreat → re-perceive → re-grasp, иногда с несколькими попытками. Ввели разметку recovery как последовательности примитивов с явными границами фаз, чтобы модель училась стратегии, а не отдельному жесту.
Синтетика из FailGen / Isaac Sim закрывает редкие категории, но рискует увести модель в нереалистичный домен. Держали баланс: синтетика только для усиления покрытия, с обязательной долей реальных эпизодов и OOD-разметкой для контроля переноса.
Ошибка планирования не видна в кадре — её нужно вывести из контекста задачи. Привлекли сигнал System 2-монитора (отсутствие прогресса) и нарушения precondition как объективные якоря, плюс обязательную адъюдикацию при расхождении разметчиков.
Для force-vision policies точность синхронизации между RGB, F/T (200 Гц) и joint states критична. Перешли на PTP с единым clock-source, верифицируя выравнивание автоматически; эпизоды с дрейфом синхронизации дропались до разметки.
11 | 13

Экономика recovery

Почему recovery-датасет окупается в одну смену. Все суммы — в рублях по курсу ЦБ РФ на 29.05.2026 (71,37 ₽/$).

[Стоимость простоя]
70 000–710 000
₽/мин

Стоимость незапланированного простоя промышленной линии — до ~43 млн ₽/час, со штрафным множителем до 15× за unplanned downtime. Сокращение downtime на 5 п.п. на развёртывании из 100 ячеек — около ~86 млн ₽/сутки.

Formant.io
[Снижение интервенций]
1,5% → 0,5%

Базовая частота операторских интервенций — 1,5% (3,8 млн на 250 млн пиков, Plus One Robotics). Снижение до целевых 0,5% при 30 000 интервенциях/сутки даёт около ~2,1 млн ₽/сутки экономии.

Plus One Robotics
[ROI]
1 : 30 000–300 000

Операционная стоимость гуманоида ~140 ₽/час против стоимости простоя 70 000–710 000 ₽/мин — соотношение от 1:30 000 до 1:300 000. Recovery-датасет окупается в одну смену.

Roland Berger 2026 · Formant.io
12 | 13

Масштабирование

Как Recovery Pack растёт за пределы одного развёртывания.

01

HMND 01 cross-deployment

Перенос recovery-данных между площадками одного OEM: Schaeffler → Siemens → Bosch → SAP. Общая failure-taxonomy позволяет переиспользовать разметку на новых линиях.

02

Cross-OEM

Перенос на других гуманоидов: Figure 02, Apptronik Apollo, 1X NEO, Unitree H1/H2. Reference cross-embodiment переноса — RT-1-X +50%.

03

Legacy industrial arms

Recovery-сценарии для классических манипуляторов: UR, Franka, KUKA, Kinova — крупнейший установленный парк промышленной робототехники.

04

Synthetic amplification

Procedural injection в стиле FailGen усиливает редкие категории в 10–100× — масштабирование покрытия без пропорционального роста сбора реальных данных.

13 | 13

Внешняя валидация

Стоимость ошибки обучения с учителем для последовательного предсказания растёт квадратично с длиной горизонта задачи. Именно поэтому policy, обученная только на успешных демонстрациях, неизбежно деградирует в длинных эпизодах.

Соберём [recovery]-датасет под вашу задачу

Этот датасет мы собрали под задачу заказчика — humanoid OEM. Реализуем похожий recovery-датасет под ваш embodiment и домен.