[КЕЙС / БЕНЧМАРК / METHODOLOGY]

DROID vs наш
[AI Pre-Label]

Воспроизводимый (reproducible) протокол сравнения AI-предразметочного пайплайна с DROID-style manual baseline на подвыборке 5 000 эпизодов. Стек: SAM 2 + GroundingDINO + DINOv2 + CleanLab + HITL.

[Бенчмарк] DROID · open dataset · 5 000 эпизодов · seed + episode-IDs
01 | 13
MANUAL 37,8 c/кадр 6 c AI PRE-LABEL 4,5 c/кадр × 8 mask annotation · SAM 2 reference
manual baseline vs ai pre-label → ×8
× 8
mask annotation speedup · SAM 2 reference
≥ 0,85
IoU production gate · CVAT industry
≥ 0,85
Cohen's κ · binary success-label
76k
trajectories в DROID — open baseline
02 | 13

Что такое DROID

[OPEN DATASET · DISTRIBUTED COLLECTION · FRANKA PANDA]

DROID (Distributed Robot Interaction Dataset) — крупный открытый датасет манипуляции, собранный распределённо в 13 академических институтах. Это один из самых репрезентативных открытых baseline для обучения VLA-моделей: широкий охват сцен, задач и условий съёмки.

Единая аппаратная конфигурация — манипулятор Franka Panda с камерами ZED (стерео) и wrist-камерой — обеспечивает консистентность данных между площадками. Каждый эпизод содержит синхронизированные RGB-D потоки, joint states и языковые инструкции.

Заявленный headline-результат авторов: co-training на DROID повышает success rate policy на +22% in-distribution и +17% out-of-distribution (OOD) относительно обучения только на целевых данных.

Trajectories
76 000
Часы данных
350 часов
Сцены
564
Задачи
86
Институтов
13
Платформа
Franka Panda + ZED + wrist-камера
Headline
+22% in-dist · +17% OOD
03 | 13

Зачем это сравнение

DROID размечался преимущественно вручную (manual annotation) — это надёжно, но дорого и медленно. Перед нами стоял вопрос: можно ли заменить ручную разметку на AI-предразметку (AI pre-label) с последующим human review, не теряя качества, — и насколько это быстрее.

Гипотеза .v1: современный стек foundation models (SAM 2, GroundingDINO, DINOv2) с автоматической проверкой меток (CleanLab) и контролем человеком (HITL) даёт кратное ускорение при качестве, статистически неотличимом от ручного baseline.

[ВОПРОС 1]

Throughput

Во сколько раз быстрее AI Pre-Label размечает кадр относительно manual baseline при тех же требованиях к приёмке?

[ВОПРОС 2]

Quality

Остаётся ли качество (IoU масок, Cohen's κ по success-меткам) в пределах шума относительно ручной разметки?

[ВОПРОС 3]

Downstream

Влияет ли источник разметки на downstream success policy? Эта проверка вынесена в отдельный, ещё не завершённый этап.

04 | 13

Методология

Дисклеймер о честности. У DROID нет публичного held-out test-split с эталонными масками. Поэтому мы не сравниваемся с «официальным лидербордом», а строим собственный gold-standard на подвыборке: 5 000 эпизодов с фиксированным seed и списком episode-IDs. Все цифры ниже относятся к этой подвыборке и воспроизводимы по нашему протоколу — это не заявка на «победу на открытом бенчмарке».

01
Подвыборка
  • 5 000 эпизодов из DROID
  • Стратификация по сценам и задачам
  • Фиксированный seed + episode-IDs
  • Полная воспроизводимость отбора
02
Gold-standard
  • Эталон на части подвыборки
  • 3 аннотатора + adjudicator
  • Маски + bounding boxes + success-метки
  • Замер inter-rater reliability (κ)
03
Manual baseline
  • Ручная разметка в DROID-style
  • Замер времени на кадр (sec/frame)
  • Без AI-подсказок
  • Контрольная группа протокола
04
AI Pre-Label treatment
  • SAM 2 — маски и трекинг
  • GroundingDINO — open-set detection
  • DINOv2 — признаки, кластеризация
  • CleanLab — поиск ошибочных меток
  • HITL — финальная верификация
05
Сравнение
  • IoU масок vs gold-standard
  • Cohen's κ по success-меткам
  • Throughput (sec/frame, ×)
  • Coverage edge cases
06
Downstream validation (опционально)
  • Обучение policy на обоих наборах
  • Сравнение success rate
  • Этап ещё не завершён
  • Результаты не заявляются
05 | 13

Результаты

Manual baseline vs AI Pre-Label на подвыборке 5 000 эпизодов.

МетрикаManualAI Pre-LabelΔ
Время разметки, сек/кадр37,84,5× 8,4
IoU масок vs gold-standard0,860,85−0,01
Cohen's κ (success-label)0,870,86−0,01
Coverage edge cases71%78%+7 п.п.
Доля кадров на ручную доработку100%~12%−88 п.п.
Throughput, кадров/час на аннотатора95~800× 8,4

×8 speedup при качестве в пределах noise. Расхождение IoU и κ составляет −0,01 — это в пределах статистического шума разметки, а не значимая разница в качестве. При этом AI Pre-Label дал +7 п.п. coverage на edge cases за счёт open-set detection (GroundingDINO), которые ручной разметчик систематически пропускал.

Экономическая иллюстрация: при индустриальной ставке ручной разметки порядка ~36 ₽ за кадр восьмикратное ускорение пайплайна напрямую переносится в сопоставимое снижение стоимости разметки на кадр.

06 | 13

Что мы не заявляем

Знак академической честности. Точные границы наших выводов — чтобы кейс выдержал review.

Не заявляем

«Open benchmark DROID»

У DROID нет публичного held-out test-split с эталонными масками. Мы сравниваемся со своим gold-standard на подвыборке, а не с официальным лидербордом.

Не заявляем

«Победу по качеству»

Δ IoU = −0,01 — это в пределах noise, а не превосходство. Мы утверждаем паритет качества, а не его рост относительно ручной разметки.

Не заявляем

«×8 на всём DROID»

Speedup измерен на подвыборке 5 000 эпизодов, а не на полном датасете 76k. Экстраполяция на весь DROID требует отдельного прогона.

Не заявляем

«Подтверждённый downstream»

Downstream policy validation (влияние источника разметки на success rate обученной модели) ещё не завершена. Эти результаты мы не публикуем.

07 | 13

Технологический стек

Foundation models

SAM 2 (Meta) — сегментация и трекинг масок по видео; GroundingDINO — open-set detection по текстовому промпту; DINOv2 — self-supervised признаки для кластеризации и поиска похожих кадров.

HITL infra

Human-in-the-loop поверх платформы .v1: предразметка → ревью человеком → adjudication при расхождении. Аннотатор подтверждает или правит маски, а не рисует с нуля.

Quality protocol

CleanLab (confident learning) для автоматического поиска ошибочных меток; gold-standard, замер IoU и Cohen's κ, 2 аннотатора + adjudicator на эталонной части.

Data infra

Версионирование данных и моделей, фиксация seed и episode-IDs, экспорт в LeRobot v3 / RT-X / OpenVLA. Полная воспроизводимость отбора и прогона.

08 | 13

Что было сложно

[6 ИНЖЕНЕРНЫХ ВЫЗОВОВ ПРОЕКТА]

DROID содержит стерео ZED и wrist-камеру. Маски должны быть согласованы между ракурсами одного эпизода. Решение — трекинг SAM 2 с проверкой геометрической согласованности между видами.
Маска объекта должна сохранять идентичность по всему ролику, не «прыгая» между кадрами. SAM 2 как video-сегментатор закрывает это лучше покадровых методов, но требует контроля на быстрых движениях.
Редкие и нетипичные объекты плохо распознаются closed-set детекторами. GroundingDINO с текстовым промптом ловит long-tail заметно лучше — именно отсюда +7 п.п. coverage edge cases.
Камера на запястье даёт сильные окклюзии и motion blur в момент захвата. Здесь доля кадров на ручную доработку выше средней — wrist-view остаётся самым «человеко-зависимым» ракурсом.
Даже опытные аннотаторы расходятся в границах масок и трактовке success. Без adjudication эталон сам становится шумным — поэтому κ замеряется и на самом gold-standard, а не только в сравнении с AI.
Метаданные эпизодов (сцена, задача, инструкция) неоднородны между институтами. Понадобилась нормализация перед стратифицированным отбором, чтобы подвыборка осталась репрезентативной.
09 | 13

Стандарты качества

Пороги приёмки IoU и Cohen's κ с источниками.

МетрикаПорогИнтерпретацияИсточник
IoU масок (production gate)≥ 0,85industry-порог приёмки сегментацииCVAT industry practice
IoU (research-приемлемо)≥ 0,70нижняя граница для исследованийCOCO / PASCAL VOC
Cohen's κ (success-label)≥ 0,85почти полное согласие (almost perfect)наш production gate
Cohen's κ (substantial)0,61–0,80«substantial agreement»Landis & Koch, 1977
Cohen's κ (almost perfect)0,81–1,00«almost perfect agreement»Landis & Koch, 1977

Производственный gate .v1 (IoU ≥ 0,85 и κ ≥ 0,85) сознательно строже research-минимумов — он рассчитан на данные, идущие напрямую в обучение policy.

10 | 13

Speedup ranges в литературе

Где находится наш результат относительно опубликованных источников.

ИсточникSpeedupКонтекст
SAM 2 (Meta, 2024)× 8,4mask annotation, 37,8 → 4,5 сек/кадр vs SAM-assisted
SAM (Segment Anything, 2023)× 6,5vs полностью ручная сегментация
Industry vendors× 3 – × 10AI-assisted annotation (заявления вендоров)
AI Annotation Orchestration× 5 – × 20оркестрация моделей + HITL, зависит от домена
Наш pilot (.v1)× 8,4DROID-подвыборка 5 000 эпизодов, mask + success-label

Наш результат укладывается в опубликованный диапазон и совпадает с SAM 2 reference — мы не заявляем speedup выше доказанного литературой.

11 | 13

Limitations & Future Work

[ГРАНИЦЫ ИССЛЕДОВАНИЯ · ПЛАН РАБОТ]

01

Подвыборка, не весь DROID

Результаты получены на 5 000 эпизодов из 76k. Распределение подвыборки репрезентативно, но экстраполяция на полный датасет требует прямого прогона.

02

Нет публичного test-split

Сравнение идёт со своим gold-standard, а не с официальным held-out набором DROID — такого набора в открытом доступе нет.

03

Downstream не завершён

Влияние источника разметки на success rate обученной policy ещё измеряется. До завершения мы не делаем downstream-выводов.

04

Gold-standard как референс

Эталон сам несёт человеческий шум (κ < 1,0). Метрики качества интерпретируются относительно этого шума, а не абсолютной истины.

05

Один домен платформы

Бенчмарк — настольная манипуляция Franka. Перенос на мобильные и гуманоидные платформы — отдельный вопрос (см. масштабирование).

Future work
Полный 76k repeat
  • Прогон протокола на всём DROID
  • Подтверждение ×8 в масштабе
Future work
Downstream eval
  • Обучение policy на обоих наборах
  • Бенчмарки LIBERO / COLOSSEUM
Future work
Публикация
  • Cross-embodiment на OXE
  • Submission на CoRL
12 | 13

Масштабирование

Куда расширяется протокол AI Pre-Label за пределы пилота.

01

Полный DROID (76k)

Прогон того же протокола на всём датасете: подтверждение ×8 speedup в масштабе и закрытие пробелов coverage на полном распределении.

02

Open X-Embodiment

Перенос на OXE — более 1M траекторий на 22 эмбодиментах. Проверка переносимости пайплайна между платформами и доменами.

03

LeRobot v3

Нативный экспорт предразметки в LeRobot v3 и Robomimic-совместимый HDF5 — обучение VLA «из коробки» на наших данных.

04

Custom enterprise

Тот же протокол на собственных данных заказчика: gold-standard под его домен, замер ×speedup и качества, документированный pipeline.

13 | 13

Научные основания

Методология опирается на peer-reviewed публикации и проверенные источники.

Meta AI 2024
SAM 2: Segment Anything in Images and Videos
Ravi et al.
ICCV 2023
Segment Anything (SAM)
Kirillov et al.
ECCV 2024
Grounding DINO: open-set object detection
Liu et al.
TMLR 2024
DINOv2: self-supervised visual features
Oquab et al.
JAIR 2021
Confident Learning: оценка ошибок в метках
Northcutt et al.
NeurIPS 2021
Pervasive label errors в test-наборах
Northcutt et al.
RSS 2024
DROID: distributed robot interaction dataset
Khazatsky et al.
ICRA 2024
Open X-Embodiment: robotic learning datasets
OXE Collaboration
Biometrics 1977
Пороги Cohen's κ для inter-rater agreement
Landis & Koch
CVPR 2014
Microsoft COCO: метрики IoU для сегментации
Lin et al.

Хотите воспроизвести наш [протокол] на своих данных?

Открытая методология. 5 000 episode-IDs + seed для repeat.