Воспроизводимый (reproducible) протокол сравнения AI-предразметочного пайплайна с DROID-style manual baseline на подвыборке 5 000 эпизодов. Стек: SAM 2 + GroundingDINO + DINOv2 + CleanLab + HITL.
[OPEN DATASET · DISTRIBUTED COLLECTION · FRANKA PANDA]
DROID (Distributed Robot Interaction Dataset) — крупный открытый датасет манипуляции, собранный распределённо в 13 академических институтах. Это один из самых репрезентативных открытых baseline для обучения VLA-моделей: широкий охват сцен, задач и условий съёмки.
Единая аппаратная конфигурация — манипулятор Franka Panda с камерами ZED (стерео) и wrist-камерой — обеспечивает консистентность данных между площадками. Каждый эпизод содержит синхронизированные RGB-D потоки, joint states и языковые инструкции.
Заявленный headline-результат авторов: co-training на DROID повышает success rate policy на +22% in-distribution и +17% out-of-distribution (OOD) относительно обучения только на целевых данных.
DROID размечался преимущественно вручную (manual annotation) — это надёжно, но дорого и медленно. Перед нами стоял вопрос: можно ли заменить ручную разметку на AI-предразметку (AI pre-label) с последующим human review, не теряя качества, — и насколько это быстрее.
Гипотеза .v1: современный стек foundation models (SAM 2, GroundingDINO, DINOv2) с автоматической проверкой меток (CleanLab) и контролем человеком (HITL) даёт кратное ускорение при качестве, статистически неотличимом от ручного baseline.
Во сколько раз быстрее AI Pre-Label размечает кадр относительно manual baseline при тех же требованиях к приёмке?
Остаётся ли качество (IoU масок, Cohen's κ по success-меткам) в пределах шума относительно ручной разметки?
Влияет ли источник разметки на downstream success policy? Эта проверка вынесена в отдельный, ещё не завершённый этап.
Дисклеймер о честности. У DROID нет публичного held-out test-split с эталонными масками. Поэтому мы не сравниваемся с «официальным лидербордом», а строим собственный gold-standard на подвыборке: 5 000 эпизодов с фиксированным seed и списком episode-IDs. Все цифры ниже относятся к этой подвыборке и воспроизводимы по нашему протоколу — это не заявка на «победу на открытом бенчмарке».
Manual baseline vs AI Pre-Label на подвыборке 5 000 эпизодов.
| Метрика | Manual | AI Pre-Label | Δ |
|---|---|---|---|
| Время разметки, сек/кадр | 37,8 | 4,5 | × 8,4 |
| IoU масок vs gold-standard | 0,86 | 0,85 | −0,01 |
| Cohen's κ (success-label) | 0,87 | 0,86 | −0,01 |
| Coverage edge cases | 71% | 78% | +7 п.п. |
| Доля кадров на ручную доработку | 100% | ~12% | −88 п.п. |
| Throughput, кадров/час на аннотатора | 95 | ~800 | × 8,4 |
×8 speedup при качестве в пределах noise. Расхождение IoU и κ составляет −0,01 — это в пределах статистического шума разметки, а не значимая разница в качестве. При этом AI Pre-Label дал +7 п.п. coverage на edge cases за счёт open-set detection (GroundingDINO), которые ручной разметчик систематически пропускал.
Экономическая иллюстрация: при индустриальной ставке ручной разметки порядка ~36 ₽ за кадр восьмикратное ускорение пайплайна напрямую переносится в сопоставимое снижение стоимости разметки на кадр.
Знак академической честности. Точные границы наших выводов — чтобы кейс выдержал review.
У DROID нет публичного held-out test-split с эталонными масками. Мы сравниваемся со своим gold-standard на подвыборке, а не с официальным лидербордом.
Δ IoU = −0,01 — это в пределах noise, а не превосходство. Мы утверждаем паритет качества, а не его рост относительно ручной разметки.
Speedup измерен на подвыборке 5 000 эпизодов, а не на полном датасете 76k. Экстраполяция на весь DROID требует отдельного прогона.
Downstream policy validation (влияние источника разметки на success rate обученной модели) ещё не завершена. Эти результаты мы не публикуем.
SAM 2 (Meta) — сегментация и трекинг масок по видео; GroundingDINO — open-set detection по текстовому промпту; DINOv2 — self-supervised признаки для кластеризации и поиска похожих кадров.
Human-in-the-loop поверх платформы .v1: предразметка → ревью человеком → adjudication при расхождении. Аннотатор подтверждает или правит маски, а не рисует с нуля.
CleanLab (confident learning) для автоматического поиска ошибочных меток; gold-standard, замер IoU и Cohen's κ, 2 аннотатора + adjudicator на эталонной части.
Версионирование данных и моделей, фиксация seed и episode-IDs, экспорт в LeRobot v3 / RT-X / OpenVLA. Полная воспроизводимость отбора и прогона.
[6 ИНЖЕНЕРНЫХ ВЫЗОВОВ ПРОЕКТА]
Пороги приёмки IoU и Cohen's κ с источниками.
| Метрика | Порог | Интерпретация | Источник |
|---|---|---|---|
| IoU масок (production gate) | ≥ 0,85 | industry-порог приёмки сегментации | CVAT industry practice |
| IoU (research-приемлемо) | ≥ 0,70 | нижняя граница для исследований | COCO / PASCAL VOC |
| Cohen's κ (success-label) | ≥ 0,85 | почти полное согласие (almost perfect) | наш production gate |
| Cohen's κ (substantial) | 0,61–0,80 | «substantial agreement» | Landis & Koch, 1977 |
| Cohen's κ (almost perfect) | 0,81–1,00 | «almost perfect agreement» | Landis & Koch, 1977 |
Производственный gate .v1 (IoU ≥ 0,85 и κ ≥ 0,85) сознательно строже research-минимумов — он рассчитан на данные, идущие напрямую в обучение policy.
Где находится наш результат относительно опубликованных источников.
| Источник | Speedup | Контекст |
|---|---|---|
| SAM 2 (Meta, 2024) | × 8,4 | mask annotation, 37,8 → 4,5 сек/кадр vs SAM-assisted |
| SAM (Segment Anything, 2023) | × 6,5 | vs полностью ручная сегментация |
| Industry vendors | × 3 – × 10 | AI-assisted annotation (заявления вендоров) |
| AI Annotation Orchestration | × 5 – × 20 | оркестрация моделей + HITL, зависит от домена |
| Наш pilot (.v1) | × 8,4 | DROID-подвыборка 5 000 эпизодов, mask + success-label |
Наш результат укладывается в опубликованный диапазон и совпадает с SAM 2 reference — мы не заявляем speedup выше доказанного литературой.
[ГРАНИЦЫ ИССЛЕДОВАНИЯ · ПЛАН РАБОТ]
Результаты получены на 5 000 эпизодов из 76k. Распределение подвыборки репрезентативно, но экстраполяция на полный датасет требует прямого прогона.
Сравнение идёт со своим gold-standard, а не с официальным held-out набором DROID — такого набора в открытом доступе нет.
Влияние источника разметки на success rate обученной policy ещё измеряется. До завершения мы не делаем downstream-выводов.
Эталон сам несёт человеческий шум (κ < 1,0). Метрики качества интерпретируются относительно этого шума, а не абсолютной истины.
Бенчмарк — настольная манипуляция Franka. Перенос на мобильные и гуманоидные платформы — отдельный вопрос (см. масштабирование).
Куда расширяется протокол AI Pre-Label за пределы пилота.
Прогон того же протокола на всём датасете: подтверждение ×8 speedup в масштабе и закрытие пробелов coverage на полном распределении.
Перенос на OXE — более 1M траекторий на 22 эмбодиментах. Проверка переносимости пайплайна между платформами и доменами.
Нативный экспорт предразметки в LeRobot v3 и Robomimic-совместимый HDF5 — обучение VLA «из коробки» на наших данных.
Тот же протокол на собственных данных заказчика: gold-standard под его домен, замер ×speedup и качества, документированный pipeline.
Методология опирается на peer-reviewed публикации и проверенные источники.
Открытая методология. 5 000 episode-IDs + seed для repeat.
Оставьте контакты — пришлём PDF с полным протоколом, списком 5 000 episode-IDs и seed для воспроизведения в течение 24 часов в рабочие дни.