AI

Die versteckten Roboter-Trainingsmomente des Webs in öffentlichen Web-Videodaten

Studie: Bright Datas Video Search API fand 10-mal mehr Momente mit physischen Aktionen, indem sie durchsuchte, was Videos zeigen, statt sich auf Titel, Beschreibungen und Tags zu verlassen.
19 min lesen
Finding the web’s hidden robot training moments in public web video data

Videodaten können dabei helfen, Roboter, einschließlich humanoider Roboter, darin zu trainieren, physische Aufgaben zu verstehen und auszuführen. Dies umfasst VLA-Modelle, die visuelle Beobachtungen und Sprachanweisungen mit Aktionen verknüpfen, sowie World-Modelle, die lernen, wie sich eine Umgebung im Laufe der Zeit verändert. Das öffentliche Web enthält Millionen von Videos, in denen Menschen diese Arbeiten ausführen, und das Auffinden einer bestimmten Aktion darin ist schwierig, da ein Titel das allgemeine Thema eines Videos beschreibt, während die Aktionen im Filmmaterial unbenannt bleiben. Beschreibungen und Tags sind in der Regel nicht besser.

Für diese Studie haben wir die Video Search API von Bright Data verwendet. Die Video Search API ist ein Tool, das es ermöglicht, Momente in Web-Videos visuell zu durchsuchen.

Man übergibt ihr eine Beschreibung einer Aktion in natürlicher Sprache, sie durchsucht den visuellen Inhalt öffentlicher Videos anstelle der daran angehängten Texte und gibt Kandidatenvideos zusammen mit Zeitstempeln zurück, an denen die Aktion möglicherweise erscheint. Die herkömmliche Keyword-Suche funktioniert umgekehrt: Sie gleicht Ihre Wörter mit Titel, Beschreibung und Tags eines Videos ab, sodass die beiden Ansätze sehr unterschiedliche Aufnahmen erreichen.

Wir haben ihr 141 physische Aktionen gesendet und 10.828 Momente in 7.549 Videos zurückerhalten. Für jeden behaltenen Moment haben wir geprüft, ob ein Wort des Aktionsnamens im Titel, der Beschreibung oder den Tags des Videos vorkommt. In 90,8% der Fälle war dies nicht der Fall.

Wenn Sie Trainingsmaterial per Keyword sammeln, sind diese 90,8% die Daten, die Sie verpassen, und das macht die Ausbeute der API 10-mal größer als das, was die Textsuche erreichen könnte. Diese zusätzlichen Momente zeigen dieselben Aktionen, nach denen Sie gefragt haben, in Videos, deren Titel über etwas anderes sprechen, und sie bleiben für eine Text-Pipeline unsichtbar, egal wie viele Abfragen Sie gegen diese Felder ausführen.

Wir haben wörtliche Teilzeichenketten mit Titel, Beschreibung und Tags abgeglichen und innerhalb des Korpus gezählt, den die API selbst zurückgegeben hat, sodass das Verhältnis unter diesen beiden Bedingungen gilt. Semantische Suche, mehrsprachige Suche, Transkriptsuche und YouTubes eigenes Ranking liegen außerhalb dessen, was wir getestet haben.


Das Ergebnis in drei Zahlen

10,9× mehr Momente als bei wörtlichem Abgleich Die Inhaltssuche lieferte 10.828 Ergebnisse; 992 tragen ein Wort des Aktionsnamens in ihren Metadaten
90,8% nirgends benannt 9.836 von 10.828 Momenten enthalten keine Erwähnung der Aktion in Titel, Beschreibung oder Tags
56,1% kein Hinweis im Titel ein schwächerer Test als die Suche. Wir haben google/gemini-2.5-flash gefragt, ob irgendetwas im Titel auch nur entfernt mit der Aktion zusammenhängt, einschließlich Hinweise, die viel zu vage zum Suchen sind. Es fand in 6.071 von 10.828 Fällen nichts
Woher diese drei Zahlen stammen

Die ersten beiden ergeben sich aus derselben Division: 9.836 von 10.828 Momenten enthalten kein Wort der Aktion in einem Feld, und die 992, die es tun, sind das, was ein wörtlicher Matcher erreicht: 10.828 ÷ 992 = 10,9. Die vier Kategorien (Titel, Beschreibung, Tags, keine) schließen sich gegenseitig aus und ergeben zusammen die geprüfte Gesamtzahl. Beide werden pro Match-Zeile gezählt; reduziert man sie auf die 8.849 unterschiedlichen Video-Sekunden, ergibt sich ein Verhältnis von 8,9×.

Die dritte zählt die Titel, die das Modell als nicht verwandt eingestuft hat: 6.071 von 10.828, eine Zeile pro Moment über 7.549 verschiedene Videos.

Die Zeitstempel haben eine zweite Konsequenz. Erlaubt man jedem Moment höchstens 10 Sekunden Aktion, werden aus den 5.066,5 Stunden Quellvideo, in denen diese Treffer liegen, 24,58 Stunden Clips, was das zu Bewegende, Speichernde und Überprüfende um das 206,1-Fache reduziert.

Was die Suche tatsächlich zurückgab. Dass die Suche zuversichtlich ist, bedeutet nicht, dass sie richtig liegt, daher haben wir aus fast jedem Treffer einen echten Frame gezogen und ein Vision-Modell alle davon bewertet. Abschnitt 3.5 enthält die Raten. Diese Prüfung liefert Kandidatenmaterial zur Entdeckung und Kuratierung; keine Richtlinie, kein World-Modell und kein Roboter wurde damit trainiert.

Sechs Beispiel-Videos und ihre Titel auf YouTube

Was ein Vision-Modell sah, dem das Bild ohne Titel gezeigt wurde, verglichen mit dem eigenen Titel des Videos, ins Englische übersetzt, wo eine Ausgangssprache angegeben ist. Eine KI hat jeden Titel im Korpus auf einen Hinweis auf die jeweilige Aktion geprüft und diese sechs als nicht verwandt eingestuft: ein bloßes Datum, ein Koranvers, ein Wirtschaftsnachrichtenblock. Wir haben jeden Frame manuell bestätigt und jedes Video ist live. Klicken Sie auf einen Frame, um das Video ab dieser Sekunde abzuspielen.

Der Moment Was der Frame zeigt Wie das Video heißt
Person shoveling cement in mixing tub
mix_cement
Person schaufelt Zement in Mischwanne Tawbah Sure, Vers 26. “Aber wohin geht ihr?” (aus tr)
Hand inserting fuel nozzle into car filler
refuel
Hand steckt Zapfpistole in Tankstutzen Bangladeschs wirtschaftliche Reformherausforderungen und IWF-Botschaft | Bangladesch Wirtschaft | IWF (aus bn)
Two hands folding green paper in half
fold
Zwei Hände falten grünes Papier in der Mitte 24. Dezember 2023 (aus zh)
Hand slicing avocado on chopping board
cut_knife
Hand schneidet Avocado auf Schneidebrett Essen auf Mondboden angebaut… Wissenschaftler erschraken? (aus hi)
Hand striking red mushroom emergency stop button
emergency_stop
Hand schlägt auf roten Pilz-Not-Aus-Knopf (Cheongju City/Hauptlinie) Woojin Sanjeon Apollo 1100 Elektrisch Ultra-Niederflur Modell PEV Standard 2024 Juni Ausgabe 2027 Dongil Transportation 712 (aus ko)
Hand guiding chisel into wood carving
chisel_carve
Hand führt Meißel in Holzschnitzerei adapt and overcome 🌱

90,8% der abgerufenen Momente sind in ihren Metadaten nirgends benannt

Dieser Anteil ist die Lücke zwischen dem, was die Inhaltssuche in diesem Korpus erreichte, und dem, was ein wörtlicher Metadaten-Abgleich erreicht hätte.

Der naheliegende Einwand ist die Sprache, da wir englische Aktionswörter gegen Titel testen, die oft nicht auf Englisch sind. Beschränkt man sich auf modellbestätigte englische Titel, bleibt die Zahl bei 85,8%; Abschnitt 3.3 zeigt jeden Ausschnitt.

Wo die Aktion benannt wird, über alle 10.828 abgerufenen Momente

Waffle-Diagramm: 100 Felder, eines pro Prozentpunkt der 10.828 übereinstimmenden Momente; 91 sind nirgends benannt
Tabellenformat
Kategorie Momente Anteil Was das für eine Text-Pipeline bedeutet
im Titel benannt 386 3,6% wörtlicher Matcher findet es
nur in der Beschreibung 531 4,9% nur wenn Beschreibungen gelesen werden
nur in Tags 75 0,7% nur wenn Tags gelesen werden
nirgends benannt 9.836 90,8% wörtlicher Matcher findet es nicht

Ein echter Moment aus jeder Kategorie, denn “531 Momente sind nur in der Beschreibung benannt” ist eine Behauptung, und ein tatsächlicher Titel mit dem markierten übereinstimmenden Wort ist ein Beweis:

Kategorie Aktion Videotitel (öffnet bei der übereinstimmenden Sekunde) Treffer
im Titel benannt pour Teaching a beginner how to pour latte art patterns (Expert Barista Guide) Treffer auf “pour”
nur in der Beschreibung take GENTLE SOY SAUCE SOUP RAMEN (SHOYU RAMEN) | A Real Japanese Dad Cooks | Japanese cooking Treffer auf “take”
nur in Tags fold ورقة واحدة .. طيّات قليلة .. بدون لاصق.. وعالمٌ هرميٌ كامل! Treffer auf “fold”
nirgends benannt take # viral video in social media # viral koriyaan # sad story of koriyan romance kein Wort von “take” erscheint irgendwo in den Metadaten

Unsichtbarer Anteil, nach Domäne

Momente jeder Domäne aufgeteilt in nirgends benannt (rosa) vs. in Titel, Beschreibung oder Tags benannt (blau)
Zahlen im Tabellenformat
Domäne Nirgends benannt Geprüfte Momente
Tischplatte (DROID) 98,1% 1.836
Outdoor 95,9% 217
Ganzkörper 95,4% 866
Haushalt 92,0% 402
Bau 91,1% 987
Industrie 89,6% 4.612
Automotive 83,8% 1.908

Jedes übereinstimmende Video in jeder Domäne enthielt gescrapte Metadaten, daher ist jedes n der vollständige abgerufene Satz dieser Domäne. Niemand betitelt ein Video “einen Block in eine Schüssel legen”; Reparaturvideos kündigen hingegen an, was sie reparieren, weshalb Automotive die einzige Domäne ist, die ein wörtlicher Matcher teilweise erreicht.


1 Was ein Zeitstempel aus der Pipeline entfernt

Angenommen, Sie möchten zehn Sekunden davon, wie jemand eine Lötstelle lötet. Der übliche Weg umfasst fünf Schritte, und jeder davon läuft auf einer ganzen Videodatei: ein Video anhand seines Titels finden, es vollständig extrahieren, Ihre eigene Kopie nach dem Moment durchsuchen, diesen Moment herausschneiden und dann beschriften, was er zeigt.

Schritt eins verfehlt 90,8% dieser Momente direkt. Das Durchsuchen des Filmmaterials hingegen liefert das Video und die Sekunde darin, und einer der fünf Schritte hört auf zu existieren. Es gibt nichts mehr im extrahierten Video zu suchen, da Sie bereits wissen, wo der Moment ist. Das Schneiden muss noch erfolgen, da die Media Data API ganze Videos, Audio, Untertitel und Storyboards liefert und keinen Zeitstempel entgegennimmt, aber Sie schneiden gegen einen bekannten Offset statt nach einem zu suchen. Aus fünf Schritten werden vier.

Offline-Sammel-Pipelines teilen diese Arbeit häufig auf mehrere Systeme auf: Videos in Cloud-Speicher verschieben, sie Frame für Frame manuell oder halbautomatisch annotieren und zwischen Robotik-Formaten wie ROS oder MCAP und allgemeinen Videoformaten konvertieren. Jede Übergabe ist ein Ort, an dem Durchsatz verloren geht und an dem die zeitliche Ausrichtung zwischen Kameraströmen und Motorbefehlen driften kann. Nichts davon haben wir hier gemessen. Es ist der Kontext, der einen zurückgegebenen Zeitstempel wertvoll macht.

Herkömmlicher Weg (fünf Schritte, bezahlt für ganze Videos):

  1. Videos finden · Keyword-Suche über Titel
  2. Extrahieren · 5.066,5 Stunden Quellvideo (der teure Schritt, gemessen an der gescrapten Dauer jedes übereinstimmenden Videos)
  3. Suche ausführen · ein zweites Tool, über Ihre eigene Kopie
  4. Schneiden · jeden Clip auf den Moment zuschneiden
  5. Beschriften · annotieren, was geschnitten wurde

Mit Momenten-Suche (vier Schritte, bezahlt pro Sekunde):

  1. Szenen finden · Inhaltssuche gibt die Sekunde zurück
  2. Abrufen · ~24,58 Stunden rund um die zurückgegebenen Offsets (Schätzung: setzt voraus, dass jeder Moment höchstens 10 Sekunden Aktion ist)
  3. Schneiden · lokal schneiden, gegen einen bekannten Offset
  4. Beschriften · ein Frame pro Moment
Verschobenes Filmmaterial, maßstabsgetreu: zwei Balken auf einer Achse

2 Methode

Wir haben einen Satz für jede der 141 Aktionen verfasst und sie an die Video Search API gesendet. Der Satz für das Löten lautete:

einer der 141 Sätze, die wir gesendet haben

Nahaufnahme einer Hand, die einen Lötkolben an eine Leiterplattenverbindung hält, während die andere Hand Lötzinn zuführt, Tischlampenbeleuchtung

Anschließend haben wir den Titel, die Beschreibung und die Tags jedes zurückgegebenen Videos gescrapt. Bright Data dokumentiert den Index als auf gesampelten Frames basierend und nicht auf Titel, Beschreibung oder Tags, sodass die von uns bewerteten Felder nicht das sein sollten, was das Filmmaterial gefunden hat. Wir haben das nicht unabhängig getestet.

Wir haben 22 Aktionsnamen aus den Task-Strings von DROID entnommen, die wir auf Verbhäufigkeit hin gelesen haben, und die verbleibenden 119 als handverfasste Aktionen hinzugefügt, um die Prüfung über DROIDs Abdeckung hinaus zu erweitern.


3 Ergebnisse

3.1 Was jeder Weg kostet

Alles hier ist in Stunden über diesen Korpus, mit Dauern, die vom Scraper summiert wurden, sodass die Ausgangszahl eine Zählung und keine Schätzung ist. Wir haben kein Video extrahiert, daher erheben wir keinen Anspruch auf eine Byte-Zahl.

Hinter dem Wert 206,1× stehen zwei Zählungen. Die 5.066,5 Stunden sind eine echte Summe über 7.549 Videos. Die Clip-Zahl zählt jede (Video, Sekunde) einmal, über 8.849 verschiedene Sekunden, und multipliziert mit dem 10-Sekunden-Fenster.

Das Verhältnis hängt von zwei Entscheidungen ab: wie lang ein Clip ist und ob der lange Schwanz zählt, und der lange Schwanz ist der größere Hebel der beiden: 483 Videos von drei Stunden oder mehr sind ~6% des Sets und tragen ~60% der Stunden. Die vollständige Sensitivitätstabelle:

Reduktionsfaktor unter jeder Videolängenbegrenzung
Zahlen im Tabellenformat
Videos länger als verwerfen Videos Korpus-Stunden Verschiedene Sekunden Clip-Stunden (10 s) Reduktion
1 Std. 6.554 1.113,5 7.605 21,12 52,7×
2 Std. 6.873 1.563,8 8.017 22,27 70,2×
3 Std. 7.066 2.031,3 8.247 22,91 88,7×
6 Std. 7.364 3.272,8 8.609 23,91 136,9×
12 Std. 7.546 5.012,3 8.846 24,57 204,0×
alle behalten (veröffentlicht) 7.549 5.066,5 8.849 24,58 206,1×

Derselbe Korpus, auf beiden Wegen erhalten: 10.828 Match-Zeilen auf 8.849 verschiedenen Video-Sekunden. Zählt man jeden Treffer statt jede einzelne Sekunde, ergibt das 30,08 Clip-Stunden und eine Reduktion von 168,4×. Dasselbe Verhältnis gilt für die Überprüfungszeit nur, wenn die Alternative jedes Quellvideo vollständig überprüft, die Überprüfungszeit linear mit der Dauer skaliert und das Durchgehen von 8.849 separaten Clips keinen Overhead pro Clip verursacht.

3.2 Die Abgleichregel und was ihre Verschärfung bewirkt

Für jeden behaltenen Kandidatenmoment haben wir den Titel, die Beschreibung und die Tags des Videos geprüft – die wichtigsten in dieser Prüfung verfügbaren Metadatenfelder.

Ein Moment gilt als benannt, wenn ein Wort des Aktionsnamens mit mehr als zwei Zeichen als Teilzeichenkette ohne Berücksichtigung der Groß-/Kleinschreibung vorkommt, sodass “change” allein change_tire_wrench markiert und “car” in “carpet” gefunden wird. Das ist die großzügigste Regel, die wir hätten wählen können, was die Schlagzeile zu einem Mindestwert macht. Verschärft man sie, steigt sie:

Momente, die ein Text-Matcher unter vier zunehmend strengeren Regeln erreicht: 992, 868, 597, 206 von 10.828

Jede Regel, die strenger als die veröffentlichte ist, erhöht den Wert, was 90,8% zu einem Mindestwert statt einem Bestfall macht: 395 der 992 Momente, die die veröffentlichte Regel als benannt zählt, verdanken das einem Fragment innerhalb eines längeren Wortes. Jeder Wert ist gemessen, vier echte Durchläufe über den Korpus (supply_gap.py _variants()).

3.3 Viele sind in einer anderen Sprache betitelt

Wir haben für jeden der 10.828 übereinstimmenden Momente eine Titelsprache gelesen, sodass dies der gesamte Korpus und keine Stichprobe ist. Von diesen befinden sich 4.863 (~45%) in einem Video, das in einer von 77 benannten Nicht-Englisch-Sprachen betitelt ist, plus einem Titel, den das Modell nicht einordnen konnte. Dieselben englischen Aktionsbeschreibungen lieferten 423 Momente aus Hindi-betitelten Videos und 509 aus Portugiesisch-betitelten. Es wurden keine geografischen Felder gesammelt, daher sagt dies nichts darüber aus, wo die Videos produziert wurden.

Titelsprache jedes übereinstimmenden Moments, proportionaler Streifen

Titelsprache jedes übereinstimmenden Moments, über alle 79 gefundenen Sprachen.

Diese Mischung ist der Grund, warum wir den Korpus vor dem Vertrauen in die Schlagzeile auf Englisch eingeschränkt haben. Die Beschränkung auf bekannte englische Titel verschiebt die Zahl um einige Punkte und lässt den größten Teil bestehen, sodass ein Teil der Lücke ein Sprachunstimmigkeit ist und der Rest ein Beschreibungsfehler, der nach Beseitigung der Unstimmigkeit bestehen bleibt:

Anteil 'nirgends benannt', wenn der Korpus auf Englisch eingeschränkt wird: 90,8% gesamt, 87,6% ASCII, 85,8% englische Titel, 95,0% englisches Audio
Dieselben Zahlen als Tabelle
Ausschnitt Nirgends benannt n
alle Momente 90,8% 10.828
reine ASCII-Titel 87,6% 5.560
modellbestätigte englische Titel 85,8% 5.965
bestätigtes englisches Audio 95,0% 317 (zu wenige, um sich darauf zu stützen)

3.4 Pro Aktion

Sortiert nach dem Anteil ohne wörtlichen Aktionsbegriff in den verfügbaren Metadaten. 17 Aktionen haben keinen behaltenen Moment, dessen Metadaten die Zielaktion benennen. Über alle 141 Aktionen mit mindestens 8 geprüften Momenten liegt der Anteil zwischen 50,0% und 100,0%, Median 94,1%. Die 12 am wenigsten verborgenen:

Die 12 am wenigsten verborgenen Aktionen: Jeder Balken zeigt gefundene Momente, aufgeteilt in im eigenen Text benannt (blau) vs. nirgends benannt (rosa)
Zahlen im Tabellenformat
Aktion Domäne Gefunden Im eigenen Text benannt Nirgends benannt
wash_car Automotive 72 36 50,0%
wash_car_panel Automotive 78 36 53,8%
car_door_open Automotive 92 38 58,7%
car_door_close Automotive 91 36 60,4%
car_door Automotive 93 36 61,3%
pack_box Industrie 73 28 61,6%
grinder_use Industrie 69 23 66,7%
hand_saw_cut Industrie 77 25 67,5%
jack_up_car Automotive 78 24 69,2%
tape_box Industrie 75 23 69,3%
sit_stand Ganzkörper 28 8 71,4%
impact_driver Industrie 70 19 72,9%
Alle 141 Aktionen · gefunden / benannt / nirgends benannt, plus die indexweite Extrapolation pro Aktion
Aktion Domäne Gefunden Benannt Nirgends benannt Geschätzte Momente indexweit Nutzbare Rate Ratenbasis
climb_ladder Ganzkörper 93 0 100,0% 188.790 26,1% Aktion
crane_hook Industrie 84 0 100,0% 170.436 9,5% Aktion
flip Tischplatte (DROID) 87 0 100,0% 176.523 26,7% Aktion
lift Tischplatte (DROID) 89 0 100,0% 180.581 24,7% Aktion
load_cart Industrie 82 0 100,0% 166.460 9,8% Aktion
pick_up Tischplatte (DROID) 72 0 100,0% 146.088 47,9% Aktion
push Tischplatte (DROID) 91 0 100,0% 184.639 23,3% Aktion
push_heavy_cart Ganzkörper 70 0 100,0% 142.100 24,3% Aktion
push_trolley Industrie 65 0 100,0% 131.950 20,0% Aktion
refuel Automotive 91 0 100,0% 184.639 26,4% Aktion
refuel_nozzle Automotive 88 0 100,0% 178.552 27,6% Aktion
seatbelt_buckle Automotive 87 0 100,0% 176.523 29,9% Aktion
slide Tischplatte (DROID) 82 0 100,0% 166.378 32,1% Aktion
sort_parcel Industrie 82 0 100,0% 166.460 37,8% Aktion
stack Tischplatte (DROID) 65 0 100,0% 136.958 21,9% Aktion
unfold Tischplatte (DROID) 79 0 100,0% 160.291 57,0% Aktion
ziptie_bundle Industrie 82 0 100,0% 166.460 48,8% Aktion
carry_upstairs Ganzkörper 87 1 98,9% 176.610 25,6% Aktion
hang Tischplatte (DROID) 92 1 98,9% 181.596 12,1% Aktion
pull Tischplatte (DROID) 87 1 98,9% 176.523 18,4% Aktion
pull_trolley Ganzkörper 92 1 98,9% 186.760 22,8% Aktion
close Tischplatte (DROID) 83 1 98,8% 168.407 41,5% Aktion
emergency_stop Industrie 85 1 98,8% 172.465 22,6% Aktion
handbrake_pull Automotive 82 1 98,8% 166.378 31,7% Aktion
place Tischplatte (DROID) 84 1 98,8% 170.436 39,3% Aktion
remove Tischplatte (DROID) 86 1 98,8% 174.494 48,8% Aktion
turn_on Tischplatte (DROID) 85 1 98,8% 172.465 29,4% Aktion
count_stock Industrie 76 1 98,7% 154.280 32,4% Aktion
reach_overhead Ganzkörper 79 1 98,7% 160.370 46,8% Aktion
wipe Tischplatte (DROID) 77 1 98,7% 180.581 28,0% Aktion
crouch_down Ganzkörper 65 1 98,5% 131.950 34,9% Aktion
seat_chip Industrie 65 1 98,5% 131.950 46,9% Aktion
plaster_wall Bau 88 2 97,7% 178.552 25,3% Aktion
plug_in Haushalt 87 2 97,7% 176.523 36,5% Aktion
turn Tischplatte (DROID) 86 2 97,7% 174.494 27,9% Aktion
unplug_cable Industrie 88 2 97,7% 178.640 42,5% Aktion
label_parcel Industrie 85 2 97,6% 172.550 45,9% Aktion
move Tischplatte (DROID) 82 2 97,6% 166.378 34,2% Aktion
press Tischplatte (DROID) 83 2 97,6% 168.407 42,2% Aktion
spirit_level Industrie 83 2 97,6% 168.407 12,5% Aktion
conveyor_pick Industrie 79 2 97,5% 160.291 35,4% Aktion
grout_joint Bau 81 2 97,5% 164.349 28,4% Aktion
open_hood Automotive 80 2 97,5% 162.320 53,8% Aktion
trowel_mortar Bau 79 2 97,5% 160.291 28,2% Aktion
balance_load Ganzkörper 77 2 97,4% 156.310 21,1% Aktion
shovel_load Outdoor 74 2 97,3% 150.220 31,5% Aktion
scan_barcode Industrie 71 2 97,2% 144.059 27,1% Aktion
desolder_remove Industrie 63 2 96,8% 127.890 51,6% Aktion
pull_wire Bau 61 2 96,7% 123.769 30,0% Aktion
take Tischplatte (DROID) 90 3 96,7% 182.610 37,8% Aktion
forklift_controls Industrie 59 2 96,6% 119.711 27,1% Aktion
open_gate Ganzkörper 88 3 96,6% 178.640 21,6% Aktion
pour Tischplatte (DROID) 89 3 96,6% 183.624 56,2% Aktion
plug_in_socket Industrie 85 3 96,5% 172.550 36,5% Aktion
shrink_wrap Industrie 81 3 96,3% 164.430 22,5% Aktion
wipe_windshield Automotive 82 3 96,3% 166.378 34,6% Aktion
control_dial Industrie 72 3 95,8% 146.088 31,9% Aktion
steering Automotive 72 3 95,8% 146.088 59,7% Aktion
open_carton Industrie 69 3 95,7% 140.070 31,9% Aktion
put Tischplatte (DROID) 91 4 95,6% 184.639 41,8% Aktion
plant_seed Outdoor 67 3 95,5% 136.010 28,8% Aktion
steering_turn Automotive 43 2 95,3% 87.247 60,5% Aktion
pipe_fitting Industrie 83 4 95,2% 168.407 44,6% Aktion
open Tischplatte (DROID) 79 4 94,9% 173.987 44,2% Aktion
dig_soil Outdoor 76 4 94,7% 154.280 44,6% Aktion
sweep Haushalt 75 4 94,7% 152.175 29,3% Aktion
route_cable Industrie 74 4 94,6% 150.220 43,8% Aktion
gear_shift Automotive 73 4 94,5% 148.117 37,0% Aktion
stack_pallet Industrie 70 4 94,3% 142.100 12,9% Aktion
thermal_paste Industrie 69 4 94,2% 140.070 19,1% Aktion
ev_charge_plug Automotive 85 5 94,1% 172.465 26,2% Aktion
carry_box Haushalt 84 5 94,0% 170.436 25,0% Aktion
open_trunk Automotive 84 5 94,0% 170.436 28,6% Aktion
socket_ratchet Industrie 82 5 93,9% 166.378 31,7% Aktion
top_up_fluid Automotive 82 5 93,9% 166.378 37,0% Aktion
press_machine_button Industrie 79 5 93,7% 160.291 31,6% Aktion
valve_turn Industrie 79 5 93,7% 160.291 19,0% Aktion
insert_usb Industrie 78 5 93,6% 158.340 46,0% Aktion
caulk_gun Industrie 86 6 93,0% 174.494 34,1% Aktion
adjust_mirror Automotive 85 6 92,9% 172.465 20,0% Aktion
sand_surface Industrie 85 6 92,9% 172.465 55,3% Aktion
cut_pipe Bau 68 5 92,6% 137.972 41,8% Aktion
machine_unload Industrie 68 5 92,6% 137.972 30,9% Aktion
unload_truck Industrie 68 5 92,6% 138.040 35,3% Aktion
machine_lever Industrie 80 6 92,5% 162.320 21,2% Aktion
assemble_snap_fit Industrie 77 6 92,2% 156.310 51,3% Aktion
measure_tape Industrie 76 6 92,1% 154.204 42,1% Aktion
chisel_carve Industrie 49 4 91,8% 99.421 42,9% Aktion
wrench_bolt Industrie 85 7 91,8% 172.465 34,1% Aktion
hammer_nail Industrie 84 7 91,7% 170.436 20,2% Aktion
solder_pipe Bau 70 6 91,4% 142.030 37,1% Aktion
step_over Ganzkörper 70 6 91,4% 142.100 28,6% Aktion
gauge_read Industrie 78 7 91,0% 158.262 35,9% Aktion
fold Tischplatte (DROID) 77 7 90,9% 158.769 57,1% Aktion
tile_place Bau 83 8 90,4% 168.407 30,1% Aktion
solder Industrie 55 6 89,1% 111.595 45,5% Aktion
screwdriver Industrie 72 8 88,9% 146.088 43,1% Aktion
bend_lift Ganzkörper 62 7 88,7% 125.860 32,3% Aktion
power_drill_hole Industrie 70 8 88,6% 142.030 40,9% Aktion
solder_joint Industrie 61 7 88,5% 123.830 55,7% Aktion
mix_cement Bau 68 8 88,2% 137.972 43,3% Aktion
nail_gun Bau 68 8 88,2% 137.972 29,8% Aktion
drywall_screw Bau 72 9 87,5% 146.088 28,2% Aktion
lay_brick Bau 80 10 87,5% 162.320 27,5% Aktion
clamp_workpiece Industrie 62 8 87,1% 125.798 35,5% Aktion
machine_load Industrie 62 8 87,1% 125.798 19,4% Aktion
cut_vegetable Haushalt 83 11 86,7% 168.407 42,2% Aktion
torque_wrench Industrie 83 11 86,7% 168.407 31,3% Aktion
cut_knife Haushalt 73 10 86,3% 148.117 34,2% Aktion
tire_pressure Automotive 73 10 86,3% 148.117 47,9% Aktion
weld_seam Industrie 87 12 86,2% 176.523 31,4% Aktion
pliers_grip Industrie 72 10 86,1% 146.088 50,7% Aktion
paint_brush Bau 90 13 85,6% 182.610 22,2% Aktion
wire_cut Industrie 76 11 85,5% 154.204 34,2% Aktion
paint_roller Bau 79 13 83,5% 160.291 15,2% Aktion
breadboard_wire Industrie 65 11 83,1% 131.950 44,6% Aktion
change_tire Automotive 69 12 82,6% 140.001 50,0% Aktion
kneel_work Ganzkörper 55 10 81,8% 111.650 45,5% Aktion
change_tire_wrench Automotive 71 13 81,7% 144.059 46,4% Aktion
assemble_part Industrie 70 13 81,4% 142.030 64,3% Aktion
check_oil_dipstick Automotive 80 15 81,2% 162.320 43,8% Aktion
screw_panel Industrie 81 16 80,2% 164.430 37,5% Aktion
lathe_operate Industrie 51 11 78,4% 103.479 31,4% Aktion
engine_bay Automotive 77 17 77,9% 156.233 56,6% Aktion
probe_test Industrie 63 14 77,8% 127.890 54,8% Aktion
machine_control Industrie 78 18 76,9% 158.262 36,4% Aktion
screwdriver_drive Industrie 78 20 74,4% 158.262 39,5% Aktion
weld Industrie 86 22 74,4% 174.494 31,4% Aktion
power_drill Industrie 70 18 74,3% 142.030 48,6% Aktion
impact_driver Industrie 70 19 72,9% 142.030 35,3% Aktion
sit_stand Ganzkörper 28 8 71,4% 56.840 35,7% Aktion
tape_box Industrie 75 23 69,3% 152.250 26,4% Aktion
jack_up_car Automotive 78 24 69,2% 158.262 27,3% Aktion
hand_saw_cut Industrie 77 25 67,5% 156.233 32,9% Aktion
grinder_use Industrie 69 23 66,7% 140.001 42,6% Aktion
pack_box Industrie 73 28 61,6% 148.117 50,0% Aktion
car_door Automotive 93 36 61,3% 188.697 20,4% Aktion
car_door_close Automotive 91 36 60,4% 184.639 26,4% Aktion
car_door_open Automotive 92 38 58,7% 186.668 22,8% Aktion
wash_car_panel Automotive 78 36 53,8% 158.262 41,6% Aktion
wash_car Automotive 72 36 50,0% 146.088 45,1% Aktion

Auffindbarkeit pro Aktion. ‘Benannt’ zählt Momente, deren eigener Titel, Beschreibung oder Tags ein Wort des Aktionsnamens unter der veröffentlichten Teilzeichenkettenregel enthalten. Die Extrapolationsspalten multiplizieren die gemessene Ausbeute pro Shard jeder Aktion mit der Shard-Anzahl des Index und dividieren durch die gemessene aktionsübergreifende Überschneidung; ‘Ratenbasis’ gibt an, ob die nutzbare Rate an den eigenen Frames der Aktion gemessen, von ihrer Domäne oder vom korpusweiten Wert übernommen wurde.

3.5 Die Frames abrufen

Um zu prüfen, ob die Suche überhaupt korrekt war, haben wir aus jedem übereinstimmenden Video einen echten Frame gezogen und ihn betrachtet. Was YouTube ohne Extraktion des Videos bereitstellt, ist das Storyboard, ein Sprite-Sheet mit Thumbnails, dessen Abtastintervall mit der Laufzeit zunimmt: wir maßen 1 s bei Videos bis zu 109 s, 2 s von 175 s bis 275 s, 5 s von 454 s bis 892 s und 10 s ab 1.366 s aufwärts. Die Schrittgrenzen zwischen diesen Bereichen wurden durch die 12 untersuchten Videos nicht aufgelöst. Das beurteilte Bild ist das nächste Sample bei oder vor der übereinstimmenden Sekunde, sodass es bis zu ein Intervall früh sein kann – im schlimmsten Fall 10 s und für etwas mehr als die Hälfte der Frames 5 s oder 10 s. Gemessen durch storyboard_probe.py; die Spezifikationen pro Video befinden sich in data/storyboard_spec.json.

Ein Vision-Modell hat alle 10.750 von 10.828 erhaltenen Frames bewertet, sodass jede Rate hier auf 99,3% des Korpus und nicht auf einer Stichprobe gemessen wird. 93,8% sind echtes Filmmaterial und keine Animation, kein Spiel oder Bildschirmaufzeichnung; 25,7% zeigten die Aktion sichtbar im Gange und 57,4% zeigten sie im Gange oder vorbereitet; 34,5% erzielten 3 oder besser auf einer Nutzbarkeits-Skala von 0 bis 5. Diese letzte Zahl ist ein Urteil über einen nachgelagerten Trainingsprozess, den das Modell nicht beobachten kann, und verhält sich entsprechend: Bei einer 60-Frame-Stichprobe umspannten vier Durchläufe mit identischer Konfiguration 3,4 Punkte, und eine Umformulierung der Bewertungsrubrik verschob sie um 20. Der sichtbare Aktionsanteil verschob sich über dieselbe Rubrikänderung um 1,7, was ihn zur Kennzahl macht, die über Durchläufe hinweg verglichen werden sollte.

Frame-Akquisition:

Frame-Extraktionsergebnisse über alle versuchten Momente
Zahlen im Tabellenformat
Ergebnis Momente Anteil
Frames erhalten 10.750 / 10.828 99%
Kein parsbares Storyboard 75 0,7%
Sprite-Abruf fehlgeschlagen 3 0,03%

Frame-Akquisition. Wir haben Storyboards direkt abgerufen und bei 863 der 10.828 Momente Rate-Limiting getroffen, von denen 856 in einem späteren Durchlauf wiederhergestellt wurden, sodass keiner der 78 verlorenen Momente auf einem 429 endete; die Media Data API ist der unterstützte Weg für diesen Schritt und gibt Storyboards direkt zurück. Diese Prüfung hat keinen Aufruf dazu gemacht. Diese Momente befinden sich auf 7.549 Videos, und ein Video kostet einen Watch-Page-Abruf plus mindestens ein Sprite-Sheet, pro Video gecacht.


4 Die Momente, abspielbar

Treffer werden gegen den nächsten Storyboard-Frame bei oder vor der Sekunde angezeigt, für die sie übereinstimmten. Das Ranking ist nicht kuratiert. 10.750 der 10.828 Momente haben einen eigenen Frame, und die vollständige Galerie enthält 10.761 Zeilen, da 11 weitere ein Bild mit einer anderen Aktion teilen, die bei derselben Sekunde übereinstimmte. Diese Zeilen basieren auf 8.792 verschiedenen Bildern, da der Dateiname ein Video und eine Sekunde und keine Aktion benennt.

Unten sind die am höchsten bewerteten übereinstimmenden Momente, einer pro Aktion, direkt aus dem Ranking. Klicken Sie auf einen Frame, um das Quellvideo ab der übereinstimmenden Sekunde abzuspielen.

Hand using tape measure on wooden board Hands holding copper pipe cutter tool Pink gloved hands arranging white metal small parts
measure_tape · 0,391 · nützlich 4/5
Hand benutzt Maßband auf Holzbrett
Shootout review and a work story!
cut_pipe · 0,388 · nützlich 2/5
Hände halten Kupferrohrschneider-Werkzeug
How Raw Copper Turns into a Masterpiece with Artistic Hammer Strikes⚒️🔥🇮🇷
machine_load · 0,386 · nützlich 2/5
Rosa behandschuhte Hände ordnen kleine weiße Metallteile an
THK rail | Installation guide | THK rail | Rail removal and installation | 0363.
Hands on forklift controls and steering wheel Hands near circuit board, unclear soldering setup Both hands gripping steering wheel, turning
forklift_controls · 0,383 · nützlich 5/5
Hände an Gabelstapler-Bedienelementen und Lenkrad
JUST DRIVE : Forklift #38
solder · 0,382 · nützlich 3/5
Hände nahe Leiterplatte, unklares Löt-Setup
⚡ Simple DIY Repair Old Bike Battery And Install Separate USB Charging Port For
steering_turn · 0,378 · nützlich 5/5
Beide Hände greifen Lenkrad, drehen
1995 Volvo 850 T5-R Wagon – POV Driving Impressions
Hand near tape rolls and packing supplies Hands manipulating white fabric on surface Gloved hands near industrial machine setup
tape_box · 0,376 · nützlich 1/5
Hand nahe Kleberollenrollen und Verpackungsmaterial
Cell 32140 high discharge line – battery pack accessories 0824457979
wipe · 0,374 · nützlich 3/5
Hände manipulieren weißen Stoff auf Oberfläche
Washed Notebook ASMR 📘✨ Radiator‑Dried Pages With Intense Crinkles
machine_unload · 0,373 · nützlich 1/5
Behandschuhte Hände nahe industrieller Maschineneinrichtung
Transmission Assembly – 1929 Ford Model A
Hands positioning nail gun on timber frame Person rising from chair using armrests Hand writing in notebook near clipboard
nail_gun · 0,371 · nützlich 4/5
Hände positionieren Nagelpistoile auf Holzrahmen
Building a deck for garden raised bed – Part 1
sit_stand · 0,371 · nützlich 5/5
Person erhebt sich mit Armlehnen vom Stuhl
Flexibility and Mobility Senior Chair Exercise
count_stock · 0,371 · nützlich 2/5
Hand schreibt in Notizbuch nahe Klemmbrett
[26.4.16.Thu.] Study with me | Studying together | Thursday meet-up! | Firefight
Two hands holding multimeter probes on circuit Hands holding bottles near box opening, no cutting Person prone on floor in work position
probe_test · 0,371 · nützlich 5/5
Zwei Hände halten Multimeter-Prüfspitzen an Schaltkreis
How to Measure Electronic Components with a Multimeter (Complete Guide)
open_carton · 0,369 · nützlich 2/5
Hände halten Flaschen nahe Kartonöffnung, kein Schneiden
Oddly Satisfying Video-How to Cutting New Wooden Fruits and Vegetables ASMR – Cu
kneel_work · 0,369 · nützlich 3/5
Person liegt auf dem Boden in Arbeitsposition
Lupimorphie, animal-performance by Régis Moulu, Capsule 114, dance
Person pushing heavy cart with both hands Hand guiding chisel into wood carving Hand turning lathe cross-slide handwheel with spinning part
push_heavy_cart · 0,367 · nützlich 4/5
Person schiebt schweren Wagen mit beiden Händen
2321FI”2-Step Multi-Functional Aluminum Alloy Step Trolley: Comprehensive Usage
chisel_carve · 0,366 · nützlich 5/5
Hand führt Meißel in Holzschnitzerei
adapt and overcome 🌱
lathe_operate · 0,362 · nützlich 5/5
Hand dreht Drehbank-Querschlitten-Handrad mit drehendem Teil
Unbelievable Damage! Caterpillar Cylindrical Roller Bearing Destroyed 😱

Jede Zelle: die Aktion, für die sie übereinstimmte, und ihr Relevanz-Score, dann was das Vision-Modell im Frame sah (dem das Bild ohne Titel gezeigt wurde), dann der eigene Titel des Videos auf Englisch. Zeitstempel öffnen zwei Sekunden früh, damit der Moment ins Bild kommt.


Das Abrufen eines Moments per Beschreibung ist eine etablierte Aufgabe: zeitliche Verankerung auf Charades-STA, Highlight-Erkennung auf QVHighlights, natürlichsprachige Abfragen in Ego4D. Wir stellen hier keine neue Methode vor.

Das Konstrukt hat Vorläufer. TVR (2020) hat seine 108.965 Abfragen danach beschriftet, ob Video, Untertitel oder beides sie beantwortete, und berichtete 74,2% nur Video. Was sich unterscheidet, ist der Korpus und der Zweck: offene Web-Videos statt sechs TV-Sendungen, physische Aktionen, eine verifizierte Teilstichprobe und ein Kostenverhältnis. Das Veröffentlichungsformat folgt AVA und HowTo100M: Kennung, Zeitstempel und Label, ohne Video weiterzugeben. Die Suche erfolgt durchgehend über die Video Search API. Frames wurden hier durch Parsing des YouTube-Storyboards von der Watch-Page gewonnen; zu keinem Zeitpunkt wurde ein Clip extrahiert. Für einen Produktionslauf ist die Media Data API der unterstützte Weg.

Was die Prüfung feststellt, ist enger als ein Ersatz für Roboter-Demonstrationen. Das Web enthält eine große und schlecht indizierte Schicht von Filmmaterial mit physischen Aktionen, und zeitgestempelte visuelle Suche macht diese Schicht erheblich leichter erreichbar. Ob auf diese Weise kuratiertes Filmmaterial ein Robotik- oder World-Modell-System messbar verbessert, ist die nächste Frage, und ihre Beantwortung erfordert ein Trainingsexperiment, das diese Prüfung nicht durchgeführt hat.


6 Zitierung

@misc{webmoments2026,
  title        = {Finding the Web's Hidden Robot Training Moments in
                  Public Web Video Data},
  author       = {Bright Data},
  year         = {2026},
  howpublished = {Technical report},
  note         = {141 physical actions, 10,828 retrieved match rows over
                  8,849 distinct video-second moments, and
                  10,750 frames reviewed by a vision model}
}