Videodaten können dabei helfen, Roboter, einschließlich humanoider Roboter, darin zu trainieren, physische Aufgaben zu verstehen und auszuführen. Dies umfasst VLA-Modelle, die visuelle Beobachtungen und Sprachanweisungen mit Aktionen verknüpfen, sowie World-Modelle, die lernen, wie sich eine Umgebung im Laufe der Zeit verändert. Das öffentliche Web enthält Millionen von Videos, in denen Menschen diese Arbeiten ausführen, und das Auffinden einer bestimmten Aktion darin ist schwierig, da ein Titel das allgemeine Thema eines Videos beschreibt, während die Aktionen im Filmmaterial unbenannt bleiben. Beschreibungen und Tags sind in der Regel nicht besser.
Für diese Studie haben wir die Video Search API von Bright Data verwendet. Die Video Search API ist ein Tool, das es ermöglicht, Momente in Web-Videos visuell zu durchsuchen.
Man übergibt ihr eine Beschreibung einer Aktion in natürlicher Sprache, sie durchsucht den visuellen Inhalt öffentlicher Videos anstelle der daran angehängten Texte und gibt Kandidatenvideos zusammen mit Zeitstempeln zurück, an denen die Aktion möglicherweise erscheint. Die herkömmliche Keyword-Suche funktioniert umgekehrt: Sie gleicht Ihre Wörter mit Titel, Beschreibung und Tags eines Videos ab, sodass die beiden Ansätze sehr unterschiedliche Aufnahmen erreichen.
Wir haben ihr 141 physische Aktionen gesendet und 10.828 Momente in 7.549 Videos zurückerhalten. Für jeden behaltenen Moment haben wir geprüft, ob ein Wort des Aktionsnamens im Titel, der Beschreibung oder den Tags des Videos vorkommt. In 90,8% der Fälle war dies nicht der Fall.
Wenn Sie Trainingsmaterial per Keyword sammeln, sind diese 90,8% die Daten, die Sie verpassen, und das macht die Ausbeute der API 10-mal größer als das, was die Textsuche erreichen könnte. Diese zusätzlichen Momente zeigen dieselben Aktionen, nach denen Sie gefragt haben, in Videos, deren Titel über etwas anderes sprechen, und sie bleiben für eine Text-Pipeline unsichtbar, egal wie viele Abfragen Sie gegen diese Felder ausführen.
Wir haben wörtliche Teilzeichenketten mit Titel, Beschreibung und Tags abgeglichen und innerhalb des Korpus gezählt, den die API selbst zurückgegeben hat, sodass das Verhältnis unter diesen beiden Bedingungen gilt. Semantische Suche, mehrsprachige Suche, Transkriptsuche und YouTubes eigenes Ranking liegen außerhalb dessen, was wir getestet haben.
Das Ergebnis in drei Zahlen
| 10,9× | mehr Momente als bei wörtlichem Abgleich | Die Inhaltssuche lieferte 10.828 Ergebnisse; 992 tragen ein Wort des Aktionsnamens in ihren Metadaten |
| 90,8% | nirgends benannt | 9.836 von 10.828 Momenten enthalten keine Erwähnung der Aktion in Titel, Beschreibung oder Tags |
| 56,1% | kein Hinweis im Titel | ein schwächerer Test als die Suche. Wir haben google/gemini-2.5-flash gefragt, ob irgendetwas im Titel auch nur entfernt mit der Aktion zusammenhängt, einschließlich Hinweise, die viel zu vage zum Suchen sind. Es fand in 6.071 von 10.828 Fällen nichts |
Woher diese drei Zahlen stammen
Die ersten beiden ergeben sich aus derselben Division: 9.836 von 10.828 Momenten enthalten kein Wort der Aktion in einem Feld, und die 992, die es tun, sind das, was ein wörtlicher Matcher erreicht: 10.828 ÷ 992 = 10,9. Die vier Kategorien (Titel, Beschreibung, Tags, keine) schließen sich gegenseitig aus und ergeben zusammen die geprüfte Gesamtzahl. Beide werden pro Match-Zeile gezählt; reduziert man sie auf die 8.849 unterschiedlichen Video-Sekunden, ergibt sich ein Verhältnis von 8,9×.
Die dritte zählt die Titel, die das Modell als nicht verwandt eingestuft hat: 6.071 von 10.828, eine Zeile pro Moment über 7.549 verschiedene Videos.
Die Zeitstempel haben eine zweite Konsequenz. Erlaubt man jedem Moment höchstens 10 Sekunden Aktion, werden aus den 5.066,5 Stunden Quellvideo, in denen diese Treffer liegen, 24,58 Stunden Clips, was das zu Bewegende, Speichernde und Überprüfende um das 206,1-Fache reduziert.
Was die Suche tatsächlich zurückgab. Dass die Suche zuversichtlich ist, bedeutet nicht, dass sie richtig liegt, daher haben wir aus fast jedem Treffer einen echten Frame gezogen und ein Vision-Modell alle davon bewertet. Abschnitt 3.5 enthält die Raten. Diese Prüfung liefert Kandidatenmaterial zur Entdeckung und Kuratierung; keine Richtlinie, kein World-Modell und kein Roboter wurde damit trainiert.
Sechs Beispiel-Videos und ihre Titel auf YouTube
Was ein Vision-Modell sah, dem das Bild ohne Titel gezeigt wurde, verglichen mit dem eigenen Titel des Videos, ins Englische übersetzt, wo eine Ausgangssprache angegeben ist. Eine KI hat jeden Titel im Korpus auf einen Hinweis auf die jeweilige Aktion geprüft und diese sechs als nicht verwandt eingestuft: ein bloßes Datum, ein Koranvers, ein Wirtschaftsnachrichtenblock. Wir haben jeden Frame manuell bestätigt und jedes Video ist live. Klicken Sie auf einen Frame, um das Video ab dieser Sekunde abzuspielen.
90,8% der abgerufenen Momente sind in ihren Metadaten nirgends benannt
Dieser Anteil ist die Lücke zwischen dem, was die Inhaltssuche in diesem Korpus erreichte, und dem, was ein wörtlicher Metadaten-Abgleich erreicht hätte.
Der naheliegende Einwand ist die Sprache, da wir englische Aktionswörter gegen Titel testen, die oft nicht auf Englisch sind. Beschränkt man sich auf modellbestätigte englische Titel, bleibt die Zahl bei 85,8%; Abschnitt 3.3 zeigt jeden Ausschnitt.
Wo die Aktion benannt wird, über alle 10.828 abgerufenen Momente
Tabellenformat
| Kategorie | Momente | Anteil | Was das für eine Text-Pipeline bedeutet |
|---|---|---|---|
| im Titel benannt | 386 | 3,6% | wörtlicher Matcher findet es |
| nur in der Beschreibung | 531 | 4,9% | nur wenn Beschreibungen gelesen werden |
| nur in Tags | 75 | 0,7% | nur wenn Tags gelesen werden |
| nirgends benannt | 9.836 | 90,8% | wörtlicher Matcher findet es nicht |
Ein echter Moment aus jeder Kategorie, denn “531 Momente sind nur in der Beschreibung benannt” ist eine Behauptung, und ein tatsächlicher Titel mit dem markierten übereinstimmenden Wort ist ein Beweis:
| Kategorie | Aktion | Videotitel (öffnet bei der übereinstimmenden Sekunde) | Treffer |
|---|---|---|---|
| im Titel benannt | pour |
Teaching a beginner how to pour latte art patterns (Expert Barista Guide) | Treffer auf “pour” |
| nur in der Beschreibung | take |
GENTLE SOY SAUCE SOUP RAMEN (SHOYU RAMEN) | A Real Japanese Dad Cooks | Japanese cooking | Treffer auf “take” |
| nur in Tags | fold |
ورقة واحدة .. طيّات قليلة .. بدون لاصق.. وعالمٌ هرميٌ كامل! | Treffer auf “fold” |
| nirgends benannt | take |
# viral video in social media # viral koriyaan # sad story of koriyan romance | kein Wort von “take” erscheint irgendwo in den Metadaten |
Unsichtbarer Anteil, nach Domäne
Zahlen im Tabellenformat
| Domäne | Nirgends benannt | Geprüfte Momente |
|---|---|---|
| Tischplatte (DROID) | 98,1% | 1.836 |
| Outdoor | 95,9% | 217 |
| Ganzkörper | 95,4% | 866 |
| Haushalt | 92,0% | 402 |
| Bau | 91,1% | 987 |
| Industrie | 89,6% | 4.612 |
| Automotive | 83,8% | 1.908 |
Jedes übereinstimmende Video in jeder Domäne enthielt gescrapte Metadaten, daher ist jedes n der vollständige abgerufene Satz dieser Domäne. Niemand betitelt ein Video “einen Block in eine Schüssel legen”; Reparaturvideos kündigen hingegen an, was sie reparieren, weshalb Automotive die einzige Domäne ist, die ein wörtlicher Matcher teilweise erreicht.
1 Was ein Zeitstempel aus der Pipeline entfernt
Angenommen, Sie möchten zehn Sekunden davon, wie jemand eine Lötstelle lötet. Der übliche Weg umfasst fünf Schritte, und jeder davon läuft auf einer ganzen Videodatei: ein Video anhand seines Titels finden, es vollständig extrahieren, Ihre eigene Kopie nach dem Moment durchsuchen, diesen Moment herausschneiden und dann beschriften, was er zeigt.
Schritt eins verfehlt 90,8% dieser Momente direkt. Das Durchsuchen des Filmmaterials hingegen liefert das Video und die Sekunde darin, und einer der fünf Schritte hört auf zu existieren. Es gibt nichts mehr im extrahierten Video zu suchen, da Sie bereits wissen, wo der Moment ist. Das Schneiden muss noch erfolgen, da die Media Data API ganze Videos, Audio, Untertitel und Storyboards liefert und keinen Zeitstempel entgegennimmt, aber Sie schneiden gegen einen bekannten Offset statt nach einem zu suchen. Aus fünf Schritten werden vier.
Offline-Sammel-Pipelines teilen diese Arbeit häufig auf mehrere Systeme auf: Videos in Cloud-Speicher verschieben, sie Frame für Frame manuell oder halbautomatisch annotieren und zwischen Robotik-Formaten wie ROS oder MCAP und allgemeinen Videoformaten konvertieren. Jede Übergabe ist ein Ort, an dem Durchsatz verloren geht und an dem die zeitliche Ausrichtung zwischen Kameraströmen und Motorbefehlen driften kann. Nichts davon haben wir hier gemessen. Es ist der Kontext, der einen zurückgegebenen Zeitstempel wertvoll macht.
Herkömmlicher Weg (fünf Schritte, bezahlt für ganze Videos):
- Videos finden · Keyword-Suche über Titel
- Extrahieren · 5.066,5 Stunden Quellvideo (der teure Schritt, gemessen an der gescrapten Dauer jedes übereinstimmenden Videos)
- Suche ausführen · ein zweites Tool, über Ihre eigene Kopie
- Schneiden · jeden Clip auf den Moment zuschneiden
- Beschriften · annotieren, was geschnitten wurde
Mit Momenten-Suche (vier Schritte, bezahlt pro Sekunde):
- Szenen finden · Inhaltssuche gibt die Sekunde zurück
- Abrufen · ~24,58 Stunden rund um die zurückgegebenen Offsets (Schätzung: setzt voraus, dass jeder Moment höchstens 10 Sekunden Aktion ist)
- Schneiden · lokal schneiden, gegen einen bekannten Offset
- Beschriften · ein Frame pro Moment
2 Methode
Wir haben einen Satz für jede der 141 Aktionen verfasst und sie an die Video Search API gesendet. Der Satz für das Löten lautete:
einer der 141 Sätze, die wir gesendet haben
Nahaufnahme einer Hand, die einen Lötkolben an eine Leiterplattenverbindung hält, während die andere Hand Lötzinn zuführt, Tischlampenbeleuchtung
Anschließend haben wir den Titel, die Beschreibung und die Tags jedes zurückgegebenen Videos gescrapt. Bright Data dokumentiert den Index als auf gesampelten Frames basierend und nicht auf Titel, Beschreibung oder Tags, sodass die von uns bewerteten Felder nicht das sein sollten, was das Filmmaterial gefunden hat. Wir haben das nicht unabhängig getestet.
Wir haben 22 Aktionsnamen aus den Task-Strings von DROID entnommen, die wir auf Verbhäufigkeit hin gelesen haben, und die verbleibenden 119 als handverfasste Aktionen hinzugefügt, um die Prüfung über DROIDs Abdeckung hinaus zu erweitern.
3 Ergebnisse
3.1 Was jeder Weg kostet
Alles hier ist in Stunden über diesen Korpus, mit Dauern, die vom Scraper summiert wurden, sodass die Ausgangszahl eine Zählung und keine Schätzung ist. Wir haben kein Video extrahiert, daher erheben wir keinen Anspruch auf eine Byte-Zahl.
Hinter dem Wert 206,1× stehen zwei Zählungen. Die 5.066,5 Stunden sind eine echte Summe über 7.549 Videos. Die Clip-Zahl zählt jede (Video, Sekunde) einmal, über 8.849 verschiedene Sekunden, und multipliziert mit dem 10-Sekunden-Fenster.
Das Verhältnis hängt von zwei Entscheidungen ab: wie lang ein Clip ist und ob der lange Schwanz zählt, und der lange Schwanz ist der größere Hebel der beiden: 483 Videos von drei Stunden oder mehr sind ~6% des Sets und tragen ~60% der Stunden. Die vollständige Sensitivitätstabelle:
Zahlen im Tabellenformat
| Videos länger als verwerfen | Videos | Korpus-Stunden | Verschiedene Sekunden | Clip-Stunden (10 s) | Reduktion |
|---|---|---|---|---|---|
| 1 Std. | 6.554 | 1.113,5 | 7.605 | 21,12 | 52,7× |
| 2 Std. | 6.873 | 1.563,8 | 8.017 | 22,27 | 70,2× |
| 3 Std. | 7.066 | 2.031,3 | 8.247 | 22,91 | 88,7× |
| 6 Std. | 7.364 | 3.272,8 | 8.609 | 23,91 | 136,9× |
| 12 Std. | 7.546 | 5.012,3 | 8.846 | 24,57 | 204,0× |
| alle behalten (veröffentlicht) | 7.549 | 5.066,5 | 8.849 | 24,58 | 206,1× |
Derselbe Korpus, auf beiden Wegen erhalten: 10.828 Match-Zeilen auf 8.849 verschiedenen Video-Sekunden. Zählt man jeden Treffer statt jede einzelne Sekunde, ergibt das 30,08 Clip-Stunden und eine Reduktion von 168,4×. Dasselbe Verhältnis gilt für die Überprüfungszeit nur, wenn die Alternative jedes Quellvideo vollständig überprüft, die Überprüfungszeit linear mit der Dauer skaliert und das Durchgehen von 8.849 separaten Clips keinen Overhead pro Clip verursacht.
3.2 Die Abgleichregel und was ihre Verschärfung bewirkt
Für jeden behaltenen Kandidatenmoment haben wir den Titel, die Beschreibung und die Tags des Videos geprüft – die wichtigsten in dieser Prüfung verfügbaren Metadatenfelder.
Ein Moment gilt als benannt, wenn ein Wort des Aktionsnamens mit mehr als zwei Zeichen als Teilzeichenkette ohne Berücksichtigung der Groß-/Kleinschreibung vorkommt, sodass “change” allein change_tire_wrench markiert und “car” in “carpet” gefunden wird. Das ist die großzügigste Regel, die wir hätten wählen können, was die Schlagzeile zu einem Mindestwert macht. Verschärft man sie, steigt sie:
Jede Regel, die strenger als die veröffentlichte ist, erhöht den Wert, was 90,8% zu einem Mindestwert statt einem Bestfall macht: 395 der 992 Momente, die die veröffentlichte Regel als benannt zählt, verdanken das einem Fragment innerhalb eines längeren Wortes. Jeder Wert ist gemessen, vier echte Durchläufe über den Korpus (supply_gap.py _variants()).
3.3 Viele sind in einer anderen Sprache betitelt
Wir haben für jeden der 10.828 übereinstimmenden Momente eine Titelsprache gelesen, sodass dies der gesamte Korpus und keine Stichprobe ist. Von diesen befinden sich 4.863 (~45%) in einem Video, das in einer von 77 benannten Nicht-Englisch-Sprachen betitelt ist, plus einem Titel, den das Modell nicht einordnen konnte. Dieselben englischen Aktionsbeschreibungen lieferten 423 Momente aus Hindi-betitelten Videos und 509 aus Portugiesisch-betitelten. Es wurden keine geografischen Felder gesammelt, daher sagt dies nichts darüber aus, wo die Videos produziert wurden.
Titelsprache jedes übereinstimmenden Moments, über alle 79 gefundenen Sprachen.
Diese Mischung ist der Grund, warum wir den Korpus vor dem Vertrauen in die Schlagzeile auf Englisch eingeschränkt haben. Die Beschränkung auf bekannte englische Titel verschiebt die Zahl um einige Punkte und lässt den größten Teil bestehen, sodass ein Teil der Lücke ein Sprachunstimmigkeit ist und der Rest ein Beschreibungsfehler, der nach Beseitigung der Unstimmigkeit bestehen bleibt:
Dieselben Zahlen als Tabelle
| Ausschnitt | Nirgends benannt | n |
|---|---|---|
| alle Momente | 90,8% | 10.828 |
| reine ASCII-Titel | 87,6% | 5.560 |
| modellbestätigte englische Titel | 85,8% | 5.965 |
| bestätigtes englisches Audio | 95,0% | 317 (zu wenige, um sich darauf zu stützen) |
3.4 Pro Aktion
Sortiert nach dem Anteil ohne wörtlichen Aktionsbegriff in den verfügbaren Metadaten. 17 Aktionen haben keinen behaltenen Moment, dessen Metadaten die Zielaktion benennen. Über alle 141 Aktionen mit mindestens 8 geprüften Momenten liegt der Anteil zwischen 50,0% und 100,0%, Median 94,1%. Die 12 am wenigsten verborgenen:
Zahlen im Tabellenformat
| Aktion | Domäne | Gefunden | Im eigenen Text benannt | Nirgends benannt |
|---|---|---|---|---|
wash_car |
Automotive | 72 | 36 | 50,0% |
wash_car_panel |
Automotive | 78 | 36 | 53,8% |
car_door_open |
Automotive | 92 | 38 | 58,7% |
car_door_close |
Automotive | 91 | 36 | 60,4% |
car_door |
Automotive | 93 | 36 | 61,3% |
pack_box |
Industrie | 73 | 28 | 61,6% |
grinder_use |
Industrie | 69 | 23 | 66,7% |
hand_saw_cut |
Industrie | 77 | 25 | 67,5% |
jack_up_car |
Automotive | 78 | 24 | 69,2% |
tape_box |
Industrie | 75 | 23 | 69,3% |
sit_stand |
Ganzkörper | 28 | 8 | 71,4% |
impact_driver |
Industrie | 70 | 19 | 72,9% |
Alle 141 Aktionen · gefunden / benannt / nirgends benannt, plus die indexweite Extrapolation pro Aktion
| Aktion | Domäne | Gefunden | Benannt | Nirgends benannt | Geschätzte Momente indexweit | Nutzbare Rate | Ratenbasis |
|---|---|---|---|---|---|---|---|
climb_ladder |
Ganzkörper | 93 | 0 | 100,0% | 188.790 | 26,1% | Aktion |
crane_hook |
Industrie | 84 | 0 | 100,0% | 170.436 | 9,5% | Aktion |
flip |
Tischplatte (DROID) | 87 | 0 | 100,0% | 176.523 | 26,7% | Aktion |
lift |
Tischplatte (DROID) | 89 | 0 | 100,0% | 180.581 | 24,7% | Aktion |
load_cart |
Industrie | 82 | 0 | 100,0% | 166.460 | 9,8% | Aktion |
pick_up |
Tischplatte (DROID) | 72 | 0 | 100,0% | 146.088 | 47,9% | Aktion |
push |
Tischplatte (DROID) | 91 | 0 | 100,0% | 184.639 | 23,3% | Aktion |
push_heavy_cart |
Ganzkörper | 70 | 0 | 100,0% | 142.100 | 24,3% | Aktion |
push_trolley |
Industrie | 65 | 0 | 100,0% | 131.950 | 20,0% | Aktion |
refuel |
Automotive | 91 | 0 | 100,0% | 184.639 | 26,4% | Aktion |
refuel_nozzle |
Automotive | 88 | 0 | 100,0% | 178.552 | 27,6% | Aktion |
seatbelt_buckle |
Automotive | 87 | 0 | 100,0% | 176.523 | 29,9% | Aktion |
slide |
Tischplatte (DROID) | 82 | 0 | 100,0% | 166.378 | 32,1% | Aktion |
sort_parcel |
Industrie | 82 | 0 | 100,0% | 166.460 | 37,8% | Aktion |
stack |
Tischplatte (DROID) | 65 | 0 | 100,0% | 136.958 | 21,9% | Aktion |
unfold |
Tischplatte (DROID) | 79 | 0 | 100,0% | 160.291 | 57,0% | Aktion |
ziptie_bundle |
Industrie | 82 | 0 | 100,0% | 166.460 | 48,8% | Aktion |
carry_upstairs |
Ganzkörper | 87 | 1 | 98,9% | 176.610 | 25,6% | Aktion |
hang |
Tischplatte (DROID) | 92 | 1 | 98,9% | 181.596 | 12,1% | Aktion |
pull |
Tischplatte (DROID) | 87 | 1 | 98,9% | 176.523 | 18,4% | Aktion |
pull_trolley |
Ganzkörper | 92 | 1 | 98,9% | 186.760 | 22,8% | Aktion |
close |
Tischplatte (DROID) | 83 | 1 | 98,8% | 168.407 | 41,5% | Aktion |
emergency_stop |
Industrie | 85 | 1 | 98,8% | 172.465 | 22,6% | Aktion |
handbrake_pull |
Automotive | 82 | 1 | 98,8% | 166.378 | 31,7% | Aktion |
place |
Tischplatte (DROID) | 84 | 1 | 98,8% | 170.436 | 39,3% | Aktion |
remove |
Tischplatte (DROID) | 86 | 1 | 98,8% | 174.494 | 48,8% | Aktion |
turn_on |
Tischplatte (DROID) | 85 | 1 | 98,8% | 172.465 | 29,4% | Aktion |
count_stock |
Industrie | 76 | 1 | 98,7% | 154.280 | 32,4% | Aktion |
reach_overhead |
Ganzkörper | 79 | 1 | 98,7% | 160.370 | 46,8% | Aktion |
wipe |
Tischplatte (DROID) | 77 | 1 | 98,7% | 180.581 | 28,0% | Aktion |
crouch_down |
Ganzkörper | 65 | 1 | 98,5% | 131.950 | 34,9% | Aktion |
seat_chip |
Industrie | 65 | 1 | 98,5% | 131.950 | 46,9% | Aktion |
plaster_wall |
Bau | 88 | 2 | 97,7% | 178.552 | 25,3% | Aktion |
plug_in |
Haushalt | 87 | 2 | 97,7% | 176.523 | 36,5% | Aktion |
turn |
Tischplatte (DROID) | 86 | 2 | 97,7% | 174.494 | 27,9% | Aktion |
unplug_cable |
Industrie | 88 | 2 | 97,7% | 178.640 | 42,5% | Aktion |
label_parcel |
Industrie | 85 | 2 | 97,6% | 172.550 | 45,9% | Aktion |
move |
Tischplatte (DROID) | 82 | 2 | 97,6% | 166.378 | 34,2% | Aktion |
press |
Tischplatte (DROID) | 83 | 2 | 97,6% | 168.407 | 42,2% | Aktion |
spirit_level |
Industrie | 83 | 2 | 97,6% | 168.407 | 12,5% | Aktion |
conveyor_pick |
Industrie | 79 | 2 | 97,5% | 160.291 | 35,4% | Aktion |
grout_joint |
Bau | 81 | 2 | 97,5% | 164.349 | 28,4% | Aktion |
open_hood |
Automotive | 80 | 2 | 97,5% | 162.320 | 53,8% | Aktion |
trowel_mortar |
Bau | 79 | 2 | 97,5% | 160.291 | 28,2% | Aktion |
balance_load |
Ganzkörper | 77 | 2 | 97,4% | 156.310 | 21,1% | Aktion |
shovel_load |
Outdoor | 74 | 2 | 97,3% | 150.220 | 31,5% | Aktion |
scan_barcode |
Industrie | 71 | 2 | 97,2% | 144.059 | 27,1% | Aktion |
desolder_remove |
Industrie | 63 | 2 | 96,8% | 127.890 | 51,6% | Aktion |
pull_wire |
Bau | 61 | 2 | 96,7% | 123.769 | 30,0% | Aktion |
take |
Tischplatte (DROID) | 90 | 3 | 96,7% | 182.610 | 37,8% | Aktion |
forklift_controls |
Industrie | 59 | 2 | 96,6% | 119.711 | 27,1% | Aktion |
open_gate |
Ganzkörper | 88 | 3 | 96,6% | 178.640 | 21,6% | Aktion |
pour |
Tischplatte (DROID) | 89 | 3 | 96,6% | 183.624 | 56,2% | Aktion |
plug_in_socket |
Industrie | 85 | 3 | 96,5% | 172.550 | 36,5% | Aktion |
shrink_wrap |
Industrie | 81 | 3 | 96,3% | 164.430 | 22,5% | Aktion |
wipe_windshield |
Automotive | 82 | 3 | 96,3% | 166.378 | 34,6% | Aktion |
control_dial |
Industrie | 72 | 3 | 95,8% | 146.088 | 31,9% | Aktion |
steering |
Automotive | 72 | 3 | 95,8% | 146.088 | 59,7% | Aktion |
open_carton |
Industrie | 69 | 3 | 95,7% | 140.070 | 31,9% | Aktion |
put |
Tischplatte (DROID) | 91 | 4 | 95,6% | 184.639 | 41,8% | Aktion |
plant_seed |
Outdoor | 67 | 3 | 95,5% | 136.010 | 28,8% | Aktion |
steering_turn |
Automotive | 43 | 2 | 95,3% | 87.247 | 60,5% | Aktion |
pipe_fitting |
Industrie | 83 | 4 | 95,2% | 168.407 | 44,6% | Aktion |
open |
Tischplatte (DROID) | 79 | 4 | 94,9% | 173.987 | 44,2% | Aktion |
dig_soil |
Outdoor | 76 | 4 | 94,7% | 154.280 | 44,6% | Aktion |
sweep |
Haushalt | 75 | 4 | 94,7% | 152.175 | 29,3% | Aktion |
route_cable |
Industrie | 74 | 4 | 94,6% | 150.220 | 43,8% | Aktion |
gear_shift |
Automotive | 73 | 4 | 94,5% | 148.117 | 37,0% | Aktion |
stack_pallet |
Industrie | 70 | 4 | 94,3% | 142.100 | 12,9% | Aktion |
thermal_paste |
Industrie | 69 | 4 | 94,2% | 140.070 | 19,1% | Aktion |
ev_charge_plug |
Automotive | 85 | 5 | 94,1% | 172.465 | 26,2% | Aktion |
carry_box |
Haushalt | 84 | 5 | 94,0% | 170.436 | 25,0% | Aktion |
open_trunk |
Automotive | 84 | 5 | 94,0% | 170.436 | 28,6% | Aktion |
socket_ratchet |
Industrie | 82 | 5 | 93,9% | 166.378 | 31,7% | Aktion |
top_up_fluid |
Automotive | 82 | 5 | 93,9% | 166.378 | 37,0% | Aktion |
press_machine_button |
Industrie | 79 | 5 | 93,7% | 160.291 | 31,6% | Aktion |
valve_turn |
Industrie | 79 | 5 | 93,7% | 160.291 | 19,0% | Aktion |
insert_usb |
Industrie | 78 | 5 | 93,6% | 158.340 | 46,0% | Aktion |
caulk_gun |
Industrie | 86 | 6 | 93,0% | 174.494 | 34,1% | Aktion |
adjust_mirror |
Automotive | 85 | 6 | 92,9% | 172.465 | 20,0% | Aktion |
sand_surface |
Industrie | 85 | 6 | 92,9% | 172.465 | 55,3% | Aktion |
cut_pipe |
Bau | 68 | 5 | 92,6% | 137.972 | 41,8% | Aktion |
machine_unload |
Industrie | 68 | 5 | 92,6% | 137.972 | 30,9% | Aktion |
unload_truck |
Industrie | 68 | 5 | 92,6% | 138.040 | 35,3% | Aktion |
machine_lever |
Industrie | 80 | 6 | 92,5% | 162.320 | 21,2% | Aktion |
assemble_snap_fit |
Industrie | 77 | 6 | 92,2% | 156.310 | 51,3% | Aktion |
measure_tape |
Industrie | 76 | 6 | 92,1% | 154.204 | 42,1% | Aktion |
chisel_carve |
Industrie | 49 | 4 | 91,8% | 99.421 | 42,9% | Aktion |
wrench_bolt |
Industrie | 85 | 7 | 91,8% | 172.465 | 34,1% | Aktion |
hammer_nail |
Industrie | 84 | 7 | 91,7% | 170.436 | 20,2% | Aktion |
solder_pipe |
Bau | 70 | 6 | 91,4% | 142.030 | 37,1% | Aktion |
step_over |
Ganzkörper | 70 | 6 | 91,4% | 142.100 | 28,6% | Aktion |
gauge_read |
Industrie | 78 | 7 | 91,0% | 158.262 | 35,9% | Aktion |
fold |
Tischplatte (DROID) | 77 | 7 | 90,9% | 158.769 | 57,1% | Aktion |
tile_place |
Bau | 83 | 8 | 90,4% | 168.407 | 30,1% | Aktion |
solder |
Industrie | 55 | 6 | 89,1% | 111.595 | 45,5% | Aktion |
screwdriver |
Industrie | 72 | 8 | 88,9% | 146.088 | 43,1% | Aktion |
bend_lift |
Ganzkörper | 62 | 7 | 88,7% | 125.860 | 32,3% | Aktion |
power_drill_hole |
Industrie | 70 | 8 | 88,6% | 142.030 | 40,9% | Aktion |
solder_joint |
Industrie | 61 | 7 | 88,5% | 123.830 | 55,7% | Aktion |
mix_cement |
Bau | 68 | 8 | 88,2% | 137.972 | 43,3% | Aktion |
nail_gun |
Bau | 68 | 8 | 88,2% | 137.972 | 29,8% | Aktion |
drywall_screw |
Bau | 72 | 9 | 87,5% | 146.088 | 28,2% | Aktion |
lay_brick |
Bau | 80 | 10 | 87,5% | 162.320 | 27,5% | Aktion |
clamp_workpiece |
Industrie | 62 | 8 | 87,1% | 125.798 | 35,5% | Aktion |
machine_load |
Industrie | 62 | 8 | 87,1% | 125.798 | 19,4% | Aktion |
cut_vegetable |
Haushalt | 83 | 11 | 86,7% | 168.407 | 42,2% | Aktion |
torque_wrench |
Industrie | 83 | 11 | 86,7% | 168.407 | 31,3% | Aktion |
cut_knife |
Haushalt | 73 | 10 | 86,3% | 148.117 | 34,2% | Aktion |
tire_pressure |
Automotive | 73 | 10 | 86,3% | 148.117 | 47,9% | Aktion |
weld_seam |
Industrie | 87 | 12 | 86,2% | 176.523 | 31,4% | Aktion |
pliers_grip |
Industrie | 72 | 10 | 86,1% | 146.088 | 50,7% | Aktion |
paint_brush |
Bau | 90 | 13 | 85,6% | 182.610 | 22,2% | Aktion |
wire_cut |
Industrie | 76 | 11 | 85,5% | 154.204 | 34,2% | Aktion |
paint_roller |
Bau | 79 | 13 | 83,5% | 160.291 | 15,2% | Aktion |
breadboard_wire |
Industrie | 65 | 11 | 83,1% | 131.950 | 44,6% | Aktion |
change_tire |
Automotive | 69 | 12 | 82,6% | 140.001 | 50,0% | Aktion |
kneel_work |
Ganzkörper | 55 | 10 | 81,8% | 111.650 | 45,5% | Aktion |
change_tire_wrench |
Automotive | 71 | 13 | 81,7% | 144.059 | 46,4% | Aktion |
assemble_part |
Industrie | 70 | 13 | 81,4% | 142.030 | 64,3% | Aktion |
check_oil_dipstick |
Automotive | 80 | 15 | 81,2% | 162.320 | 43,8% | Aktion |
screw_panel |
Industrie | 81 | 16 | 80,2% | 164.430 | 37,5% | Aktion |
lathe_operate |
Industrie | 51 | 11 | 78,4% | 103.479 | 31,4% | Aktion |
engine_bay |
Automotive | 77 | 17 | 77,9% | 156.233 | 56,6% | Aktion |
probe_test |
Industrie | 63 | 14 | 77,8% | 127.890 | 54,8% | Aktion |
machine_control |
Industrie | 78 | 18 | 76,9% | 158.262 | 36,4% | Aktion |
screwdriver_drive |
Industrie | 78 | 20 | 74,4% | 158.262 | 39,5% | Aktion |
weld |
Industrie | 86 | 22 | 74,4% | 174.494 | 31,4% | Aktion |
power_drill |
Industrie | 70 | 18 | 74,3% | 142.030 | 48,6% | Aktion |
impact_driver |
Industrie | 70 | 19 | 72,9% | 142.030 | 35,3% | Aktion |
sit_stand |
Ganzkörper | 28 | 8 | 71,4% | 56.840 | 35,7% | Aktion |
tape_box |
Industrie | 75 | 23 | 69,3% | 152.250 | 26,4% | Aktion |
jack_up_car |
Automotive | 78 | 24 | 69,2% | 158.262 | 27,3% | Aktion |
hand_saw_cut |
Industrie | 77 | 25 | 67,5% | 156.233 | 32,9% | Aktion |
grinder_use |
Industrie | 69 | 23 | 66,7% | 140.001 | 42,6% | Aktion |
pack_box |
Industrie | 73 | 28 | 61,6% | 148.117 | 50,0% | Aktion |
car_door |
Automotive | 93 | 36 | 61,3% | 188.697 | 20,4% | Aktion |
car_door_close |
Automotive | 91 | 36 | 60,4% | 184.639 | 26,4% | Aktion |
car_door_open |
Automotive | 92 | 38 | 58,7% | 186.668 | 22,8% | Aktion |
wash_car_panel |
Automotive | 78 | 36 | 53,8% | 158.262 | 41,6% | Aktion |
wash_car |
Automotive | 72 | 36 | 50,0% | 146.088 | 45,1% | Aktion |
Auffindbarkeit pro Aktion. ‘Benannt’ zählt Momente, deren eigener Titel, Beschreibung oder Tags ein Wort des Aktionsnamens unter der veröffentlichten Teilzeichenkettenregel enthalten. Die Extrapolationsspalten multiplizieren die gemessene Ausbeute pro Shard jeder Aktion mit der Shard-Anzahl des Index und dividieren durch die gemessene aktionsübergreifende Überschneidung; ‘Ratenbasis’ gibt an, ob die nutzbare Rate an den eigenen Frames der Aktion gemessen, von ihrer Domäne oder vom korpusweiten Wert übernommen wurde.
3.5 Die Frames abrufen
Um zu prüfen, ob die Suche überhaupt korrekt war, haben wir aus jedem übereinstimmenden Video einen echten Frame gezogen und ihn betrachtet. Was YouTube ohne Extraktion des Videos bereitstellt, ist das Storyboard, ein Sprite-Sheet mit Thumbnails, dessen Abtastintervall mit der Laufzeit zunimmt: wir maßen 1 s bei Videos bis zu 109 s, 2 s von 175 s bis 275 s, 5 s von 454 s bis 892 s und 10 s ab 1.366 s aufwärts. Die Schrittgrenzen zwischen diesen Bereichen wurden durch die 12 untersuchten Videos nicht aufgelöst. Das beurteilte Bild ist das nächste Sample bei oder vor der übereinstimmenden Sekunde, sodass es bis zu ein Intervall früh sein kann – im schlimmsten Fall 10 s und für etwas mehr als die Hälfte der Frames 5 s oder 10 s. Gemessen durch storyboard_probe.py; die Spezifikationen pro Video befinden sich in data/storyboard_spec.json.
Ein Vision-Modell hat alle 10.750 von 10.828 erhaltenen Frames bewertet, sodass jede Rate hier auf 99,3% des Korpus und nicht auf einer Stichprobe gemessen wird. 93,8% sind echtes Filmmaterial und keine Animation, kein Spiel oder Bildschirmaufzeichnung; 25,7% zeigten die Aktion sichtbar im Gange und 57,4% zeigten sie im Gange oder vorbereitet; 34,5% erzielten 3 oder besser auf einer Nutzbarkeits-Skala von 0 bis 5. Diese letzte Zahl ist ein Urteil über einen nachgelagerten Trainingsprozess, den das Modell nicht beobachten kann, und verhält sich entsprechend: Bei einer 60-Frame-Stichprobe umspannten vier Durchläufe mit identischer Konfiguration 3,4 Punkte, und eine Umformulierung der Bewertungsrubrik verschob sie um 20. Der sichtbare Aktionsanteil verschob sich über dieselbe Rubrikänderung um 1,7, was ihn zur Kennzahl macht, die über Durchläufe hinweg verglichen werden sollte.
Frame-Akquisition:
Zahlen im Tabellenformat
| Ergebnis | Momente | Anteil |
|---|---|---|
| Frames erhalten | 10.750 / 10.828 | 99% |
| Kein parsbares Storyboard | 75 | 0,7% |
| Sprite-Abruf fehlgeschlagen | 3 | 0,03% |
Frame-Akquisition. Wir haben Storyboards direkt abgerufen und bei 863 der 10.828 Momente Rate-Limiting getroffen, von denen 856 in einem späteren Durchlauf wiederhergestellt wurden, sodass keiner der 78 verlorenen Momente auf einem 429 endete; die Media Data API ist der unterstützte Weg für diesen Schritt und gibt Storyboards direkt zurück. Diese Prüfung hat keinen Aufruf dazu gemacht. Diese Momente befinden sich auf 7.549 Videos, und ein Video kostet einen Watch-Page-Abruf plus mindestens ein Sprite-Sheet, pro Video gecacht.
4 Die Momente, abspielbar
Treffer werden gegen den nächsten Storyboard-Frame bei oder vor der Sekunde angezeigt, für die sie übereinstimmten. Das Ranking ist nicht kuratiert. 10.750 der 10.828 Momente haben einen eigenen Frame, und die vollständige Galerie enthält 10.761 Zeilen, da 11 weitere ein Bild mit einer anderen Aktion teilen, die bei derselben Sekunde übereinstimmte. Diese Zeilen basieren auf 8.792 verschiedenen Bildern, da der Dateiname ein Video und eine Sekunde und keine Aktion benennt.
Unten sind die am höchsten bewerteten übereinstimmenden Momente, einer pro Aktion, direkt aus dem Ranking. Klicken Sie auf einen Frame, um das Quellvideo ab der übereinstimmenden Sekunde abzuspielen.
Jede Zelle: die Aktion, für die sie übereinstimmte, und ihr Relevanz-Score, dann was das Vision-Modell im Frame sah (dem das Bild ohne Titel gezeigt wurde), dann der eigene Titel des Videos auf Englisch. Zeitstempel öffnen zwei Sekunden früh, damit der Moment ins Bild kommt.
5 Verwandte Arbeiten
Das Abrufen eines Moments per Beschreibung ist eine etablierte Aufgabe: zeitliche Verankerung auf Charades-STA, Highlight-Erkennung auf QVHighlights, natürlichsprachige Abfragen in Ego4D. Wir stellen hier keine neue Methode vor.
Das Konstrukt hat Vorläufer. TVR (2020) hat seine 108.965 Abfragen danach beschriftet, ob Video, Untertitel oder beides sie beantwortete, und berichtete 74,2% nur Video. Was sich unterscheidet, ist der Korpus und der Zweck: offene Web-Videos statt sechs TV-Sendungen, physische Aktionen, eine verifizierte Teilstichprobe und ein Kostenverhältnis. Das Veröffentlichungsformat folgt AVA und HowTo100M: Kennung, Zeitstempel und Label, ohne Video weiterzugeben. Die Suche erfolgt durchgehend über die Video Search API. Frames wurden hier durch Parsing des YouTube-Storyboards von der Watch-Page gewonnen; zu keinem Zeitpunkt wurde ein Clip extrahiert. Für einen Produktionslauf ist die Media Data API der unterstützte Weg.
Was die Prüfung feststellt, ist enger als ein Ersatz für Roboter-Demonstrationen. Das Web enthält eine große und schlecht indizierte Schicht von Filmmaterial mit physischen Aktionen, und zeitgestempelte visuelle Suche macht diese Schicht erheblich leichter erreichbar. Ob auf diese Weise kuratiertes Filmmaterial ein Robotik- oder World-Modell-System messbar verbessert, ist die nächste Frage, und ihre Beantwortung erfordert ein Trainingsexperiment, das diese Prüfung nicht durchgeführt hat.
6 Zitierung
@misc{webmoments2026,
title = {Finding the Web's Hidden Robot Training Moments in
Public Web Video Data},
author = {Bright Data},
year = {2026},
howpublished = {Technical report},
note = {141 physical actions, 10,828 retrieved match rows over
8,849 distinct video-second moments, and
10,750 frames reviewed by a vision model}
}






















