---
title: "VLAs und World Models brauchen Web-Scale-Daten. Nur nicht dieselben Daten"
slug: vlas-and-world-models-need-web-scale-data
date: 2026-06-22T09:10:02+00:00
modified: 2026-09-02T12:47:12+00:00
permalink: https://brightdata.de/blog/fuhrung/vlas-and-world-models-need-web-scale-data
type: blog
---

[ Blog ](https://brightdata.de/blog "Blog") / [Fuhrung](https://brightdata.de/blog/fuhrung)







 [Fuhrung](https://brightdata.de/blog/fuhrung)

# VLAs und World Models brauchen Web-Scale-Daten. Nur nicht dieselben Daten

Fünf Erkenntnisse aus unserem VLA-Panel: warum Web-Scale-Pretraining, Kurationsgeschwindigkeit und Datenherkunft das Rennen um reale Roboter bestimmen.

 8 min lesen





 [ ![](https://media.brightdata.de/2026/06/image-40-50x50.png) ](https://brightdata.com/blog/authors/adam-chan)

 [Adam Chan

Founder &amp; Builder @Hackersquad

 ](https://brightdata.com/blog/authors/adam-chan)





 ![](https://media.brightdata.de/2026/06/2_VLAs-and-World-Models-Need-Web-Scale-Data.-Just-Not-the-Same-Data.png)





Eine Zusammenfassung des VLA-Abends im Web Data Loft.

Wir haben Engineers von Agility Robotics, Tesla, Prometheus und Distill Labs in den [Bright Data](https://brightdata.com/) Web Data Loft in San Francisco eingeladen, um eine Frage zu diskutieren:

**Was braucht es wirklich, um von einem Sprachmodell zu einem Roboter zu gelangen, der in der realen Welt funktioniert?**

Die Antwort war bodenständiger als der Hype vermuten lässt. Der Engpass liegt nicht nur in der Modellarchitektur. Es ist das Trainingskorpus: was man sammelt, wie man es mischt, woher es stammt und ob man es in einem Umfang kuratieren kann, den kein manuelles Team erreichen kann.

Auf dem Panel waren Sri und Ahmed von Agility Robotics, Ankur, ein Robotik-ML-Engineer der in persönlicher Eigenschaft sprach, Daniel von Prometheus, ehemals bei 1X und Waymo, sowie Jacek, Mitgründer von Distill Labs. Die Moderation übernahm Adam von HackerSquad und dem Builders Collective.

Im Folgenden sind die fünf wichtigsten Erkenntnisse für alle, die ein Vision-Language-Action-Modell, ein World Model oder die dahinterliegende Datenpipeline entwickeln.

## 1. Ein VLA ist ein VLM mit einem Action Head, und seine Generalisierung kommt vom Web-Scale-Pretraining

Die Arbeitsdefinition des Panels war einfach: Ein VLA beginnt als Vision-Language-Modell, das auf internetgroßen Text- und Bilddaten trainiert wird, bei Aufgaben wie Bildunterschriften, Segmentierung und Objektverständnis. Anschließend fügt man eine Action-Komponente hinzu und feinabstimmt es auf Robotikdaten.

Diese Unterscheidung ist wichtig. Die Robotikdaten lehren die Ausführung. Das Web-Scale-Pretraining lehrt das Modell, wie die Welt beschaffen ist.

Deshalb kann ein VLA manchmal ein Objekt aufnehmen, auf das es nie explizit trainiert wurde. Die Generalisierung kommt nicht allein aus einem kleinen Satz teleoperierter Roboter-Demonstrationen. Sie entsteht durch breite visuelle und semantische Exposition, bevor der Roboter überhaupt in die Schleife eintritt.

Ist Ihr [Pretraining-Korpus](https://brightdata.com/use-cases/training-data) zu eng, kann keine Menge teurer Teleoperationsdaten die übersprungene Generalisierung vollständig ersetzen.

> *“Es wird auf internetgroßen Text- und Bilddaten trainiert… dann feinabstimmt man das VLM auf Robotikdaten und erhält ein Vision-Language-Action-Modell. Das Schöne daran ist die bessere Generalisierung: Wenn man es trainiert, ein bestimmtes Objekt aufzunehmen, kann man es bitten, ein anderes Objekt aufzunehmen, weil es ähnliche Dinge gesehen hat.”*
> — **Ankur**, Robotik-ML-Engineer, spricht in persönlicher Eigenschaft. [Ansehen ab 9:59 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=599s)

📖 *Weiterführende Lektüre:* [Was ist ein Vision-Language-Modell (VLA)?](https://brightdata.com/ai/video-data/vla) · [Beste Robotik-KI-Bibliotheken](https://brightdata.com/blog/ai/best-robotics-ai-libraries) · [Foundation Models erklärt](https://brightdata.com/glossary/foundation-model)

## 2. Vision, Sprache und Aktion bewegen sich in einen gemeinsamen Token-Raum

Moderne VLAs ähneln LLMs in einer wichtigen Hinsicht: Sie sagen das nächste Token voraus.

Dieses Token kann ein Wort, ein Bild-Patch oder ein Joint-Space-Steuerungsbefehl sein. Wie Jacek, Mitgründer von Distill Labs, erklärte, ist die Verbindung zu Software-Agenten direkt. Ein LLM ruft API-Tools auf. Ein VLA ruft physische Tools auf. Das Harness wechselt von “Endpunkt aufrufen” zu “Becher greifen”, aber das zugrundeliegende Muster ist ähnlich.

Die Implikation ist weitreichend: Jede Modalität, die tokenisiert werden kann, kann Teil desselben Trainingsraums werden. Web-Video, egozentrische Aufnahmen, menschliche Demonstrationen, Teleoperation und On-Policy-Roboterdaten können alle zu einer gemeinsamen Repräsentation beitragen.

Die Einschränkung verlagert sich dann von “kann das Modell das verwenden?” zu “können wir die richtigen Beispiele im richtigen Umfang beschaffen?”

> *“Man kann den Action Space als Function Calling für LLMs betrachten… man zerlegt es so und es unterscheidet sich nicht von dem, was Menschen für die nicht-physische Welt bauen, Agenten die Sub-Agenten in einem Harness starten, das Tools bereitstellt. Jetzt ist das Harness physischer. Das macht es mächtig, weil man sich auf Web-Trainingsdaten verlassen kann, um einen guten Ausgangspunkt zu erhalten.”*
> — **Jacek**, Mitgründer, Distill Labs. [Ansehen ab 15:14 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=914s)

📖 *Weiterführende Lektüre:* [Tokenisierung erklärt](https://brightdata.com/glossary/tokenization) · [Inside the KI-Agent Tech Stack](https://brightdata.com/blog/ai/ai-agent-tech-stack) · [Wie man KI-Agenten baut: Vollständige Roadmap](https://brightdata.com/blog/ai/ai-agents-roadmap)

## 3. VLAs und World Models brauchen unterschiedliche Daten – die Verwechslung ist kostspielig

Eine der schärfsten Unterscheidungen des Abends war die zwischen VLA-Training und World-Model-Training.

Wie Ankur es formulierte, ist ein VLA im Wesentlichen ein **Imitation-Learning-Problem**. Man will saubere, erfolgreiche, hochwertige Trajektorien. Schlechte Demonstrationen können schaden.

Ein **World Model** ist anders. Es muss vorhersagen, was als nächstes passiert, wenn eine Aktion ausgeführt wird, was bedeutet, dass es nicht nur erfolgreiche Ergebnisse verstehen muss, sondern auch Fehler, Grenzfälle und Misserfolge. Wenn man ein World Model für Planung oder als gelernten Simulator für [Reinforcement Learning](https://brightdata.com/glossary/reinforcement-learning) nutzen möchte, muss es die gesamte Bandbreite möglicher Zukünfte abbilden.

Daniel, ein Engineer bei Prometheus, der zuvor World-Model-Arbeit bei 1X leitete, erklärte, warum das schwierig ist. Viele aktuelle World Models sind auf erfolgreiche Ergebnisse ausgerichtet. Wenn sie eine Trajektorie sehen, die kurz vor dem Scheitern steht, halluzinieren sie möglicherweise eine Erholung, anstatt den Fehler zu modellieren. In der Robotik ist das besonders gefährlich. Das Modell muss genau in den Momenten aktionskontrollierbar sein, in denen Kontakt, Greifen und Versagen am wahrscheinlichsten sind.

Die Erkenntnis: “Robotikdaten” ist kein generischer Sammelbegriff. Imitationsrichtlinien und World Models erfordern bewusst unterschiedliche Korpora.

> *“Man will wirklich ein World Model, das sehr aktionskontrollierbar ist… der entscheidende Moment beim Greifen eines Objekts. Wenn es dort Lücken gibt, ist das ein sehr schlechtes Zeichen.”*
> — **Daniel**, Prometheus, ehemals 1X. [Ansehen ab 35:36 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=2136s)

📖 *Weiterführende Lektüre:* [Was ist KI-Modelltraining?](https://brightdata.com/blog/ai/what-is-ai-model-training) · [KI-Halluzination erklärt](https://brightdata.com/glossary/ai-hallucination) · [Robotik-Datensätze](https://brightdata.com/products/datasets/robotics)

## 4. Die Datenhierarchie ist real: Web-Daten geben Breite, Roboterdaten geben Kontrolle

Ahmed, ein Engineer bei Agility Robotics, legte eine klare Signalhierarchie dar.

Teleoperationsdaten enthalten die stärksten Kontrollinformationen, da sie den vollständigen Roboterzustand beinhalten. Menschliche Demonstrationen und egozentrische Videos tragen weniger direktes Kontrollsignal. Web-Video trägt auf der Low-Level-Kontrollebene am wenigsten.

Das macht [Web-Daten](https://brightdata.com/products/datasets) aber nicht weniger wichtig. Es macht ihre Rolle anders.

Web-Scale-Video lehrt Semantik, Kontext, Aufgabenstruktur, Objektvielfalt und allgemeines Weltwissen. Es hilft dem Modell zu verstehen, wie Räume, Werkzeuge, Menschen, Objekte und Ziele in enormer Vielfalt aussehen. Was es nicht gut lehrt, ist die feinkörnige Physik eines spezifischen Roboterkörpers bei der Ausführung einer spezifischen Aktion.

Ankur gab die klarste Analogie: Man kann jedes Messi- oder Ronaldo-Video ansehen und Fußball tief verstehen, aber man kann trotzdem nicht spielen, ohne zu üben. Web-Daten lehren das Spiel. On-Robot-Daten lehren den Körper.

Die praktische Erkenntnis zum Datenbudget aus demselben Austausch: **Eine Stunde Web-Daten liefert ungefähr den übertragbaren Wert von fünf Minuten Teleoperationsdaten**. Web-Daten ersetzen kein Teleop, aber starkes Web-Scale-Pretraining kann den Bedarf an teuren Roboterdaten reduzieren.

> *“Wir können viele Fußballvideos von Messi oder Ronaldo ansehen, aber bis wir selbst üben, können wir nicht wirklich spielen. Das Verständnis der Aufgabe erhalten wir aus Web-Daten. Um sie tatsächlich auszuführen, brauchen wir On-Robot-Daten… vielleicht ist eine Stunde Web-Daten gleichwertig mit fünf Minuten Teleop-Daten.”*
> — **Ankur**, Robotik-ML-Engineer, spricht in persönlicher Eigenschaft. [Ansehen ab 1:01:09 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=3669s)

📖 *Weiterführende Lektüre:* [Videodaten für KI](https://brightdata.com/ai/video-data) · [YouTube-Videos-Datensatz](https://brightdata.com/products/datasets/youtube/videos) · [Audio-Datensätze für KI](https://brightdata.com/products/datasets/audio) · [Bild-Datensätze](https://brightdata.com/products/datasets/image)

## 5. Es gibt noch keine verlässlichen Skalierungsgesetze, daher wird Kurationsgeschwindigkeit zum Vorteil

Für LLMs hat die Branche die Kaplan- und Chinchilla-Skalierungsgesetze. Für VLAs und World Models war Daniel direkt: Die Robotik ist noch nicht so weit.

Teams können die Roboterleistung noch nicht zuverlässig als saubere Funktion von Web-Tokens, Teleop-Stunden, Deployment-Daten, Rechenleistung oder Modellgröße vorhersagen. Ein Teil der Herausforderung ist, dass Imitation Learning und World Modeling unterschiedliche Supervisionssignale verwenden. Ein weiterer ist, dass die entscheidende Metrik der nachgelagerte Aufgabenerfolg ist, nicht der Pretraining-Verlust.

Daniel zog auch einen nützlichen Vergleich mit der Simulation autonomer Fahrzeuge. Im autonomen Fahren stoppt die Simulation oft bei Kontakt. In der Robotik beginnt dort erst die eigentliche Komplexität. Greifen, Schieben, Rutschen, Verformen, Kollidieren und Erholen sind keine Grenzfälle. Sie sind die Aufgabe.

Bis bessere Skalierungsgesetze entstehen, haben Teams einen Vorteil, die die richtigen Beispiele am schnellsten finden und kuratieren können: spezifische Szenen, Aufgabenfamilien, Objektinteraktionen, Fehler und kontaktreiche Momente. Das ist nicht nur eine Modellierungsherausforderung. Es ist eine Entdeckungs- und [Datenpipeline](https://brightdata.com/blog/proxy-101/data-pipeline-architecture)-Herausforderung.

> *“Skalierungsgesetze in Bezug auf FLOP- oder Token-Anzahlen zu beantworten ist heute für LLMs üblich, Kaplan et al., die Chinchilla-Skalierungsgesetze. Wir stellen diese Fragen nicht wirklich, um VLAs und World Models heute wissenschaftlich zu vergleichen… Ich denke, die Antwort ist, wir sind noch nicht so weit, und wir sollten wirklich dahin gelangen.”*
> — **Daniel**, Prometheus, ehemals 1X und Waymo. [Ansehen ab 54:35 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=3275s)

📖 *Weiterführende Lektüre:* [Datenentdeckung](https://brightdata.com/blog/web-data/data-discovery) · [Beste KI-Trainingsdatenanbieter](https://brightdata.com/blog/ai/best-ai-training-data-providers) · [LLM-Trainingsdaten](https://brightdata.com/blog/web-data/llm-training-data)

## Was das für Ihre Robotik-Datenstrategie bedeutet

Das Panel kam zu einem klaren Fazit:

> **Web-Scale-Daten geben Robotern ein breites Verständnis der Welt. On-Robot-Daten lehren sie, wie sie darin handeln. Je besser Ihr Pretraining-Korpus, desto weniger teure Roboterdaten benötigen Sie, um eine zuverlässige Ausführung zu erreichen.**

Dies erfordert drei Fähigkeiten, die die meisten Teams unterschätzen:

### 🌐 Web-Scale-Extraktion

Petabyte-skalierte Video-, Bild- und Audiosammlung aus dem offenen Web, nicht nur eingefrorene akademische Datensätze mit veralteten Taxonomien. Siehe [Bright Datas Web-Scale-Datenerfassungsinfrastruktur](https://brightdata.com/products/web-scraper) und [individuelle Datenlösungen](https://brightdata.com/products/data-solutions).

### 🔍 Visuelle Entdeckung jenseits der Keyword-Suche

Die wertvollste Aufgabenvielfalt erscheint oft in Szenen, die nie in einem Titel, Tag oder einer Bildunterschrift beschrieben werden. Die Keyword-Suche verfehlt einen Großteil des Long Tails.

### ⚖️ Verteidigbare Herkunft

Textmodelle trainieren auf Billionen von Tokens. VLAs trainieren auf Billionen von Frames. Jeder Frame kann eine Lizenzierungs- und Herkunftsfrage aufwerfen, und der reale Roboter-Einsatz erhöht den Einsatz. Erfahren Sie mehr in unserem [Trust Center](https://brightdata.com/trustcenter) und unseren [ethischen Datenerhebungsrichtlinien](https://brightdata.com/trustcenter/privacy-ethical-data-collection-guidelines).

Die Modelle konvergieren. Der Differenzierungsfaktor wird zunehmend das Korpus: **wie breit es ist, wie relevant es ist und ob Sie verteidigen können, woher es stammt.**

### Sie bauen ein VLA oder World Model?

[**Sprechen Sie mit unserem Team →**](https://brightdata.com/contact) über die Entdeckung und Beschaffung von Trainingsvideo im Web-Scale-Bereich.

Erfahren Sie mehr über [Bright Data für KI](https://brightdata.com/ai), erkunden Sie unser [Videodatenangebot für VLAs](https://brightdata.com/ai/video-data/vla) oder durchsuchen Sie unsere [vorgefertigten Datensätze](https://brightdata.com/products/datasets) für Robotik, Computer Vision und multimodales Training.



Vertrieb kontaktierenGratis testen![google social icon](/wp-content/themes/brightdata/assets/images/ic_google.svg)









 Inhaltsverzeichnis













 [ ](https://news.ycombinator.com/submitlink?t=VLAs+und+World+Models+brauchen+Web-Scale-Daten.+Nur+nicht+dieselben+Daten&u=https://brightdata.de/blog/fuhrung/vlas-and-world-models-need-web-scale-data) [ ](https://www.linkedin.com/shareArticle?mini=true&title=VLAs+und+World+Models+brauchen+Web-Scale-Daten.+Nur+nicht+dieselben+Daten&url=https://brightdata.de/blog/fuhrung/vlas-and-world-models-need-web-scale-data) [ ](http://www.reddit.com/submit?title=VLAs+und+World+Models+brauchen+Web-Scale-Daten.+Nur+nicht+dieselben+Daten&url=https://brightdata.de/blog/fuhrung/vlas-and-world-models-need-web-scale-data)







##  Das könnte Sie auch interessieren

 [ ![Best LLM Scrapers blog image](https://media.brightdata.de/2026/02/Best-LLM-Scrapers.png) ](https://brightdata.de/blog/ai/best-llm-scrapers "Die besten LLM-Scraper im Jahr 2026: Der ultimative Tool-Vergleich")

 [AI



 ![Antonello Zanini](https://media.brightdata.de/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Die besten LLM-Scraper im Jahr 2026: Der ultimative Tool-Vergleich

Ein Vergleich der sechs besten LLM-Scraper im Jahr 2026, der unterstützte Modelle, Preise und wichtige Funktionen umfasst, um Ihnen bei der Auswahl des richtigen Tools zu helfen.



 24-Feb-2026

 16 min lesen

 ](https://brightdata.de/blog/ai/best-llm-scrapers)

 [ ![Best Robotics AI Libraries](https://media.brightdata.de/2026/02/Best-Robotics-AI-Libraries.png) ](https://brightdata.de/blog/ai/best-robotics-ai-libraries "Die besten KI-Bibliotheken für Robotik im Jahr 2026: Die 10 besten Auswahlen")

 [AI



 ![Antonello Zanini](https://media.brightdata.de/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Die besten KI-Bibliotheken für Robotik im Jahr 2026: Die 10 besten Auswahlen

Entdecken Sie die besten KI-Bibliotheken für Robotik im Jahr 2026, von NVIDIA Isaac bis LeRobot, mit detaillierten Vergleichen, die Ihnen bei der Auswahl der richtigen Lösung helfen.



 11-Feb-2026

 17 min lesen

 ](https://brightdata.de/blog/ai/best-robotics-ai-libraries)

 [ ![Building AI-Ready Vector Datasets for LLMs blog image](https://media.brightdata.de/2025/05/Building-AI-Ready-Vector-Datasets-for-LLMs.svg) ](https://brightdata.de/blog/ai/ai-ready-vector-datasets "Aufbau von KI-tauglichen Vektordatensätzen für LLMs: Ein Leitfaden mit Bright Data, Google Gemini und Pinecone")

 [AI



 ![Satyam Tripathi](https://media.brightdata.de/2024/09/Satyam-Tripathi-50x50.png)

Satyam Tripathi

Technical Writer





### Aufbau von KI-tauglichen Vektordatensätzen für LLMs: Ein Leitfaden mit Bright Data, Google Gemini und Pinecone

Große Sprachmodelle (Large Language Models, LLMs) verändern die Art und Weise, wie wir auf Informationen zugreifen und intelligente Anwendungen entwickeln. Um ihr volles Potenzial auszuschöpfen, insbesondere bei bereichsspezifischem Wissen oder geschützten Daten, ist die Erstellung hochwertiger, strukturierter Vektordatensätze entscheidend. Die Leistung und Genauigkeit eines LLM hängt direkt von der Qualität der Eingabedaten ab. Schlecht aufbereitete […]



 14-May-2025

 20 min lesen

 ](https://brightdata.de/blog/ai/ai-ready-vector-datasets)
