Im Juli 2026 starteten Together AI und Y Combinator den ersten dedizierten YC-GPU-Cluster. YC-Gründer können jetzt in wenigen Wochen erhebliche Rechenkapazitäten sichern. Die alten Zweijahresverträge sind nicht mehr der einzige Weg.
Angenommen, Sie leiten KI in einem neuen Unternehmen. Sie trainieren ein Foundation-Modell für physische KI, Video oder Suche. Diese Modelle benötigen viele FLOPs und viele Trainingsdaten. Diese Ankündigung sollte Ihnen zwei Gefühle gleichzeitig geben. Erleichterung, weil Ihr schwierigstes Beschaffungsproblem gerade leichter wurde. Unbehagen, weil es für alle anderen auch leichter wurde.
Das ist das Muster dieses gesamten Zyklus. Jeder Input, um den Sie kämpfen, wird Ihren Wettbewerbern zu denselben Konditionen verfügbar. Das zwingt zur Frage, die Ihr Board immer wieder stellt. Was genau ist Ihr Burggraben?
Beginnen Sie damit, zu streichen, was es nicht ist
Ihr Code ist nicht Ihr Burggraben. Agentisches Coding hat diese Debatte beendet. Ihre Trainingsinfrastruktur, Ihr Serving-Stack und Ihr Eval-Harness sind alle rekonstruierbar. Ein kompetentes Team mit einem Coding-Agenten baut sie in Wochen nach. Nicht perfekt, aber nah genug.
Ihre Architektur ist nicht Ihr Burggraben. Architekturen werden veröffentlicht, geleakt oder aus dem Verhalten rückentwickelt. DeepSeek hat gezeigt, dass ein schneller Nachfolger einen mehrjährigen Vorsprung in Monate komprimieren kann. Welche Attention-Variante oder welchen State-Space-Trick Sie heute bevorzugen, ist einen Blogbeitrag davon entfernt, allen zu gehören.
Ihre GPUs sind allein nicht Ihr Burggraben. Rechenkapazität ist knapp, aber sie wird beschaffbar. Der Zusammenschluss von Together und YC ist der Beweis: viele Anbieter, sinkende Wechselkosten und Vertragsbedingungen, die in Richtung Flexibilität tendieren. Compute ist ein Rennen, das Sie nicht verlieren dürfen. Es ist kein Rennen, das Sie gewinnen können.
Ihre Daten sind allein auch nicht Ihr Burggraben. Wenn Ihr Plan dieselben lizenzierten Datensätze und dieselben APIs wie alle anderen sind, haben Sie ein Problem. Sie trainieren dasselbe Modell wie alle anderen, mit großem Aufwand. Was bleibt also?
Compute + Data + Recipe = Company
Hier ist der Rahmen, den ich in Ihr nächstes Board-Meeting mitnehmen würde.
Im Jahr 2026 ist die Gleichung einfach: Compute + Data + Recipe = Company. Alles andere, der Code, die Infrastruktur und die App-Schicht, kann ein Agent neu aufbauen. Ihre Weights sind der Ort, an dem alle drei zusammentreffen, physisch gemacht. Das ist der Burggraben.
Weights sind das einzige Artefakt in Ihrem Unternehmen, das agentisches Coding nicht replizieren kann. Nicht weil sie geheim sind. Weil sie ein komprimiertes Protokoll von Entscheidungen sind. Jeder Filtervorgang, jede Curriculum-Entscheidung und jede RL-Umgebung ist in die Parameter eingebacken. Ebenso jede Entscheidung, 40 % des Korpus wegzuwerfen, weil Ihre Domänenexperten sagten, es sei wertlos. Zwei Teams mit identischen Clustern und identischen Rohdaten liefern trotzdem unterschiedliche Modelle, weil das Recipe das Modell ist.
Deshalb ist die Schnittmenge wichtiger als jeder einzelne Kreis.
- Data ohne Compute ist eine Festplatte.
- Compute ohne differenzierte Data ist ein sehr teurer Weg, Llama zu reproduzieren.
- Data und Compute ohne Urteilsvermögen ist der Weg, wie Sie eine Series A verbrennen und dabei eine benchmark-förmige Ware produzieren.
Die Weights sitzen dort, wo alle drei sich überschneiden. Alles andere in Ihrem Stack ist ersetzbar. Dieses Artefakt nicht.
Sie befinden sich gleichzeitig in zwei Rennen
Jeder erkennt das Compute-Rennen, weil es eine laute Anzeigetafel hat. Cluster-Ankündigungen, Mega-Runden und Zweijahresverträge. Jetzt YC-artige Partnerschaften, um sie zu umgehen. Das Daten-Rennen läuft parallel, genau jetzt, mit denselben Gesetzmäßigkeiten und derselben Dringlichkeit. Knappes Angebot, konsolidierende Zugänge und frühe Akteure, die Konditionen festlegen.
Die Signale sind überall. Reddit unterzeichnete einen Lizenzvertrag über 60 Millionen Dollar pro Jahr mit Google. Eine Inference-Cloud zahlte 275 Millionen Dollar für die Übernahme einer Web-Zugriffsschicht. Hyperscaler liefern Datenzugang jetzt als erstklassige Infrastruktur. Es ist dasselbe Schlagzeilenmuster wie bei Compute. Es erscheint nur auf einer ruhigeren Seite.
Das Daten-Rennen trägt einen entscheidenden Unterschied. Es gibt keinen Spotmarkt für Daten, die Sie nicht gesammelt haben. Verpassen Sie ein Compute-Fenster und warten Sie ein Quartal. Verpassen Sie das Datenfenster, und der Korpus, den Sie brauchten, wurde nie gesammelt.
Wo leben Daten in diesem Maßstab also wirklich? Nicht in akademischen Snapshots, die eingefroren sind. Nicht in lizenzierten Katalogen, die enge Silos sind, eine Domäne nach der anderen. Nicht in Common Crawl, das erschöpft ist und nie Video enthielt. Das offene Web ist die größte Quelle von Trainingsdaten, die es gibt. Text, Bilder, PDFs und vor allem Video, täglich aktualisiert, in jeder Sprache, über jede Domäne.
Aber das Web gibt sich nicht preis. Im Petabyte-Maßstab ist die Sammlung eine industrielle Fähigkeit. Bot-Walls, Rate-Limits, Rendering, Aktualität und Herkunft, die Ihr Rechtsteam verteidigen kann. Open-Source-Scraping-Stacks erreichen maximal 60 bis 75 % Erfolg und brechen mitten im Lauf ab. Deshalb enden so viele gut finanzierte Labs damit, dass Forscher Crawler betreuen, anstatt Modelle zu trainieren.
So wie Sie Ihre eigenen GPUs nicht herstellen würden, ist die eigene Web-Sammlung ein Unternehmen im Unternehmen. Hier möchte ich direkt sein, wo ich stehe, denn das ist es, was wir bei Bright Data tun. Wir sammeln jede Woche etwa ein Petabyte Web-Daten. Das liegt auf einem 90-Petabyte-Web-Archiv. Es enthält 630 Milliarden Seiten über 320 Millionen Domains. Wir arbeiten mit 99,99 % Verfügbarkeit, mit Compliance, die vor Gericht getestet wurde. Soweit ich weiß, betreibt niemand sonst Web-Sammlung in dem Maßstab, den ein Frontier-Training-Run erfordert.
Ziehen Sie die Parallele bis zum Ende. Die frühzeitige Sicherung von Compute ist das Mindeste. Die frühzeitige Sicherung von web-skaliger Datenversorgung ist der identische Schritt, im identischen Moment. Dieselben Marktdynamiken spielen sich genau jetzt ab, in der Spur, die weniger Menschen beobachten.
Was das für Ihre Ausgaben nach der Finanzierungsrunde bedeutet
1. Behandeln Sie Compute als Rennen und Data als Asset. Compute mieten Sie zu den besten Konditionen, die Sie bekommen können. Der Markt bewegt sich in Ihre Richtung, also nutzen Sie das. Data besitzen Sie: gesichert, versioniert, aktualisiert und anders als das, was Ihre Wettbewerber bekommen können. Für die meisten Teams bedeutet das, über den erschöpften öffentlichen Korpus hinauszugehen. Forscher prognostizieren jetzt, dass hochqualitatives öffentliches Text-Material zwischen 2026 und 2032 aufgebraucht sein wird. Wenn Sie auf dem trainieren, was jeder herunterladen kann, haben Sie das Modell Ihrer Wettbewerber gewählt.
2. Wenn Sie in physischer KI oder Video tätig sind, gilt das doppelt. Ihr Korpus war nie in Common Crawl. World-Modelle und VLAs laufen auf Video, egozentrischer, aufgabenreicher und vielfältiger Natur. Die Labs, die dieses Rennen gewinnen, sind jene, die dessen Sammlung jetzt industrialisieren, bevor die Kategorie standardisiert wird. Ihre Datenpipeline ist keine unterstützende Infrastruktur. Sie ist die Produktentscheidung.
3. Setzen Sie Ihr knappes Senior-Talent auf das Recipe, nicht auf die Klempnerarbeit. Agenten können Ihre Data-Loader schreiben. Sie können nicht entscheiden, was ein Roboter sehen muss, um zu lernen, Wäsche zu falten. Sie können nicht entscheiden, was ein Suchmodell sehen muss, um Google in Ihrer Vertikale zu schlagen. Dieses Urteilsvermögen, der dritte Kreis, ist der Bereich, in dem Ihre Forscher unersetzlich sind. Planen Sie entsprechend.
4. Sagen Sie es Ihrem Board klar. Unser Burggraben sind unsere Weights: eine Datenversorgung, die Wettbewerber nicht haben, unser eigenes Recipe, auf frühzeitig gesichertem Compute. Das ist ein Satz, der eine Due-Diligence-Prüfung übersteht. ‘Wir haben großartige Ingenieure’ nicht mehr.
Die unbequeme Uhr
Noch eine Sache, die Ihnen der Together-und-YC-Deal sagt. Die Inputs konsolidieren sich schnell. Compute wird in Clustern und Partnerschaften gesperrt. Data wird in Lizenzen und Übernahmen gesperrt. Die Schnittmenge, die Sie 2026 aufbauen können, ist größer als die, die 2027 verfügbar sein wird. Die Kreise schrumpfen für Nachzügler.
Compute + Data + Recipe = Company. Die zwei Rennen laufen parallel. Sie werden nur als Zieleinläufer in beiden gezählt.