---
title: "Internet Archive vs Common Crawl vs Web-Archiv"
slug: internet-archive-vs-common-crawl-vs-web-archive
date: 2026-08-23T07:22:42+00:00
modified: 2026-09-06T16:38:45+00:00
permalink: https://brightdata.de/blog/web-data-de/internet-archive-vs-common-crawl-vs-web-archive
type: blog
---

[ Blog ](https://brightdata.de/blog "Blog") / [Web Data](https://brightdata.de/blog/web-data-de)







 [Web Data](https://brightdata.de/blog/web-data-de)

# Internet Archive vs Common Crawl vs Web-Archiv

Was Internet Archive und Common Crawl jeweils speichern, was eine Abfrage kostet und wann Bright Data Live-Sammlung die bessere Wahl ist.

 23 min lesen





 [ ![Satyam Tripathi](https://media.brightdata.de/2024/09/Satyam-Tripathi-50x50.png) ](https://brightdata.com/blog/authors/satyam-tripathi)

 [Satyam Tripathi

Technical Writer

 ](https://brightdata.com/blog/authors/satyam-tripathi)





 ![Internet Archive vs Common Crawl vs Web archive](https://media.brightdata.de/2026/08/Internet-Archive-vs-Common-Crawl-vs-Web-archive.png)





Wir haben den `CC-MAIN-2026-30` Common-Crawl-Index nach `theguardian.com` abgefragt und 185 Einträge erhalten. Kein einziger ist ein Artikel. Jeder Eintrag ist die eigene `robots.txt` der Website oder eine Weiterleitung dazu, und diese Datei verbietet CCBot. Die Berechtigungsprüfung ist das Einzige, was der Crawl gespeichert hat.

Die Wayback Machine des Internet Archive und Common Crawl speichern beide Kopien von Seiten, die nicht mehr existieren, und beantworten unterschiedliche Fragen. Die Wayback Machine gibt eine einzelne URL so wieder, wie sie an einem von Ihnen gewählten Datum aussah. Common Crawl liefert Milliarden von Seiten als Bulk-Text, ohne Wiedergabe. Ein Web-Archiv ist die Kategorie, der beide angehören, und kein drittes Produkt. Zur selben Kategorie gehören nationale Web-Archive, Abonnementdienste wie Archive-It, On-Demand-Capture-Seiten wie archive.today und WARC-Dateien, die Sie selbst erstellen. Beide Dienste beantworten Fragen über die Vergangenheit; keiner sammelt fortlaufend eine definierte Menge von Websites.

## TL;DR

- CCBot führt kein JavaScript aus. Eine client-gerenderte Seite kommt als Shell an.
- Fragen Sie Common Crawl zuerst für Bulk-Arbeit ab und die Wayback Machine für die fehlenden Treffer; kehren Sie die Reihenfolge für eine bekannte URL-Liste um.
- Ein CDX-`digest` ist der Payload-SHA-1, also `collapse=digest` und `collapse=timestamp` im Index vergleichen, bevor Sie abrufen. Common Crawl ignoriert `collapse`.
- Legen Sie einen Wayback-CDX-Client auf 24 Anfragen pro Minute aus, also 80 % des gemeinsamen Pools von 30/min.
- Keiner der Dienste veröffentlicht eine Abdeckungsgarantie oder ein SLA, und keiner sammelt fortlaufend eine definierte Menge von Websites. Messen Sie Ihre Domains zuerst.

## Was Internet Archive und Common Crawl jeweils speichern

Ein Wayback-Capture ist als `web.archive.org/web/<timestamp>/<url>` adressierbar, und dieselbe URL kann über drei Jahrzehnte hinweg Tausende von Captures tragen. Die Standard-Wiedergabe schreibt Links um und fügt eine Toolbar ein, damit die Seite im Browser gerendert wird.

Jeder monatliche Common-Crawl-Crawl ist ein Satz WARC-Dateien plus abgeleitete Text- und Metadatendateien, die in einem öffentlichen Bucket veröffentlicht werden. Ein Index zeigt Ihnen, in welchem Byte-Bereich welcher Datei eine bestimmte URL gespeichert ist.

Wayback MachineCommon CrawlSpeichertCaptures einzelner URLs über die Zeitvollständige monatliche Crawls, WARC plus abgeleiteter TextBeantworteteine URL über viele Datenviele URLs aus einem Crawl-DatumWiedergabeja, mit umgeschriebenen Links und eingefügter ToolbarkeineVolltextsuchekeinekeine, aber WET-Dateien liefern den Text zum IndizierenBulk-Exportkeiner, API-Zugriffder gesamte Crawl, kostenlos in einem öffentlichen BucketRate-Limit30 Anfragen pro Minute, CDX und Timemap geteilt, nicht vom Internet Archive veröffentlichtkeines veröffentlicht, “stark ratenbegrenzt”Abdeckungsgarantiekeinekeine, und nach Domain-Rang gesampelt[`CC-MAIN-2026-30`](https://commoncrawl.org/blog/july-2026-crawl-archive-now-available) wird mit 2,14 Milliarden Seiten und 364 TiB unkomprimiertem Inhalt über 40,5 Millionen Hosts angekündigt, die in 18 Tagen gecrawlt wurden. Common Crawl beziffert das Gesamtkorpus auf über 300 Milliarden Seiten und beschreibt die Rate mit 3 bis 5 Milliarden neuen Seiten pro Monat, obwohl die letzten 18 veröffentlichten Crawls alle unter 3 Milliarden lagen. Bemessen Sie einen Job anhand eines einzelnen Crawls.

Common Crawls FAQ lautet: “Derzeit wird JavaScript nicht ausgeführt und Cookies werden nicht verwendet”. CCBot speichert die rohe HTTP-Antwort, sodass eine client-gerenderte Seite als Shell ankommt. Wenn die Seiten, die Sie interessieren, ihren Inhalt im Browser aufbauen, prüfen Sie einen Capture, bevor Sie Ihre Planung auf Common Crawl aufbauen.

Jeder Crawl enthält fünf parallele Dateisätze mit je 100.000 Dateien. WARC enthält die vollständige Antwort, WAT enthält extrahierte Metadaten und Links, WET enthält nur Klartext, und zwei weitere enthalten die `robots.txt`-Captures und die Nicht-200-Antworten. Ein Link-Graph-Job, der WARC liest, bewegt weit mehr Bytes als nötig.

Common Crawl verspricht nicht, eine Seite erneut zu besuchen, sodass viele URLs über viele Daten eine Frage ist, die keiner der Dienste beantwortet.

![Zwei-mal-zwei-Matrix. Vertikale Achse von einem Datum zu vielen Daten, horizontal von einer URL zu vielen URLs. Die Wayback Machine belegt eine URL über viele Daten; Common Crawl viele URLs aus einem Crawl-Datum; eine URL an einem Datum ist für beide trivial. Das verbleibende Quadrant, viele URLs über viele Daten, wird von keinem abgedeckt.](https://media.brightdata.com/2026/08/Hyu7W0SUGe.png)Common Crawls [FAQ](https://commoncrawl.org/faq) beschreibt die Sampling-Richtlinie: Der Datensatz “ist eine Stichprobe des Webs, und wir archivieren im Allgemeinen keine gesamte Website, sondern eine zufällig ausgewählte Teilmenge davon”. Der Mechanismus ist in einem [Common-Crawl-Engineering-Vortrag](https://indico.cern.ch/event/1006978/contributions/4539477/attachments/2325769/3962907/ossym2021-sn-web-graphs-crawling.pdf) dokumentiert und nicht in der FAQ: Domain-level harmonische Zentralitätswerte definieren ein Budget für die Anzahl der URLs, die jede Domain erhält, sodass gut verlinkte Domains ein größeres Budget erhalten und niedrig eingestufte Domains möglicherweise keines.

Die Wayback Machine hat keine Volltextsuche über archivierte Seiteninhalte. Die eigene [Hilfeseite](https://help.archive.org/help/using-the-wayback-machine/) sagt, das Internet Archive hoffe, “zu einem zukünftigen Zeitpunkt eine Volltext-Suchmaschine zu implementieren”. Die Website-Suche findet Website-Metadaten, nicht den Text innerhalb archivierter Seiten. Common Crawl liefert den Text, aber keine Wiedergabe, sodass eine aus einer WET-Datei rekonstruierte Seite nicht wie das Original aussieht.

## Was eine Domain-Abfrage zurückgibt

Wir haben dieselbe Abfrage gegen fünf Domains ausgeführt, mit Präfix-Matching.

Abgefragte DomainIndex-Einträge`robots.txt`-EinträgeInhaltsseiten`nytimes.com/*`110`cnn.com/*`110`bbc.com/*`220`theguardian.com/*`1851850`github.blog/*`4.700494.651Die 185 Einträge von The Guardian lösen sich in nur zwei URLs auf, die `robots.txt` und ihre `http`-Weiterleitung, die durch den Crawl erneut abgerufen wurden. Ein Skript, das Index-Einträge zählt, würde alle fünf als abgedeckt bezeichnen und bei vier falsch liegen. Von `github.blog`‘s 4.651 Inhaltseinträgen antworteten 3.647 mit 200.

Der Match-Typ verändert das Ergebnis. SURT-Kanonisierung faltet `www.` in den nackten Host, aber ein `domain/*`-Präfix-Match erreicht keine andere Subdomain: `cnn.com/*` gab 1 Eintrag zurück, während `*.cnn.com` 11 zurückgab, und `nytimes.com/*` gab 1 gegenüber 2 für `*.nytimes.com` zurück. Jeder Eintrag war ein `robots.txt`-Abruf unter beiden Formen, aber die Anzahlen sind eine Eigenschaft der Abfrage ebenso wie des Crawls. Geben Sie Ihren Match-Typ immer an, wenn Sie eine solche Zahl berichten.

Dieselbe Abfrage datiert die Blockierung ungefähr, wenn Sie sie gegen ältere Crawl-IDs ausführen. Die Abfrage hat einen blinden Fleck: Sie sieht, was ein Publisher in `robots.txt` geschrieben hat, nicht eine am Netzwerk-Edge angewendete Blockierung oder einen späteren Opt-out, sodass sie eher als Untergrenze denn als Zählung zu lesen ist. Unser [robots.txt-Leitfaden für Web-Scraping](/blog/how-tos/robots-txt-for-web-scraping-guide) erläutert, wie die Agent-Gruppen aufgelöst werden.

Die Größe pro Crawl ist ebenfalls gesunken. Die [veröffentlichten Crawl-Größenstatistiken](https://commoncrawl.github.io/cc-crawl-statistics/plots/crawlsize/monthly.csv) von Common Crawl zeigen, dass die monatliche Seitenzahl von 3,031 Milliarden in `CC-MAIN-2025-05` auf 2,149 Milliarden in `CC-MAIN-2026-30` gesunken ist, ein Rückgang von 29,1 %. Über die 29 Crawls von `CC-MAIN-2024-10` bis `CC-MAIN-2026-30` hinweg durchschnittlich 2,69 Milliarden Seiten für die 10 Crawls von 2024, 2,53 Milliarden für die 12 Crawls von 2025 und 2,15 Milliarden für die 7 bis Juli 2026 veröffentlichten Crawls.

![Liniendiagramm der Common-Crawl-Seiten pro Crawl, die von 3,1 auf etwa 2,1 Milliarden fallen, mit gestrichelten Jahresmittelwerten bei 2,69 Mrd. für 2024, 2,53 Mrd. für 2025 und 2,15 Mrd. für die sieben 2026er Crawls bis Juli.](https://media.brightdata.com/2026/08/BkLVWAB8zx.png)Nichts hier identifiziert eine Ursache: Die Crawl-Größe bewegt sich mit Infrastruktur, Budget und Planung innerhalb von Common Crawl ebenso wie mit allem, was Publisher tun. Der Rückgang bedeutet, dass ein Korpus, der nach einem Crawl von 2024 bemessen wurde, einen von 2026 um etwa ein Viertel überschätzt, und dass Counts pro Crawl nicht addiert werden dürfen. Aufeinanderfolgende Crawls rufen einen Großteil derselben Frontier erneut ab, sodass das Summieren ohne Deduplizierung nach `urlkey` und `digest` die Schätzung erneut aufbläht.

### Überprüfen Sie Ihre eigenen Domains

Das Skript zählt Inhaltseinträge gegen `robots.txt`-Abrufe für den neuesten veröffentlichten Crawl, unter Verwendung desselben `domain/*`-Präfix-Matchs wie die Tabelle. Es geht den Index seitenweise durch, verwirft eine Seite, deren Abschneidung einen Eintrag teilt statt einen Teil davon zu zählen, und macht weiter, wenn eine Domain nie sauber antwortet. Die beiden unten aufgeführten Domains benötigen etwa 70 Sekunden, fast alles davon die absichtlichen Wartezeiten:

```none
import http.client, json, time, urllib.error, urllib.parse, urllib.request

DOMAINS = ["theguardian.com", "github.blog"]
# Use your own contact address. One shared UA string arriving from many callers
# is the string an operator blocks.
UA = {"User-Agent": "coverage-check/1.0 (<a class="__cf_email__" data-cfemail="d7aeb8a297b2afb6baa7bbb2f9b4b8ba" href="/cdn-cgi/l/email-protection">[email protected]</a>)"}

def latest_crawl():
    """Common Crawl ships roughly monthly. Hardcoding an ID measures a stale crawl
    and returns a number that looks current."""
    url = "https://index.commoncrawl.org/collinfo.json"
    info = urllib.request.urlopen(urllib.request.Request(url, headers=UA), timeout=60).read()
    return json.loads(info)[0]["id"]        # newest first

CRAWL = latest_crawl()
INDEX = f"https://index.commoncrawl.org/{CRAWL}-index"
print(f"crawl: {CRAWL}")

def fetch(params, tries=3):
    url = f"{INDEX}?{urllib.parse.urlencode(params)}"
    for attempt in range(tries):
        wait = None
        try:
            return urllib.request.urlopen(
                urllib.request.Request(url, headers=UA), timeout=120).read()
        except urllib.error.HTTPError as e:
            if e.code == 404:
                return None               # this crawl never captured the domain
            if e.code not in (429, 500, 502, 503, 504):
                raise
            wait = e.headers.get("Retry-After")   # the server's own number beats ours
        except (urllib.error.URLError, http.client.IncompleteRead, TimeoutError):
            pass                          # dropped connection
        time.sleep(int(wait) if wait and wait.isdigit() else 5 * 2 ** attempt)
    return b""

def coverage(domain):
    """(robots, content) for one domain, or None if the index never answered cleanly."""
    query = {"url": f"{domain}/*", "output": "json", "pageSize": 1}
    head = fetch({**query, "showNumPages": "true"})
    if head is None:
        return 0, 0
    if not head:
        return None
    robots = content = 0
    for page in range(json.loads(head)["pages"]):
        body = fetch({**query, "page": page})
        if not body:
            return None
        # CDXJ is one JSON object per line. Use split, not splitlines(): splitlines()
        # breaks on several characters that are not newlines, which cuts records in half.
        for line in body.split(b"\n"):
            if not line.strip():
                continue
            try:
                record = json.loads(line)
            except json.JSONDecodeError:
                return None               # the page arrived incomplete
            if record.get("url", "").rstrip("/").endswith("/robots.txt"):
                robots += 1
            else:
                content += 1
        time.sleep(5)
    return robots, content

for domain in DOMAINS:
    result = coverage(domain)
    if result is None:
        print(f"{domain}: no clean response")
    else:
        robots, content = result
        print(f"{domain}: {robots + content} records, {robots} robots.txt, {content} content")
    time.sleep(20)
```

Es gibt aus:

```none
crawl: CC-MAIN-2026-30
theguardian.com: 185 records, 185 robots.txt, 0 content
github.blog: 4700 records, 49 robots.txt, 4651 content
```

Gegen `CC-MAIN-2026-30` reproduzieren die beiden Domain-Zeilen die obige Tabelle. Ein neuerer Crawl gibt andere Zahlen zurück; was gelten sollte, ist die Form: nur robots für `theguardian.com` und inhaltsbezogen für `github.blog`. Einträge ohne Inhaltsseiten bedeuten, dass der Crawl keinen Seiteninhalt von dieser Domain enthält.

## So fragen Sie jede Quelle ab und was der Round-Trip kostet

Beide Dienste stellen einen CDX-Index bereit, aber die Antwortformate unterscheiden sich: Der Wayback-CDX-Server gibt ein JSON-Array von Arrays zurück, Common Crawls `output=json` gibt CDXJ zurück, ein JSON-Objekt pro Zeile.

**Der Wayback-CDX-Server gibt eine Zeile pro Capture zurück**, und serverseitiges Filtern hält die Antwort klein genug zum Durchblättern:

```none
curl "https://web.archive.org/cdx/search/cdx?url=example.com&output=json&from=2026&limit=3&fl=timestamp,original,statuscode"
```

Das gibt zurück:

```none
[["timestamp","original","statuscode"],
["20260101000936","http://www.example.com/","200"],
["20260101002937","https://example.com/","200"],
["20260101004445","https://example.com/","200"]]
```

Um eine archivierte Seite zu parsen statt sie zu rendern, fordern Sie den rohen Capture an. Das Hinzufügen von `id_` nach dem Zeitstempel gibt die originalen Bytes zurück, ohne Toolbar und ohne umgeschriebene Links:

```none
curl -sL "https://web.archive.org/web/2026id_/https://example.com/" -o raw.html
curl -sL "https://web.archive.org/web/2026/https://example.com/"    -o rewritten.html
```

Die umgeschriebene Kopie enthält eingefügte Verweise auf `web.archive.org`, die Selektoren beschädigen können, die auf der DOM-Struktur verankert sind.

Neben dem Match-Typ entscheiden zwei Felder in einer CDX-Zeile und ein Abfrageparameter darüber, was eine Abfrage findet, ob Sie Änderungen erkennen können und was es kostet.

`urlkey` ist die SURT-Form der URL. `https://github.blog/` wird als `blog,github)/` indiziert: Host umgekehrt, dann Pfad. Präfix- und Bereichsabfragen operieren auf diesem Schlüssel und nicht auf der von Ihnen eingegebenen URL, weshalb die Behandlung von `www.` und die Reihenfolge der Query-Strings entscheiden, ob eine Abfrage überhaupt etwas trifft.

`digest` ist der Payload-SHA-1, base32-kodiert, und es ist der Wert, den der WARC-Eintrag als `WARC-Payload-Digest` trägt. Ein Hex-Digest wird nicht damit übereinstimmen. Änderungserkennung ist daher eine Index-Operation: Zwei Zeilen mit demselben Digest haben dieselben Payload-Bytes.

`collapse` macht daraus die Abfrage, die Sie eigentlich wollen. Den Wayback-CDX-Server nach jedem `example.com`-Capture im Kalenderjahr 2024 zu fragen, gibt 130.115 Zeilen zurück. Dieselbe Abfrage mit `collapse=timestamp:8` gibt 366 zurück, eine pro Tag: Zeitstempel sind `YYYYMMDDhhmmss`, sodass das Abschneiden auf acht Stellen nach dem Datum zusammenfasst. Mit `collapse=digest` gibt sie 17.448 zurück, eine pro Änderung zwischen aufeinanderfolgenden Captures. Common Crawls Index akzeptiert den Parameter und ignoriert ihn, gibt also in beiden Fällen dieselben Zeilen zurück.

**Paginierung über `page` und `pageSize` zählt Index-Blöcke und nicht Ergebniszeilen**, und die Blockgröße variiert: Zwei benachbarte Blöcke einer Abfrage gaben 2.032 und 4.726 Einträge zurück. Den Wayback-CDX-Server nach `bbc.com` mit `matchType=domain` und `pageSize=1` zu befragen, meldete 28.257 Seiten.

Eine Seite kann leer zurückkommen, einfach weil Ihre Filter in diesen Blöcken nichts gefunden haben, was nicht bedeutet, dass das Ergebnis-Set beendet ist. Der Standard-`pageSize` ist 1, und die Dokumentation nennt kein Maximum.

Common Crawls Index paginiert auf dieselbe Weise, mit drei Unterschieden: `showNumPages` gibt JSON statt einer nackten Zahl zurück, der Standard-`pageSize` ist 5 statt 1, und seine Blöcke haben eine andere Größe. Bemessen Sie eine Schleife anhand von `showNumPages` statt einer angenommenen Blockgröße, und fragen Sie die Seitenanzahl bei der `pageSize` ab, die Sie verwenden möchten, da sich die Anzahl damit ändert.

Es gibt zwei Möglichkeiten zu iterieren. Der Standard ist der Limit-Modus, bei dem `limit` und ein Resume-Schlüssel das Ergebnis-Set durchlaufen; der Seitenmodus verwendet stattdessen `page` und `pageSize`. Der Seitenmodus existiert, damit die Seitenanzahl im Voraus bekannt ist und die Arbeit auf Worker verteilt werden kann. Der Limit-Modus macht in der Regel weniger Anfragen insgesamt, kann aber bei einer selten gecapturten URL über einen weiten Datumsbereich weit genug scannen, um zu einem Timeout zu führen.

**Common Crawl kehrt den Abrufschritt um**, und der Vorteil ist, dass das Abrufen einer Seite eine einzige Range-Anfrage statt eines Datei-Downloads kostet. Der Index gibt Ihnen einen Dateinamen, einen Byte-Offset und eine Länge, sodass eine HTTP-Range-Anfrage einen einzelnen Eintrag zurückliefert. Da CDXJ ein Objekt pro Zeile enthält, liest der folgende Code eine Zeile statt den gesamten Body zu parsen:

```none
import gzip, json, urllib.error, urllib.parse, urllib.request

url = "https://example.com/"
crawl = "CC-MAIN-2026-30"
q = urllib.parse.quote(url, safe="")

# Common Crawl asks API clients for a properly formed UserAgent. Use your own.
ua = {"User-Agent": "coverage-check/1.0 (<a class="__cf_email__" data-cfemail="156c7a6055706d74786579703b767a78" href="/cdn-cgi/l/email-protection">[email protected]</a>)"}

# Step 1: ask the index which WARC file and byte range holds this page.
index = f"https://index.commoncrawl.org/{crawl}-index?url={q}&output=json&limit=1"
try:
    req = urllib.request.Request(index, headers=ua)
    rec = json.loads(urllib.request.urlopen(req, timeout=60).read().split(b"\n")[0])
except urllib.error.HTTPError as e:
    if e.code != 404:
        # 502, 503 and 504 all mean try again later, not "not captured".
        # Treating them as a miss under-reports coverage.
        raise
    # A URL this crawl never captured returns 404. That is the normal case for a
    # blocked domain, not an error in your code.
    raise SystemExit(f"{url} is not in {crawl}")

# Step 2: fetch only those bytes.
offset, length = int(rec["offset"]), int(rec["length"])
warc = "https://data.commoncrawl.org/" + rec["filename"]
req = urllib.request.Request(warc, headers={**ua, "Range": f"bytes={offset}-{offset + length - 1}"})
record = gzip.decompress(urllib.request.urlopen(req, timeout=60).read())

print(record.decode("utf-8", "replace")[:400])
```

Das gibt einen gzip-komprimierten WARC-Eintrag zurück, der die Antwort-Header und das Seiten-HTML enthält. Über 29 gesampelte Inhaltseinträge hinweg betrug die komprimierte Größe 7 bis 45 KiB, sodass die Range-Anfrage Kilobytes aus einer Datei von etwa 900 MiB bewegt. Derselbe Pfad funktioniert gegen jeden Crawl, den der Index-Server auflistet.

Für Arbeit im Korpus-Maßstab liefert Common Crawls [URL-Index](https://commoncrawl.org/url-index) denselben Index als Parquet mit zusätzlichen Spalten, veröffentlicht unter `s3://commoncrawl/cc-index/table/cc-main/warc/` und abfragbar mit DuckDB lokal oder Athena in AWS. Common Crawl beziffert den spaltenorientierten Index auf etwa 300 GB pro monatlichem Crawl und einen vollständigen Athena-Scan auf etwa 1,50 $ Stand September 2025, sodass die meisten gefilterten Abfragen weniger kosten. Der Datenzugriff selbst ist über das AWS Open Data Program kostenlos, und `data.commoncrawl.org` benötigt kein AWS-Konto, obwohl Egress von Ihrem eigenen Cloud-Anbieter weiterhin Ihre Kosten sind.

## Rate-Limits und Kontingente, auf die Sie stoßen werden

Common Crawls FAQ sagt, der CDX-Endpunkt “wird häufig missbraucht und daher stark ratenbegrenzt”. Ein HTTP 503 bedeutet, langsamer zu werden, und eine vorübergehend blockierte IP sollte 24 Stunden warten. Die Anleitung bittet Sie auch, zwischen Aufrufen zu schlafen, mehrere Threads von einer IP zu vermeiden, Proxy-Netzwerke zu vermeiden und einen korrekt geformten `User-Agent` zu senden, den die FAQ an RFC 9110 knüpft. Die Proxy-Klausel ist die bemerkenswerteste. Der Block der FAQ und seine Threading-Anleitung richten sich beide an die IP, sodass die Verteilung eines Jobs auf mehr Adressen das Limit umgeht statt es zu respektieren, und die Eskalation ist eine Blockierung der Adresse statt weiterer 503er.

Das Internet Archive veröffentlicht Kontingente für Save Page Now und praktisch nichts für die Lese-APIs. Die [Save Page Now 2-Spezifikation](https://docs.google.com/document/d/1Nsv52MvSjbLb2PCpHlat0gkzw0EvtSgpKHu4mk0MnrA/) gibt diese Limits an:

LimitAuthentifiziertAnonymCaptures pro Minute73Captures pro Tag30.000200Archivierte Bytes pro Tag5 GB2 GBCaptures derselben URL pro Tag55Die Spezifikation nennt keine bezahlte Stufe über diesen Zahlen und verweist stärkere Nutzer an eine E-Mail an das Internet Archive. Die Spezifikation gibt die anonyme Zahl sowohl als 2 GB als auch als 500 MB an, und ihr Changelog senkte die authentifizierte Zahl auf 4 GiB, während die Tabelle noch immer 5 GB angibt.

Für die Lese-APIs stammen die Zahlen von außerhalb des Internet Archive. Der Maintainer des `wayback`-Python-Clients [hat ein Gespräch](https://github.com/edgi-govdata-archiving/wayback/issues/205) mit Internet-Archive-Mitarbeitern dokumentiert und das Ergebnis als Standard-Werte der Bibliothek kodiert. Das Dokument ist keine Veröffentlichung des Internet Archive.

Die Endpunkte `/cdx/search/cdx` und `/web/timemap/` sind jetzt ein Dienst auf denselben Servern, der sich nur darin unterscheidet, wie er den `output`-Parameter liest, und sie teilen sich einen einzigen Rate-Limit-Pool. Dieser Pool beträgt 30 Anfragen pro Minute für beide zusammen. Das Dokument sagt nicht, ob der Zähler an eine Adresse oder ein Konto gebunden ist, sodass ein auf Worker verteilter Job nicht davon ausgehen kann, dass sich das Budget multipliziert. Der Memento-Endpunkt bedient die Wiedergabe und nutzt einen separaten Pool.

Die Bibliothek kodiert diese Limits als ihre Standard-Werte, `0,8 * 30 / 60` für CDX und `0,8 * 600 / 60` für die Wiedergabe, nachdem Internet-Archive-Mitarbeiter gebeten hatten, dass Clients bei 80 % der Hard-Limits bleiben. Das sind 24 Anfragen pro Minute statt 30 und 480 für die Wiedergabe. Legen Sie dagegen aus, nicht gegen die Caps.

Der Verfügbarkeits-Endpunkt unter `archive.org/wayback/available` ist ein dritter Dienst ohne eigenes veröffentlichtes Limit, also behandeln Sie ihn als begrenzt statt als frei. Beachten Sie `Retry-After`, wenn die Antwort einen enthält. Wenn keiner vorhanden ist, pausiert der `wayback`-Client 60 Sekunden, bevor er es erneut versucht.

## Warum archive.today-Captures nicht eigenständig verifiziert werden können

archive.today rendert Seiten beim Capture in einem Browser und ignoriert `robots.txt`, sodass es Seiten enthält, die die Wayback Machine nicht hat. Zitations-Workflows haben archive.today für diese Abdeckung übernommen.

archive.today speichert veränderliches HTML statt WARC, sodass es keinen Payload-Digest gibt und nichts im Capture, gegen das man es prüfen könnte. Es wurden Belege vorgelegt, dass die Betreiber archivierte Seiten verändert haben, und Wikipedia hat die Site abgelehnt und sie zur Spam-Blacklist hinzugefügt. Die [abschließende Erklärung](https://en.wikipedia.org/wiki/Wikipedia:Archive.today_guidance) beginnt mit einem anderen Grund: Sie sagt, die Site habe Code eingebettet, der die Browser von Besuchern in einen Denial-of-Service-Angriff gegen einen Blog verwandelte, und behandelt die veränderten Snapshots als zusätzlich.

Überprüfen Sie alles, was Sie bereits aus archive.today zitieren, gegen eine zweite Quelle. Dieselbe Seite vermerkt, dass der Code im Juni 2026 noch mit reduzierter Aufrufrate vorhanden war, und empfiehlt jedem, der die Site benötigt, sie hinter einem Content-Blocker zu laden.

## Nationale Archive, Formate und Replay-Tools

**Arquivo.pt:** Das portugiesische nationale Web-Archiv betreibt eine Volltext-Such-API, die die Wayback Machine nicht hat. Ein `GET` an [`arquivo.pt/textsearch`](https://github.com/arquivo/pwa-technologies/wiki/APIs) gibt JSON zurück, das pro Ergebnis einen `linkToExtractedText` enthält, sodass Sie das HTML-Parsing vollständig überspringen. Die API ist kostenlos und benötigt keinen Schlüssel, und das dokumentierte Limit ist 250 Anfragen pro 60 Sekunden von einer IP, geteilt über Volltext- und URL-Suche statt separat budgetiert. Das Überschreiten dieses Limits ist als Grund für eine dauerhafte Blockierung dokumentiert, während Common Crawls Blockierung vorübergehend ist. Die Abdeckung ist auf Portugal ausgerichtet, und die Latenz ist ungleichmäßig, von unter 3 Sekunden bis 18 über drei Einzelergebnis-Abfragen, also setzen Sie den Client-Timeout auf 30 Sekunden.

**WARC und WACZ:** WARC ist der Archivierungscontainer, standardisiert als [ISO 28500:2017](https://www.iso.org/standard/68004.html), das WARC 1.1 abdeckt. Es gibt kein WARC 1.2. [WACZ](https://specs.webrecorder.net/wacz/1.1.1/) verpackt WARC-Einträge mit einem CDX-Index, sodass ein Browser sie ohne Server wiedergeben kann. Ein 1.2.0-Entwurf ist vorhanden, aber `wacz/latest` liefert noch immer 1.1.1, also implementieren Sie gegen 1.1.1.

**Browsertrix:** Wenn Sie Captures benötigen, die Sie kontrollieren, produziert Webrecorders Crawler WACZ-Dateien, die in einem Browser über ReplayWeb.page ohne Server wiedergegeben werden. Gehostete Pläne beginnen bei 30 $ pro Monat für den Einstiegsplan, und der Crawler ist Open Source, wenn Sie ihn lieber selbst betreiben möchten.

## Wie Sie wählen

Beginnen Sie mit der Form der Frage: spezifische URLs, Text in Bulk oder eine Eigenschaft, die keiner der Dienste bietet.

**Verwenden Sie die Wayback Machine, wenn URL und Datum der Kern sind.** Eine gelöschte Seite wiederherstellen, beweisen, was eine Site vor einer Bearbeitung sagte, eine Produktseite über die Zeit verfolgen oder einen toten Dokumentationssatz wiederaufbauen. Keine andere Allzweck-Option erreicht seine Zeittiefe bei einzelnen URLs, obwohl ein nationales Archiv es innerhalb seines eigenen Geltungsbereichs erreichen kann.

Wenn der Zweck beweisrechtlich ist, planen Sie mehr als den Capture ein. US-Gerichte haben Wayback-Captures zugelassen, aber ein Ausdruck allein reicht selten aus, da Captures nicht selbstauthentifizierend sind. Eine Internet-Archive-Erklärung ist der Weg, den Gerichte akzeptiert haben, und zu Anfang 2025 veröffentlichten Preisen kostet es 250 $ pro Anfrage plus 20 $ für jede URL oder 30 $ für URLs, die eine herunterladbare Datei wie ein PDF enthalten.

**Verwenden Sie Common Crawl, wenn Sie viele Seiten wollen und es egal ist, welche.** Sprachkorpora, Modell-Pretraining, Link-Graph-Analyse, Sicherheitsforschung über viele Hosts und jede Messung, bei der eine rang-verzerrte Stichprobe akzeptabel ist. Die meisten großen offenen Pretraining-Korpora basieren darauf, einschließlich C4, RefinedWeb, FineWeb und Dolma. Wenn Sie ein Korpus statt des rohen Crawls wollen, sind diese Ableitungen und ihre Lizenzen zuerst lesenswert, und unsere [Übersicht der LLM-Trainingsdatenquellen](/blog/web-data/llm-training-data) ist ein Ausgangspunkt. Verwenden Sie es nicht, um die Abdeckung einer benannten Site zu garantieren, da die Sampling-Richtlinie die Abdeckung unvorhersehbar macht.

Eine [Studie](https://arxiv.org/abs/2605.00087) von Sichang Steven He und Kollegen klassifizierte etwa 100.000 Sites in Common Crawl und stellte fest, dass 6,0 % von ihnen von Text dominiert werden, der mit wenig menschlichem Input generiert wurde. Unter Sites, die in der ersten Hälfte von 2025 erstmals gesehen wurden, betrug der Anteil 29,4 %, gegenüber 2,1 % unter Sites, die Ende 2022 erstmals gesehen wurden.

Lesen Sie die 6,0 % und die 29,4 % als wahrscheinliche Unterschätzungen. Die Autoren berichten eine starke negative Korrelation zwischen der Genauigkeit ihres Klassifikators und dem Benchmark-Score des Modells, das eine Site generiert hat, sodass der Anteil, den der Klassifikator verpasst, wächst, je besser die Generatoren werden.

**Verwenden Sie ein nationales oder selbst betriebenes Archiv, wenn Sie eine Eigenschaft benötigen, die keiner der Dienste bietet.** Volltextsuche über archivierte Inhalte, Captures, die Sie von Anfang bis Ende kontrollieren, oder client-gerenderte Seiten, die anderswo schlecht wiedergegeben werden.

archive.today wird aus einem anderen Grund ausgeschlossen: Ein Capture, das sich nachträglich ändern kann, kann nicht eigenständig als Beweis dienen.

Für Bulk-Arbeit über viele Hosts fragen Sie Common Crawl zuerst für Breite und Kosten ab und fallen Sie dann auf die Wayback Machine zurück, was der Crawl verpasst hat. Für eine bekannte URL-Liste gehen Sie umgekehrt vor: Die meisten Common-Crawl-Lookups werden verfehlen, und jeder Lookup verbraucht eine Anfrage gegen einen Index, dessen dokumentierte Strafe für Übernutzung eine 24-stündige Blockierung ist. Und wenn eine Domain langfristig für Ihre Arbeit wichtig ist, führen Sie parallel eigene Captures mit einem WARC-produzierenden Crawler durch, denn das ist eine Kopie, deren Verfügbarkeit Sie kontrollieren.

Das Betreiben eines eigenen Crawlers kostet Speicher, Replay-Infrastruktur und einen Wartungsaufwand, den keiner der öffentlichen Dienste Ihnen berechnet, also betreiben Sie ihn selbst dort, wo der Verlust des Zugangs etwas kaputtmachen würde, und stützen Sie sich auf die öffentlichen Archive oder gekaufte Sammlungen für den Rest.

## Wenn Sie Sammlung statt eines Archivs benötigen

Keiner der Dienste ist dafür ausgelegt, eine definierte Menge von Sites nach einem Zeitplan zu sammeln. Save Page Now sammelt auf Anfrage und läuft bei 7 Captures pro Minute bei Authentifizierung, 3 ohne.

Alle vier News-Domains, die wir abgefragt haben, hatten keine Inhaltsseiten in `CC-MAIN-2026-30`. Keiner veröffentlicht eine Abdeckungsgarantie, ein SLA oder eine Support-Verpflichtung, gegen die Sie eskalieren könnten.

Wenn Sie benannte Sites nach einem Zeitplan gesammelt benötigen, mit einer von Ihnen definierten Abdeckung, ist das ein Sammlungsprodukt und kein Archiv. Crawling entdeckt, was da draußen ist; gezielte Sammlung gibt bekannte Seiten auf Anfrage zurück. Unser [Leitfaden zu Crawling vs. Web-Scraping](/blog/leadership/web-crawling-vs-web-scraping) arbeitet den Unterschied durch.

Das Bezahlen für Sammlung kauft keine Ausnahme von der Blockierung. Publisher schränken kommerzielle Crawler ebenso ein wie Archiv-Crawler; ein Anbieter ändert, wer die Wartung trägt, wenn eine Site ihre Abwehr ändert.

Bright Data verkauft gezielte Sammlung: die [Web Scraper API](/products/web-scraper) für 1 $ pro 1.000 Einträge, mit den ersten 5.000 pro Monat kostenlos, und [fertige Datensätze](/products/datasets) ab 0,0025 $ pro Eintrag bei einem Minimum von 250 $. Beide decken unterstützte Sites fortlaufend ab. Keines ersetzt die Wayback Machine, und der Grund ist ein Datumsbereich: vorgesammelte Daten reichen Tage bis Monate zurück, nicht bis 1996, sodass eine Frage darüber, was eine Seite 2014 sagte, immer noch zum Archiv geht.

## Nächste Schritte

Führen Sie das Coverage-Skript für die Domains aus, die Sie interessieren, und prüfen Sie dann dieselben Domains im Wayback-CDX-Server auf Capture-Dichte.

Inhaltseinträge sagen Ihnen, ob Bulk-Arbeit möglich ist; Capture-Dichte sagt Ihnen, ob URL-Level-History möglich ist. Eine gesunde Anzahl ist eine Messung und keine Zusage: Die Sampling-Richtlinie verspricht keine Untergrenze, und die Counts pro Crawl sind seit 2024 um etwa ein Viertel gesunken, also führen Sie die Prüfung erneut durch, bevor Sie sich darauf verlassen.

Erfassen Sie jetzt, was wichtig ist, wo der Verlust des Zugangs etwas kaputtmachen würde, kaufen Sie Sammlung für den Rest, bewahren Sie das, was Sie erfassen, in WARC auf, damit es portabel bleibt, und behandeln Sie beide öffentlichen Archive als Quellen, die Sie abfragen, und nicht als Speicher, auf den Sie sich verlassen.

## Häufig gestellte Fragen

### Kann ich Common Crawl kommerziell nutzen?

Die Nutzungsbedingungen erlauben es und legen das Risiko bei Ihnen. Common Crawl begrenzt seine Gesamthaftung auf 100 $ und verlangt, dass Sie es für Ansprüche freistellen, die aus der Verwendung gecrawlter Inhalte zur Entwicklung, zum Training oder zum Einsatz von KI-Systemen entstehen. Common Crawl empfiehlt rechtliche Beratung vor jeder kommerziellen Nutzung.

### Kann man alle Wayback-Machine-Daten herunterladen?

Nicht als Bulk. Das Internet Archive veröffentlicht keinen Bulk-Export des allgemeinen Web-Archivs, und der Zugriff läuft über ratenbegrenzte APIs. Für Analysen im Forschungsmaßstab bietet das Internet Archive ARCH an, seine Compute-Plattform, die nur auf Anfrage erhältlich ist und keine veröffentlichten Preise hat.

### Gegen welche Rate sollte ich einen Wayback-CDX-Client auslegen?

Legen Sie gegen 24 Anfragen pro Minute aus. Das Limit beträgt 30 pro Minute, was das Internet Archive nicht veröffentlicht, geteilt über die CDX- und Timemap-Endpunkte, seit sie ein Dienst wurden, und der `wayback`-Client liefert 80 % davon als Standard. Die Wiedergabe ist ein separater Pool bei 600 pro Minute, also legen Sie dort gegen 480 aus.

### Warum gibt eine Common-Crawl-Domain-Abfrage Einträge aber keinen Inhalt zurück?

Weil diese Einträge `robots.txt`-Abrufe sind. CCBot fordert `robots.txt` von jedem Host an, den es berührt, und wenn eine Site es nicht erlaubt, sind diese Anfrage und jede Weiterleitung dazu alles, was der Crawl behält. Klassifizieren Sie zurückgegebene URLs, bevor Sie schlussfolgern, dass eine Domain abgedeckt ist, und geben Sie Ihren Match-Typ an, da eine Präfix-Abfrage und eine Domain-Abfrage unterschiedliche Anzahlen zurückgeben können.



Vertrieb kontaktierenGratis testen![google social icon](/wp-content/themes/brightdata/assets/images/ic_google.svg)









 Inhaltsverzeichnis







Dedicated Scraper APIs &amp; No-Code Scrapers

Over 1000 scrapers for all popular domains. Simplify your web scraping.

[See pricing](/pricing/web-scraper "See pricing")

Just want data? Skip scraping.

Hundreds of ready-to-use datasets from all popular domains.

[See pricing](/pricing/datasets "See pricing")







 [ ](https://news.ycombinator.com/submitlink?t=Internet+Archive+vs+Common+Crawl+vs+Web-Archiv&u=https://brightdata.de/blog/web-data-de/internet-archive-vs-common-crawl-vs-web-archive) [ ](https://www.linkedin.com/shareArticle?mini=true&title=Internet+Archive+vs+Common+Crawl+vs+Web-Archiv&url=https://brightdata.de/blog/web-data-de/internet-archive-vs-common-crawl-vs-web-archive) [ ](http://www.reddit.com/submit?title=Internet+Archive+vs+Common+Crawl+vs+Web-Archiv&url=https://brightdata.de/blog/web-data-de/internet-archive-vs-common-crawl-vs-web-archive)







##  Das könnte Sie auch interessieren

 [ ![OpenHuman with Bright Data](https://media.brightdata.de/2026/09/OpenHuman-with-Bright-Data.png) ](https://brightdata.de/blog/ai/openhuman-with-bright-data "Produktionsreifer Web-Zugriff in OpenHuman über die Bright Data CLI")

 [AI



 ![Antonello Zanini](https://media.brightdata.de/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Produktionsreifer Web-Zugriff in OpenHuman über die Bright Data CLI

Integrieren Sie die Bright Data CLI mit OpenHuman, um produktionsreifen Web-Zugriff und Datenerhebung für KI-Agenten zu ermöglichen.



 09-Sep-2026

 12 min lesen

 ](https://brightdata.de/blog/ai/openhuman-with-bright-data)

 [ ![Multimodal Web Scraping with MiniMax](https://media.brightdata.de/2026/09/Multimodal-Web-Scraping-with-MiniMax.png) ](https://brightdata.de/blog/web-data-de/multimodal-web-scraping-with-minimax "Multimodales Web-Scraping mit MiniMax")

 [Web Data



 ![Antonello Zanini](https://media.brightdata.de/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Multimodales Web-Scraping mit MiniMax

Kombinieren Sie Bright Data Web Unlocker mit MiniMax M3 Vision, um strukturierte Daten aus Bildern und Webseiten-Screenshots zu extrahieren.



 09-Sep-2026

 4 min lesen

 ](https://brightdata.de/blog/web-data-de/multimodal-web-scraping-with-minimax)

 [ ![The 10 Best CLI Tools for Codex in 2026](https://media.brightdata.de/2026/08/The-10-Best-CLI-Tools-for-Codex-in-2026.png) ](https://brightdata.de/blog/ai/best-cli-tools-for-codex "Die 10 besten CLI-Tools für Codex im Jahr 2026 – Getestet & Bewertet")

 [AI



 ![Daniel Shashko](https://media.brightdata.de/2022/04/Daniel-Shashko-2-50x50.png)

Daniel Shashko

Web Data &amp; AI Expert





### Die 10 besten CLI-Tools für Codex im Jahr 2026 – Getestet &amp; Bewertet

Die 10 CLI-Tools, die Codex schneller und leistungsfähiger machen, beginnend mit dem Bright Data CLI für echten Web-Zugriff aus der Sandbox heraus.



 06-Sep-2026

 20 min lesen

 ](https://brightdata.de/blog/ai/best-cli-tools-for-codex)
