Internet Archive vs Common Crawl vs Web-Archiv

Was Internet Archive und Common Crawl jeweils speichern, was eine Abfrage kostet und wann die Live-Sammlung von Bright Data die bessere Wahl ist.
23 min lesen
Internet Archive vs Common Crawl vs Web archive

Wir haben den CC-MAIN-2026-30 Common-Crawl-Index nach theguardian.com abgefragt und 185 Einträge erhalten. Kein einziger ist ein Artikel. Jeder Eintrag ist die eigene robots.txt der Website oder eine Weiterleitung dazu, und diese Datei verbietet CCBot. Die Berechtigungsprüfung ist das Einzige, was der Crawl gespeichert hat.

Die Wayback Machine des Internet Archive und Common Crawl speichern beide Kopien von Seiten, die nicht mehr existieren, und beantworten unterschiedliche Fragen. Die Wayback Machine zeigt eine einzelne URL so, wie sie an einem von Ihnen gewählten Datum aussah. Common Crawl liefert Ihnen Milliarden von Seiten als Massentext, ohne Wiedergabe. Ein Web-Archiv ist die Kategorie, der beide angehören, kein drittes Produkt. Zur selben Kategorie gehören nationale Web-Archive, Abonnementdienste wie Archive-It, On-Demand-Erfassungsseiten wie archive.today und WARC-Dateien, die Sie selbst erstellen. Beide Dienste beantworten Fragen über die Vergangenheit; keiner erfasst laufend eine bestimmte Gruppe von Websites.

TL;DR

  • CCBot führt kein JavaScript aus. Eine client-seitig gerenderte Seite kommt als leeres Gerüst an.
  • Fragen Sie Common Crawl zuerst für Massenarbeit ab und die Wayback Machine für fehlende Treffer; kehren Sie die Reihenfolge bei einer bekannten URL-Liste um.
  • Ein CDX-digest ist der Payload-SHA-1, also collapse=digest und collapse=timestamp im Index vergleichen, bevor Sie abrufen. Common Crawl ignoriert collapse.
  • Legen Sie einen Wayback-CDX-Client auf 24 Anfragen pro Minute aus, also 80 % des gemeinsamen Pools von 30/min.
  • Keiner der Dienste veröffentlicht eine Abdeckungsgarantie oder ein SLA, und keiner erfasst laufend eine bestimmte Gruppe von Websites. Messen Sie zuerst Ihre Domains.

Was Internet Archive und Common Crawl jeweils speichern

Eine Wayback-Erfassung ist unter web.archive.org/web/<timestamp>/<url> adressierbar, und dieselbe URL kann über drei Jahrzehnte hinweg Tausende von Erfassungen enthalten. Die Standard-Wiedergabe schreibt Links um und fügt eine Toolbar ein, damit die Seite im Browser gerendert wird.

Jeder monatliche Common-Crawl-Crawl besteht aus einem Satz WARC-Dateien plus abgeleiteten Text- und Metadatendateien, die in einem öffentlichen Bucket veröffentlicht werden. Ein Index zeigt Ihnen, welcher Bytebereich welcher Datei eine bestimmte URL enthält.

Wayback Machine Common Crawl
Speichert Erfassungen einzelner URLs über die Zeit vollständige monatliche Crawls, WARC plus abgeleiteter Text
Beantwortet eine URL über viele Daten viele URLs aus einem Crawl-Datum
Wiedergabe ja, mit umgeschriebenen Links und einer eingefügten Toolbar keine
Volltextsuche keine keine, aber WET-Dateien liefern den Text zum Indexieren
Massenexport keiner, API-Zugriff der gesamte Crawl, kostenlos in einem öffentlichen Bucket
Rate-Limit 30 Anfragen pro Minute, CDX und Timemap gemeinsam, nicht vom Internet Archive veröffentlicht keines veröffentlicht, “stark ratenbegrenzt”
Abdeckungsgarantie keine keine, und nach Domain-Rang gesampelt

CC-MAIN-2026-30 wird mit 2,14 Milliarden Seiten und 364 TiB unkomprimiertem Inhalt über 40,5 Millionen Hosts angekündigt, die über 18 Tage gecrawlt wurden. Common Crawl beziffert das Gesamtkorpus auf über 300 Milliarden Seiten und beschreibt die Rate als 3 bis 5 Milliarden neue Seiten pro Monat, obwohl die letzten 18 veröffentlichten Crawls alle unter 3 Milliarden lagen. Dimensionieren Sie einen Job ausgehend von einem einzelnen Crawl.

Die FAQ von Common Crawl besagt: “Derzeit wird JavaScript nicht ausgeführt und Cookies werden nicht verwendet”. CCBot speichert die rohe HTTP-Antwort, sodass eine client-seitig gerenderte Seite als leeres Gerüst ankommt. Wenn die Seiten, die Sie interessieren, ihren Inhalt im Browser aufbauen, prüfen Sie eine Erfassung, bevor Sie auf Common Crawl setzen.

Jeder Crawl enthält fünf parallele Dateisätze mit je 100.000 Dateien. WARC enthält die vollständige Antwort, WAT enthält extrahierte Metadaten und Links, WET enthält nur Klartext, und zwei weitere enthalten die robots.txt-Erfassungen und die Nicht-200-Antworten. Ein Link-Graph-Job, der WARC liest, bewegt weit mehr Bytes als nötig.

Common Crawl gibt keine Garantie, dass eine Seite erneut besucht wird, sodass viele URLs über viele Daten eine Frage ist, die keiner der Dienste beantwortet.

Zwei-mal-zwei-Matrix. Vertikale Achse von einem Datum bis zu vielen Daten, horizontal von einer URL bis zu vielen URLs. Die Wayback Machine belegt eine URL über viele Daten; Common Crawl viele URLs aus einem Crawl-Datum; eine URL an einem Datum ist für beide trivial. Das verbleibende Quadrant, viele URLs über viele Daten, wird von keinem abgedeckt.

Die FAQ von Common Crawl beschreibt die Sampling-Richtlinie: Der Datensatz “ist eine Stichprobe des Webs, und wir archivieren im Allgemeinen keine vollständige Website, sondern eine zufällig ausgewählte Teilmenge davon”. Der Mechanismus ist in einem Common-Crawl-Engineering-Vortrag dokumentiert und nicht in der FAQ: Harmonische Zentralitätsränge auf Domain-Ebene definieren ein Budget dafür, wie viele URLs jede Domain erhält, sodass gut verlinkte Domains ein größeres Budget erhalten und niedrig eingestufte Domains möglicherweise gar keines.

Die Wayback Machine hat keine Volltextsuche über archivierte Seiteninhalte. Die eigene Hilfeseite besagt, dass das Internet Archive hofft, “irgendwann eine Volltextsuchmaschine zu implementieren”. Die Website-Suche trifft Site-Metadaten, nicht den Text in archivierten Seiten. Common Crawl liefert Ihnen den Text, aber keine Wiedergabe, sodass eine aus einer WET-Datei rekonstruierte Seite nicht wie das Original aussieht.

Was eine Domain-Abfrage zurückgibt

Wir haben dieselbe Abfrage gegen fünf Domains mit Präfix-Matching ausgeführt.

Abgefragte Domain Index-Einträge robots.txt-Einträge Inhaltsseiten
nytimes.com/* 1 1 0
cnn.com/* 1 1 0
bbc.com/* 2 2 0
theguardian.com/* 185 185 0
github.blog/* 4.700 49 4.651

Die 185 Einträge des Guardian lösen sich auf nur zwei URLs auf, die robots.txt und ihre http-Weiterleitung, die durch den Crawl erneut abgerufen wurden. Ein Skript, das Index-Einträge zählt, würde alle fünf als abgedeckt bezeichnen und bei vier falsch liegen. Von den 4.651 Inhaltseinträgen von github.blog antworteten 3.647 mit 200.

Der Match-Typ verändert die Antwort. Die SURT-Kanonisierung faltet www. in den bloßen Host, aber ein domain/*-Präfix-Match erreicht keine andere Subdomain: cnn.com/* lieferte 1 Eintrag, während *.cnn.com 11 lieferte, und nytimes.com/* lieferte 1 gegenüber 2 für *.nytimes.com. Jeder Eintrag war ein robots.txt-Abruf bei beiden Formen, aber die Zahlen sind eine Eigenschaft der Abfrage genauso wie des Crawls. Geben Sie Ihren Match-Typ immer an, wenn Sie eine solche Zahl berichten.

Dieselbe Abfrage datiert die Sperre ungefähr, wenn Sie sie gegen ältere Crawl-IDs ausführen. Die Abfrage hat einen blinden Fleck: Sie sieht, was ein Publisher in robots.txt geschrieben hat, nicht eine am Netzwerk-Edge angewendete Sperre oder einen späteren Opt-out, sodass sie eher als untere Grenze denn als Zählung zu lesen ist. Unser robots.txt-Leitfaden für Web-Scraping erklärt, wie die Agent-Gruppen aufgelöst werden.

Die Größe pro Crawl ist ebenfalls gesunken. Die veröffentlichten Crawl-Größenstatistiken von Common Crawl zeigen, dass die monatliche Seitenanzahl von 3,031 Milliarden in CC-MAIN-2025-05 auf 2,149 Milliarden in CC-MAIN-2026-30 gesunken ist, ein Rückgang von 29,1 %. Über die 29 Crawls von CC-MAIN-2024-10 bis CC-MAIN-2026-30 hinweg durchschnittlich die 10 Crawls von 2024 2,69 Milliarden Seiten, die 12 Crawls von 2025 2,53 Milliarden, und die 7 bis Juli 2026 veröffentlichten Crawls 2,15 Milliarden.

Liniendiagramm der Common-Crawl-Seiten pro Crawl, das von 3,1 auf etwa 2,1 Milliarden sinkt, mit gestrichelten jährlichen Mittelwerten bei 2,69 Mrd. für 2024, 2,53 Mrd. für 2025 und 2,15 Mrd. für die sieben 2026-Crawls bis Juli.

Nichts hier identifiziert eine Ursache: Die Crawl-Größe hängt genauso von Infrastruktur, Budget und Planung innerhalb von Common Crawl ab wie von dem, was Publisher tun. Der Rückgang bedeutet, dass ein Korpus, der aus einem Crawl von 2024 dimensioniert wurde, einen von 2026 um etwa ein Viertel überschätzt, und dass Zahlen pro Crawl nicht addiert werden können. Aufeinanderfolgende Crawls rufen einen Großteil derselben Frontier erneut ab, sodass ihre Summierung ohne Deduplizierung nach urlkey und digest die Schätzung erneut aufbläht.

Prüfen Sie Ihre eigenen Domains

Das Skript zählt Inhaltseinträge gegenüber robots.txt-Abrufen für den neuesten veröffentlichten Crawl, mit demselben domain/*-Präfix-Match wie die Tabelle. Es durchläuft den Index seitenweise, lehnt eine Seite ab, deren Kürzung einen Eintrag teilt, anstatt einen Teil davon zu zählen, und macht weiter, wenn eine Domain nie sauber antwortet. Die beiden unten stehenden Domains benötigen etwa 70 Sekunden, fast alles davon sind die absichtlichen Pausen:

import http.client, json, time, urllib.error, urllib.parse, urllib.request

DOMAINS = ["theguardian.com", "github.blog"]
# Use your own contact address. One shared UA string arriving from many callers
# is the string an operator blocks.
UA = {"User-Agent": "coverage-check/1.0 ([email protected])"}

def latest_crawl():
    """Common Crawl ships roughly monthly. Hardcoding an ID measures a stale crawl
    and returns a number that looks current."""
    url = "https://index.commoncrawl.org/collinfo.json"
    info = urllib.request.urlopen(urllib.request.Request(url, headers=UA), timeout=60).read()
    return json.loads(info)[0]["id"]        # newest first

CRAWL = latest_crawl()
INDEX = f"https://index.commoncrawl.org/{CRAWL}-index"
print(f"crawl: {CRAWL}")

def fetch(params, tries=3):
    url = f"{INDEX}?{urllib.parse.urlencode(params)}"
    for attempt in range(tries):
        wait = None
        try:
            return urllib.request.urlopen(
                urllib.request.Request(url, headers=UA), timeout=120).read()
        except urllib.error.HTTPError as e:
            if e.code == 404:
                return None               # this crawl never captured the domain
            if e.code not in (429, 500, 502, 503, 504):
                raise
            wait = e.headers.get("Retry-After")   # the server's own number beats ours
        except (urllib.error.URLError, http.client.IncompleteRead, TimeoutError):
            pass                          # dropped connection
        time.sleep(int(wait) if wait and wait.isdigit() else 5 * 2 ** attempt)
    return b""

def coverage(domain):
    """(robots, content) for one domain, or None if the index never answered cleanly."""
    query = {"url": f"{domain}/*", "output": "json", "pageSize": 1}
    head = fetch({**query, "showNumPages": "true"})
    if head is None:
        return 0, 0
    if not head:
        return None
    robots = content = 0
    for page in range(json.loads(head)["pages"]):
        body = fetch({**query, "page": page})
        if not body:
            return None
        # CDXJ is one JSON object per line. Use split, not splitlines(): splitlines()
        # breaks on several characters that are not newlines, which cuts records in half.
        for line in body.split(b"\n"):
            if not line.strip():
                continue
            try:
                record = json.loads(line)
            except json.JSONDecodeError:
                return None               # the page arrived incomplete
            if record.get("url", "").rstrip("/").endswith("/robots.txt"):
                robots += 1
            else:
                content += 1
        time.sleep(5)
    return robots, content

for domain in DOMAINS:
    result = coverage(domain)
    if result is None:
        print(f"{domain}: no clean response")
    else:
        robots, content = result
        print(f"{domain}: {robots + content} records, {robots} robots.txt, {content} content")
    time.sleep(20)

Es gibt aus:

crawl: CC-MAIN-2026-30
theguardian.com: 185 records, 185 robots.txt, 0 content
github.blog: 4700 records, 49 robots.txt, 4651 content

Gegen CC-MAIN-2026-30 reproduzieren die beiden Domain-Zeilen die obige Tabelle. Ein neuerer Crawl liefert andere Zahlen; was konstant bleiben sollte, ist die Form: nur robots für theguardian.com und inhaltsbearing für github.blog. Einträge ohne Inhaltsseiten bedeuten, dass der Crawl keinen Seiteninhalt von dieser Domain enthält.

Wie man jede Quelle abfragt und was der Round-Trip kostet

Beide Dienste bieten einen CDX-Index, aber die Antwortformate unterscheiden sich: Der Wayback-CDX-Server gibt ein JSON-Array von Arrays zurück, Common Crawls output=json gibt CDXJ zurück, ein JSON-Objekt pro Zeile.

Der Wayback-CDX-Server gibt eine Zeile pro Erfassung zurück, und serverseitiges Filtern hält die Antwort klein genug, um sie seitenweise zu durchlaufen:

curl "https://web.archive.org/cdx/search/cdx?url=example.com&output=json&from=2026&limit=3&fl=timestamp,original,statuscode"

Das gibt zurück:

[["timestamp","original","statuscode"],
["20260101000936","http://www.example.com/","200"],
["20260101002937","https://example.com/","200"],
["20260101004445","https://example.com/","200"]]

Um eine archivierte Seite zu parsen statt sie zu rendern, fordern Sie die rohe Erfassung an. Das Hinzufügen von id_ nach dem Zeitstempel gibt die ursprünglichen Bytes zurück, ohne Toolbar und ohne umgeschriebene Links:

curl -sL "https://web.archive.org/web/2026id_/https://example.com/" -o raw.html
curl -sL "https://web.archive.org/web/2026/https://example.com/"    -o rewritten.html

Die umgeschriebene Kopie enthält eingefügte Verweise auf web.archive.org, was Selektoren, die auf der DOM-Struktur verankert sind, beschädigen kann.

Neben dem Match-Typ entscheiden zwei Felder in einer CDX-Zeile und ein Abfrageparameter darüber, was eine Abfrage trifft, ob Sie Änderungen erkennen können und was es kostet.

urlkey ist die SURT-Form der URL. https://github.blog/ wird als blog,github)/ indiziert: Host umgekehrt, dann Pfad. Präfix- und Bereichsabfragen operieren auf diesem Schlüssel und nicht auf der von Ihnen eingegebenen URL, weshalb die www.-Behandlung und die Reihenfolge der Abfragezeichenfolgen entscheiden, ob eine Abfrage überhaupt etwas trifft.

digest ist der Payload-SHA-1, base32-kodiert, und es ist der Wert, den der WARC-Eintrag als WARC-Payload-Digest trägt. Ein Hex-Digest stimmt nicht damit überein. Änderungserkennung ist daher eine Index-Operation: Zwei Zeilen mit demselben Digest haben dieselben Payload-Bytes.

collapse macht daraus die Abfrage, die Sie tatsächlich benötigen. Den Wayback-CDX-Server nach jeder example.com-Erfassung im Kalenderjahr 2024 zu befragen, gibt 130.115 Zeilen zurück. Dieselbe Abfrage mit collapse=timestamp:8 gibt 366 zurück, eine pro Tag: Zeitstempel sind YYYYMMDDhhmmss, sodass das Kürzen auf acht Stellen nach Datum zusammenfasst. Mit collapse=digest gibt sie 17.448 zurück, eine pro Änderung zwischen aufeinanderfolgenden Erfassungen. Common Crawls Index akzeptiert den Parameter und ignoriert ihn, wobei er dieselben Zeilen zurückgibt.

Die Paginierung über page und pageSize zählt Index-Blöcke und nicht Ergebniszeilen, und die Blockgröße variiert: Zwei benachbarte Blöcke einer Abfrage lieferten 2.032 und 4.726 Einträge. Den Wayback-CDX-Server nach bbc.com mit matchType=domain und pageSize=1 zu befragen, meldete 28.257 Seiten.

Eine Seite kann leer zurückkommen, einfach weil Ihre Filter in diesen Blöcken nichts gefunden haben, was nicht bedeutet, dass das Ergebnis-Set beendet ist. Die Standard-pageSize ist 1, und die Dokumentation nennt kein Maximum.

Common Crawls Index paginiert auf dieselbe Weise, mit drei Unterschieden: showNumPages gibt JSON statt einer bloßen Zahl zurück, die Standard-pageSize ist 5 statt 1, und seine Blöcke haben eine andere Größe. Dimensionieren Sie eine Schleife aus showNumPages statt aus einer angenommenen Blockgröße, und fragen Sie die Seitenanzahl bei der pageSize ab, die Sie verwenden möchten, da sich die Anzahl damit ändert.

Es gibt zwei Möglichkeiten zur Iteration. Standard ist der Limit-Modus, bei dem limit und ein Resume-Schlüssel das Ergebnis-Set durchlaufen; der Seiten-Modus verwendet stattdessen page und pageSize. Der Seiten-Modus existiert, damit die Seitenanzahl im Voraus bekannt ist und die Arbeit auf Worker verteilt werden kann. Der Limit-Modus macht in der Regel weniger Anfragen insgesamt, kann aber bei einer selten erfassten URL über einen weiten Datumsbereich weit genug scannen, um eine Zeitüberschreitung zu verursachen.

Common Crawl kehrt den Abrufschritt um, und der Vorteil ist, dass das Abrufen einer Seite eine einzelne Range-Anfrage statt eines Datei-Downloads kostet. Der Index gibt Ihnen einen Dateinamen, einen Byte-Offset und eine Länge, sodass eine HTTP-Range-Anfrage einen einzigen Eintrag zurückliefert. Da CDXJ ein Objekt pro Zeile enthält, liest der folgende Code eine Zeile statt den gesamten Body zu parsen:

import gzip, json, urllib.error, urllib.parse, urllib.request

url = "https://example.com/"
crawl = "CC-MAIN-2026-30"
q = urllib.parse.quote(url, safe="")

# Common Crawl asks API clients for a properly formed UserAgent. Use your own.
ua = {"User-Agent": "coverage-check/1.0 ([email protected])"}

# Step 1: ask the index which WARC file and byte range holds this page.
index = f"https://index.commoncrawl.org/{crawl}-index?url={q}&output=json&limit=1"
try:
    req = urllib.request.Request(index, headers=ua)
    rec = json.loads(urllib.request.urlopen(req, timeout=60).read().split(b"\n")[0])
except urllib.error.HTTPError as e:
    if e.code != 404:
        # 502, 503 and 504 all mean try again later, not "not captured".
        # Treating them as a miss under-reports coverage.
        raise
    # A URL this crawl never captured returns 404. That is the normal case for a
    # blocked domain, not an error in your code.
    raise SystemExit(f"{url} is not in {crawl}")

# Step 2: fetch only those bytes.
offset, length = int(rec["offset"]), int(rec["length"])
warc = "https://data.commoncrawl.org/" + rec["filename"]
req = urllib.request.Request(warc, headers={**ua, "Range": f"bytes={offset}-{offset + length - 1}"})
record = gzip.decompress(urllib.request.urlopen(req, timeout=60).read())

print(record.decode("utf-8", "replace")[:400])

Das gibt einen komprimierten WARC-Eintrag zurück, der die Antwort-Header und das Seiten-HTML enthält. Über 29 von uns gesampelte Inhaltseinträge hinweg betrug die komprimierte Größe 7 bis 45 KiB, sodass die Range-Anfrage Kilobytes aus einer Datei von etwa 900 MiB bewegt. Derselbe Weg funktioniert gegen jeden Crawl, den der Index-Server auflistet.

Für Arbeit auf Korpus-Ebene liefert Common Crawls URL-Index denselben Index als Parquet mit zusätzlichen Spalten, veröffentlicht unter s3://commoncrawl/cc-index/table/cc-main/warc/ und lokal mit DuckDB oder Athena in AWS abfragbar. Common Crawl beziffert den spaltenförmigen Index auf etwa 300 GB pro monatlichem Crawl und einen vollständigen Athena-Scan auf etwa 1,50 $ Stand September 2025, sodass die meisten gefilterten Abfragen weniger kosten. Der Datenzugriff selbst ist durch das AWS Open Data Program kostenlos, und data.commoncrawl.org benötigt kein AWS-Konto, obwohl Egress von Ihrem eigenen Cloud-Anbieter weiterhin Ihre Sache ist.

Rate-Limits und Kontingente, auf die Sie stoßen werden

Common Crawls FAQ besagt, dass der CDX-Endpunkt “häufig missbraucht und daher stark ratenbegrenzt” ist. Ein HTTP 503 bedeutet, langsamer zu werden, und eine vorübergehend gesperrte IP sollte 24 Stunden warten. Die Anleitung bittet Sie auch, zwischen Aufrufen zu pausieren, mehrere Threads von einer IP zu vermeiden, Proxy-Netzwerke zu vermeiden und einen korrekt gebildeten User-Agent zu senden, den die FAQ an RFC 9110 knüpft. Die Proxy-Klausel ist die, bei der es sich lohnt, innezuhalten. Die Sperre und die Threading-Anleitung der FAQ beziehen sich beide auf die IP, sodass die Verteilung eines Jobs auf mehrere Adressen das Limit umgeht statt es zu respektieren, und die Eskalation ist eine Sperre der Adresse statt mehr 503er.

Das Internet Archive veröffentlicht Kontingente für Save Page Now und praktisch nichts für die Lese-APIs. Die Save Page Now 2-Spezifikation gibt diese Limits an:

Limit Authentifiziert Anonym
Erfassungen pro Minute 7 3
Erfassungen pro Tag 30.000 200
Archivierte Bytes pro Tag 5 GB 2 GB
Erfassungen derselben URL pro Tag 5 5

Die Spezifikation nennt keine bezahlte Stufe über diesen Zahlen und verweist intensivere Nutzer an das Internet Archive per E-Mail. Die Spezifikation gibt die anonyme Zahl sowohl als 2 GB als auch als 500 MB an, und ihr Changelog senkte die authentifizierte Zahl auf 4 GiB, während die Tabelle noch 5 GB anzeigt.

Für die Lese-APIs kommen die Zahlen von außerhalb des Internet Archive. Der Maintainer des wayback-Python-Clients dokumentierte ein Gespräch mit Internet-Archive-Mitarbeitern und kodierte das Ergebnis als Standardwerte der Bibliothek. Die Dokumentation ist keine Veröffentlichung des Internet Archive.

Die Endpunkte /cdx/search/cdx und /web/timemap/ sind jetzt ein Dienst auf denselben Servern, der sich nur darin unterscheidet, wie sie den output-Parameter lesen, und sie teilen sich einen einzigen Rate-Limit-Pool. Dieser Pool beträgt 30 Anfragen pro Minute für beide. Die Dokumentation sagt nicht, ob der Zähler an eine Adresse oder ein Konto gebunden ist, sodass ein auf Worker verteilter Job nicht annehmen kann, dass sich das Budget multipliziert. Der Memento-Endpunkt bedient die Wiedergabe und schöpft aus einem separaten Pool.

Die Bibliothek kodiert diese Limits als ihre Standardwerte, 0,8 * 30 / 60 für CDX und 0,8 * 600 / 60 für die Wiedergabe, nachdem Internet-Archive-Mitarbeiter gebeten hatten, dass Clients bei 80 % der harten Limits bleiben. Das sind 24 Anfragen pro Minute statt 30 und 480 für die Wiedergabe. Planen Sie gegen diese Werte, nicht gegen die Obergrenzen.

Der Verfügbarkeits-Endpunkt unter archive.org/wayback/available ist ein dritter Dienst ohne eigenes veröffentlichtes Limit, also behandeln Sie ihn als begrenzt und nicht als frei. Beachten Sie Retry-After, wenn die Antwort eines enthält. Wenn keines enthalten ist, pausiert der wayback-Client 60 Sekunden, bevor er es erneut versucht.

Warum archive.today-Erfassungen nicht eigenständig verifiziert werden können

archive.today rendert Seiten zum Erfassungszeitpunkt in einem Browser und ignoriert robots.txt, sodass es Seiten enthält, die die Wayback Machine nicht hat. Zitier-Workflows haben archive.today wegen dieser Abdeckung übernommen.

archive.today speichert veränderbares HTML statt WARC, sodass es keinen Payload-Digest gibt und nichts in der Erfassung, gegen das man prüfen könnte. Es wurden Beweise vorgelegt, dass die Betreiber archivierte Seiten verändert haben, und Wikipedia hat die Website veraltet erklärt und auf die Spam-Blacklist gesetzt. Die abschließende Erklärung beginnt mit einem anderen Grund: Sie besagt, dass die Website Code eingebettet hat, der die Browser der Besucher in einen Denial-of-Service-Angriff gegen einen Blog verwandelt hat, und behandelt die veränderten Snapshots als zusätzliches Argument.

Verifizieren Sie alles, was Sie bereits aus archive.today zitieren, anhand einer zweiten Quelle. Dieselbe Seite vermerkt, dass der Code im Juni 2026 noch mit reduzierter Aufrufrate vorhanden war, und empfiehlt jedem, der die Seite benötigt, sie hinter einem Content-Blocker zu laden.

Nationale Archive, Formate und Wiedergabe-Tools

Arquivo.pt: Das portugiesische nationale Web-Archiv betreibt eine Volltext-Such-API, die die Wayback Machine nicht hat. Ein GET an arquivo.pt/textsearch gibt JSON zurück, das pro Ergebnis einen linkToExtractedText enthält, sodass Sie HTML-Parsing vollständig überspringen. Die API ist kostenlos und benötigt keinen Schlüssel, und das dokumentierte Limit ist 250 Anfragen pro 60 Sekunden von einer IP, gemeinsam genutzt für Volltext- und URL-Suche statt separat budgetiert. Das Überschreiten dieses Limits ist als Grund für eine dauerhafte Sperre dokumentiert, während Common Crawls Sperre temporär ist. Die Abdeckung ist auf Portugal ausgerichtet, und die Latenz ist ungleichmäßig, von unter 3 Sekunden bis 18 über drei Einzelergebnis-Abfragen, also setzen Sie das Client-Timeout auf 30 Sekunden.

WARC und WACZ: WARC ist der Archivierungs-Container, standardisiert als ISO 28500:2017, das WARC 1.1 abdeckt. Es gibt kein WARC 1.2. WACZ verpackt WARC-Einträge mit einem CDX-Index, sodass ein Browser sie ohne Server wiedergeben kann. Ein 1.2.0-Entwurf ist verfügbar, aber wacz/latest liefert noch 1.1.1, also implementieren Sie gegen 1.1.1.

Browsertrix: Wenn Sie Erfassungen benötigen, die Sie kontrollieren, produziert Webrecorders Crawler WACZ-Dateien, die in einem Browser über ReplayWeb.page ohne Server wiedergegeben werden. Gehostete Pläne beginnen bei 30 $ pro Monat für den Einstiegsplan, und der Crawler ist Open Source, wenn Sie ihn lieber selbst betreiben möchten.

Wie man wählt

Beginnen Sie mit der Form der Frage: spezifische URLs, Text in großen Mengen oder eine Eigenschaft, die keiner der Dienste bietet.

Verwenden Sie die Wayback Machine, wenn URL und Datum der Kern sind. Wiederherstellung einer gelöschten Seite, Nachweis, was eine Website vor einer Bearbeitung sagte, Verfolgung einer einzelnen Produktseite über die Zeit oder Wiederherstellung eines toten Dokumentationssatzes. Keine andere Allzweck-Option erreicht ihre zeitliche Tiefe bei einzelnen URLs, obwohl ein nationales Archiv sie im eigenen Bereich erreichen kann.

Wenn der Verwendungszweck beweisrechtlich ist, planen Sie mehr als die Erfassung ein. US-Gerichte haben Wayback-Erfassungen zugelassen, aber ein Ausdruck allein reicht selten aus, da Erfassungen nicht selbst-authentifizierend sind. Eine Internet-Archive-Erklärung ist der Weg, den Gerichte akzeptiert haben, und zu Anfang 2025 veröffentlichten Preisen kostet sie 250 $ pro Anfrage plus 20 $ für jede URL, oder 30 $ für URLs, die eine herunterladbare Datei wie ein PDF enthalten.

Verwenden Sie Common Crawl, wenn Sie viele Seiten möchten und es egal ist, welche. Sprachkorpora, Modell-Pretraining, Link-Graph-Analyse, Sicherheitsforschung über viele Hosts und jede Messung, bei der eine nach Rang verzerrte Stichprobe akzeptabel ist. Die meisten großen offenen Pretraining-Korpora schöpfen daraus, darunter C4, RefinedWeb, FineWeb und Dolma. Wenn Sie ein Korpus statt des rohen Crawls möchten, sind diese Ableitungen und ihre Lizenzen zuerst lesenswert, und unsere Übersicht der LLM-Trainingsdatenquellen ist ein Ausgangspunkt. Verwenden Sie es nicht, um die Abdeckung einer bestimmten Website zu garantieren, da die Sampling-Richtlinie die Abdeckung unvorhersehbar macht.

Eine Studie von Sichang Steven He und Kollegen klassifizierte etwa 100.000 Websites in Common Crawl und fand, dass 6,0 % davon von Text dominiert wurden, der mit wenig menschlichem Input generiert wurde. Unter Websites, die erstmals in der ersten Hälfte von 2025 gesehen wurden, betrug der Anteil 29,4 %, gegenüber 2,1 % unter Websites, die erstmals Ende 2022 gesehen wurden.

Lesen Sie die 6,0 % und die 29,4 % als wahrscheinliche Unterschätzungen. Die Autoren berichten eine starke negative Korrelation zwischen der Genauigkeit ihres Klassifikators und dem Benchmark-Score des Modells, das eine Website generiert hat, sodass der Anteil, den der Klassifikator verpasst, wächst, wenn Generatoren besser werden.

Verwenden Sie ein nationales oder selbst betriebenes Archiv, wenn Sie eine Eigenschaft benötigen, die keiner der Dienste bietet. Volltextsuche über archivierte Inhalte, Erfassungen, die Sie von Ende zu Ende kontrollieren, oder client-seitig gerenderte Seiten, die anderswo schlecht wiedergegeben werden.

archive.today ist aus einem anderen Grund ausgeschlossen: Eine Erfassung, die sich nachträglich ändern kann, kann nicht eigenständig als Beweis stehen.

Für Massenarbeit über viele Hosts fragen Sie Common Crawl zuerst für Breite und Kosten ab und fallen dann auf die Wayback Machine für das zurück, was der Crawl verpasst hat. Für eine bekannte URL-Liste gehen Sie den anderen Weg: Die meisten Common-Crawl-Abfragen werden fehlschlagen, und jede Abfrage verbraucht eine Anfrage gegen einen Index, dessen dokumentierte Strafe für Übernutzung eine 24-Stunden-Sperre ist. Und wenn eine Domain für Ihre Arbeit langfristig wichtig ist, führen Sie parallel eigene Erfassungen mit einem WARC-produzierenden Crawler durch, denn das ist eine Kopie, deren Verfügbarkeit Sie kontrollieren.

Das Betreiben eines eigenen Crawlers kostet Speicherplatz, Wiedergabe-Infrastruktur und einen Wartungsaufwand, den keiner der öffentlichen Dienste Ihnen berechnet, also betreiben Sie ihn selbst, wo der Verlust des Zugriffs etwas kaputtmachen würde, und verlassen Sie sich auf die öffentlichen Archive oder gekaufte Sammlungen für den Rest.

Wenn Sie Sammlung statt eines Archivs benötigen

Keiner der Dienste ist dafür gebaut, eine definierte Gruppe von Websites nach einem Zeitplan zu sammeln. Save Page Now sammelt auf Anfrage und läuft bei 7 Erfassungen pro Minute bei Authentifizierung und 3 ohne.

Alle vier von uns abgefragten Nachrichtendomains hatten keine Inhaltsseiten in CC-MAIN-2026-30. Keiner veröffentlicht eine Abdeckungsgarantie, ein SLA oder eine Support-Verpflichtung, gegen die Sie eskalieren könnten.

Wenn Sie benannte Websites nach einem Zeitplan gesammelt haben möchten, mit einer von Ihnen definierten Abdeckung, ist das ein Sammlungsprodukt und kein Archiv. Crawling entdeckt, was da draußen ist; gezielte Sammlung gibt bekannte Seiten auf Anfrage zurück. Unser Leitfaden zu Crawling vs. Web-Scraping arbeitet den Unterschied heraus.

Das Bezahlen für eine Sammlung kauft keine Befreiung von Blockierungen. Publisher beschränken kommerzielle Crawler genauso wie Archiv-Crawler; ein Anbieter ändert, wer die Wartung trägt, wenn eine Website ihre Abwehr ändert.

Bright Data verkauft gezielte Sammlung: die Web Scraper API für 1 $ pro 1.000 Einträge, mit den ersten 5.000 jeden Monat kostenlos, und vorgefertigte Datensätze ab 0,0025 $ pro Eintrag bei einem Minimum von 250 $. Beide decken unterstützte Websites laufend ab. Keines ersetzt die Wayback Machine, und der Grund ist ein Datumsbereich: vorgesammelte Daten reichen Tage bis Monate zurück, nicht bis 1996, sodass eine Frage darüber, was eine Seite im Jahr 2014 sagte, immer noch ans Archiv geht.

Nächste Schritte

Führen Sie das Abdeckungsskript für die Domains aus, die Ihnen wichtig sind, und prüfen Sie dann dieselben Domains im Wayback-CDX-Server auf Erfassungsdichte.

Inhaltseinträge zeigen Ihnen, ob Massenarbeit möglich ist; Erfassungsdichte zeigt, ob URL-level-Historie möglich ist. Eine gesunde Anzahl ist eine Messung und kein Versprechen: Die Sampling-Richtlinie garantiert keinen Boden, und die Zahlen pro Crawl sind seit 2024 um etwa ein Viertel gesunken, also führen Sie die Prüfung erneut durch, bevor Sie sich darauf verlassen.

Erfassen Sie jetzt, was wichtig ist, wo der Verlust des Zugriffs etwas kaputtmachen würde, kaufen Sie Sammlung für den Rest, bewahren Sie das Erfasste in WARC auf, damit es portabel bleibt, und behandeln Sie beide öffentlichen Archive als Quellen, die Sie abfragen, nicht als Speicher, auf den Sie sich verlassen.

Häufig gestellte Fragen

Kann ich Common Crawl kommerziell nutzen?

Die Nutzungsbedingungen erlauben es und legen das Risiko bei Ihnen. Common Crawl begrenzt seine Gesamthaftung auf 100 $ und verlangt, dass Sie es für Ansprüche aus der Nutzung gecrawlter Inhalte zur Entwicklung, zum Training oder zum Einsatz von KI-Systemen freistellen. Common Crawl empfiehlt rechtliche Beratung vor jeder kommerziellen Nutzung.

Kann man alle Wayback-Machine-Daten herunterladen?

Nicht in großen Mengen. Das Internet Archive veröffentlicht keinen Massenexport des allgemeinen Web-Archivs, und der Zugriff erfolgt über ratenbegrenzte APIs. Für Analysen im Forschungsmaßstab bietet das Internet Archive ARCH, seine Rechenplattform, die nur auf Anfrage erhältlich ist und keine veröffentlichten Preise hat.

Gegen welche Rate sollte ich einen Wayback-CDX-Client auslegen?

Legen Sie gegen 24 Anfragen pro Minute aus. Das Limit ist 30 pro Minute, das das Internet Archive nicht veröffentlicht, gemeinsam genutzt für CDX- und Timemap-Endpunkte seit sie ein Dienst wurden, und der wayback-Client liefert 80 % davon als seinen Standard. Die Wiedergabe ist ein separater Pool mit 600 pro Minute, also legen Sie dort gegen 480 aus.

Warum gibt eine Common-Crawl-Domain-Abfrage Einträge, aber keinen Inhalt zurück?

Weil diese Einträge robots.txt-Abrufe sind. CCBot fordert robots.txt von jedem Host an, den er berührt, und wenn eine Website ihn nicht erlaubt, sind diese Anfrage und jede Weiterleitung dazu alles, was der Crawl behält. Klassifizieren Sie zurückgegebene URLs, bevor Sie schlussfolgern, dass eine Domain abgedeckt ist, und geben Sie Ihren Match-Typ an, da eine Präfix-Abfrage und eine Domain-Abfrage unterschiedliche Zahlen zurückgeben können.