---
title: "Integration von Bright Data in AWS Glue ETL-Jobs: Eine Schritt-für-Schritt-Anleitung"
slug: aws-glue-etl-with-bright-data
date: 2026-03-10T13:38:46+00:00
modified: 2026-03-10T13:38:52+00:00
permalink: https://brightdata.de/blog/web-data-de/aws-glue-etl-with-bright-data
type: blog
---

[ Blog ](https://brightdata.de/blog "Blog") / [Web Data](https://brightdata.de/blog/web-data-de)







 [Web Data](https://brightdata.de/blog/web-data-de)

# Integration von Bright Data in AWS Glue ETL-Jobs: Eine Schritt-für-Schritt-Anleitung

Erfahren Sie, wie Sie eine AWS Glue ETL-Pipeline auf Basis der Web-Scraping-APIs von Bright Data erstellen, von der Extraktion von Aktienkursdaten bis hin zu gefilterten Ergebnissen, die in S3 gespeichert werden.

 8 min lesen





 [ ![Antonello Zanini](https://media.brightdata.de/2022/12/Antonello-Zanini-2-50x50.jpg) ](https://brightdata.com/blog/authors/antonello-zanini)

 [Antonello Zanini

Technical Writer

 ](https://brightdata.com/blog/authors/antonello-zanini)





 ![AWS Glue ETL jobs with Bright Data integration](https://media.brightdata.de/2026/03/AWS-Glue-ETL-jobs-with-Bright-Data-integration.png)





In diesem Tutorial lernen Sie:

- Was AWS Glue ist und was es bietet.
- Warum Bright Data dank seiner Webdatenabrufdienste ETL-Pipelines unterstützt.
- Wie Sie Bright Data in einen ETL-Job in AWS Glue integrieren können.

Lassen Sie uns loslegen!

## Was ist AWS Glue?

[AWS Glue](https://aws.amazon.com/glue/) ist ein serverloser Datenintegrationsdienst, der entwickelt wurde, um das Auffinden, Vorbereiten und Kombinieren von Daten aus mehreren Quellen in beliebiger Größe zu vereinfachen.

Damit können Sie [ETL-Workflows (Extract, Transform, Load)](https://aws.amazon.com/what-is/etl/) für Analysen, maschinelles Lernen und Anwendungsentwicklung erstellen, ohne die Infrastruktur verwalten zu müssen. AWS Glue beschleunigt die Entwicklung von Datenpipelines und macht Daten für Analysen leicht zugänglich. Dies wird durch die Zentralisierung Ihres Datenkatalogs und die Bereitstellung visueller und code-basierter Tools zur Job-Erstellung erreicht.

Die drei wichtigsten Funktionen sind:

- **Daten finden und organisieren**: Schemata automatisch ableiten, Metadaten katalogisieren und Verbindungen zu Datenquellen in AWS, vor Ort und in anderen Clouds herstellen.
- **Daten transformieren und bereinigen**: Visueller Job-Editor, interaktive Notizbücher, Streaming-ETL-Unterstützung und integrierte ML-basierte Deduplizierung.
- **Erstellen und überwachen Sie Pipelines**: Planen, automatisieren und skalieren Sie Jobs und überwachen Sie Pipelines mit detaillierten Einblicken und Triggern.

[Weitere Informationen finden Sie in der offiziellen Dokumentation](https://docs.aws.amazon.com/glue/latest/dg/what-is-glue.html).

## Warum Sie Bright Data in Ihren AWS Glue ETL-Workflow integrieren sollten

Die Integration von [Bright Data](/) in einen AWS ETL-Workflow kann den Umfang und die Qualität Ihrer Datenpipelines erheblich erweitern.

Während [sich ETL traditionell auf die Extraktion strukturierter Daten](/blog/proxy-101/etl-pipeline) aus bekannten Quellen [konzentriert](/blog/proxy-101/etl-pipeline), ermöglicht Bright Data den Zugriff auf strukturierte Webdaten in Echtzeit. Dadurch werden Erkenntnisse gewonnen, die sonst nur durch manuelle Erfassung oder komplexe Scraping-Infrastrukturen möglich wären.

Über *die Extraktion (E)* umfangreicher Webdaten hinaus kann Bright Data auch Ihre *Transformationsphase (T)* verbessern. Während der Transformation können Sie Datensätze anreichern, indem Sie Ihren Datensätzen Live-Markt-, Produkt- oder Sozialinformationen hinzufügen. Sie könnten beispielsweise Aktienkurskennzahlen, Preise von Wettbewerbern oder Unternehmensmetadaten zu Ihren internen Datensätzen hinzufügen.

Diese Erkenntnisse helfen Teams, fundiertere Entscheidungen zu treffen. [Die Datenüberprüfung](/glossary/data-verification) ist ein weiterer wichtiger Vorteil, da die gescraped Daten mit maßgeblichen Quellen abgeglichen werden können. So können Sie die Genauigkeit sicherstellen, bevor Sie die Daten in Ihren Zieldatenspeicher laden.

## So verwenden Sie Bright Data zum Abrufen von Webdaten für einen AWS Glue ETL-Job

In diesem Abschnitt wird eine mögliche Integration von Bright Data in einen AWS Glue ETL-Job vorgestellt. Konkret erfahren Sie, wie Sie diese Beispiel-ETL-Pipeline erstellen:

![The ETL pipeline](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773072944146_image.png)Bright Data kommt dank seiner leistungsstarken Optionen zum Abrufen von Webdaten in der *Extraktionsphase (E)* zum Einsatz. Der [Yahoo Finance Scraper](/products/web-scraper/yahoo-finance) wird verwendet, um Aktienkurse abzurufen, die dann nach dem Kurs-Gewinn-Verhältnis gefiltert und schließlich in einem S3-Bucket gespeichert werden. Dies ist ein einfaches Beispiel, aber dennoch eine realistische Demonstration eines vollständigen ETL-Workflows.

**Hinweis**: Nach diesem Tutorial können Sie weitere Ansätze zur Integration von Bright Data in AWS Glue erkunden und in Betracht ziehen.

Befolgen Sie die nachstehenden Anweisungen, um loszulegen!

### Voraussetzungen

Bevor Sie dieses Tutorial befolgen, stellen Sie sicher, dass Sie über Folgendes verfügen:

- Ein [AWS-Konto](https://aws.amazon.com/account/) (auch ein kostenloses Testkonto ist ausreichend).
- Ein [Bright Data-Konto](/) mit einem konfigurierten API-Schlüssel. Befolgen Sie die offiziellen Anweisungen, um [Ihren API-Schlüssel zu generieren](https://docs.brightdata.com/api-reference/authentication#how-do-i-generate-a-new-api-key).
- Einen in Ihrem AWS-Konto definierten [S3-Bucket](https://aws.amazon.com/s3/).
- Grundlegende Python-Kenntnisse, um ein Skript zu schreiben, das sich in die Scraping-APIs von Bright Data integriert und die gescrapten Daten in Ihren S3-Bucket hochlädt.
- Grundlegende SQL-Kenntnisse zum Schreiben einer einfachen Abfrage in der *Transformationsphase (T)* der ETL-Pipeline.

Für dieses Tutorial gehen wir davon aus, dass Ihr S3-Bucket den Namen `„bright-data-etl-bucket”` trägt:
![](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773065772037_image.png)
Es ist außerdem hilfreich, wenn Sie mit [der Funktionsweise der Bright Data Web-Scraping-APIs](https://docs.brightdata.com/datasets/scrapers/scrapers-library/overview) vertraut sind.

### Schritt 1: Erste Schritte mit den Bright Data Scraping-APIs

Bei der Entwicklung einer ETL-Pipeline sollten Sie natürlich mit der *Extraktionsphase (E)* beginnen. Der erste Schritt besteht darin, Daten mit dem Bright Data Yahoo Finance Scraper abzurufen. Daher ist es wichtig, sich damit vertraut zu machen.

[Erstellen Sie](/?hs_signup=1) zunächst [ein Bright Data-Konto](/?hs_signup=1), falls Sie noch keines haben. Andernfalls [melden Sie sich](/cp/start) bei Ihrem bestehenden Konto [an](/cp/start). Navigieren Sie im Kontrollfeld zum Abschnitt[„Scrapers](/cp/scrapers)“:
![The “Web Scrapers” page](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773067168688_image.png)

Wechseln Sie anschließend zur Registerkarte „Web Scrapers Library”. Suchen Sie nach „finance” und wählen Sie die Option „Yahoo Finance Scraper”. Greifen Sie auf den verfügbaren Scraper zu:
![Selecting the “finance.yahoo.com” scraper](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773067230302_image.png)

Auf der Seite [„Yahoo Finance Scraper“](/cp/scrapers/gd_lmrpz3vxmz972ghd7/pdp/configuration) können Sie die Eingabeanforderungen und das Ausgabeschema dieses Scrapers erkunden:
![The Yahoo Finance Scraper page](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773067431562_image.png)
Das Control Panel bietet auch Code-Schnipsel in mehreren Programmiersprachen für eine schnelle Einrichtung. Der wichtigste Punkt ist, dass der Scraper eine oder mehrere Yahoo Finance-Aktienseiten als Eingabe akzeptiert und strukturierte Echtzeit-Aktien-Daten zurückgibt. Perfekt!

### Schritt 2: Konfigurieren Sie die S3-Übertragung

Die Web-Scraping-APIs von Bright Data unterstützen [die](https://docs.brightdata.com/datasets/scrapers/scrapers-library/delivery-options) automatische [Lieferung der gescrapten Daten an Amazon S3](https://docs.brightdata.com/datasets/scrapers/scrapers-library/delivery-options). Es ist daher sinnvoll, diese nützliche Funktion zu nutzen, um den Schritt der Datenerfassung zu beschleunigen. Um die Amazon S3-Lieferung zu konfigurieren, müssen Sie zunächst den asynchronen Modus aktivieren.

Wählen Sie auf der Registerkarte „Konfiguration“ die Option „Asynchron“. Klicken Sie dann auf die Schaltfläche „Lieferungseinstellungen“:
![Pressing the “Delivery settings” button](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773067765350_image.png)

Konfigurieren Sie die Datenübermittlung an Ihren Amazon S3-Bucket, indem Sie das Formular wie folgt ausfüllen:

- Aktivieren Sie die Option „Übertragung aktivieren“.
- Legen Sie das Format auf `JSON` fest.
- Wählen Sie „Amazon S3“ als Speicherziel.
- Geben Sie den Namen Ihres S3-Buckets ein (in diesem Beispiel `„bright-data-etl-bucket“`). (Das Feld „Endpunkt-URL“ kann leer bleiben.)
- Lassen Sie das Feld „Zielpfad“ leer, um die Datei in den Stammordner des Buckets hochzuladen.
- Setzen Sie die Option „Authentifizierungstyp“ auf den Wert „Zugriffsschlüssel“.
- Fügen Sie Ihre [AWS-Zugriffsschlüssel-ID und Ihren geheimen AWS-Zugriffsschlüssel](https://docs.aws.amazon.com/IAM/latest/UserGuide/id_credentials_access-keys.html) ein.
- Legen Sie den Dateinamen auf `„stocks“` fest.

![Configuring the data delivery to your Amazon S3 bucket](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773069452926_image.png)
Mit dieser Konfiguration wird die Web-Scraping-API im asynchronen Modus ausgeführt. Das bedeutet, dass Bright Data eine Scraping-Aufgabe erstellt, die auf seiner Infrastruktur ausgeführt wird. Sobald die Aufgabe abgeschlossen ist, werden die gescrapten Daten automatisch in Ihren Amazon S3-Bucket hochgeladen, wo sie von Ihrem AWS Glue ETL-Job abgerufen werden können. Fantastisch!

### Schritt 3: Führen Sie die Webdaten-Extraktionslogik aus

Um zu überprüfen, ob die Webdaten-Extraktionslogik funktioniert, fügen Sie einige Yahoo Finance-Aktien-URLs hinzu (z. B. NVDA, AAPL, GOOGL, MSFT, AMZN, TSLA, META, AVGO, BRK.B, LLY) und klicken Sie auf die Schaltfläche „Manuell ausführen“:
![Pressing the “Run manually” button](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773069864132_image.png)

Die Scraping-API-Anfrage wird gesendet und die Scraping-Aufgabe wird in der Cloud gestartet. Sie können den Status der Aufgabe in Echtzeit über das Bright Data-Kontrollpanel überwachen:
![Monitoring the web data extraction task](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773069917372_image.png)

Alternativ können Sie das gleiche Ergebnis programmgesteuert erzielen, indem Sie einen der in der Bright Data-Konsole verfügbaren Code-Schnipsel (siehe rechte Spalte) in Ihrer bevorzugten Programmiersprache ausführen:
![The code snippet for programmatic web scraping API execution](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773068448330_image.png)

Wenn sich der Status der Aufgabe zu „Bereit“ ändert, überprüfen Sie Ihren AWS S3-Bucket. Sie sollten eine neue Datei mit dem Namen `stocks.json` finden:
![Note the “stocks.json” file](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773070059697_image.png)

Wenn Sie die Datei `stocks.json` in Ihrem Browser öffnen, sehen Sie etwa Folgendes:
![The structured stock data in the “stocks.json” file](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773069684392_image.png)
Dies sind dieselben Aktiendaten, die auch auf Yahoo Finance verfügbar sind, jedoch im JSON-Format strukturiert. Diese Daten wurden von der Bright Data Web-Scraping-API gesammelt. Mission erfüllt! Sie verfügen nun über die erforderlichen Daten, um Ihre AWS Glue ETL-Pipeline zu erstellen.

### Schritt 4: Initialisieren Sie Ihren AWS Glue-Job

[Melden Sie sich bei der AWS-Konsole an](https://aws.amazon.com/console/) und suchen Sie nach dem Begriff „AWS Glue“. Wählen Sie den Dienst aus, um dessen Hauptseite zu öffnen.
![Selecting the “Go to ETL jobs” option on the AWS Glue homepage](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773061913346_image.png)

Klicken Sie dort auf die Schaltfläche „Go to ETL jobs“, um [AWS Glue Studio](https://docs.aws.amazon.com/glue/latest/dg/edit-nodes-chapter.html) zu öffnen, die offizielle Schnittstelle zum Erstellen von ETL-Workflows:
![Creating a new visual ETL job](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773061977394_image.png)
Hier können Sie einen neuen AWS Glue-Job initialisieren. Wählen Sie für dieses Tutorial die Option „Visual ETL”. Diese Option wird für die Erstellung von Pipelines über eine vereinfachte Drag-and-Drop-Oberfläche empfohlen.

Sie gelangen dann zu einer leeren Arbeitsfläche, auf der Sie Ihren AWS Glue ETL-Workflow visuell definieren können, indem Sie verschiedene Knoten miteinander verbinden:
![The new AWS Glue ETL job](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773061695144_image.png)
Geben Sie Ihrem ETL-Job einen aussagekräftigen Namen, z. B. „Bright Data Glue ETL Job“. Sobald dies erledigt ist, können Sie mit dem Aufbau Ihrer ETL-Pipeline beginnen.

### Schritt 5: Erstellen Sie eine IAM-Rolle

Um einen AWS Glue-Job auszuführen, [müssen](https://docs.aws.amazon.com/glue/latest/dg/create-an-iam-role.html) Sie [eine IAM-Rolle](https://docs.aws.amazon.com/glue/latest/dg/create-an-iam-role.html) für den Zugriff auf Ressourcen wie Amazon S3 und die Verwaltung von AWS Glue [bereitstellen](https://docs.aws.amazon.com/glue/latest/dg/create-an-iam-role.html). Diese Berechtigungen sind für Glue-Komponenten wie Jobs, Crawler und Entwicklungsendpunkte erforderlich.

Um die Rolle direkt in Glue Studio zu erstellen, gehen Sie zum Bereich „Jobdetails“ und klicken Sie auf die Schaltfläche „Neue Rolle erstellen“:
![Pressing the “Create new role” button](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773063264238_image.png)

Geben Sie im Abschnitt „Rolle erstellen“ Ihrer IAM-Rolle einen aussagekräftigen Namen, z. B. ` „bd-glue-role`“:
![Creating a "bd-glue-role” IAM](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773063379280_image.png)
Standardmäßig fügt AWS die beiden erforderlichen Richtlinien hinzu:

- `AWSGlueConsoleFullAccess`: Bietet vollständigen Zugriff auf AWS Glue über die AWS Management Console.
- `AWSGlueServiceRole`: Richtlinie für die AWS Glue-Dienstrolle, die den Zugriff auf verwandte Dienste wie EC2, S3 und Cloudwatch Logs ermöglicht.

![Note the two required policies added by AWS by default](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773062652585_image.png)Rufen Sie als Nächstes die ARN Ihres S3-Buckets ab. Sie finden sie auf der Seite „Eigenschaften“ Ihres Buckets in der S3-Konsole:
![Your bucket’s S3](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773063507030_image.png)

Diese Informationen benötigen Sie, um die von AWS Glue bereitgestellte Standardrichtlinie zu überschreiben. Fügen Sie die S3-Bucket-ARN in das Feld „Ressource“ im Texteditor „Zusätzliche Richtlinie“ auf der Seite „Rolle erstellen“ ein:

```none
„Resource”: {
    „<YOUR_S3_BUCKET_ARN>/*”
}
```

![Adding your S3 bucket's ARN to the policy](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773063623305_image.png)Klicken Sie abschließend auf die Schaltfläche „Rolle erstellen“. Sobald die Rolle erstellt wurde, wird sie automatisch in Ihrer AWS Glue-Jobkonfiguration angezeigt:
![Note the “bd-glue-role” IAM role](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773063732895_image.png)
Großartig! Ihr AWS Glue-Job verfügt nun über eine IAM-Rolle mit den erforderlichen Berechtigungen für den Zugriff auf S3 und die Ausführung Ihrer ETL-Pipeline.

### Schritt 6: Fügen Sie den Knoten „Extrahieren (E)“ zu Ihrer Pipeline hinzu

Die *Extraktionsphase (E)* der Pipeline begann, als Sie den Bright Data-Scraper ausgeführt haben, der die Aktienkurse erfasst und in Amazon S3 hochgeladen hat.

Jetzt besteht das Ziel darin, Ihre AWS Glue ETL-Pipeline mit diesen Daten zu verbinden, damit sie verarbeitet werden können. Gehen Sie dazu auf die Registerkarte „Quellen“ im Bereich „Knoten hinzufügen“ und wählen Sie den Knoten „Amazon S3“ aus.
![Adding the “Amazon S3” node](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773063872498_image.png)

Ein Knoten „Datenquelle – S3-Bucket – Amazon S3“ wird auf der Arbeitsfläche angezeigt. Klicken Sie darauf und konfigurieren Sie die S3-Quelle:
![Configuring the “Amazon S3” node](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773062944743_image.png)
Klicken Sie auf die Schaltfläche „S3 durchsuchen“ und wählen Sie Ihren S3-Bucket aus (z. B. `bright-data-etl-bucket`).

Nach der Auswahl des Buckets füllt AWS Glue das Feld „S3-URL“ mit einem Eintrag wie dem folgenden:

```none
s3://bright-data-etl-bucket
```

Standardmäßig versucht AWS Glue, alle Dateien innerhalb des angegebenen S3-Pfads zu lesen. Da wir den genauen Namen der Eingabedatei kennen, aktualisieren Sie das Feld „S3-URL“, damit es direkt darauf verweist:

```none
s3://bright-data-etl-bucket/stocks.json
```

Dadurch wird AWS Glue angewiesen, die zuvor hochgeladene Datei `„stocks.json“` zu verwenden, die die mit Yahoo Finance Scraper gesammelten Daten enthält.

Konfigurieren Sie als Nächstes das Datenformat. Da es sich bei dem Eingabedatensatz um eine JSON-Datei handelt, wählen Sie „JSON” als Eingabeformat aus.
![The configured “Amazon S3” node](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773064004618_image.png)
Klicken Sie dann auf die Schaltfläche „Schema ableiten“. AWS Glue analysiert automatisch die JSON-Eingabedatei und generiert das entsprechende Schema.

Im Abschnitt „Output schema“ (Ausgabeschema) des Knotens sehen Sie die aus den JSON-Daten abgeleitete Struktur:
![The "Output schema” section](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773064145081_image.png)
Das abgeleitete Schema stimmt mit dem von Bright Data Yahoo Finance Scraper zurückgegebenen Ausgabedatenschema überein. Cool!

### Schritt 7: Definieren Sie die Transformationslogik (T)

Wie bereits erwähnt, handelt es sich hierbei nur um ein einfaches Beispiel, daher wird der *Transformationsschritt (T)* minimal gehalten. Das Ziel besteht darin, die Quelldaten mithilfe einer SQL-Abfrage zu filtern und nur Unternehmen zu behalten, deren KGV unter 30 liegt.

Gehen Sie dazu auf die Registerkarte „Transformierungen“ und wählen Sie den Knoten „SQL-Abfrage“ aus:
![Adding the “SQL Query” node](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773064717415_image.png)

Der Knoten wird zur Arbeitsfläche hinzugefügt. Klicken Sie darauf und konfigurieren Sie ihn so, dass der übergeordnete Knoten „Amazon S3” ist. Das bedeutet, dass die Ausgabe des Amazon S3-Knotens zur Eingabe des Knotens „SQL-Abfrage” wird. Mit anderen Worten: Sie führen eine SQL-Abfrage auf den gescrapten JSON-Daten aus.

Definieren Sie als Nächstes den Aliasnamen für den Eingabedatensatz als `„stocks“` und fügen Sie diese SQL-Abfrage hinzu:

```none
select stock_ticker, pe_ratio from stocks
WHERE pe_ratio < 30;
```

Diese Abfrage wählt die Felder `„stock_ticker“` und `„pe_ratio“` aus jeder gescrapten Aktie aus und behält nur diejenigen, deren KGV unter 30 liegt.

Falls Sie sich fragen, woher diese Felder stammen: `„stock_ticker“` und `„pe_ratio“` sind zwei der Attribute, die vom Bright Data Yahoo Finance Scraper zurückgegeben werden (die AWS Glue im vorherigen Schritt automatisch abgeleitet hat):
![Note the “stock_picker” and “pe_ratio” fields in the Bright Data Yahoo Finance Scraper output schema](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773064887310_image.png)

Zu diesem Zeitpunkt sollte Ihre ETL-Pipeline wie folgt aussehen:
![See the configured “SQL Query” node](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773070713285_image.png)
**Hinweis**: In realen Pipelines umfasst die *Transformationsphase (T)* in der Regel mehrere Schritte. Sie können diese implementieren, indem Sie mehrere Transformationsknoten hinzufügen und diese sequenziell verbinden oder indem Sie mehrere Verzweigungen im Workflow erstellen.

### Schritt 8: Verbinden Sie sich in der Load-Phase (L) mit Ihrem S3-Bucket

Die Ausgabe Ihres „SQL Query”-Knotens sind die gefilterten, transformierten Daten. Der letzte Schritt besteht darin, diese Daten in Ihrem S3-Bucket zu speichern, um die *Load (L)* -Phase Ihrer ETL-Pipeline abzuschließen.

Fügen Sie auf der Registerkarte „Targets“ einen weiteren Amazon S3-Knoten hinzu:
![Adding an “Amazon S3” node](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773070247866_image.png)
Klicken Sie auf den neuen Knoten, um ihn zu konfigurieren. Legen Sie den übergeordneten Knoten als Ihren „SQL-Abfrage”-Knoten fest. Die Ausgabe des „SQL-Abfrage”-Knotens wird als Eingabe an den neuen Amazon S3-Knoten gesendet.

Definieren Sie das Ausgabeformat als „JSON“ ohne Komprimierung. Geben Sie dann den Ziel-S3-Ordner an, z. B.:

```none
s3://bright-data-etl-bucket/output/
```

**Hinweis**: Ersetzen Sie `„bright-data-etl-bucket“` durch den Namen Ihres tatsächlichen S3-Buckets.

Auf diese Weise werden die transformierten Daten im Ordner ` „/output“` gespeichert.

Behalten Sie alle anderen Optionen als Standard bei und klicken Sie dann auf „Speichern“, um Ihren AWS Glue ETL-Job zu aktualisieren:
![The final AWS Glue ETL job pipeline](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773065331805_image.png)
Großartig! Ihre ETL-Pipeline ist nun vollständig konfiguriert und bereit zur Ausführung.

### Schritt 9: Führen Sie die Pipeline aus und sehen Sie sich die Ergebnisse an

Klicken Sie auf die Schaltfläche „Ausführen“, um Ihren AWS Glue-Job zu starten. Sie sollten eine Benachrichtigung wie diese sehen:
![The successful job started notification](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773070414347_image.png)

Wechseln Sie zur Registerkarte „Ausführungen“, um die Ausführung Ihrer Pipeline zu überwachen:
![Note the job run](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773070454847_image.png)

Warten Sie, bis der „Ausführungsstatus“ den Status „Erfolgreich“ erreicht hat. Dies kann über eine Minute dauern, haben Sie also etwas Geduld:
![Note the “Succeeded” status](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773070571375_image.png)

Nach Abschluss des Vorgangs wird die Ausgabedatei im Ordner ` „/output“` Ihres S3-Buckets angezeigt:
![The output folder containing the produced filtered data](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773070594674_image.png)

Öffnen Sie die erstellte Datei. Sie sehen eine Liste der Aktien mit einem KGV unterhalb Ihres Filtergrenzwerts (z. B. unter 30):
![The produced filtered stocks](https://media.brightdata.com/2026/03/s_ED40AD1B0EDB4725A1BB833F8F2E73C8D42F9F5F68642268D1FDAC9E9619B836_1773071196346_image.png)
Wie Sie sehen können, gehören zu den resultierenden Aktien AMZN, BRK.B, META, MSFT und GOOGL.

Et voilà! Sie haben gerade eine AWS Glue ETL-Pipeline integriert mit Bright Data erstellt. Die *Extraktionsphase* nutzt die Web-Scraping-APIs von Bright Data, die *Transformationsphase* filtert die Daten mit SQL und die *Ladephase* speichert die Ergebnisse wieder in S3.

## Weitere Ideen für die Integration von Bright Data in einen AWS Glue ETL-Job

Es besteht kein Zweifel, dass Bright Data dank seiner [Funktionen zum Abrufen von Webdaten](/products/web-scraper) eine wichtige Rolle in der *Extraktionsphase* einer ETL-Pipeline spielen kann.

Bright Data kann jedoch auch über die Extraktion hinaus genutzt werden, beispielsweise in der *Transform-* Phase zur Datenanreicherung, -validierung oder -verifizierung. Sie könnten beispielsweise:

- **Unternehmensprofile verbessern**: Verwenden Sie den [ZoomInfo Scraper](/products/web-scraper/zoominfo), um firmografische Daten an Datensätze anzuhängen, die aus Webquellen extrahiert wurden.
- **Mitarbeiterinformationen validieren**: Integrieren Sie [LinkedIn-Profile](/products/web-scraper/linkedin), um Berufsbezeichnungen, E-Mail-Adressen oder soziale Profile zu überprüfen.
- **Preise oder Produktdetails von Wettbewerbern abrufen**: Verwenden Sie den [Amazon Scraper](/products/web-scraper/amazon) oder [Amazon Reviews Scraper](/products/web-scraper/amazon/reviews), um Ihren Datensatz mit Marktinformationen anzureichern.
- **SEO- oder Suchdaten hinzufügen:** Verwenden Sie die [SERP-API](/products/serp-api), um Suchmaschinen-Rankingdaten oder Keyword-Einblicke als Teil Ihres transformierten Datensatzes sowie zur Datenüberprüfung einzubeziehen.

Wenn Sie sich fragen, wie diese Integration möglich ist, lesen Sie die offizielle Anleitung zur [Definition benutzerdefinierter visueller Transformationen](https://docs.aws.amazon.com/glue/latest/dg/custom-visual-transform.html). Sie müssen lediglich eine JSON-Datei mit den Beschreibungen und eine Python-Datei mit der Logik für die Bright Data API-Integration hinzufügen.

## Fazit

In diesem Tutorial haben Sie gelernt, was AWS Glue ist und wie Bright Data seine Funktionen durch eine Vielzahl von Web-Scraping-Lösungen erweitern kann.

Insbesondere haben Sie gesehen, wie [die Web-Scraping-APIs](/products/web-scraper) von Bright Data sowohl die *Extraktions- (E)* als auch *die Transformationsphase (T)* einer ETL-Pipeline unterstützen können (sei es beim Abrufen von Rohdaten, beim Anreichern von Datensätzen oder beim Verifizieren von Informationen).

Erstellen Sie noch heute ein kostenloses Bright Data-Konto und entdecken Sie unsere Webdatenlösungen!



Vertrieb kontaktierenGratis testen![google social icon](/wp-content/themes/brightdata/assets/images/ic_google.svg)









 Inhaltsverzeichnis







Dedicated Scraper APIs &amp; No-Code Scrapers

Over 1000 scrapers for all popular domains. Simplify your web scraping.

[See pricing](/pricing/web-scraper "See pricing")

Just want data? Skip scraping.

Hundreds of ready-to-use datasets from all popular domains.

[See pricing](/pricing/datasets "See pricing")







 [ ](https://news.ycombinator.com/submitlink?t=Integration+von+Bright+Data+in+AWS+Glue+ETL-Jobs%3A+Eine+Schritt-f%C3%BCr-Schritt-Anleitung&u=https://brightdata.de/blog/web-data-de/aws-glue-etl-with-bright-data) [ ](https://www.linkedin.com/shareArticle?mini=true&title=Integration+von+Bright+Data+in+AWS+Glue+ETL-Jobs%3A+Eine+Schritt-f%C3%BCr-Schritt-Anleitung&url=https://brightdata.de/blog/web-data-de/aws-glue-etl-with-bright-data) [ ](http://www.reddit.com/submit?title=Integration+von+Bright+Data+in+AWS+Glue+ETL-Jobs%3A+Eine+Schritt-f%C3%BCr-Schritt-Anleitung&url=https://brightdata.de/blog/web-data-de/aws-glue-etl-with-bright-data)







##  Das könnte Sie auch interessieren

 [ ![OpenHuman with Bright Data](https://media.brightdata.de/2026/09/OpenHuman-with-Bright-Data.png) ](https://brightdata.de/blog/ai/openhuman-with-bright-data "Produktionsreifer Web-Zugriff in OpenHuman über die Bright Data CLI")

 [AI



 ![Antonello Zanini](https://media.brightdata.de/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Produktionsreifer Web-Zugriff in OpenHuman über die Bright Data CLI

Integrieren Sie die Bright Data CLI mit OpenHuman, um produktionsreifen Web-Zugriff und Datenerhebung für KI-Agenten zu ermöglichen.



 09-Sep-2026

 12 min lesen

 ](https://brightdata.de/blog/ai/openhuman-with-bright-data)

 [ ![Multimodal Web Scraping with MiniMax](https://media.brightdata.de/2026/09/Multimodal-Web-Scraping-with-MiniMax.png) ](https://brightdata.de/blog/web-data-de/multimodal-web-scraping-with-minimax "Multimodales Web-Scraping mit MiniMax")

 [Web Data



 ![Antonello Zanini](https://media.brightdata.de/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Multimodales Web-Scraping mit MiniMax

Kombinieren Sie Bright Data Web Unlocker mit MiniMax M3 Vision, um strukturierte Daten aus Bildern und Webseiten-Screenshots zu extrahieren.



 09-Sep-2026

 4 min lesen

 ](https://brightdata.de/blog/web-data-de/multimodal-web-scraping-with-minimax)

 [ ![The 10 Best CLI Tools for Codex in 2026](https://media.brightdata.de/2026/08/The-10-Best-CLI-Tools-for-Codex-in-2026.png) ](https://brightdata.de/blog/ai/best-cli-tools-for-codex "Die 10 besten CLI-Tools für Codex im Jahr 2026 – Getestet & Bewertet")

 [AI



 ![Daniel Shashko](https://media.brightdata.de/2022/04/Daniel-Shashko-2-50x50.png)

Daniel Shashko

Web Data &amp; AI Expert





### Die 10 besten CLI-Tools für Codex im Jahr 2026 – Getestet &amp; Bewertet

Die 10 CLI-Tools, die Codex schneller und leistungsfähiger machen, beginnend mit dem Bright Data CLI für echten Web-Zugriff aus der Sandbox heraus.



 06-Sep-2026

 20 min lesen

 ](https://brightdata.de/blog/ai/best-cli-tools-for-codex)
