Scrapy Proxy Integration
Diese Anleitung ist möglicherweise veraltet. Eine aktuelle Anleitung finden Sie in unserer Dokumentation.
What is Scrapy?
Scrapy ist ein Python-Framework für Web-Crawling und Web-Scraping, das es Benutzern ermöglicht, strukturierte Daten von Websites zu extrahieren. Es ist Open-Source, schnell und erweiterbar. Scrapy kann für verschiedene Zwecke verwendet werden, wie z. B. Data Mining, Monitoring und automatisiertes Testen.
Scrapy integration with Bright Data proxies
Öffnen Sie Ihre bevorzugte IDE und starten Sie ein neues Scrapy-Projekt, geben Sie in der Befehlszeile ein:
scrapy startproject <project_name>
Dadurch wird ein neuer Ordner mit dem Projektnamen erstellt. Öffnen Sie innerhalb des Ordners eine Python-Datei.
- Gehen Sie zu Ihrem Bright Data Control Panel und klicken Sie auf das Symbol ‘Proxies & Scraping Infra’
- Erstellen Sie eine neue Proxy-Zone, indem Sie auf ‘Hinzufügen’ klicken, einen Netzwerktyp auswählen, den Proxy konfigurieren und auf Speichern klicken
- Unter dem Tab ‘Zugriffsparameter‘ Ihrer Proxy-Zone finden Sie Ihre ‘BENUTZERNAME‘- und ‘PASSWORT‘-Werte.
- Setzen Sie in Ihrer Scrapy Spider-Codedatei innerhalb des Meta-Parameters der Anfrage den ‘proxy’-Wert auf Folgendes, unter Verwendung der zuvor genannten ‘BENUTZERNAME‘- und ‘PASSWORT‘-Werte: “http://USERNAME:[email protected]:33335“
- Zum Beispiel:
import scrapy
class BrightdatascrapyexampleSpider(scrapy.Spider):
name = "BrightDataScrapyExample"
def start_requests(self):
request = scrapy.Request(url="http://example.com",callback=self.parse)
request.meta['proxy'] = "http://USERNAME:[email protected]:33335"
yield request
def parse(self, response):
print(response.body)
Führen Sie dann den folgenden Befehl in Ihrer Befehlszeile aus:
scrapy runspider <Pythonfilename.py>
How To Use Bright Data Proxy Manger With Scrapy
- Erstellen Sie eine Proxy-Zone wie bei der direkten Integration oben beschrieben
- Installieren Sie den Proxy Manager
- Klicken Sie auf ‘Neuen Port hinzufügen’ und konfigurieren Sie ihn für Ihren Anwendungsfall
- Setzen Sie in Ihrer Scrapy Spider-Codedatei innerhalb des Meta-Parameters der Anfrage den ‘proxy’-Wert auf Folgendes: “http://IP:PORTNUMBER”
- Die lokale Host-IP ist 127.0.0.1 – dies ist der Wert, den Sie verwenden müssen, wenn der Proxy Manager auf Ihrem Rechner installiert ist. Wenn der Proxy Manager auf einem externen Server installiert ist, geben Sie die IP-Adresse dieses Servers ein
- Der im Proxy Manager erstellte Port ist 24XXX, zum Beispiel 24000 – die standardmäßige erste Portnummer
- Zum Beispiel:
import scrapy
class BrightdatascrapyexampleSpider(scrapy.Spider):
name = "BrightDataScrapyExample"
def start_requests(self):
request = scrapy.Request(url="http://example.com",callback=self.parse)
request.meta['proxy'] = "http://127.0.0.1:24000"
yield request
def parse(self, response):
print(response.body)
⚠️Wichtiger Hinweis: Wenn Sie Bright Data’s Residential-Proxys, Web Unlocker oder SERP-API verwenden, müssen Sie ein SSL-Zertifikat installieren, um Ende-zu-Ende-sichere Verbindungen zu Ihrer(n) Zielwebsite(s) zu ermöglichen. Dies ist ein einfacher Vorgang, siehe https://docs.brightdata.com/general/account/ssl-certificate#installation-of-the-ssl-certificate für Anweisungen.
Get proxies for Scrapy
Angetrieben von einem preisgekrönten Residential-Proxy-Netzwerk
Über 400M+ monthly residential IPs, erstklassige Technologie und die Fähigkeit jedes Land, jede Stadt, jeden Anbieter und jede ASN zu erreichen, machen unsere Premium-Proxy-Dienste zur ersten Wahl für Entwickler
Ein Proxy für jeden Entwicklungspfad
Kombinieren Sie Netzwerke, Peers und IPs, um Ihren kontinuierlichen Web-Datenfluss zu optimieren.
Proxy-Netzwerk Preise
Das beste Kundenerlebnis in der Branche!
Neue Funktionsveröffentlichungen jeden Tag
Um Fragen zu beantworten, wenn Sie sie benötigen
Echtzeit-Netzwerkleistungs-Dashboard
Um Ihre Leistung zu optimieren
Um Ihre Datensammelziele zu erreichen