In this Article
Scrapy ist das produktionsreife Python-Framework für anspruchsvolles Web Scraping: schnell, asynchron und für Crawling im großen Maßstab entwickelt. Wenn du aber ein echtes Ziel von einer einzigen Datacenter-IP crawlst, wirst du innerhalb weniger Minuten gedrosselt oder blockiert. Die Lösung: Leite Scrapy über Proxies, idealerweise Residential Proxies, damit Anfragen wie die echter Nutzer wirken. Die gute Nachricht: Scrapy unterstützt Proxies direkt über request.meta['proxy'], und mit einem rotierenden Gateway musst du nicht einmal eine IP-Liste verwalten. Dieser Leitfaden zeigt genau, wie du einen Proxy mit Scrapy verwendest (pro Anfrage, per Middleware für alle Anfragen und mit Rotation), und bewertet anschließend die 8 besten Proxies für Scrapy im Jahr 2026. DataImpulse mit $1/GB ist der Maßstab beim Preis-Leistungs-Verhältnis.
Ich bin Andrii Byzov, AI-Native Fractional CMO, und betreibe täglich Scrapy-Crawler. Im Folgenden findest du die Copy-paste-Konfiguration, den wichtigen Fallstrick bei der Middleware-Reihenfolge und die Anbieter, die dein Budget wert sind.
Wichtige Fakten
- Setze den Proxy mit
request.meta['proxy']: Die integrierteHttpProxyMiddlewarevon Scrapy liest ihn aus und übernimmt die Authentifizierung über die Proxy-URL (http://user:pass@host:port). - Wende ihn mit einer kleinen DownloaderMiddleware auf jede Anfrage an, oder setze ihn pro Anfrage in
start_requests. - Ein rotierendes Gateway macht eine IP-Liste überflüssig. Richte
meta['proxy']auf einen rotierenden Residential-Endpunkt (wie DataImpulse), und jede Anfrage verlässt ihn automatisch über eine neue IP. - Für eine statische IP-Liste verwende
scrapy-rotating-proxies(ROTATING_PROXY_LIST): Es rotiert die Proxies, erkennt Sperren und steht in der Reihenfolge vorHttpProxyMiddleware(die Standardprioritäten erledigen das bereits). - Scrapy unterstützt HTTP/HTTPS Proxies nativ (nicht SOCKS5): Verwende den HTTP-Endpunkt (DataImpulse Port 823). Kombiniere ihn mit Residential für $1/GB, Datacenter für $0.50/GB oder Mobile für $2/GB aus einem Pool mit 90M+ IPs in 195 Ländern.
So verwendest du einen Proxy mit Scrapy
1. Pro Anfrage über meta['proxy']
import scrapy
class IpSpider(scrapy.Spider):
name = "ip"
def start_requests(self):
proxy = "http://YOUR_LOGIN__cr.us:[email protected]:823" # __cr.us = US
yield scrapy.Request("https://httpbin.org/ip", meta={"proxy": proxy})
def parse(self, response):
self.log(response.text) # confirm the egress IP
Die standardmäßig aktivierte HttpProxyMiddleware von Scrapy übernimmt meta['proxy'] und setzt den Header Proxy-Authorization anhand der Zugangsdaten in der URL. Zusätzlicher Code ist nicht nötig.
2. Eine Middleware für alle Anfragen
Sauberer für ein ganzes Projekt: Setze den Proxy einmal, dann gilt er für alle Anfragen:
# middlewares.py
class DataImpulseProxyMiddleware:
PROXY = "http://YOUR_LOGIN__cr.us:[email protected]:823"
def process_request(self, request, spider):
request.meta["proxy"] = self.PROXY
# settings.py — run BEFORE the built-in HttpProxyMiddleware (750)
DOWNLOADER_MIDDLEWARES = {
"myproject.middlewares.DataImpulseProxyMiddleware": 350,
}
3. Rotation einer statischen IP-Liste mit scrapy-rotating-proxies
Wenn du eine Liste von Proxies statt eines rotierenden Gateways hast, rotiert scrapy-rotating-proxies sie und erkennt Sperren:
# pip install scrapy-rotating-proxies
# settings.py
ROTATING_PROXY_LIST = [
"http://YOUR_LOGIN__cr.us:[email protected]:823",
# ...more endpoints/sessions...
]
DOWNLOADER_MIDDLEWARES = {
"rotating_proxies.middlewares.RotatingProxyMiddleware": 610,
"rotating_proxies.middlewares.BanDetectionMiddleware": 620,
}
Mit dem rotierenden Residential Gateway von DataImpulse brauchst du das meist nicht: Ein Endpunkt liefert bereits pro Anfrage eine neue IP. Nutze scrapy-rotating-proxies, wenn du viele getrennte Sessions verwaltest oder eine integrierte Sperrerkennung möchtest. Hinweis: Scrapy unterstützt bei Proxies nur HTTP/HTTPS. Verwende daher den HTTP-Endpunkt (Port 823), nicht SOCKS5. Die DataImpulse-Tutorials erklären die Session-Parameter.
Die besten Proxies für Scrapy auf einen Blick
| Anbieter | Am besten für Scrapy | Residential-Preis | Protokolle | Besonderheiten |
|---|---|---|---|---|
| DataImpulse | Bestes Preis-Leistungs-Verhältnis, interne Crawler | $1/GB PAYG | HTTP/HTTPS | 90M+ pool, rotating gateway, ohne Ablaufdatum |
| Bright Data | Enterprise + Managed Services | ~$4/GB promo; $8 regular | HTTP/HTTPS/SOCKS5 | Web Unlocker, SERP API, datasets |
| Oxylabs | Enterprise SLA | from $6/GB | HTTP/HTTPS/SOCKS5 | 175M+ pool, Scraper-APIs |
| Decodo | Mittelstand, vollständiges Geo-Raster | $3.75/GB (~$2 at 1TB+) | HTTP/HTTPS | 115M+ pool, Sticky bis 24h |
| IPRoyal | Lange Sticky Sessions | from $7.35/GB | HTTP/HTTPS/SOCKS5 | Sticky bis zu 7 Tage; günstiges PAYG |
| SOAX | Residential- und Mobile-Mix | $3.60/GB Starter | HTTP/HTTPS | 155M+ res, 33M+ mobile |
| Webshare | Budget / Self-Service | from $3.50/mo res; $2.99/mo DC | HTTP/SOCKS5 | Kostenloser Tarif, günstigstes Datacenter |
| NetNut | Stabilität durch ISP-Residential | from $3.53/GB | HTTP/HTTPS | Statische IPs von Consumer-ISPs |

Die Auswahl im Überblick
DataImpulse ist der Maßstab beim Preis-Leistungs-Verhältnis für Scrapy-Crawler: Residential für $1/GB nach Verbrauch (Datacenter $0.50/GB, Mobile $2/GB), 90M+ IPs in 195 Ländern, ein rotierendes HTTP/HTTPS Gateway mit einer neuen IP pro Anfrage sowie Länder-, Stadt- und ASN-Targeting im Benutzernamen. Der Traffic läuft nie ab, sodass Entwicklungsdurchläufe kein Abonnement verbrauchen. Veröffentlichte Erfolgsrate: 99.51 %; G2: 4.8/5; persönlicher Support rund um die Uhr. Für internes Crawling mit hohem Volumen bietet es die niedrigsten Kosten pro erfolgreicher Anfrage.
Bright Data ist die Enterprise-Wahl (Residential regulär etwa $8/GB, im Angebot etwa $4) mit Web Unlocker, SERP API und Datensätzen. Oxylabs (ab $6/GB, 175M+ Pool) ist die SLA-Option mit Scraper-APIs. Decodo (ab $3.75/GB, Sticky bis 24h) ist die ausgewogene Wahl für den Mittelstand. IPRoyal (ab $7.35/GB, Sticky bis zu 7 Tage) eignet sich für lange Crawls mit stabilen Sessions. SOAX ($3.60/GB, 155M+ Residential + 33M+ Mobile) ergänzt einen starken Mobile-Pool. Webshare (kostenloser Tarif, Datacenter ab $2.99/Monat) ist der günstige Self-Service-Einstieg, und NetNut (ab $3.53/GB) steht für stabile ISP-Residential-Proxies.
Rotierende vs. Sticky Proxies mit Scrapy
Für breit angelegtes Crawling ist ein rotierendes Residential Gateway ideal: Jede Scrapy-Anfrage erhält eine neue IP, was die Last verteilt und Rate Limits ohne IP-Verwaltung umgeht. Verwende bei zustandsbehafteten Abläufen (Login und anschließende Anfragen) eine Sticky Session, damit dieselbe IP über die gesamte Abfolge erhalten bleibt, und lasse Cookies aktiviert (die Cookie-Middleware von Scrapy ist standardmäßig aktiv). Die meisten Scrapy-Crawls sind breit angelegt und zustandslos, daher ist Rotation der übliche Standard. Nutze Sticky nur für authentifizierte oder mehrstufige Ziele.
Häufige Fehler mit Scrapy Proxies
- Middleware-Reihenfolge. Eine eigene Proxy-Middleware oder
scrapy-rotating-proxiesmuss vor der integriertenHttpProxyMiddlewareausgeführt werden (niedrigere Prioritätszahl), sonst wird dein Proxy nicht angewendet. - Erwarten, dass SOCKS5 funktioniert. Scrapy unterstützt bei Proxies nur HTTP/HTTPS. Verwende den HTTP-Endpunkt, keine SOCKS URL.
- Zu aggressives Crawling. Aktiviere
AUTOTHROTTLE_ENABLEDund wähle sinnvolle Werte fürCONCURRENT_REQUESTS/DOWNLOAD_DELAY, damit auch rotierende IPs nicht überlastet werden. - Datacenter IPs bei geschützten Zielen: Sie werden schnell blockiert. Verwende Residential für Seiten mit starkem Anti-Bot-Schutz.
- Keine Behandlung von Sperren. Ergänze Wiederholungs- und Sperrerkennung (BanDetectionMiddleware von
scrapy-rotating-proxiesoder eigeneRETRY_HTTP_CODES), damit blockierte Antworten über eine neue IP wiederholt und nicht als Daten geparst werden.
Welcher Proxy-Typ für Scrapy: Residential, Datacenter oder Mobile?
- Residential ($1/GB): der Standard für geschützte Ziele (E-Commerce, SERPs, Social Media). Wenn du nur einen wählst, dann diesen.
- Mobile ($2/GB): echte Carrier-IP-Adressen für die schwierigsten Ziele und mobile Weboberflächen.
- Datacenter ($0.50/GB): am günstigsten und schnellsten für ungeschütztes Crawling, APIs und deine eigene Infrastruktur. Setze sie nicht bei Seiten mit starkem Anti-Bot-Schutz ein.
DataImpulse bietet alle drei in einem einzigen Pay-as-you-go-Konto. So kann ein Scrapy-Projekt jede Anfrage über Benutzername und Endpunkt an die passende Kategorie leiten.
So startest du mit DataImpulse + Scrapy
Schritt 1. Erstelle ein DataImpulse-Konto und hole dir Zugangsdaten für Residential. Das $5-/5GB-Einstiegsangebot läuft nie ab und ist ein echtes Testbudget.
Schritt 2. Setze request.meta["proxy"] = "http://YOUR_LOGIN__cr.us:[email protected]:823" pro Anfrage oder füge die einzeilige Proxy-Middleware hinzu, um sie überall anzuwenden. Hänge für Geo-Targeting einen Ländercode an den Benutzernamen an.
Schritt 3. Aktiviere AUTOTHROTTLE, ergänze Wiederholungs- und Sperrbehandlung und lasse dir vom rotierenden Gateway pro Anfrage eine neue IP geben. Siehe die DataImpulse-Tutorials und die Seite zu Residential Proxies.
Häufig gestellte Fragen
Wie verwende ich einen Proxy in Scrapy?
Setze request.meta['proxy'] = 'http://user:pass@host:port' in deinen Anfragen. Die integrierte HttpProxyMiddleware von Scrapy liest ihn aus und übernimmt die Authentifizierung über die URL. Füge für ein ganzes Projekt eine kleine DownloaderMiddleware hinzu, die request.meta['proxy'] bei jeder Anfrage setzt. Für DataImpulse: http://YOUR_LOGIN__cr.us:[email protected]:823.
Welcher Proxy ist der beste für Scrapy?
Residential Proxies für geschützte Ziele: DataImpulse mit $1/GB ist die Wahl mit dem besten Preis-Leistungs-Verhältnis (90M+ IPs, rotierendes HTTP/HTTPS Gateway, Traffic ohne Ablaufdatum). Bright Data und Oxylabs sind die Enterprise-Optionen; Webshare ist am günstigsten für den Einstieg. Alle funktionieren mit meta['proxy'] von Scrapy. Entscheidend sind Preis, Pool-Qualität und die Frage, ob du Managed APIs benötigst.
Wie rotiere ich Proxies in Scrapy?
Am einfachsten richtest du meta['proxy'] auf ein rotierendes Residential Gateway (DataImpulse). Jede Anfrage erhält automatisch eine neue IP, ohne dass du eine Liste verwalten musst. Installiere für eine statische Proxy-Liste scrapy-rotating-proxies, setze ROTATING_PROXY_LIST und platziere dessen Middleware vor der integrierten HttpProxyMiddleware. Es erkennt außerdem Sperren und wiederholt Anfragen über eine neue IP.
Unterstützt Scrapy SOCKS5 Proxies?
Nicht nativ: Die HttpProxyMiddleware von Scrapy unterstützt nur HTTP und HTTPS Proxies. Verwende für Residential Proxies den HTTP-Endpunkt (DataImpulse Port 823). SOCKS5 würde einen eigenen Download-Handler erfordern, was selten nötig ist, da das HTTP Gateway Scrapy-Crawling abdeckt.
Warum funktioniert mein Scrapy Proxy nicht?
Meist liegt es an der Middleware-Reihenfolge: Eine eigene Proxy-Middleware oder scrapy-rotating-proxies muss vor der integrierten HttpProxyMiddleware laufen (mit einer niedrigeren Prioritätszahl). Weitere Ursachen sind eine SOCKS URL (verwende HTTP), fehlende Zugangsdaten in der Proxy-URL oder eine blockierte Datacenter-IP auf einer geschützten Seite (wechsle zu Residential). Prüfe die ausgehende IP über https://httpbin.org/ip.
Was kosten Scrapy Proxies?
Reine Residential Proxies werden pro GB abgerechnet: DataImpulse $1/GB (Preisuntergrenze), NetNut ab $3.53, SOAX $3.60, Decodo $3.75, Oxylabs ab $6, IPRoyal $7.35; Webshare bietet günstige Abonnements ab $3.50/Monat. Eine gecrawlte Seite macht nur einen kleinen Teil eines GB aus. Deshalb ist Residential nach GB für Scrapy-Crawling mit hohem Volumen deutlich günstiger als Managed APIs pro Datensatz; Managed Optionen eignen sich für die schwierigsten Ziele.
