Best Proxies for Scrapy 2026 cover

Scrapy ist das produktionsreife Python-Framework für anspruchsvolles Web Scraping: schnell, asynchron und für Crawling im großen Maßstab entwickelt. Wenn du aber ein echtes Ziel von einer einzigen Datacenter-IP crawlst, wirst du innerhalb weniger Minuten gedrosselt oder blockiert. Die Lösung: Leite Scrapy über Proxies, idealerweise Residential Proxies, damit Anfragen wie die echter Nutzer wirken. Die gute Nachricht: Scrapy unterstützt Proxies direkt über request.meta['proxy'], und mit einem rotierenden Gateway musst du nicht einmal eine IP-Liste verwalten. Dieser Leitfaden zeigt genau, wie du einen Proxy mit Scrapy verwendest (pro Anfrage, per Middleware für alle Anfragen und mit Rotation), und bewertet anschließend die 8 besten Proxies für Scrapy im Jahr 2026. DataImpulse mit $1/GB ist der Maßstab beim Preis-Leistungs-Verhältnis.

Ich bin Andrii Byzov, AI-Native Fractional CMO, und betreibe täglich Scrapy-Crawler. Im Folgenden findest du die Copy-paste-Konfiguration, den wichtigen Fallstrick bei der Middleware-Reihenfolge und die Anbieter, die dein Budget wert sind.


Wichtige Fakten

  • Setze den Proxy mit request.meta['proxy']: Die integrierte HttpProxyMiddleware von Scrapy liest ihn aus und übernimmt die Authentifizierung über die Proxy-URL (http://user:pass@host:port).
  • Wende ihn mit einer kleinen DownloaderMiddleware auf jede Anfrage an, oder setze ihn pro Anfrage in start_requests.
  • Ein rotierendes Gateway macht eine IP-Liste überflüssig. Richte meta['proxy'] auf einen rotierenden Residential-Endpunkt (wie DataImpulse), und jede Anfrage verlässt ihn automatisch über eine neue IP.
  • Für eine statische IP-Liste verwende scrapy-rotating-proxies (ROTATING_PROXY_LIST): Es rotiert die Proxies, erkennt Sperren und steht in der Reihenfolge vor HttpProxyMiddleware (die Standardprioritäten erledigen das bereits).
  • Scrapy unterstützt HTTP/HTTPS Proxies nativ (nicht SOCKS5): Verwende den HTTP-Endpunkt (DataImpulse Port 823). Kombiniere ihn mit Residential für $1/GB, Datacenter für $0.50/GB oder Mobile für $2/GB aus einem Pool mit 90M+ IPs in 195 Ländern.

So verwendest du einen Proxy mit Scrapy

1. Pro Anfrage über meta['proxy']

import scrapy

class IpSpider(scrapy.Spider):
    name = "ip"
    def start_requests(self):
        proxy = "http://YOUR_LOGIN__cr.us:[email protected]:823"  # __cr.us = US
        yield scrapy.Request("https://httpbin.org/ip", meta={"proxy": proxy})

    def parse(self, response):
        self.log(response.text)  # confirm the egress IP

Die standardmäßig aktivierte HttpProxyMiddleware von Scrapy übernimmt meta['proxy'] und setzt den Header Proxy-Authorization anhand der Zugangsdaten in der URL. Zusätzlicher Code ist nicht nötig.

2. Eine Middleware für alle Anfragen

Sauberer für ein ganzes Projekt: Setze den Proxy einmal, dann gilt er für alle Anfragen:

# middlewares.py
class DataImpulseProxyMiddleware:
    PROXY = "http://YOUR_LOGIN__cr.us:[email protected]:823"
    def process_request(self, request, spider):
        request.meta["proxy"] = self.PROXY

# settings.py — run BEFORE the built-in HttpProxyMiddleware (750)
DOWNLOADER_MIDDLEWARES = {
    "myproject.middlewares.DataImpulseProxyMiddleware": 350,
}

3. Rotation einer statischen IP-Liste mit scrapy-rotating-proxies

Wenn du eine Liste von Proxies statt eines rotierenden Gateways hast, rotiert scrapy-rotating-proxies sie und erkennt Sperren:

# pip install scrapy-rotating-proxies
# settings.py
ROTATING_PROXY_LIST = [
    "http://YOUR_LOGIN__cr.us:[email protected]:823",
    # ...more endpoints/sessions...
]
DOWNLOADER_MIDDLEWARES = {
    "rotating_proxies.middlewares.RotatingProxyMiddleware": 610,
    "rotating_proxies.middlewares.BanDetectionMiddleware": 620,
}

Mit dem rotierenden Residential Gateway von DataImpulse brauchst du das meist nicht: Ein Endpunkt liefert bereits pro Anfrage eine neue IP. Nutze scrapy-rotating-proxies, wenn du viele getrennte Sessions verwaltest oder eine integrierte Sperrerkennung möchtest. Hinweis: Scrapy unterstützt bei Proxies nur HTTP/HTTPS. Verwende daher den HTTP-Endpunkt (Port 823), nicht SOCKS5. Die DataImpulse-Tutorials erklären die Session-Parameter.


Die besten Proxies für Scrapy auf einen Blick

Anbieter Am besten für Scrapy Residential-Preis Protokolle Besonderheiten
DataImpulse Bestes Preis-Leistungs-Verhältnis, interne Crawler $1/GB PAYG HTTP/HTTPS 90M+ pool, rotating gateway, ohne Ablaufdatum
Bright Data Enterprise + Managed Services ~$4/GB promo; $8 regular HTTP/HTTPS/SOCKS5 Web Unlocker, SERP API, datasets
Oxylabs Enterprise SLA from $6/GB HTTP/HTTPS/SOCKS5 175M+ pool, Scraper-APIs
Decodo Mittelstand, vollständiges Geo-Raster $3.75/GB (~$2 at 1TB+) HTTP/HTTPS 115M+ pool, Sticky bis 24h
IPRoyal Lange Sticky Sessions from $7.35/GB HTTP/HTTPS/SOCKS5 Sticky bis zu 7 Tage; günstiges PAYG
SOAX Residential- und Mobile-Mix $3.60/GB Starter HTTP/HTTPS 155M+ res, 33M+ mobile
Webshare Budget / Self-Service from $3.50/mo res; $2.99/mo DC HTTP/SOCKS5 Kostenloser Tarif, günstigstes Datacenter
NetNut Stabilität durch ISP-Residential from $3.53/GB HTTP/HTTPS Statische IPs von Consumer-ISPs

Beste Proxies für Scrapy 2026: reine Residential-Preise pro GB im Vergleich zu Managed-Scraping-API-Preisen pro 1.000 Anfragen (unterschiedliche Einheiten)


Die Auswahl im Überblick

DataImpulse ist der Maßstab beim Preis-Leistungs-Verhältnis für Scrapy-Crawler: Residential für $1/GB nach Verbrauch (Datacenter $0.50/GB, Mobile $2/GB), 90M+ IPs in 195 Ländern, ein rotierendes HTTP/HTTPS Gateway mit einer neuen IP pro Anfrage sowie Länder-, Stadt- und ASN-Targeting im Benutzernamen. Der Traffic läuft nie ab, sodass Entwicklungsdurchläufe kein Abonnement verbrauchen. Veröffentlichte Erfolgsrate: 99.51 %; G2: 4.8/5; persönlicher Support rund um die Uhr. Für internes Crawling mit hohem Volumen bietet es die niedrigsten Kosten pro erfolgreicher Anfrage.

Bright Data ist die Enterprise-Wahl (Residential regulär etwa $8/GB, im Angebot etwa $4) mit Web Unlocker, SERP API und Datensätzen. Oxylabs (ab $6/GB, 175M+ Pool) ist die SLA-Option mit Scraper-APIs. Decodo (ab $3.75/GB, Sticky bis 24h) ist die ausgewogene Wahl für den Mittelstand. IPRoyal (ab $7.35/GB, Sticky bis zu 7 Tage) eignet sich für lange Crawls mit stabilen Sessions. SOAX ($3.60/GB, 155M+ Residential + 33M+ Mobile) ergänzt einen starken Mobile-Pool. Webshare (kostenloser Tarif, Datacenter ab $2.99/Monat) ist der günstige Self-Service-Einstieg, und NetNut (ab $3.53/GB) steht für stabile ISP-Residential-Proxies.


Rotierende vs. Sticky Proxies mit Scrapy

Für breit angelegtes Crawling ist ein rotierendes Residential Gateway ideal: Jede Scrapy-Anfrage erhält eine neue IP, was die Last verteilt und Rate Limits ohne IP-Verwaltung umgeht. Verwende bei zustandsbehafteten Abläufen (Login und anschließende Anfragen) eine Sticky Session, damit dieselbe IP über die gesamte Abfolge erhalten bleibt, und lasse Cookies aktiviert (die Cookie-Middleware von Scrapy ist standardmäßig aktiv). Die meisten Scrapy-Crawls sind breit angelegt und zustandslos, daher ist Rotation der übliche Standard. Nutze Sticky nur für authentifizierte oder mehrstufige Ziele.

Häufige Fehler mit Scrapy Proxies

  • Middleware-Reihenfolge. Eine eigene Proxy-Middleware oder scrapy-rotating-proxies muss vor der integrierten HttpProxyMiddleware ausgeführt werden (niedrigere Prioritätszahl), sonst wird dein Proxy nicht angewendet.
  • Erwarten, dass SOCKS5 funktioniert. Scrapy unterstützt bei Proxies nur HTTP/HTTPS. Verwende den HTTP-Endpunkt, keine SOCKS URL.
  • Zu aggressives Crawling. Aktiviere AUTOTHROTTLE_ENABLED und wähle sinnvolle Werte für CONCURRENT_REQUESTS/DOWNLOAD_DELAY, damit auch rotierende IPs nicht überlastet werden.
  • Datacenter IPs bei geschützten Zielen: Sie werden schnell blockiert. Verwende Residential für Seiten mit starkem Anti-Bot-Schutz.
  • Keine Behandlung von Sperren. Ergänze Wiederholungs- und Sperrerkennung (BanDetectionMiddleware von scrapy-rotating-proxies oder eigene RETRY_HTTP_CODES), damit blockierte Antworten über eine neue IP wiederholt und nicht als Daten geparst werden.

Welcher Proxy-Typ für Scrapy: Residential, Datacenter oder Mobile?

  • Residential ($1/GB): der Standard für geschützte Ziele (E-Commerce, SERPs, Social Media). Wenn du nur einen wählst, dann diesen.
  • Mobile ($2/GB): echte Carrier-IP-Adressen für die schwierigsten Ziele und mobile Weboberflächen.
  • Datacenter ($0.50/GB): am günstigsten und schnellsten für ungeschütztes Crawling, APIs und deine eigene Infrastruktur. Setze sie nicht bei Seiten mit starkem Anti-Bot-Schutz ein.

DataImpulse bietet alle drei in einem einzigen Pay-as-you-go-Konto. So kann ein Scrapy-Projekt jede Anfrage über Benutzername und Endpunkt an die passende Kategorie leiten.

So startest du mit DataImpulse + Scrapy

Schritt 1. Erstelle ein DataImpulse-Konto und hole dir Zugangsdaten für Residential. Das $5-/5GB-Einstiegsangebot läuft nie ab und ist ein echtes Testbudget.

Schritt 2. Setze request.meta["proxy"] = "http://YOUR_LOGIN__cr.us:[email protected]:823" pro Anfrage oder füge die einzeilige Proxy-Middleware hinzu, um sie überall anzuwenden. Hänge für Geo-Targeting einen Ländercode an den Benutzernamen an.

Schritt 3. Aktiviere AUTOTHROTTLE, ergänze Wiederholungs- und Sperrbehandlung und lasse dir vom rotierenden Gateway pro Anfrage eine neue IP geben. Siehe die DataImpulse-Tutorials und die Seite zu Residential Proxies.


Häufig gestellte Fragen

Wie verwende ich einen Proxy in Scrapy?

Setze request.meta['proxy'] = 'http://user:pass@host:port' in deinen Anfragen. Die integrierte HttpProxyMiddleware von Scrapy liest ihn aus und übernimmt die Authentifizierung über die URL. Füge für ein ganzes Projekt eine kleine DownloaderMiddleware hinzu, die request.meta['proxy'] bei jeder Anfrage setzt. Für DataImpulse: http://YOUR_LOGIN__cr.us:[email protected]:823.

Welcher Proxy ist der beste für Scrapy?

Residential Proxies für geschützte Ziele: DataImpulse mit $1/GB ist die Wahl mit dem besten Preis-Leistungs-Verhältnis (90M+ IPs, rotierendes HTTP/HTTPS Gateway, Traffic ohne Ablaufdatum). Bright Data und Oxylabs sind die Enterprise-Optionen; Webshare ist am günstigsten für den Einstieg. Alle funktionieren mit meta['proxy'] von Scrapy. Entscheidend sind Preis, Pool-Qualität und die Frage, ob du Managed APIs benötigst.

Wie rotiere ich Proxies in Scrapy?

Am einfachsten richtest du meta['proxy'] auf ein rotierendes Residential Gateway (DataImpulse). Jede Anfrage erhält automatisch eine neue IP, ohne dass du eine Liste verwalten musst. Installiere für eine statische Proxy-Liste scrapy-rotating-proxies, setze ROTATING_PROXY_LIST und platziere dessen Middleware vor der integrierten HttpProxyMiddleware. Es erkennt außerdem Sperren und wiederholt Anfragen über eine neue IP.

Unterstützt Scrapy SOCKS5 Proxies?

Nicht nativ: Die HttpProxyMiddleware von Scrapy unterstützt nur HTTP und HTTPS Proxies. Verwende für Residential Proxies den HTTP-Endpunkt (DataImpulse Port 823). SOCKS5 würde einen eigenen Download-Handler erfordern, was selten nötig ist, da das HTTP Gateway Scrapy-Crawling abdeckt.

Warum funktioniert mein Scrapy Proxy nicht?

Meist liegt es an der Middleware-Reihenfolge: Eine eigene Proxy-Middleware oder scrapy-rotating-proxies muss vor der integrierten HttpProxyMiddleware laufen (mit einer niedrigeren Prioritätszahl). Weitere Ursachen sind eine SOCKS URL (verwende HTTP), fehlende Zugangsdaten in der Proxy-URL oder eine blockierte Datacenter-IP auf einer geschützten Seite (wechsle zu Residential). Prüfe die ausgehende IP über https://httpbin.org/ip.

Was kosten Scrapy Proxies?

Reine Residential Proxies werden pro GB abgerechnet: DataImpulse $1/GB (Preisuntergrenze), NetNut ab $3.53, SOAX $3.60, Decodo $3.75, Oxylabs ab $6, IPRoyal $7.35; Webshare bietet günstige Abonnements ab $3.50/Monat. Eine gecrawlte Seite macht nur einen kleinen Teil eines GB aus. Deshalb ist Residential nach GB für Scrapy-Crawling mit hohem Volumen deutlich günstiger als Managed APIs pro Datensatz; Managed Optionen eignen sich für die schwierigsten Ziele.

Share article: