In this Article
Ein Modell für maschinelles Lernen ist nur so gut wie die Daten, aus denen es lernt, und für die meisten Teams stammen diese Daten aus dem Web. Bei der Datenerfassung für maschinelles Lernen, also dem Sammeln, Bereinigen und Strukturieren realer Beispiele zu einem Trainingsdatensatz, entscheidet sich ein großer Teil der Modellqualität. Dieser Leitfaden führt Sie durch Web Scraping für maschinelles Lernen: So erstellen Sie einen hochwertigen Trainingsdatensatz, was “hochwertig” bedeutet, wie der Prozess Schritt für Schritt abläuft, welche Bereinigung besonders wichtig ist, wo die rechtlichen Grenzen liegen und warum Erfassung in großem Maßstab Proxys braucht.
Ich bin Andrii Byzov, ein AI-Native Fractional CMO, der Webdaten-Pipelines für ML und Analysen entwickelt. Im Folgenden erfahren Sie, welche Datensatzeigenschaften die Modellleistung beeinflussen, wie ein praxisnaher Workflow von Scraping zum Datensatz mit Code aussieht und wie Residential Proxys die Erfassung skalierbar und vielfältig halten.
Wichtige Fakten
- Qualität, Deduplizierung und die Genauigkeit der Kennzeichnungen sind oft wichtiger als die reine Datenmenge. Ein sauberer, vielfältiger und gut gekennzeichneter Datensatz kann ein besseres Modell trainieren als ein größerer, verrauschter Datensatz, auch wenn Umfang weiterhin hilft, sobald die Qualität gesichert ist.
- Das Web ist eine häufige Quelle für viele ML-Datensätze: Texte, Bilder, Preise, Bewertungen und Angebote werden per Scraping erfasst, wenn keine API, kein lizenzierter Feed und kein offener Datensatz passt.
- Nutzen Sie für geosensible Aufgaben eine regionsbewusste Erfassung. Wenn Sprache, Preise oder Verfügbarkeit je nach Standort variieren, verhindert das Abrufen von Beispielen aus vielen Regionen über geozielgerichtete Proxys einen verzerrten Datensatz.
- Web Scraping von rate-limitierten Websites in großem Umfang nutzt oft Proxys. Eine einzelne IP wird schnell gesperrt, daher stützen sich große Erfassungen auf rotierende Residential IPs. Proxys setzen die Nutzungsbedingungen einer Website jedoch nicht außer Kraft.
- Wie Sie die Daten beschafft haben, ist rechtlich relevant. In Bartz v. Anthropic (2025) entschied das Gericht, dass das Training mit rechtmäßig erworbenen Büchern unter diesen Umständen Fair Use darstellte, verneinte dies jedoch für den Aufbau einer Bibliothek aus Raubkopien. Die Herkunft der Daten ist Teil der Compliance.
Was zeichnet einen guten Trainingsdatensatz aus?
Bevor Sie etwas scrapen, sollten Sie Ihr Ziel kennen. Ein hochwertiger Trainingsdatensatz hat fünf Eigenschaften:
- Relevanz: Die Beispiele passen zur Aufgabe und zu der Verteilung, die Ihr Modell im Produktiveinsatz sieht.
- Vielfalt: unterschiedliche Quellen, Regionen und Sonderfälle, damit das Modell verallgemeinert, statt nur einen Ausschnitt auswendig zu lernen.
- Saubere Kennzeichnungen: präzise, konsistente Annotationen; Rauschen in den Kennzeichnungen begrenzt die erreichbare Genauigkeit.
- Ausgewogenheit: Klassen und Segmente sind in sinnvollen Anteilen vertreten und werden nicht von dem dominiert, was sich am leichtesten scrapen ließ.
- Aktualität: aktuell genug, damit die Muster noch gelten, und mit einem Plan zur Aktualisierung, wenn sich die Welt verändert.
Die meisten Probleme nach dem Motto “Mehr Daten haben nicht geholfen” gehen darauf zurück, dass eine dieser Eigenschaften schwach ausgeprägt ist, meist durch Duplikate, Rauschen in den Kennzeichnungen oder einen auf eine Quelle verzerrten Datensatz. Darauf konzentriert sich dieser Leitfaden. Informationen zum Kauf von Proxys finden Sie unter die besten Proxys für ML-Training; typische Fehler behandelt Fehler, die Teams bei der Datenerfassung für AI-Training wiederholen.
So erstellen Sie per Web Scraping einen Trainingsdatensatz
Schritt 1. Definieren Sie Schema und Kennzeichnungen. Legen Sie vor der Erfassung die genauen Felder und Kennzeichnungen fest: Was enthält jedes Beispiel, und wie wird es markiert? Wenn Sie von der Aufgabe des Modells rückwärts planen, vermeiden Sie Daten, die Sie nicht verwenden können.
Schritt 2. Beschaffen und scrapen Sie Daten in großem Maßstab. Identifizieren Sie die Websites mit Ihren Beispielen und scrapen Sie sie über Proxys, um große Mengen und regionale Vielfalt zu erreichen. Versehen Sie jedes Beispiel bereits bei der Erfassung mit seiner Quelle und Kennzeichnung.
import requests
from bs4 import BeautifulSoup
HEADERS = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) "
"AppleWebKit/537.36 (KHTML, like Gecko) Chrome/126.0.0.0 Safari/537.36"}
# Rotating residential proxies: scale collection without IP blocks, and pull
# region-diverse examples so the dataset isn't skewed to one location.
proxies = {"http": "http://LOGIN__cr.us;sid.ml1:[email protected]:823",
"https": "http://LOGIN__cr.us;sid.ml1:[email protected]:823"}
def collect(urls, label):
"""Scrape raw text examples and tag each with its source + label."""
rows = []
for url in urls:
try:
r = requests.get(url, headers=HEADERS, proxies=proxies, timeout=30)
r.raise_for_status()
except requests.RequestException:
continue
text = BeautifulSoup(r.text, "html.parser").get_text(" ", strip=True)
rows.append({"text": text, "label": label, "source": url})
return rows
Schritt 3. Bereinigen und deduplizieren Sie die Daten. Rohdaten aus dem Scraping sind verrauscht und voller Duplikate. Duplikate führen besonders schnell zu einem verzerrten, überangepassten Modell. Entfernen Sie leere und zu kurze Beispiele, normalisieren Sie Text und löschen Sie vor allen weiteren Schritten exakte sowie nahezu identische Duplikate.
import hashlib, re
def clean(t):
return re.sub(r"\s+", " ", t).strip().lower()
def dedup(rows, min_len=40):
"""Drop empties, too-short samples, and exact duplicates — noisy,
duplicated data is the fastest way to a biased, overfit model."""
seen, out = set(), []
for row in rows:
text = row["text"]
if not text or len(text) < min_len:
continue
key = hashlib.sha1(clean(text).encode()).hexdigest()
if key in seen:
continue
seen.add(key)
out.append(row)
return out
urls = ["https://example.com/a", "https://example.com/b"] # your source list
dataset = dedup(collect(urls, label="positive"))
print(f"{len(dataset)} deduplicated examples")
Schritt 4. Kennzeichnen und strukturieren Sie die Daten. Wenden Sie konsistente Kennzeichnungen an, wo möglich programmatisch durch schwache Überwachung und Heuristiken, und lassen Sie eine Stichprobe von Menschen prüfen, um die Qualität der Kennzeichnungen zu messen. Speichern Sie den Datensatz in einem strukturierten, versionierten Format (JSONL/Parquet), damit Sie Trainingsläufe reproduzieren können.
Schritt 5. Validieren Sie die Qualität. Prüfen Sie vor dem Training die Ausgewogenheit der Klassen, die Verteilung der Quellen und offensichtliche Verzerrungen. Ein kurzer Audit mit der Anzahl der Beispiele pro Klasse, Region und Quelle deckt die Schieflage auf, die die Modellleistung unbemerkt beeinträchtigt.
Warum Proxys bei der ML-Datenerfassung wichtig sind
Zwei Probleme führen dazu, dass die Datenerfassung für maschinelles Lernen in großem Maßstab ohne Proxys scheitert. Menge: Trainingsdatensätze benötigen Tausende bis Millionen Beispiele, und Websites begrenzen Anfragen und blockieren aggressives Crawling. Eine einzelne IP wird schnell gesperrt. Vielfalt: Wenn jedes Beispiel von einem Standort stammt, übernimmt der Datensatz diese Verzerrung. Deshalb sollten Beispiele aus vielen Regionen abgerufen werden. DataImpulse Residential Proxys ($1/GB, rotierend, 195 Länder) helfen bei beidem: Ein großer rotierender Pool ermöglicht hohe Mengen, und Geo-Targeting liefert regional vielfältige Beispiele für geosensible Aufgaben. Proxys helfen zwar bei der Erfassung, setzen aber die Nutzungsbedingungen einer Website nicht außer Kraft. Einen umfassenderen Blick auf im Web erhobene Daten bietet unser Leitfaden zu alternativen Daten.
Ist es legal, Daten für ML-Training zu scrapen?
Erfassung und Training sind zwei getrennte Rechtsfragen. Erfassung: Es gelten die üblichen Regeln. Öffentliche, nicht personenbezogene Daten sind im Allgemeinen weniger riskant, dennoch kommt es auf Urheberrecht, Nutzungsbedingungen der Website, Zugangskontrollen und Datenschutzrecht an. Vermeiden Sie Inhalte hinter einem Login, personenbezogene Daten und das Umgehen von Zugangskontrollen. Training: In Bartz v. Anthropic (2025) entschied ein US-Gericht, dass das Training mit rechtmäßig erworbenen Büchern unter diesen Umständen Fair Use war, verneinte dies jedoch für den Aufbau einer Bibliothek aus Raubkopien. Wie Sie die Daten beschafft haben, ist somit ebenso wichtig wie ihre Verwendung. Dokumentieren Sie die Herkunft sauber, beachten Sie robots.txt und die Nutzungsbedingungen der Website und holen Sie für ein kommerzielles Modell rechtlichen Rat ein. Den vollständigen Rahmen erläutert ob Web Scraping legal ist. Dies sind allgemeine Informationen und keine Rechtsberatung.
Häufig gestellte Fragen
Was ist Datenerfassung für maschinelles Lernen?
Dabei werden reale Beispiele gesammelt, bereinigt und zu einem Datensatz strukturiert, mit dem ein Modell trainieren kann. Für die meisten Teams ist das öffentliche Web die wichtigste Quelle: Texte, Bilder, Preise, Bewertungen und Angebote werden per Scraping erfasst, wenn keine API oder kein lizenzierter Feed verfügbar ist, und anschließend dedupliziert, gekennzeichnet und validiert.
Wie viele Daten brauche ich, um ein Modell zu trainieren?
Das hängt von Aufgabe und Modell ab, doch Qualität und Vielfalt sind wichtiger als die reine Anzahl. Ein kleinerer, sauberer, ausgewogener und gut gekennzeichneter Datensatz ist einem größeren, verrauschten meist überlegen. Konzentrieren Sie sich darauf, Duplikate und Rauschen in den Kennzeichnungen zu entfernen und die Fälle abzudecken, die Ihr Modell im Produktiveinsatz sehen wird, bevor Sie nach mehr Umfang streben.
Warum ist Deduplizierung für Trainingsdaten so wichtig?
Duplikate gewichten wiederholte Inhalte übermäßig, verzerren dadurch das Modell und erhöhen Bewertungswerte künstlich, weil dasselbe Beispiel sowohl im Trainings- als auch im Testdatensatz landen kann. Das Entfernen exakter und nahezu identischer Duplikate zählt zu den wirksamsten Bereinigungsschritten: Es verbessert die Generalisierungsfähigkeit und macht Ihre Kennzahlen verlässlich.
Brauche ich Proxys, um ML-Trainingsdaten zu scrapen?
Für Web Scraping in großem Umfang auf Websites, die nach IP limitieren, in der Regel schon. Der Aufbau eines Datensatzes erfordert viele Anfragen, und eine einzelne IP wird schnell gesperrt. Rotierende Residential Proxys ermöglichen hohe Mengen und den Abruf regional vielfältiger Beispiele. Sie setzen jedoch die Nutzungsbedingungen einer Website nicht außer Kraft, daher sollten Sie verantwortungsvoll erfassen. APIs, lizenzierte Feeds oder offene Datensätze wie Common Crawl können Scraping manchmal vollständig ersetzen.
Ist es legal, Daten zum Trainieren eines Modells zu scrapen?
Erfassung und Training sind getrennte Fragen. Die Erfassung öffentlicher, nicht personenbezogener Daten ist im Allgemeinen weniger riskant, aber nicht automatisch unbedenklich: Urheberrecht, ToS, Zugangskontrollen und Datenschutzrecht gelten weiterhin. Vermeiden Sie Logins, personenbezogene Daten und das Umgehen von Kontrollen. Für das Training wurde in Bartz v. Anthropic (2025) das Training mit rechtmäßig erworbenen Büchern unter diesen Umständen als Fair Use anerkannt, für eine Bibliothek aus Raubkopien jedoch abgelehnt. Die Herkunft der Daten ist entscheidend. Beachten Sie die Nutzungsbedingungen der Website und holen Sie für kommerzielle Nutzung rechtlichen Rat ein. Keine Rechtsberatung.
Fazit
Der Aufbau eines hochwertigen Trainingsdatensatzes ist ein Prozess, kein Download: Definieren Sie das Schema, scrapen Sie die richtigen Quellen in großem Maßstab, deduplizieren und bereinigen Sie konsequent, kennzeichnen Sie einheitlich und prüfen Sie Ausgewogenheit sowie Verzerrungen. Die meisten Daten liegen im Web. Daher macht die Erfassungsschicht mit geografischer Vielfalt, hoher Kapazität und ohne Sperren erst den Rest möglich. Genau das bieten Residential Proxys. Dokumentieren Sie die Herkunft sauber und behalten Sie die rechtlichen Grenzen im Blick, dann erzeugt Ihre Datenerfassung für maschinelles Lernen Datensätze, aus denen ein Modell tatsächlich lernen kann. Informationen zur Infrastruktur finden Sie unter die besten Proxys für ML-Training und die besten Proxys für Web Scraping.
Zuletzt aktualisiert: 25. Juni 2026.
