web scraping best practices

ウェブスクレイピングのベストプラクティスは、数か月にわたり安定して稼働するスクレイパーと、停止やブロック、あるいは気付かないうちに不正なデータを返すスクレイパーを分ける要因です。このガイドはエンジニアリングの側面に焦点を当てます。信頼性が高く、対象サイトに配慮しながら、大規模でも低コストで運用できるスクレイパーの構築方法を解説します。

ほとんどのスクレイパーは予測可能な形で失敗します。サーバーに短時間で過剰なリクエストを送る、ボットのように見える、あるいは変化するページ構造に依存する、といった具合です。スクレイピングを使い捨てのスクリプトではなくデータパイプラインとして扱うことが、核心となる発想の転換です。以下では、レート制限、IP とヘッダーのローテーション、適切なデータソースの選択、堅牢なパース、リトライ、キャッシュ、品質保証を取り上げます。1 日に数千ページを収集する場合でも、数百万ページを収集する場合でも当てはまります。

DataImpulse は倫理的なプロキシプロバイダーで、195 か国にわたって 9,000万以上の住宅用・モバイル・データセンターの IP アドレスを提供しています。1 GB あたり 1 ドルからの従量課金モデルを採用し、トラフィックは失効せず、ウェブスクレイピング、広告検証、価格モニタリング、市場調査、複数アカウント管理に使われています。

重要なポイント

  • まず信頼性: 最も重要なウェブスクレイピングのベストプラクティスは、レート制限 を尊重すること、現実的なヘッダーで IP をローテーションすること、バックオフ を使ってリトライすること、そして信頼する前にすべてのバッチを検証することです。
  • 最適なプロキシの種類: ローテーティング住宅用プロキシ。検出されにくい実在の一般ユーザーの IP を使用します。
  • 料金: 1 GB あたり 1 ドルから、従量課金で、トラフィックは失効せず、サブスクリプションもありません。
  • カバレッジ: 195 か国にわたる 90M 以上の倫理的に調達された IP。
  • 信頼性: 成功率 99.51%、G2 で 5 段階中 4.8 の評価。
  • プロトコルとターゲティング: HTTP、HTTPS、SOCKS5 に対応し、国別ターゲティングを含みます。
稼働し続けるスクレイパーを構築する

レート制限 を尊重し、どのように バックオフ すべきか?

対象サイトが処理できるペースでリクエストを送り、負荷の兆候が見えたら自動的に速度を落としましょう。適応的な バックオフ は対象サイトへの配慮であると同時に、自衛策にもなります。過度なトラフィックはブロックを招きやすいだからです。

控えめな並列度とリクエスト間の小さな遅延から始め、サイトが安定して応答している場合は徐々に上げていきます。HTTP 429 (Too Many Requests) と 503 の応答に注意し、サーバーが返す Retry-After ヘッダーがあれば従いましょう。エラーが出たら、少しランダムな ジッター を加えて待機時間を指数関数的に増やし、並列ワーカーが足並みをそろえてリトライしないようにします。

  • 並列度: 全体だけでなく、ホストごとに同時接続数を制限します。
  • 基本遅延: 同じドメインへのリクエストの間に短い休止を入れます。
  • 指数 バックオフ: 失敗するたびに待機時間を 2 倍にし、上限まで増やします。
  • Jitter: 遅延をランダム化し、リトライを時間的に分散させます。

ブロックを避けるために IP とヘッダーをどうローテーションするか?

リクエストを多数の IP アドレスに分散し、自然で一貫性のあるリクエストヘッダーを送って、各セッションが通常のブラウザに見えるようにします。ローテーションは負荷を分散し、単一のアドレスが rate のしきい値を超えるのを防ぎます。

住宅用およびモバイルの IP は実在のユーザーに似ており、一般的なデータセンター IP 帯よりも検知されにくい一方、データセンタープロキシは制限が比較的緩やかな対象サイトや高スループットには依然として適しています。DataImpulse は、ローテーティングおよびスティッキーセッションに対応した住宅用プロキシモバイルプロキシデータセンタープロキシを提供しており、対象サイトの難易度に応じて IP の種類を合わせられます。ローテーションは、相互に整合したヘッダーと組み合わせましょう。すなわち、実在する一般的なブラウザと矛盾しない User-Agent、Accept-Language、Accept-Encoding を、リクエストごとにランダム化するのではなく、セッション内で安定させておきます。より詳しいチェックリストは、ブロックされずにスクレイピングする方法のガイドをご覧ください。

ワークフローに合わせてセッションモードを選びましょう。ローテーティングセッションは頻繁に新しい IP を割り当て、負荷を分散し、互いに独立したページを並列でクロールする処理に向いています。スティッキーセッションは一定時間ひとつの IP を保持し、ログイン、カートへの追加、セッションクッキーに結びついた検索結果などのページ送りといった複数ステップのフローで重要になります。DataImpulse はすべてのプールで両方のモードに対応しています。セッション内では IP、クッキー、ヘッダーの一貫性を保ちましょう。固定した IP と変化し続けるフィンガープリントの組み合わせ自体が、避けるべき兆候だからです。

import requests

HEADERS_POOL = [
    {
        "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) "
                      "AppleWebKit/537.36 (KHTML, like Gecko) "
                      "Chrome/124.0 Safari/537.36",
        "Accept-Language": "en-US,en;q=0.9",
    },
    {
        "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) "
                      "AppleWebKit/605.1.15 (KHTML, like Gecko) "
                      "Version/17.4 Safari/605.1.15",
        "Accept-Language": "en-GB,en;q=0.8",
    },
]

def build_session(headers, proxy_url):
    s = requests.Session()
    s.headers.update(headers)
    s.proxies.update({"http": proxy_url, "https": proxy_url})
    return s

HTML をパースする代わりに、いつ隠れた API を使うべきか?

レンダリングされた HTML をスクレイピングするより、利用できる場合はサイトの基盤となる JSON API を優先しましょう。API は整った構造化データを返し、ページのマークアップより変更が少なく、処理コストもはるかに低くなります。

ブラウザの開発者ツールを開き、Network タブを見て、ページの読み込み中に XHR または Fetch のリクエストを確認します。多くのサイトは、直接呼び出せる JSON エンドポイントからコンテンツを取得しており、ページネーションやフィルタリング用の簡単なクエリパラメータが使えることもあります。これにより、ヘッドレスブラウザのオーバーヘッドを避け、ほとんどのレイアウト変更を回避し、壊れやすいテキスト抽出の代わりに型情報を持つフィールドが得られます。常にサイトの利用規約を確認し、アクセスを許可されたデータだけを要求し、エンドポイントが高速でもリクエスト量は適度に保ちましょう。

サイトの変更に耐えるセレクタをどう書くか?

安定していて意味のある属性を狙うセレクタを書き、利用者より先に問題を検知できるようモニタリングを追加しましょう。壊れやすいセレクタは、静かなデータ損失の最も一般的な原因です。

再デプロイのたびに変わる自動生成クラス名の深い連鎖ではなく、要素の ID、データ属性、ARIA ロールといった意味的な手がかりを基準に選びましょう。レイアウト変更が単一モジュールの編集で済み、コードベース全体を探し回らずに済むよう、パースのロジックは一か所にまとめます。そのうえで、パーサーを本番コードとして扱いましょう。

  • アサーション: レコードごとに、期待される各フィールドが存在し空でないことを確認します。
  • カナリア: いくつかの既知の URL を定期的にスクレイピングし、構造が変わったら通知します。
  • 行数: 今日の量を昨日と比較し、大幅な減少を検知します。
  • スナップショット: 生の HTML のサンプルを保存し、後から失敗をデバッグできるようにします。

リトライとキャッシュで、どうスクレイピングを安く保つか?

リクエストを冪等にして失敗したものだけをリトライし、更新のないページを繰り返しダウンロードしないよう積極的にキャッシュしましょう。どちらの手法もコストを下げ、ターゲットへの負荷を減らします。

各作業単位を URL やレコード ID のような安定したキーを中心に設計し、ジョブの再実行が安全で重複が生じないようにします。一時的なエラー (タイムアウト、5xx、接続リセット) では バックオフ を使ってリトライし、恒久的なエラー (404、410) では結果を記録して次に進みます。キャッシュでは、ETag や Last-Modified といった HTTP バリデータを利用して条件付きリクエストを送り、変更のないページは本文全体ではなく、軽量な 304 応答を返すようにします。増分スクレイピング (タイムスタンプ、サイトマップ、フィードを使って新規または更新された項目だけを取得すること) は、帯域幅を大きく節約する手段です。プロキシのトラフィックは GB 単位で課金されるため、変更のないページを飛ばすことが支出を直接下げます。

import time
import random
import requests
from requests.exceptions import RequestException

def fetch(session, url, retries=4):
    for attempt in range(retries):
        try:
            r = session.get(url, timeout=20)
            if r.status_code in (429, 503):
                wait = int(r.headers.get("Retry-After", 2 ** attempt))
                time.sleep(wait + random.random())
                continue
            r.raise_for_status()
            return r
        except RequestException:
            if attempt == retries - 1:
                raise
            time.sleep((2 ** attempt) + random.random())
    return None

スクレイピングしたデータをどう検証し、パイプラインをどう観測するか?

各バッチを明確に定義したスキーマに照らして検証し、ジョブ全体を再実行せずに問題を診断できるだけの詳細をログに残しましょう。信頼できないデータは、データがない場合よりも危険のです。

各カラムについて、期待される型、範囲、必須フィールドを定義し、失敗したレコードはメインのストアに書き込むのではなく除外するか隔離します。静かな失敗モードに注意しましょう。価格欄が空文字列になっている状態、はるか未来の日付、null 率の突然の急増、重複キーなどです。可観測性の面では、各リクエストのステータスコード、レイテンシ、使用したプロキシ、転送バイト数をログに記録し、成功率とコストを時系列で追跡して、徐々に進む劣化がダッシュボードで見えるようにします。構造化ログといくつかのアラートがあれば、壊れやすかったスクレイパーは安心して運用できるシステムに変わります。

スクレイピングの法的・倫理的なガードレールとは?

収集を許可されたデータだけをスクレイピングし、利用規約と robots.txt の指示を尊重し、処理する法的根拠のない個人データは避けましょう。信頼性と責任は一体です。

ルールは管轄区域やデータの種類によって異なるため、合法性を後回しではなく必須要件として扱いましょう。ウェブスクレイピングは合法かという概説で主な検討事項を解説し、ブロックされずにスクレイピングする方法のガイドで行儀のよい手法を扱っています。調達元も重要です。DataImpulse は、オプトインして報酬を受け取るユーザーから IP を得る倫理的なプロキシプロバイダーとして運営しており、これによりデータ収集を GDPR の要件に沿ったものに保ちます。

ベストプラクティス一覧

プラクティス 理由 ツール
Backoff とリトライ サーバーの過負荷を避ける リトライライブラリ
IP ローテーション ブロックを防ぐ ローテーティングプロキシ
隠れた API を使う より整った高速なデータ取得 ネットワークインスペクタ
モニタリング 問題を早期に検知 アラートとログ
キャッシュ 重複リクエストを削減 ローカルキャッシュストア
検証 データ品質を確保 スキーマチェック
ベストプラクティスと、それぞれが重要な理由

よくある質問

最も重要なウェブスクレイピングのベストプラクティスは何ですか?

適応的な バックオフ で レート制限 を尊重することです。ターゲットが処理できるペースでリクエストを送ることが、ほとんどのブロックを防ぎ、スクレイパーを安定して稼働させます。これは、単一のアンチ検出テクニックよりも重要です。

ウェブスクレイピングに住宅用プロキシは必要ですか?

常に必要というわけではありません。データセンタープロキシは寛容なサイトや高スループットにはよく機能し、住宅用やモバイルの IP は厳格なアンチボットシステムを持つターゲットに適しています。対象サイトの難易度に応じて IP の種類を合わせましょう。

キャッシュはどのようにウェブスクレイピングのコストを下げますか?

キャッシュと増分スクレイピングを使うと、条件付きリクエストとタイムスタンプによって、変わっていないページを飛ばせます。プロキシのトラフィックは GB 単位で課金されるため、変更のないコンテンツを再ダウンロードしないことが帯域幅の支出を直接下げます。

サイトが変わったときにスクレイパーが壊れないようにするには?

自動生成されたクラス名ではなく、ID やデータ属性のような安定した属性を狙い、パースを単一モジュールにまとめ、ページ構造が変わったら通知する定期的なカナリアチェックを実行しましょう。

ローテーティングセッションとスティッキーセッションのどちらを使うべきですか?

独立したリクエストの大きなバッチにはローテーティングセッションを使い、ログインやセッションに紐づく検索結果などのページ送りのように、ワークフローが複数ステップにわたって同じ IP を必要とする場合はスティッキーセッションを使いましょう。

DataImpulse が適さないのはどんなときですか?

静的な ISP プロキシ、フルマネージドのスクレイピング API、あるいは銀行や政府のサイトへのアクセスが必要な場合、DataImpulse は適したサービスではありません。公開データの収集やコンテンツへのアクセスのための、ローテーティングの住宅用・モバイル・データセンタープロキシに特化しています。

倫理的なプロキシで信頼できるスクレイパーを構築する

堅実なエンジニアリングの実践は、信頼できるネットワークの上で最もよく機能します。DataImpulse は、195 か国にわたって、1 GB あたり 1 ドルからの従量課金で失効しないトラフィックを備えた、ローテーティングおよびスティッキーの倫理的なプロキシを提供しています。小さく始めて、パイプラインの成長に合わせてスケールできます。アカウントを作成して、これらのベストプラクティスを本番に取り入れましょう。


Share article: