In this Article
LLMトレーニングの経済性は2025-2026年に変化しました。RedditはGoogle($60M/yr)およびOpenAI($70M/yr)とAIライセンス契約を締結し、Stack Overflow + Cloudflareは2026年2月にpay-per-crawlを開始し、1,500+の出版社連合がReally Simple Licensing (RSL)プロトコルを支持し、Redditは無許可スクレイピングを理由にAnthropicとPerplexityを提訴しました。同時に、2人の連邦判事は、Bartz v Anthropic(June 23, 2025)およびKadrey v Meta(June 25, 2025)において、公開データでのトレーニングは「highly transformative」であり、フェアユースの下で保護されるとそれぞれ判断しました。その結果、2026年のMLチームは前例のない規模で公開Webデータを積極的に収集しています。Common Crawlだけでも現在2B+ページ、数百テラバイトに及びます。しかし、AI関連ソース全体で出版社側の反発が現実のものとなり、レート制限が強化されているため、そのままのデータセンターIPではなく、レジデンシャルプロキシインフラを通じて実施しています。Common Crawlを分野別コーパスで補完する場合でも、多言語RAGインデックスを構築する場合でも、拡散モデルのトレーニング向けに画像・テキストペアを組み立てる場合でも、競合にクエリを投げる合成データパイプラインを構築する場合でも、適切なプロキシ構成こそが、IPを消耗させずに収集パイプラインを拡張する鍵です。
本ガイドでは、2026年におけるAIおよびMLトレーニングデータ収集向けのベストプロキシ8選をランク付けし、MLパイプラインにおけるレジデンシャル、データセンター、モバイル、ISPの違いを整理し、Bartz/Kadrey後の法的状況をカバーし、各社を詳しく解説します。30秒で候補を絞りたい場合はクイック比較へ進んでください。その後、詳しい解説をご覧ください。
重要ポイント
ML/AIトレーニングデータ収集は、それ自体が独立したプロキシ市場です。2025-2026年に法的枠組みが明確化し、パブリッシャー側のゲートキーピングが強まり、データセット量が3年間で2桁増加したためです。まず押さえるべき5点は次のとおりです。
- 公開Webでのトレーニングはフェアユースであり、実際のゲートはToSとボット対策です。 Bartz v Anthropic(2025年6月23日、Alsup判事)では、トレーニング利用自体は「極めて変容的」でフェアであると判断されました。ただし、Anthropicが恒久的ライブラリ用に約7M冊の海賊版書籍を別途ダウンロードした行為はフェアユースではありませんでした。Kadrey v Meta(2025年6月25日、Chhabria判事)では、構築された記録に基づきMeta側に有利な判断が下されましたが、AIトレーニングの合法性について広範な権威を示すものではないと明示的に警告しました。「これらの原告は主張を誤った」ということです。個別サイトのToSとボット対策(Cloudflare、Akamai、PerimeterX)が、実務上のアクセスをなお左右します。法的な見通しは明確になり、技術的な障壁はより高くなっています。
- 出版社側は収益化を進めています。 RedditはGoogle(約$60M/yr)およびOpenAI(約$70M/yr)とAIライセンス契約を締結し、現在ではAIモデルで最も引用されるソースとなっています。Wikipediaよりも3×高い頻度です。Redditは無許可スクレイピングを理由にAnthropic(2025年6月)とPerplexity(2025年10月)を提訴しました。Stack Overflow + Cloudflareはpay-per-crawlを開始しました(2026年2月)。RSL(Really Simple Licensing、2025年9月)は、1,500+のパブリッシャーに機械可読なライセンス条件を提供しています。
- Common Crawlは基盤であり、派生データセットが主流です。 Common Crawlは、約2Bページ、数百TB規模に及ぶWebアーカイブを毎月提供しています。C4(750 GB、Google)、RefinedWeb(600Bトークン、Falcon)、RedPajama-V2(100Tトークン、2014-2023年の84件の月次CCスナップショット)は、いずれもこれを基にしています。MLチームは、CCに加えて業種特化型・多言語スクレイピングで補完します。この補完領域こそ、プロキシが必要になる場所です。
- NYT v OpenAIにより、証拠開示の水準が引き上げられました。 2026年1月、SDNY裁判所はOpenAIに対し、NYT原告側へ20M件すべてのChatGPTログ(一部を選別したサブセットではなく)を提出するよう命じました。本番環境のMLパイプラインでは、将来的な証拠開示を前提にすべきです。スクレイピングログ、robots.txt遵守記録、ライセンス文書を保持してください。プロキシプロバイダーのコンプライアンス姿勢(ISO 27001、SOC 2、倫理的に調達されたIP)は、監査証跡において重要です。
- データセンターIPは、AI関連ソースで素早く検知されます。 Reddit、Stack Overflow、ニュースサイト(NYT、WSJ、Atlantic)、GitHub Codespaces、主要アグリゲーターはいずれも最上位のアンチボットスタックを運用しています。本番環境のAIトレーニングデータ収集では、住宅用およびISP住宅用プロキシが標準です。保護されたソースでは、レート制限はIPあたり1-10 RPS前後に集中します。プロキシプールの規模が収集スループットを決定します。
これらのMLトレーニングデータ向けプロキシの選定方法
これら8社を選んだ理由は、大規模な住宅用IPカバレッジに信頼性があること(MLパイプラインはプールを急速に消費します)、2026年5月時点の公開価格があること、そしてAIトレーニング用データ収集で重要となる機能が1つ以上文書化されていることです。具体的には、多言語コーパス向けの複数地域のジオターゲティング、ページ分割されたアーカイブのクロールに十分な長さのスティッキーセッション、ライセンス済みソースのアカウント(Reddit Pushshift、GitHub、Stack Exchange API)向けのISP住宅用、アンチボット対策を汎用的に処理するレコード単位課金のマネージドAPI、または法務監査証跡のためにIPの出所を文書化している倫理的に調達されたプールです。最新のPAYG住宅用GB単価、価格の透明性、マーケティング上の主張の鮮度、独立系のML/AIスクレイピングベンチマークでの順位を評価しました。検証可能なグローバルカバレッジがないプロバイダー、価格情報が古いプロバイダー、または公開された成功率の開示がないプロバイダーは除外しました。
MLトレーニングデータ向けの優れたプロキシとは?
強力なMLトレーニング向けプロキシスタックは、4つの課題を同時に解決します。 国単位でのプールの深さ。MLパイプラインでは、スクレイパー1つあたり月10–500GBの住宅用IPを消費します。30M IPs未満のプールはすぐに枯渇し、品質が低下します。多地域カバレッジ(US/EU/Asia/LatAm)は、多言語トレーニングコーパスや文化的に多様なデータセットにとって必須条件です。 倫理的に調達されたことを示すドキュメント。RedditがAnthropicを提訴し、Stack Overflowがクロールごとの課金へ移行した後、MLチームには法務監査証跡のためにIPの出所を証明するドキュメントが必要です。ISO 27001 / SOC 2準拠は、調達要件としてますます求められています。 有効期限なしのPAYG。MLデータ収集はスパイクが大きいものです。データセットのバージョン更新サイクル、評価データの更新、業界別コーパスの構築などが発生します。サブスクリプションへのロックインは、稼働のない月に予算を消耗します。 レコード単位のマネージドスクレイパーAPI。Cloudflare/Akamai向けにカスタムパーサーを構築・保守したくないチームにとって、レコード単位課金のマネージドAPI(Bright Data、Oxylabs)は、ボット対策の問題をプロキシベンダー側へ移します。社内にパーサーチームがある場合は生のプロキシを選び、プロダクト/リサーチチームの場合はマネージドAPIを選びましょう。
クイック比較:ML・AIトレーニングデータ向けの最適なプロキシ一覧
| プロバイダー | 最適な用途 | 住宅プロキシ価格 | プール | 地域指定 | 注目ポイント |
|---|---|---|---|---|---|
| DataImpulse | 最高のコストパフォーマンス、自社MLパイプライン | $1/GB PAYG | 90M+ 住宅プロキシ、195+ か国 | 国は無料;州/市/ZIP/ASN は2×レート | 倫理的に調達;トラフィックは無期限 |
| Bright Data | AI向けマネージド Scraper APIs | ~$4/GB(50%プロモ);通常 $8/GB | 400M+ 住宅プロキシ | 国/市/ZIP/ASN は無料 | 専用 Reddit / Stack Overflow / ニュース Scraper APIs |
| Oxylabs | SLAレベルのエンタープライズMLプログラム | $6/GB から | 175M+ 住宅プロキシ | 国/州/市/ZIP/ASN/座標 | Web Scraper API;99.95% 成功率 |
| Decodo | ミッドマーケット、多言語コーパス | $3.75/GB スターター、$8.50/GB PAYG | 115M+ 住宅プロキシ | 国/市/ZIP/ASN 込み | 多言語スイープ向けに195+ ロケーション |
| IPRoyal | 長時間稼働するトレーニングパイプライン | $7.35/GB から | 32M+ 住宅プロキシ | 国/地域/市/ISP | 最大7日間のスティッキー |
| SOAX | 複数プロキシタイプの併用 | $3.60/GB スターター | 155M+ 住宅、33M+ モバイル、2.6M+ ISP | 国/地域/市/ISP/ASN | 統合クレジット;アプリベースAI向けのモバイルカバレッジ |
| Webshare | 低コストな Common Crawl 補完 | $3.50/月 から 住宅;$2.99/月 DC | 80M+ 住宅プロキシ(サブ) | 国、プランにより市 | 防御の低いAIソース向けの予算重視の選択肢 |
| NetNut | クリーンなトレーニングデータ向けISP住宅プロキシ | $3.53/GB から | ISPグレード住宅プロキシ | 国(上位プランでは市) | 一般消費者向けISP IP(DCよりノイズが少ない) |

MLトレーニングデータ収集にはどのプロキシタイプを使うべきか?
MLトレーニングデータ収集は、単発のスクレイピング作業とは異なる挙動を示します。これは、ボリュームが大きく(一般的な価格追跡ジョブの10× to 1000×)、鮮度要件が緩く(トレーニング実行ごとにデータを一度取り込む)、法務監査の証跡がより重要になるためです(フェアユース文書化のためのIP来歴)。プロキシタイプは、成功率と監査上の立場を左右します。
レジデンシャルプロキシ
レジデンシャルプロキシは、ほぼすべての本格的なMLトレーニングデータ収集における適切なデフォルトです。対象には、Reddit、Stack Overflow、GitHub Codespaces、ニュースアグリゲーター(NYT、WSJ、FT、Atlantic、Politico)、Wikipediaミラーと言語版、学術出版社(Cambridge、Springer、JSTOR public-domain)、MediumとSubstackニュースレター、ブログエコシステム、業界特化コンテンツ(CourtListenerのような法務データベース、medRxivのような医療プレプリントサーバー、SEC EDGAR public layerのような金融提出書類)、フォーラムやディスカッションサイト、そして低トラフィックの専門サイトのロングテールが含まれます。実際の消費者ISP IPはボット防御から通常の読者として認識され、フレッシュなグローバルレジデンシャルプロキシプールは、データセンター帯域が数百リクエストでフラグされるような場面でも、Cloudflareのボット管理レイヤーを日常的に通過します。
ISP / Static レジデンシャルプロキシ
ISPプロキシ(静的レジデンシャル)は、セッション継続性や永続的なIDが必要なMLワークフローに適しています。たとえば、ログイン済みのReddit / Pushshift API利用者、Stack Exchange APIのクォータアカウント、GitHub認証済みクロール、有料パブリッシャーアカウント(Bloomberg Terminalフィード、FTサブスクリプション)、ニュースアーカイブやフォーラム履歴の長時間にわたるページネーション付きアーカイブクロールなどです。ISP IPは、静的ホスティングの安定性を備えたISP割り当ての消費者向けアドレス上にあり、レジデンシャルプロキシの信頼性と固定アドレスの予測可能性を両立します。Decodo、IPRoyal、Bright Data、NetNutはいずれもISP製品ラインを提供しています。
モバイルプロキシ
モバイルプロキシは実際のキャリアネットワーク(Verizon、T-Mobile、AT&T、Vivo、Vodafone、Jioなど)を経由し、MLトレーニングデータ収集では3つのケースで価値を発揮します。(1) モバイルファーストのソース(法的にアクセス可能なInstagram、TikTok、Discord公開チャンネルのようなモバイルアプリ系フォーラム)で、モバイルIPが自然なアクセス元となる場合。(2) アプリAPIエンドポイントで、非モバイルIPに対してより厳しく制限する場合(Snapchat public、一部のモバイル版サイトAPI)。(3) 最も厳しいアンチボットソース(Redditのモバイル防御、Twitter/X)で、ローテーションモバイルIPが最後に残る未ブロック経路となる場合です。モバイルプロキシはGBあたり最も高価な選択肢のため、モバイル文脈が本当に重要なジョブに限定して使うべきです。
データセンタープロキシ
データセンタープロキシは、MLトレーニングデータ収集において狭いながらも実在する役割があります。それは、防御の弱い公開ソースの大規模クロールです。Common Crawlの生アクセス(これは公開CDNです)、公開政府データセット(data.gov、EU Open Data Portal、data.gov.in)、オープンな学術リポジトリ(arXiv、PubMed Central)、v3 API経由のGitHub公開リポジトリ、オープンなWikipediaダンプ、Project Gutenberg、Hugging Faceデータセットミラーなどが該当します。Reddit、Stack Overflow、ニュースサイト、または本格的なアンチボットを備えたソースにデータセンタープロキシに頼るべきではありません。これらは数百リクエスト以内にデータセンター帯域をフラグします。データセンタープロキシはMLスタックの低防御レイヤーに限定し、ターゲットがチャレンジを開始したらすぐにレジデンシャルプロキシまたはISPプロキシへ切り替えてください。
MLトレーニングデータにおけるローテーションとスティッキーセッション
MLデータ収集の原則は、広範囲には積極的にローテーションし、ページネーション文脈でのみ固定することです。ローテーション型レジデンシャルプロキシは、広範なCommon Crawl補完、Redditのsubreddit単位の取得、Stack Overflowのタグ単位の取得、ニュースサイトの全アーカイブスイープ、スレッド別のフォーラム履歴クロールに対応します。スティッキーセッションは、より深いフローに対応します。たとえば、同じフィンガープリントで50+ページにわたり「次のページ」リンクをたどる必要があるページネーション付きニュースアーカイブ、Stack Exchangeのスレッド型ディスカッション、複数ページにわたるRedditスレッド展開、サーバー側状態がIP継続性を必要とするあらゆるフローです。ほとんどの本番MLスタックでは、ページネーションの例外的なケース向けに90% ローテーション型90% + スティッキー10%をデフォルトとしています。
ML・AIトレーニングデータに最適なプロキシ。完全レビュー
以下の選定は、MLトレーニングデータ収集における価値に基づいてランク付けしています。評価軸は、プールの規模、地域カバレッジ、アンチボット成功率、倫理的に調達されたことを示すドキュメント、スティッキーセッションの長さ、取得成功レコードあたりの価格のバランスです。DataImpulseはコストパフォーマンスで先行し、その他はそれぞれ特定の領域で強みを発揮します。
1. DataImpulse
DataImpulseは、自社でトレーニングデータ用スクレイパーを運用する社内MLチームにとって、最もコストパフォーマンスに優れた選択肢です。Redditの補完、Stack Overflowコーパスの構築、ニュースアーカイブの収集、ブログ/Medium/Substackのクロール、195+ロケールにわたる多言語Wikipediaミラーリング、GitHub周辺のコードドキュメントサイト、そして分野別コーパスの構築(法律、医療、金融)。レジデンシャルは$1/GBから、従量課金制で、トラフィックは無期限。エンタープライズ向けAIデータスクレイパーが請求する料金のほんの一部であり、MLデータ収集がデータセットのバージョン更新サイクル前後に100GBから複数TB規模で急増する場合に重要です。プールは195か国にまたがる倫理的に調達された90M+ IP。地域IPの真正性が、データがブラジルポルトガル語として読めるか、英語から翻訳されたptとして読めるかを左右する多言語トレーニングコーパスにおいて意味があります。国ターゲティングは含まれており、州/都市/ZIP/ASNは有料アドオン(GB単価の2×)として利用でき、地域ニュースのトレーニングデータセットや文化固有のコーパスに有用です。HTTP、HTTPS、SOCKS5、ローテーションおよびスティッキーセッション、完全なAPIアクセス、標準的なスクレイピングスタック(Scrapy、Selenium、Playwright)をサポートしています。最も厳しいアンチボットAIソース向けにはモバイルが$2/GBで利用でき、公開データ層(Common Crawlミラー、オープン政府データ、arXiv、公開API)向けにはデータセンターが$0.50/GBで利用できます。
本格的なMLデータ収集の標準的な選択肢になる理由は、倫理的な調達ドキュメントと組み合わされた価格対プール深度の比率です。$1/GBなら、継続的な多言語Web補完を$1K/TB未満で実行でき、PAYGモデルにより、新しいトレーニングデータソースの実験でサブスクリプションに縛られることもありません。倫理的に調達された90Mプールは、Bartz/Kadrey以降の法務監査証跡でますます求められるIP来歴ドキュメントを提供します。サポートは24/7の有人対応、公開成功率は99.51%、G2は4.8/5です。ここには専用のAIデータエンドポイントはありません。DataImpulseはプロキシインフラをシンプルに提供し、MLチームがその上にスクレイパーレイヤーを構築できるようにしています。最上位のアンチボットAIソースには、TLSフィンガープリント対応クライアント(curl_cffi、undetected-chromedriver、Playwright + stealth)と組み合わせて使用します。
クイックスペック。タイプ: レジデンシャル、モバイル、データセンター · プール: 90M+レジデンシャル、195か国、倫理的に調達 · ローテーション: ローテーション + スティッキー · Geo: 国(州/都市/ZIP/ASNは2×レートの有料アドオン) · 価格: $1/GB res、$0.50/GB DC、$2/GB mobile · 公開成功率: 99.51% · 評価: G2 4.8。
最適な用途: エンタープライズ契約なしで、低価格の従量課金と監査で説明可能なIP調達を求める社内ML/AIチーム。
2. Bright Data
Bright Dataは、ML学習データをマネージド製品として利用したい場合のエンタープライズ向けの選択肢です。未加工のレジデンシャルプロキシは従量課金で$8/GB(現在は50%プロモーションにより約$4/GBに割引中。$1,999/moの大容量ティアでは、さらに低い$2.50/GBのレートが利用可能)で、400M+の月間IPプールと無料の都市/ZIP/ASNターゲティングを備えています。さらにBright Dataは、PAYGで1,000レコードあたり$1.50($499プランでは約$1.30/1K)のReddit、Stack Overflow、主要ニュースサイト、ソーシャルプラットフォーム、検索エンジンSERP向けの専用Scraper APIsを提供しています。$1.50/1K件の結果で利用できるWeb Unlockerは、任意のAI関連ソースを汎用的に処理します。Cloudflareで保護されたブログ、Akamai配下のニュースアーカイブ、PerimeterXで防御されたフォーラムに向けるだけで、レンダリング済みHTMLを返します。ISO 27001、SOC 2 Type II、プライバシー法準拠(GDPR/CCPA/LGPDに準拠)の文書化、監査対応可能なドキュメントにより、ほとんどのエンタープライズ調達要件とMLの法的リスクレビューをクリアできます。パブリッシャー側のレート制限やDOM変更に対応するパーサーを維持するよりも、マネージドなRedditやNYTエンドポイントを利用したい場合に適した選択肢です。ただし、価格体系と購入プロセスはエンタープライズ向けです。
主な仕様。種類: レジデンシャル、DC、ISP、モバイル + Reddit/Stack-Overflow/news/social専用Scraper APIs + Web Unlocker · プール: 400M+の月間レジデンシャル · ローテーション: ローテーティング、スティッキー、専用 · 地域: 国/都市/ZIP/ASNが無料 · 価格: レジデンシャル約$4/GB(プロモーション); 通常$8/GB($1,999/moの大容量ティアでは、さらに低い$2.50/GB); Scraper APIsはPAYGで$1.50/1Kレコードから($499プランでは約$1.30/1K); サブスクリプションは$499/monthから · コンプライアンス: ISO 27001、SOC 2 Type II。
最適な用途: Reddit/SO/news向けのマネージドScraper APIsと、監査対応可能なコンプライアンスおよびSLA管理を求めるエンタープライズのML/AIデータチーム。
3. Oxylabs
Oxylabsは、エンタープライズ領域の最上位でBright Dataに並び、MLトレーニング向けの広範なカバレッジを提供します。レジデンシャルはエントリープランでおよそ$6/GBから始まり、195カ国にわたる175M+のプールと、市区町村、州、ZIP、ASN、地理座標ターゲティングを含む強力な地域カバレッジを備えています(地域特化型のトレーニングコーパスには不可欠です)。Web Scraper API(エントリーは$49/month)は、Reddit、ニュースサイト、SERPなどAI関連ソース全体で、JavaScriptレンダリング、アンチボット回避、構造化データ抽出を処理します。セッションは柔軟で、同時接続数は無制限です(データセット収集スプリント中に1000+の同時スクレイパーへファンアウトするMLパイプラインで重要です)。また、Oxylabsはレジデンシャルの成功率として99.95%を公表しています。エントリー価格よりも信頼性、SLA水準のサポート、ISO 27001 / SOC 2準拠、調達部門向けのドキュメントが重要な場合、特にトレーニングデータの出所に関する法的リスクレビューのために調達資料が必要なエンタープライズMLプログラムでは、Oxylabsを選ぶとよいでしょう。
主な仕様。種類: レジデンシャル、DC、ISP、モバイル + Web Scraper API · プール: 175M+レジデンシャル、195カ国 · ローテーション: 柔軟、スティッキー、無制限の同時接続 · 地域: 国/州/市区町村/ZIP/座標/ASN · 価格: レジデンシャルは$6/GBから、Web Scraper APIは$49/monthから · 公表成功率: 99.95% · コンプライアンス: ISO 27001、SOC 2。
最適な用途: ISO 27001 / SOC 2準拠と同時ファンアウト対応を備えた、SLA水準のマネージドスクレイピングを求めるエンタープライズMLプログラム。
4. Decodo
Decodo(旧Smartproxy)は、MLトレーニングデータ用途、とりわけ多言語コーパスにおけるミッドマーケット向けの最適解です。レジデンシャルプロキシは、公開料金ページでは3 GBスタータープランで$3.75/GBから、PAYGでは$8.50/GBから利用でき、1,000 GBティアでは約$2/GBまで下がります。国、都市、ZIP、ASNターゲティングが含まれており、195+ロケーションにまたがる115M+ IPを利用できます。これは、本物の地域IPを必要とする多言語データセット(Wikipediaの言語版、地域ニュースアーカイブ、国別フォーラム)を構築するMLチームにとって重要です。静的レジデンシャル/ISPは$0.27/IPからで、Reddit Pushshift風アカウント、Stack Exchange APIクォータアカウント、数週間にわたるCommon Crawl補完実行のような静的レジデンシャルワークフロー向けとして、最も競争力のあるISP料金の一つです。Web Scraping APIには主要コンテンツソース向けテンプレートが含まれており、最大24時間のスティッキーセッションに対応しています。
クイックスペック。種類: residential、DC、ISP、mobile + Web Scraping API · プール: 115M+ residential、195+か国 · ローテーション: リクエストごと、最大24hのスティッキー · 地域: 国/都市/ZIP/ASNを含む · 価格: $3.75/GBスターター、$8.50/GB PAYG、1TB+で$2/GB、静的レジデンシャル/ISPは$0.27/IPから · 公開成功率: 99.86%。
最適な用途: 多言語トレーニングコーパスを構築する、または長期の静的レジデンシャルMLアカウントを運用するミッドマーケットMLチーム。
5. IPRoyal
IPRoyal は、長時間稼働する ML トレーニングパイプラインに適しているため、このリストに入っています。複数日にわたる Common Crawl 補完スイープ、複数ページに分かれたニュースアーカイブのクロール、Reddit アカウントに紐づく継続的なスクレイピング、数日にわたるセッション継続性が重要な長時間のフォーラム履歴収集などです。住宅用 PAYG はエントリー価格で $7.35/GB(大容量ではより安価)から利用でき、195+ か国にまたがる 32M+ のプールと、国、地域、都市、ISP ターゲティングに対応しています。最大の差別化要素は、最長 7 days のスティッキーセッションで、このリストでは最長です。セッションのローテーションによってページ分割されたサーバー状態が崩れる複数日にわたる ML データ収集スプリント、セッション継続性が必須となる Reddit/SO の API キー紐づきアカウント、長時間稼働するトレーニングデータ構築パイプラインに特に有用です。リクエスト単位の料金で利用できる ISP 製品ラインと Web Unblocker(CAPTCHA + アンチボット回避)もあります。
主な仕様。タイプ: 住宅用、ISP、モバイル、DC + Web Unblocker · プール: 32M+ 住宅用、195+ か国 · ローテーション: ローテーション、最長 7 days のスティッキー · 地域指定: 国/地域/都市/ISP · 価格: 住宅用 PAYG は $7.35/GB から。
最適な用途: ページ分割されたアーカイブ全体でスティッキーセッションの継続性を必要とする、複数日にわたる ML データ収集パイプライン。
6. SOAX
SOAXは、MLパイプラインで複数のプロキシタイプを使い分ける必要がある場合の有力な選択肢です。住宅プロキシはStarterプランで$3.60/GBから利用でき(25 GB込み)、統合クレジットモデルにより、同じ予算を住宅、モバイル、ISP、データセンター、またはWeb Data APIに充てられます。プールはミッドティアの中でも大規模な部類で、住宅155M+、モバイル33M+、ISP 2.6M+を備え、国、地域、都市、ISP、ASNターゲティングに対応しています。すべてのプロキシタイプでスティッキーセッションがサポートされています。幅広いニュース/フォーラムのスクレイピングには住宅、最も難易度の高いソース(Redditモバイル、TikTok系プラットフォーム)にはモバイル、アカウントに紐づくAPI利用者(Reddit、Stack Exchange)にはISPを使うようなMLパイプラインを、共有クレジット付きの1つのサブスクリプションで運用できる点が便利です。
主な仕様。タイプ: 住宅、モバイル、ISP、DC + Web Data API · プール: 住宅155M+、モバイル33M+、ISP 2.6M+ · ローテーション: リクエストごとまたは間隔指定、Sticky対応 · Geo: 国/地域/都市/ISP/ASN · 価格: $3.60/GB Starter。
最適な用途: 1つのサブスクリプションで複数タイプの収集(住宅 + モバイル + ISP)を行うMLチーム。
7. Webshare
Webshareは、低防御のAIソースに対して低コストで大規模クロールを行うMLチームに適した選択肢です。Common Crawlミラーアクセス(公開CDN)、公開オープンデータリポジトリ(data.gov、EU Open Data Portal、arXiv、PubMed Central、GitHub public API、HuggingFaceデータセットミラー)、パブリックドメインのテキストアーカイブ(Project Gutenberg、Internet Archive)、そして本格的なアンチボット対策のない低トラフィックの専門サイトに対応します。プランは、100プロキシのデータセンターパッケージが$2.99/monthから、エントリー向けローテーション住宅用プランが$3.50/monthから始まり、上位ティアでは80M+の住宅用プロキシが利用可能です。さらに、サブスクリプションプランでは静的ISPプロキシも提供されています。Webshareの住宅用プロキシは、低防御のMLデータソースに最適です。ティア1のアンチボット対策(Reddit、NYT、Stack Overflow)には、上記のプロバイダーへのアップグレードを検討してください。
主な仕様。種類:住宅用、静的ISP、データセンター · プール:80M+ 住宅用(サブスクリプション);データセンターおよびISPも利用可能 · 地域:国、プラン依存の都市 · 価格:データセンター(100プロキシ)は$2.99/monthから;ローテーション住宅用は$3.50/monthから。
最適な用途:公開オープンデータおよび低防御のAIソースに対して、低コストで大規模クロールを行うMLチーム。
8. NetNut
NetNutは、MLトレーニングデータ向けのISPレジデンシャルの信頼性に重点を置いて、このリストを締めくくります。監査証跡において、攻撃的なローテーション型レジデンシャルプールよりも不自然に見えにくい、クリーンな消費者向けISPのIPを提供します。製品ラインは、ローテーション型とスティッキー型のオプションを備えたISPグレードのレジデンシャルIP(Comcast、Charter、Vodafone、BT、Deutsche Telekom、その他の消費者向けISPが割り当てたアドレス)を重視しています。ローテーション型レジデンシャルは現在、エントリープランでおよそ$3.53/GBから始まり、利用量に応じてスケールします。上位プランでは国および都市レベルのターゲティングを利用できます。NetNutは、監査上の防御可能性という観点から、消費者向けISPレジデンシャルネットワークの深さを特に求める場合に適しています。これらのIPは、トレーニングデータソースに対する後続の法的確認や監査精査において、通常の家庭用インターネットユーザーとして認識されます。
クイックスペック。種類:ISPレジデンシャル、レジデンシャル、モバイル · プール:主要ISPを深くカバーするISPグレードのレジデンシャル · ローテーション:ローテーション型、スティッキー型 · Geo:国(上位プランでは都市) · 価格:レジデンシャルは$3.53/GBから。
最適な用途: トレーニングデータ収集パイプラインの監査上の防御可能性を高めるために、消費者向けISPレジデンシャルIPを求めるMLチーム。
MLトレーニングデータ用プロキシのコストはどれくらいですか?
2026年の公表価格は3つの帯域に分かれます。$1–$3.75/GBの低価格/高コストパフォーマンス帯。DataImpulse、SOAX Starter、Decodoのエントリー、Webshareの住宅用サブスクリプション。は、ほとんどの社内MLトレーニングデータ収集をカバーします。$3.50–$7.35/GBのミッド/プレミアム帯。Bright Data、Oxylabs、IPRoyal、NetNut。は、エンタープライズ向けツール、SLAレベルの信頼性、監査に対応できるコンプライアンス体制を追加します。API価格およびISP価格。Bright DataのScraper APIsは$1.50/1K recordsのPAYG($499プランでは約$1.30/1K)、Oxylabs Web Scraper APIは$49/moから、Decodo Web Scraping APIは$19/moから、Decodo US ISPは$0.27/IP。は、GB単位ではなく、レコード単位、プラン単位、またはIP単位で構造化された成果を販売します。
MLトレーニングデータにおける本当のコストの論点は、「最も低い$/GBはいくらか」ではなく、「成功し、監査上も説明可能なトレーニングレコード1件あたりの最低コストはいくらか」です。社内スクレイパーがCloudflareやAkamaiのブロックによりリクエストの30–50%で失敗する場合、$1.30–$1.50/1K recordsのマネージドスクレイパーAPIは$1/GBの住宅用プロキシを上回ることがあります。逆に、TLSフィンガープリントを考慮したクライアントと、ページ分割されたアーカイブ向けのスティッキーセッションを組み合わせた$1/GBの住宅用プロキシは、社内パーサーが成熟した後のマルチTB規模では、レコード単位課金のAPIを日常的に上回ります。100GB-1TB/weekのML予算では、$/recordの観点で生の住宅用プロキシが有利です。一方、より小規模な研究や評価データのニーズでは、エンジニアリング時間の面でマネージドAPIが有利です。
ML & AIトレーニングデータ収集にプロキシを使用することは合法ですか?
MLトレーニングデータに関する法律は、米国著作権(Bartz/Kadrey後のフェアユース)、CFAA(hiQ v LinkedIn)、パブリッシャー契約(Reddit/SOライセンス)、州のプライバシー法(CCPA/CPRA + EU GDPR)、そして各国のAI/データ法(インドのDPDP、ブラジルのLGPD)の寄せ集めが交差する領域にあります。基本は次のとおりです。
- 公開Webデータでのトレーニングはフェアユース(米国)です。ただし例外があります。 Bartz v Anthropic(2025年6月23日、Alsup判事)は、トレーニング自体を「きわめて変革的」とし、17 USC §107に基づくフェアユースと判断しました。ただし、Anthropicの恒久ライブラリを構築するために約7M冊の海賊版書籍をダウンロードしたことはフェアユースではなく、別個かつ重要な例外とされました。Kadrey v Meta(2025年6月25日、Chhabria判事)は記録上Meta勝訴としましたが、この判断がAIトレーニング一般を広くフェアユースと認める根拠にはならないと明示的に警告しました。係属中のAuthors Guild v OpenAIおよび統合されたIn re: OpenAI Copyright Infringement Litigationの各事件が、その境界をさらに明確にしていくでしょう。公開 + 変革的 + 代替しない = フェアユース、ただし出所管理を徹底というのが実務上の枠組みです。
- 公開データのスクレイピングはCFAA上、原則として問題になりません。 第9巡回区控訴裁判所のhiQ Labs v LinkedIn(2022年)判決は、公開アクセス可能なWebデータのスクレイピングはComputer Fraud and Abuse Actに違反しないことを確立しました。Meta v Bright Data(2024年)は、公開データとログイン済みデータの区別によってこれを補強しました。公開データは問題ありませんが、ログインアカウントでのスクレイピングは契約違反リスクを生じさせます。
- ライセンス済みソースについては、パブリッシャー契約がフェアユースの抗弁に優先します。 Reddit、Stack Overflow、NYT、WSJ、および1,500+のRSLプロトコル署名者は、明示的なライセンス条件のもとでデータを配布しています。ライセンスなしにこれらのソースをトレーニング目的でスクレイピングすると、契約違反の請求につながります(Reddit v Anthropic 2025、Reddit v Perplexity 2025)。フェアユースの抗弁は契約違反を免責しません。
- 証拠開示が新たなリスク領域です。 NYT v OpenAI(2026年1月 SDNY判決)では、OpenAIは選別した一部ではなく、20M件すべてのChatGPTログの提出を命じられました。本番MLパイプラインでは、将来的な証拠開示を前提にすべきです。スクレイピングログ、robots.txt遵守記録、ライセンス文書、プロキシベンダーのIP出所証明を保持してください。
- 個人データには越境プライバシー法が適用されます。 GDPR(EU)、CCPA/CPRA(カリフォルニア)、LGPD(ブラジル)、DPDP Act 2023(インド、2027年まで段階施行)はいずれも、それらの法域の居住者の個人データを含むトレーニングデータセットを規制します。法的根拠なく個人データをスクレイピングすることは、フェアユースの抗弁とは独立して執行対象となります。可能な場合はトレーニングコーパスから個人データを削除し、監査用にその削除ステップを文書化してください。
実務的に整理すると、公開Webデータを用いた大規模MLトレーニングは、2026年時点ではBartz/Kadrey + hiQのもとで法的に抗弁の余地があるです。ただし、契約レイヤー(Reddit、SO、RSL署名者)と個人データレイヤー(GDPR/CCPA/LGPD/DPDP)は現実のリスクです。公開・非ライセンス・非個人データが最も低リスクの領域であり、ライセンス対象ソースのスクレイピングと個人データのスクレイピングが最も高リスクです。本番MLトレーニングパイプラインを拡大する前に、米国著作権およびテック取引に詳しい弁護士へ相談してください。これは法的助言ではありません。
DataImpulseでMLトレーニングデータ収集を始める方法
- アカウントを作成し、プロキシ構成を選択します。Reddit、Stack Overflow、ニュースアーカイブ、フォーラム履歴、ブログ/Substack/Mediumのスクレイピング、多言語Wikipediaミラー、業界別コーパス(法律/医療/金融)にはレジデンシャルプロキシ($1/GB)、エンリッチメント層(Common Crawlミラー、arXiv、PubMed、GitHub public API、data.gov、EU Open Data Portal、パブリックドメインアーカイブ)にはデータセンタープロキシ($0.50/GB)、ローテーションモバイルIPが最後にブロックされていない経路となる、最も厳しいアンチボットAIソースにはモバイルプロキシ($2/GB)を使用します。
- 資金を追加します。 従量課金制で、サブスクリプション不要、有効期限なしです。MLデータ収集は、データセットのバージョン更新サイクル、評価データの更新、業界別コーパス構築スプリントの前後に100GBから複数TB規模のスパイクで実行され、その後数週間アイドル状態になるため便利です。
- 監査証跡を計画します。 コーパスの地域バランスに合った国ターゲティング(多言語トレーニングならUS/EU/Asia/LatAm、地域別コーパスなら特定の国)を設定し、広範囲の収集にはローテーション、ページ分割されたアーカイブにはスティッキーを選択し、スクレイパーをプロキシエンドポイントに向けて実行します。すべてのスクレイピングについて、タイムスタンプ、ターゲットURL、プロキシセッションID、robots.txt尊重の結果をログに記録します。これがBartz/Kadrey後の監査防御レイヤーになります。
関連ワークフローの詳細については、当社のレジデンシャルプロキシ製品ページ、データセンタープロキシ製品ページ(Common Crawlおよびオープンデータ層向け)、Webスクレイピングに最適なプロキシのまとめ、SEOと順位追跡に最適なプロキシのまとめをご覧ください。
FAQ
AI学習データ収集にプロキシを使用することは合法ですか?
公開Webデータについては、はい。Bartz v Anthropic (June 23, 2025) と Kadrey v Meta (June 25, 2025) はいずれも、公開WebデータでAIを学習させることは「高度に変容的」であり、17 USC §107 に基づくフェアユースで保護されると判断しました。第9巡回区の hiQ v LinkedIn (2022) 判決は、CFAAに基づき基礎となるスクレイピングを保護しています。ただし、パブリッシャー契約(Reddit、Stack Overflow、RSL-protocol署名者)は、ライセンス済みソースについてフェアユースに優先します。Reddit は無許可スクレイピングを理由に Anthropic (June 2025) と Perplexity (October 2025) を提訴しました。個人データは、いずれの場合もGDPR/CCPA/LGPD/DPDPの対象になります。本番運用前に、米国著作権およびテック取引に詳しい弁護士に相談してください。これは法的助言ではありません。
本番環境のLLM学習パイプラインでは実際にどのようなプロキシが使われていますか?
本番MLチームは通常、階層型スタックを運用します。公開データ層(Common Crawl、arXiv、GitHub公開API、オープンリポジトリ)にはデータセンタープロキシ($0.50/GB)、Webスクレイピングの大部分(Reddit、Stack Overflow、ニュース、フォーラム、ブログ)にはレジデンシャルプロキシ($1–$3.75/GB)、最も厳しいアンチボット対策があるソース(Redditモバイル、ソーシャルプラットフォーム)にはモバイルプロキシ($2–$10/GB)、社内でのパース時間がレコード単価より高くつく場合にはマネージドScraper API($1.30–$1.50/1K records)を使用します。DataImpulse、Bright Data、Oxylabs はいずれも本番MLスタックで採用されています。
RedditによるAnthropicへの訴訟は、ML学習データ収集にどのような影響がありますか?
Reddit は、Claudeの学習にRedditコンテンツを無許可でスクレイピングしたとして、June 2025 に Anthropic を提訴し、October 2025 には同様の理由で Perplexity を提訴しました。Reddit-Google および Reddit-OpenAI のライセンス契約(それぞれ $60M/yr と $70M/yr)は、ライセンス済みRedditデータの価格下限を示しています。実務上の示唆として、MLパイプラインがRedditを大規模にスクレイピングする場合は、ライセンスを取得する(Reddit Data API)か、契約違反リスクを受け入れる必要があります。Common Crawl経由で偶発的なRedditコンテンツを含む、公開データのみのCC補完パイプラインは、実質的にリスクが低くなります。
Stack OverflowとStack Exchangeのスクレイピングはどうですか?
Stack Overflow + Cloudflare は February 2026 に従量課金型クロールを開始しました。ボットはゲートウェイで課金されます。Stack Exchange API にはレート制限があり、ToSでは一括再配布が禁止されています。ML学習データについて合法的な方法は、公開 Stack Exchange API のクォータを使用する(認証付き)、IPごとのレート制限を尊重する、または Stack Overflow のエンタープライズチームから一括アクセスのライセンスを取得することです。レジデンシャルプロキシによる回避は技術的には可能ですが、契約違反リスクを高めます。
多言語学習にはプロキシプールの国別多様性が必要ですか?
多言語学習コーパスには必要です。本当に多言語なデータセットを構築するMLチームには、その言語圏の真正なIPが必要です。US IPでスクレイピングした Wikipedia-de は、英語へのリダイレクトや英語形式のコンテンツを返すことがあります。r/Brasil からのRedditサブレディット取得では、閲覧者IPのジオに基づいて異なる固定投稿が表示されます。地域ニュースアーカイブは訪問者の国によってジオフェンスを設けています。DataImpulse、Decodo、Oxylabs、Bright Data はいずれも 195+ か国をカバーしています。SOAX と IPRoyal は、エントリープランでも国別カバレッジが強力です。
学習データ収集を監査に耐えられる形にするにはどうすればよいですか?
5つの実践事項があります。(1) 倫理的に調達されたプロキシプールを使用する(DataImpulse、Bright Data、Oxylabs はいずれもIP由来ドキュメントを公開しています)。(2) すべてのスクレイピングについて、タイムスタンプ、URL、プロキシセッションID、レスポンスコード、robots.txt遵守結果をログに記録する。(3) robots.txtが存在する場合は尊重する。(4) 学習コーパスから個人データを除去し、その除去ステップを文書化する。(5) ライセンス済みソース(Reddit、SO、NYT)についてはライセンス文書を維持するか、それらを除外して Common Crawl のスナップショットに依存する。NYT-v-OpenAI の January 2026 判決以降、将来的な証拠開示を前提にしてください。監査証跡はもはや任意ではありません。
Common Crawlは無料です。それでもプロキシに料金を払う理由は何ですか?
Common Crawl は毎月約 ~2B ページをカバーしますが、1–3 か月遅れで、高トラフィックの英語サイトに偏っています。MLチームがプロキシを使う理由は次のとおりです。(1) より新しいデータ(最新ニュース、最近のRedditスレッド、最近の論文)による補完。(2) CCの英語偏重を超えた多言語カバレッジ。(3) CCでサンプル不足になりがちな分野別コーパス(法律、医療、金融、科学)。(4) 特定ソースの完全性(例:完全なRedditアーカイブ vs CCのサンプル)。(5) 独自のプライバシーフィルターを適用するためにリアルタイムスクレイピングが必要な個人データ除去済みパイプライン。CCは基盤であり、プロキシは拡張レイヤーです。
ML向けモバイルプロキシ。どのような場合に重要ですか?
3つのケースがあります。(1) モバイルIPが自然な前提となるモバイルファーストのソース(Instagram、TikTok public-domain、モバイルアプリフォーラム)。(2) 非モバイルIPに対してより厳しく制限するアプリAPIエンドポイント(一部のモバイル版サイトAPI、プッシュ通知フィード)。(3) Cloudflare/Akamai/PerimeterX がレジデンシャルもブロックする最も厳しいアンチボットソース。モバイルキャリアIPが最後に残る未ブロック経路です。SOAX、IPRoyal、DataImpulse、Bright Data はいずれもモバイルプロキシを提供しています。モバイルは、モバイル文脈が本当に重要なジョブに限定してください。GB単価が高く、MLパイプラインがモバイルのプレミアム全体を必要とすることはまれです。
ML向け静的レジデンシャル / ISPプロキシ。いつ使いますか?
ISP/静的レジデンシャルは、数日にわたるセッション継続性が必要なMLワークフローで使用します。ページ分割されたアーカイブ文脈を保持するReddit Pushshift風アカウント、Stack Exchange APIクォータアカウント、有料パブリッシャーアカウント(Bloomberg、FT)、ローテーションによってサーバー側のページネーション状態が壊れる長期の複数日フォーラム履歴収集などです。Decodo(from $0.27/IP)、IPRoyal、NetNut、Bright Data、Webshare はいずれもISP製品ラインを販売しています。単発のMLデータ収集スプリントではローテーションレジデンシャルの方が安価です。永続的なアイデンティティには、ISPが唯一の選択肢です。
監査に耐えうるMLおよびAIトレーニングデータ収集を大規模に実行する準備はできていますか?DataImpulseから始めましょう。レジデンシャルは$1/GBから、データセンターは$0.50/GBから、モバイルは$2/GBから、従量課金制で、倫理的に調達された90M+ IPを195か国で利用可能、国ターゲティング込み(州/市/ZIP/ASNは有料アドオン)、トラフィックは無期限です。
