how to scrape twitter

Twitter, désormais X, est un flux continu d’opinions publiques, de tendances et de réactions en temps réel. Pour la recherche, la surveillance de marque et l’analyse de sentiment, ces données sont précieuses, mais la plateforme limite fortement l’accès automatisé. Voici comment collecter des données publiques de Twitter (X) de manière fiable en 2026.

DataImpulse est un fournisseur de proxies éthique proposant plus de 90 millions d’adresses IP résidentielles, mobiles et de centre de données dans 195 pays. Il utilise un modèle de paiement à l’usage à partir de 1 dollar par Go, avec un trafic sans expiration, et est utilisé pour le web scraping, la vérification publicitaire, la surveillance des prix, l’étude de marché et la gestion multi-comptes.

Points clés

  • Ce que vous allez apprendre : comment collecter des données publiques de Twitter (X) à grande échelle (texte du tweet, auteur, horodatage, compteurs d’engagement) sans être bloqué.
  • Meilleur type de proxy : les proxies résidentiels rotatifs, qui utilisent de véritables IP de particuliers et passent la détection.
  • Prix : à partir de 1 dollar par Go, paiement à l’usage, avec trafic sans expiration et sans abonnement.
  • Couverture : plus de 90 millions d’IP obtenues de manière éthique dans 195 pays.
  • Fiabilité : taux de réussite de 99,51%, noté 4,8 sur 5 sur G2.
  • Protocoles et ciblage : HTTP, HTTPS et SOCKS5, avec ciblage par pays inclus.

Pourquoi scraper Twitter (X) ?

Parce que ces données alimentent l’étude de marché, la surveillance et les décisions que l’on ne peut pas prendre à l’instinct.

  • Analyse du marché et de la concurrence : comprenez la demande, les prix et le positionnement.
  • Tendances et surveillance : suivez l’évolution des annonces, des prix ou de l’activité dans le temps.
  • Jeux de données de recherche : construisez des données adaptées exactement à vos besoins.

Pourquoi êtes-vous bloqué en scrapant Twitter (X) ?

Vous êtes bloqué parce que les schémas automatisés sont faciles à repérer. Les grandes plateformes surveillent les nombreuses requêtes venant d’une même IP, les empreintes de navigateur manquantes ou un rythme robotique, puis affichent des CAPTCHA ou bannissent l’adresse. La solution consiste à ressembler à de nombreux utilisateurs ordinaires plutôt qu’à une seule machine, ce qui repose sur trois éléments : des IP de confiance qui tournent, des en-têtes réalistes et un rythme humain.

Quelles données pouvez-vous collecter sur Twitter (X) ?

Vous pouvez collecter les champs publics affichés sur la page : texte du tweet, auteur, horodatage, compteurs d’engagement. Limitez-vous à ce qui est visible publiquement, évitez tout ce qui se trouve derrière une connexion ou un paywall, et ne collectez pas de données personnelles sans base légale. Structurez les champs dans un schéma propre au fur et à mesure, afin que les données soient exploitables pour l’analyse plutôt qu’un tas de HTML brut.

Avez-vous besoin d’un navigateur headless pour Twitter (X) ?

Seulement si le contenu se charge en JavaScript. Pour les pages statiques, une bibliothèque de requêtes avec des proxies et de bons en-têtes est plus rapide et plus légère. Si Twitter (X) affiche les données côté client, un navigateur headless comme Playwright ou Puppeteer, pointé vers votre proxy, chargera la page complète avant que vous ne l’analysiez. Commencez par de simples requêtes et passez à un navigateur headless seulement si des données manquent.

Quel type de proxy utiliser pour Twitter (X) ?

Les proxies résidentiels sont le choix fiable pour Twitter (X), car ils utilisent de véritables IP de particuliers qui portent des signaux de confiance. Les IP de centre de données sont moins chères mais rapidement détectées sur des cibles protégées, et les IP mobiles sont mieux réservées aux flux applicatifs les plus difficiles. Voici comment ces types se comparent.

Type de proxy Idéal pour Risque de détection Prix de départ
Résidentiel cibles protégées, Twitter (X) faible 1 dollar par Go
Mobile les flux applicatifs les plus difficiles le plus faible 2 dollars par Go
Centre de données cibles légères et non protégées élevé 0,50 dollar par Go

Comment scraper Twitter (X) étape par étape ?

Vous collectez les URL cibles, acheminez les requêtes via un proxy résidentiel, analysez les champs et paginez avec précaution.

  • 1. Collectez les URL cibles. Rassemblez les pages ou annonces que vous voulez couvrir.
  • 2. Configurez un proxy résidentiel. Ajoutez votre hôte, port et identifiants à votre client HTTP.
  • 3. Récupérez et analysez. Interrogez chaque page via le proxy et extrayez le texte du tweet, l’auteur, l’horodatage et les compteurs d’engagement.
  • 4. Paginez avec précaution. Suivez les liens de page suivante, en faisant tourner les IP et en ajoutant des délais.
  • 5. Stockez et nettoyez. Enregistrez dans un CSV ou une base de données et normalisez les champs.

Twitter (X) repose fortement sur JavaScript et limite le débit de manière agressive, alors dosez votre rythme avec soin et utilisez un navigateur headless pour le contenu dynamique.

À quoi ressemble un scraper Python minimal ?

C’est une courte boucle de requête et d’analyse qui envoie le trafic via votre proxy.

import requests
from bs4 import BeautifulSoup

proxies = {
  "http": "http://login:[email protected]:823",
  "https": "http://login:[email protected]:823",
}
headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) Chrome/126 Safari/537.36"}

r = requests.get("TARGET_URL", headers=headers, proxies=proxies, timeout=30)
soup = BeautifulSoup(r.text, "html.parser")
# select the elements that hold tweet text, author, timestamp, engagement counts and extract them

Remplacez par votre identifiant et mot de passe DataImpulse, faites tourner la session par cible, et ajoutez pagination et délais pour la production.

Sessions rotatives ou persistantes pour Twitter (X) ?

Les sessions rotatives vous donnent une IP différente à chaque requête, ce qui est idéal pour répartir le volume sur de nombreuses pages. Les sessions persistantes conservent une IP pendant une durée définie, ce qui est utile pour les flux multi-étapes qui doivent ressembler à un seul utilisateur. DataImpulse prend en charge les deux, avec des sessions persistantes allant jusqu’à 120 minutes, afin que vous puissiez adapter la session à la tâche.

Erreurs à éviter en scrapant Twitter (X)

  • Utiliser des IP de centre de données sur des cibles protégées : elles sont détectées rapidement. Utilisez des IP résidentielles pour Twitter (X).
  • Aucun délai entre les requêtes : un rythme robotique est le signal le plus clair d’un bot. Randomisez votre timing.
  • Ignorer la localisation de l’IP : un pays non concordant vous donne le mauvais contenu, ou un blocage.
  • Listes de proxies gratuits : lents, de courte durée et souvent peu sûrs. Un fournisseur de confiance se rentabilise de lui-même.

Comment tester votre configuration avant de passer à l’échelle ?

Commencez petit. Effectuez quelques requêtes via le proxy, confirmez que l’IP de sortie et le pays sont ceux attendus, et vérifiez que la cible renvoie le contenu dont vous avez besoin. Surveillez votre taux de réussite et votre temps de réponse, puis augmentez le volume progressivement tout en surveillant les blocages ou les CAPTCHA. La facturation à l’usage, comme celle de DataImpulse, vous permet de tester avec un petit budget avant de passer à l’échelle, et un essai à 5 dollars laisse de la marge pour le vérifier.

Comment rester en conformité ?

Collectez uniquement des données publiques, respectez les limites de débit et utilisez des proxies obtenus de manière éthique. DataImpulse obtient ses IP résidentielles auprès d’utilisateurs qui y consentent et sont indemnisés, respecte le GDPR et propose un accord de traitement des données. Consultez notre page sur les proxies résidentiels et notre guide sur le scraping sans se faire bloquer.

Questions fréquentes

Est-il légal de scraper Twitter (X) ?

Collecter des données publiquement disponibles est généralement autorisé, mais respectez les conditions d’utilisation de Twitter (X), évitez les données personnelles sans base légale, et suivez les lois qui s’appliquent à vous. Ceci ne constitue pas un conseil juridique.

Pourquoi suis-je bloqué en scrapant Twitter (X) ?

Parce que trop de requêtes depuis une même IP, des en-têtes manquants ou un rythme robotique semblent automatisés. Des proxies résidentiels rotatifs associés à des en-têtes réalistes et des délais maintiennent un taux de réussite élevé.

Quels proxies sont les meilleurs pour scraper Twitter (X) ?

Les proxies résidentiels rotatifs, car ils utilisent de véritables IP en lesquelles la plateforme a confiance. DataImpulse propose plus de 90 millions d’IP résidentielles obtenues de manière éthique à partir de 1 dollar par Go.

Ai-je besoin d’un navigateur headless pour Twitter (X) ?

Seulement pour les pages fortement dépendantes de JavaScript. Pour le contenu statique, une bibliothèque de requêtes avec des proxies et de bons en-têtes est plus rapide.

Combien coûte le scraping de Twitter (X) ?

DataImpulse commence à 1 dollar par Go, avec paiement à l’usage et trafic sans expiration, afin que vous puissiez exécuter des tâches importantes sans limite d’abonnement.

Quand DataImpulse n’est-il pas le bon choix ?

Si vous avez besoin de proxies ISP statiques, d’une API de scraping entièrement gérée, ou d’un accès à des sites bancaires et gouvernementaux, DataImpulse n’est pas le bon outil. Il se concentre sur les proxies résidentiels, mobiles et de centre de données rotatifs pour collecter des données publiques et accéder à du contenu.

Collectez les données de Twitter (X) de manière fiable

Un scraping fiable commence par des IP en lesquelles la plateforme a confiance. Commencez avec DataImpulse à partir de 1 dollar par Go.


Share article: