Skip to content
Intermediate / 4 min read

Comment configurer les proxies SOCKS5 IPRoyal sur Windows pour le scraping web

Un guide étape par étape pour configurer les proxies SOCKS5 d'IPRoyal sur Windows afin de réaliser du scraping web efficace et anonyme, couvrant la configuration des identifiants, la configuration du navigateur et l'intégration Python.

Windows SOCKS5 Scraping Web

Aperçu

Le scraping web nécessite souvent de faire tourner les adresses IP pour éviter les limites de débit et les blocages. Les proxies SOCKS5 offrent un moyen flexible de router le trafic au niveau de la socket, en prenant en charge TCP et UDP. IPRoyal propose des proxies résidentiels, datacenter et ISP avec prise en charge de SOCKS5, ainsi qu'un pool de plus de 32 millions d'IP et une facturation à l'usage ou mensuelle forfaitaire. Ce tutoriel vous montre comment configurer les proxies SOCKS5 IPRoyal sur Windows pour des tâches de scraping web. Nous aborderons l'obtention des identifiants, la configuration d'un navigateur et l'utilisation de Python avec la bibliothèque requests. Les étapes sont neutres vis-à-vis du fournisseur et peuvent être adaptées à d'autres prestataires.

Étapes

  1. Inscrivez-vous et obtenez les identifiants du proxy
    Créez un compte chez IPRoyal (ou votre fournisseur choisi). Rendez-vous dans le tableau de bord et localisez vos identifiants de proxy SOCKS5. Vous recevrez généralement :

    • Hôte du proxy (par ex., geo.iproyal.com ou une adresse IP)
    • Port (par ex., 12345)
    • Nom d'utilisateur et mot de passe
    • Éventuellement, une liste d'IP ou un point de terminaison rotatif.

    Remarque : IPRoyal prend en charge HTTP et SOCKS5 ; assurez-vous de sélectionner SOCKS5 lors de la génération des identifiants.

  2. Testez votre proxy avec une simple commande cURL
    Ouvrez l'Invite de commandes ou PowerShell et exécutez :

    curl -x socks5://username:password@host:port https://httpbin.org/ip
    

    Remplacez username, password, host et port par vos identifiants. Si cela fonctionne, la réponse affichera l'adresse IP du proxy.

  3. Configurez un navigateur web (Firefox) pour une utilisation manuelle du proxy

    • Ouvrez Firefox et allez dans about:preferences.
    • Faites défiler jusqu'en bas et cliquez sur « Paramètres... » sous Paramètres réseau.
    • Sélectionnez « Configuration manuelle du proxy ».
    • Dans le champ Hôte SOCKS, saisissez l'hôte et le port de votre proxy.
    • Choisissez « SOCKS v5 ».
    • Cochez « Proxy DNS lors de l'utilisation de SOCKS v5 » pour éviter les fuites DNS.
    • Si votre proxy nécessite une authentification, Firefox demandera le nom d'utilisateur et le mot de passe lors de la première utilisation. Vous pouvez aussi utiliser une extension comme FoxyProxy pour une gestion plus simple.
  4. Configurer Python pour le scraping avec SOCKS5
    Installez les bibliothèques requests et requests[socks] :

    pip install requests requests[socks]
    

    Utilisez le code suivant pour envoyer une requête via le proxy :

    import requests
    
    proxies = {
        'http': 'socks5://username:password@host:port',
        'https': 'socks5://username:password@host:port'
    }
    response = requests.get('https://httpbin.org/ip', proxies=proxies)
    print(response.text)
    

    Cela acheminera votre requête via le proxy SOCKS5.

  5. Implémentez la rotation des IP
    Pour le scraping à grande échelle, vous voudrez faire tourner les IP. IPRoyal peut fournir un point de terminaison rotatif ou une liste d'IP individuelles ; consultez votre tableau de bord. Avec un point de terminaison rotatif, chaque requête (ou session) peut utiliser une IP différente. Par exemple, en utilisant une session avec un proxy rotatif :

    import requests
    from itertools import cycle
    
    proxy_list = [
        'socks5://user:pass@host1:port1',
        'socks5://user:pass@host2:port2',
        # ...
    ]
    proxy_pool = cycle(proxy_list)
    
    for i in range(10):
        proxy = next(proxy_pool)
        try:
            response = requests.get('https://httpbin.org/ip', proxies={'http': proxy, 'https': proxy}, timeout=10)
            print(response.json())
        except:
            print("Proxy failed")
    

    Ajustez selon la méthode de rotation de votre fournisseur.

  6. Gérez les erreurs et respectez robots.txt
    Mettez toujours en place la gestion des erreurs, les nouvelles tentatives et les délais. Respectez le fichier robots.txt et les conditions d'utilisation du site cible. L'utilisation de proxies ne vous dispense pas de pratiques de scraping légales et éthiques.

  7. Surveillez et mettez à l'échelle
    À mesure que vos besoins de scraping augmentent, envisagez d'utiliser un gestionnaire de proxies ou un service de proxies rotatifs. IPRoyal propose des forfaits à l'usage et mensuels forfaitaires adaptés à différents volumes. Surveillez votre utilisation et vos taux de réussite pour optimiser.