Le scraping sérieux ne se fait pas depuis un laptop
Un script de collecte qui tourne sur votre PC portable s'arrête quand vous fermez le capot, partage votre IP personnelle avec vos cibles, et meurt à la première coupure Wi-Fi. Le scraping professionnel exige une machine allumée 24/7 avec une IP dédiée et stable : c'est la définition d'un VPS.
Le Titan est notre recommandation : 8 vCores Ryzen 9 à 5,7 GHz pour faire tourner plusieurs workers Playwright en parallèle, 16 GB de RAM parce que Chromium headless consomme 400 MB par onglet. Si votre pipeline est du pur HTTP (Scrapy, httpx), un Apex suffit largement.
L'IP dédiée : votre actif le plus précieux
Chez les hébergeurs mutualisés, vous héritez d'une IP partagée dont vous ne connaissez pas l'historique — parfois déjà blacklistée par Cloudflare. Ici, chaque VPS reçoit une IP IPv4 dédiée propre, et notre équipe abuse vérifie sa réputation avant attribution. Pour du scraping respectueux, une IP stable avec un reverse DNS configuré passe bien mieux qu'une rotation d'IP douteuses.
Le squelette d'un pipeline robuste
# docker-compose.yml minimal
services:
scraper:
build: .
restart: unless-stopped
environment:
- REDIS_URL=redis://redis:6379
redis:
image: redis:7
postgres:
image: postgres:16
volumes:
- pgdata:/var/lib/postgresql/dataArchitecture qui tient la route : file Redis pour les URLs à visiter, workers stateless qui dépilent, PostgreSQL pour les résultats, et un scheduler (cron ou APScheduler) qui alimente la file. Chaque worker dans son conteneur : un crash Chromium ne tue pas le pipeline.
Éthique et légalité : la section que les concurrents évitent
Le scraping de données publiques est légal dans la plupart des juridictions européennes, à trois conditions : respecter le robots.txt, ne pas contourner de mesures techniques de protection, et ne pas collecter de données personnelles au-delà du nécessaire (RGPD). Nos conditions d'utilisation l'exigent aussi : le scraping qui ignore les robots.txt ou qui sature un site cible entraîne la suspension du compte. Réglez votre DOWNLOAD_DELAY — Scrapy le fait nativement avec AutoThrottle.
Monitoring : sachez quand ça casse
Un scraper meurt en silence : la cible change son HTML, ajoute un captcha, ou vous rate-limite. Mettez en place des métriques (items collectés/heure) et une alerte quand le débit chute de 50 %. Notre article sur le monitoring de VPS couvre la stack Prometheus + Grafana qui tient sur le même Titan.