L’essentiel à retenir
Il existe aujourd’hui des navigateurs conçus pour que les agents automatiques ne soient pas détectés. camofox-browser en est un exemple public : un fork de Firefox avec des mécanismes anti-détection, une API destinée aux agents, et l’annonce explicite de contourner Cloudflare et les protections anti-scraping. Onze mille étoiles sur GitHub, une installation en une commande.
La difficulté n’est donc plus technique. Elle est que la facilité d’installation ne dit rien du risque encouru, et qu’aucune documentation d’outil ne vous le dira.
Trois repères, tirés de décisions et de textes existants, valent mieux qu’une intuition :
La donnée publique n’est pas la donnée libre. La justice américaine a jugé que collecter des pages accessibles à tous ne relevait pas de la loi pénale sur la fraude informatique — puis a condamné la même entreprise à 500 000 dollars pour rupture de contrat, sur la base des conditions d’utilisation du site.
L’opt-out européen est lisible par machine. La directive sur le droit d’auteur dans le marché unique numérique autorise la fouille de textes et de données, sauf réserve exprimée par le titulaire de droits « par des procédés lisibles par machine ». Autrement dit : le robots.txt et les balises d’un site ne sont pas un décor, ils expriment une réserve juridique.
Et l’intention compte. La même collecte peut être licite pour de la recherche et contestable pour un usage commercial.
Le problème que ça résout
Une PME qui veut suivre son marché a des besoins parfaitement légitimes : savoir ce que publient ses concurrents, suivre des appels d’offres, agréger des annonces sectorielles, surveiller des évolutions réglementaires.
Jusqu’ici, faire cela à la main coûtait du temps mais ne posait aucune question. Personne ne se demande s’il a le droit de lire un site.
L’automatisation change la nature de l’acte sans que personne ne s’en aperçoive. Un humain qui consulte vingt pages par jour est un visiteur. Un agent qui en consulte vingt mille est autre chose : il pèse sur l’infrastructure, il constitue une base de données, et il le fait souvent malgré des mesures techniques déployées pour l’en empêcher.
C’est ce dernier point qui déplace le curseur. Tant que l’agent respecte les signaux du site, il reste dans la logique d’une visite. Dès qu’un outil est installé pour ne pas être reconnu, l’entreprise franchit une ligne qu’elle n’a généralement pas décidé de franchir — parce que la décision a été prise par le développeur qui cherchait juste à faire marcher son script.
Le vrai problème n’est donc pas juridique au départ. Il est organisationnel : un choix qui engage l’entreprise se prend au niveau d’un npm install.
Ce que c’est concrètement
Les outils de cette catégorie font trois choses.
Ils masquent les signaux de l’automatisation. Un navigateur piloté par un programme se trahit par des dizaines de détails — propriétés JavaScript, empreinte de rendu, régularité des mouvements. Ces outils les corrigent, parfois jusqu’au niveau du moteur.
Ils exposent une interface pensée pour un agent. Plutôt que des captures d’écran à interpréter, ils fournissent une représentation structurée de la page avec des identifiants d’éléments stables, ce qui rend l’automatisation bien plus fiable.
Ils gèrent des sessions authentifiées. L’import de cookies exportés depuis votre propre navigateur permet à l’agent d’agir sur des sites où vous êtes déjà connecté.
Ce troisième point mérite une attention particulière, parce qu’il est celui qui déplace le plus le risque. Collecter une page publique est une chose. Faire agir un agent avec votre session authentifiée en est une autre : vous n’êtes plus dans la consultation, vous êtes dans l’usage d’un compte, soumis aux conditions que vous avez acceptées en le créant.
Comment s’en servir
Distinguer les trois zones avant d’écrire une ligne de code
Zone 1 : contenu public, sans mesure technique de protection, sans réserve déclarée. Risque faible.
Zone 2 : contenu public mais protégé par une mesure anti-robot, ou couvert par une réserve dans le robots.txt. Le contournement est un acte délibéré.
Zone 3 : contenu derrière une authentification. Vous êtes lié par les conditions d’utilisation que vous avez acceptées.
La plupart des projets de veille qui tournent mal ont commencé en zone 1 et ont glissé en zone 3 sans que personne ne l’écrive nulle part.
Lire le robots.txt comme un document juridique
Depuis la directive européenne, une réserve exprimée de façon lisible par machine a une valeur. Un Disallow n’est plus une politesse entre techniciens : c’est l’expression d’un droit. Le lire avant de collecter coûte trente secondes.
Relire les conditions d’utilisation des sites concernés
C’est fastidieux et c’est précisément ce que personne ne fait. Or c’est sur ce terrain — le contrat, pas le pénal — que la plupart des litiges de collecte se tranchent réellement.
Vérifier la présence de données personnelles
Un nom, un email professionnel, un profil : c’est de la donnée personnelle, et le RGPD s’applique indépendamment du fait que la page soit publique. Il faut une base légale, et les personnes concernées conservent leurs droits.
Documenter la décision, pas seulement le code
Écrivez noir sur blanc quelles sources sont collectées, à quelle fréquence, pour quel usage, et qui a validé. Le jour où la question se pose, l’absence de trace est le vrai problème.
Mesurer votre propre empreinte
Une collecte raisonnable respecte des délais entre requêtes et s’identifie. Un agent qui martèle un serveur peut causer un dommage réel, et c’est de là que viennent les plaintes.
Source : https://github.com/jo-inc/camofox-browser
Ce que ça coûte vraiment
L’outil est gratuit. Ce qui coûte, c’est ce qui vient après.
Le premier poste est l’analyse préalable. Déterminer dans quelle zone se situe chaque source demande du temps, et souvent l’avis de quelqu’un qui connaît le sujet. C’est un coût réel, largement inférieur à celui d’un litige.
Le deuxième est la maintenance. Les protections anti-robot évoluent, les outils de contournement aussi. Une veille bâtie sur le contournement demande un entretien permanent — et chaque mise à jour rejoue la même question.
Le troisième est le risque assumé. Il ne s’annule pas, il se gère : sélectionner ses sources, respecter les réserves déclarées, éviter la zone 3 sauf décision explicite.
En contrepartie, une veille automatisée bien cadrée apporte un avantage réel. La plupart des besoins d’une PME se satisfont d’ailleurs très bien de sources ouvertes : flux RSS, API publiques, données ouvertes, sites qui autorisent explicitement la collecte. Ces sources ne demandent aucun contournement, et c’est par elles qu’il faut commencer.
Pour qui ce n’est pas
Si vos besoins sont couverts par des flux RSS et des API publiques, ces outils n’apportent rien qu’un risque supplémentaire. Commencez par vérifier, la réponse est souvent oui.
Si vous envisagez de collecter des données derrière une authentification avec vos propres identifiants, arrêtez-vous et faites valider la décision. Ce n’est pas un réglage technique, c’est un engagement contractuel.
Si votre secteur est régulé — finance, santé, services juridiques —, le sujet dépasse le droit d’auteur et touche vos obligations sectorielles. La question ne se traite pas dans une équipe technique seule.
Enfin, si l’objectif est de collecter des données qu’un concurrent protège délibérément, l’outil ne résout pas le problème. Il le déplace du terrain technique au terrain judiciaire, où il coûte beaucoup plus cher.
FAQ
Collecter des données publiques est-il légal ?
Ce n’est pas une question à réponse unique. Aux États-Unis, la justice a jugé que collecter des pages accessibles à tous ne relevait pas de la loi pénale sur la fraude informatique — mais la même affaire s’est conclue par une condamnation à 500 000 dollars pour rupture de contrat, fondée sur les conditions d’utilisation, et pour l’accès à des pages protégées par mot de passe. « Public » règle une question, pas toutes.
Le robots.txt a-t-il une valeur juridique ?
Il en a acquis une en Europe. La directive sur le droit d’auteur dans le marché unique numérique autorise la fouille de textes et de données sauf réserve exprimée par le titulaire de droits, notamment « par des procédés lisibles par machine ». Un fichier qui exprime une réserve n’est donc plus une simple convention technique.
Le RGPD s’applique-t-il si les données sont publiques ?
Oui. Le caractère public d’une page ne retire pas aux informations leur qualité de données personnelles. Une base légale reste nécessaire, et les personnes concernées gardent leurs droits d’accès et d’opposition.
Que risque une PME concrètement ?
Le risque le plus fréquent n’est pas pénal : c’est le blocage de l’accès, la mise en demeure, puis l’action en rupture de contrat. À quoi s’ajoute un risque réputationnel rarement anticipé, et des développements à refaire quand la source se ferme. La disproportion habituelle est là : quelques heures d’analyse préalable contre plusieurs mois de procédure.
Publié le 21 septembre 2026.
Cet article est un outil d’orientation, pas un avis juridique. Pour une analyse adaptée à votre situation, consultez un professionnel qualifié.



