← Glossaire
Glossaire · Data

Qu'est-ce que Web Crawlers ?

Ce sont des robots logiciels qui parcourent automatiquement les pages sur Internet et enregistrent les données.

Définition

Ils constituent la base des moteurs de recherche. En suivant les liens d'une page, ils sautent vers d'autres pages et indexent tout ce qu'ils voient pour créer une base de données massive. Ils peuvent être considérés comme des voyageurs numériques qui cartographient Internet.

Analogie : Ils sont comme un employé qui ouvre un à un tous les livres d'une bibliothèque, note les informations qu'ils contiennent, puis se dirige vers les autres livres.

Comment ça marche

Ils commencent avec une liste de départ spécifique. Ils lisent les textes, les images et les liens sur la page et les traitent dans leur propre base de données, puis continuent à avancer vers les nouveaux liens qu'ils trouvent.

Où est-ce utilisé

Ils sont utilisés dans l'indexation des moteurs de recherche, les projets de collecte de données et les sites de comparaison de prix.

Souvent confondu avec

Ils peuvent être confondus avec le web scraping ; le crawler parcourt tout le réseau, tandis que le scraper extrait des données d'une page spécifique.

Questions fréquentes

Peuvent-ils parcourir tous les sites ?

Les propriétaires de sites peuvent déterminer quelles parties les robots peuvent ou ne peuvent pas parcourir à l'aide du fichier 'robots.txt'.

Termes liés

Cette explication a été rédigée en langage clair pour TreScout puis traduite automatiquement depuis l’original turc · la version turque fait foi. Si quelque chose vous semble erroné ou manquant, écrivez à hello@trescout.com. Lire en turc →