Pourquoi je le trouve pas, ce fichu lien vers mes résultats ? Ou comment fonctionne un moteur de recherche.

À force d’entendre ma copine et d’autres se plaindre de ne pas trouver :

je me décide à t’expliquer, public, comment ça marche un moteur de recherche, à la base.

Pourquoi, lorsque vous tapez quelque chose du genre “bac résultats toulouse”, vous n’obtenez pas toujours de façon miraculeuse et en premier le lien direct sur la liste des bacheliers fraîchement reçus ?

C’est très simple : chaque moteur de recherche possède un robot (un logiciel) qui passe son temps à surfer et à trier tout ce qu’il lit. Il retient donc plus ou moins bêtement les mots qu’il a rencontré. Donc, si aucun site n’a écrit en toute lettre un ou plusieurs jours avant les résultats d’un examen Résultats du bac ici pour l’académie de chouette, et bien le moteur de recherche ne pourra pas deviner où l’information est succeptible de se trouver et ne pourra pas donc pas vous fournir la bonne réponse le jour venu… C’est pas plus compliqué que ça.

Exemple des traces que laisse lors de ses recherches ce type de robot :

Google

64.68.82.178 www.batmat.net - [01/Sep/2004:11:48:04 +0200] "GET /robots.txt HTTP/1.0" 404 2384 "-" "Googlebot/2.1 (+http://www.google.com/bot.html)"

Yahoo

66.196.90.232 www.batmat.net - [01/Sep/2004:00:21:44 +0200] "GET /robots.txt HTTP/1.0" 404 2384 "-" "Mozilla/5.0 (compatible; Yahoo! Slurp; http://help.yahoo.com/help/us/ysearch/slurp)"

MSN

65.54.188.130 batmat.net - [01/Sep/2004:07:55:07 +0200] "GET /blog/2004/08/24/76-VolleyballAuxJoSuiteEtFin HTTP/1.0" 200 12981 "-" "msnbot/0.11 (+http://search.msn.com/msnbot.htm)"

Divers autres

192.133.61.44 www.batmat.net - [01/Sep/2004:09:04:42 +0200] "GET /robots.txt HTTP/1.0" 404 2384 "-" "lmspider (lmspider@scansoft.com)"

64.62.168.26 www.batmat.net - [01/Sep/2004:02:56:44 +0200] "GET /robots.txt HTTP/1.0" 404 2384 "-" "Gigabot/2.0"

La faute n’est donc pas à ce_fichu_internet_qui_ne_fonctionne_pas_si_bien_que_ça, mais tout simplement au fait qu’on ne sait pas encore, malgré les progrès fulgurants de la technologie, lire l’avenir dans les pages web :-).

PS aux XHTMLeux : j’ai mis les logs en <code>, qu’est-ce que vous en pensez ?

comments powered by Disqus