04 mars 2012

Blogger: Comment enlever le nom du blog dans le titre de chaque post

Les utilisateurs de la plate-forme de blogs blogger de Google ont sans doute remarqué que le titre de chaque post commence par le nom du blog.

Cette façon de faire peut être souhaitée, néanmoins elle est dommageable pour l'optimisation de l'indexation des pages du blog dans les moteurs de recherche: le titre de chaque post se trouvant raccourci à cause du titre du blog ajouté au début du titre du post.

Ainsi, une partie des mots-clés du titre du post passent à la trappe au niveau de l'indexation par Google.

Pour supprimer le titre du blog, on procède de la façon suivante au début du template de blogger:

Après la balise <head>, on trouve la balise <title>:


<title><$BlogPageTitle$></title>

qu'il faut remplacer par un titre "conditionnel" selon que l'on se trouve sur la page d'accueil (ou sur une page d'archive) ou sur un post (item):

  <MainOrArchivePage>
  <title><$BlogPageTitle$></title>
  </MainOrArchivePage>

  <Blogger>
  <ItemPage>
  <title><$BlogItemTitle$></title>
  </ItemPage>
  </Blogger>

De cette façon, le post Tester l'antivirus de Gmail avec les fichiers d'eicar.org a bien ce titre à la fois en début de post et dans la balise <title>.

Libellés : , , , , , , , , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

05 janvier 2008

Les moteurs de recherche qui scannent le Web

En regardant en détail les logs d'un site Web filtrés par le User-Agent, on découvre un certain nombre de bots ou crawlers pas forcément connus.

Certains sont japonais ou indiens, il n'est donc pas très utile d'être indexé par eux lorsque l'on édite un site en langue Française.

D'autre ne sont que des moteurs destinés à alimenter des annuaires que plus personne ne consulte aujourd'hui. Ils ne contribuent qu'à ajouter du spam sur Internet.

J'en ai recensé quelques uns, on pourra éventuellement interdire leurs adresses IP respectives dans le fichier .htaccess d'Apache, afin de limiter la bande passante utilisée par le serveur.

Moteurs Japonais:

Ichiro:

Adresse IP: 210.150.10.112
User-Agent: ichiro/2.0 (http://help.goo.ne.jp/door/crawler.html)
Hostname: crs023.goo.ne.jp

Steeler:

Adresse IP: 157.82.156.159
User-Agent: Steeler/3.3 (http://www.tkl.iis.u-tokyo.ac.jp/~crawler/)
Hostname: crawl159.tkl.iis.u-tokyo.ac.jp

Moteurs Indiens:

GurujiBot:

Adresse IP: 72.20.109.34
User-Agent: GurujiBot/1.0 (+http://www.guruji.com/en/WebmasterFAQ.html)
Hostname: guruji.com

J'ai également noté le passage d'un moteur nommé Omni-Crawler ou Omni-Explorer, qui a le défaut de passer souvent.

Ce moteur indexe les annonces d'achat/vente de voitures ou d'immobilier aux Etats Unis (vast.com), il est donc sans intérêt:

OmniExplorer:

Adresse IP: 72.44.50.39
User-Agent: OmniExplorer_Bot/6.10.7 (+http://www.omni-explorer.com) WorldIndexer
Hostname: ec2-72-44-50-39.z-1.compute-1.amazonaws.com

Le "moteur" GnoZtik semble être un moteur sans grand intérêt (c'est un annuaire de plus):

GnoZtiK:

Adresse IP: 219.117.195.201
User-Agent: GnoZtiK bot/1.0 (http://www.gnoztik.com
Hostname: 219.117.195.201.static.zoot.jp

ainsi que MJ12bot qui passe beaucoup trop souvent:

MJ12bot:

Adresse IP: 151.65.138.82
User-Agent: MJ12bot/v1.0.8 (http://majestic12.co.uk/bot.php?+)
Hostname: 151.65.138.82

Enfin, archive.org archive les pages trouvées sur Internet, ce que l'on ne souhaite pas forcément:

archive.org_bot:

Adresse IP: 208.70.26.113
User-Agent: Mozilla/5.0 (compatible; archive.org_bot/1.13.1x +http://crawler.archive.org)
Hostname: crawling13.us.archive.org

Libellés : , , , , , , , , , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

24 septembre 2006

La Libre Belgique et Le Soir ne sont plus dans l'index de Google

Google a été condamné récemment par le tribunal de première instance de Bruxelles à retirer de www.google.be les articles des pays adhérents à Copiepresse.

Cela suppose en particulier de ne plus faire apparaitre les articles émanants des journaux adhérents à Copiepresse dans les News Google en Belgique.

De plus, Google devait publier sur sa page d'accueil le texte du jugement, ce qu'il a fini par faire, bien qu'ayant refusé au départ.

Les pages émanant des journaux Belges ont donc disparu du cache de Google.

Mais il semble que Google soit allé plus loin puisque des journaux Le Soir, la Libre Belgique ou La Dernière Heure, aucun ne semble encore figurer dans l'index de Google (www.google.be) !

En revanche, sur les autres sites de Google, les journaux Belges sont encore indexés.

Tout semble laisser penser que c'est un pied de nez de Google à ces journaux qui l'ont attaqué ...

Cette affaire peut faire beaucoup de tord aux journaux Belges compte tenu de la prédominance actuelle de Google sur le marché des moteurs de recherche.

Libellés : , , , , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

02 septembre 2006

Le spam d'index dans Google et Yahoo

J'ai effectué récemment une recherche sur le moteur de recherche Yahoo ! en Anglais sur un mot clé qui ramène beaucoup de pages.

Comme beaucoup d'internautes, j'essaie les premiers résultats, et je me rends compte que ces derniers renvoient sur trois domaines différents qui pointent sur des sites identiques.

Quels points communs entre ces sites qui sont en fait les mêmes ?

Déjà, les mots clés en question sont répétés à l'envie, dans les balises méta, dans le titre et aussi dans le texte.

Ensuite, les pages ne comportent que très peu de mots, et ce afin d'obtenir une densité de mots clés importante.

Si l'on "visite" le site en question, on s'aperçoit rapidement que le contenu est quasi inexistant.

Ayant récupéré les pages d'accueil des trois domaines hébergeant le même site avec wget, un diff Unix fait apparaitre que les seules différences portent sur l'URL du site dupliqué !

Des sites de ce genre sont des spams réels d'index pour les moteurs de recherche et sont nuisibles à l'internaute, qui jusque là, n'a pas trouvé l'information qu'il cherchait.

On aimerait vraiment voir disparaitre ce genre de sites de l'index de Google ou de Yahoo !

Lorsque l'on rencontre un cas de spam d'index sur un moteur de recherche donné, on peut le signaler au dit moteur via les liens suivants:

Signaler un spam dans l'index de Google

Signaler un spam d'index dans le moteur de recherche Yahoo !

Libellés : , , , , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil