15 octobre 2007

Suppression de répertoire dans l'index de Google

La suppression d'un répertoire entier d'un site Web dans l'index de Google doit être demandée auprès de l'interface Google Webmasters Tools.

Néanmoins, il ne suffit pas que les pages du répertoire répondent par un code 404.

En fait, il semble que Google exige que le répertoire soit rendu inaccessible par le fichier robots.txt, par exemple:

User-agent: Googlebot
Disallow: /dir-deleted/

Dans le cas contraire, la demande de suppression sera refusée.

Libellés : , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

07 septembre 2007

Suppression d'URL du cache de Google

J'ai testé la suppression de contenu dans le cache de Google via l'interface de Google Sitemaps.

Dans l'onglet "Diagnostic", on choisit "Suppressions d'URL" puis "Nouvelle demande de suppression".

Google précise les règles à respecter pour pouvoir effectivement supprimer la page du cache (ou la page tout court si c'est ce que l'on veut):

  • Vérifiez que les demandes d'accès à la page renvoient le code d'état HTTP 404 ou 410
  • Bloquez la page à l'aide d'un fichier robots.txt
  • Bloquer la page à l'aide d'une balise META "noindex"

Il suffit qu'une condition soit respectée.

On choisit alors parmi:

  • URL individuelles : pages web, images ou autres fichiers Supprimer des pages Web, images et autres documents bloqués ou périmés des résultats de recherche Google
  • Un répertoire et tous les sous-répertoires de votre site Supprimer l'ensemble des fichiers et sous-répertoires d'un répertoire donné de votre site des résultats de recherche Google
  • Totalité de votre site Supprimer votre site des résultats de recherche Google
  • Copie en cache d'un résultat de recherche Google

Une fois sélectionné "Copie en cache d'un résultat de recherche Google", il suffit d'indiquer le chemin relatif du fichier en question.

Pour ma part, les URL ont été supprimées du cache en 4 jours ; au plus, je n'avais pas vérifié avant.

Libellés : , , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

19 avril 2007

Google Sitemaps ajoute les suppressions d’URL

Google Webmaster Tools vient d’ajouter la possibilité de supprimer des URL depuis son interface, ce qui n’était possible auparavant que via une page spéciale sur le site de Google.

Pour supprimer une page de l’index de Google, trois possibilités:

* Vérifiez que les demandes d’accès à la page renvoient le code HTTP 404 ou 410.
* Bloquez la page à l’aide d’un fichier robots.txt.
* Bloquez la page à l’aide d’une balise META “noindex”

Libellés : , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

16 avril 2007

Petite chaleur de Google Sitemaps

Google Sitemaps a eu quelques difficultés ce soir, j'ai republié les sitemaps de deux sites tout à l'heure et maintenant Google me signale qu'il faut que je vérifie les sites ...

Par ailleurs, le site Google Sitemaps était extrèmement lent mais tout est rentré dans l'ordre maintenant.

Donc si Google vous demande de vérifier un site Web alors que c'est fait depuis longtemps, n'en tenez pas compte, c'est un problème de charge sur les serveurs de Google.

Compliqué la scalabilité, hein ?

Libellés : ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

15 avril 2007

Support du fichier sitemap.xml dans robots.txt

Les trois géants de la recherche sur Internet, Google, Yahoo ! et Microsoft se sont mis d'accord il y a quelques temps pour supporter le même protocole Sitemap.

Une nouvelle entrée vient d'être ajoutée dans le fichier robots.txt.

Cette nouvelle entrée du fichier robots.txt permet de préciser où se trouve le fichier sitemap.xml, que l'on soumet habituellement auprès de Google Webmaster Tools.

Il suffit d'indiquer:
Sitemap: http://www.mysite.com/sitemap.xml

dans le fichier robots.txt.

Google ne précise cependant pas si cette entrée du fichier robots.txt doit être positionnée pour chaque moteur de recherche ou si elle peut résider dans la section générique:
User-agent: *

Personnellement, je préfère utiliser une entrée par moteur de recherche plus une entrée dans la section générique, car les crawlers ne lisent généralement pas la suite du fichier robots.txt lorsqu'ils ont trouvé la section qui leur correspond.

Par ailleurs, on a appris que le moteur de recherche Ask supporte désormais lui aussi le protocole Sitemap.

Libellés : , , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

23 septembre 2006

Google Sitemaps: Assistant d'état du site

La page d'aide aux Webmasters de Google permet désormais de savoir si Google est en train d'indexer votre site, et ce même sans disposer d'un compte Google Sitemaps.

Le récapitulatif d'indexation par Google ainsi que la date de dernier accès par Googlebot est donné.

Il s'agit surtout de la part de Google de fournir une page permettant de signaler l'existence du programme Google Sitemaps maintenant nommé "Outils Google à l'attention des webmasters".

Libellés : , , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

14 septembre 2006

New format for Google Webmaster Tools (Google Sitemaps)

Google now adds a plain text format for Google Sitemaps files. It is the same plain text format Yahoo! uses for Yahoo ! Site Explorer.

Google Sitemaps, now Google Webmaster Tools, is able to understand the following Google Sitemaps formats:

* Sitemap protocol (XML file with: file name, last modification date, frequency for changes, priority)
* Real Simple Syndication and Atom
* Plain text file with Web Site URLs (Same format as Yahoo ! Site Explorer)

The Real Simple Syndication format is useful for blogs, for example a blogger blog. The simple submission of an RSS feed of your blog to Google Sitemaps gives you the same functionalities for the Site as for another WebSite.

Plain text file format is easier to use and generate but you loose the information: last modification date, frequency for changes, and priority, and thus it gives Google less useful information about the changes of your Web site.

Moreover, Google Sitemap files can be compressed using gzip, and Sitemap index files may be created for Web Sites containing many pages.

Sitemap file should reside in the root directory of the web site, for example, see the sitemap of Google Web Site.

Before being able to submit a sitemap for a Web Site of your own, you first need a Google Account. Existing Gmail, Google Analytics accounts are fine. Then, you have to make the proof you owns the Web Site.

Web Site Authentication includes:

* META-TAGS to add to the Web Site index file
* Authentication file in the root directory, the file name is choosen by Google

The first method is fine for blogs: for example, you can't create a file in the root directory of a blogger blog. On the contrary, it is possible to add META-TAGS in the blog template page.

Second method is used for "normal" Web Sites, and it is also the method used by Yahoo ! Site Explorer.

As Yahoo ! gives no other choice for authentication, there is no ways to use Yahoo ! Site Explorer with a blogger blog. I think this problem should occur for other types of blogs ...

Libellés : , , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

15 juillet 2006

Ajoutez un sitemap Google sur un compte blogger.com

Dans un post précédent sur Google Sitemaps, j'expliquais rapidement les mérites de Google Sitemaps comme outil fournissant des statistiques sur un site Web.

Sur un site classique, qui n'est pas un blog, il faut au préalable générer le fichier sitemap.xml, correspondant aux pages du site, ce qui peut être fait de différentes façons, à une fréquence assez faible si le site n'est pas trop dynamique.

Personnellement, j'utilise un programme C qui me génére le fichier sitemap.xml en fonction des pages HTML du site avant mise à jour de celui-ci par FTP.

Avec un blog, par exemple sur blogger, le problème est tout autre. Il est en effet difficile de re-générer le fichier sitemap.xml à chaque post, dans la mesure ou ceux-cis sont généralement faits avec une interface Web (Wordpress, blogger.com ...), ou par le biais d'un compte e-mail secret destiné à recevoir les posts.

Seulement voilà, Google a tout prévu !

En effet, Google Sitemaps accepte pour un compte blogger.com de prendre comme fichier sitemap.xml, le flux rss Atom, c'est à dire http://developpement-logiciel.blogspot.com/atom.xml dans mon cas.

L'avantage de cela, plus qu'évident, est que le fichier atom.xml du compte blogger.com est toujours à jour et n'a pas besoin d'être regénéré à chaque post sur le Weblog !

Conclusion, si vous avez un compte sur Google Sitemaps et que vous venez de créer un blog sur blogger.com, il faut:

- Ajouter le nouveau site créé sur blogger.com au compte Google Sitemaps,
- Signaler à Google que le site vous appartient en ajoutant un META tag dans le template du blog blogger.com (L'autre méthode étant l'upload d'un fichier HTML dont Google vous donne le nom),
- Ajouter un Sitemap pour le nouveau site après vérification de l'appartenance su site,

Vous aurez utilisé comme sitemap.xml, pour votre compte blogger.com, le flux atom.xml du blog et quelques minutes ensuite, Google Sitemaps affichera "Etat du plan Sitemap" OK.

Libellés : , ,

1 commentaires:

Blogger Prac a dit...

Une explication détaillée ici :

Un sitemap pour un compte blogger.com

8:51 PM  

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil

27 juin 2006

Google Sitemaps: les statistiques de votre site Web

L’outil de Google, Google Sitemaps, permet d’obtenir des statistiques concernant un site Web via les données de Google.

Le principe de Google Sitemaps consiste à créer un fichier XML décrivant les pages du site Web. Ce fichier contient également la date de dernière mise à jour du site Web ainsi que la périodicité des changements survenus sur les pages.

Le fichier XML doit se trouver à la racine du site Web et se nommer sitemap.xml et être mis à jour régulièrement.

Des formulaires existent sur le net pour générer un fichier sitemap.xml, je préfère personnellement le générer automatiquement via un script shell à chaque mise à jour de mon site.

Le programme Google Sitemaps était destiné initialement à faciliter le référencement d’un site Web. Ainsi, en théorie, c’est l’administrateur du site Web qui signale les changements auprès de Google, au lieu que ce soit googlebot qui s’en charge.

En pratique, googlebot utilise le fichier sitemap pour adapter sa fréquence de visite des pages du site. A la connexion à Google Sitemaps s’affiche la date de dernière indexation des pages par googlebot ; en général le robot de Google passe entre 2 et 5 fois par mois.

L’interface de Google Sitemaps qui change régulièrement comporte 3 onglets: Diagnostics, Statistics, et Sitemaps.

Diagnostic présente les informations générales d’indexation du site Web par Google ainsi que les erreurs éventuelles.

L’onglet Sitemaps permet de regrouper sur un seul compte Google Sitemaps les sitemaps de plusieurs sites Web.

Statistics est la partie la plus intéressante puisqu’elle permet de voir les requêtes les plus fréquentes sur Google ayant conduit à des résultats émanant des pages de votre site, ainsi que celles qui ont conduit à des clics. Cela permet de considérer les mots-clés pertinents qui conduisent vers le site, ou d’exclure ceux pour lesquels on ne désire pas obtenir de traffic.

La position des pages retournées (Average Top Position) dans les résultats de recherche de Google est aussi indiquée, ce qui est particulièrement intéressant pour savoir si l’on se situe dans la première page de recherche ou non !

Depuis peu, les requêtes les plus fréquentes présentées par Google Sitemaps peuvent être triées par localisation géographique.

Même si Google Sitemaps présente des statistiques bien moins détaillées que le programme Google Analytics (et au moins Sitemaps n’a pas besoin de Flash !), il a le mérite d’être simple et de présenter simplement les requêtes qui génèrent du traffic, tout en prévenant Google de l’ajout de nouvelles pages.

L’onglet Diagnostic de Google Sitemaps permet aussi de simuler le passage de googlebot (ou de l’un des autres robots de Google) sur une page donnée du site, en prenant en compte les exclusions du fichier robots.txt. Cela permet de vérifier que le fichier robots.txt est correct.

Libellés : , ,

0 commentaires:

Enregistrer un commentaire

Abonnement Publier les commentaires [Atom]

<< Accueil