Canonical#
Gérer des cas de contenus dupliqués (cf. duplicate content), ce n’est pas toujours de la tarte ! Communément appelé balise canonique, cet élément de code HTML est là pour ça. La canonical permet de définir la version principale de pages dupliquées ou similaires. Si le même contenu ou un contenu similaire est disponible sous différentes URL, la balise canonique permet d’indiquer quelle version est la principale et donc celle qui doit être indexée.
Cocon sémantique#
Système d’organisation d’un site web visant à optimiser les contenus rédactionnels. Vous devez trouver les bons ingrédients afin de répondre aux questions des internautes sur un thème donné, et ficeler le tout par des liens hypertextes habilement placés. Le visiteur et ses préoccupations sont au centre du processus, alors n’hésitez pas à mettre les petits plats dans les grands pour lui proposer un contenu unique.
Code HTTP#
Ce code donne une indication concernant le résultat d’une requête, et la classification de ces codes d’état se fait en fonction du type de message qu’ils renvoient. On ne pourra pas tous les décortiquer ici, cependant vous connaissez probablement le plus courant : l’erreur 404 Not Found, lorsque la ressource n’a pas été trouvée par le serveur.
Content spinning#
Cette méthode consiste à utiliser un logiciel pour reformuler un article, de telle sorte que les robots – Google notamment – pense qu’il s’agit d’un article différent. Une fois qu’ils sont revisités et assaisonnés de nouveaux mots, ces contenus peuvent être soumis à plusieurs blogs dans un but de référencement. Perso je n’utilise pas ce type d’outils, je préfère faire appel à de vrais rédacteurs !
Crawler#
Également appelé spider ou spiderbot, un crawler est un robot qui parcourt régulièrement le World Wide Web sans en perdre une miette. Les moteurs de recherche utilisent généralement ce type de robot pour collecter les ressources et indexer les pages web.