Recherche agentique : 4 fondamentaux techniques pour être visible
Les internautes ne passent plus uniquement par une page classique de résultats Google pour trouver une information. Google AI Overviews, AI Mode, ChatGPT et d’autres assistants peuvent désormais rechercher plusieurs sources, extraire certaines informations puis construire directement une réponse. Pour une entreprise, cela crée un nouvel enjeu : son site ne doit plus seulement pouvoir être indexé et positionné. Son contenu doit également pouvoir être récupéré, compris et éventuellement utilisé comme source par des systèmes d’intelligence artificielle. Cela pourrait laisser penser qu’une nouvelle discipline technique entièrement distincte du SEO est nécessaire. En réalité, une grande partie des fondamentaux reste la même. Google explique d’ailleurs que ses fonctionnalités de recherche utilisant l’IA générative continuent à s’appuyer sur ses systèmes principaux de recherche et de classement. Les bonnes pratiques SEO techniques restent donc largement pertinentes. Ce qui change surtout, c’est que certaines erreurs autrefois relativement tolérables peuvent désormais empêcher un système IA d’exploiter correctement une page. 1. Vérifier que les robots IA peuvent réellement accéder au site Avant qu’un moteur puisse comprendre une information, il faut d’abord qu’il puisse atteindre la page sur laquelle elle se trouve. Le principe est le même qu’en SEO traditionnel : des robots automatisés parcourent le web afin de récupérer les pages. Mais l’écosystème compte désormais davantage de robots, avec des fonctions différentes. OpenAI utilise par exemple OAI-SearchBot pour permettre aux contenus publics d’être découverts dans la recherche ChatGPT. Le robot GPTBot répond à un autre usage, notamment lié à l’entraînement potentiel des modèles. Il est donc possible pour un éditeur d’autoriser le premier tout en limitant le second. Cette distinction est importante. Une entreprise peut croire avoir « bloqué les IA » alors qu’elle a uniquement bloqué un robot d’entraînement. À l’inverse, une règle trop large dans le fichier robots.txt, un pare-feu ou une solution antibot peut empêcher involontairement un robot de recherche d’accéder au site. Le problème est alors difficile à repérer : le site peut continuer à fonctionner normalement pour les visiteurs et même rester correctement visible dans certains moteurs traditionnels, tout en étant inaccessible à certains systèmes IA. Pour une banque ou une compagnie d’assurance, cela peut par exemple signifier qu’une page expliquant les conditions d’un produit est parfaitement accessible aux internautes, mais impossible à consulter lorsqu’un assistant IA cherche une source pour répondre à une question sur ce produit. La première vérification consiste donc à contrôler non seulement le fichier robots.txt, mais également les règles du CDN, du pare-feu, des systèmes antibot et les éventuelles réponses HTTP 403 ou 429. Pour une vérification rapide, l’AI Bot Access Tester de TechnicalSEO.com permet de contrôler si plusieurs robots liés à l’IA peuvent accéder à une URL. Son outil de test du fichier robots.txt permet également d’identifier simplement si une règle bloque une URL ou un robot particulier. Pour ChatGPT Search, OpenAI recommande explicitement de ne pas bloquer OAI-SearchBot et de vérifier que l’hébergement ou le réseau de diffusion de contenu autorise son trafic. 2. Ne pas cacher les informations essentielles derrière JavaScript De nombreux sites modernes utilisent JavaScript pour construire tout ou partie de leurs pages dans le navigateur. Ce fonctionnement n’est pas nécessairement problématique pour Google : Google sait depuis longtemps rendre et traiter de nombreuses pages utilisant JavaScript. Sa propre documentation continue toutefois de rappeler que les sites construits avec des frameworks JavaScript sont généralement plus complexes à optimiser techniquement. Pour les autres systèmes de récupération d’information, les capacités de rendu peuvent varier. Le risque apparaît surtout lorsque la réponse envoyée initialement par le serveur contient très peu d’informations et que le contenu important n’apparaît qu’après l’exécution de JavaScript. Imaginons par exemple une page présentant une assurance automobile. Le serveur renvoie essentiellement la structure de la page, puis JavaScript charge ensuite : La bonne pratique consiste donc à rendre les informations critiques disponibles directement dans le HTML initial lorsque cela est possible, grâce par exemple au SSR (Server-Side Rendering, rendu côté serveur) ou à la génération statique. Cela concerne notamment les titres, le texte principal, les liens importants, les caractéristiques d’un produit et les informations nécessaires pour comprendre l’offre. L’objectif n’est pas de supprimer JavaScript. Il est d’éviter que JavaScript devienne l’unique moyen d’accéder à une information essentielle. Pour effectuer un premier contrôle sans analyser le code du site, l’outil Fetch & Render de TechnicalSEO.com permet de visualiser le contenu et le HTML qu’un robot peut récupérer après rendu. Pour les sites dont on dispose de l’accès, l’outil d’inspection d’URL de Google Search Console permet également de tester une URL en direct et de vérifier comment Google peut l’explorer et l’indexer. 3. Utiliser les données structurées pour réduire l’ambiguïté, sans leur prêter un pouvoir qu’elles n’ont pas Les données structurées permettent de décrire explicitement certaines informations d’une page dans un format compréhensible par les machines. Avec le vocabulaire Schema.org, un site peut par exemple préciser qu’un élément correspond à une organisation, un produit, un article, une personne, une adresse ou une offre. Cette couche supplémentaire peut aider les systèmes à interpréter plus précisément le contenu. Sur la page d’une compagnie d’assurance, il devient par exemple possible d’indiquer clairement le nom de l’organisation, son logo, son adresse, ses coordonnées ou certaines relations entre les différentes entités présentes sur le site. Mais il faut éviter un raccourci fréquent : ajouter du Schema.org ne garantit pas qu’un site sera cité par une intelligence artificielle. Google précise même qu’aucun balisage Schema.org spécifique n’est nécessaire pour apparaître dans ses fonctionnalités de recherche utilisant l’IA générative. Les données structurées restent recommandées dans une stratégie SEO globale, notamment parce qu’elles peuvent rendre certaines pages éligibles à des résultats enrichis, mais elles ne constituent pas un « ticket d’entrée » vers les réponses IA. La priorité reste donc de disposer d’un contenu clair et accessible. Les données structurées viennent ensuite renforcer cette compréhension. Il faut également vérifier que le balisage correspond réellement à ce qui est visible sur la page. Ajouter de nombreuses propriétés Schema.org sans contenu correspondant n’améliore pas la qualité de l’information. Deux outils gratuits permettent de


