Un site lisible par les IA est un site dont le contenu est accessible sans exécuter de JavaScript, structuré en HTML sémantique, décrit par des données structurées Schema.org et ouvert aux crawlers IA dans son robots.txt. Le fichier llms.txt, standard émergent, complète le dispositif en offrant aux modèles de langage un plan clair de votre site. Voici la checklist technique 2026, vérifiable point par point sur votre propre site.
HTML sémantique : le socle de tout
Les crawlers des IA n'exécutent pas, ou mal, le JavaScript. Un site dont le contenu n'apparaît qu'après rendu côté navigateur — le cas des single-page applications classiques — est, pour beaucoup d'entre eux, une page vide. La première vérification est donc simple : affichez le code source de vos pages clés (clic droit, « afficher la source ») et vérifiez que le texte important y figure réellement. Si ce n'est pas le cas, le rendu côté serveur (SSR) ou la génération statique (SSG) s'imposent ; les frameworks modernes comme Next.js ou Astro le proposent nativement.
Au-delà, la sémantique compte : un seul H1 par page, une hiérarchie H2/H3 logique, des paragraphes courts, des listes pour les énumérations et des balises appropriées (article, nav, main). Les modèles découpent vos pages en fragments : plus la structure est propre, plus les fragments extraits sont cohérents et citables.
Pensez aussi aux contenus non textuels : un attribut alt descriptif sur les images, des transcriptions pour les vidéos, des tableaux HTML plutôt que des captures d'écran. Tout ce qui n'est pas du texte accessible reste invisible pour la plupart des systèmes d'extraction.
Schema.org et JSON-LD : les quatre schémas essentiels
Les données structurées décrivent votre contenu dans un format que les machines comprennent sans ambiguïté. Quatre schémas couvrent l'essentiel des besoins d'une PME :
- Organization : qui vous êtes — nom, logo, coordonnées, profils sociaux.
- Article : vos contenus éditoriaux, avec auteur et dates de publication.
- FAQPage : vos questions-réponses, directement exploitables par les moteurs de réponse.
- BreadcrumbList : la position de chaque page dans l'arborescence du site.
Un exemple minimal de schéma Organization, à placer dans une balise script de type application/ld+json :
{ "@context": "https://schema.org", "@type": "Organization", "name": "Votre Entreprise", "url": "https://www.exemple.fr", "description": "Expertise IT pour PME et ETI", "sameAs": ["https://www.linkedin.com/company/exemple"] }Validez ensuite chaque schéma avec le validateur officiel de Schema.org ou l'outil de test des résultats enrichis de Google : une donnée structurée invalide est simplement ignorée.
llms.txt : la carte de visite pour les modèles
Proposé en 2024, llms.txt est un fichier Markdown placé à la racine du site (votredomaine.fr/llms.txt) qui présente votre site aux modèles de langage : qui vous êtes, ce que vous proposez, où trouver les contenus importants. Son adoption par les fournisseurs d'IA reste partielle à ce jour, mais son coût de mise en place est quasi nul et il structure utilement l'information. Un llms.txt type contient :
- Un titre de niveau 1 avec le nom de l'entreprise, suivi d'un résumé d'une phrase de votre activité.
- Une section par grand ensemble de contenus (services, blog, tarifs) listant les URL essentielles, chacune accompagnée d'une courte description.
- Éventuellement un fichier compagnon llms-full.txt reprenant le contenu intégral des pages clés au format Markdown.
Le pari est simple : si le standard s'impose, vous êtes prêt ; s'il reste marginal, vous aurez au moins clarifié la présentation de votre offre — un exercice rarement inutile.
robots.txt : qui laissez-vous entrer ?
Les principaux crawlers IA s'identifient par leur user-agent : GPTBot et OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot, ou encore Google-Extended, qui contrôle l'usage de vos contenus par Gemini. La décision de les autoriser est stratégique : un média qui vit de son contenu peut vouloir bloquer les robots d'entraînement ; une entreprise de services qui cherche de la visibilité a tout intérêt à les accueillir, faute de quoi elle disparaît des réponses générées. Vérifiez votre fichier actuel : certains CDN et modèles de robots.txt bloquent ces robots par défaut, sans que personne ne l'ait réellement décidé.
Sitemap et hreflang : la signalétique
Un sitemap.xml à jour, déclaré dans le robots.txt, aide tous les robots — classiques et IA — à découvrir rapidement vos pages et leurs mises à jour. Si votre site existe en plusieurs langues, les balises hreflang indiquent quelle version correspond à quelle audience : sans elles, une IA peut citer votre page anglaise à un utilisateur francophone, ou ignorer purement l'une des deux versions. Profitez-en pour vérifier les dates de dernière modification déclarées : un sitemap qui annonce des pages jamais mises à jour depuis des années n'incite aucun robot à repasser fréquemment.
Tester concrètement : demandez aux IA
- Demandez à ChatGPT, Perplexity et Gemini : « Que sais-tu de [votre entreprise] ? » et « Que propose [votre entreprise] ? ». Les réponses révèlent ce que les modèles ont réellement retenu — et les erreurs à corriger.
- Posez les questions métier que vos clients poseraient et vérifiez si votre site apparaît dans les sources citées.
- Récupérez vos pages avec un simple outil en ligne de commande comme curl, pour voir exactement ce qu'un robot obtient sans JavaScript.
- Surveillez vos logs serveur : la présence régulière de GPTBot ou ClaudeBot confirme que votre contenu est bien collecté.
- Répétez l'exercice après chaque évolution majeure du site : une refonte peut casser silencieusement la lisibilité IA acquise.
La lisibilité IA n'exige ni refonte ni budget considérable : c'est une série de vérifications techniques précises, dont la plupart relèvent de l'hygiène web de base. Mais chaque point négligé est un endroit où votre entreprise devient invisible pour des assistants que vos clients utilisent déjà quotidiennement. Un audit technique rapide, mené avec un partenaire qui pratique ces standards au quotidien, permet généralement d'identifier et de corriger l'essentiel en quelques jours.
