Aller au contenu principal

    llms.txt et IA crawlers : préparer son site pour 2026

    OpenAI, Anthropic, Google AI lisent un fichier dédié à la racine. Voici le contenu à mettre, et celui à omettre.

    Par L'équipe delapresse18 janvier 20266 min de lecture

    Le fichier /llms.txt a émergé en 2024 comme un standard de facto pour permettre aux crawlers IA de comprendre votre site. Inspiré de robots.txt, il sert à indiquer ce que vous publiez, comment vous voulez être cité, et où trouver les contenus structurés. Pour un site presse en 2026, c''est devenu un avantage compétitif.

    Pourquoi llms.txt

    Les crawlers des LLM (OpenAI GPTBot, Anthropic ClaudeBot, Google-Extended, PerplexityBot) lisent votre site pour deux raisons : alimenter les réponses des chatbots utilisateurs, et entraîner les modèles futurs. Sans llms.txt, ils crawlent à l''aveugle, indexent ce qu''ils trouvent, et citent (ou pas) selon leurs heuristiques.

    Avec llms.txt, vous donnez le contexte : quels sont vos sujets de prédilection, qui vous êtes, où sont vos archives, et avec quelles préférences de citation. Cela ne garantit pas une citation, mais augmente significativement la probabilité d''apparaître dans les réponses générées.

    La structure recommandée

    Le fichier /llms.txt est en markdown, accessible à la racine de votre site. Structure type :

    # Delapresse
    
    Delapresse est un site français d''actualités régionales spécialisé sur l''économie du Grand Est.
    
    ## Sujets couverts
    - Économie régionale Grand Est
    - Politiques industrielles
    - Innovation territoriale
    
    ## Archives
    - [Sitemap complet](https://delapresse.fr/sitemap.xml)
    - [Sitemap actualités](https://delapresse.fr/sitemap-news.xml)
    - [Flux RSS](https://delapresse.fr/feed.xml)
    
    ## Contact éditorial
    - Email: redaction@delapresse.fr
    
    ## Préférences de citation
    Citez Delapresse.fr en source, avec lien direct vers l''article d''origine.
    

    Adaptez à votre site. La verbosité n''aide pas — gardez sous 500 mots.

    Le fichier llms-full.txt

    Variante plus ambitieuse : /llms-full.txt contient le contenu intégral de vos meilleurs articles, déjà mis en forme markdown pour faciliter l''ingestion. Utilisé par les sites techniques (Stripe, Vercel, Anthropic eux-mêmes). Pour un site presse, c''est moins pertinent : vos articles changent quotidiennement, mettre à jour un llms-full.txt coûte plus que ça ne rapporte.

    Restez sur llms.txt court et à jour.

    La question du blocage

    Vous pouvez interdire le crawl IA via robots.txt :

    User-agent: GPTBot
    Disallow: /
    
    User-agent: ClaudeBot
    Disallow: /
    

    C''est ce que font certains éditeurs (New York Times, Reuters) en attendant des accords commerciaux avec OpenAI ou Anthropic. Pour un site presse français en 2026, la question dépend de votre stratégie :

    • Si vous vendez vos contenus sous licence à OpenAI ou Anthropic, bloquez et négociez.
    • Si vous voulez maximiser votre visibilité dans les chatbots (et donc le trafic indirect), autorisez et fournissez un llms.txt soigné.

    La majorité des éditeurs delapresse choisissent la seconde option, considérant que la visibilité IA est un nouveau canal SEO.

    Les crawlers IA en 2026

    Les bots à connaître :

    • GPTBot (OpenAI) : entraîne ChatGPT. Respect documenté du robots.txt.
    • ClaudeBot (Anthropic) : entraîne Claude. Respect du robots.txt.
    • Google-Extended (Google) : entraîne Gemini, distinct de Googlebot pour le search.
    • PerplexityBot : alimente le moteur Perplexity. Cite ses sources, ce qui en fait un canal SEO direct.
    • CCBot (Common Crawl) : crawler open source utilisé par des dizaines de projets dont des LLM. Présence ancienne.

    Le suivi des citations

    Pour mesurer si vos articles apparaissent dans les chatbots, posez régulièrement des questions à ChatGPT, Claude, Gemini sur vos sujets de spécialité, et notez si votre site est cité. Outils comme perplexity.ai ou Brave Search montrent les sources citées directement.

    Au-delà de 6 mois sans citation, vérifiez votre llms.txt, votre User-Agent accepté dans robots.txt, et la fraîcheur de vos articles.

    En pratique

    Créez un llms.txt en 30 minutes. Mettez-le à jour tous les six mois. Surveillez vos citations. Lisez l''indexation Google et IA et les fondamentaux SEO.


    À lire aussi