Le marché des modèles IA généralistes s'est stabilisé en 2026 autour de trois grandes familles : Anthropic Claude, OpenAI GPT, Google Gemini. Plus Mistral et quelques outsiders comme Cohere et Meta. Pour un éditeur de presse automatisée, le choix n'est pas binaire — il dépend de la tâche, du coût, et de la voix recherchée. Ce comparatif passe en revue les six modèles les plus pertinents pour la rédaction d'actualité, en s'appuyant sur des données mesurées sur sites delapresse en production.
Claude Haiku 4.5 : le cheval de trait
Haiku 4.5 est le modèle par défaut sur delapresse. Il rédige une dépêche de 400 mots en moins de deux secondes, pour 3 crédits par article. Son ton est neutre, ses phrases courtes, sa structure prévisible. Il fait peu de fautes factuelles quand on lui donne une source explicite. Sa faiblesse : il manque d'argument profond. Pour une analyse de 1 200 mots, il devient répétitif et se réfugie dans des formules génériques.
Mesurés sur 2 400 articles delapresse en production : taux d'hallucination résiduel 0,8 %, taux de rejet manuel 4,2 %, score QA moyen 7,3/10. Excellent ratio qualité/coût.
Cas d'usage idéaux : dépêches sport, agenda culturel, brèves économiques, transcription météo, reprise de communiqué AFP, courts portraits, rubriques régulières. Si votre site publie principalement de l'actualité de cadence sur des sujets connus, Haiku couvre 80 % du besoin.
Claude Sonnet 4.6 : l'équilibre
Sonnet 4.6 ajoute la nuance d'analyse sans exploser le coût (8 crédits par article). Il argumente mieux, structure des sous-parties, repère des contradictions, propose des angles non triviaux sans déraper. Sa signature stylistique est plus marquée que Haiku — certains éditeurs aiment, d'autres trouvent ça envahissant. Sur un site qui veut une voix homogène, alterner Haiku et Sonnet selon la catégorie est souvent le bon compromis (cf. notre article routage).
Mesurés : taux d'hallucination résiduel 0,5 %, taux de rejet 3,1 %, score QA 8,1/10. Plus cher mais mesurablement meilleur en profondeur.
Cas d'usage : analyses politiques, reportages courts, chroniques régionales, billets d'opinion modérés, dossiers thématiques de moyenne longueur (800-1 500 mots).
Claude Opus 4.7 : la profondeur
Opus 4.7 est ce qu'Anthropic fait de plus capable. Coût : 18 crédits par article, quelle que soit la longueur. Il produit des textes argumentés, repère des angles oubliés, propose des structures non triviales, sait nuancer ses propres affirmations. Sa contrepartie : latence plus longue (8 à 15 secondes) et un coût qui pèse si vous le mettez sur tous les articles.
Mesurés : taux d'hallucination résiduel 0,2 %, taux de rejet 1,4 %, score QA 9,1/10. Le meilleur en absolu, à condition d'accepter le coût.
Cas d'usage : enquêtes hebdomadaires, dossiers de fond, analyses macroéconomiques, articles à fort enjeu SEO (combien ça coûte vraiment). Réservez Opus aux 15-25 % d'articles qui méritent le surcoût.
GPT-5 : l'alternative OpenAI
GPT-5 est sorti fin 2025 et a recentré l'offre OpenAI sur un modèle généraliste fort. En presse, il rivalise avec Sonnet 4.6 sur le raisonnement, mais sa signature stylistique est moins discrète — il tombe plus souvent dans la phrase markétante (« unleash », « revolutionary », « game-changer »). Pour un site à voix éditoriale forte, c'est un défaut. Pour un site qui veut un ton dynamique grand public, c'est un atout.
Coût : 8 crédits par article. Latence comparable à Sonnet. Mesurés sur 600 articles delapresse en production : taux d'hallucination 0,7 %, taux de rejet 5,4 %, score QA 7,8/10. Le taux de rejet supérieur reflète la nécessité de tordre la voix vers le registre français soigné.
Idéal pour les sites tech et lifestyle. Moins adapté aux sites de presse régionale française classique.
Gemini 2.5 Flash : la latence basse
Gemini 2.5 Flash est le champion de la latence. Une dépêche en moins d'une seconde, pour 2 crédits. Pour les sites qui veulent publier en temps réel sur un événement (compte rendu sportif minute par minute, suivi d'une conférence de presse), c'est l'outil. Sa faiblesse : il est moins bon que Haiku sur la rédaction longue, et tend à survoler les nuances.
Mesurés : taux d'hallucination 1,1 %, taux de rejet 6,8 %, score QA 6,9/10. Le compromis classique de la latence basse.
Cas d'usage : live blogging, alertes événementielles, suivi temps réel, traduction rapide, génération de meta descriptions et de balises SEO (fondamentaux SEO).
Mistral Large : la souveraineté
Pour les éditeurs sensibles à la souveraineté française, Mistral Large offre des performances proches de Sonnet sur les tâches éditoriales, à un coût comparable. Son atout : hébergement EU possible chez plusieurs partenaires (CNIL sur l'IA et le RGPD), et entraînement avec une attention particulière au français journalistique. Sa faiblesse : un peu moins fluide sur certaines tournures soutenues, mais l'écart se réduit à chaque release.
Mesurés : taux d'hallucination 0,9 %, taux de rejet 4,8 %, score QA 7,6/10. Comparable à Haiku/Sonnet, légèrement en retrait sur les analyses longues.
Cas d'usage : sites de presse régionale française attachés à la souveraineté technologique, éditeurs qui veulent éliminer tout transfert hors UE pour leurs traitements éditoriaux.
Comment choisir
Trois questions à vous poser. Quel est votre volume mensuel ? Au-dessus de 200 articles, le coût compte ; Haiku ou Mistral deviennent obligatoires en défaut. Quelle est votre exigence stylistique ? Un quotidien régional sérieux ne tolère pas la grandiloquence GPT par défaut ; il faut Sonnet ou Opus. Quelle est votre sensibilité souveraine ? Un éditeur français peut préférer Mistral pour des raisons politiques, indépendamment de la qualité technique.
L'approche delapresse permet d'avoir plusieurs modèles configurés en parallèle, et de router automatiquement selon la catégorie de l'article (routage modèles). C'est, à notre sens, la seule manière de garder une voix éditoriale dans la durée tout en maîtrisant le coût.
Concrètement, sur les sites delapresse en production, 65 % du trafic articles utilise Haiku par défaut, 22 % bascule sur Sonnet pour les catégories analyse/portrait, 8 % bascule sur Opus pour les enquêtes hebdomadaires, et 5 % utilise Gemini Flash pour le live blogging. Cette répartition tend à se stabiliser au bout de deux mois d'opération.
En pratique
Démarrez avec Claude Haiku 4.5 comme défaut, ajoutez Opus pour les enquêtes hebdomadaires, gardez Gemini Flash en option pour les événements live. Mesurez le taux d'approbation manuelle par modèle pendant un mois, puis figez votre routage. Lisez l'anatomie d'un article généré par Claude Haiku pour voir les réglages concrets, et comment détecter les hallucinations IA pour les protections obligatoires.