94,3 % sur le benchmark scientifique GPQA Diamond, 87,6 % sur SWE-bench Verified, 15,8 % sur le Remote Labor Index : trois scores qui distinguent Gemini 3.1 Pro, une version avancée de GPT et Claude Fable 5 sur les critères qui comptent pour choisir un assistant IA. Ce comparatif s’appuie sur la documentation officielle de chaque éditeur, les grilles tarifaires publiées et les benchmarks publics disponibles, arrêté à août 2026 — il ne remplace pas votre propre test avant de choisir.
Ce qu’il faut retenir
– Claude Opus 4.6 a atteint 80,8 % sur SWE-bench Verified, le meilleur score des trois familles de modèles à son lancement, avant qu’une version ultérieure de GPT ne porte la barre à 87,6 %, selon le comparatif compilé par Studeria.
– Gemini 3.1 Pro affiche le meilleur score de raisonnement scientifique des trois avec 94,3 % sur GPQA Diamond.
– Anthropic a lancé Fable 5 le 10 juin 2026, un modèle qui détient le record du Remote Labor Index avec 15,8 %.
– Les trois éditeurs proposent une fenêtre de contexte pouvant atteindre environ 1 million de tokens selon le plan souscrit.
Fiche comparative
| Critère | ChatGPT (OpenAI) | Claude (Anthropic) | Gemini (Google) |
|---|---|---|---|
| Abonnement grand public | environ 20 $/mois (ChatGPT Plus) | environ 20 $/mois (Claude Pro) | environ 20 $/mois (Gemini Advanced) |
| Fenêtre de contexte | jusqu’à environ 1 million de tokens selon le plan | jusqu’à environ 1 million de tokens selon le plan | jusqu’à environ 1 million de tokens selon le plan |
| SWE-bench Verified (code) | environ 80 % (GPT-5.2), 87,6 % sur une version ultérieure | 80,8 % (Opus 4.6) | 80,6 % (Gemini 3.1 Pro) |
| GPQA Diamond (raisonnement) | non communiqué dans les sources disponibles | non communiqué dans les sources disponibles | 94,3 % — meilleur score des trois |
| Remote Labor Index | non communiqué | 15,8 % (Fable 5, record) | non communiqué |
| Fonctionnalité distinctive | GPT-4o Image, recherche web native, GPT personnalisés | mode Extended Thinking dans l’interface grand public | modèle multimodal unifié dans l’offre grand public |
Sources : Studeria, sauf mention contraire.
SWE-bench et GPQA Diamond : ce que mesurent réellement les scores de code et de raisonnement
SWE-bench Verified évalue la capacité d’un modèle à résoudre de vrais tickets GitHub, avec un code qui doit compiler et passer les tests existants. À son lancement, Claude Opus 4.6 y affichait 80,8 %, un score légèrement supérieur à celui de Gemini 3.1 Pro (80,6 %) et à celui de GPT-5.2 (environ 80 %), selon les chiffres publiés par Studeria. L’écart entre les trois modèles tenait alors à moins d’un point de pourcentage.
Cet écart n’a pas duré. Une version ultérieure de GPT a ensuite porté ce même score à 87,6 % sur SWE-bench Verified, toujours selon la même source. En quelques mois, un avantage marginal côté Anthropic s’est transformé en un déficit de près de sept points sur ce benchmark précis — un rythme de mise à jour qui rend toute hiérarchie figée peu fiable au-delà de quelques semaines.
Sur GPQA Diamond, un test de raisonnement scientifique de niveau doctorat, Gemini 3.1 Pro obtient 94,3 %, le meilleur résultat des trois modèles d’après Studeria. Aucune source de ce comparatif ne fournit de score équivalent, daté et vérifiable, pour Claude ou pour GPT sur ce même benchmark : la case reste marquée « non communiqué » plutôt que comblée par une estimation.
Ces scores mesurent des tâches précises, pas une compétence générale. Le comparatif publié par Gmelius, qui met en regard six assistants dont ChatGPT, Gemini, Copilot, Claude, Perplexity et Grok, rappelle qu’un score de benchmark élevé ne garantit pas une supériorité constante sur des usages quotidiens comme la rédaction ou la synthèse de documents. Un modèle premier sur SWE-bench peut rester en retrait sur d’autres tâches non couvertes par ce test.
Extended Thinking, GPT-4o Image, multimodalité unifiée : ce que chaque interface propose en plus
Les trois éditeurs ne se distinguent pas uniquement par des scores de benchmarks : leurs interfaces grand public embarquent des fonctionnalités différentes qui pèsent sur le choix au quotidien.
ChatGPT intègre la génération d’images via GPT-4o Image, une fonction de recherche web native directement dans la conversation, et la possibilité de créer des GPT personnalisés pour des tâches répétitives. Cette combinaison en fait une interface orientée vers la polyvalence d’usage plutôt que vers une spécialité unique.
Claude Opus 4.6 propose de son côté un mode Extended Thinking, visible directement dans l’interface grand public plutôt que réservé à l’API. Ce mode correspond à une « réflexion avant réponse », selon la formulation employée par ia-pratique.fr : le modèle expose ses étapes de raisonnement avant de livrer une réponse finale, ce qui facilite la vérification du cheminement sur des tâches complexes. Anthropic a par ailleurs coiffé sa gamme avec Fable 5, lancé le 10 juin 2026, qui détient le record du Remote Labor Index avec 15,8 % selon Studeria — un indicateur qui mesure la part de tâches professionnelles qu’un modèle peut mener à terme sans intervention humaine.
Gemini met en avant un modèle multimodal unifié dans son offre grand public : texte, image et autres formats sont traités par un seul et même modèle plutôt que par des composants séparés, d’après la documentation compilée par Studeria. Combinée à la fenêtre de contexte large partagée par les trois éditeurs, cette approche unifiée facilite l’analyse de documents volumineux mêlant plusieurs formats dans une même session.
20 dollars par mois : le tarif d’entrée identique chez les trois éditeurs
Sur le plan tarifaire, les trois assistants convergent. ChatGPT Plus, Claude Pro et Gemini Advanced sont chacun proposés autour de 20 dollars par mois pour un usage grand public, selon le comparatif de Studeria. Aucun des trois éditeurs ne se différencie par un prix d’appel plus bas ou plus élevé sur cette offre de référence.
Cette convergence tarifaire déplace la décision d’achat vers les fonctionnalités et les scores de performance plutôt que vers le coût direct. Les tarifs d’accès par API — facturés au token plutôt qu’à l’abonnement — ne sont pas détaillés dans les sources consultées pour ce comparatif ; ce point reste à vérifier directement sur la documentation tarifaire de chaque éditeur avant tout usage professionnel via API.
Fable 5, GPT et Gemini 3.5 : une hiérarchie qui a changé en quelques mois
Le classement établi au premier trimestre 2026 ne tient plus en l’état quelques mois plus tard. D’après Studeria, dès juillet 2026, GPT-5.5, Claude Opus 4.8 et Gemini 3.5 sont considérés comme des modèles de niveau comparable — la hiérarchie qui prévalait deux ans plus tôt n’existe plus sous cette forme.
Ce mouvement suit la sortie de Fable 5 le 10 juin 2026, qui a repositionné Claude sur le terrain des tâches professionnelles longues grâce à son score de 15,8 % sur le Remote Labor Index, et la mise à jour de GPT qui a fait grimper son score SWE-bench Verified à 87,6 %. Le comparatif publié par Spliiit élargit la focale à un quatrième acteur, Grok, signe que le marché des assistants généralistes ne se limite plus à trois éditeurs et que les mises à jour de rang s’y succèdent à un rythme trimestriel plutôt qu’annuel.
Pour un choix qui doit rester valable plusieurs mois, retenir une version précise de modèle a donc moins d’intérêt que suivre la cadence de mise à jour propre à chaque éditeur.
Pour quel profil choisir ChatGPT, Claude ou Gemini ?
Débutant ou usage occasionnel. ChatGPT reste l’option la plus polyvalente grâce à la génération d’images intégrée (GPT-4o Image), la recherche web native et les GPT personnalisés, qui couvrent un large éventail de tâches sans configuration technique. Ce profil valorise la diversité de fonctionnalités plutôt qu’un score de benchmark spécifique.
Usage professionnel quotidien (rédaction, analyse, synthèse). Claude Opus 4.6, avec son mode Extended Thinking visible dans l’interface grand public, convient aux tâches où la vérification du raisonnement compte autant que la réponse finale. Son score de 80,8 % sur SWE-bench Verified au lancement et le record de 15,8 % au Remote Labor Index tenu par Fable 5 en font une option solide pour des tâches professionnelles étendues.
Développeur ou intégrateur technique. Ce profil pose des questions différentes, du type « Comment fonctionne un API REST ? » avant de choisir un fournisseur : la documentation d’intégration, la stabilité de l’API et la fenêtre de contexte disponible en usage programmatique pèsent plus que l’interface grand public. Gemini 3.1 Pro, avec son score de 94,3 % sur GPQA Diamond et sa fenêtre de contexte extensible à environ 1 million de tokens, s’adresse particulièrement aux intégrations qui traitent de gros volumes de documents ou des tâches de raisonnement scientifique.
Aucun des trois modèles ne domine sur l’ensemble des critères réunis dans ce comparatif. Le choix dépend du critère qui pèse le plus dans l’usage visé — code, raisonnement scientifique, ou polyvalence d’interface.
Questions fréquentes
Quel modèle a la plus grande fenêtre de contexte ?
D’après la documentation compilée par Studeria, les trois modèles flagship peuvent atteindre environ 1 million de tokens de fenêtre de contexte, selon le plan souscrit et le mode d’utilisation. Aucune source de ce comparatif ne documente un écart chiffré entre les trois au-delà de ce seuil commun.
Quelles versions de modèles sont comparées dans cet article ?
Le comparatif s’appuie sur GPT-5.2 puis une version ultérieure de GPT ayant atteint 87,6 % sur SWE-bench Verified, sur Claude Opus 4.6 et Fable 5 (lancé le 10 juin 2026), et sur Gemini 3.1 Pro. Des mises à jour plus récentes — GPT-5.5, Claude Opus 4.8, Gemini 3.5 — sont mentionnées comme de niveau comparable dès juillet 2026.
- Studeria — studeria.fr
- Gmelius — gmelius.com
- ia-pratique.fr — ia-pratique.fr
- Spliiit — spliiit.com
