Six modèles de premier plan sont sortis entre février et juillet 2026 : Claude Opus 5, GPT-5.6, Gemini 3.1 Pro, Kimi K3, DeepSeek-V4 et Grok 4.5. Cet article rassemble leurs scores officiels, chacun avec sa condition de mesure et un lien vers sa source. Tous les graphiques ont été construits à partir de ces chiffres, relevés le 2 août 2026.
La question revient à chaque sortie : quel est le meilleur modèle d'IA ? Les annonces des éditeurs donnent des pourcentages impressionnants, mais elles ne mesurent pas toutes la même chose, et presque jamais dans les mêmes conditions. Nous avons relevé les scores publiés par Anthropic, OpenAI, Google DeepMind, Moonshot AI, DeepSeek, xAI, Mistral AI, Meta et Alibaba, puis vérifié chaque chiffre à sa source primaire.
Le classement sur GPQA Diamond
GPQA Diamond réunit 198 questions de niveau doctorat en biologie, physique et chimie, écrites pour résister à la recherche web. C'est le benchmark le plus largement publié par les éditeurs, donc celui qui permet la comparaison la plus large.
Le constat important n'est pas l'ordre du classement, c'est le tassement du haut de tableau. Quand cinq modèles de quatre éditeurs différents se tiennent en 1,5 point, le benchmark ne discrimine plus. Il reste utile pour situer les modèles ouverts, où l'écart est réel : Llama 4 Maverick est 24 points derrière.
Pourquoi ces chiffres ne sont pas comparables entre eux
C'est le point que la plupart des comparatifs omettent. Un même benchmark se mesure de façons différentes, et l'écart entre deux protocoles dépasse souvent l'écart entre deux modèles.
La démonstration la plus nette vient de Humanity's Last Exam, un examen de 2 500 questions expertes. Voici les mêmes modèles, sur les mêmes questions, sans outils puis avec outils.
Huit points d'écart pour un seul et même modèle. C'est davantage que l'écart qui sépare les trois premiers du classement précédent. Un comparatif qui placerait le score « avec outils » de l'un face au score « sans outils » de l'autre produirait un classement faux.
Autre exemple, sur SWE-bench Verified : Anthropic mesure sur un sous-ensemble de 500 problèmes, avec effort maximal et moyenne sur 5 essais. Google publie une tentative unique sur le jeu complet. Les deux chiffres sont exacts, aucun des deux n'est comparable à l'autre.
La mesure indépendante
Une seule source applique le même protocole à tous les modèles : l'indice composite d'Artificial Analysis, qui agrège neuf évaluations passées par un tiers. C'est la comparaison la plus honnête disponible, avec une réserve importante : les modèles Anthropic n'y figuraient pas au moment du relevé.
Le raisonnement abstrait, vérifié par un tiers
ARC-AGI-2 mesure la capacité à inférer une règle nouvelle à partir de quelques exemples, sur des problèmes conçus pour ne ressembler à rien de présent dans les données d'entraînement. Les scores sont vérifiés et publiés par la fondation ARC Prize, sur un jeu semi-privé.
Les agents en ligne de commande
Terminal-Bench mesure ce qui compte pour un usage professionnel : la capacité à mener une tâche d'ingénierie de bout en bout dans un terminal, en enchaînant des commandes. C'est le benchmark le plus proche du travail réel, et le plus sensible au harnais d'exécution.
Tableau complet des scores relevés
Chaque ligne porte sa condition de mesure et un lien vers la source primaire.
| Modèle | Éditeur | Sortie | Benchmark | Score | Condition |
|---|---|---|---|---|---|
| Claude Opus 5 | Anthropic | 24/07/2026 | SWE-bench Verified | 96 % | sous-ensemble de 500 problèmes, effort maximal, moyenne sur 5 essais |
| Claude Opus 5 | Anthropic | 24/07/2026 | ARC-AGI-2 | 90,4 % | jeu semi-privé, vérifié par la fondation ARC Prize |
| Claude Opus 5 | Anthropic | 24/07/2026 | Humanity's Last Exam | 56,3 % sans outils, 64,7 % avec | raisonnement seul, puis avec recherche web et exécution de code |
| Claude Opus 5 | Anthropic | 24/07/2026 | IMO 2026 | 42 sur 42 | olympiade internationale de mathématiques, sans outils, médaille d'or |
| Claude Mythos 5 | Anthropic | 24/07/2026 | GPQA Diamond | 94,1 % | 198 questions, moyenne sur 5 essais |
| GPT-5.6 Sol | OpenAI | 09/07/2026 | GPQA Diamond | 94,6 % | condition non précisée par l'éditeur |
| GPT-5.6 Sol | OpenAI | 09/07/2026 | Terminal-Bench 2.1 | 88,8 % mono-agent, 91,9 % multi-agents | configuration par défaut, puis réglage à quatre agents en parallèle |
| Gemini 3.1 Pro | Google DeepMind | 19/02/2026 | GPQA Diamond | 94,3 % | sans outils |
| Gemini 3.1 Pro | Google DeepMind | 19/02/2026 | SWE-bench Verified | 80,6 % | codage agentique, tentative unique |
| Kimi K3 | Moonshot AI | 27/07/2026 | GPQA Diamond | 93,5 % | effort de raisonnement maximal, sans outils |
| Kimi K3 | Moonshot AI | 27/07/2026 | Terminal-Bench 2.1 | 88,3 % | harnais Kimi Code, effort maximal |
| DeepSeek-V4-Pro | DeepSeek | 24/04/2026 | SWE-bench Verified | 80,6 % | mode Think Max. 73,6 % sans raisonnement étendu |
| Grok 4.5 | xAI | 2026 | GPQA Diamond | 93,1 % | mesure indépendante Artificial Analysis, variante high |
| Mistral Medium 3.5 | Mistral AI | 22/05/2026 | SWE-bench Verified | 77,6 % | condition non précisée par l'éditeur |
| Llama 4 Maverick | Meta | 05/04/2025 | GPQA Diamond | 69,8 % | modèle instruction-tuned, 0-shot |
Quel modèle choisir selon la tâche
| Besoin | Ce que disent les chiffres relevés |
|---|---|
| Raisonnement abstrait, problèmes inédits | Claude Opus 5 domine ARC-AGI-2 avec 90,4 %, vérifié par un tiers, 13 points devant le suivant. |
| Mathématiques de compétition | Claude Opus 5 obtient 42 sur 42 à l'olympiade internationale 2026, sans outils. Le seuil de la médaille d'or était à 29. |
| Agent de code en terminal | GPT-5.6 Sol et Kimi K3 se tiennent en un demi-point sur Terminal-Bench 2.1, à configuration mono-agent comparable. |
| Sciences et connaissances expertes | Cinq modèles en 1,5 point sur GPQA Diamond. Le critère de choix se déplace vers le prix et la conformité. |
| Budget maîtrisé, poids ouverts | DeepSeek-V4-Pro tient 90,1 % sur GPQA Diamond et 80,6 % sur SWE-bench Verified, à un coût très inférieur. |
| Souveraineté et français | Mistral Medium 3.5 atteint 77,6 % sur SWE-bench Verified, avec un éditeur et des modèles européens. |
Accéder à ces modèles depuis la France
Souscrire séparément chez chaque éditeur revient cher et disperse les données entre plusieurs fournisseurs, souvent facturés en dollars et soumis au droit américain. Moon AI réunit plus de 70 modèles dans un seul abonnement à partir de 9,90 € TTC par mois et par siège, avec bascule d'un modèle à l'autre au sein d'une même conversation. L'application et le stockage sont hébergés chez OVHcloud à Strasbourg et Roubaix, et les requêtes envoyées aux modèles tiers sont anonymisées au préalable par Moon Blur, sur 145 catégories de données personnelles.
Le détail plateforme par plateforme figure sur notre comparatif, avec une page dédiée par concurrent : face à ChatGPT Plus, face à Claude Pro, face à Google AI Pro, face à Mistral. Les tarifs des cinq paliers sont sur la page tarifs.
Questions fréquentes
Quel est le meilleur modèle d'IA en août 2026 ?
Aucun modèle ne domine tous les classements. Sur le raisonnement abstrait mesuré par la fondation ARC Prize, Claude Opus 5 est nettement devant avec 90,4 % sur ARC-AGI-2. Sur les questions scientifiques de GPQA Diamond, les cinq premiers se tiennent en un point et demi, ce qui n'est plus un écart significatif. Sur les agents en terminal, GPT-5.6 Sol et Kimi K3 sont au coude à coude. La question utile n'est donc pas de désigner un vainqueur mais de choisir selon la tâche, ce que permet une plateforme qui les réunit tous.
Ces scores sont-ils comparables entre eux ?
Pas directement, et c'est le point que la plupart des comparatifs passent sous silence. Anthropic mesure SWE-bench Verified sur un sous-ensemble de 500 problèmes avec une moyenne sur 5 essais, quand Google publie une tentative unique sur le jeu complet. Sur Humanity's Last Exam, Claude Opus 5 passe de 56,3 % à 64,7 % selon qu'il dispose ou non d'outils. Comparer deux chiffres mesurés dans des conditions différentes n'a pas de sens. Chaque score de cet article est donc accompagné de sa condition.
Où puis-je utiliser ces modèles en France ?
La plupart nécessitent un abonnement distinct chez chaque éditeur, souvent facturé en dollars. Moon AI réunit plus de 70 modèles dans un seul abonnement à partir de 9,90 € TTC par mois et par siège, avec l'application et le stockage hébergés chez OVHcloud en France. Les requêtes envoyées aux modèles tiers sont anonymisées au préalable par Moon Blur.
À quelle fréquence ces chiffres changent-ils ?
Vite. Entre février et juillet 2026, six modèles de premier plan sont sortis. Les scores de cet article ont été relevés le 2 août 2026 sur les annonces et model cards officielles. En cas d'écart avec une page d'éditeur, c'est celle-ci qui fait foi, et nous corrigeons sur signalement.
Méthode. Les scores ont été relevés le 2 août 2026 sur les annonces officielles, model cards et rapports techniques des éditeurs, puis vérifiés une seconde fois à ces mêmes sources. Les graphiques sont réalisés par Moon AI à partir de ces chiffres : nous ne reproduisons pas les visuels des éditeurs, qui leur appartiennent. Les échelles partent de zéro et vont jusqu'à 100 pour les pourcentages, afin de ne pas exagérer visuellement les écarts. Un chiffre vous semble faux ? Écrivez à contact@stellarrstudio.com, nous corrigeons.