Aller au contenu principal
Produit — Équipe Moon AI 7 min de lecture

Benchmarks IA août 2026 : Claude Opus 5, GPT-5.6, Kimi K3 et Gemini 3.1 comparés

Tous les scores officiels des modèles sortis en 2026 : Claude Opus 5, GPT-5.6 Sol, Gemini 3.1 Pro, Kimi K3, DeepSeek-V4 et Grok 4.5. Six graphiques, chaque chiffre avec sa condition de mesure et sa source. Relevé du 2 août 2026.

Benchmarks IA août 2026 : Claude Opus 5, GPT-5.6, Kimi K3 et Gemini 3.1 comparés
Benchmarks IA août 2026 : Claude Opus 5, GPT-5.6, Kimi K3 et Gemini 3.1 comparés

Six modèles de premier plan sont sortis entre février et juillet 2026 : Claude Opus 5, GPT-5.6, Gemini 3.1 Pro, Kimi K3, DeepSeek-V4 et Grok 4.5. Cet article rassemble leurs scores officiels, chacun avec sa condition de mesure et un lien vers sa source. Tous les graphiques ont été construits à partir de ces chiffres, relevés le 2 août 2026.

La question revient à chaque sortie : quel est le meilleur modèle d'IA ? Les annonces des éditeurs donnent des pourcentages impressionnants, mais elles ne mesurent pas toutes la même chose, et presque jamais dans les mêmes conditions. Nous avons relevé les scores publiés par Anthropic, OpenAI, Google DeepMind, Moonshot AI, DeepSeek, xAI, Mistral AI, Meta et Alibaba, puis vérifié chaque chiffre à sa source primaire.

Le classement sur GPQA Diamond

GPQA Diamond réunit 198 questions de niveau doctorat en biologie, physique et chimie, écrites pour résister à la recherche web. C'est le benchmark le plus largement publié par les éditeurs, donc celui qui permet la comparaison la plus large.

Graphique en barres des scores GPQA Diamond en aout 2026 : GPT-5.6 Sol 94,6 %, Gemini 3.1 Pro 94,3 %, Claude Mythos 5 94,1 %, Kimi K3 93,5 %, Grok 4.5 93,1 %, GLM-5.2 91,2 %, DeepSeek-V4-Pro 90,1 %, Llama 4 Maverick 69,8 %
Les cinq premiers se tiennent en un point et demi. À ce niveau de saturation, l'écart n'est plus significatif : le benchmark approche de son plafond.

Le constat important n'est pas l'ordre du classement, c'est le tassement du haut de tableau. Quand cinq modèles de quatre éditeurs différents se tiennent en 1,5 point, le benchmark ne discrimine plus. Il reste utile pour situer les modèles ouverts, où l'écart est réel : Llama 4 Maverick est 24 points derrière.

Pourquoi ces chiffres ne sont pas comparables entre eux

C'est le point que la plupart des comparatifs omettent. Un même benchmark se mesure de façons différentes, et l'écart entre deux protocoles dépasse souvent l'écart entre deux modèles.

La démonstration la plus nette vient de Humanity's Last Exam, un examen de 2 500 questions expertes. Voici les mêmes modèles, sur les mêmes questions, sans outils puis avec outils.

Graphique des scores Humanity's Last Exam sans outils : Claude Mythos 5 59 %, Claude Fable 5 56,5 %, Claude Opus 5 56,3 %, Gemini 3.1 Deep Think 48,4 %, Gemini 3.1 Pro 44,4 %, Kimi K3 43,5 %, Claude Sonnet 5 43,2 %, GLM-5.2 40,5 %
Sans outils : le modèle répond avec son seul raisonnement.
Graphique des scores Humanity's Last Exam avec outils : Claude Opus 5 64,7 %, Claude Sonnet 5 57,4 %, Gemini 3.1 Deep Think 53,4 %, Gemini 3.1 Pro 51,4 %, Kimi K2 Thinking 44,9 %
Avec outils : recherche web et exécution de code autorisées. Claude Opus 5 passe de 56,3 % à 64,7 %, soit plus de 8 points gagnés par le seul changement de protocole.

Huit points d'écart pour un seul et même modèle. C'est davantage que l'écart qui sépare les trois premiers du classement précédent. Un comparatif qui placerait le score « avec outils » de l'un face au score « sans outils » de l'autre produirait un classement faux.

Autre exemple, sur SWE-bench Verified : Anthropic mesure sur un sous-ensemble de 500 problèmes, avec effort maximal et moyenne sur 5 essais. Google publie une tentative unique sur le jeu complet. Les deux chiffres sont exacts, aucun des deux n'est comparable à l'autre.

La mesure indépendante

Une seule source applique le même protocole à tous les modèles : l'indice composite d'Artificial Analysis, qui agrège neuf évaluations passées par un tiers. C'est la comparaison la plus honnête disponible, avec une réserve importante : les modèles Anthropic n'y figuraient pas au moment du relevé.

Graphique de l'indice Artificial Analysis v4.1 : GPT-5.6 Sol 58,9, Kimi K3 57, GPT-5.6 Terra 55, Grok 4.5 53,8, GPT-5.6 Luna 51,2, GLM-5.2 51, Mistral Medium 3.5 30, Qwen3-235B 18, Mistral Large 3 16, Llama 4 Maverick 14
Indice composite de neuf évaluations, même protocole pour tous. L'écart entre les modèles propriétaires de tête et les modèles à poids ouverts reste net.

Le raisonnement abstrait, vérifié par un tiers

ARC-AGI-2 mesure la capacité à inférer une règle nouvelle à partir de quelques exemples, sur des problèmes conçus pour ne ressembler à rien de présent dans les données d'entraînement. Les scores sont vérifiés et publiés par la fondation ARC Prize, sur un jeu semi-privé.

Graphique des scores ARC-AGI-2 verifies par la fondation ARC Prize : Claude Opus 5 90,4 %, Gemini 3.1 Pro 77,1 %, Kimi K3 60,4 %, Grok 4.5 52,6 %
C'est le seul benchmark de cette sélection où un modèle se détache franchement. Claude Opus 5 devance de 13 points le suivant, et passe de 72,1 % à 90,4 % par rapport à la génération précédente d'Anthropic.

Les agents en ligne de commande

Terminal-Bench mesure ce qui compte pour un usage professionnel : la capacité à mener une tâche d'ingénierie de bout en bout dans un terminal, en enchaînant des commandes. C'est le benchmark le plus proche du travail réel, et le plus sensible au harnais d'exécution.

Graphique des scores Terminal-Bench 2.1 : GPT-5.6 Sol 88,8 %, Kimi K3 88,3 %, Claude Mythos 5 88 %, GPT-5.6 Terra 87,4 %, Claude Fable 5 84,3 %, Grok 4.5 83,3 %, GLM-5.2 82,7 %, DeepSeek-V4-Flash 82,7 %, Claude Sonnet 5 80,4 %
Neuf modèles en huit points. Attention : GPT-5.6 Sol atteint 91,9 % dans un réglage à quatre agents en parallèle, contre 88,8 % en configuration mono-agent. Seul le second chiffre est comparable aux autres.

Tableau complet des scores relevés

Chaque ligne porte sa condition de mesure et un lien vers la source primaire.

ModèleÉditeurSortieBenchmarkScoreCondition
Claude Opus 5Anthropic24/07/2026SWE-bench Verified96 %sous-ensemble de 500 problèmes, effort maximal, moyenne sur 5 essais
Claude Opus 5Anthropic24/07/2026ARC-AGI-290,4 %jeu semi-privé, vérifié par la fondation ARC Prize
Claude Opus 5Anthropic24/07/2026Humanity's Last Exam56,3 % sans outils, 64,7 % avecraisonnement seul, puis avec recherche web et exécution de code
Claude Opus 5Anthropic24/07/2026IMO 202642 sur 42olympiade internationale de mathématiques, sans outils, médaille d'or
Claude Mythos 5Anthropic24/07/2026GPQA Diamond94,1 %198 questions, moyenne sur 5 essais
GPT-5.6 SolOpenAI09/07/2026GPQA Diamond94,6 %condition non précisée par l'éditeur
GPT-5.6 SolOpenAI09/07/2026Terminal-Bench 2.188,8 % mono-agent, 91,9 % multi-agentsconfiguration par défaut, puis réglage à quatre agents en parallèle
Gemini 3.1 ProGoogle DeepMind19/02/2026GPQA Diamond94,3 %sans outils
Gemini 3.1 ProGoogle DeepMind19/02/2026SWE-bench Verified80,6 %codage agentique, tentative unique
Kimi K3Moonshot AI27/07/2026GPQA Diamond93,5 %effort de raisonnement maximal, sans outils
Kimi K3Moonshot AI27/07/2026Terminal-Bench 2.188,3 %harnais Kimi Code, effort maximal
DeepSeek-V4-ProDeepSeek24/04/2026SWE-bench Verified80,6 %mode Think Max. 73,6 % sans raisonnement étendu
Grok 4.5xAI2026GPQA Diamond93,1 %mesure indépendante Artificial Analysis, variante high
Mistral Medium 3.5Mistral AI22/05/2026SWE-bench Verified77,6 %condition non précisée par l'éditeur
Llama 4 MaverickMeta05/04/2025GPQA Diamond69,8 %modèle instruction-tuned, 0-shot

Quel modèle choisir selon la tâche

BesoinCe que disent les chiffres relevés
Raisonnement abstrait, problèmes inéditsClaude Opus 5 domine ARC-AGI-2 avec 90,4 %, vérifié par un tiers, 13 points devant le suivant.
Mathématiques de compétitionClaude Opus 5 obtient 42 sur 42 à l'olympiade internationale 2026, sans outils. Le seuil de la médaille d'or était à 29.
Agent de code en terminalGPT-5.6 Sol et Kimi K3 se tiennent en un demi-point sur Terminal-Bench 2.1, à configuration mono-agent comparable.
Sciences et connaissances expertesCinq modèles en 1,5 point sur GPQA Diamond. Le critère de choix se déplace vers le prix et la conformité.
Budget maîtrisé, poids ouvertsDeepSeek-V4-Pro tient 90,1 % sur GPQA Diamond et 80,6 % sur SWE-bench Verified, à un coût très inférieur.
Souveraineté et françaisMistral Medium 3.5 atteint 77,6 % sur SWE-bench Verified, avec un éditeur et des modèles européens.

Accéder à ces modèles depuis la France

Souscrire séparément chez chaque éditeur revient cher et disperse les données entre plusieurs fournisseurs, souvent facturés en dollars et soumis au droit américain. Moon AI réunit plus de 70 modèles dans un seul abonnement à partir de 9,90 € TTC par mois et par siège, avec bascule d'un modèle à l'autre au sein d'une même conversation. L'application et le stockage sont hébergés chez OVHcloud à Strasbourg et Roubaix, et les requêtes envoyées aux modèles tiers sont anonymisées au préalable par Moon Blur, sur 145 catégories de données personnelles.

Le détail plateforme par plateforme figure sur notre comparatif, avec une page dédiée par concurrent : face à ChatGPT Plus, face à Claude Pro, face à Google AI Pro, face à Mistral. Les tarifs des cinq paliers sont sur la page tarifs.

Questions fréquentes

Quel est le meilleur modèle d'IA en août 2026 ?

Aucun modèle ne domine tous les classements. Sur le raisonnement abstrait mesuré par la fondation ARC Prize, Claude Opus 5 est nettement devant avec 90,4 % sur ARC-AGI-2. Sur les questions scientifiques de GPQA Diamond, les cinq premiers se tiennent en un point et demi, ce qui n'est plus un écart significatif. Sur les agents en terminal, GPT-5.6 Sol et Kimi K3 sont au coude à coude. La question utile n'est donc pas de désigner un vainqueur mais de choisir selon la tâche, ce que permet une plateforme qui les réunit tous.

Ces scores sont-ils comparables entre eux ?

Pas directement, et c'est le point que la plupart des comparatifs passent sous silence. Anthropic mesure SWE-bench Verified sur un sous-ensemble de 500 problèmes avec une moyenne sur 5 essais, quand Google publie une tentative unique sur le jeu complet. Sur Humanity's Last Exam, Claude Opus 5 passe de 56,3 % à 64,7 % selon qu'il dispose ou non d'outils. Comparer deux chiffres mesurés dans des conditions différentes n'a pas de sens. Chaque score de cet article est donc accompagné de sa condition.

Où puis-je utiliser ces modèles en France ?

La plupart nécessitent un abonnement distinct chez chaque éditeur, souvent facturé en dollars. Moon AI réunit plus de 70 modèles dans un seul abonnement à partir de 9,90 € TTC par mois et par siège, avec l'application et le stockage hébergés chez OVHcloud en France. Les requêtes envoyées aux modèles tiers sont anonymisées au préalable par Moon Blur.

À quelle fréquence ces chiffres changent-ils ?

Vite. Entre février et juillet 2026, six modèles de premier plan sont sortis. Les scores de cet article ont été relevés le 2 août 2026 sur les annonces et model cards officielles. En cas d'écart avec une page d'éditeur, c'est celle-ci qui fait foi, et nous corrigeons sur signalement.

Méthode. Les scores ont été relevés le 2 août 2026 sur les annonces officielles, model cards et rapports techniques des éditeurs, puis vérifiés une seconde fois à ces mêmes sources. Les graphiques sont réalisés par Moon AI à partir de ces chiffres : nous ne reproduisons pas les visuels des éditeurs, qui leur appartiennent. Les échelles partent de zéro et vont jusqu'à 100 pour les pourcentages, afin de ne pas exagérer visuellement les écarts. Un chiffre vous semble faux ? Écrivez à contact@stellarrstudio.com, nous corrigeons.

Prêt à essayer Moon AI ?

À partir de 9,90 € TTC/mois. 70+ modèles IA, Moon Blur et génération de documents inclus. Sans engagement.

Démarrer