---
title: "Qwen3.8-Max et Kimi K3 défient les abonnements IA américains"
url: "https://realmoon.ai/actualites/qwen3-8-max-kimi-k3-poids-ouverts-dsi-francaises"
date_published: "2026-08-06T16:25:56+00:00"
date_modified: "2026-08-07T06:37:43+00:00"
author: "Veille Moon AI"
category: "Tendances"
publisher: "Moon AI (Stellarr Studio SAS)"
language: fr
license: "Citation autorisée avec lien vers la source. Réutilisation intégrale soumise à accord."
ai_generated: true
human_reviewed: false
editorial_policy: "https://realmoon.ai/actualites/methode"
sources:
  - "https://news.ycombinator.com/item?id=49150470"
  - "https://github.com/MoonshotAI/Kimi-K3"
  - "https://apps.apple.com/us/app/kimi-kimi-k3-is-live/id6474233312"
  - "https://huggingface.co/unsloth/Kimi-K3"
  - "https://developers.cloudflare.com/ai/models/moonshotai/kimi-k3/"
  - "https://en.wikipedia.org/wiki/Thinking_Machines_Lab"
---

# Qwen3.8-Max et Kimi K3 défient les abonnements IA américains

*Le fil Hacker News consacre a Qwen3.8-Max a depasse les 600 commentaires en trois jours, porte par des utilisateurs qui disent avoir resilie leur abonnement Claude pour un modele local de la meme famille. Au meme moment, le modele chinois Kimi K3 de Moonshot AI affiche des scores de benchmark proches de Claude Opus 4.8 et GPT-5.5, et la startup americaine Thinking Machines Lab a du publier son propre modele ouvert, Inkling, pour repondre a cette pression.*

> Article produit par la veille automatisée de Moon AI, sans relecture humaine préalable, conformément à l'article 50 du règlement (UE) 2024/1689. Méthode et politique de correction : https://realmoon.ai/actualites/methode

## Qwen3.8-Max, symptome d'une bascule vers les modeles locaux

Publie sur qwen.ai sous le titre « Qwen3.8-Max: A New Bar for Coding and Cowork », l'article a recueilli 1 113 points et 609 commentaires en trois jours sur Hacker News. Les sources disponibles ne detaillent pas l'architecture ni la licence exacte de Qwen3.8-Max: le fil de discussion porte surtout sur la generation precedente, Qwen3.6, presentee par plusieurs utilisateurs comme la meilleure alternative locale du moment.

Un utilisateur, nozzlegear, resume le phenomene: « Qwen3.6-35B is my daily driver for AI, and what convinced me to cancel my Claude subscription back in April. » Un autre temoignage, celui de trollbridge, decrit comment un collegue sceptique a fini par faire tourner Qwen-3.6-35B-A3B sur une carte graphique RTX 5090 qui ne servait a rien, via le harnais OpenCode, avant qu'une partie des usages ne bascule vers un autre modele ouvert, DS-V4-Flash-0731.

Un commentateur, toshinoriyagi, avance qu'une version Qwen3.8-27B doit sortir en poids ouverts la semaine suivante. Cette information provient d'un commentaire de forum et n'est confirmee par aucune source officielle de l'editeur du modele: elle doit etre lue comme une anticipation d'utilisateur, pas comme une annonce arretee.

## Kimi K3: un poids ouvert qui talonne Claude et GPT sur les benchmarks

Le cas le plus documente dans les sources disponibles est celui de Kimi K3, publie par Moonshot AI. Le modele est decrit comme open-weight et multimodal, agentique nativement, avec 2,8 mille milliards de parametres au total, dont 104 milliards actives a chaque requete grace a une architecture MoE (Mixture-of-Experts) repartie sur 93 couches. Sa fenetre de contexte atteint 1 048 576 tokens, et il integre un encodeur visuel natif, MoonViT-V2.

Les poids sont publies sous la Kimi K3 License, qui autorise la recherche, le deploiement et les developpements derives. Le modele est accessible via une API compatible OpenAI et Anthropic sur platform.kimi.ai, ainsi que via Cloudflare Workers AI en tant que modele tiers: la tarification precise n'est consultable que dans le tableau de bord Cloudflare, les sources ne fournissant pas de chiffre. Pour l'inference, l'editeur recommande les moteurs vLLM, SGLang et TokenSpeed, avec une quantification native MXFP4/MXFP8 destinee a elargir la compatibilite materielle.

Le poids ouvert ne signifie pas application gratuite pour l'utilisateur final: sur l'App Store americain, l'application grand public Kimi propose des achats integres allant de 19 dollars a 199 dollars, avec des forfaits annuels pouvant atteindre 1 999 dollars. Cette tarification, en dollars et taxes americaines, concerne l'application mobile de Moonshot AI, pas l'usage des poids du modele en propre.

Sur une serie de benchmarks publics, Kimi K3 se positionne au niveau ou tres proche des modeles proprietaires americains les plus recents.

| Benchmark | Kimi K3 (max) | Claude Opus 4.8 | GPT-5.5 (xhigh) | GPT-5.6 Sol | Claude Fable 5 | GLM-5.2 |
| --- | --- | --- | --- | --- | --- | --- |
| GPQA Diamond | 93,5 | 91,0 | 93,5 | 94,1 | 92,6 | 91,2 |
| Terminal-Bench 2.1 | 88,3 | 84,6 | 83,4 | 88,8 | 88,0 | 82,7 |
| SWE-Marathon | 42,0 | 40,0 | 14,0 | 39,0 | 35,0 | 13,0 |
| FrontierSWE | 81,2 | 66,7 | 64,9 | 71,3 | 86,6 | 67,3 |
| BrowseComp | 91,2 | 84,3 | 84,4 | 90,4 | 88,0 | , |
| MCPMark-Verified | 94,5 | 76,4 | 92,9 | 92,9 | 87,4 | , |

## Meme les Etats-Unis repondent: le cas Thinking Machines Lab

La pression ne vient pas seulement de Chine. Thinking Machines Lab, fondee en fevrier 2025 par Mira Murati, ancienne directrice technique d'OpenAI, et valorisee 12 milliards de dollars lors d'un tour de financement de 2 milliards de dollars mene par Andreessen Horowitz (avec Nvidia, AMD, Cisco et Jane Street parmi les investisseurs), a publie son propre modele en poids ouverts, Inkling, le 15 juillet 2026, sous licence Apache. Le modele a ete partiellement entraine avec des donnees issues de Kimi K2.5, un modele anterieur de Moonshot AI.

Plusieurs medias cites par Wikipedia ont decrit Inkling comme une alternative americaine aux modeles a poids ouverts existants, en soulignant que les modeles a poids ouverts les plus competitifs de l'epoque etaient majoritairement developpes par des acteurs chinois. Une version reduite, Inkling Small, comptant 276 milliards de parametres et presentee comme d'une performance comparable, a suivi le 31 juillet 2026.

## Ce que l'auto-hebergement coute vraiment a une organisation

### Le materiel et la quantification, un budget cache

Sur Hacker News, un utilisateur, Aurornis, temoigne avoir fait tourner Qwen3.6-27B et 35B sur 32 Go de memoire locale pour des taches non liees au code, en laissant le modele travailler toute la nuit. Il precise toutefois que la qualite du code genere reste insuffisante avec les versions quantifiees testees, et que le calcul economique ne tient pas face aux API hebergees, sauf lorsque la contrainte impose que les donnees ne sortent pas du reseau local.

Un echange plus vif sur le meme fil illustre le cout cache d'un deploiement local: choisir entre ollama, llama.cpp ou mlx, trouver la version quantifiee adaptee a son materiel, calibrer la taille de la fenetre de contexte, puis mettre en place un harnais logiciel compatible, avant d'ajouter, si besoin, des outils de recherche web ou de traitement d'image. Rien de tout cela n'est impossible, mais rien n'est gratuit non plus en temps d'ingenieur.

### Les delais internes pesent autant que la technique

Un autre commentateur, jurgenburgen, rappelle une realite propre aux organisations: avant meme la question technique, il faut compter des mois d'attente pour que la securite valide l'outil, que le juridique donne son accord et que les achats terminent leur procedure, a moins de s'appuyer sur du materiel deja disponible dans les equipes. Pour une DSI francaise, cette remarque vaut autant pour un modele ouvert auto-heberge que pour un abonnement API etranger.

## Poids ouverts et souverainete: deux questions distinctes

Les sources disponibles ne permettent pas d'affirmer qu'un modele en poids ouverts garantit, par construction, une meilleure maitrise des donnees pour une entreprise francaise. Qwen, Kimi K3 et Inkling sont developpes respectivement par l'ecosysteme Qwen, par Moonshot AI (Chine) et par Thinking Machines Lab (Etats-Unis): aucun de ces acteurs n'est francais ni europeen. La licence des poids determine ce que l'on a le droit de faire du modele (le deployer, le modifier, l'integrer), pas l'endroit ou tournent les serveurs qui l'executent.

Une DSI qui telecharge les poids de Kimi K3 et les fait tourner sur une infrastructure hebergee en France maitrise la localisation de ce traitement precis. Mais elle reste seule responsable de la conformite du reste de la chaine: journalisation, sauvegardes, gestion des acces, sous-traitants eventuels. A l'inverse, une entreprise qui continue de payer un abonnement a un modele proprietaire americain sait au moins ou celui-ci est heberge, meme si ce n'est pas en France.

Entre ces deux extremes, des plateformes francaises comme Moon AI proposent un abonnement unique donnant acces a plus de 70 modeles, dont des variantes de la famille Qwen, sans que l'utilisateur ait a gerer lui-meme des GPU ou des quantifications. L'application et le stockage sont heberges chez OVHcloud, a Strasbourg et Roubaix. Un mecanisme nomme Moon Blur remplace les donnees personnelles par des jetons avant l'envoi aux modeles tiers, puis les retablit au retour: le procede etant reversible, il s'agit d'une pseudonymisation au sens de l'article 4-5 du RGPD, pas d'une anonymisation. Les requetes adressees aux modeles tiers partent bien, apres cette pseudonymisation, vers les infrastructures de leurs fournisseurs respectifs, qui ne sont pas necessairement situees en France.

Cette nuance vaut pour toute solution qui agrege des modeles etrangers, ouverts ou proprietaires: la pseudonymisation reduit l'exposition des donnees personnelles identifiantes, elle ne rend pas le traitement local par nature.

## Comparer les modeles sans confondre licence, gratuite et performance

| Modele | Editeur | Parametres | Contexte | Licence | Date connue |
| --- | --- | --- | --- | --- | --- |
| Qwen3.6-35B | non precise dans les sources | designation nominative (35B) | non precise | non precise | discussion Hacker News, aout 2026 |
| Kimi K3 | Moonshot AI | 2,8 T total / 104 Md actives | 1 048 576 tokens | Kimi K3 License | disponible en aout 2026 |
| Inkling | Thinking Machines Lab | non precise | non precise | Apache License | 15 juillet 2026 |
| Inkling Small | Thinking Machines Lab | 276 Md | non precise | Apache License (variante) | 31 juillet 2026 |

## Questions frequentes

### Qwen3.8-Max est-il disponible en poids ouverts ?

Les sources ne le confirment pas pour Qwen3.8-Max lui-meme. Un commentaire de forum evoque une version Qwen3.8-27B publiee en poids ouverts, mais cette information n'a pas ete verifiee auprès d'une source officielle de l'editeur.

### Peut-on faire tourner Kimi K3 sur l'infrastructure d'une entreprise ?

Techniquement oui: les poids sont publies sous la Kimi K3 License et des moteurs d'inference (vLLM, SGLang, TokenSpeed) sont recommandes, avec une quantification MXFP4/MXFP8 pour reduire l'empreinte materielle. Mais le modele compte 2,8 mille milliards de parametres au total, dont 104 milliards actives, ce qui suppose une infrastructure consequente meme en version quantifiee.

### Un modele open weight coute-t-il vraiment moins cher qu'un abonnement Claude ou GPT ?

Cela depend de l'usage. Sur Hacker News, plusieurs utilisateurs decrivent des usages personnels ou professionnels ou le seul cout residuel est celui de l'electricite, une fois le materiel amorti. Mais un autre temoignage souligne que, pour du code de production, le calcul economique ne tient pas toujours face a une API hebergee, sauf contrainte explicite de confidentialite des donnees.

### La souverainete se resume-t-elle au choix d'un modele ouvert ?

Non. Aucun des modeles cites dans cet article, Qwen, Kimi K3 ou Inkling, n'est developpe par une entreprise francaise. La licence des poids conditionne ce que l'on peut faire du modele, pas la localisation des serveurs qui l'executent ni la conformite de l'ensemble de la chaine de traitement des donnees.

> **Transparence.** Cet article a été rédigé par un système d'intelligence artificielle à partir des sources listées ci-dessous, puis vérifié fait par fait par un second système avant publication. Il n'a pas fait l'objet d'une relecture humaine préalable. Les chiffres et citations proviennent des sources ; en cas d'écart, la source fait foi. Notre [méthode, ses limites et notre politique de correction](https://realmoon.ai/actualites/methode).

> **Sources.** Article rédigé à partir des publications suivantes, consultées le 06/08/2026. En cas d'écart, la source fait foi. Signalez toute inexactitude à [contact@stellarrstudio.com](https://realmoon.ai/mailto:contact@stellarrstudio.com).
>
> - [https://news.ycombinator.com/item?id=49150470](https://news.ycombinator.com/item?id=49150470)
> - [https://github.com/MoonshotAI/Kimi-K3](https://github.com/MoonshotAI/Kimi-K3)
> - [https://apps.apple.com/us/app/kimi-kimi-k3-is-live/id6474233312](https://apps.apple.com/us/app/kimi-kimi-k3-is-live/id6474233312)
> - [https://huggingface.co/unsloth/Kimi-K3](https://huggingface.co/unsloth/Kimi-K3)
> - [https://developers.cloudflare.com/ai/models/moonshotai/kimi-k3/](https://developers.cloudflare.com/ai/models/moonshotai/kimi-k3/)
> - [https://en.wikipedia.org/wiki/Thinking_Machines_Lab](https://en.wikipedia.org/wiki/Thinking_Machines_Lab)

---

Source : https://realmoon.ai/actualites/qwen3-8-max-kimi-k3-poids-ouverts-dsi-francaises
