Depuis deux ans, le critère de choix d'une intelligence artificielle générative était la qualité de ses réponses. Depuis le 13 août 2026, un autre paramètre s'impose dans les discussions techniques : la vitesse pure d'exécution, mesurée en tokens générés par seconde. Ce jour-là, OpenAI et Cerebras ont présenté Ultrafast, un nouveau palier de l'API d'OpenAI qui fait tourner le modèle GPT-5.6 Sol à un débit revendiqué de 750 tokens de sortie par seconde, soit jusqu'à 14 fois la vitesse du traitement standard. Au même moment, Google a mis en avant Gemini 3.7 Flash, un modèle pensé pour le code, le raisonnement et les agents automatisés, ces programmes capables d'enchaîner des actions sans validation humaine à chaque étape. Le mot Flash désigne, chez Google, toute une famille de modèles volontairement optimisés pour la rapidité plutôt que pour la puissance brute.
Le 13 août 2026, la vitesse devient un produit à part entière
Un token correspond à un fragment de mot que le modèle génère l'un après l'autre. Plus ce débit est élevé, moins l'utilisateur perçoit d'attente, à l'écrit comme à l'oral. Un délai de plusieurs secondes reste tolérable pour un rapport de recherche approfondi lancé en arrière-plan. Il devient problématique dès que l'IA doit répondre en temps réel : conversation vocale, correction de code pendant la frappe, service client automatisé. C'est précisément ce créneau que vise Ultrafast, disponible pour l'instant en aperçu limité auprès d'un groupe restreint de clients, avec un accès qui doit s'élargir à mesure que la capacité de Cerebras augmente. OpenAI travaille avec quatre entreprises pilotes issues du code, de la recherche financière, de l'IA vocale et du e-commerce pour identifier où cette vitesse crée une valeur réelle avant d'ouvrir plus largement l'accès.
Sous le capot : pourquoi un wafer entier va plus vite qu'un cluster de GPU
Le mur de la mémoire
Sur un cluster de processeurs graphiques classique, chaque token généré oblige à relire les poids du modèle depuis une mémoire externe à haute bande passante. Pour un modèle de grande taille, ce transfert représente des dizaines à des centaines de gigaoctets de données déplacées à chaque étape. C'est ce que les ingénieurs appellent le mur de la bande passante mémoire. Cerebras contourne ce goulot d'étranglement en gravant 44 gigaoctets de mémoire SRAM directement sur la puce, à côté des 900 000 cœurs de calcul de son processeur WSE-3, qui occupe la quasi-totalité d'une plaquette de silicium de 300 millimètres, soit une surface environ 56 fois supérieure à celle d'un processeur H100 de Nvidia. Les poids du modèle restent sur la puce et les tokens circulent d'une plaquette à l'autre sans repasser par un bus mémoire externe. Selon Cerebras, cette architecture se comporte bien à mesure que la taille des modèles augmente, ce qui laisserait présager un avantage de vitesse durable sur les futurs modèles de pointe.
Ce que rapportent les premiers clients
Le cabinet de trading quantitatif Jane Street indique, dans une déclaration citée par Tech Times, que le gain de vitesse permet à ses développeurs de travailler de façon plus concentrée et productive avec le modèle, un point sensible dans un métier où une décision perd de sa valeur en quelques secondes. Podium, qui conçoit des IA vocales pour la relation client, va plus loin : « Ultrafast a été inestimable pour notre pile vocale. La vitesse change complètement l'expérience d'appel pour les tâches complexes. » Basis, qui construit des expériences utilisateur synchrones, souligne que la limite d'un produit rapide n'est pas seulement le nombre de tokens par seconde mais aussi l'intelligence du modèle, et qu'Ultrafast combine les deux pour la première fois sans obliger à basculer vers un modèle plus petit. Rogo, plateforme de recherche financière, résume : « La vitesse ne rend pas seulement le produit plus agréable. Elle change ce que les gens peuvent réellement en faire. » Sachin Katti, vice-président en charge de la stratégie de calcul chez OpenAI, décrit ainsi l'approche : « We're starting with a small group of customers to learn where that speed creates meaningful value, and we'll use those learnings to inform how we expand the service over time. »
Une guerre des prix qui accompagne la guerre de la vitesse
Cette accélération n'est pas qu'une prouesse d'ingénieurs, c'est aussi un argument commercial. OpenAI et Anthropic ont entamé une baisse de leurs tarifs sur certains de leurs modèles au même moment, tandis que le laboratoire chinois DeepSeek a pris le chemin inverse en augmentant les siens. Le signal est clair : l'équilibre économique du secteur ne repose plus uniquement sur l'intelligence du modèle, mais aussi sur la capacité à livrer une réponse rapide à un coût maîtrisé. Côté infrastructure, l'accord signé en janvier 2026 entre OpenAI et Cerebras porte sur 750 mégawatts de capacité de calcul livrés jusqu'en 2028, pour une valeur rapportée à plus de 10 milliards de dollars par des sources proches des deux entreprises, incluant un prêt d'un milliard de dollars accordé par OpenAI à Cerebras. Les résultats du deuxième trimestre 2026 de Cerebras, publiés le 12 août, montrent une activité cloud et inférence en hausse de 281 % sur un an à 126 millions de dollars de revenus GAAP, pour une perte nette GAAP de 450,5 millions de dollars sur le trimestre, largement due à 377 millions de dollars de charges de rémunération en actions non décaissées. L'entreprise dispose de 25,4 milliards de dollars d'engagements de performance restants et de 8,6 milliards de dollars de liquidités.
Le chantier 2027 : les puces d'inférence spécialisées visent un déploiement industriel
Cerebras n'est pas seule sur ce marché. La start-up britannique Fractile, fondée en 2022 par Walter Goodwin, docteur en IA d'Oxford, serait en pourparlers pour lever environ 600 millions de dollars à une valorisation pré-monétaire de 6,5 milliards de dollars, selon Bloomberg, contre 220 millions de dollars levés en mai dernier. Fractile aurait déjà conclu un premier accord pour vendre environ 250 millions de dollars de puces à Anthropic, avec un déploiement prévu en 2027. Anthropic a par ailleurs confirmé son intention de concevoir ses propres puces face à la pénurie mondiale de matériel d'IA. Dans le même mouvement, la start-up d'inférence Etched aurait levé 700 millions de dollars lors d'un tour mené par Jane Street, portant sa valorisation à 21 milliards de dollars. Ces informations sont rapportées par Bloomberg via Business World et n'ont pas été confirmées par Anthropic ou Fractile eux-mêmes dans les sources consultées. Elles dessinent néanmoins un marché où l'horizon 2027, plutôt que 2026, correspond au moment où plusieurs de ces puces spécialisées quitteraient le stade de l'annonce pour celui du déploiement industriel.
Ce que cela change pour une DSI qui pilote plusieurs modèles
Le choix d'un modèle ne se limite plus à sa note sur un benchmark. Il dépend de l'usage visé, et donc de la famille de modèle appropriée.
| Usage | Priorité | Type de modèle adapté |
|---|---|---|
| Rapport de recherche approfondi | Qualité, exhaustivité | Modèle de raisonnement, temps de réflexion long |
| Assistant vocal en temps réel | Vitesse, fluidité | Modèle Flash ou mode Ultrafast |
| Correction de code en direct | Réactivité immédiate | Modèle Flash optimisé code |
| Génération d'image ou de vidéo complexe | Qualité visuelle | Modèle spécialisé, temps de calcul plus long accepté |
Sur le plan tarifaire, la page de prix de GPT-5.6 Sol affiche, pour les modes Standard et Fast, 5 dollars par million de tokens en entrée et 30 dollars par million de tokens en sortie (tarifs américains, hors toute conversion ou fiscalité française). OpenAI n'a communiqué aucun tarif pour Ultrafast, aucune date de disponibilité générale confirmée, et le mode ne dispose même pas encore d'un identifiant de modèle distinct dans la documentation de l'API. Pour une DSI française qui pilote plusieurs fournisseurs sous un abonnement unique, comme le permet Moon AI avec plus de 70 modèles GPT, Claude, Gemini, Mistral, DeepSeek, Llama, Grok, Qwen et son modèle maison Moon 6, à des tarifs publics allant de 9,90 euros TTC par siège et par mois pour l'offre Lune à 249,90 euros pour l'offre Univers, la question posée par Ultrafast n'est pas seulement celle de la fluidité vocale. C'est aussi celle du trajet des données pendant la fraction de seconde où elles quittent l'infrastructure européenne pour rejoindre les serveurs de Cerebras ou d'OpenAI aux États-Unis. Moon AI héberge son application et son stockage chez OVHcloud, à Strasbourg et Roubaix, et applique Moon Blur, un procédé qui remplace les données personnelles par des jetons avant l'envoi aux modèles tiers, puis les rétablit au retour. Ce procédé étant réversible, il s'agit d'une pseudonymisation au sens de l'article 4-5 du RGPD, et non d'une anonymisation : les requêtes elles-mêmes partent bien vers les fournisseurs tiers, une fois les données personnelles masquées.
Les réserves à garder en tête avant de bâtir une architecture dessus
Tous les chiffres attachés à Ultrafast, le facteur 14, les comparaisons avec les modèles concurrents, proviennent d'OpenAI et de Cerebras eux-mêmes, pas d'un organisme de test indépendant. Les tests Humanity's Last Exam et GDP-Val cités dans les documents de Cerebras ont été menés par Cerebras, pas par un évaluateur externe. Le service reste en aperçu limité, réservé à une liste d'attente, sans prix publié ni date de disponibilité générale confirmée. Une DSI qui envisage de router du trafic de production vers Ultrafast doit donc surveiller la documentation de l'API OpenAI pour l'attribution d'un identifiant de modèle et ne pas présumer d'un calendrier fixe, ni d'un alignement du prix sur celui du mode Standard.
Questions fréquentes
Ultrafast d'OpenAI est-il déjà accessible aux entreprises françaises ?
Non. Le service est en aperçu limité, ouvert par invitation à un petit groupe de clients issus du code, de la finance, de l'IA vocale et du e-commerce. OpenAI indique que l'accès s'élargira au fil de la montée en capacité de Cerebras, sans date de disponibilité générale confirmée.
Le mode Ultrafast coûte-t-il plus cher que le traitement standard ?
L'éditeur n'a communiqué aucun tarif pour Ultrafast. Seuls les modes Standard et Fast de GPT-5.6 Sol ont un prix public, 5 dollars par million de tokens en entrée et 30 dollars par million de tokens en sortie. Aucune information ne permet d'estimer le surcoût, s'il existe, du mode Ultrafast.
Une inférence plus rapide change-t-elle les obligations de conformité d'une entreprise française ?
La vitesse d'exécution ne modifie pas en soi la question du lieu de traitement des données. Les requêtes envoyées à un modèle hébergé aux États-Unis, qu'elles soient traitées en mode standard ou ultra-rapide, quittent l'infrastructure européenne. Des dispositifs de pseudonymisation, comme Moon Blur chez Moon AI, réduisent l'exposition des données personnelles avant cet envoi, mais ne suppriment pas le fait que la requête parte bien vers le fournisseur tiers.
Faut-il attendre 2027 pour voir l'effet de ces puces spécialisées ?
Les annonces d'août 2026 (Ultrafast, Gemini 3.7 Flash) sont déjà en aperçu ou en disponibilité restreinte. Les informations rapportées par Bloomberg sur Fractile évoquent en revanche un déploiement de puces chez Anthropic prévu pour 2027, ce qui suggère que l'essentiel du basculement matériel vers l'inférence ultra-rapide à grande échelle se jouera sur les deux prochaines années plutôt qu'immédiatement.