---
title: "L'IA d'entreprise se heurte au réseau, pas aux puces"
url: "https://realmoon.ai/actualites/reseau-goulet-etranglement-clusters-ia-entreprises"
date_published: "2026-08-30T22:24:53+00:00"
author: "Veille Moon AI"
category: "Actualité IA"
publisher: "Moon AI (Stellarr Studio SAS)"
language: fr
license: "Citation autorisée avec lien vers la source. Réutilisation intégrale soumise à accord."
ai_generated: true
human_reviewed: false
editorial_policy: "https://realmoon.ai/actualites/methode"
sources:
  - "https://umesh-malik.com/blog/eliminate-pcie-bottleneck-ai-training"
  - "https://www.itechpost.com/articles/237157/20260827/networking-cool-again-how-ai-put-network-critical-path-view-inside-meta.htm"
  - "https://www.forbes.com/councils/forbestechcouncil/2026/08/26/the-infrastructure-challenge-the-biggest-bottleneck-in-enterprise-ai/"
  - "https://seniorexecutive.com/ai-data-centers-infrastructure-power-efficiency-flexibility/"
  - "https://www.franceinfo.fr/monde/usa/aux-etats-unis-la-societe-civile-s-organise-contre-les-cameras-de-surveillance-flock-fonctionnant-a-l-intelligence-artificielle_8159093.html"
  - "https://www.forbes.com/councils/forbestechcouncil/2026/08/27/the-ai-infrastructure-stack-is-being-rewritten-for-the-agentic-era/"
---

# L'IA d'entreprise se heurte au réseau, pas aux puces

*Les clusters d'intelligence artificielle butent de plus en plus rarement sur la puissance des puces et de plus en plus souvent sur la capacité du réseau à faire circuler les données entre elles. Des ingénieurs de Meta, ainsi que plusieurs experts cités par Forbes, décrivent une architecture où bande passante, latence et topologie déterminent le temps réel d'entraînement et d'inférence.*

> Article produit par la veille automatisée de Moon AI, sans relecture humaine préalable, conformément à l'article 50 du règlement (UE) 2024/1689. Méthode et politique de correction : https://realmoon.ai/actualites/methode

Pendant des années, la course à l'intelligence artificielle s'est résumée à une question simple : combien de GPU peut-on aligner ? Cette question perd de son sens. Plusieurs ingénieurs et dirigeants techniques, cités dans la presse spécialisée fin août 2026, convergent vers un même constat : au-delà d'un certain seuil, ce n'est plus la puce qui limite la vitesse d'un entraînement ou d'une inférence, c'est le réseau qui relie les puces entre elles, et la mémoire qui les alimente.

## Le réflexe « plus de GPU » ne suffit plus

Suman Debnath, directeur des relations développeurs et produit chez Crusoe, raconte le cas d'une entreprise d'IA physique convaincue qu'elle avait besoin de davantage de calcul. En observant la charge réelle, son équipe a découvert que les GPU déjà payés fonctionnaient à moins de 10 % d'utilisation. Le problème ne venait pas des accélérateurs, mais d'un pipeline de préparation des données incapable de les alimenter assez vite. Après une refonte du pipeline sur un moteur de calcul distribué open source, l'utilisation est passée au-dessus de 80 %, et l'entreprise a entraîné puis déployé ses modèles sur une infrastructure plus petite que celle qu'elle avait initialement demandée.

Ce constat illustre un basculement plus large. Debnath recommande d'établir une base de mesure avant tout achat de capacité : taux d'utilisation réel du parc de GPU, coût d'une requête au 95e percentile de latence, et localisation exacte du temps perdu entre l'arrivée d'une requête et la réponse. Il insiste aussi sur un point souvent négligé : le choix du modèle et celui de la pile de service ne sont pas deux décisions séparées. Un modèle plus petit, bien servi avec du batching, de la quantification et du cache, peut offrir une meilleure latence et un meilleur coût qu'un modèle plus grand mal exploité.

## Le vrai goulet : le trajet des données entre GPU et réseau

Sur le plan technique, le problème a un nom précis : le goulot d'étranglement PCIe. Dans une architecture classique, quand des GPU distants doivent synchroniser des gradients (une opération dite d'AllReduce, qui revient après chaque lot d'entraînement), les données parcourent un chemin coûteux : de la mémoire du GPU, à travers le bus PCIe, vers la mémoire hôte, puis via la pile réseau du processeur central, jusqu'à une carte réseau séparée, avant de traverser la fabrique réseau. Chaque étape ajoute de la latence et mobilise le processeur central.

Les chiffres publiés par Meta pour son projet de puce MTIA 300 rendent le problème concret. Un chemin GPU vers carte réseau via PCIe Gen4 x16 plafonne autour de 32 Go/s par direction, alors qu'une carte réseau RDMA à 800 Gbps peut pousser jusqu'à 100 Go/s. C'est donc le bus PCIe, et non le réseau, qui limite la chaîne, avec en prime un processeur central qui exécute un travail dont on voudrait le décharger. La réponse de Meta consiste à intégrer douze cartes réseau RDMA à 800 Gbps directement sur le boîtier de la puce, pour une bande passante agrégée de 1,2 To/s qui ne traverse jamais le bus PCIe ni le processeur hôte, soit plus de 37 fois la capacité d'un seul lien PCIe Gen4 x16. Des moteurs de messages dédiés prennent en charge les opérations collectives pendant que les unités de calcul restent libres, et des unités de calcul proches de la mémoire assurent plus de 2,8 To/s de débit de réduction, permettant d'exécuter les opérations AllReduce à la vitesse de la ligne.

Cette puce n'est pas commercialisée. Mais le principe qu'elle illustre l'est : minimiser le rôle du processeur hôte dans les échanges collectifs. Les recommandations qui en découlent pour des infrastructures classiques incluent l'usage du GPUDirect RDMA pour que les cartes réseau accèdent directement à la mémoire des GPU, le placement des cartes réseau et des GPU sur le même commutateur PCIe, et le recours à des réseaux natifs des fournisseurs cloud comme AWS EFA, GPUDirect TCPX de Google ou l'InfiniBand d'Azure.

| Architecture | Chemin de données pour un AllReduce | Bande passante crête | Rôle du processeur hôte |
| --- | --- | --- | --- |
| GPU avec carte réseau discrète | GPU → PCIe → CPU → carte réseau → fabrique | Environ 32 Go/s (limité par PCIe) | Sollicité à chaque opération |
| Puce avec cartes réseau intégrées (MTIA 300) | Accélérateur → puce réseau → fabrique | 1,2 To/s | Sollicité uniquement au démarrage |

## Un réseau à plusieurs étages, pas un tuyau unique

Prankur Gupta, ingénieur logiciel senior chez Meta et co-auteur de NetEdit (plateforme de gestion réseau présentée à la conférence SIGCOMM 2024), décrit un changement de nature plutôt que de degré. Selon lui, une charge d'entraînement moderne ne tourne pas sur un GPU mais sur des dizaines de milliers, qui doivent se comporter comme un seul accélérateur géant. « Le goulot d'étranglement s'est déplacé, et il est arrivé chez nous », résume-t-il. Ces charges sont dites bulk-synchronous : les GPU calculent, puis attendent qu'un échange collectif se termine avant de continuer. Un seul lien congestionné, une seule carte réseau défaillante, et des milliers de GPU restent inactifs. La métrique qui compte n'est plus la puissance de calcul brute, mais le goodput : la part du temps réel pendant laquelle le travail progresse effectivement.

Gupta décompose l'infrastructure en trois niveaux aux physiques différentes. À l'intérieur d'un rack, un domaine dit scale-up relie les accélérateurs par une fabrique à très haute bande passante et à latence inférieure à la microseconde. En sortant du rack, le domaine scale-out utilise de l'Ethernet avec RoCE ou de l'InfiniBand en topologie Clos, où la bande passante par GPU chute d'un ordre de grandeur. Un troisième niveau, scale-across, relie les centres de données entre eux. Deux problèmes de congestion s'y ajoutent : l'incast, quand de nombreux émetteurs convergent au même instant sur un seul récepteur et saturent son tampon, et un problème de routage, quand le hachage classique ECMP fait collider quelques flux volumineux sur un même lien alors que d'autres restent vides. Un troisième risque, la « défaillance grise », est le plus insidieux : une carte réseau qui perd occasionnellement des paquets sans tomber en panne devient un maillon lent qui ralentit tout le travail à sa propre vitesse.

| Niveau réseau | Portée | Contrainte dominante |
| --- | --- | --- |
| Scale-up | Intérieur d'un rack | Latence et bande passante brute, sub-microseconde |
| Scale-out | Entre racks, au sein d'un pod | Congestion (incast, collisions de routage) |
| Scale-across | Entre centres de données | Distance et latence géographique |

## La mémoire et le stockage rejoignent le réseau dans l'équation

Sven Oehme, directeur technique chez DDN, ajoute une dimension supplémentaire : le stockage devient une extension de la hiérarchie mémoire des systèmes d'IA. Les applications dites agentiques maintiennent des sessions longues, accèdent de façon répétée à des caches de clés-valeurs et doivent conserver un état intermédiaire pour pouvoir reprendre un travail interrompu. Une étude d'inférence à contexte long citée par Oehme, portant sur un modèle de 8 milliards de paramètres et une séquence d'un million de tokens, montre qu'un cache clé-valeur non optimisé exige 128 Go de mémoire GPU, contre 1 Go seulement après déchargement et gestion sélective. Chez Salesforce, le déploiement de la solution EXAScaler aurait permis, selon les chiffres cités, une réduction de 75 % de la latence d'entrée-sortie, un entraînement 1,5 fois plus rapide et une baisse de 42 % du coût total d'entraînement.

Oehme cite également des projections de McKinsey selon lesquelles la demande de puissance électrique des centres de données dédiés à l'inférence d'IA pourrait tripler, passant d'environ 31 gigawatts en 2025 à 93 gigawatts en 2030, et l'Agence internationale de l'énergie relève une hausse de 50 % de la consommation électrique des centres de données orientés IA sur la seule année 2025. Ces chiffres, même s'ils concernent d'abord les très grands opérateurs américains, cadrent l'ampleur de la course aux infrastructures dans laquelle s'inscrivent les choix d'architecture réseau.

## Ce que cela change concrètement pour une entreprise qui évalue un cluster d'IA

Pour une organisation qui envisage de déployer ou de louer un cluster d'IA, plusieurs conséquences pratiques se dégagent de ces témoignages. D'abord, la mesure doit précéder l'achat : profiler le temps passé dans les opérations collectives, vérifier la topologie PCIe des serveurs, observer l'utilisation du processeur pendant les phases de communication. Ajouter des GPU à un pipeline déjà limité par le réseau ou par le stockage augmente le coût sans améliorer la performance.

Ensuite, l'entraînement et l'inférence n'ont pas les mêmes contraintes réseau. Vivek Kumkar, responsable IA générative chez AWS, distingue une charge d'entraînement, qui exige une forte densité de puissance localisée, d'une charge d'inférence en production, qui exige une disponibilité et une latence faible pour des millions de requêtes quotidiennes. Il ajoute que la stratégie gagnante ne se résume pas à disposer de la plus grande prise électrique, mais à délivrer la latence et le coût les plus bas par requête « tout en respectant la souveraineté régionale des données et la conformité réglementaire ». Cette dernière remarque rejoint une préoccupation propre au contexte européen et français : le choix d'une architecture réseau ou d'un fournisseur d'infrastructure ne peut pas être dissocié de la question de savoir où les données transitent et sous quel régime juridique.

C'est précisément la raison pour laquelle beaucoup d'entreprises françaises n'ont pas vocation à construire elles-mêmes un cluster d'entraînement avec sa propre architecture réseau, mais préfèrent accéder aux modèles via une plateforme qui gère cette couche pour elles. Moon AI, éditée par Stellarr Studio SAS, propose ainsi un accès à plus de soixante-dix modèles (GPT, Claude, Gemini, Mistral, DeepSeek, Llama, Grok, Qwen, ainsi que son modèle maison Moon 6) via un abonnement unique, avec une application et un stockage hébergés chez OVHcloud à Strasbourg et Roubaix. Ce choix ne dispense pas l'entreprise de s'interroger sur le trajet des données une fois la requête envoyée à un modèle tiers : ces requêtes partent bien chez les fournisseurs de ces modèles, après un passage par Moon Blur, un mécanisme qui remplace les données personnelles par des jetons avant l'envoi et les rétablit au retour. Ce procédé étant réversible, il s'agit d'une pseudonymisation au sens de l'article 4-5 du RGPD, et non d'une anonymisation.

Enfin, Piyush Lakhawat, membre technique senior chez Salesforce, rappelle que la mémoire et le réseau ne sont pas des sujets ponctuels mais évolutifs : « n'importe lequel de ces éléments peut devenir un goulot d'étranglement si la distribution du trafic entrant change, ou si l'infrastructure de calcul évolue. Et les deux sont une question de quand, pas de si. » Pour un dirigeant technique, cela signifie qu'un dimensionnement figé au moment de l'achat devient obsolète à mesure que les modèles et les usages changent.

## Questions fréquentes

### Qu'est-ce que le goulot d'étranglement PCIe exactement ?

C'est le ralentissement causé par le passage obligé des données de l'accélérateur vers le processeur hôte via le bus PCIe, avant qu'elles n'atteignent la carte réseau. Ce trajet ajoute de la latence, mobilise le processeur central et plafonne le débit au niveau du bus PCIe, qui est nettement plus lent que ce que l'accélérateur et le réseau pourraient soutenir seuls.

### Faut-il d'abord investir dans plus de GPU ou revoir l'architecture réseau ?

Selon les praticiens cités, la première étape est de mesurer : taux d'utilisation réel des GPU, temps passé dans les opérations réseau, localisation des ralentissements dans le pipeline complet, de la donnée brute jusqu'à la réponse. Ajouter des GPU à une charge limitée par le réseau ou par un pipeline de données augmente les coûts sans améliorer la performance.

### Quel rapport entre cette question réseau et la conformité en France ?

Les experts cités insistent sur le fait que la souveraineté des données (où elles résident, comment elles circulent, qui peut y accéder) devient un critère d'architecture aussi central que la latence ou le coût par requête. Pour une entreprise française, cela implique de vérifier non seulement où l'infrastructure est hébergée, mais aussi le trajet effectif des données vers les fournisseurs de modèles tiers, notamment lorsqu'un mécanisme de pseudonymisation est utilisé en amont.

### Le goulot d'étranglement réseau concerne-t-il uniquement les très grands clusters comme ceux de Meta ?

Non. Si les exemples les plus spectaculaires (puces à cartes réseau intégrées, dizaines de milliers de GPU) viennent des très grands opérateurs, le principe de fond, à savoir que la communication mérite la même attention architecturale que le calcul, s'applique à toute infrastructure distribuée, y compris les configurations plus modestes utilisées par les entreprises en dehors des hyperscalers.

> **Transparence.** Cet article a été rédigé par un système d'intelligence artificielle à partir des sources listées ci-dessous, puis vérifié fait par fait par un second système avant publication. Il n'a pas fait l'objet d'une relecture humaine préalable. Les chiffres et citations proviennent des sources ; en cas d'écart, la source fait foi. Notre [méthode, ses limites et notre politique de correction](https://realmoon.ai/actualites/methode).

> **Sources.** Article rédigé à partir des publications suivantes, consultées le 30/08/2026. En cas d'écart, la source fait foi. Signalez toute inexactitude à [contact@stellarrstudio.com](https://realmoon.ai/mailto:contact@stellarrstudio.com).
>
> - [https://umesh-malik.com/blog/eliminate-pcie-bottleneck-ai-training](https://umesh-malik.com/blog/eliminate-pcie-bottleneck-ai-training)
> - [https://www.itechpost.com/articles/237157/20260827/networking-cool-again-how-ai-put-network-critical-path-view-inside-meta.htm](https://www.itechpost.com/articles/237157/20260827/networking-cool-again-how-ai-put-network-critical-path-view-inside-meta.htm)
> - [https://www.forbes.com/councils/forbestechcouncil/2026/08/26/the-infrastructure-challenge-the-biggest-bottleneck-in-enterprise-ai/](https://www.forbes.com/councils/forbestechcouncil/2026/08/26/the-infrastructure-challenge-the-biggest-bottleneck-in-enterprise-ai/)
> - [https://seniorexecutive.com/ai-data-centers-infrastructure-power-efficiency-flexibility/](https://seniorexecutive.com/ai-data-centers-infrastructure-power-efficiency-flexibility/)
> - [https://www.franceinfo.fr/monde/usa/aux-etats-unis-la-societe-civile-s-organise-contre-les-cameras-de-surveillance-flock-fonctionnant-a-l-intelligence-artificielle_8159093.html](https://www.franceinfo.fr/monde/usa/aux-etats-unis-la-societe-civile-s-organise-contre-les-cameras-de-surveillance-flock-fonctionnant-a-l-intelligence-artificielle_8159093.html)
> - [https://www.forbes.com/councils/forbestechcouncil/2026/08/27/the-ai-infrastructure-stack-is-being-rewritten-for-the-agentic-era/](https://www.forbes.com/councils/forbestechcouncil/2026/08/27/the-ai-infrastructure-stack-is-being-rewritten-for-the-agentic-era/)

---

Source : https://realmoon.ai/actualites/reseau-goulet-etranglement-clusters-ia-entreprises
