09.08.2026
8 min de lecture

De nombreuses directions informatiques développent leur capacité GPU et attendent toujours des temps de réponse. Les slots de calcul disponibles et l’augmentation de la latence inter-jeton ne vont pas de pair. Le 23 juillet 2026, Cisco classe explicitement l’inférence AI comme un problème de réseau : le mouvement des données devient le principal goulet d’étranglement des performances GPU. Un symptôme devient un choix d’architecture.

Les points clés en bref

  • Caractéristique. Si la latence inter-jeton augmente avec une capacité de calcul disponible et que les collectifs Est-Ouest comme All-Reduce dominent le temps de pas, le goulet d’étranglement se situe dans le réseau.
  • Changement de marché. En 2025, Ethernet a dépassé InfiniBand en termes d’adoption dans les réseaux AI back-end ; deux ans auparavant, InfiniBand représentait environ 80 %. Les ports 800 Gbps ont dépassé les 20 millions en trois ans.
  • Prévision et contre-position. Selon les prévisions de Dell’Oro, la majorité des ports de commutation AI back-end seront à 800 Gbps d’ici 2025, à 1600 Gbps d’ici 2027 et à 3200 Gbps d’ici 2030. Dans la discussion pratique, InfiniBand conserve souvent un avantage en termes de latence et de bande passante All-Reduce ; un RoCEv2 bien réglé se situe souvent à 15 à 25 % en dessous de la bande passante collective.
  • Niveau de décision. Les directions informatiques doivent évaluer séparément les réseaux de requêtes Nord-Sud et les réseaux GPU Est-Ouest, prendre en compte l’économie des ports et des modules ainsi que les coûts de sortie et déterminer si RDMA sur Ethernet avec RoCEv2 et des piles ouvertes répond aux objectifs opérationnels.

Articles associésIA locale : la gouvernance avant l’achat de matériel  /  Pourquoi la facture cloud ne diminue jamais

Lorsque les GPU disponibles attendent

Qu’est-ce qu’une fabric AI back-end ? La fabric AI back-end relie deux réseaux : un réseau de requêtes Nord-Sud amène les demandes aux clusters et les résultats en arrière. Une fabric GPU Est-Ouest (NVLink, InfiniBand ou RDMA sur Ethernet) couple les accélérateurs entre eux. Les collectifs comme All-Reduce déterminent le temps de pas, car chaque étape de formation ou d’inférence attend l’échange de données entre les GPU.

Pour la direction informatique, l’image de reconnaissance est claire. La latence inter-jeton augmente, bien que la capacité de calcul soit disponible. Les collectifs Est-Ouest comme All-Reduce dominent le temps de pas. Le 23 juillet 2026, Cisco résume ainsi : « le mouvement des données est désormais le principal goulet d’étranglement des performances GPU »

Le symptôme fonctionne comme un problème de capacité. Les équipes commandent plus de GPU et mesurent néanmoins des temps d’attente plus longs par jeton ou par étape de formation. Le diagnostic se déplace alors de la ressource de calcul vers le chemin des données entre les nœuds. Celui qui néglige cela finance des accélérateurs inutilisés et laisse le goulet d’étranglement dans la conception de la fabric.

Les workloads agents renforcent la pression sur la face Nord-Sud. Une étude de Cisco prévoit que l’IA agente peut augmenter le trafic des entreprises de 9 fois d’ici 2035. Plus de requêtes frappent des clusters qui sont déjà limités par la bande passante et la latence Est-Ouest. Les directions informatiques ont donc besoin de points de mesure sur les deux chemins et d’une propriété claire pour la fabric qui détermine le temps de pas.

Deux fabrics, un goulot d’étranglement commun

L’inférence par IA repose sur deux fabrics connectés mais distincts. Le réseau de requêtes nord-sud achemine les charges et renvoie les réponses. Le fabric GPU est-ouest maintient les opérations de collectives en marche. NVLink, InfiniBand ou RDMA over Ethernet y assurent l’interconnexion à haute vitesse. Des erreurs dans la séparation de ces deux niveaux entraînent des priorités d’investissement erronées.

Si le réseau de requêtes est dimensionné mais que le fabric GPU est saturé, l’inférence reste lente. Si le fabric GPU est performant mais que le réseau de requêtes est surchargé, les temps d’attente en entrée augmentent. La décision commence donc par une cartographie des charges : quelle part du temps de traitement est consacrée aux opérations All-Reduce et collectives associées, et quelle part à l’ingress et à l’egress ? Sans cette répartition, les discussions budgétaires restent spéculatives.

Pour les responsables infrastructure, cela implique une conséquence organisationnelle. Réseau, plateforme et exploitation IA nécessitent des métriques communes. La latence inter-token, la durée des collectives et l’utilisation des ports doivent figurer dans les mêmes revues que l’utilisation des GPU. Ce n’est qu’ainsi que la direction peut agir là où le rythme réel est rompu.

Pourquoi l’Ethernet s’impose si rapidement dans le backend IA

Le groupe Dell’Oro marque 2025 comme un tournant : l’Ethernet a dépassé InfiniBand en termes d’adoption sur les réseaux backend IA. Deux ans plus tôt, InfiniBand représentait encore environ 80 % du marché. Lorsque Dell’Oro a lancé son suivi des réseaux backend IA fin 2023, InfiniBand détenait environ 80 % de parts de marché. Le changement d’adoption est donc récent et marqué.

Les vitesses de port évoluent en parallèle. Les ports de commutateurs 800 Gbps ont franchi la barre des 20 millions d’unités en moins de trois ans après leur lancement. Il avait fallu six à sept ans pour atteindre ce seuil avec le 400 Gbps. Selon les prévisions de Dell’Oro, la majorité des ports de commutateurs dans les réseaux backend IA atteindront 800 Gbps d’ici 2025, 1600 Gbps d’ici 2027 et 3200 Gbps d’ici 2030. Il s’agit de prévisions, et non de chiffres réels.

Dell’Oro prévoit que 2026 sera la première année avec des livraisons en volume de commutateurs 1,6 Tbps. Leur déploiement devrait être plus rapide que celui des 800 Gbps et dépasser 5 millions de ports en un à deux ans. Là encore, il s’agit de prévisions. Pour la planification budgétaire, cela signifie que la prochaine génération de ports est imminente, alors que le 800G n’est que récemment devenu courant.

L’enjeu économique est de taille. L’Ethernet dans le backend IA pourrait générer environ 69 milliards d’euros de chiffre d’affaires pour les commutateurs d’ici cinq ans. Quiconque planifie des fabrics aujourd’hui évolue donc sur un marché où la densité de ports, l’optique et les modèles d’exploitation se renouvellent à un rythme soutenu. Les délais d’attente de plusieurs années entre les générations ne sont plus la norme.

Normes, RoCEv2 et la position de l’InfiniBand

Le 11 juin 2025, le Ultra Ethernet Consortium a publié la spécification UEC 1.0, une pile de communication Ethernet dédiée à l’IA et au HPC. La spéc 1.0 cible le RDMA moderne sur Ethernet et IP, l’interopérabilité ouverte et la mise à l’échelle jusqu’à des millions d’extrémités. Pour les responsables IT, cela ouvre la voie à des fabrics IA multi-fournisseurs basés sur Ethernet.

Parallèlement, l’IEEE accélère le développement de la couche physique. La norme IEEE 802.3df-2024 pour le 800 GbE a été finalisée en environ 16 mois, soit quatre mois avant la date prévue. Le groupe de travail IEEE P802.3dj, chargé des normes 200, 400, 800 Gb/s et 1,6 Tb/s basées sur un signal d’au moins 200 Gb/s, est prévu pour une finalisation en 2026. Les normes et les capacités de livraison évoluent donc plus rapidement que lors des cycles Ethernet précédents.

Une information isolée a annoncé le 20 juillet 2026 la publication de la spécification Ultra Ethernet 1.0.3, datée du 16 juillet 2026, avec une extension à 200 Gb/s par voie. Cette donnée provient d’une source unique et doit être considérée avec prudence. Elle ne valide pas un standard de marché confirmé, mais signale une dynamique dans la pile de spécifications.

La position d’InfiniBand reste visible sur le terrain. Lors des discussions pratiques en 2025 et 2026, InfiniBand continue d’être présenté comme offrant une latence plus faible et une bande passante All-Reduce supérieure. RoCEv2 bien optimisé s’en approche, mais reste souvent en retrait de 15 à 25 % en termes de bande passante collective par rapport à InfiniBand. Choisir l’Ethernet, c’est opter pour une largeur de bande opérationnelle, une chaîne d’approvisionnement et un écosystème, tout en devant compenser l’écart potentiel en matière de bande passante collective dans l’architecture et l’optimisation.

Ce que signifient les ports, modules et coûts de sortie dans le budget

La décision technique se heurte à des chiffres opérationnels bien réels. Les modules 800G consomment généralement entre 14 et 24 watts selon la portée et le DSP. Les modules 400G affichent souvent 10 à 12 watts, mais sont moins efficaces par bit transmis. Une vitesse de port plus élevée ne soulage donc pas seulement le temps de latence. Elle modifie le refroidissement, le budget énergétique et la planification des baies.

Pour donner un ordre de grandeur issu du retail : un module 800G-OSFP-SR8 compatible NVIDIA pour 50 mètres de multimode coûte environ 762 euros chez FS.com. Ce n’est pas un prix d’achat officiel, mais cela donne une idée du coût par optique. Multiplié par la densité de ports d’une AI-Fabric, cela représente rapidement un investissement qui dépasse celui du matériel réseau pur.

S’ajoute à cela le levier de coût Nord-Sud du cloud. Sur Google Cloud, le transfert de données sortantes vers l’Europe en niveau Premium est gratuit pour le premier Gio par mois et par compte. Ensuite, les paliers s’échelonnent à environ 0,10 euro par Gio jusqu’à 1 024 Gio, puis environ 0,095 euro par Gio jusqu’à 10 240 Gio, et enfin environ 0,074 euro par Gio au-delà. AWS facture le transfert de données sortantes vers Internet dans la plupart de ses régions américaines selon un premier palier de 100 Go gratuits par mois à environ 0,078 euro par Go, suivi de paliers décroissants. Les données AWS proviennent d’une source secondaire.

IONOS, l’un des principaux fournisseurs européens de cloud et d’hébergement, a migré d’InfiniBand vers Ethernet avec Enterprise SONiC, RoCEv2 et EVPN-VXLAN, tout en mettant à l’échelle une AI-Fabric 400G. Cet exemple illustre une architecture Ethernet opérationnelle proche de l’IA et du HPC dans un contexte européen. Il ne remplace pas un test de charge sur votre propre charge de travail, mais il démontre que la pile composée d’un OS réseau ouvert, de RoCEv2 et d’EVPN-VXLAN est scalable en production.

Quelles décisions s’imposent aujourd’hui

D’abord, il faut intégrer le symptôme dans le reporting opérationnel. Latence inter-token, durée des opérations All-Reduce et temps GPU libre évoluent en parallèle. Si la latence augmente alors que la capacité de calcul est disponible, il faut prioriser la Fabric et les optiques avant d’investir dans d’autres accélérateurs. Cela protège le Capex et réduit le délai avant une amélioration tangible des performances.

Ensuite, l’architecture doit clairement séparer les flux Nord-Sud et Est-Ouest. Les chemins de requêtes, les coûts de sortie et les zones de sécurité relèvent d’une analyse, tandis que la bande passante collective, le comportement RDMA, le contrôle de congestion et les générations de ports relèvent d’une autre. Les calculs mixtes génèrent une fausse précision et des appels d’offres erronés.

Troisièmement, l’organisation doit choisir consciemment sa pile de transport et d’exploitation. InfiniBand reste justifiable là où la bande passante collective et la latence constituent une limite stricte, et où l’écart potentiel de 15 à 25 % de RoCEv2 fausse le business case. Ethernet avec RoCEv2, des spécifications ouvertes et une économie de ports croissante est performant là où comptent la scalabilité, la disponibilité des livraisons, le fonctionnement multi-fournisseurs et l’intégration dans des Fabrics de data centers existantes. La spécification UEC 1.0 et la feuille de route des ports IEEE étayent cette option, mais ne remplacent ni un ajustement personnalisé ni une preuve de concept.

Enfin, la direction doit calculer le coût total en intégrant ports, modules, watts et transfert de données. Les 800G, et bientôt selon les prévisions les 1,6 Tbps, augmentent le débit et transforment le budget énergétique ainsi que celui des optiques. Les paliers de coûts de sortie dans le cloud déterminent si les résultats d’inférence restent dans votre propre Fabric ou s’ils s’envolent à un prix élevé. En croisant ces quatre axes, on identifie rapidement si le réseau impose le tempo – et on peut agir en amont avant que la prochaine commande de GPU ne rende le goulot d’étranglement encore plus coûteux.

Foire aux questions

Comment la direction informatique identifie-t-elle que le réseau limite les performances des GPU ?

Lorsque la latence inter-token augmente alors que la capacité de calcul reste disponible et que les opérations collectives est-ouest comme All-Reduce dominent le temps de traitement, le goulot d’étranglement se situe dans le réseau. Cisco décrit dans ce contexte le déplacement des données comme le principal facteur limitant des performances des GPU.

Quelle est la différence entre le trafic nord-sud et est-ouest dans l’inférence par IA ?

Le réseau nord-sud des requêtes achemine les demandes vers le cluster et renvoie les résultats. La matrice GPU est-ouest, quant à elle, interconnecte les accélérateurs via NVLink, InfiniBand ou RDMA over Ethernet. Les opérations collectives sur le chemin est-ouest déterminent souvent le temps de traitement.

À quelle vitesse l’Ethernet se développe-t-il dans les backends dédiés à l’IA, selon les données et prévisions du marché ?

En 2025, l’Ethernet a dépassé l’InfiniBand en termes d’adoption dans les réseaux back-end dédiés à l’IA. Les ports à 800 Gbps ont dépassé les 20 millions d’unités en l’espace de trois ans. Selon les prévisions de Dell’Oro, la majorité des ports de commutateurs back-end dédiés à l’IA atteindront 800 Gbps d’ici 2025, 1 600 Gbps d’ici 2027 et 3 200 Gbps d’ici 2030. L’année 2026 devrait marquer le début des livraisons en volume de commutateurs à 1,6 Tbps, avec une montée en puissance de plus de 5 millions de ports en un à deux ans.

L’Ethernet avec RoCEv2 est-il un substitut équivalent à l’InfiniBand ?

Pas systématiquement. Dans les discussions pratiques de 2025 et 2026, l’InfiniBand continue d’être mis en avant pour sa latence plus faible et sa bande passante All-Reduce supérieure. Un RoCEv2 bien optimisé s’en approche, mais reste souvent en retrait de 15 à 25 % en termes de bande passante collective par rapport à l’InfiniBand. L’Ethernet se distingue par son écosystème, sa disponibilité et son intégration ; l’écart en matière de performances collectives doit être évalué en fonction de votre propre charge de travail.

Quels leviers de coûts la direction doit-elle prendre en compte en plus des ports de commutateurs ?

La consommation électrique des modules, le prix des optiques et les frais de sortie cloud. Les modules 800G consomment généralement entre 14 et 24 watts. À titre indicatif, un module 800G OSFP-SR8 coûte environ 762 euros en prix de détail. Les frais de sortie cloud de Google Cloud vers l’Europe s’élèvent à environ 0,10 à 0,074 euro par Gio après le premier Gio gratuit, selon les paliers. Les tarifs AWS pour les sorties commencent à environ 0,078 euro par Go après le Free Tier. Les prix indiqués pour AWS et les modules de détail sont des ordres de grandeur et ne constituent pas des valeurs contractuelles contraignantes.

Source de l’image : générée par IA (août 2026)

À lire aussi sur Digital Chiefs

Digital ChiefsAmazon et Alphabet : flux de trésorerie négatif, engagement à long termeDigital ChiefsIA locale : la gouvernance avant l’achat de matérielDigital ChiefsRèglement sur l’IA : jusqu’à 3 % du chiffre d’affaires du groupe

Plus du réseau MBF Media

cloudmagazinPénurie dans le cloud : ce que le deuxième trimestre signifie pour les acheteurs securitytodayDrones au-dessus des infrastructures critiques : le périmètre devient cyber-OT mybusinessfutureClimat de financement au T2 2026 : crédits rares, capital disponible
Partager cet article :

Aussi disponible en

Plus d'articles

09.09.2026

Nvidia acquiert Hugging Face pour plus de 11 milliards d’euros

Eva Mickler

4 min de lecture Nvidia acquiert Hugging Face pour environ 11,1 milliards d'euros, contrat du 2 septembre ...

Lire l’article
08.09.2026

SAP laisse Joule piloter des robots, la responsabilité reste ouverte

Bernhard Liebl

4 min de lecture SAP a documenté le premier Embodied-AI-Jam dans la Swiss Smart Factory de Bienne. Des ...

Lire l’article
15.08.2026

ChatGPT pourrait espionner les conversations sur le Mac

Eva Mickler

6 min de lecture OpenAI a décrit le 13 août 2026 l’historique informatique pour l’application ...

Lire l’article
14.08.2026

SpaceX rachète Cursor : les clauses de l’UE restent en suspens

Eva Mickler

5 min de lecture L’accord de vente a été finalisé le 14 août 2026. Toute entreprise utilisant cet ...

Lire l’article
13.08.2026

CRA impose aux fabricants de déclarer sous 24 heures

Bernhard Liebl

9 min de lecture Le 11 septembre 2026, l’article 14 du Cyber Resilience Act entrera en vigueur. À ...

Lire l’article
11.08.2026

Les plans de milliards de dollars de NVIDIA et ce que les exploitants doivent désormais examiner

Bernhard Liebl

7 min de lecture NVIDIA a annoncé le 10 août 2026, en collaboration avec six partenaires financiers, ...

Lire l’article
Un magazine de Evernine Media GmbH