Nvidia acquiert Hugging Face pour plus de 11 milliards d’euros
Eva Mickler
4 min de lecture Nvidia acquiert Hugging Face pour environ 11,1 milliards d'euros, contrat du 2 septembre ...
De nombreuses directions informatiques développent leur capacité GPU et attendent toujours des temps de réponse. Les slots de calcul disponibles et l’augmentation de la latence inter-jeton ne vont pas de pair. Le 23 juillet 2026, Cisco classe explicitement l’inférence AI comme un problème de réseau : le mouvement des données devient le principal goulet d’étranglement des performances GPU. Un symptôme devient un choix d’architecture.
Articles associésIA locale : la gouvernance avant l’achat de matériel / Pourquoi la facture cloud ne diminue jamais
Qu’est-ce qu’une fabric AI back-end ? La fabric AI back-end relie deux réseaux : un réseau de requêtes Nord-Sud amène les demandes aux clusters et les résultats en arrière. Une fabric GPU Est-Ouest (NVLink, InfiniBand ou RDMA sur Ethernet) couple les accélérateurs entre eux. Les collectifs comme All-Reduce déterminent le temps de pas, car chaque étape de formation ou d’inférence attend l’échange de données entre les GPU.
Pour la direction informatique, l’image de reconnaissance est claire. La latence inter-jeton augmente, bien que la capacité de calcul soit disponible. Les collectifs Est-Ouest comme All-Reduce dominent le temps de pas. Le 23 juillet 2026, Cisco résume ainsi : « le mouvement des données est désormais le principal goulet d’étranglement des performances GPU »
Le symptôme fonctionne comme un problème de capacité. Les équipes commandent plus de GPU et mesurent néanmoins des temps d’attente plus longs par jeton ou par étape de formation. Le diagnostic se déplace alors de la ressource de calcul vers le chemin des données entre les nœuds. Celui qui néglige cela finance des accélérateurs inutilisés et laisse le goulet d’étranglement dans la conception de la fabric.
Les workloads agents renforcent la pression sur la face Nord-Sud. Une étude de Cisco prévoit que l’IA agente peut augmenter le trafic des entreprises de 9 fois d’ici 2035. Plus de requêtes frappent des clusters qui sont déjà limités par la bande passante et la latence Est-Ouest. Les directions informatiques ont donc besoin de points de mesure sur les deux chemins et d’une propriété claire pour la fabric qui détermine le temps de pas.
L’inférence par IA repose sur deux fabrics connectés mais distincts. Le réseau de requêtes nord-sud achemine les charges et renvoie les réponses. Le fabric GPU est-ouest maintient les opérations de collectives en marche. NVLink, InfiniBand ou RDMA over Ethernet y assurent l’interconnexion à haute vitesse. Des erreurs dans la séparation de ces deux niveaux entraînent des priorités d’investissement erronées.
Si le réseau de requêtes est dimensionné mais que le fabric GPU est saturé, l’inférence reste lente. Si le fabric GPU est performant mais que le réseau de requêtes est surchargé, les temps d’attente en entrée augmentent. La décision commence donc par une cartographie des charges : quelle part du temps de traitement est consacrée aux opérations All-Reduce et collectives associées, et quelle part à l’ingress et à l’egress ? Sans cette répartition, les discussions budgétaires restent spéculatives.
Pour les responsables infrastructure, cela implique une conséquence organisationnelle. Réseau, plateforme et exploitation IA nécessitent des métriques communes. La latence inter-token, la durée des collectives et l’utilisation des ports doivent figurer dans les mêmes revues que l’utilisation des GPU. Ce n’est qu’ainsi que la direction peut agir là où le rythme réel est rompu.
Le groupe Dell’Oro marque 2025 comme un tournant : l’Ethernet a dépassé InfiniBand en termes d’adoption sur les réseaux backend IA. Deux ans plus tôt, InfiniBand représentait encore environ 80 % du marché. Lorsque Dell’Oro a lancé son suivi des réseaux backend IA fin 2023, InfiniBand détenait environ 80 % de parts de marché. Le changement d’adoption est donc récent et marqué.
Les vitesses de port évoluent en parallèle. Les ports de commutateurs 800 Gbps ont franchi la barre des 20 millions d’unités en moins de trois ans après leur lancement. Il avait fallu six à sept ans pour atteindre ce seuil avec le 400 Gbps. Selon les prévisions de Dell’Oro, la majorité des ports de commutateurs dans les réseaux backend IA atteindront 800 Gbps d’ici 2025, 1600 Gbps d’ici 2027 et 3200 Gbps d’ici 2030. Il s’agit de prévisions, et non de chiffres réels.
Dell’Oro prévoit que 2026 sera la première année avec des livraisons en volume de commutateurs 1,6 Tbps. Leur déploiement devrait être plus rapide que celui des 800 Gbps et dépasser 5 millions de ports en un à deux ans. Là encore, il s’agit de prévisions. Pour la planification budgétaire, cela signifie que la prochaine génération de ports est imminente, alors que le 800G n’est que récemment devenu courant.
L’enjeu économique est de taille. L’Ethernet dans le backend IA pourrait générer environ 69 milliards d’euros de chiffre d’affaires pour les commutateurs d’ici cinq ans. Quiconque planifie des fabrics aujourd’hui évolue donc sur un marché où la densité de ports, l’optique et les modèles d’exploitation se renouvellent à un rythme soutenu. Les délais d’attente de plusieurs années entre les générations ne sont plus la norme.
Le 11 juin 2025, le Ultra Ethernet Consortium a publié la spécification UEC 1.0, une pile de communication Ethernet dédiée à l’IA et au HPC. La spéc 1.0 cible le RDMA moderne sur Ethernet et IP, l’interopérabilité ouverte et la mise à l’échelle jusqu’à des millions d’extrémités. Pour les responsables IT, cela ouvre la voie à des fabrics IA multi-fournisseurs basés sur Ethernet.
Parallèlement, l’IEEE accélère le développement de la couche physique. La norme IEEE 802.3df-2024 pour le 800 GbE a été finalisée en environ 16 mois, soit quatre mois avant la date prévue. Le groupe de travail IEEE P802.3dj, chargé des normes 200, 400, 800 Gb/s et 1,6 Tb/s basées sur un signal d’au moins 200 Gb/s, est prévu pour une finalisation en 2026. Les normes et les capacités de livraison évoluent donc plus rapidement que lors des cycles Ethernet précédents.
Une information isolée a annoncé le 20 juillet 2026 la publication de la spécification Ultra Ethernet 1.0.3, datée du 16 juillet 2026, avec une extension à 200 Gb/s par voie. Cette donnée provient d’une source unique et doit être considérée avec prudence. Elle ne valide pas un standard de marché confirmé, mais signale une dynamique dans la pile de spécifications.
La position d’InfiniBand reste visible sur le terrain. Lors des discussions pratiques en 2025 et 2026, InfiniBand continue d’être présenté comme offrant une latence plus faible et une bande passante All-Reduce supérieure. RoCEv2 bien optimisé s’en approche, mais reste souvent en retrait de 15 à 25 % en termes de bande passante collective par rapport à InfiniBand. Choisir l’Ethernet, c’est opter pour une largeur de bande opérationnelle, une chaîne d’approvisionnement et un écosystème, tout en devant compenser l’écart potentiel en matière de bande passante collective dans l’architecture et l’optimisation.
La décision technique se heurte à des chiffres opérationnels bien réels. Les modules 800G consomment généralement entre 14 et 24 watts selon la portée et le DSP. Les modules 400G affichent souvent 10 à 12 watts, mais sont moins efficaces par bit transmis. Une vitesse de port plus élevée ne soulage donc pas seulement le temps de latence. Elle modifie le refroidissement, le budget énergétique et la planification des baies.
Pour donner un ordre de grandeur issu du retail : un module 800G-OSFP-SR8 compatible NVIDIA pour 50 mètres de multimode coûte environ 762 euros chez FS.com. Ce n’est pas un prix d’achat officiel, mais cela donne une idée du coût par optique. Multiplié par la densité de ports d’une AI-Fabric, cela représente rapidement un investissement qui dépasse celui du matériel réseau pur.
S’ajoute à cela le levier de coût Nord-Sud du cloud. Sur Google Cloud, le transfert de données sortantes vers l’Europe en niveau Premium est gratuit pour le premier Gio par mois et par compte. Ensuite, les paliers s’échelonnent à environ 0,10 euro par Gio jusqu’à 1 024 Gio, puis environ 0,095 euro par Gio jusqu’à 10 240 Gio, et enfin environ 0,074 euro par Gio au-delà. AWS facture le transfert de données sortantes vers Internet dans la plupart de ses régions américaines selon un premier palier de 100 Go gratuits par mois à environ 0,078 euro par Go, suivi de paliers décroissants. Les données AWS proviennent d’une source secondaire.
IONOS, l’un des principaux fournisseurs européens de cloud et d’hébergement, a migré d’InfiniBand vers Ethernet avec Enterprise SONiC, RoCEv2 et EVPN-VXLAN, tout en mettant à l’échelle une AI-Fabric 400G. Cet exemple illustre une architecture Ethernet opérationnelle proche de l’IA et du HPC dans un contexte européen. Il ne remplace pas un test de charge sur votre propre charge de travail, mais il démontre que la pile composée d’un OS réseau ouvert, de RoCEv2 et d’EVPN-VXLAN est scalable en production.
D’abord, il faut intégrer le symptôme dans le reporting opérationnel. Latence inter-token, durée des opérations All-Reduce et temps GPU libre évoluent en parallèle. Si la latence augmente alors que la capacité de calcul est disponible, il faut prioriser la Fabric et les optiques avant d’investir dans d’autres accélérateurs. Cela protège le Capex et réduit le délai avant une amélioration tangible des performances.
Ensuite, l’architecture doit clairement séparer les flux Nord-Sud et Est-Ouest. Les chemins de requêtes, les coûts de sortie et les zones de sécurité relèvent d’une analyse, tandis que la bande passante collective, le comportement RDMA, le contrôle de congestion et les générations de ports relèvent d’une autre. Les calculs mixtes génèrent une fausse précision et des appels d’offres erronés.
Troisièmement, l’organisation doit choisir consciemment sa pile de transport et d’exploitation. InfiniBand reste justifiable là où la bande passante collective et la latence constituent une limite stricte, et où l’écart potentiel de 15 à 25 % de RoCEv2 fausse le business case. Ethernet avec RoCEv2, des spécifications ouvertes et une économie de ports croissante est performant là où comptent la scalabilité, la disponibilité des livraisons, le fonctionnement multi-fournisseurs et l’intégration dans des Fabrics de data centers existantes. La spécification UEC 1.0 et la feuille de route des ports IEEE étayent cette option, mais ne remplacent ni un ajustement personnalisé ni une preuve de concept.
Enfin, la direction doit calculer le coût total en intégrant ports, modules, watts et transfert de données. Les 800G, et bientôt selon les prévisions les 1,6 Tbps, augmentent le débit et transforment le budget énergétique ainsi que celui des optiques. Les paliers de coûts de sortie dans le cloud déterminent si les résultats d’inférence restent dans votre propre Fabric ou s’ils s’envolent à un prix élevé. En croisant ces quatre axes, on identifie rapidement si le réseau impose le tempo – et on peut agir en amont avant que la prochaine commande de GPU ne rende le goulot d’étranglement encore plus coûteux.
Lorsque la latence inter-token augmente alors que la capacité de calcul reste disponible et que les opérations collectives est-ouest comme All-Reduce dominent le temps de traitement, le goulot d’étranglement se situe dans le réseau. Cisco décrit dans ce contexte le déplacement des données comme le principal facteur limitant des performances des GPU.
Le réseau nord-sud des requêtes achemine les demandes vers le cluster et renvoie les résultats. La matrice GPU est-ouest, quant à elle, interconnecte les accélérateurs via NVLink, InfiniBand ou RDMA over Ethernet. Les opérations collectives sur le chemin est-ouest déterminent souvent le temps de traitement.
En 2025, l’Ethernet a dépassé l’InfiniBand en termes d’adoption dans les réseaux back-end dédiés à l’IA. Les ports à 800 Gbps ont dépassé les 20 millions d’unités en l’espace de trois ans. Selon les prévisions de Dell’Oro, la majorité des ports de commutateurs back-end dédiés à l’IA atteindront 800 Gbps d’ici 2025, 1 600 Gbps d’ici 2027 et 3 200 Gbps d’ici 2030. L’année 2026 devrait marquer le début des livraisons en volume de commutateurs à 1,6 Tbps, avec une montée en puissance de plus de 5 millions de ports en un à deux ans.
Pas systématiquement. Dans les discussions pratiques de 2025 et 2026, l’InfiniBand continue d’être mis en avant pour sa latence plus faible et sa bande passante All-Reduce supérieure. Un RoCEv2 bien optimisé s’en approche, mais reste souvent en retrait de 15 à 25 % en termes de bande passante collective par rapport à l’InfiniBand. L’Ethernet se distingue par son écosystème, sa disponibilité et son intégration ; l’écart en matière de performances collectives doit être évalué en fonction de votre propre charge de travail.
La consommation électrique des modules, le prix des optiques et les frais de sortie cloud. Les modules 800G consomment généralement entre 14 et 24 watts. À titre indicatif, un module 800G OSFP-SR8 coûte environ 762 euros en prix de détail. Les frais de sortie cloud de Google Cloud vers l’Europe s’élèvent à environ 0,10 à 0,074 euro par Gio après le premier Gio gratuit, selon les paliers. Les tarifs AWS pour les sorties commencent à environ 0,078 euro par Go après le Free Tier. Les prix indiqués pour AWS et les modules de détail sont des ordres de grandeur et ne constituent pas des valeurs contractuelles contraignantes.
Source de l’image : générée par IA (août 2026)
À lire aussi sur Digital Chiefs
Digital ChiefsAmazon et Alphabet : flux de trésorerie négatif, engagement à long termeDigital ChiefsIA locale : la gouvernance avant l’achat de matérielDigital ChiefsRèglement sur l’IA : jusqu’à 3 % du chiffre d’affaires du groupePlus du réseau MBF Media
cloudmagazinPénurie dans le cloud : ce que le deuxième trimestre signifie pour les acheteurs securitytodayDrones au-dessus des infrastructures critiques : le périmètre devient cyber-OT mybusinessfutureClimat de financement au T2 2026 : crédits rares, capital disponible