09.08.2026
8 min de lectura

Muchas direcciones de TI están ampliando la capacidad de GPU y aún así esperan tiempos de respuesta. Los slots de cómputo libres y el aumento de la latencia entre tokens no encajan. Cisco clasifica expresamente la inferencia de IA como un tema de red el 23 de julio de 2026: el movimiento de datos se convierte en el principal cuello de botella del rendimiento de la GPU. El síntoma se convierte en una decisión de arquitectura.

Lo más importante en resumen

  • Característica de reconocimiento. Si la latencia entre tokens aumenta con capacidad de cómputo libre y los colectivos de este a oeste, como All-Reduce, dominan el tiempo de paso, el cuello de botella está en la red.
  • Cambio en el mercado. En 2025, Ethernet superó a InfiniBand en la adopción en redes de back-end de IA; dos años antes, InfiniBand estaba en torno al 80 por ciento. Los puertos de 800 Gbps superaron claramente los 20 millones de unidades en tres años.
  • Previsión y contraposición. Según la previsión de Dell’Oro, la mayoría de los puertos de conmutación de back-end de IA para 2025 serán de 800 Gbps, para 2027 de 1600 Gbps y para 2030 de 3200 Gbps. En la discusión práctica, InfiniBand a menudo sigue siendo ventajoso en términos de latencia y ancho de banda de All-Reduce; RoCEv2 bien ajustado suele estar entre un 15 y un 25 por ciento por debajo en ancho de banda colectivo.
  • Nivel de decisión. Las direcciones de TI deben evaluar por separado la red de solicitudes de norte a sur y la fabric de GPU de este a oeste, incluir el costo de los puertos y módulos y determinar si RDMA sobre Ethernet con RoCEv2 y pilas abiertas cumple con los objetivos operativos.

RelacionadoIA local: gobernanza antes de la compra de hardware  /  Por qué la factura de la nube nunca disminuye

Cuando las GPU libres siguen esperando

¿Qué es una fabric de back-end de IA? La fabric de back-end de IA conecta dos redes: una red de solicitudes de norte a sur lleva solicitudes a los clústeres y resultados de vuelta. Una fabric de GPU de este a oeste (NVLink, InfiniBand o RDMA sobre Ethernet) acopla los aceleradores entre sí. Los colectivos como All-Reduce determinan el tiempo de paso allí, porque cada paso de entrenamiento o inferencia espera el intercambio de datos entre GPU.

La imagen de reconocimiento es clara para la dirección de TI. La latencia entre tokens aumenta, aunque la capacidad de cómputo es libre. Los colectivos de este a oeste, como All-Reduce, dominan el tiempo de paso. Cisco resume el núcleo el 23 de julio de 2026 de la siguiente manera: «el movimiento de datos es ahora el principal cuello de botella para el rendimiento de la GPU».

El síntoma funciona como un problema de capacidad en la práctica. Los equipos solicitan más GPU y aún así miden tiempos de espera más largos por token o por paso de entrenamiento. El diagnóstico se desplaza entonces de la recurso de cómputo al camino de datos entre los nodos. Quien pasa por alto esto, financia aceleradores no utilizados y deja el cuello de botella en el diseño de la fabric.

Los flujos de trabajo agenciales aumentan la presión sobre el lado de norte a sur. Un estudio de Cisco prevé que la IA agencial puede aumentar el tráfico empresarial en un factor de 9 para 2035. Más solicitudes llegan a clústeres que ya están limitados por la banda ancha y la latencia de este a oeste. Por lo tanto, las direcciones de TI necesitan puntos de medición en ambos caminos y una propiedad clara para la fabric que determina el tiempo de paso.

Dos fabrics, un cuello de botella común

La inferencia en IA depende de dos fabrics conectados pero distintos. La red de peticiones norte-sur gestiona la carga entrante y envía las respuestas. La fabric de GPU este-oeste mantiene en funcionamiento los Collective. NVLink, InfiniBand o RDMA over Ethernet se encargan allí de la conexión de alta velocidad. Los errores en la separación de estos dos niveles generan prioridades de inversión incorrectas.

Si la red de peticiones se escala y la fabric de GPU se satura, la inferencia sigue siendo lenta. Si la fabric de GPU es potente y la red de peticiones se sobrecarga, aumentan los tiempos de espera en la entrada. Por eso, la decisión comienza con un mapa de carga: qué proporción del tiempo de paso corresponde a All-Reduce y Collective relacionados, y cuál a Ingress y Egress. Sin esta división, las discusiones presupuestarias quedan en el terreno de la especulación.

Para los responsables de infraestructura, esto implica una consecuencia organizativa. Red, plataforma y operación de IA necesitan métricas compartidas. La latencia inter-token, la duración de los Collective y la ocupación de puertos deben formar parte de las mismas revisiones que la utilización de GPU. Solo entonces la dirección podrá actuar donde realmente se produce el cuello de botella.

Por qué Ethernet está ganando terreno tan rápido en el backend de IA

El grupo Dell’Oro Group marca 2025 como punto de inflexión: Ethernet superó a InfiniBand en adopción en redes backend de IA. Dos años antes, InfiniBand aún representaba alrededor del 80 por ciento. Cuando Dell’Oro lanzó su cobertura de backend de IA a finales de 2023, InfiniBand mantenía aproximadamente el 80 por ciento de cuota de mercado. El cambio en la adopción es, por tanto, reciente y pronunciado.

Las velocidades de los puertos avanzan en paralelo. Los puertos de switch de 800 Gbps superaron claramente la marca de 20 millones de puertos en solo tres años desde su lanzamiento. Los de 400 Gbps necesitaron entre seis y siete años para alcanzar esa cifra. Según la previsión de Dell’Oro, la mayoría de los puertos de switch en redes backend de IA alcanzarán los 800 Gbps en 2025, los 1600 Gbps en 2027 y los 3200 Gbps en 2030. Se trata de previsiones, no de cifras reales.

Dell’Oro estima que 2026 será el primer año con entregas masivas de switches de 1,6 Tbps. Su despliegue debería ser más rápido que el de los 800 Gbps y superar los 5 millones de puertos en uno o dos años. También aquí cabe la salvedad de las previsiones. Para la planificación presupuestaria, esto significa que la próxima generación de puertos está a punto de llegar, mientras que los 800 Gbps acaban de implantarse de forma generalizada.

El movimiento tiene un impacto económico enorme. Ethernet en el backend de IA podría generar unos 69.000 millones de euros en ventas de switches en cinco años. Quien planifique fabrics hoy lo hace en un mercado que renueva la densidad de puertos, la óptica y los modelos operativos en ciclos cortos. Los periodos de espera de varios años entre generaciones ya no son la norma.

Estándares, RoCEv2 y la postura contraria de InfiniBand

El 11 de junio de 2025, el Ultra Ethernet Consortium publicó la especificación UEC 1.0 como pila de comunicación Ethernet para IA y HPC. La especificación 1.0 aborda RDMA moderno sobre Ethernet e IP, interoperabilidad abierta y escalabilidad hasta millones de puntos finales. Es relevante para los directivos de TI porque describe el camino hacia fabrics de IA basados en Ethernet compatibles con múltiples proveedores.

Paralelamente, el IEEE acelera la capa física. El estándar IEEE 802.3df-2024 para 800 GbE se desarrolló en unos 16 meses, cuatro meses antes de lo previsto. El grupo de trabajo IEEE P802.3dj para velocidades de 200, 400, 800 Gb/s y 1,6 Tb/s con señalización de al menos 200 Gb/s está programado para completarse en 2026. Los estándares y la capacidad de entrega avanzan así más alineados que en ciclos anteriores de Ethernet.

Una noticia aislada informó el 20 de julio de 2026 sobre la liberación de la especificación Ultra Ethernet 1.0.3 con fecha de lanzamiento el 16 de julio de 2026, que incluye una ampliación de 200 Gb/s por lane. Esta información procede de una única fuente y debe interpretarse con precaución. No confirma un estándar de mercado definitivo, pero sí refleja movimiento en la pila de especificaciones.

La postura contraria sigue presente en el sector. En las discusiones prácticas de 2025 y 2026, InfiniBand sigue argumentando con menor latencia y mayor ancho de banda para All-Reduce. Un RoCEv2 bien ajustado se acerca, pero suele quedar entre un 15 y un 25 por ciento por debajo de InfiniBand en ancho de banda para Collective. Quienes elijan Ethernet optarán por amplitud operativa, cadena de suministro y ecosistema, pero deberán garantizar en su arquitectura y ajuste la posible brecha en ancho de banda para Collective.

Qué significan los puertos, módulos y el egress en el presupuesto

La decisión técnica se enfrenta a cifras operativas contundentes. Los módulos 800G suelen consumir entre 14 y 24 vatios de potencia, dependiendo de su alcance y del procesador de señal digital (DSP). Los módulos 400G, que suelen rondar los 10 a 12 vatios, son menos eficientes por bit transmitido. Por lo tanto, aumentar la velocidad de los puertos no solo acelera el tiempo de paso, sino que también modifica los requisitos de refrigeración, el presupuesto energético y la planificación del rack.

Como referencia del sector retail: un módulo 800G-OSFP-SR8 compatible con NVIDIA para 50 metros de fibra multimodo cuesta unos 762 euros en FS.com. Este no es un precio de compra vinculante, pero ofrece una idea aproximada por óptica. Multiplicado por la densidad de puertos de una infraestructura de IA, rápidamente surge un bloque de inversión que supera el coste del hardware del switch.

A esto se suma el impacto de los costes de transferencia norte-sur en la nube. En Google Cloud, la transferencia de datos de salida a Europa en el nivel Premium permite los primeros GiB por mes y cuenta de forma gratuita. A partir de ahí, las tarifas escalan a unos 0,10 euros por GiB hasta 1.024 GiB, alrededor de 0,095 euros por GiB hasta 10.240 GiB y, por encima de ese umbral, unos 0,074 euros por GiB. AWS calcula la transferencia de datos de salida a internet en la mayoría de las regiones de EE.UU. tras los primeros 100 GB del nivel gratuito mensual en una primera fase de alrededor de 0,078 euros por GB, con tarifas decrecientes en tramos posteriores. La cifra de AWS es una referencia aproximada basada en una fuente secundaria.

IONOS, uno de los principales proveedores europeos de cloud y hosting, migró de InfiniBand a Ethernet con Enterprise SONiC, RoCEv2 y EVPN-VXLAN, escalando una infraestructura de datos 400G. Este ejemplo muestra una arquitectura Ethernet cercana a entornos de IA y HPC operada en Europa. No sustituye las pruebas de carga en el propio flujo de trabajo, pero demuestra que la combinación de sistema operativo de red abierto, RoCEv2 y EVPN-VXLAN puede escalarse y desplegarse en producción.

Qué decisiones hay que tomar ahora

En primer lugar, el síntoma debe incluirse en el informe operativo. La latencia entre tokens, la duración de All-Reduce y el tiempo de GPU libre avanzan en paralelo. Si la latencia aumenta a pesar de tener capacidad de cómputo libre, se debe priorizar la infraestructura de red y la óptica antes que aceleradores adicionales. Esto protege la inversión en capex y acelera el tiempo hasta lograr una mejora perceptible del rendimiento.

En segundo lugar, la arquitectura debe separar claramente los flujos norte-sur y este-oeste. Las rutas de solicitud, los costes de egress y las zonas de seguridad pertenecen a una consideración, mientras que el ancho de banda colectivo, el comportamiento de RDMA, el control de congestión y las generaciones de puertos corresponden a otra. Las estimaciones mixtas generan una falsa precisión y licitaciones incorrectas.

En tercer lugar, la organización debe elegir conscientemente la pila de transporte y operación. InfiniBand sigue siendo una opción justificable donde el ancho de banda colectivo y la latencia marcan el límite absoluto, y la posible brecha del 15 al 25 % de RoCEv2 desequilibra el caso de negocio. Ethernet con RoCEv2, especificaciones abiertas y una economía de puertos en crecimiento es la opción más sólida donde priman la escalabilidad, la disponibilidad de suministro, la operación multivector y la integración en infraestructuras de centros de datos existentes. La especificación UEC 1.0 y el plan de desarrollo de puertos IEEE respaldan esta opción, aunque no sustituyen un ajuste propio ni una prueba de concepto.

En cuarto lugar, el equipo directivo debe calcular el coste total por puerto, módulo, vatios y transferencia de datos. Los 800G y, según las previsiones, pronto los 1,6 Tbps aumentan el rendimiento y modifican el presupuesto de energía y óptica. Las tarifas de egress en la nube deciden si los resultados de inferencia permanecen en la infraestructura propia o se transfieren a un coste elevado. Al integrar estas cuatro variables, se detecta con antelación si la red marca el ritmo, y se pueden tomar medidas antes de que el próximo pedido de GPU convierta el cuello de botella en un gasto aún mayor.

Preguntas frecuentes

¿Cómo detecta el departamento de TI que la red está limitando el rendimiento de las GPU?

Cuando la latencia entre tokens aumenta a pesar de que la capacidad de cómputo esté libre y los colectivos Este-Oeste como All-Reduce dominan el tiempo de paso, el cuello de botella reside en la red. Cisco describe el movimiento de datos en este contexto como el principal factor limitante del rendimiento de las GPU.

¿Qué diferencia el tráfico Norte-Sur y Este-Oeste en la inferencia de IA?

La red de solicitudes Norte-Sur gestiona las peticiones hacia el clúster y devuelve los resultados. La estructura Este-Oeste de las GPU acopla los aceleradores mediante NVLink, InfiniBand o RDMA sobre Ethernet. Los colectivos en el camino Este-Oeste suelen determinar con frecuencia el tiempo de paso.

¿A qué velocidad está creciendo Ethernet en el backend de IA según datos de mercado y previsiones?

En 2025, Ethernet superó a InfiniBand en adopción en redes backend de IA. Los puertos de 800 Gbps superaron claramente los 20 millones de unidades en solo tres años. Según la previsión de Dell’Oro, la mayoría de los puertos de conmutadores backend de IA hasta 2025 serán de 800 Gbps, hasta 2027 de 1600 Gbps y hasta 2030 de 3200 Gbps. 2026 se considera, según las previsiones, el primer año con entregas en volumen de conmutadores de 1,6 Tbps, con un aumento de más de 5 millones de puertos en uno o dos años.

¿Es Ethernet con RoCEv2 un sustituto completo de InfiniBand?

No de forma general. En el debate práctico de 2025 y 2026, InfiniBand sigue destacando por su menor latencia y mayor ancho de banda en All-Reduce. Un RoCEv2 bien ajustado se acerca, pero suele quedar entre un 15 y un 25 % por debajo de InfiniBand en ancho de banda colectivo. Ethernet destaca por su ecosistema, capacidad de suministro e integración; la brecha en rendimiento colectivo debe medirse en función de la propia carga de trabajo.

¿Qué factores de coste debe considerar la dirección además de los puertos de los conmutadores?

Consumo de los módulos, precio de las ópticas y salida de datos en la nube. Los módulos de 800G suelen consumir entre 14 y 24 vatios. Como referencia de precio al por menor, un módulo 800G OSFP-SR8 ronda los 762 euros. La salida de datos de Google Cloud a Europa cuesta, tras el primer GiB gratuito, entre 0,10 y 0,074 euros por GiB según la escala. Las tarifas de salida de AWS parten, tras el nivel gratuito, en unos 0,078 euros por GB. Los precios indicados para AWS y los módulos al por menor son referencias y no valores contractuales vinculantes.

Fuente de la imagen: Generada por IA (agosto de 2026)

Más del grupo editorial MBF Media

Más para leer en Digital Chiefs

Digital ChiefsAmazon y Alphabet: flujo de caja negativo, compromiso a largo plazoDigital ChiefsIA local: gobernanza antes de la compra de hardwareDigital ChiefsRegulación de IA: hasta un 3 por ciento del volumen de negocios del grupo
cloudmagazinEscasez en la nube: qué significa el segundo trimestre para los compradores securitytodayDrones sobre infraestructuras críticas: el perímetro se convierte en ciber-OT mybusinessfutureClima de financiación en el segundo trimestre de 2026: créditos escasos, capital disponible
Compartir este artículo:

También disponible en

Más artículos

09.09.2026

Nvidia adquiere Hugging Face por más de 11.000 millones de euros

Eva Mickler

4 Min. de lectura Nvidia adquiere Hugging Face por unos 11.100 millones de euros, contrato del 2 de septiembre ...

Leer artículo
08.09.2026

SAP deja que Joule controle robots, la responsabilidad sigue abierta

Bernhard Liebl

4 min de lectura SAP ha documentado el primer Embodied-AI-Jam en la Swiss Smart Factory de Biel. Los ...

Leer artículo
15.08.2026

ChatGPT quiere leer el Mac

Eva Mickler

6 min de lectura OpenAI describió Computer History para la app de ChatGPT en Mac el 13 de agosto de ...

Leer artículo
14.08.2026

SpaceX compra Cursor: cláusulas de la UE pendientes

Eva Mickler

5 min de lectura El contrato de compra se formalizó el 14 de agosto de 2026. Quien utilice la herramienta ...

Leer artículo
13.08.2026

La CRA obliga a los fabricantes a notificar en 24 horas

Bernhard Liebl

9 min. de lectura El 11 de septiembre de 2026 entra en vigor el artículo 14 del Reglamento de Resiliencia ...

Leer artículo
11.08.2026

Los planes de capital de NVIDIA y lo que deben revisar los operadores

Bernhard Liebl

7 min. de lectura NVIDIA anunció el 10 de agosto de 2026 que, junto con seis socios de capital, creará ...

Leer artículo
Una revista de Evernine Media GmbH