Berliner Boersenzeitung - ockwork.io presenta una nueva clase de tolerancia a fallos para acabar con el desperdicio de GPU

EUR -
AED 4.236995
AFN 75.564777
ALL 92.925304
AMD 422.338256
AOA 1057.950846
ARS 1720.186655
AUD 1.634576
AWG 2.076675
AZN 1.954279
BAM 1.95528
BBD 2.322983
BDT 142.38216
BHD 0.434894
BIF 3447.858408
BMD 1.153708
BND 1.477207
BOB 13.69636
BRL 5.975869
BSD 1.153294
BTN 110.017146
BWP 15.567863
BYN 3.419365
BYR 22612.684445
BZD 2.319634
CAD 1.606164
CDF 2619.559688
CHF 0.936743
CLF 0.026783
CLP 1054.109049
CNY 7.78476
CNH 7.784105
COP 3623.013531
CRC 522.972347
CUC 1.153708
CUP 30.573272
CVE 110.235704
CZK 24.259084
DJF 205.037586
DKK 7.475978
DOP 67.252127
DZD 153.435832
EGP 57.900816
ERN 17.305626
ETB 186.55832
FJD 2.550865
FKP 0.853025
GBP 0.854661
GEL 3.011003
GGP 0.853025
GHS 13.569394
GIP 0.853025
GMD 84.812008
GNF 10128.308297
GTQ 8.798662
GYD 241.545807
HKD 9.052971
HNL 30.913784
HRK 7.533829
HTG 150.799923
HUF 365.315418
IDR 20591.387346
ILS 3.45801
IMP 0.853025
INR 110.049993
IQD 1510.898463
IRR 1586031.766414
ISK 142.010199
JEP 0.853025
JMD 182.471506
JOD 0.818036
JPY 183.805935
KES 149.197336
KGS 100.892074
KHR 4672.758166
KMF 491.479148
KRW 1630.778433
KWD 0.356392
KYD 0.961145
KZT 537.888706
LAK 26022.084362
LBP 103281.951751
LKR 385.677502
LRD 208.174675
LSL 18.716326
LTL 3.406601
LVL 0.697867
LYD 7.355045
MAD 10.68546
MDL 20.033676
MGA 4962.681116
MKD 61.503655
MMK 2422.138913
MNT 4147.35178
MOP 9.321223
MRU 46.098749
MUR 54.27046
MVR 17.824855
MWK 1999.868514
MXN 19.733484
MYR 4.720861
MZN 73.727751
NAD 18.716326
NGN 1571.847041
NIO 42.438721
NOK 10.960702
NPR 176.02322
NZD 1.961933
OMR 0.443597
PAB 1.153294
PEN 3.899064
PGK 5.175625
PHP 70.640985
PKR 320.13932
PLN 4.302582
PYG 6867.174977
QAR 4.204383
RON 5.23876
RSD 117.319465
RUB 95.121228
RWF 1698.848513
SAR 4.321626
SBD 9.305462
SCR 15.863122
SDG 692.804035
SEK 10.989147
SGD 1.477168
SLE 28.403473
SOS 659.124831
SRD 43.778598
STD 23879.434346
STN 24.493491
SVC 10.091318
SZL 18.705434
THB 38.24947
TJS 10.628075
TMT 4.049516
TND 3.3864
TRY 55.075645
TTD 7.811093
TWD 37.209176
TZS 3063.093434
UAH 51.748047
UGX 4290.85966
USD 1.153708
UYU 46.437659
UZS 13713.355534
VES 871.929427
VND 30153.899336
VUV 137.115681
WST 3.15393
XAF 655.782719
XAG 0.017881
XAU 0.000264
XCD 3.117955
XCG 2.078693
XDR 0.815195
XOF 655.782719
XPF 119.331742
YER 275.046986
ZAR 18.710265
ZMK 10384.761593
ZMW 21.625253
ZWL 371.493631
ockwork.io presenta una nueva clase de tolerancia a fallos para acabar con el desperdicio de GPU
ockwork.io presenta una nueva clase de tolerancia a fallos para acabar con el desperdicio de GPU

ockwork.io presenta una nueva clase de tolerancia a fallos para acabar con el desperdicio de GPU

La nueva solución TorchPass aborda un desafío multimillonario en la infraestructura de IA; utiliza migración en vivo de GPU para mantener el entrenamiento de IA a gran escala en funcionamiento ante fallos de hardware en lugar de obligar a costosos reinicios

Tamaño del texto:

PALO ALTO, CA / ACCESS Newswire / 10 de marzo de 2026 / Clockwork.io, líder en Software-Driven AI Fabrics™, una capa de software programable y neutral respecto a proveedores que optimiza clústeres de GPU a gran escala para observabilidad en tiempo real, tolerancia a fallos y rendimiento determinista, anunció hoy la disponibilidad general de TorchPass Workload Fault Tolerance. Esta nueva clase de tolerancia a fallos impulsada por software elimina uno de los modos de fallo más costosos en el entrenamiento de IA a gran escala: los reinicios catastróficos de trabajos provocados por fallos de infraestructura.

Ofrecido como una capacidad central de la plataforma FleetIQ de Clockwork.io, TorchPass aplica los principios de Software-Driven AI Fabrics al entrenamiento distribuido, utilizando migración en vivo de GPU para permitir que las cargas de trabajo continúen ejecutándose a través de fallos de GPU, interrupciones de red, errores de controladores e incluso caídas completas de nodos, sin reinicios desde checkpoints ni pérdida de progreso.

"Las empresas están invirtiendo miles de millones en chips de nueva generación, y sin embargo los costes de ejecutar trabajos de IA distribuidos siguen estando enormemente inflados porque el ecosistema ha aceptado el fallo como una constante", afirmó Suresh Vasudevan, CEO de Clockwork.io. "Construimos TorchPass para rechazar fundamentalmente esa premisa. En lugar de tratar el fallo como inevitable y reiniciar después, TorchPass hace que los fallos de infraestructura sean invisibles para la carga de trabajo: el entrenamiento continúa a través de los fallos de forma transparente, en software. Para un despliegue típico de 2.048 GPU, eso se traduce en más de 6 millones de dólares al año en capacidad de cómputo recuperada. Esto es exactamente lo que nuestro enfoque de Software-Driven AI Fabric fue diseñado para ofrecer: infraestructura de IA tolerante a fallos".

Dylan Patel, fundador y CEO de SemiAnalysis, coincidió en que los trabajos de entrenamiento a gran escala están limitados por interrupciones. "A medida que se despliegan clústeres Blackwell con un dominio NVL72, y mirando al futuro con el dominio NVL576 de Rubin Ultra, la idea de que un solo error de GPU o una fluctuación en un enlace de red pueda detener toda una ejecución es totalmente inaceptable", afirmó Patel. "TorchPass resuelve un enorme desafío de fiabilidad de clústeres: proporciona conmutación por error transparente y migración en vivo de cargas de trabajo que mantiene alto el MFU, lo que a su vez impulsa una mejor economía de GPU".

Por qué el entrenamiento de IA falla a escala
El entrenamiento distribuido de IA sigue siendo una de las cargas de trabajo más propensas a fallos en la infraestructura moderna. A medida que crece el tamaño de los clústeres, la fragilidad aumenta de forma pronunciada. Investigaciones de Meta FAIR muestran que el tiempo medio hasta el fallo desciende a 7,9 horas en un clúster de 1.024 GPU y a solo 1,8 horas en uno de 16.384 GPU. Esto significa que, para la mayoría de las grandes empresas centradas en IA o nubes de IA, los reinicios provocados por fallos son completamente inevitables, lo que convierte este problema en una gran barrera para escalar el impacto de la IA.

Cada fallo obliga a los trabajos de entrenamiento a retroceder hasta el checkpoint más reciente, descartando minutos u horas de trabajo completado y perdiendo tiempo adicional en intervención manual, reprovisión de recursos y reinicio del entrenamiento. Estos reinicios limitan silenciosamente la utilización de GPU, lo que convierte la fiabilidad en uno de los mayores costes ocultos de la infraestructura de IA.

TorchPass aborda este problema al gestionar de forma proactiva los fallos costosos de cargas de trabajo de IA, resolviéndolos antes de que el trabajo se detenga o necesite reiniciarse. Fundamental para empresas que ejecutan grandes cargas de trabajo de IA y para nubes de IA por igual, TorchPass mejora drásticamente la fiabilidad de las cargas de trabajo y la utilización de los clústeres. Para las nubes de IA, que ahora pueden solucionar problemas en GPU afectadas mientras mantienen la ejecución del entrenamiento según lo previsto, esto se traduce en mejores SLA para los clientes y una economía global de nube de IA más favorable, mejorando su capacidad para proteger márgenes y ofrecer nuevos modelos antes.

"Gestionar la producción de cómputo en clústeres de GPU a gran escala es vital para garantizar que estamos ofreciendo capacidad fiable a nuestros clientes. Al usar TorchPass contamos con el respaldo de una empresa que se centra en la resiliencia como si fuera una función central del negocio: sustituye cualquier GPU específica que falle y mantiene el resto del trabajo en marcha, en lugar de permitir que un pequeño problema afecte a nuestras operaciones a gran escala", afirmó David Power, CTO de Nscale.

Habilitando la próxima generación de infraestructura de IA
Al convertir la fiabilidad en una capacidad definida por software en lugar de una limitación de hardware, TorchPass proporciona la confianza operativa necesaria para desplegar sistemas de nueva generación altamente acoplados, como los NVIDIA GB200 y NVIDIA GB300 NVL72, así como futuros sistemas a escala de rack, donde las arquitecturas densas amplifican el coste incluso de pequeños fallos.

TorchPass se basa en el lanzamiento previo de Network Fault Tolerance de Clockwork.io, que aplica los mismos principios de Software-Driven AI Fabric a la resiliencia de red mediante el redireccionamiento transparente del tráfico alrededor de fallos de enlace.

Para obtener más información sobre el lanzamiento de TorchPass, visitar al equipo de Clockwork.io en persona en NVIDIA GTC 2026 del 16 al 19 de marzo, en el stand n.º 205, o visitar https://clockwork.io.

Acerca de Clockwork.io
Clockwork.io es pionera en Software-Driven AI Fabrics™, ofreciendo una capa de software programable que hace que los clústeres de IA a gran escala sean observables, deterministas y resilientes por diseño para impulsar el progreso continuo de las cargas de trabajo y la máxima utilización del clúster. Su plataforma FleetIQ permite a las empresas entrenar, desplegar y servir las cargas de trabajo de IA más exigentes del mundo de forma más rápida, fiable y a menor coste. Empresas como Uber, Wells Fargo, Nebius, Nscale y White Fiber confían en Clockwork.io para impulsar su infraestructura de IA. Más información en www.clockwork.io.

Contacto:

Dana Trismen
[email protected]
650-269-7478

SOURCE: Clockwork

(A.Berg--BBZ)