Berliner Boersenzeitung - Clockwork.io lanza primer compromiso contractual para eliminar el desperdicio de GPU en entrenamiento de IA

EUR -
AED 4.21834
AFN 74.661225
ALL 91.432306
AMD 416.419413
ANG 2.056463
AOA 1054.440663
ARS 1739.601242
AUD 1.608272
AWG 2.06753
AZN 1.957227
BAM 1.955422
BBD 2.310453
BDT 140.872738
BGN 1.933647
BHD 0.432416
BIF 3448.932551
BMD 1.148628
BND 1.465916
BOB 11.270819
BRL 5.906291
BSD 1.147178
BTN 109.921728
BWP 15.556989
BYN 3.470128
BYR 22513.103189
BZD 2.307154
CAD 1.607907
CDF 2654.479062
CHF 0.944743
CLF 0.027911
CLP 1102.062801
CNY 7.693107
CNH 7.700293
COP 3628.597782
CRC 513.200684
CUC 1.148628
CUP 30.438634
CVE 110.243665
CZK 24.347696
DJF 204.280467
DKK 7.475389
DOP 67.706897
DZD 153.643935
EGP 59.789629
ERN 17.229416
ETB 187.378938
FJD 2.545249
FKP 0.859109
GBP 0.857921
GEL 2.990867
GGP 0.859109
GHS 13.215443
GIP 0.859109
GMD 84.42856
GNF 10085.048308
GTQ 8.754306
GYD 240.003554
HKD 9.011042
HNL 30.79504
HRK 7.534658
HTG 149.930985
HUF 364.287725
IDR 20459.4717
ILS 3.487958
IMP 0.859109
INR 110.194179
IQD 1502.809171
IRR 1578903.655694
ISK 139.202636
JEP 0.859109
JMD 181.144944
JOD 0.814422
JPY 180.197158
KES 148.551252
KGS 100.447935
KHR 4649.100291
KMF 491.613064
KPW 1033.765308
KRW 1592.044397
KWD 0.353962
KYD 0.956015
KZT 512.880746
LAK 25706.025284
LBP 102727.519827
LKR 379.706518
LRD 198.461593
LSL 18.650291
LTL 3.391599
LVL 0.694794
LYD 7.28659
MAD 10.868997
MDL 20.161098
MGA 4973.037601
MKD 61.513096
MMK 2411.949927
MNT 4132.823691
MOP 9.269406
MRU 46.150069
MUR 54.640655
MVR 17.746733
MWK 1989.21504
MXN 19.789482
MYR 4.690656
MZN 73.40923
NAD 18.650291
NGN 1529.662418
NIO 42.211831
NOK 10.809019
NPR 175.874964
NZD 1.993627
OMR 0.441652
PAB 1.147178
PEN 3.871151
PGK 5.106012
PHP 72.2606
PKR 317.962167
PLN 4.363465
PYG 6800.683909
QAR 4.193089
RON 5.263476
RSD 117.367287
RUB 96.581309
RWF 1685.17388
SAR 4.316112
SBD 9.18961
SCR 15.827137
SDG 690.903792
SEK 11.290555
SGD 1.465883
SHP 0.858627
SLE 28.314099
SLL 24086.139517
SOS 655.573131
SRD 43.585257
STD 23774.274604
STN 24.49526
SVC 10.038057
SYP 14934.457826
SZL 18.644392
THB 38.275765
TJS 10.582452
TMT 4.031683
TND 3.374547
TOP 2.76562
TRY 56.015171
TTD 7.787493
TWD 36.503811
TZS 3039.911706
UAH 51.253181
UGX 4525.124283
USD 1.148628
UYU 46.131073
UZS 13582.371494
VES 973.444877
VND 29889.590367
VUV 135.812798
WST 3.158992
XAF 655.957
XAG 0.01734
XAU 0.000262
XCD 3.104224
XCG 2.0675
XDR 0.812139
XOF 655.957
XPF 119.331742
YER 271.708303
ZAR 18.688024
ZMK 10339.031894
ZMW 22.547637
ZWL 369.857655
SSP 6551.981415
MXV 2.243573
Clockwork.io lanza primer compromiso contractual para eliminar el desperdicio de GPU en entrenamiento de IA
Clockwork.io lanza primer compromiso contractual para eliminar el desperdicio de GPU en entrenamiento de IA

Clockwork.io lanza primer compromiso contractual para eliminar el desperdicio de GPU en entrenamiento de IA

La garantía "You Only Compute Once" (YOCO) se compromete a resolver el 90 % de los fallos durante el entrenamiento de modelos de IA sin pérdida de progreso; en caso contrario, los clientes recibirán una compensación económica

Tamaño del texto:

PALO ALTO (California, EE. UU.) / ACCESS Newswire / 1 de julio de 2026 / Clockwork.io, pionera en Software-Driven AI Fabrics™ y la empresa responsable de TorchPass, su solución de tolerancia a fallos para IA, anunció hoy la Garantía YOCO, el primer compromiso contractual del sector destinado a reducir drásticamente el coste oculto y acumulativo que provocan los fallos durante el entrenamiento de modelos de inteligencia artificial a gran escala. El anuncio marca un punto de inflexión en la forma en que la industria mide la fiabilidad de la infraestructura de IA, alejándose de las métricas tradicionales de disponibilidad ("uptime") diseñadas para una era anterior y centrándose en lo que realmente valoran los equipos de IA: que el entrenamiento finalice a tiempo y sin pérdida de trabajo.

En virtud de la garantía YOCO (You Only Compute Once), Clockwork.io se compromete a que al menos el 90 % de los fallos de entrenamiento en cargas de trabajo TorchPass compatibles se resolverán mediante la migración en caliente de las GPU, sin pérdida del progreso del entrenamiento, sin necesidad de volver al último punto de control ("checkpoint") y sin tener que recomputar el trabajo ya realizado. Si Clockwork.io no cumple este compromiso durante cualquier año de contrato, los clientes recibirán un crédito del 25 % aplicable a la siguiente renovación o ampliación de TorchPass.

"Desarrollamos TorchPass para que los fallos durante el entrenamiento dejaran de ser un problema", afirmó Suresh Vasudevan, director ejecutivo de Clockwork.io. "La garantía YOCO queda reflejada en el propio contrato. Ponemos en juego nuestra propia credibilidad porque sabemos que TorchPass cumple lo que promete, y queremos que nuestros clientes también lo sepan".

El coste oculto del progreso en IA
Todas las organizaciones que entrenan modelos de IA a gran escala se enfrentan al mismo problema: los clústeres de GPU fallan constantemente y cada fallo obliga a reiniciar un costoso ciclo de recuperación. Según una investigación publicada por Meta FAIR en HPCA 2025, un clúster de 1.024 GPU presenta un tiempo medio entre fallos de apenas 7,9 horas, mientras que en un clúster de 16.384 GPU esa cifra se reduce a 1,8 horas. Cada fallo obliga a asignar nuevos nodos, restaurar el entrenamiento desde el último punto de control y volver a calcular todos los pasos realizados desde entonces. Ese trabajo recomputado supone un coste completo de GPU: capacidad de cálculo que ya se había pagado y que debe volver a ejecutarse desde cero. Habitualmente, cada incidente implica la pérdida de tres o más horas de progreso, acumulándose estas pérdidas día tras día.

Como consecuencia, los clústeres actuales de GPU funcionan de forma efectiva entre un 30 % y un 50 % de su rendimiento teórico, no porque el hardware sea lento, sino porque el modelo de fiabilidad sobre el que se construye nunca fue diseñado para cargas de trabajo de esta naturaleza, duración y escala.

"Los equipos de IA necesitan que sus modelos se completen, no simplemente que sus nodos permanezcan activos. Durante años, el sector ha medido la disponibilidad de los nodos y la ha llamado fiabilidad. YOCO nos hace responsables de lo único que realmente importa: que el modelo termine de entrenarse", añadió Vasudevan.

El impacto económico es considerable. En una implementación típica de 2.048 GPU H200, los reinicios provocados por fallos generan más de 6 millones de dólares anuales en capacidad de cálculo desperdiciada, con cientos de miles de horas de GPU perdidas debido a reintentos encadenados, tiempos de recuperación y recomputación del entrenamiento. Para quienes desarrollan IA, la verdadera unidad de valor no es el tiempo de disponibilidad de las GPU, sino el tiempo necesario para obtener un modelo entrenado. Sin embargo, los contratos de infraestructura que adquieren garantizan la disponibilidad de los nodos, no la continuidad de los trabajos de entrenamiento. Para los operadores de IA ocurre algo similar: cuando el entrenamiento de un cliente falla, se reinicia y pierde días de progreso, la percepción es de falta de fiabilidad, independientemente de lo que establezca el acuerdo de nivel de servicio (SLA).

"La recomputación y los reinicios constituyen el impuesto oculto del entrenamiento de IA a gran escala", señaló Vasudevan. "La mayoría de los equipos lo consideran inevitable. No lo es".

La garantía YOCO cambia ese planteamiento contractual.

TorchPass: la fiabilidad redefinida mediante software
La respuesta de Clockwork.io consiste en convertir la fiabilidad en una propiedad definida por software, en lugar de depender de la disponibilidad del hardware, mediante un replanteamiento arquitectónico que desvincula la continuidad del entrenamiento de la tasa de fallos de cualquier componente individual.

TorchPass aborda los fallos desde su origen mediante la migración en caliente de GPU. Cuando se produce una incidencia, la solución transfiere todo el estado almacenado en memoria del entrenamiento -incluidos los pesos del modelo, los gradientes y el estado del optimizador- a un nodo de reserva operativo. El entrenamiento continúa exactamente donde se había detenido y, por lo general, la recuperación se completa en aproximadamente tres minutos, sin restaurar puntos de control, sin recomputar y sin pérdida de progreso.

TorchPass gestiona tres tipos de incidencias: migración no planificada para fallos repentinos y graves, como bloqueos del kernel, cortes de suministro eléctrico o averías de GPU; migración preventiva, activada por señales tempranas como el aumento de errores ECC o determinados umbrales térmicos; y migración planificada para tareas de mantenimiento, actualizaciones de seguridad o firmware. En los tres casos, el entrenamiento continúa sin interrupciones.

Disponibilidad
La garantía YOCO estará disponible para los nuevos clientes de TorchPass y para las renovaciones a partir del 3 de agosto de 2026. Los clientes actuales podrán ponerse en contacto con su equipo comercial de Clockwork.io para incorporar la garantía a sus contratos vigentes. Más información en clockwork.io/yoco.

Clockwork.io estará presente en RAISE Summit, que se celebrará en París (Francia) los días 8 y 9 de julio, en el stand 27A. Además, Suresh Vasudevan, director ejecutivo de Clockwork.io, participará el 8 de julio, a las 10:40 horas (hora local), en la mesa redonda "Infrastructure as Destiny: The Compute-Capital-Cloud Trinity", que tendrá lugar en el escenario principal.

Contacto:

Dana Trismen
[email protected]
650-269-7478

SOURCE: Clockwork

(T.Renner--BBZ)