LinkedIn évite chaque mois des dizaines de milliers d’heures GPU d’indisponibilité ; les nouvelles innovations de TorchPass permettent de préserver la progression des charges de travail d’IA sans modification du code et d’accélérer l’apprentissage par renforcement.
PALO ALTO, Californie, 5 octobre 2026 — Clockwork.io, dont le logiciel de tolérance aux pannes permet de maintenir le fonctionnement des charges de travail liées à la formation de l’IA, à l’apprentissage par renforcement et à l’inférence même en cas de défaillance de l’infrastructure, annonce aujourd’hui une nouvelle levée de fonds de 31 millions de dollars, des déploiements en production chez LinkedIn et Together AI, ainsi qu’une adoption élargie par WhiteFiber.
L’entreprise a également présenté deux nouvelles fonctionnalités pour sa solution TorchPass, chacune permettant de capturer l’état d’une tâche d’IA distribuée en cours d’exécution. Les instantanés de plateformes multi-nœuds, une première dans le secteur de l’apprentissage automatique, permettent de sauvegarder l’intégralité d’un travail en cours d’exécution sur l’ensemble des nœuds sans modifier le code d’apprentissage, et de le conserver en vue d’une restauration. Des points de contrôle rapides et asynchrones de l’application, effectués en arrière-plan pendant l’exécution de la tâche, accélèrent l’apprentissage par renforcement. Ils transmettent les poids actualisés du modèle aux répliques d’inférence qui génèrent les rollouts (les exemples à partir desquels le modèle apprend), ce qui permet à ces répliques de passer moins de temps à attendre ou à travailler à partir d’un modèle obsolète.
La tolérance aux pannes est désormais une exigence incontournable pour l’IA à grande échelle
Les charges de travail d’IA distribuées à grande échelle peuvent s’étendre sur des milliers de GPU qui doivent rester synchronisés : un seul GPU défaillant, une connexion interrompue ou un serveur figé peuvent paralyser l’ensemble du traitement. Meta a signalé des interruptions imprévues, à raison d’environ une toutes les trois heures en moyenne, au cours d’une période de 54 jours consacrée à la formation de Llama 3 sur 16 384 GPU.
La solution habituelle consiste à recharger un point de contrôle, c’est-à-dire une copie enregistrée de l’avancement de la tâche. La récupération peut prendre jusqu’à 90 minutes, met les GPU en bon état en attente et nécessite que la tâche répète le travail effectué depuis ce point de contrôle. Les clients paient pour des GPU inutilisés et des calculs répétés, et les modèles mettent plus de temps à s’exécuter. À mesure que le nombre de tâches augmente, chaque redémarrage compromet davantage le temps de calcul alloué au GPU.
À cette échelle, garantir la continuité des opérations utiles malgré les pannes est une exigence fondamentale de l’infrastructure. Clockwork.io y répond grâce à une suite de solutions de tolérance aux pannes que les équipes chargées de la plateforme déploient comme une couche intermédiaire entre le matériel et la charge de travail. LinkPass redirige le trafic en contournant une liaison défaillante, de sorte que la tâche ne détecte jamais la panne. TorchPass transfère les tâches d’un GPU défaillant vers un GPU en bon état, ce qui permet de poursuivre l’entraînement au lieu de revenir en arrière. Les deux sont en cours de production. Les nouveaux instantanés de la plateforme TorchPass, annoncés aujourd’hui, permettent de capturer l’état d’une tâche distribuée en cours d’exécution, afin que l’ensemble de la tâche puisse être restauré lorsqu’une défaillance est trop importante pour être contournée.
« Les échecs sont inévitables à l’échelle de l’IA. On ne devrait pas perdre des heures de travail productives à cause d’eux », déclare Suresh Vasudevan, CEO de Clockwork.io. « La tolérance aux pannes est un multiplicateur de débit effectif : cela permet aux cartes graphiques de continuer à effectuer des tâches utiles au lieu d’attendre la récupération des données ou de répéter des opérations déjà effectuées. Nous avons développé notre logiciel en collaboration avec des entreprises et des fournisseurs de services cloud qui exploitent certains des plus grands parcs de GPU ; il est donc capable de gérer les pannes auxquelles ils sont réellement confrontés. Cette protection fait partie intégrante de l’infrastructure sur laquelle s’appuient quotidiennement les entreprises et les fournisseurs de services cloud. »
L’adoption se généralise au sein des entreprises, chez les hyperscalers et dans les néoclouds
Les entreprises qui gèrent leurs propres parcs de GPU, les hyperscalers et les néoclouds adoptent Clockwork.io pour la même raison : une plus grande partie de leurs heures de calcul GPU est consacrée à des tâches utiles.
LinkedIn a déployé la technologie LinkPass de tolérance aux pannes réseau sur l’ensemble de son parc d’infrastructures d’IA, ce qui permet d’éviter chaque mois des dizaines de milliers d’heures de temps d’arrêt des GPU.
« À l’échelle d’une infrastructure IA, un problème réseau isolé ne devrait jamais mettre hors service des GPU en bon état de fonctionnement ni interrompre les charges de travail en cours d’exécution. Avant Clockwork.io, une seule instabilité au niveau d’une carte réseau InfiniBand pouvait mettre hors service un serveur équipé de huit GPU, tandis qu’une instabilité au niveau d’un port de commutateur pouvait mettre hors service un deuxième serveur, doublant ainsi l’impact à 16 GPU », déclare Raghu Hiremagalur, vice-président principal et CTO de l’infrastructure chez LinkedIn. « Clockwork.io a contribué à transformer ce modèle opérationnel. Sa technologie de tolérance aux pannes réseau redirige automatiquement le trafic vers des chemins opérationnels, ce qui permet aux tâches de se poursuivre sans interruption pendant la réparation des pannes de liaison, de fibre optique, de câble ou de NIC. Au total, Clockwork.io évite chaque mois des dizaines de milliers d’heures de temps d’arrêt des GPU sur l’ensemble de notre parc. En transformant ce qui était autrefois des incidents opérationnels perturbateurs en interventions de maintenance gérables, Clockwork.io a contribué à améliorer le taux d’utilisation des infrastructures et l’efficacité opérationnelle. »
Together AI commercialise TorchPass sous forme de service sur ses clusters de GPU. Lors de la PyTorch Conference, les deux entreprises présenteront en direct un travail d’entraînement multi-nœuds qui se poursuit malgré des pannes simulées du réseau et des GPU, sans redémarrage.
« Nos clients nous jugent sur le goodput, la part de leurs heures de GPU qui font réellement progresser le modèle », déclare Pavneet Ahluwalia, chef de produit chez Together AI. « La fonction de réparation des nœuds détecte déjà les défaillances et alloue automatiquement une capacité de remplacement. Les solutions TorchPass et LinkPass de Clockwork.io s’appuient sur cette base et sont conçues pour assurer la continuité des tâches en cas de défaillance des GPU ou de coupures de liaison, tout en préservant la progression des tâches. Nous les commercialisons comme le prochain niveau de résilience de la plateforme. »
WhiteFiber (NASDAQ : WYFI), un client existant, étend l’utilisation du logiciel Clockwork.io à l’ensemble de son réseau mondial de services GPU-as-a-service, en pleine expansion.
« Il est essentiel de tester la fiabilité d’un cluster sous pression avant sa mise en production, car un client qui hérite d’un défaut caché au niveau de la structure en fera les frais par la suite, sous forme de tâches échouées et d’heures de GPU perdues », déclare Tom Sanfilippo, CTO chez WhiteFiber. « Des optiques marginales, des cartes réseau mal configurées et des liaisons qui passent un test de base mais se dégradent sous charge peuvent passer inaperçues. L’audit automatisé de parc de Clockwork.io vérifie simultanément chaque lien et chaque nœud, localise les défaillances en quelques minutes et nous permet de les corriger avant la mise en service. Nous mettons les clusters en service plus rapidement, et la première session de formation d’un client s’effectue sur une infrastructure validée de bout en bout, et pas simplement mise sous tension. Compte tenu de la croissance fulgurante de la demande du marché, il est essentiel pour notre activité de mettre rapidement à la disposition de nos clients une capacité validée ; c’est pourquoi nous déployons actuellement Clockwork.io sur l’ensemble de nos clusters. »
Les nouvelles fonctionnalités de TorchPass confèrent aux équipes chargées de la plateforme les moyens de protéger les charges de travail
Clockwork.io a étendu les capacités de TorchPass au-delà de la migration vers le GPU en y ajoutant deux fonctionnalités dont les équipes de la plateforme ne disposaient pas jusqu’à présent : un aperçu complet d’un travail distribué qu’ils peuvent obtenir eux-mêmes, ainsi que des points de contrôle de l’application suffisamment rapides pour s’exécuter en arrière-plan.
Dans le cadre de la formation, les instantanés de plateforme enregistrent l’état d’exécution d’une tâche en cours sur l’ensemble de ses nœuds, afin que celle-ci puisse être restaurée après une interruption. Les équipes chargées de la plateforme et les ingénieurs en infrastructure d’IA le déploient pour les charges de travail prises en charge sans attendre que les responsables d’applications modifient leur code ou ajoutent une logique de point de contrôle. Les équipes d’entreprise peuvent sécuriser les tâches de formation sur l’ensemble de leur parc à l’aide d’un seul mécanisme, et les fournisseurs de services cloud peuvent sécuriser les tâches de leurs clients dont ils ne contrôlent pas le code. Lorsque les équipes effectuent des sauvegardes au niveau de l’application, les sauvegardes rapides de TorchPass peuvent être réalisées plus fréquemment, ce qui permet de limiter la perte de progrès et de réduire le nombre de calculs à refaire en cas d’échec.
Pour les opérations d’inférence, les modèles volumineux s’exécutent sur deux serveurs ou plus ; ainsi, une seule connexion défaillante peut mettre hors service toute une réplique et interrompre une session utilisateur ou une tâche d’agent en cours d’exécution. LinkPass permet à ces répliques réparties sur plusieurs serveurs de continuer à fonctionner malgré les pannes de liaison.
L’apprentissage par renforcement repose à la fois sur la formation et sur l’inférence. Les copies du modèle génèrent des itérations ; le modèle d’entraînement apprend à partir de celles-ci, et les poids mis à jour doivent être transmis aux copies avant que celles-ci puissent générer des résultats avec la dernière version. Les points de contrôle d’application de TorchPass transmettent plus rapidement les poids mis à jour aux répliques de déploiement, tandis que LinkPass permet à ces répliques de continuer à fonctionner malgré les pannes de liaison.
« La tolérance aux pannes dans les clusters était autrefois un problème de formation. C’est désormais aussi un problème d’inférence », explique Dylan Patel, fondateur, CEO et analyste en chef chez SemiAnalysis, dont les classements ClusterMAX servent de référence pour les fournisseurs de services cloud de GPU. « Dans notre ClusterMAX, TorchPass réduit la perte de débit utile lors de l’entraînement de 14 % à moins de 3 % pour un néocloud certifié Gold. L’apprentissage par renforcement (RL) fait le lien entre les deux : les répliques d’inférence génèrent des rollouts, l’entraîneur en tire des enseignements, puis les poids mis à jour sont renvoyés vers les répliques. Clockwork.io assure la continuité du service des répliques en cas de fluctuations de connexion et de pannes réseau. Ses points de contrôle extrêmement rapides accélèrent le transfert de poids vers le parc de rollout, de sorte qu’aucune des deux directions ne bloque l’exécution. C’est au niveau de la couche de tolérance aux pannes sous-jacente à la formation, à l’inférence et à l’apprentissage par renforcement que ce problème doit être résolu. »
Les équipes chargées des plateformes d’entreprise et les fournisseurs de services cloud peuvent contacter Clockwork.io afin d’évaluer le logiciel pour leurs charges de travail ou d’étudier des opportunités de partenariat.
Le tour de table et ce qu’il permet de financer
Ce tour de table a été mené conjointement par Premji Invest, Wing Venture Capital et Seligman Ventures, avec la participation des investisseurs existants NEA et e& Capital. Il porte le montant total des financements levés par Clockwork.io à 73 millions de dollars. L’entreprise utilisera ces fonds pour accélérer le déploiement de sa suite de solutions de tolérance aux pannes dans les domaines de l’entraînement, de l’inférence et de l’apprentissage par renforcement, pour étendre son adoption par les entreprises et pour développer son offre par l’intermédiaire de partenaires cloud.
« La seule chose qui évolue parfaitement à grande échelle, c’est le manque de fiabilité : il suffit de mettre suffisamment de cartes graphiques dans une machine pour qu’il y ait toujours un problème », confie Greg Papadopoulos, Venture Partner, NEA. « La vieille recette : interrompre la tâche et recharger un point de contrôle n’a aucun sens, compte tenu de l’ampleur actuelle des opérations. Clockwork considère l’échec comme un état normal : TorchPass transfère en temps réel l’entraînement depuis un GPU défaillant et réalise désormais des instantanés d’un travail en cours d’exécution dans son intégralité, sans aucune modification du code. Cela permet déjà d’économiser des dizaines de milliers d’heures GPU par mois. Nous avons soutenu pour la première fois Clockwork.io en 2021 et nous sommes ravis de continuer à les accompagner alors qu’ils définissent la couche de performances des clusters d’IA. »
À propos de Clockwork.io
Clockwork.io est le pionnier des AI Fabrics™ pilotés par logiciel, une couche programmable entre le matériel et les charges de travail qui rend les clusters de GPU observables, tolérants aux pannes et pleinement exploités, quel que soit l’accélérateur, le réseau ou le cloud utilisé. Les charges de travail d’IA nécessitent que l’ensemble du cluster fonctionne comme une seule machine, mais les pannes et les goulots d’étranglement entraînent la mise à l’arrêt des GPU. La plateforme FleetLens de Clockwork.io, permet de récupérer cette capacité perdue : une télémétrie précise à la nanoseconde près permet d’identifier le GPU, le nœud ou la liaison à l’origine du ralentissement ou du blocage d’une tâche, de valider les clusters avant leur lancement et, grâce à LinkPass et TorchPass, d’assurer la continuité des charges de travail en cas de défaillance ou de dégradation de l’infrastructure, de l’entraînement à l’inférence. SemiAnalysis a mené une évaluation comparative indépendante qui a montré que TorchPass assure une correction des pannes plus rapidement que le redémarrage depuis un point de contrôle et que les principaux frameworks open source. LinkedIn, Together AI, WhiteFiber, Wells Fargo, Nebius, NScale et DCAI font confiance à Clockwork.io pour prendre en charge leur infrastructure d’IA. Pour en savoir plus, rendez-vous sur www.clockwork.io.