Un Token 30 fois plus rapide défie la suprématie du GPU ! BNP Paribas encense Cerebras (CBRS.US) CS-4, ouvrant l’ère de la “wafer-scale + inférence découplée”.
Après l’événement Supernova Day organisé mardi par la société de puces d’intelligence artificielle (AI) Cerebras Systems, BNP Paribas a déclaré avoir été impressionnée par les partenaires annoncés par l’entreprise ainsi que par les annonces connexes.
Selon des informations de Zhihu Finance APP, à la suite de l’événement Supernova Day organisé mardi par la société de puces d’intelligence artificielle (IA) Cerebras Systems (CBRS.US), BNP Paribas a déclaré avoir été fortement impressionnée par les partenariats et annonces présentés par l’entreprise.
Dans un rapport adressé à ses clients, Karl Ackerman, analyste chez BNP Paribas, a écrit : « À l’instar du LPU de NVIDIA (NVDA.US), les nouveaux partenariats de Cerebras avec OpenAI, Amazon (AMZN.US) AWS et AMD (AMZ.US) soulignent l’augmentation continue de la demande du marché pour améliorer les phases de décodage, particulièrement sensibles à la latence, lors de l’inférence. »
L’analyste précise également que, pour l’inférence rapide, le tout nouveau moteur à l’échelle de la tranche (Wafer-Scale Engine) CS-4 basé sur la SRAM offre une bande passante mémoire intégrée « impressionnante de 43,2 PB/s », et bénéficie d’une nouvelle interface I/O de tranche exploitant le RDMA. Cerebras revendique fièrement que le système CS-4 génère les tokens à une vitesse trente fois supérieure à celle des systèmes GPU actuellement utilisés en production.
Par ailleurs, l’analyste salue la feuille de route produit de Cerebras, qui prévoit un doublement annuel des performances et une multiplication par vingt du débit d’ici 2027. Selon l’analyste : « Cerebras se concentre sur l’inférence découplée, en positionnant son moteur à l’échelle de la tranche comme un moteur de décodage ultra-rapide pour la génération rapide de tokens, en travaillant conjointement avec des systèmes axés sur le calcul intensif tels qu’AWS Trainium ou AMD Helios. Cerebras estime que son système d’inférence découplée pourrait être jusqu’à 10 fois plus rapide qu’un GPU, et cinq fois plus performant qu’une configuration reposant uniquement sur le WSE. »
Enfin, selon l’analyste, Arista Networks (ANET.US) est devenu un partenaire réseau « clé » pour Cerebras, et il s’attend à ce que ce partenariat permette à Arista de développer de nouvelles applications clients au fil du temps.
Il est à noter que lors de l’événement Supernova Day de mardi, Cerebras a officiellement lancé la nouvelle génération de système IA à l’échelle du rack, le Cerebras CS-4, présenté comme « l’accélérateur IA le plus rapide de l’industrie ». Ce système s’adresse au segment de l’inférence des grands modèles, en concurrence directe avec les serveurs GPU de NVIDIA. Cerebras a également annoncé la conclusion de nouveaux partenariats avec OpenAI, AMD, Arista Networks, AWS, Figma, Cognition et CrowdStrike à l’occasion de cet événement.
Le CS-4 est le premier produit de la nouvelle architecture de plateforme rack Nexus de Cerebras, alimenté par trois tout nouveaux processeurs Wafer Scale Engine 3 Turbo (WSE-3T). Le WSE-3T est le plus grand processeur IA jamais conçu, chaque puce intégrant 4 000 milliards de transistors et 900 000 cœurs optimisés pour l’IA, couvrant une surface de 46 225 mm² de silicium et intégrant 44 Go de SRAM. Le système CS-4 délivre 750 PFLOPS de puissance IA, une bande passante mémoire de 129,6 PB par seconde et un débit d’E/S de 7,2 Tbps. La puissance IA d’un seul WSE-3T est doublée par rapport à la génération précédente, passant de 125 à 250 PFLOPS, tandis que la bande passante mémoire passe de 21,6 PB/s à 43,2 PB/s.
Cerebras affirme que le CS-4 établit une nouvelle référence sectorielle en matière de vitesse d’inférence. Lors des tests comparatifs réalisés sur le modèle GPT-OSS-120B, le CS-4 peut générer plus de 4 400 tokens par seconde et par utilisateur, soit jusqu’à 30 fois plus rapide que les solutions GPUs. Le système peut prendre en charge des modèles de plus de 50 000 milliards de paramètres. Par rapport au précédent CS-3, le CS-4 est deux fois plus rapide, multiplie par dix le débit par watt et offre ainsi une amélioration significative de la rentabilité des centres de données.
Avertissement : le contenu de cet article reflète uniquement le point de vue de l'auteur et ne représente en aucun cas la plateforme. Cet article n'est pas destiné à servir de référence pour prendre des décisions d'investissement.
Vous pourriez également aimer
Le taux de défaut des crédits privés américains atteint un nouveau record de 6,3 %, tandis que celui du secteur des logiciels chute à 0,6 %.
Selon le dernier rapport de Fitch, le taux de défaut du crédit privé américain, basé sur 1 300 emprunteurs suivis au cours des 12 derniers mois, a atteint 6,3 % fin août, dépassant le précédent record de 6,1 % enregistré en juillet. Les secteurs de la santé, de l'industrie et de la fabrication affichent tous un taux de défaut élevé de 9,9 %, tandis que le secteur des logiciels technologiques a chuté à 0,6 %, à contre-courant de la tendance. Bien que les craintes de perturbations liées à l’IA exercent une pression sur le secteur des logiciels, elles n’ont pas encore eu d’impact substantiel sur la qualité du crédit dans ce secteur.
Données : ETH dépasse 2600 dollars
La Bank of America chute de 6 % ! Le PDG déclare que les revenus de trading du troisième trimestre stagnent et que les revenus de la banque d'investissement sont inférieurs aux attentes.
Le PDG de Bank of America, Brian Moynihan, a déclaré que les revenus du trading de la banque pour ce trimestre seront "relativement stables" par rapport au troisième trimestre de l'année dernière, contrastant avec la forte augmentation des revenus qu'a connue Wall Street durant le premier semestre. Il prévoit également que les frais liés à la banque d'investissement se situeront entre 1,6 et 1,8 milliard de dollars, soit en dessous des attentes du marché, qui étaient proches de 2 milliards de dollars.
