Cerebras Systems Inc. (NASDAQ : CBRS) a dévoilé mardi un nouveau système d'IA qui, selon elle, peut générer des réponses jusqu'à 30 fois plus rapidement que les alternatives basées sur le GPU, donnant ainsi une nouvelle chance à Nvidia Corp. (NASDAQ : NVDA) sur le marché en pleine croissance de l'inférence par IA.
Le nouveau CS-4 a atteint des vitesses de plus de 4 400 jetons par seconde et par utilisateur sur le GPT-OSS-120B lors d'un test de référence pour les entreprises, soit environ le double de la vitesse par utilisateur de son prédécesseur. Les premiers systèmes devraient être mis en ligne ce trimestre.
Le CS-4 utilise toujours le même silicium WSE-3 de 5 nanomètres sous-jacent que son prédécesseur. Selon SemiAnalysis, Cerebras a pratiquement doublé la vitesse d'horloge en augmentant la puissance fournie et en améliorant le refroidissement.
Cerebras adopte également une approche différente de celle de Nvidia.
Au lieu de connecter des milliers de GPU, il construit un processeur de la taille d'une plaquette de silicium entière, avec 900 000 cœurs et une mémoire intégrée rapide.
Cela réduit la nécessité de déplacer des données entre des puces distinctes, ce qui explique en partie pourquoi Cerebras peut fournir une inférence exceptionnellement rapide.
L'allégation s'applique principalement au type d'inférence ultra-rapide pour lequel Cerebras est conçu.
SemiAnalysis estime que le CS-4 pourrait atteindre environ 4 000 jetons par seconde et par utilisateur sur les modèles Frontier, contre environ 100 à 200 pour les puces Blackwell de Nvidia.
L'augmentation des performances provient en partie du fait que le silicium existant fonctionne beaucoup plus fort.
SemiAnalysis estime qu'un rack CS-4 à trois plaquettes consomme environ 125 à 135 kilowatts et indique que les performances par watt ne s'améliorent que légèrement par rapport à la génération précédente.
Malgré tout, The Register note que c'est bien en deçà des racks de 240 à 250 kilowatts que Nvidia et AMD s'apprêtent à expédier plus tard cette année.
OpenAI met déjà cette vitesse à profit. La semaine dernière, la société a présenté en avant-première un niveau ultrarapide alimenté par Cerebras qui exécute son modèle phare GPT-5.6 Sol à 750 jetons de sortie par seconde, soit jusqu'à 14 fois plus vite qu'un traitement standard.
Cerebras fait le pari qu'une inférence plus rapide peut gagner des clients par rapport aux systèmes traditionnels basés sur des GPU.
Les marchés prévisionnels suggèrent que la demande pour les ordinateurs Nvidia pourrait rester ferme. Les traders de Kalshi accordent 64 % de chances à ce que les prix de location du H200 terminent l'année au-dessus de 6,69 dollars de l'heure et 61 % de chances que les prix du H100 restent supérieurs à 3,38 dollars.
Le lancement intervient à un moment difficile pour les actions IA. Les actions de Cerebras ont chuté de 12,7 % mardi, effaçant la hausse de 15 % enregistrée lundi, la hausse des rendements obligataires ayant exercé une pression sur les valeurs technologiques à forte croissance.
Photo : Shutterstock
Kalshi et Benzinga ont déjà un accord de collaboration en matière de données.