En tant que partenaire de NVIDIA NVLink Fusion, D-matrix travaillera en étroite collaboration avec NVIDIA pour intégrer les XPU d'inférence de nouvelle génération de D-matrix, à commencer par D-matrix Raptor™, directement dans la dernière architecture de référence en rack NVIDIA comprenant des processeurs NVIDIA Vera, des commutateurs NVIDIA NVLink, des DPU NVIDIA BlueField-4, des SuperNICS NVIDIA ConnectX-9 et un réseau Ethernet NVIDIA Spectrum-X. d-matrix travaille également en partenariat avec Astera Labs, un leader des solutions de connectivité au sein de l'écosystème NVIDIA NVLink Fusion, pour fournir des solutions personnalisées afin de garantir un flux de données fluide et à haut débit dans l'ensemble du système. Le rack à matrice D, activé par la plate-forme MGX, comportera des plateaux modulaires sans câble construits avec l'écosystème MGX mature et éprouvé et la chaîne d'approvisionnement de NVIDIA pour des déploiements rapides et fluides.
NVLink Fusion fournit à D-Matrix une base évolutive mature, à bande passante élevée et à faible latence pour connecter les XPU à matrice D à l'infrastructure NVIDIA à l'échelle du rack. Grâce à NVLink Fusion et à l'écosystème MGX, D-matrix peut s'appuyer sur la même architecture de rack, le même réseau et la même chaîne d'approvisionnement que ceux utilisés sur la plate-forme NVIDIA. Le premier point d'engagement de cette collaboration sera la connexion de processeurs XPUs Raptor à matrice D au rack NVIDIA MGX, ce qui se traduira par de meilleures performances, une plus grande flexibilité de déploiement pour les clients et une architecture évolutive permettant d'étendre les clusters d'inférence basés sur Raptor à mesure que la demande augmente.
« Cette collaboration avec NVIDIA marque un tournant dans notre voyage vers l'inférence infinie, accessible à tous », a déclaré Sid Sheth, fondateur et PDG de D-matrix. « L'intégration à la dernière infrastructure rack MGX de NVIDIA avec NVLink Fusion signifie que nos clients peuvent déployer nos xPU d'inférence parallèlement à la plate-forme d'usine NVIDIA AI largement disponible. C'est l'avenir vers lequel D-matrix s'est engagé : des processeurs XPU et GPU d'inférence à très faible latence et économes en énergie travaillant ensemble, à l'échelle du rack, pour offrir des expériences d'IA haut de gamme. »
« NVLink Fusion permet aux partenaires d'intégrer du silicium personnalisé à l'écosystème complet de NVLink de NVIDIA, composé de boîtiers avancés, de systèmes montés en rack et de technologies réseau », a déclaré Jensen Huang, fondateur et PDG de NVIDIA. « Grâce à l'infrastructure d'intelligence artificielle de NVIDIA déployée dans les centres de données cloud et locaux du monde entier, NVLink Fusion offre à des partenaires tels que D-matrix la possibilité de s'intégrer parfaitement aux plateformes de calcul NVIDIA, élargissant ainsi le choix d'accélérateurs pour les clients qui construisent la prochaine génération d'usines d'IA. »
« La connectivité spécialement conçue permet de transformer les calculs innovants en usines d'IA hautement performantes », a déclaré Jitendra Mohan, PDG d'Astera Labs. « Notre partenariat avec D-matrix et NVIDIA donne vie à cette vision au sein de l'écosystème NVLink Fusion, en fournissant un haut débit pour une inférence d'IA à faible latence. »
L'essor de l'économie des jetons haut de gamme
Alors que les charges de travail liées à l'IA agentique ont augmenté la demande d'inférence, les fournisseurs de services d'IA recherchent de plus en plus des systèmes à architecture mixte pour fournir les économies d'inférence demandées par leurs clients.
Le système rack MGX à matrice D est conçu pour les applications sensibles à la latence telles que les assistants de codage IA, les chatbots en temps réel et les agents vocaux où l'interactivité est primordiale et les clients sont prêts à payer plus cher pour la vitesse. Basé sur l'écosystème MGX et la chaîne d'approvisionnement éprouvés et matures de NVIDIA, le système étend une architecture rack unifiée qui donne aux usines d'IA la flexibilité nécessaire pour déployer le calcul adapté à chaque charge de travail.
Grâce à la désagrégation hétérogène, les opérateurs peuvent répartir la charge de travail entre les processeurs XPU Raptor à matrice D et les processeurs NVIDIA Vera Rubin, ce qui leur permet d'optimiser chaque phase d'inférence. Pour l'une des applications désagrégées les plus populaires d'aujourd'hui, le codage IA, les GPU peuvent gérer la phase de préremplissage d'une charge de travail exigeante en termes de calcul, tandis que les xPU d'inférence à matrice D accélèrent la phase de décodage sensible à la latence.
Raptor : le XPU d'inférence de nouvelle génération de D-matrix Faisant suite à la plate-forme D-matrix Corsair™ XPU
actuellement en production, la plate-forme D-matrix Raptor étend l'architecture centrée sur la mémoire de D-matrix. Grâce à une approche d'empilement de DRAM 3D unique en son genre, Raptor réunit une puce de mémoire DRAM et une puce de calcul SRAM pour former un seul boîtier « à deux étages ».
Des détails techniques sur la technologie 3D DRAM ont récemment été publiés par l'IEEE et présentés en avant-première par le cofondateur et directeur technique de D-matrix, Sudeep Bhoja, lors de la conférence Hot Chips 2026 et.
D-matrix a conçu Raptor, qui devrait sortir de zéro avant la fin de l'année, pour l'intégrer à NVIDIA NVLink Fusion et à l'écosystème rack NVIDIA MGX, reflétant ainsi l'engagement de D-matrix à créer un silicium d'inférence spécialement conçu qui fonctionne parfaitement avec la pile NVIDIA.
Raptor est activement évalué par des hyperscalers d'IA et des laboratoires de pointe pour sa solution unique d'empilement de mémoire et est soutenu par plus de 100 brevets.
Disponibilité
La disponibilité initiale des xPU Raptor à matrice D intégrés au rack NVIDIA MGX est prévue pour le quatrième trimestre 2027.