Η startup τσιπ τεχνητής νοημοσύνης (ΤΝ) d-Matrix ανακοίνωσε στις 10 Σεπτεμβρίου ότι οι επόμενης γενιάς επιταχυντές της, με την ονομασία Raptor, θα συνδεθούν με το διασυνδετικό σύστημα NVLink Fusion της Nvidia, εξασφαλίζοντας άμεση πρόσβαση στην αρχιτεκτονική rack κέντρων δεδομένων (data centre) της αμερικανικής εταιρείας τσιπ, σύμφωνα με ανακοίνωση της Nvidia.

Τσιπ τρίτων μέσα στα racks της Nvidia

Το NVLink Fusion είναι η τεχνολογία διασύνδεσης της Nvidia που επιτρέπει σε επεξεργαστές τρίτων κατασκευαστών, γνωστούς ως XPU, να ενταχθούν στο δίκτυο κλιμάκωσης NVLink, στο δίκτυο Spectrum-X και στην αρχιτεκτονική rack MGX. Τα τσιπ Raptor της d-Matrix έχουν σχεδιαστεί εξαρχής γύρω από αυτή την τεχνολογία, σύμφωνα με τη Nvidia, και αναμένονται έως το τέλος του 2027, σύμφωνα με το The Register.

Η Nvidia έχει συνάψει παρόμοιες συμφωνίες αδειοδότησης με τις Qualcomm, Arm, Marvell, Amazon, Fujitsu και MediaTek, ενώ έχει επενδύσει 3,5 δισ. δολάρια στη MediaTek και 2 δισ. δολάρια στη Marvell παράλληλα με αυτές τις συμφωνίες, σύμφωνα με δημοσίευμα της The Register. Το μέσο περιέγραψε τη ρύθμιση ως «περιτειχισμένο κήπο» (walled garden) που δίνει στους κατασκευαστές τσιπ γρήγορη πρόσβαση σε ένα δοκιμασμένο οικοσύστημα rack, δένοντάς τους όμως με τον υπόλοιπο εξοπλισμό της Nvidia, όπως οι επεξεργαστές Vera, το NVSwitch και οι κάρτες δικτύου BlueField και ConnectX.

Στοίχημα στο εύρος ζώνης μνήμης

Ένα rack κλάσης NVL144 με έως 144 επιταχυντές Raptor θα διαθέτει συνολική χωρητικότητα μνήμης 2,3 terabytes και συνολικό εύρος ζώνης 7,2 petabytes το δευτερόλεπτο, σύμφωνα με το The Register, το οποίο αναφέρει επίσης ότι κάθε κάρτα Raptor φέρει 32 gigabytes μνήμης 3D-stacked DRAM με εύρος ζώνης 100 terabytes το δευτερόλεπτο.

«Η ζήτηση για συμπερασματολογία (inference) εκτοξεύεται, όμως το κεφάλαιο, ο χρόνος και η ενέργεια παραμένουν πεπερασμένα. Με το NVLink Fusion και το MGX μπορούμε να ενσωματώσουμε τα XPU Raptor μας σε μια ευρέως διαδεδομένη, υγρόψυκτη αρχιτεκτονική, δίνοντας στους πελάτες έναν ταχύτερο δρόμο με μικρότερο ρίσκο για την ανάπτυξη και την κλιμάκωση συμπερασματολογίας εξαιρετικά χαμηλής καθυστέρησης», δήλωσε ο συνιδρυτής και διευθύνων σύμβουλος της d-Matrix, Σιντ Σεθ, στην ανακοίνωση της Nvidia (σε απόδοση από τα αγγλικά).

Το εύρος ζώνης μνήμης, και όχι η ακατέργαστη υπολογιστική ισχύς, έχει γίνει το βασικό «στενό σημείο» για τη συμπερασματολογία (inference) ΤΝ σε μεγάλη κλίμακα, ενώ το The Register υπολόγισε ότι, όπου ένα μοντέλο ενός τρισεκατομμυρίου παραμέτρων θα χρειαζόταν πάνω από 2.000 μονάδες Groq 3 LPU σε ακρίβεια 8 bit, ένα μόνο σύστημα d-Matrix θα χρειαζόταν περίπου 64, ή 32 σε ακρίβεια 4 bit.

Ένταξη στο ευρύτερο «εργοστάσιο ΤΝ» της Nvidia

Η Nvidia ανέφερε ότι τα racks βασισμένα σε Raptor θα λειτουργούν παράλληλα με τα δικά της συστήματα GPU Vera Rubin NVL72 για «αποσυζευγμένη συμπερασματολογία» (disaggregated inference), διαχωρίζοντας τα στάδια επεξεργασίας ενός αιτήματος σε εξειδικευμένο υλικό. Η εταιρεία παρουσιάζει την ευρύτερη πλατφόρμα της, στην οποία περιλαμβάνει τα Vera Rubin NVL72, Groq 3 LPX, την αποθήκευση Vera BlueField-4 STX και το δίκτυο Spectrum-6 SPX Ethernet, ως σύνολο επιλογών για την εκτέλεση κάθε φόρτου εργασίας ΤΝ με -όπως αναφέρει- την καλύτερη απόδοση ανά watt και το χαμηλότερο κόστος ανά token.

Γιατί έχει σημασία

Η συμφωνία δείχνει πώς η Nvidia επεκτείνει την κυριαρχία της πέρα από τις κάρτες γραφικών (GPU), στην υπόλοιπη υποδομή των κέντρων δεδομένων από την οποία εξαρτώνται εργαστήρια ΤΝ, πάροχοι υπολογιστικού νέφους και «neoclouds», ακόμη και καθώς ανοίγει το δίκτυό της σε ανταγωνιστικές αρχιτεκτονικές τσιπ. Για την d-Matrix, η συμφωνία προσφέρει έναν ταχύτερο δρόμο προς την αγορά, με μικρότερο ρίσκο σε σχέση με το να χτίσει μόνη της ένα ανεξάρτητο οικοσύστημα rack, αν και η εμπορική διάθεση παραμένει πάνω από έναν χρόνο μακριά.