CDNA 5 - Instinct MI400 Series

E555user

Grand Admiral Special
★ Themenstarter ★
Mitglied seit
05.10.2015
Beiträge
2.443
Renomée
1.050
Mit dem Financial Analyst Day 2025 hat AMD erstmals die CDNA-5 Architektur für 2026 als MI400 Series konkreter bestätigt. (MI500 soll 2027 nochmals stark zulegen). Mark Papermaster stellte einzelne Details dazu vor. Guru3d berichtete:


Die Präsentationsfolien von Mark Papermaster finden sich als PDF-Download bei AMD. Einige Infos auch aus der ROCm Präsentation von Vamsi Boppana als PDF-Download bei AMD. Es gibt eine Webseite mit den Quellen und einem Webcast (4:13h total inkl. FAQ, Streaming nach Angabe persönlicher Daten).

Geplant sind bisher ein Instinct MI455X und Insinct MI430X. Kern der Verbesserungen sollen in FP4/FP8 Support liegen, sowie in mehr Speicherbandbreite durch HBM4 und verbessertes Scale-Out in Cluster-Systemen. Durch die Ankündigung von InfinityFabric5 darf von PCIe6, UALink , CXL 3.1 & UCIe ausgegangen werden, Papermasters Folie kündigt hierzu "Unified System Level Coherency" an.
Gegenüber MI455X soll MI430X nativen FP64 Hardwaresupport bieten, damit ergibt sich eine Differenzierung in unterschiedlichen CUs bzw. Shader Prozessoren innerhalb der CDNA-Familie.

cdnaroadmap26.PNG mi400specs.PNG
mi400scale.PNG mi400system.PNG
 
Zuletzt bearbeitet:
Blog: AMD Instinct MI430X: Powering the Next Wave of AI and Scientific Discovery

Vue_AR.png
Instinct MI430x in Kombination mit EPYC Venice für Supercomputer angekündigt:




mi430x-powering-top-supercomputers.jpg

 
Zuletzt bearbeitet:
Norrod:
Lisa showed the first silicon, we are right on track with where we thought we would be, both in terms of the readiness of the overall solution as well as the readiness of the silicon. And we are highly confident of ramping Helios in high volume in the second half of the year.
 
Da CDNA5 jetzt offiziell vorgestellt wurde, insbesondere die MI455X Variante gibt es einige neue Informationen.

Chips and cheese hat dazu einen Artikel über die Architektur-Änderungen veröffentlicht.

Besonders auffallend ist, dass die CDNA5 Architektur nun auf RDNA statt GCN zu basieren scheint. Beim Cache-Design wurde jedoch der Infinity Cache zugunsten eines großen schnellen Off-chip L2 entfernt. Das ist eine Richtung in die auch RDNA5 künftig gehen könnte.
 
Gut fürs Verständnis ist für mich auch das Interview als Video und Text zum nachlesen...

Der L2 ist nach meinem Verständnis aber nicht "Off-Chip" sondern Off-Chiplet bzw Die. Er kann wie X3D direkt darunter liegend als Fabric Chiplet und Träger der 4 XCDs (mit je 2 lokalen SEs) innerhalb der Fabric-Grenze genutzt werden.
So wie es aussieht werden aus einzel Chiplet XCDs von CDNA3 mit jew. separatem kleinen 4MB L2 hier in CDNA5 nunmehr Chiplets mit 4 XCDs auf gemeinsamen grossen L2 Cache. Das Scheduling wird wohl aber immer noch in XCDs gehandhabt, man muss aber global in je 8 XCDs segmentieren, der MALL fällt weg.
Während CDNA5 also Wave64 in 4 Takten (GCN-Ära) aufgibt wird die RDNA Architektur mit Wave32 je Takt noch erweitert in dem man nicht nur CUs in DCU und WGP doppelt, sondern in CDNA-Manier auch zwei SEs zu einem Accelerator Complex Die (XCDs) doppelt. Man erbt von beiden Architekturen, die Unterschiede innerhalb der CUs sind wohl entscheidend. Code der für Wave64 optimiert wurde wird wohl kaum an Effizienz verlieren. Dafür wächst der L2 aus Sicht der CUs enorm und das Scheduling wird viel einfacher, die CUs müssen auch hier viel seltener auf geteilte Daten warten.

Theoretisch könnten für RDNA künftig auch bis zu 8 SEs an einem grossen L2 möglich werden, falls man den Sandwich günstig herstellen könnte. Vermutlich wird eher die Integration mit schlankerem Design und weniger SEs ein Chiplet ohne IO definieren. Bei RDNA5 sprechen die bisherigen Leaks/Spekulationen bisher gegen ein Sandwich für L2. MLID diskutiert die Ähnlichkeiten zu diesen CDNA5 Infos.
 
Zuletzt bearbeitet:
Zurück
Oben Unten