Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden. Du solltest ein Upgrade durchführen oder ein alternativer Browser verwenden.
Mit dem Financial Analyst Day 2025 hat AMD erstmals die CDNA-5 Architektur für 2026 als MI400 Series konkreter bestätigt. (MI500 soll 2027 nochmals stark zulegen). Mark Papermaster stellte einzelne Details dazu vor. Guru3d berichtete:
AMD outlined its next steps in the AI and HPC accelerator market at its 2025 Financial Analyst Day, revealing the Instinct MI400 series based on the CDNA 5 architecture.
Geplant sind bisher ein Instinct MI455X und Insinct MI430X. Kern der Verbesserungen sollen in FP4/FP8 Support liegen, sowie in mehr Speicherbandbreite durch HBM4 und verbessertes Scale-Out in Cluster-Systemen. Durch die Ankündigung von InfinityFabric5 darf von PCIe6, UALink , CXL 3.1 & UCIe ausgegangen werden, Papermasters Folie kündigt hierzu "Unified System Level Coherency" an.
Gegenüber MI455X soll MI430X nativen FP64 Hardwaresupport bieten, damit ergibt sich eine Differenzierung in unterschiedlichen CUs bzw. Shader Prozessoren innerhalb der CDNA-Familie.
While releasing an update to its InferenceX AI inference benchmark test, formerly known as InferenceMax and thus far only having Nvidia and AMD testing
www.nextplatform.com
Norrod:
Lisa showed the first silicon, we are right on track with where we thought we would be, both in terms of the readiness of the overall solution as well as the readiness of the silicon. And we are highly confident of ramping Helios in high volume in the second half of the year.
Hello you fine Internet folks, here at AMD’s Advancing AI event we are looking at AMD’s brand new Instinct MI455X, replacing the older Instinct MI355X at the top of their AI stack.
chipsandcheese.com
Besonders auffallend ist, dass die CDNA5 Architektur nun auf RDNA statt GCN zu basieren scheint. Beim Cache-Design wurde jedoch der Infinity Cache zugunsten eines großen schnellen Off-chip L2 entfernt. Das ist eine Richtung in die auch RDNA5 künftig gehen könnte.
Gut fürs Verständnis ist für mich auch das Interview als Video und Text zum nachlesen...
Der L2 ist nach meinem Verständnis aber nicht "Off-Chip" sondern Off-Chiplet bzw Die. Er kann wie X3D direkt darunter liegend als Fabric Chiplet und Träger der 4 XCDs (mit je 2 lokalen SEs) innerhalb der Fabric-Grenze genutzt werden.
So wie es aussieht werden aus einzel Chiplet XCDs von CDNA3 mit jew. separatem kleinen 4MB L2 hier in CDNA5 nunmehr Chiplets mit 4 XCDs auf gemeinsamen grossen L2 Cache. Das Scheduling wird wohl aber immer noch in XCDs gehandhabt, man muss aber global in je 8 XCDs segmentieren, der MALL fällt weg.
Während CDNA5 also Wave64 in 4 Takten (GCN-Ära) aufgibt wird die RDNA Architektur mit Wave32 je Takt noch erweitert in dem man nicht nur CUs in DCU und WGP doppelt, sondern in CDNA-Manier auch zwei SEs zu einem Accelerator Complex Die (XCDs) doppelt. Man erbt von beiden Architekturen, die Unterschiede innerhalb der CUs sind wohl entscheidend. Code der für Wave64 optimiert wurde wird wohl kaum an Effizienz verlieren. Dafür wächst der L2 aus Sicht der CUs enorm und das Scheduling wird viel einfacher, die CUs müssen auch hier viel seltener auf geteilte Daten warten.
Theoretisch könnten für RDNA künftig auch bis zu 8 SEs an einem grossen L2 möglich werden, falls man den Sandwich günstig herstellen könnte. Vermutlich wird eher die Integration mit schlankerem Design und weniger SEs ein Chiplet ohne IO definieren. Bei RDNA5 sprechen die bisherigen Leaks/Spekulationen bisher gegen ein Sandwich für L2. MLID diskutiert die Ähnlichkeiten zu diesen CDNA5 Infos.