Cipul Arm cu 88 de nuclee se mândrește cu o performanță de până la 1,8 ori mai mare în anumite sarcini de lucru agentice AI
Ce tocmai sa întâmplat? Nvidia a lansat mai multe informații despre viitorul procesor al centrului de date Vera săptămâna aceasta, inclusiv detalii cheie despre nucleele personalizate Olympus, care sunt create special pentru sarcinile de lucru AI agentice. De asemenea, compania a susținut că noua arhitectură de bază oferă performanțe single-core mai rapide decât produsele concurente.
Parte a platformei Vera Rubin a Nvidia, procesorul Vera bazat pe Arm este proiectat pentru a efectua raționament complex, pentru a facilita execuția instrumentului, pentru a genera cod și pentru a planifica sarcini pentru agenții AI. Dezvoltat ca un cip multifuncțional, poate gestiona, de asemenea, procesarea datelor științifice și învățarea de consolidare, care necesită mai multă putere CPU decât sarcinile de lucru tipice AI.

Fiecare procesor Vera încorporează 88 de nuclee Olympus, 176 fire fizice, un cache de instrucțiuni L1 cu patru căi de 64 KB și 164 MB de cache L3 unificat pe o matriță de calcul monolitică. De asemenea, are o coadă de decodare cu 48 de instrucțiuni. Miezul mijlociu încorporează a Cache de date L1 cu șase căi de 96 KB și un cache L2 cu opt căi de 2 MB, alături de un prefetcher de grafice hardware pentru sarcinile de lucru cu grafice și analize cu consum mare de date.
Fiecare nucleul personalizat cuprinde un front-end larg cu predictori de ramuri optimizați, un nucleu mijlociu cu accelerare a căii critice și un motor de execuție cu optimizare vectorială complexă. Ei oferă preluare a instrucțiunilor cu lățime de bandă mare care acceptă până la 16 instrucțiuni pe ciclu și includ o decodare pe 10 lățime procesarea motorului până la zece instrucțiuni fuzionate pe ciclu.

Subsistemul de predicție a ramurilor Olympus include un predictor de ramuri neuronale capabil să reducă execuția unei căi greșite pe anumite modele de ramuri. În combinație cu calea largă de decodare, ajută și îmbunătățiți debitul front-end pentru sarcinile de lucru sensibile la latență, cum ar fi AI agentic și învățare prin consolidare.
Arhitectura de bază Olympus integrează tehnologia Spatial Multithreading de la Nvidia, permițând partiționarea flexibilă a resurselor. De asemenea, acceptă Scalable Coherency Fabric pentru 3,4 TB/s de lățime de bandă core-to-core on-die, 1,2 TB/s de agregat Memorie SOCAMM2 LPDDR5X lățime de bandă și până la 1,5 TB de capacitate de memorie.

Vera acceptă conectivitate de 1,8 TB/s pe NVLink-C2C, PCIe 6.4 și CXL 3.1. De asemenea, acceptă scalarea duble-socket, fiecare soclu oferind 176 de benzi PCIe Gen 6. Pentru a îmbunătăți latența în sistemele cu socket dublu, Vera utilizează o soluție bazată pe software în care fiecare socket se prezintă ca un singur domeniu NUMA, evitând fragmentarea și creând o topologie curată cu două noduri NUMA.
Pentru a-și susține afirmațiile despre performanța Vera, Nvidia a publicat rezultatele testului intern SPEC CPU 2026 de la începutul acestei luni. Datele par să arate că Vera oferă performanțe de până la 1,8 ori mai mari decât sistemele AMD Epyc Turin 9755 în anumite sarcini de lucru agentice AI, cum ar fi 714.cpython_r. Cu toate acestea, rezultatele nu au fost încă verificate independent.
