Se pare că Micron lucrează la un nou tip de flash NAND aproape de GPU, proiectat să se afle mult mai aproape de un procesor grafic decât o face în mod tradițional stocarea, conform rapoartelor industriei despre direcția de cercetare a companiei. În loc să parcheze datele într-o unitate cu câțiva pași scoși din GPU în spatele unui lanț de controlere și protocoale, acest flash ar locui chiar pe pachetul GPU-ului sau pe placa sa de circuit, acționând ca un tampon rapid între memorie și stocarea în masă.
Ideea răspunde la o problemă foarte specifică a hardware-ului de inteligență artificială: rularea unor modele de limbaje mari, enorme, fără a avea nevoie de un teanc în continuă creștere de cipuri de memorie scumpe. Dacă se realizează, flash-ul NAND aproape de GPU ar putea schimba modul în care sunt construite acceleratoarele AI în următoarele generații de produse.
Ce este de fapt flash-ul NAND aproape de GPU
Ierarhiile actuale de memorie GPU sunt construite în jurul vitezei peste aproape orice altceva. Memoria cu lățime de bandă mare (HBM) se află direct lângă matrița de calcul, oferind o lățime de bandă enormă, dar la un cost ridicat pe gigaoctet. Stocarea obișnuită a sistemului, dimpotrivă, este ieftină și densă, dar se află departe, la care se ajunge prin mai multe straturi de software și hardware care adaugă latență pe care niciun accelerator AI nu-și dorește în timpul inferenței.
Flash-ul NAND aproape de GPU este plasat ca stratul de mijloc între aceste două extreme. Ar folosi celule NAND cu densitate mai mică decât flash-ul TLC sau QLC standard găsit în SSD-urile de consum, schimbând o anumită capacitate pentru timpi de citire mult mai rapidi, I/O mai bune și rezistență mai mare. Scopul nu este de a înlocui HBM sau DRAM, ci de a oferi GPU-urilor un grup mare, moderat rapid, potențial de sute de gigaocteți, care se află chiar pe pachet, mai degrabă decât peste un cablu sau un autobuz.
De ce modelele mari de IA au nevoie de un nou nivel de memorie
Modelele mari de limbă continuă să crească, iar memoria necesară pentru a le rula crește odată cu numărul de parametri. Atunci când datele unui model depășesc memoria GPU disponibilă, sistemele fie au nevoie de mai multe GPU-uri pentru a distribui încărcătura, fie acceptă un impact de performanță transferând datele din stocarea mai lentă. Ambele opțiuni sunt costisitoare, indiferent dacă sunt măsurate în hardware sau în cicluri de calcul irosite care așteaptă sosirea datelor.

Flash-ul NAND aproape de GPU urmărește să atenueze această constrângere. Oferind fiecărei GPU acces la un pool local mare și rapid, care se comportă mai mult ca memorie decât o unitate tradițională, sarcinile de lucru de inferență ar putea utiliza o capacitate mult mai eficientă fără a cere o creștere proporțională a HBM sau DRAM. Deoarece sarcinile de lucru de inferență pentru modele masive sunt adesea legate de capacitatea de memorie, mai degrabă decât de debitul brut de calcul, acest nivel mediu ar putea permite unui centru de date să ruleze modele mai mari pe mai puține GPU-uri decât ar fi necesar altfel, reducând presiunea asupra ofertei de hardware AI deja limitate.
Cum se ridică față de HBM și Rival Concepts
Micron nu este singurul care explorează acest spațiu. SK hynix și SanDisk au discutat ambele un concept înrudit cunoscut sub numele de High Bandwidth Flash (HBF), care urmărește, în mod similar, să plaseze memoria bazată pe NAND mai aproape de calcul pentru sarcinile de inferență AI. Direcția generală în industria memoriei arată similară: păstrați HBM și DRAM pentru cea mai rapidă, cea mai sensibilă latență de lucru și introduceți un nou nivel bazat pe flash dedesubt pentru date în vrac care trebuie încă să fie rapide, dar nu rapid HBM.
| Nivelul de memorie | Rol tipic | Viteza relativă | Cost relativ pe gigabyte |
|---|---|---|---|
| HBM / GDDR7 / LPDDR6 | Memoria de lucru GPU primară | Cel mai înalt | Cel mai înalt |
| Flash NAND aproape de GPU (propus) | Buffer rapid pentru date model mari | Moderat spre ridicat | Moderat |
| Stocare SSD TLC/QLC standard | Sistem de stocare în vrac | Cel mai mic dintre cele trei | Cel mai scăzut |
Apelul este simplu. Flash-ul NAND aproape de GPU ar costa considerabil mai puțin decât adăugarea mai multor HBM sau DRAM, fiind totuși dimensionat la orice are nevoie de fapt un sistem dat, mai degrabă decât să forțeze cumpărătorii să utilizeze configurații de memorie fixe și costisitoare.
Ce ar putea însemna pentru industrie
Nimic din toate acestea nu este încă aproape de un produs de expediere. Explorarea de către Micron a flash-ului NAND aproape de GPU rămâne în stadiul de cercetare și nu există o cronologie confirmată pentru când sau dacă va ajunge la GPU-uri comerciale sau acceleratoare AI. Totuși, direcția reflectă o schimbare mai largă a modului în care producătorii de memorie și stocare se apropie de boom-ul AI, tratând decalajul dintre memoria rapidă și stocarea lentă ca o oportunitate de proiectare autentică, mai degrabă decât un compromis inevitabil.

Pentru operatorii de centre de date și dezvoltatorii de AI, un nivel flash NAND aproape de GPU funcțional ar putea însemna în cele din urmă costuri hardware mai mici per model implementat și mai puțină dependență de aprovizionarea HBM limitată și costisitoare. De asemenea, pune o presiune mai concurențială asupra rivalilor care lucrează la lucrul flash cu lățime de bandă mare a SanDisk și eforturi similare, deoarece orice companie primește primul produs viabil pe piață va câștiga o tracțiune semnificativă cu constructorii de hardware AI. Având în vedere modul în care producătorii de blițuri NAND centrali care caută să extindă capacitatea au devenit pe piața mai largă a memoriei, acest tip de bliț specializat, de înaltă rezistență, ar putea deschide o categorie de venituri complet nouă pentru Micron și concurenții săi, mult dincolo de SSD-urile convenționale.
De asemenea, reflectă tendințele care se manifestă deja în spațiul de stocare de întreprindere, unde matricele de stocare de întreprindere all-flash au împins flash-ul în roluri cândva rezervate discurilor rotative. Aplicarea aceleiași logici direct la pachetele GPU, mai degrabă decât la cutiile de stocare atașate la rețea, este un următor pas natural, deoarece încărcările de lucru AI continuă să împingă limitele hardware-ului existent. Oricine urmărește modul în care memoria GPU modelează performanța plăcilor grafice pentru consumatori va recunoaște aceeași tensiune subiacentă la o scară mult mai mare în acceleratoarele AI ale centrelor de date, unde capacitatea de memorie, nu calculul brut, decide din ce în ce mai mult ce poate rula un sistem.
Pentru moment, flash-ul NAND aproape de GPU rămâne mai degrabă un concept decât un produs confirmat de la Micron. Dacă ajunge la siliciu real, va depinde de cât de bine poate echilibra compania rezistența, costul și viteza la scară la scară de instruire modernă AI și cerere de inferență.
