Tehnologie

AMD cumpără Taalas — cipuri AI de 48 ori mai rapide decât Nvidia

Susan Hill

AMD achiziționează Taalas, o startup din Toronto care construiește cipuri ce încorporează permanent greutățile modelelor AI în siliciu, în loc să le încarce din memorie în timpul inferenței. Cipul HC1 al companiei generează 16.960 de tokeni pe secundă pe modelul Llama 3.1 8B de la Meta — o cifră despre care AMD susține că este de 48 de ori mai rapidă decât GPU-urile Nvidia și de 8,5 ori mai rapidă decât Cerebras, specialistul în cipuri de inferență.

Tehnologia din spatele Taalas exploatează o ineficiență structurală a modului în care funcționează inferența AI actuală. GPU-urile standard sunt flexibile: pot rula orice model, pot comuta între sarcini la cerere și pot fi reprogramate când un model este actualizat. Această flexibilitate este și blocajul. Încărcarea a miliarde de greutăți ale modelului din memoria de mare lățime de bandă în unitățile de calcul la fiecare cerere de inferență creează o latență pe care adăugarea mai multor GPU-uri nu o poate elimina.

Taalas încorporează acele greutăți direct în siliciul cipului în momentul fabricației. Modelul trăiește în hardware, nu în memoria care este accesată la fiecare cerere. Cifrele de throughput pe care AMD le promovează reflectă această alegere arhitecturală — dar la un preț pe care compania nu îl minimalizează: odată ce un cip este fabricat cu un model specific încorporat, actualizarea lui necesită o nouă tape-out a siliciului. Taalas spune că doar două straturi metalice trebuie schimbate pentru o reîmprospătare a modelului, ceea ce scurtează ciclul, dar aceste cipuri nu se pot adapta din mers la o versiune mai nouă a modelului.

Conform planului de integrare al AMD, cipurile Taalas vor gestiona generarea de tokeni — cea mai consumatoare de timp fază a inferenței — în timp ce GPU-urile AMD Instinct se vor ocupa de prefill și calculul atenției la începutul fiecărei cereri. Sistemul combinat rulează pe platforma rack-scale Helios a AMD. Pentru operatorii de cloud care rulează sarcini cu modele fixe — roboți de serviciu clienți, pipeline-uri de procesare a documentelor, traducere în timp real — promisiunea este un throughput per watt per rack pe care clusterele flexibile de GPU-uri nu îl pot egala la un cost echivalent.

Dacă acest calcul supraviețuiește ritmului de reîmprospătare a modelelor din industrie este întrebarea centrală. Marile laboratoare își actualizează acum modelele de producție aproximativ la fiecare șase luni. Un cip blocat pe Llama 3.1 8B astăzi poate fi retras când un succesor devine ținta standard de implementare. Afirmația Taalas privind reîmprospătarea cu două straturi metalice ajută, dar o tape-out a siliciului durează încă luni de zile — un decalaj semnificativ atunci când modelele se schimbă mai repede decât ciclurile hardware.

Achiziția vine la șapte luni după ce Nvidia a cumpărat Groq — o abordare diferită a aceleiași probleme de viteză a inferenței — pentru o sumă raportată de 20 de miliarde de dolari. Procesoarele tensor streaming de la Groq optimizează și ele throughput-ul, dar păstrează capacitatea de a încărca diferite modele. AMD plătește o sumă nedezvăluită, dar probabil mai mică, pentru o startup care a făcut pariul opus.

Pentru cumpărători, achiziția Taalas aparține mai degrabă foii de parcurs decât catalogului. Cipul HC2, vizând modele cu până la 20 de miliarde de parametri, este încă în dezvoltare. Referința de 48x se aplică HC1 în condiții specifice — implementări în lumea reală cu trafic mixt și dimensiuni variabile de batch vor produce rezultate diferite. Încheierea tranzacției este așteptată în trimestrul al patrulea al anului 2026, sub rezerva revizuirii de reglementare. HC1 a fost livrat în februarie pe 6nm; data de livrare a HC2 și nodul de proces țintă rămân neconfirmate.

Etichete: , , , , ,

Discuție

Există 0 comentarii.