Tehnologie

Cipul Jalapeño al OpenAI ruleaza inferenta cu o eficienta de 1,9 ori mai mare decat Nvidia Blackwell pe watt

Adrian Kessler

OpenAI și-a construit propriul cip. Compania a prezentat Jalapeño la conferința Hot Chips pe 25 august, un design de siliciu dezvoltat în parteneriat cu Broadcom, care procesează cereri de inferență la 85.448 de tokeni pe secundă pe kilowatt. Arhitectura Nvidia Blackwell, standardul actual al pieței, atinge 44.960 la aceeași metrică. Raportul este de 1,9 ori.

Această metrică contează deoarece inferența este modul în care sistemele AI rulează în producție. Antrenarea are loc o singură dată; inferența are loc de fiecare dată când cineva trimite o întrebare către ChatGPT, folosește o API sau interacționează cu orice aplicație care rulează un model lingvistic. Costul inferenței la scară largă este principalul factor al economiei serviciilor AI. Un cip care reduce consumul de energie al inferenței aproximativ la jumătate, dacă este implementat pe scară largă, schimbă costul per interogare al rulării modelelor.

La sarcinile de lucru interactive, unde latența răspunsului este factorul limitativ, avantajul lui Jalapeño se extinde și mai mult. Raportul SemiAnalysis despre prezentarea de la Hot Chips a stabilit intervalul la de 2,1 până la 4,1 ori mai bun decât Blackwell la acele benchmark-uri. Dispersia reflectă variația între tipurile specifice de sarcini; limita inferioară este comparația mai conservatoare.

Cipul se ocupă doar de inferență. Nu rulează sarcinile de antrenare care au produs modelele pe care Jalapeño este proiectat să le ruleze. Acestea necesită în continuare hardware Nvidia. Broadcom a fabricat cipul în baza unui acord de design personalizat cu OpenAI, mai degrabă decât să îl vândă ca produs comercial. Aranjamentul îi oferă OpenAI un strat de inferență construit special, fără a fi nevoit să concureze pe piața de cipuri comerciale.

Cronologia de implementare a OpenAI este limitată. O lansare la scară mică este planificată înainte de sfârșitul anului 2026; o implementare mai largă este un obiectiv pentru 2027. Cipul rămâne în faza de eșantion de inginerie, ceea ce înseamnă că versiunea de producție nu a fost încă livrată la scară largă. Benchmark-urile de la Hot Chips reprezintă ținta proiectată, nu o producție verificată. Decalajul dintre anunțul la conferință și implementarea operațională pentru siliciul personalizat este de obicei măsurat în ani.

Anunțul se încadrează într-o schimbare mai amplă în rândul marilor companii AI către siliciu personalizat. Google își operează propriile Tensor Processing Units în producție de un deceniu. Amazon rulează Trainium și Inferentia în AWS. Meta își operează propriile cipuri de inferență intern. Intrarea OpenAI confirmă că, la scara a sute de milioane de utilizatori activi, economia de a te baza exclusiv pe furnizori externi de GPU devine suficient de dificilă pentru a justifica costul unui program de design personalizat.

Etichete: , , , , ,

Discuție

Există 0 comentarii.