Tehnologie

OpenAI declară era AGI. Benchmark-ul citat arată un scor cu 37 puncte mai mic

Adrian Kessler

Postarea lui Jensen Huang pe X a constat dintr-o singură frază și o felicitare: „De la ChatGPT la o1, apoi la Astra, în patru ani, AGI a sosit. Felicitări echipei @OpenAI.” A trimis-o pe 6 septembrie. Cu trei zile înainte, Greg Brockman, președintele OpenAI, folosise o formulare aproape identică în fața presei: „Bun venit în era AGI.” Declarațiile au venit la scurt timp una după alta, din partea a doi bărbați cu interese complementare, și au fost primite în mare parte ca o confirmare.

Benchmarkul din spatele afirmației era ARC-AGI-3. OpenAI a declarat că Astra, noul său model frontieră lansat sub denumirea GPT-6, a obținut 99,9% la ARC-AGI-3 și 98% la FrontierMath Tier 4. Scoruri de acest nivel, în condiții standard, ar reprezenta o discontinuitate reală – un model care nu doar că performează bine, dar ajunge într-un teritoriu pe care benchmarkurile anterioare îl considerau aspirațional. Organizația care a construit ARC-AGI-3 a publicat un scor obținut cu propriul cadru de evaluare standard: 62,7%.

Treizeci și șapte de puncte procentuale separă cele două numere. Ambele provin din evaluări reale. Cadrul intern de evaluare al OpenAI și cadrul de referință al creatorilor benchmarkului nu sunt același protocol, iar același model produce scoruri diferite în fiecare dintre ele. Ceea ce organizația ARC-AGI-3 folosește drept condiție de referință – cea pe care o consideră valabilă pentru compararea modelelor din domeniu – a produs 62,7%. Configurația internă a OpenAI a produs 99,9%. Diferența dintre aceste numere este diferența dintre un rezultat solid la un benchmark și o declarație de sosire.

Vânzarea de cipuri din spatele felicitării pentru AGI

Astra a fost antrenată pe cipuri NVIDIA. Huang vinde cipuri NVIDIA. Atunci când un director general felicită public un client pentru că a depășit un prag istoric – un prag care face ca hardware-ul folosit pentru a construi acel produs să devină infrastructura definitorie pentru ceea ce urmează – anunțul este, structural, o afirmație comercială. Nu o conspirație. O realitate structurală: conflictul de interese era vizibil, încadrarea era despre sosire, nu despre performanță, iar cea mai mare parte a relatărilor a primit ambele fără comentarii.

Ce arată verificarea independentă – și ce nu arată

La momentul publicării, Astra nu apare în Artificial Analysis Intelligence Index și nici în clasamentele Arena.ai – cele mai urmărite două sisteme independente de evaluare pentru modele frontieră. Verificarea independentă pentru lansări majore de modele frontieră sosește de obicei în câteva zile. Absența de aici nu este o dovadă a unei performanțe slabe. Înseamnă că validarea externă care ar însoți în mod normal o afirmație de această magnitudine nu s-a materializat încă.

Scorul de 62,7% din partea creatorilor benchmarkului nu este o respingere. Un scor la acest nivel pe ARC-AGI-3 – un test conceput pentru a rezista trucurilor de optimizare care au umflat benchmarkurile anterioare – este cu adevărat puternic. Predecesorii ARC-AGI-3 erau saturați: modelele absorbeau date de antrenament care semănau cu întrebările testului și împingeau scorurile în sus fără a îmbunătăți raționamentul nou. ARC-AGI-3 a schimbat designul întrebărilor pentru a cere abstracție în loc de regăsire de pattern-uri. Șaizeci și două virgulă șapte procente pe acel test, sub cadrul de referință, este cu mult peste orice exista acum doi ani.

Cercetătorii care au ridicat obiecții au fost preciși în această privință. Capacitatea modelului nu era ținta lor. Saltul de la performanță la declarație era. „Scoruri bune pe aceste benchmarkuri” și „AGI a sosit” necesită un pas intermediar: o definiție stabilă, agreată a AGI, față de care sosirea poate fi măsurată. O astfel de definiție nu există în întreg domeniul. OpenAI are una internă. Conform propriei definiții a OpenAI, Astra s-ar putea califica. Dar o companie care își măsoară produsul în raport cu o definiție pe care a scris-o ea însăși este un alt tip de rezultat decât unul măsurat printr-un standard extern.

Fraza care nu a venit cu o definiție

Postarea lui Huang nu a avut niciun avertisment. „AGI a sosit” este o afirmație declarativă – nu „după unele măsuri” sau „sub anumite definiții”, ci o sosire curată. Progresia pe patru ani pe care a numit-o – ChatGPT, o1, Astra – este reală ca traiectorie de capacitate. Fiecare model din succesiune a extins ceea ce era posibil. Încadrarea acelei succesiuni ca o călătorie cu un punct final, și anunțarea punctului final, face o afirmație diferită: spune că sosirea se distinge de călătorie, că există o linie, nu o pantă, și că Astra a traversat-o.

Numărul benchmarkului din spatele acelei afirmații era 62,7%. Oamenii care au construit testul l-au publicat. Întrebarea pe care o ridică – dacă declarația AGI este o măsurătoare sau o mișcare de piață – era acolo pe 6 septembrie. Relatările au răspuns în mare parte fără să întrebe.

Etichete: , , , , ,

Discuție

Există 0 comentarii.