Tehnologie

OpenAI susține că Astra este cel mai aliniat model al său și nu arată cum gândește

Adrian Kessler

Astra operează în domenii precum codare, analiză de securitate, utilizare a computerului și sarcini profesionale multi-etapă, cu o viteză și o precizie care depășesc performanțele modelului anterior al OpenAI, Sol, și ale modelului Fable al Anthropic, conform benchmark-urilor standard de inginerie software. Compania o descrie drept primul model construit de ea care traversează nivelul „Critical” de capabilitate cibernetică: poate identifica și dezvolta exploit-uri pentru vulnerabilități de securitate necunoscute anterior, la o scară și o viteză pe care nicio echipă umană nu le poate egala.

Mecanismul din spatele acestui lucru este o tehnică numită recurență opacă. Modelele standard de limbaj produc raționamentul sub formă de text lizibil — lanțul de gândire pe care cercetătorii îl folosesc pentru a audita deciziile, a depista erorile și a verifica dacă un model se comportă conform intențiilor. Astra funcționează fără a produce acel text. Poate rezolva probleme dificile fără a lăsa nicio urmă lizibilă a procesului. Directorul științific al OpenAI, Jakub Pachocki, a recunoscut această schimbare: modelele mai capabile, a spus el, pot „executa sarcini mai dificile folosind mai puține token-uri lingvistice.” Monitorizarea devine mai dificilă proporțional.

Aceasta creează o problemă structurală pe care propriile afirmații ale OpenAI o fac vizibilă. Compania descrie Astra drept „cel mai aliniat model” al său de până acum. Alinierea — disciplina de inginerie care se ocupă de a face sistemele AI să se comporte așa cum intenționează proiectanții lor — s-a bazat în mod istoric pe citirea pas cu pas a ceea ce face modelul. Un model care raționează invizibil face ca propria sa aliniere să fie neverificabilă prin această metodă. OpenAI nu a descris public ce metodă alternativă folosește pentru a verifica comportamentul lui Astra înainte de implementare.

Greg Brockman, președintele OpenAI, a descris Astra drept un „salt generațional” și a fost întrebat direct dacă aceasta reprezintă inteligența generală artificială. Răspunsul său: definiția contractuală a AGI care guverna parteneriatul OpenAI cu Microsoft nu mai este valabilă. AGI este acum, a spus el, un „concept spiritual.” Această încadrare contează. Acordul OpenAI cu Microsoft includea clauze legate de AGI — condiții în care termenii relației s-ar fi modificat. Descrierea AGI ca fiind nedefinită menține acele clauze inactivate, indiferent de ceea ce este Astra capabilă să facă de fapt.

Accesul a fost lansat mai întâi către Daybreak, programul de securitate cibernetică verificat al OpenAI — o structură pe care compania o prezintă drept o desfășurare cu prioritate defensivă. Raționamentul este că organizațiile care caută vulnerabilități în propriile sisteme primesc capacitatea înaintea celor care caută vulnerabilități în sistemele altora. Această logică funcționează doar atâta timp cât controalele de acces rezistă. Capacitățile de identificare a vulnerabilităților zero-day ale lui Astra sunt, prin design, exact ceea ce și-ar dori un atacator bine finanțat. Un model care raționează fără un lanț de gândire lizibil este, de asemenea, mai greu de constrâns sau de auditat ulterior în cazul în care ceva merge prost.

Accesul mai larg se extinde către nivelurile plătite — Pro, Plus, Enterprise, Business — și prin API în săptămâna următoare.

Etichete: , , , , ,

Discuție

Există 0 comentarii.