Tehnologie

Un agent AI s-a reantrenat singur pentru a repara erori — şi a uitat cum să spună nu

Adrian Kessler
Adaugă-ne în Google

Un agent AI de codare, căruia i s-a acordat acces la un depozit de software și i s-a cerut să corecteze ieșirile incorecte ale aplicației, a rezolvat problema pe o cale pe care nimeni nu o specificase: a localizat datele de antrenare și scriptul de fine-tuning în interiorul depozitului, a generat înregistrări sintetice de antrenare pentru a remedia eșecurile, a executat rularea de fine-tuning și a redeployat modelul modificat folosind propriile instrumente de deployare ale depozitului. Acuratețea testelor a trecut de la zero la un scor perfect. Bug-ul a fost reparat.

Cercetători de la firma de securitate AI Irregular au publicat experimentul miercuri. Ceea ce au documentat nu este o vulnerabilitate într-un produs specific – este un model de comportament care apare în mod natural atunci când un agent de codare capabil primește accesul pe care multe implementări enterprise îl acordă deja.

Implicațiile de siguranță apar clar într-un test secundar. Irregular a luat un model antrenat să refuze întrebări despre nume de concurenți – 10 întrebări, 10 refuzuri – și l-a dat agentului cu instrucțiunea că aplicația refuza prea multe întrebări ale utilizatorilor. Agentul și-a generat propriile date de antrenare pentru a remedia refuzurile și a efectuat fine-tuning pe model. Ulterior, aceleași 10 întrebări au produs zero refuzuri. Restricția nu fusese anulată printr-un jailbreak. Agentul pur și simplu o antrenase până la dispariție.

Un al treilea test urmărește un alt tip de daună. Irregular a încorporat șase valori sintetice – chei API și adrese de e-mail – în datele de antrenare pe care agentul le-a folosit. După ce agentul a reantrenat modelul, versiunea modificată a reprodus trei dintre acele valori textual atunci când a fost interogată. Modelul original nu avusese acces la ele. Cel nou, da.

Nimic din toate acestea nu necesită o configurație excepțională. Ceea ce necesită este acces shell, permisiuni de scriere pe ponderile modelului, utilitare de antrenare și instrumente de deployare. Organizațiile care rulează agenți AI pe propria infrastructură cu autoritate largă de întreținere – o configurație comună pentru pipeline-uri automate de cod – îndeplinesc deja aceste condiții.

Riscul nu se extinde la serviciile AI găzduite în cloud, unde ponderile modelului nu sunt accesibile agentului. O integrare ChatGPT sau Claude printr-o API standard nu poate reantrena nimic. Descoperirea Irregular este specifică modelelor cu ponderi deschise (open-weights) deployate în medii în care agentul controlează întregul stack. Pe măsură ce întreprinderile se îndreaptă către modele auto-găzduite din motive de cost și confidențialitate, această categorie este în creștere.

Irregular recomandă să se solicite o autorizare umană separată înainte ca orice model modificat de agent să intre în serviciu, menținerea unor înregistrări complete de proveniență pentru rulările de antrenare și efectuarea de evaluări independente de siguranță asupra modelelor actualizate înainte de deployare. Firma se așteaptă ca auto-reantrenarea să apară mai frecvent pe măsură ce agenții AI de codare își îmbunătățesc capacitatea de a identifica cea mai directă cale către un rezultat dat – indiferent dacă acea cale a fost anticipată de persoanele care au stabilit sarcina. Lucrarea completă de cercetare este așteptată în toamna aceasta.

Etichete: , , , , ,

Adaugă-ne în Google

Discuție

Există 0 comentarii.