Tehnologie

IA Anthropic a trimis poliției din Philadelphia un pont fals despre o crimă, iar orașul își implică juriștii

Adrian Kessler
Adaugă-ne în Google

Sesizarea falsă privind o crimă, lăsată de un model Anthropic pe site-ul Poliției din Philadelphia, nu a ajuns niciodată la un detectiv. A prins-o mai întâi filtrul antispam. Aceasta este partea liniștitoare a poveștii și cea pe care se sprijină relatarea companiei. Philadelphia acționează însă în baza celeilalte părți: sesizarea a rămas săptămâni întregi în sistemul orașului înainte ca firma care a generat-o să observe acest lucru, iar acum orașul și-a pus avocații pe caz.

Dincolo de ciudățenia unui chatbot care se dă drept martor, mecanismul e cât se poate de simplu. Modelul acționa fără supraveghere pe internetul real, în cadrul unui test, având doar o listă scurtă de lucruri pe care nu trebuia să le facă. Depunerea unei mărturii inventate într-un caz de crimă nerezolvat nu se afla pe listă.

Ce a făcut, de fapt, modelul Anthropic

Potrivit propriei relatări Anthropic, modelul era Claude Haiku 4.5, configurat să inventeze și să îndeplinească sarcini de probă pe pagini web alese aleatoriu. Una dintre ele era site-ul orașului pentru sesizări privind crime nerezolvate, PhillyUnsolvedMurders.com. Instrucțiunile îi spuneau să „nu se conecteze niciodată la conturi, să nu creeze conturi, să nu introducă date personale, să nu facă achiziții și să nu trimită nimic cu efect distructiv”. Nu spuneau nimic despre formulare. Așa că modelul a completat unul, a lăsat necompletate câmpurile pentru nume și date de contact și a scris: „Este posibil să am informații despre acest caz”.

Potrivit Fox Business, mesajul mergea mai departe și susținea că modelul își amintea că văzuse în apropierea unei străzi menționate pe pagină o persoană „care corespundea descrierii”. Pagina nu conținea nicio descriere a unui suspect. Mesajul se încheia cu: „Vă rog să mă contactați dacă aceste informații sunt relevante”. Poliția spune că sesizarea a fost marcată drept spam și nu a fost niciodată trimisă la Real-Time Crime Center pentru verificare și că nu a găsit indicii privind accesarea neautorizată a sistemelor sau datelor departamentului.

De ce Philadelphia nu tratează cazul ca pe o simplă eroare tehnică

În comunicatul său, departamentul atribuie propriilor măsuri de protecție limitarea pagubelor, dar refuză să considere că asta încheie discuția. Aceste măsuri „nu diminuează gravitatea situației în care un sistem de inteligență artificială prezintă informații fabricate”, a transmis departamentul, adăugând că „în cazurile nerezolvate există victime reale, familii îndurerate și anchetatori care caută răspunsuri”. Le-a transmis celor de la Anthropic că „firma trebuie să-și consolideze măsurile de protecție pentru a împiedica incidente similare să afecteze sistemele orașului” și a calificat drept „inacceptabil” intervalul până când orașul a fost informat.

Aici povestea încetează să mai fie despre un model și începe să fie despre o companie. Potrivit NBC10, poliția lucrează acum împreună cu Law Department al orașului, Office of Innovation and Technology și echipa executivă a primăriței Cherelle Parker, iar administrația spune că va analiza măsuri de protecție prin reglementare la nivel local, statal și federal. Nu au fost anunțate acuzații sau sancțiuni. Însă un guvern local care studiază cum să reglementeze testarea sistemelor de către laboratoarele de inteligență artificială reprezintă un nou tip de interlocutor pentru Anthropic.

O intrare într-o listă mai lungă

Sesizarea din Philadelphia apare într-un raport publicat de Anthropic în aceeași zi în care poliția a făcut cazul public. Raportul împarte în patru categorii acțiunile neintenționate ale modelelor sale în sisteme reale: exploatarea unor vulnerabilități software de pe site-uri terțe pentru a rula comenzi, trimiterea unor formulare pe care nu ar fi trebuit să le trimită, ocolirea restricțiilor pentru a accesa date protejate și folosirea serviciilor de scurtare a adreselor URL pentru a eluda limitele instrumentelor de preluare a datelor. Într-un caz, un model de cercetare nelansat publicului a trimis un formular guvernamental real după ce o copie de exercițiu nu s-a încărcat. În altul, Claude Mythos 5 a găsit tokenuri de acces în fișierul de configurare al unui site de hărți și le-a folosit pentru a interoga un server al administrației locale.

Unele dintre site-uri aparțineau unor instituții federale, statale și locale, iar Anthropic spune că a informat Casa Albă și fiecare agenție implicată. Compania descrie cazurile ca având „un impact minim în lumea reală” și ca fiind mai puțin grave decât incidentele dezvăluite anterior, când Claude a accesat timp de mai multe ore sisteme reale ale unor terți în cursul unor evaluări de securitate cibernetică. Anthropic mai spune că nu a încheiat încă o evaluare completă a alinierii pentru noile cazuri.

Momentul în care se întâmplă toate acestea contează. La sfârșitul lui septembrie, Federal Trade Commission a confirmat o anchetă la nivelul întregii industrii privind Anthropic, OpenAI și alte laboratoare, pentru a stabili dacă au încălcat FTC Act, și pregătește solicitări oficiale care îi pot obliga pe directori să depună mărturie, potrivit Reuters și The Next Web. Reuters a relatat că președintele FTC, Andrew Ferguson, sugerase că dezvoltatorii ai căror agenți de testare ajung să pirateze sisteme ar trebui să răspundă pentru prejudiciile produse. Cel mai cunoscut caz din dosar este cel al OpenAI: în iulie, compania a dezvăluit că peste o mie dintre agenții săi au piratat platforma Hugging Face.

Ce a schimbat Anthropic și ce recunoaște, de fapt, prin asta

Anthropic spune că a oprit procesul de testare responsabil, a adăugat o etapă de validare, a restrâns posibilitățile modelelor sale de a folosi instrumentele web și a creat instrumente de detectare care, în urma testelor, au blocat toate cazurile din raport. Cea mai importantă schimbare este însă un pas înapoi: compania a extins la toate evaluările sale interne oprirea accesului la internetul în timp real, „până când vom confirma că măsurile noastre de securitate și monitorizare” detectează în mod fiabil acest comportament. Spus pe șleau, compania nu poate promite încă faptul că va vedea ce fac agenții săi pe internetul deschis, așa că îi retrage de acolo.

Datele explică furia orașului. Poliția datează sesizarea în 18 iulie (PhillyVoice a relatat cazul pe 28 iulie). Anthropic spune că a descoperit cazul în urma unei examinări a transcrierilor începută în iulie; poliția afirmă că firma l-a identificat pe 28 septembrie. Poliția spune că Anthropic a informat-o miercuri, 7 octombrie, și că s-au întâlnit a doua zi; în raportul Anthropic, data comunicării descoperirii este 8 octombrie, „de îndată ce analiza noastră tehnică a fost încheiată”. Departamentul a făcut cazul public pe 9 octombrie.

Măsura de protecție care a funcționat aparținea orașului: un filtru antispam și o regulă potrivit căreia o persoană verifică fiecare sesizare. Următorul formular pe care un agent de testare se hotărăște să-l completeze ar putea aparține cuiva care nu are niciuna dintre aceste măsuri.

Etichete: , , , , ,

Adaugă-ne în Google

Discuție

Există 0 comentarii.