Tehnologie

IA Alibaba care îți citește ecranul obține 92% pe telefoane reale și rulează pe propriul hardware

Susan Hill

Qwen-UI-Agent, agentul AI dezvoltat de Alibaba, nu necesită acces special la aplicațiile tale. Citește ecranul, identifică ce se află pe el și execută comenzi, gestionând de la mesagerie până la editarea documentelor doar prin percepție vizuală. Greutățile modelului – MAI-UI-2B și MAI-UI-8B – au fost publicate săptămâna aceasta pe Hugging Face, punând sistemul la îndemâna oricărui dezvoltator care dispune de un GPU.

Rezultatele benchmark-urilor sunt concrete. Pe MobileWorld, evaluarea standard pentru agenții mobili, Qwen-UI-Agent a obținut un scor de 82,1%, depășind GPT-5.6 cu 12 puncte procentuale și Claude Opus 4.8 cu 14,6 puncte. Diferența nu este marginală – sistemele occidentale comparabile s-au blocat în intervalul 70–75% la același test luni de zile. La testarea pe dispozitive reale – sarcini executate pe terminale Android fizice, nu pe emulatoare – scorul a urcat la 92,2%. Pe AndroidDaily, o evaluare mai amplă pe telefoane reale, modelul a atins 97,5%. Pentru utilizarea pe desktop, măsurată prin OSWorld-Verified, a înregistrat 79,5%, devansând atât GPT-5.5, cât și Gemini 3.1 Pro.

Alibaba a antrenat modelul pe date provenite de la peste 100 de dispozitive mobile reale care rulează 150 de aplicații distincte, apoi și-a construit propriul benchmark – MobileWorld-Real – cu peste 400 de sarcini pentru a verifica performanța în afara laboratorului. Aproximativ 40% dintre sarcinile de desktop au implicat operațiuni batch pe linia de comandă, alături de clicuri vizuale, o alegere de design care reflectă modul în care funcționează calculul real, nu cum sunt regizate demonstrațiile.

Un strat de siguranță este integrat în fluxul de lucru. Modelul refuză sarcinile pe care le identifică drept ilegale sau cu risc ridicat și se oprește la operațiuni sensibile – plăți, ștergerea datelor, autorizări de confidențialitate – solicitând confirmarea explicită a utilizatorului înainte de a continua. Sistemul gestionează secvențe mai lungi de 100 de pași folosind învățare prin consolidare antrenată pe aproximativ 10.000 de medii simulate simultane.

Scorurile benchmark-urilor lasă deschise întrebările dificile. Qwen-UI-Agent a fost evaluat pe sarcini structurate; utilizarea reală a telefonului este plină de întreruperi, aglomerată de notificări și implică aplicații care își actualizează interfețele fără avertisment. Inteligența artificială care citește ecranul ridică și o problemă de confidențialitate pe care raportul tehnic al Alibaba nu o abordează: un model care procesează fiecare pixel al ecranului tău are acces la detalii bancare, mesaje private și date pe care majoritatea utilizatorilor nu s-au gândit niciodată să le încredințeze unui sistem terț. Liniile directoare privind ce se întâmplă cu acele date în implementări terțe lipsesc.

Proiectul este găzduit la Tongyi-MAI/MAI-UI pe GitHub; greutățile modelului se află acum pe Hugging Face. Nu a fost anunțat niciun API comercial sau preț de implementare. Următorul test pentru Qwen-UI-Agent nu este un benchmark – ci dacă dezvoltatorii care construiesc pe greutățile deschise pot egala în producție ceea ce Alibaba a înregistrat în laborator.

Etichete: , , , , ,

Discuție

Există 0 comentarii.