Tehnologie

Claude Opus 5.5, cu 40% mai ieftin, apare când Anthropic cere temporizarea IA

Susan Hill
Adaugă-ne în Google

Claude Opus 5.5 face ceva ce modelele anterioare ale Anthropic nu făceau: costă mai puțin și rulează mai rapid, egalând sau depășind totodată un sistem mai mare și mai scump. Modelul gestionează programarea agentică, utilizarea computerului, interpretarea graficelor și raționamentul multidisciplinar la niveluri care, potrivit propriilor date ale Anthropic, le depășesc pe cele ale Claude Fable 5.1, anterior cel mai capabil model al companiei, în funcție de mai multe criterii. Pentru utilizatorii și dezvoltatorii care au considerat Opus 5 util, dar costisitor, raportul dintre ceea ce poate face modelul și prețul său s-a modificat semnificativ.

Diferența de preț este precisă. Opus 5.5 percepe 4 dolari pentru un milion de tokenuri de intrare și 20 de dolari pentru un milion de tokenuri de ieșire; Opus 5 costa, respectiv, 5 și 25 de dolari. Citirile din cache scad de la 0,50 dolari la 0,20 dolari pentru un milion de tokenuri. Anthropic spune că sarcinile de lucru obișnuite ajung să coste, per total, cu aproximativ 40% mai puțin. Viteza urmează aceeași tendință: modelul standard generează text cu peste 30% mai repede decât Opus 5. O opțiune separată de mod rapid, tarifată la 8 dolari pentru intrare și 40 de dolari pentru ieșire la un milion de tokenuri, atinge de până la 2,5 ori viteza standardului Opus 5 — o setare utilă pentru aplicațiile sensibile la latență.

Datele de performanță publicate de Anthropic plasează Opus 5.5 înaintea Fable 5.1, Opus 5 și GPT-6 Astra în patru dintre cele șase benchmarkuri. La Terminal-Bench 4.0, care testează executarea codului într-un mediu terminal activ, Opus 5.5 obține 66,4%, față de 55,8% pentru Fable 5.1. La Humanity’s Last Exam, un test care acoperă cunoștințe academice și profesionale din mai multe discipline, rezultatul este 67,7%, față de 65,6%. OSWorld 2.0, care măsoară operarea interfețelor computerului, indică 81,8%, față de 80,7%. Un test Deloitte a constatat că Opus 5.5, la setarea sa de efort minim, a detectat 72% dintre erorile de programare cunoscute în procesul de revizuire, față de 56% pentru Opus 5 la efort ridicat. Aceste cifre provin de la Anthropic și de la partenerii selectați de companie; marjele de eroare declarate variază între ±1,6 și ±5 puncte procentuale și, la lansare, nu a fost publicată nicio verificare independentă realizată de o terță parte.

Două domenii rup acest tipar. La AutomationBench, GPT-6 Astra obține 41,4%, față de 40,0% pentru Opus 5.5. La Terminal-Bench-Science, diferența este mai mare: Astra ajunge la 64,6%, în timp ce Opus 5.5 se oprește la 58,7%. Ambele diferențe se încadrează în marjele de eroare declarate — ar putea fi zgomot statistic — însă s-ar putea să nu fie. Anthropic include aceste rânduri în propriul tabel publicat, ceea ce este mai mult decât fac majoritatea companiilor de AI la lansare. Cifrele au în continuare nevoie de examinare independentă înainte de a putea fi considerate definitive.

În privința siguranței, Anthropic afirmă că Opus 5.5 a fost evaluat înainte de lansare de echipe externe, inclusiv METR. În propriul audit intern de comportament al companiei, cu aproape 2.000 de scenarii concepute pentru a testa dacă modelul încearcă să ocolească restricțiile impuse, Opus 5.5 este descris ca având o probabilitate cu 85% mai mică decât Opus 5 de a încerca o astfel de eludare. Modelele mai puternice tind să fie mai capabile să găsească modalități de evitare, ceea ce face ca îmbunătățirea să fie semnificativă dacă se confirmă. Experiența din implementare va fi testul real.

Ceea ce face această lansare neobișnuită este momentul în care are loc. La începutul acestei luni, directorul executiv al Anthropic, Dario Amodei, a publicat un eseu în care scria că a ajuns la concluzia că abordarea completă a riscurilor AI necesită „adaptarea ritmului avansului capabilităților, astfel încât prevenirea riscurilor să aibă timp să țină pasul”. Sam Altman, de la OpenAI, și Elon Musk și-au exprimat acordul cu preocuparea generală. Jensen Huang, de la Nvidia, a spus că știința de bază nu susține această idee. Iar apoi Anthropic a lansat un model mai rapid, mai ieftin și mai capabil decât predecesorul său. O interpretare este că un model cu evaluări de siguranță mai bune și acces mai larg este exact ceea ce avea în vedere Amodei. O alta este că eseul a identificat avansul capabilităților drept problema, iar capabilitățile au avansat. Ambele interpretări se regăsesc în același set de fapte, iar benchmarkurile Anthropic, singure, nu pot stabili care dintre ele este corectă.

Claude Opus 5.5 este disponibil din 22 septembrie 2026 sub ID-ul de model API claude-opus-5-5. Rulează în Claude, în cadrul planurilor Pro, Max, Team și Enterprise, și este accesibil prin AWS, Google Cloud și Microsoft Azure. Anthropic majorează limitele de utilizare pentru nivelurile de abonament de cinci ore. Sonnet 5.5 și Haiku 5.5, ceilalți membri ai familiei 5.5, sunt programate să urmeze în săptămânile următoare, fără ca pentru niciunul dintre ele să fi fost anunțat un preț sau o dată concretă de lansare.

Etichete: , , , , ,

Adaugă-ne în Google

Discuție

Există 0 comentarii.