Tehnologie

Fable 5.1 de la Anthropic reduce costurile de cache cu 75% și mai mult decât dublează scorurile agentice

Susan Hill

Anthropic a actualizat Claude pe 1 septembrie cu Fable 5.1, reducând costul tokenurilor de intrare din cache de la 1,00 $ la 0,25 $ per milion — o reducere de 75% care apare exact în momentul în care majoritatea dezvoltatorilor de AI din producție au descoperit că acumularea de context, nu puterea brută de calcul, este locul în care se concentrează de fapt bugetele lor de infrastructură. Într-o sesiune agentică live, o singură conversație Claude poate reține sute de mii de tokenuri în cache pe măsură ce contextul se construiește de-a lungul schimburilor. La 0,25 $ per milion, această acumulare devine o alegere de design deliberată, nu un plafon de cost pe care dezvoltatorul îl ocolește.

Rezultatele benchmark-urilor care însoțesc modificarea de preț arată îmbunătățiri de performanță care întăresc argumentul economic. Pe Terminal-Bench-Science 0.1, care măsoară raționamentul științific pe mai mulți pași, necesitând proiectare experimentală și analiză iterativă, Fable 5.1 a obținut 52,6% față de 24,7% pentru Fable 5 — mai mult decât dublând rezultatul anterior. AutomationBench a îmbunătățit de la 17,1% la 31,4%, iar Terminal-Bench 4.0, o evaluare mai largă a capacităților agentice, a crescut de la 42,0% la 55,8%. CursorBench 3.2.0 a atins 73,4%. Modelul în toate cele patru evaluări este consistent: Fable 5.1 nu este incremental mai bun la margine, ci substanțial mai fiabil în categoriile de sarcini care definesc valoarea agentică.

Efectul combinat rescrie aritmetica costurilor de construcție cu Claude. O aplicație agentică care finalizează o sarcină în mai puține schimburi — deoarece modelul este mai fiabil — consumă mai puține cicluri totale de tokenuri pe drumul către un rezultat de succes. Aplicați reducerea de 75% a cache-ului tokenurilor pe care le folosește, iar reducerea efectivă a costului per sarcină în fluxurile de lucru agentice cu reutilizare ridicată ajunge la 45% sau mai mult. Anthropic nu a publicat un singur număr principal pentru economiile combinate, dar dezvoltatorii care își modelează propria economie a tokenurilor vor ajunge la cifre în această gamă pentru sarcinile cu context greu.

Fable 5.1 este disponibil imediat prin API-ul direct al Anthropic sub identificatorul de model claude-fable-5-1, și prin Amazon Web Services Bedrock, Google Cloud Platform și Microsoft Azure. Anthropic a anunțat Enterprise Frontier Safeguards ca o capacitate concurentă: păstrarea datelor controlată de client, chei de criptare gestionate de client și implementarea în cadrul tenantului de infrastructură cloud existent al fiecărui client, incluse fără costuri suplimentare dincolo de costurile cloud de bază.

Alături de lansarea generală, Anthropic a introdus Mythos 5.1, o variantă a aceluiași model de bază care funcționează cu ceea ce compania descrie ca măsuri de siguranță mai permisive pentru organizații verificate. Accesul este restricționat la instituții de cercetare în securitate cibernetică verificate și companii din științele vieții. Compania a citat aplicații demonstrate, inclusiv proiectarea liantului de proteine și optimizarea modelelor biologice, la o capacitate de procesare a inferenței de până la 2,5 ori mai mare decât versiunea standard. Accesul la Mythos 5.1 nu este self-service: Anthropic analizează aplicațiile individual și nu a publicat dimensiunea cohortei înscrise.

Numerele agentice ale Fable 5.1, în special pe Terminal-Bench-Science, plasează rezultatele publicate de Anthropic înaintea celor mai recente cifre dezvăluite de OpenAI pe evaluări comparabile. Comparațiile cross-company de benchmark-uri vin cu o precauție metodologică — furnizorii selectează evaluări care favorizează modelele lor, iar testele specifice evidențiate de Anthropic au fost probabil alese pentru rezultatele lor favorabile. Ceea ce este mai greu de explicat este modelul de dublare internă: Fable 5.1 nu este același model cu o reducere de preț atașată. Schimbarea de performanță este suficient de mare încât povestea prețului și povestea performanței nu pot fi separate.

Pentru dezvoltatorii care nu folosesc în prezent Claude, mișcarea de preț a cache-ului este cifra care merită tradusă în propria lor economie a tokenurilor. Orice furnizor de AI care nu se apropie de 0,25 $ per milion de tokenuri în cache se va confrunta acum cu întrebări directe de comparație a costurilor în conversațiile de vânzări enterprise. Prețul cache-ului Anthropic era deja mai mic decât cel al mai multor concurenți înainte de această reducere; decalajul s-a lărgit. Îmbunătățirile de performanță sunt mai greu de generalizat între cazuri de utilizare, dar în segmentul agentic și de raționament științific, Fable 5.1 stabilește un nivel de referință față de care va fi măsurată următoarea lansare majoră a oricărui furnizor.

Etichete: , , , ,

Discuție

Există 0 comentarii.