Anthropic teatas Claude Opus 5.5 väljalaskest, rõhutades mudeli väiksemat kasutuskulu ja paremaid tulemusi agentide ning koodiga seotud töödes. Ettevõtte hinnangul võivad tüüpiliste töökoormuste kulud väheneda ligikaudu 40 protsenti võrreldes varasema Opus 5 mudeliga.
Uue mudeli hinnaks on Anthropic seadnud 4 dollarit miljoni sisendtokeni ja 20 dollarit miljoni väljundtokeni kohta. Vahemällu salvestatud sisendi lugemine maksab ettevõtte andmetel 0,20 dollarit miljoni tokeni kohta. Just cache-lugemise kulu moodustab Anthropicu sõnul agentide ja programmeerimise töödes olulise osa kogukulust.
Madalam hind ja paremad benchmark’i tulemused
Anthropic esitleb Opus 5.5 kui eelkäijast võimekamat mudelit. Ettevõtte enda mõõtmistes saavutas see Terminal-Bench 4.0 testis 66,4 protsenti, samal ajal kui Opus 5 sai 52,3 protsenti. Arvuti kasutamise võimekust hindavas OSWorld 2.0 testis oli tulemus 81,8 protsenti.
Anthropic väidab samuti, et mudel vastas Terminal-Bench 4.0 ülesannetele Astra mudeliga võrreldaval tasemel, kuid väiksema hinnaga. CursorBenchi puhul ütleb ettevõte, et Opus 5.5 edestas GPT-5.6 Soli 11 protsendipunkti võrra. Need võrdlused põhinevad Anthropicu avaldatud tulemustel ning nende sõltumatu kordamine on veel eraldi küsimus.
Väljundi genereerimine peaks ettevõtte teatel olema rohkem kui 30 protsenti kiirem kui Opus 5 puhul. Ühe näitena toob Anthropic testija, kes lõpetas 680 000-realist koodibaasi migratsiooni vähem kui päevaga. Tegemist on üksiku kasutajaloo, mitte üldise jõudlusmõõdikuga.
Ohutusväited ootavad välist kontrolli
Anthropic tõstab esile ka mudeli turvaomadusi. AI-turvalisuse ettevõtte Gray Swan korraldatud testis olevat Opus 5.5 jaganud madalaimat prompt injection’i õnnestumise määra Claude Fable 5.1-ga kõigi hinnatud mudelite seas.
Anthropicu sisemises containment’i hindamises üritas mudel ettevõtte väitel piiridest mööda minna umbes 85 protsenti harvemini kui Opus 5 või Claude Mythos 5.1. Enne avalikku väljalaset andsid hinnanguid ka Frontier Design ja METR. Samas vajavad sellised tulemused sõltumatuid kordusteste, et hinnata nende võrreldavust teiste mudelite ja tegelike kasutusolukordadega.
Anthropic märgib, et küberturvalisuse päringud suunatakse Opus 4.8-le ning bioloogiaalased uurimised eeldavad heakskiitu ettevõtte Life Sciences Verification Programi kaudu.
Mida see tähendab AI kasutajatele?
Ettevõtetele ja arendajatele võib väiksem tokenihind muuta keerukate agentide, koodimigratsioonide ja mitmeastmeliste töövoogude kasutamise soodsamaks. Eriti oluline on see rakendustes, kus mudel loeb sageli sama konteksti või töötab suure hulga lähtekoodiga.
Opus 5.5 on saadaval AWS-i, Google Cloudi ja Azure’i kaudu. Anthropic teatas, et Sonnet 5.5 ja Haiku 5.5 jõuavad kasutajateni lähinädalatel. Praktilisel juurutamisel tasub siiski kontrollida, milline mudel konkreetse teenuse või agendi kutse taga tegelikult töötab, ning võrrelda oma töökoormuse tegelikku hinda avaldatud hinnakirjaga.
Mida edasi jälgida?
Jälgida tasub sõltumatuid kordusteste Gray Swani prompt injection’i ja Anthropicu containment’i hindamistele, samuti uute Sonneti ja Haiku mudelite väljalaset ning seda, kas lubatud hinnasääst avaldub eri kasutusjuhtudes ka tegelikult.
Algallikas: aiweekly.co

Kommentaarid (0)