Anthropic avalikustas Claude Sonnet 5.5, uue keskklassi mudeli, mis ettevõtte hinnangul parandab märgatavalt teadmistepõhise töö ja programmeerimise tulemusi. Uudis saabus vahetult pärast Opus 5.5 väljaandmist ning asetab Sonneti senisest lähemale mudeliperekonna võimekaimale liikmele.

Anthropicu sõnul on Sonnet 5.5 eelkäijast umbes 30% kiirem. Samal ajal säilitab mudel varasema hinnastuse ning osa tööülesandeid võib ettevõtte väitel maksta kuni 30% vähem. Anthropic positsioneerib uut mudelit lahendusena kasutajatele, kes vajavad tugevat jõudlust, kuid ei soovi iga ülesande puhul kasutada kõige kallimat mudelit.

Sonnet 5.5 jõudlus paraneb teadmiste- ja arendustöös

The Rundowni kokkuvõtte järgi sai Sonnet 5.5 AA Intelligence Indexis tulemuseks 56 punkti. See paigutab mudeli Opus 5.5 järel ning ettepoole võrdluses nimetatud Fable 5.1 ja GPT-6 Astra mudelitest, mille tulemus oli 53.

Kontoritöö ülesannetes olevat Sonnet 5.5 Opus 5.5-le mitmes testis peaaegu järele jõudnud. Programmeerimise puhul kirjeldatakse hüpet veelgi suuremana: mõnel arendustööde võrdlustestil olevat Sonnet 5.5 olnud Opusest ja Astrast samal tasemel või neist parem. Need tulemused pärinevad algallikas kirjeldatud testidest ning nende võrreldavus sõltub kasutatud hindamismetoodikast.

Anthropic on lisanud Sonneti tasemele ka senisest rangemad küberturvalisuse kaitsemeetmed. Kokkuvõtte järgi kasutab mudel turvapiiranguid ja varumehhanisme, mida varem seostati Opuse ning teiste mudelitega. See viitab sellele, et suurem võimekus ei tähenda ettevõtte vaates ainult paremaid vastuseid, vaid ka vajadust piirata tundlikke kasutusjuhtumeid.

Kuidas valida Claude’i mudelit?

The Rundown soovitab mudelite valimiseks teha lihtsa võrdlustesti. Kasutajale antakse eri mudelitele sama ülesanne, näiteks turundusmeili koostamise lähteülesanne, millesse on peidetud faktivead. Seejärel palutakse mudelil vead esmalt tuvastada ja alles siis tekst koostada.

Juhendis soovitatakse võrrelda Opus 5.5, Opus 5 ja Fable 5.1 sama sisendi, seadistuste ja ühe katse alusel. Hinnata saab kuupäevade, hinna- ja prooviperioodi tingimuste õigsust, samuti seda, kas mudel leidis mõlemad vead. Kui tulemus jääb puudulikuks, võib sama ülesannet proovida suurema pingutustasemega.

Algallikas toodud näites oli Fable 5.1 API-kulu 0,45 dollarit ja Opus 5.5 kulu 0,18 dollarit. See ei ole universaalne hinnavõrdlus kõigi ülesannete jaoks, kuid näitab, miks mudeli valikul tasub hinnata koos kvaliteeti, parandamisele kuluvat aega ja kasutuskulu.

Miks see on AI kasutajale oluline?

Uus Sonnet võib olla oluline ettevõtetele ja arendajatele, kes vajavad igapäevases töös tugevat mudelit, kuid soovivad hoida kulusid kontrolli all. Keskklassi mudeli ja tipptasemel mudeli vaheline piir muutub hägusamaks, mistõttu ei pruugi kõige kallim valik olla iga töövoo jaoks põhjendatud.

Praktiline õppetund on kontrollida mudelit oma tegelike tööülesannetega. Eriti kasulik on testida, kas AI eristab sisendis esitatud fakte oletustest, järgib hinna- ja kuupäevapiiranguid ning suudab teksti enne avaldamist ise kontrollida. Mudeli valik võiks seega põhineda mitte ainult üldistel edetabelitel, vaid ka konkreetse organisatsiooni vigade hinnal ja kvaliteedinõuetel.

Mida edasi jälgida?

Jälgida tasub Sonnet 5.5 tegelikku jõudlust eri töövoogudes, selle kasutuskulu ning seda, kuidas võrreldakse mudelit Opus 5.5 ja teiste konkurentidega. Samuti on oluline vaadata, kas uued turvapiirangud mõjutavad praktilist kasutatavust küberturbe ja arendustööde puhul.

Algallikas: therundown.ai