TypeSafe AI tuli 15. septembril varjust välja 40 miljoni dollari suuruse rahastusega, mida juhtis DCVC. Ettevõtte väärtuseks on allika sõnul kujunenud ligikaudu 200 miljonit dollarit. Startup tutvustab Jevi mudelit kui tööriista, mis ei genereeri vabateksti, vaid võtab sisendiks programmi oleku ja tüübitud küsimuse ning tagastab tüübitud vastuse koos tõenäosusega.

Ettevõtte põhiline lubadus puudutab nende tõenäosuste kalibreeritust: kui mudel annab vastusele 70-protsendilise kindluse, peaks vastus olema õige ligikaudu 70 protsendil sarnastest juhtudest. Just seda omadust peab allikas aga seni ebapiisavalt tõendatuks.

Kalibreerimine on toote keskmes, kuid mõõdikud puuduvad

TypeSafe nimetab oma treeningmeetodit nimega Reinforcement Learning for Calibrated Decisions. Avalikult ei ole allika põhjal seni esitatud oodatava kalibreerimisvea näitajat, usaldusväärsusskeeme ega tulemusi tavapärastel avalikel võrdlusandmestikel. Samuti puudub arhitektuuripaber.

See loob vastuolu ettevõtte sõnumiga. Mudeli põhiväärtus peaks olema just see, et selle enesekindlus vastab paremini tegelikule õigsusele, kuid selle väite kontrollimiseks vajalikud mõõtmised ei ole avalikkusele kättesaadavad. Seetõttu jääb välisele hindajale ebaselgeks, kas Jevi tõenäosused on praktilises kasutuses paremini kalibreeritud kui teiste mudelite omad.

Ettevõtte enda hindamine ei mõõda tingimata õigsust

TypeSafe’i avaldatud hindamine hõlmab nelja töövooülesannet. Õige vastus on selles võrdluses määratletud GPT-6 Astra ja Claude Fable 5.1 niinimetatud kõrge mõtlemisrežiimi väljundite keskmise põhjal.

Allika kriitika järgi mõõdab selline lahendus eelkõige kokkulangevust kahe teise mudeliga, mitte vastuse tegelikku õigsust. Mudel võib viitega täielikult nõustuda ja ikkagi eksida. Lisaks võrreldakse Jevi kiiruse- ja kulunäitajaid konkurentide vaikimisi, mõtlemiseta seadistustega, samal ajal kui täpsuse siht pärineb konkurentide mõtlemisrežiimist. See muudab esitatud võrdlusarvude tõlgendamise keerukamaks.

Piiratud väljund ei tähenda õiget vastust

Jev kasutab fikseeritud väljundruumi, mis tähendab, et mudel ei saa dekodeerimise käigus pakkuda valikut, mida nimekirjas ei ole. Selles kitsas tähenduses ei saa ta luua suvalist, väljaspool lubatud valikuid olevat vastust.

See ei taga siiski valitud variandi õigsust. Piiratud dekodeerimine vähendab väljamõeldud väljundite võimalust, kuid ei lahenda automaatselt vale klassifikatsiooni või halva otsuse probleemi. Samuti ei ole selline tehniline lähenemine iseenesest uus, sest struktureeritud väljundi piiranguid on kasutatud ka varasemates süsteemides.

Varajane kasutuselevõtt ja ausalt kirjeldatud piirangud

Skeptilisusele seab piiri Jevi varajane kasutuselevõtt. Verceli teatel oli see nende AI Gateway ajaloos kõige kiiremini levinud mudel: kümnendik tasulistest tiimidest kasutas seda esimese 18 tunni jooksul ja 24. tunniks oli osakaal ligikaudu 13 protsenti.

TypeSafe’i dokumentatsioon kirjeldab samal ajal mitut konkreetset nõrkust. Jev ei loenda usaldusväärselt, töötab halvasti kuueteistkümnend- ja RGB-väärtustega, ei suuda hinnata, kas kaks väärtust on teineteisele lähedal, ning võib lugeda kuupäevi tekstina. Dokumentatsioon märgib ka, et semantiliselt seotud väljundite vahel ei ole garanteeritud matemaatilist seost: väite ja selle eituse tõenäosused ei pruugi kokku anda ühte.

Ettevõtte jaoks, kes kaalub tüübitud vastuseid ja tõenäosusi sisaldava mudeli kasutamist, tähendab see vajadust eristada kolme omadust: lubatud väljundruumi järgimist, vastuse õigsust ja tõenäosuste kalibreeritust. Need ei ole sama asi ning tootmisotsuste puhul vajavad kõik eraldi kontrolli.

Mida edasi jälgida?

Tähelepanu tasub pöörata sellele, kas TypeSafe avaldab sõltumatuid kalibreerimistulemusi, standardsete testide andmeid ja läbipaistvamaid võrdlusmeetodeid. Samuti näitab edasine kasutus, kui hästi peavad mudeli dokumenteeritud piirangud paika tegelikes töövoogudes.

Algallikas: Reddit Artificial