Anthropic avaldatud sisemiste hinnangute järgi jõudis Claude augustis tasemele, kus ta juhtis 26% ettevõtte mõõdetud tehisintellekti uurimis- ja arendustööst. Veebruaris oli sama näitaja alla ühe protsendi. Töö toimus inimeste järelevalve all, kuid tulemused annavad harvaesineva ülevaate sellest, kui suurt rolli mängib AI juba uute AI-süsteemide arendamisel.
Hinnangud avaldati ajal, mil Anthropic on rõhutanud vajadust tehisintellekti arengut tempokamalt juhtida. Mõõtmised muudavad selle üleskutse konkreetsemaks: ettevõte peab samal ajal tegelema nii AI arendamise kiiruse kui ka selle üle kontrolli säilitamisega.
Mida tähendab Claude’i „juhtiv” roll?
Anthropic kasutas ülesannete hindamisel Epoch AI skaalat ning kaalus töid selle järgi, kui palju aega need inimeselt tavaliselt nõuavad. „Juhtiv” tase tähendab, et Claude lõpetab suurema osa ülesandest, kuid tegutseb endiselt inimese järelevalve all.
Üle 90% mõõdetud tööst jõudis vähemalt tasemele „teeb koostööd või kõrgemal”. Sellesse rühma kuuluvad ka ülesanded, mille puhul inimene määrab suuna ja AI aitab töö ellu viia. Täielikku autonoomiat ei tuvastatud. Selle taseme puhul peaks süsteem suutma ise probleemi leida, lahenduse rakendada ja tulemuse tootmisesse viia ilma inimese sekkumiseta.
Oluline piirang on see, et ülesandeid hindas ka Claude ise. Tema hinnang langes inimeste hinnanguga täpselt kokku 59% juhtudest, mis jätab alles vaidlusruumi selle üle, kuidas töö tegelik automatiseerituse tase määratleda.
Järelevalve ulatus on endiselt lahtine
Anthropic teatas, et ettevõtte suurimal sisemisel platvormil töötas korraga ligikaudu 30 000 agenti. Ettevõtte sõnul jõudsid kõik nende tegevused seiresse ning augustis blokeeriti enam kui miljardi otsuse hulgas ligikaudu üks otsus 47 000-st. See väide puudutab konkreetset platvormi, mitte tingimata kogu Anthropicis toimuvat arendustööd.
Samuti suunati juuli keskpaiga ühe nädala jooksul ohutustööle umbes 6% teadus- ja arendustegevuse arvutusressursist. See ülevaade ei hõlmanud kaitsemeetmete klassifikaatoreid. Anthropic on varem märkinud, et automatiseeritud võrguühenduseta seire kvaliteeti ei olnud veel algusest lõpuni hinnatud.
Seetõttu ei näita blokeeritud otsuste arv üksi, kui hästi võimalikud probleemid avastati. Välised hindajad peaksid saama tutvuda alusandmetega, vaidlustada ülesannete liigitusi ja raporteerida ka ebasoodsatest tulemustest.
Läbipaistvus sõltub väliste hindajate ligipääsust
Anthropic on lubanud tuua ettevõttesse väliseid hindajaid töötajatega võrreldava ligipääsuga. Hiljem teatas ettevõte hindamispartnerlusest Accenture’i Faculty äriga, mille fookuses on muu hulgas ründe-testid, kooskõla hindamine ja kaitsemeetmete testimine. Partnerluse rahastab Anthropic, kuid ligipääsu ja tulemuste avalikustamise täpsed reeglid jäid esialgu lahtiseks.
Need tingimused määravad, kui sõltumatuks hindamine kujuneb ja kui palju saavad kõrvalised osapooled selle tulemustest teada. Ka teised AI-ettevõtted on väljendanud toetust sõltumatule hindamisele, kuid eri laborite tegeliku ligipääsu ja avaliku aruandluse võrreldavus pole veel selge.
Eesti ettevõtjate, juhtide ja AI kasutajate jaoks on teema oluline eelkõige usaldusväärsuse vaatenurgast. Kui AI hakkab osalema keerukate süsteemide arendamises, ei piisa ainult väitest, et inimene on protsessis kaasatud. Tähtis on ka teada, mida inimene kontrollib, milliseid andmeid ta näeb ning kas seire suudab vead õigeaegselt tuvastada.
Mida edasi jälgida?
Jälgida tasub seda, millise ligipääsu saavad Anthropicis välised hindajad, kuidas avalikustatakse nende leiud ning kas teised AI-laborid võtavad kasutusele võrreldavad mõõdikud ja aruandlusreeglid.
Algallikas: therundown.ai

Kommentaarid (0)