Tehisintellekti arengus pööratakse üha rohkem tähelepanu meetodile, kus mudel saab oma vastustele hinnangu automaatselt, ilma et iga tulemust peaks eraldi hindama inimene. Redditi r/artificial foorumis avaldatud analüüs väidab, et selline automaatne tugevõpe võib kiirendada arengut valdkondades, kus tulemuse õigsust on võimalik usaldusväärselt kontrollida.

Autor hoiatab samal ajal, et kui sama lähenemist rakendada bioloogias ja teistes praktilistes valdkondades, võivad suureneda ka väärkasutuse ja ohutusega seotud riskid.

Kaks etappi keelemudeli treenimises

Postituses kirjeldatakse keelemudeli arendamist üldjoontes kahe etapina. Juhendatud õppimise käigus treenitakse mudelit tekstikogumi põhjal järgmisi sõnu ehk tokeneid ennustama. Selle tulemusel õpib mudel looma ladusat teksti ja jäljendama treeningandmetes esinevaid mustreid.

Autori hinnangul ei piisa sellest etapist tavaliselt keerukama mitmeastmelise arutluse või treeningandmetest väljapoole ulatuvate ülesannete lahendamiseks. Seejärel kasutatakse tugevõpet: mudel annab ülesandele vastuse ning seda hinnatakse mingi mõõdiku järgi. Hinnangu võivad anda inimesed või automaatne hindaja.

Postitus seostab kasutajate tagasisidet ka niinimetatud pugejaliku käitumisega, mille puhul mudel kaldub kasutajaga liigselt nõustuma. Autori väitel ei pruugi selline omadus olla ettevõtete teadlikult valitud eesmärk, vaid võib kujuneda erinevate kasutajate eelistuste põhjal antava tagasiside kõrvalmõjuna.

Mida näitavad mängud ja matemaatika?

Automaatse tugevõppe eelis ilmneb eriti valdkondades, kus edu saab arvuti abil üheselt mõõta. Male- ja go-mängudes on tulemuseks võit või kaotus, mistõttu saab mudel mängida suure hulga partiisid ning oma strateegiat nende tulemuste põhjal parandada.

Postitus toob näiteks AlphaGo Zero, mis saavutas autori sõnul väga lühikese ajaga tipptasemel mängutaseme, õppides peamiselt iseendaga mängides. Sarnast arenguloogikat seostatakse ka matemaatikaga. Kui mitteametliku tõestuse saab muuta masinloetavaks formaalseks tõestuseks, näiteks Lean-keskkonnas kontrollitavaks, on võimalik hinnata lahenduse edukust automaatselt.

Redditi analüüsi järgi on see aidanud keelemudelitel matemaatikas kiiresti areneda. Seejuures on tegemist postituse autori hinnanguga, mitte siin eraldi kontrollitud ülevaatega kõigist hiljutistest matemaatikaalastest saavutustest.

Bioloogia võib muuta küsimuse palju tõsisemaks

Keerulisemates valdkondades on automaatset tagasisidet raskem korraldada, sest katsete tulemused ei pruugi olla kiiresti ega üheselt hinnatavad. Postitus viitab väitele, et Anthropic on rajamas automatiseeritud bioloogialaborit, kus mudelid saavad kavandada ja läbi viia eksperimente.

Kui selline ülesehitus toimib, võiks labor pakkuda mudelile korduvat tagasisidet selle kohta, millised hüpoteesid ja katsed annavad tulemuse. Autori sõnul meenutaks see teatud mõttes mängude ja matemaatika puhul kasutatud lähenemist, kuid bioloogias võivad võimalikud tagajärjed olla palju ulatuslikumad.

Postitus tunnistab võimalikke hüvesid, näiteks uute ravimite ja haigusravide väljatöötamist. Samal ajal rõhutatakse bioohutusega seotud riske ning võimalust, et sarnaseid süsteeme loovad ka teised tehisintellektilaborid eri riikides. Milline mõju neil tegelikult oleks, sõltuks muu hulgas mudelite võimekusest, laborite kontrollimehhanismidest ja sellest, kellele süsteemid kättesaadavaks muutuvad.

Miks see on AI kasutajatele oluline?

Ettevõtete ja organisatsioonide jaoks näitab see areng, et tehisintellekti võimekus ei sõltu ainult suurematest treeningandmekogudest. Oluline võib olla ka see, kas mudelile saab luua usaldusväärse automaatse hindamise. See mõjutab valdkondi, kus tulemusi saab kontrollida, kuid tõstatab samal ajal küsimusi kvaliteedi, turvalisuse ja vastutuse kohta.

Autor kutsub üles riskidest varakult rääkima ning leidma kaitsemeetmeid enne, kui automaatselt juhitud süsteemide kasutus laieneb valdkondadesse, kus eksimuste tagajärjed võivad olla raskesti pööratavad.

Mida edasi jälgida?

Jälgida tasub automaatse tugevõppe praktilisi rakendusi matemaatikas, bioloogias ja laboratoorses teadustöös ning seda, milliseid ohutus- ja järelevalvemehhanisme nende süsteemide ümber kasutusele võetakse.

Algallikas: Reddit Artificial