Tehisintellekti mudelite võrdlemiseks kavandatakse avalikku sõjamängu, kus kümme tuntud mudelit teevad strateegilisi otsuseid ühe ühise simulatsiooni käigus. Algallika kirjelduse järgi on tegemist mudeliarenaga sarnase formaadiga, kuid tavapärase küsimustele vastamise asemel tuleb mudelitel juhtida sõjalist konflikti.
Võrdluse keskne osa on otsustusprotsessi täielik salvestamine. Nii peaks olema võimalik hiljem uurida mitte ainult seda, millise tulemuse mudel saavutas, vaid ka seda, millise info põhjal ta otsuseni jõudis.
Kuidas benchmark töötab?
Mängu kirjelduses on strateegiliste valikutena esile toodud liitude sõlmimine, kokkulepete rikkumine ja tuumarelvade kasutamise võimalus. Tegemist on simulatsiooniga, mitte päris sõjalise operatsiooniga, kuid formaat on loodud selleks, et tuua mudelite erinevad otsustusstiilid nähtavale.
Iga mängu kohta säilitatakse mudelite antud korraldused ja nende ühe rea pikkused põhjendused. Lisaks salvestatakse, mida mudel otsuse tegemise hetkel nägi: näiteks kullavarud, vägede hulk, ründaja olemasolu ja teiste osapoolte pakutud paktid. Arvesse võetakse ka korraldusi, millest mudel keeldus.
Võrdluses osaleb kümme mudelit
Algallika järgi kuuluvad esialgsesse koosseisu Claude, GPT, Grok, Gemini, DeepSeek, Mistral, Qwen, Kimi, Llama ja GPT-OSS. Selline valik hõlmab mitme arendaja ja eri taustaga mudeleid, kuid sisend ei täpsusta nende konkreetseid versioone.
Korraldajate teate kohaselt pidi ülekande või mängu algus toimuma kell 22.45 USA idaranniku aja järgi ehk kell 02.45 UTC. Kuna tegu on ajastatud sündmusega, ei näita algne teadaanne iseenesest, millised mudelid lõpuks võitsid või milliseid otsuseid nad tegid.
Miks on otsuste logi oluline?
Benchmarki väärtus ei seisne üksnes lõpptulemuses. Kui mudelite korraldused, põhjendused ja nähtud olukorrad on taasesitatavad, saab võrrelda, kas erinevused tulenevad riskivalmidusest, liitude kasutamisest, olemasoleva info tõlgendamisest või mõnest muust otsustusmustrist.
AI kasutajatele ja juhtidele pakub selline formaat võimaluse jälgida, kuidas mudelid käituvad muutuvates ja vastandlike eesmärkidega olukordades. Samal ajal tuleb tulemusi tõlgendada ettevaatlikult: strateegiamängu edu ei pruugi näidata, kuidas mudel toimiks päris organisatsiooni, kriisi või julgeolekuolukorra tingimustes.
Mida edasi jälgida?
Jälgida tasub mängude täielikke logisid, mudelite põhjenduste järjepidevust ning seda, kas hiljem saab eri osapoolte otsuseid võrreldavalt ja korratavalt analüüsida.
Algallikas: Reddit Artificial

Kommentaarid (0)