BUILDRYA
Tagasi AI-RADARisse
Anthropicu mõõdiku järgi juhib Claude 26% AI-arendustööst
Automatsioon7 min lugemistKristjan Krimm

Anthropicu mõõdiku järgi juhib Claude 26% AI-arendustööst

Anthropicu R&D Automation Index mõõdab Claude'i rolli järgmiste mudelite ehitamisel. 26% juhtimisnäitaja kõrval tuleb hinnata monitoride katvust ja avastamata vigu.

FacebookXLinkedIn

Lühidalt

  • Anthropicu uue R&D Automation Indexi järgi „juhib” Claude 26% ettevõtte mõõdetud AI-uurimis- ja arendustööst ning osaleb vähemalt koostöö tasemel enam kui 90%-s tööst.
  • Täielikult autonoomseks ei hinnatud Claude'i üheski mõõdetud töövaldkonnas: AL4 tasemel teeb agent suurema osa tööst, kuid inimene annab eesmärgi ja otsustab kasutuselevõtu.
  • Anthropicu põhilisel sisemisel platvormil töötas augustis korraga ligikaudu 30 000 agenti ning nende üle miljardi tegevusotsuse seas blokeeris reaalajamonitor umbes ühe 47 000-st.
  • Mõõtmise koostasid suuresti Anthropicu enda Claude'i agendid ja hindajad; tulemusi pole veel sõltumatult auditeeritud ning blokeerimismäär ei mõõda monitori avastamata vigu.

Anthropic avaldas 17. septembril kolm mõõdikut, millega ettevõte soovib muuta frontier-mudelite arendustempo väljastpoolt paremini jälgitavaks. Kõige tähelepanuväärsem neist on R&D Automation Index: 2026. aasta augusti seisuga „juhtis” Claude ettevõtte hinnangul 26% mõõdetud AI-uurimis- ja arendustööst ning enam kui 90% tööst toimus vähemalt inimese ja AI tiheda koostööna.

„Juhtimine” ei tähenda täielikku autonoomiat. Anthropicu kasutatud AL4 tasemel saab agent kõrgetasemelise ülesande, teeb suurema osa tööst algusest lõpuni ja lahendab vahepealsed takistused, kuid inimene jälgib tulemust ning otsustab näiteks muudatuse tootmisse viimise. AL5 ehk ilma vajaliku inimese sekkumiseta autonoomiat ei tuvastatud üheski mõõdetud alamhulgas.

Ettevõte avaldas koos automatiseerimisega ka järelevalve- ja arvutusvõimsuse näitajad. Augustis töötas Anthropicu enim kasutatud sisemisel platvormil korraga ligikaudu 30 000 uurimis- ja arendusagenti. Reaalajamonitor vaatas enne täitmist läbi kõik nende tegevused ning blokeeris üle miljardi otsuse hulgas 0,002% ehk umbes ühe 47 000-st.

Reuters kinnitas põhinäitajad, kuid need jäävad Anthropicu enda mõõtmisteks. Ettevõte kavandab sõltumatute hindajate ligipääsu sisemistele protsessidele ja andmetele; avaldamise ajal polnud kirjeldatud indeks kolmanda osapoole auditi tulemus.

26% mõõdab töökorvi, mitte töötajate asendamist

Indeksi alus on umbes 15 000 üksikülesannet, mille Claude'i uurimisagent tuvastas 2026. aasta juulis valitud töötajate Slacki ja sisemiste dokumentide põhjal. Ülesanded koondati 542 sõlmega hierarhiaks, milles oli 378 kõige detailsemat tööliiki, näiteks hindamisplatvormi vigade parandamine või agentide võrgupoliitika.

Iga tööliigi automatiseeritust hindas eraldi Claude'i kohtunik Epoch AI kuueastmelisel skaalal. AL0 tähendab AI puudumist, AL3 tihedat koostööd, AL4 agendi juhtivat rolli ja AL5 täielikku autonoomiat. Tööliikide kaaluks kasutati neile kulunud inimtöö aega, et paljude töötajate oluline ülesanne mõjutaks indeksit rohkem kui väike kõrvaltegevus.

Seetõttu ei saa 26% tõlgendada nii, et Claude on asendanud veerandi Anthropicu töötajatest või teinud veerandi kõigist töötundidest. See tähendab, et juulikuise töökorvi kaalutud ülesannetest hinnati 26% augustis tasemele, kus AI suudab suurema osa tööst teha kõrgetasemelise juhise ja inimese järelevalvega.

Anthropic võrdles mudelihinnanguid valdkonna omanike hinnangutega. Täpne kokkulangevus oli 59% ning hinnangud jäid 97% juhtudest ühe taseme piiresse. Inimeste omavaheline täpne kokkulangevus oli ettevõtte järgi 35%, mis näitab, et piir näiteks „koostöö” ja „juhtimise” vahel pole täiesti objektiivne.

Järelevalve näitajad vajavad koos lugemist

Anthropic jagab järelevalve reaalaja- ja järelkontrolliks. Reaalajamonitor vaatab põhiplatvormil enne täitmist läbi 100% tegevustest ning võib ohtliku sammu blokeerida või agenti ümber suunata. Inimene vaatab blokeeritud tegevused üle kuni nädala jooksul.

Järelmonitor neelab pärast tegevust samuti kõik logid. Ligikaudu 100 000 transkripti nädalas läbivad mitu klassifikaatorit, millest kõrgeima prioriteediga umbes 50 juhtumit jõuab inimese kontrolli. Esialgselt märgitakse täiendavaks ülevaatuseks ligikaudu üks kuni kaks transkripti tuhandest.

Üks blokeering 47 000 tegevuse kohta ei ole iseseisev ohutusnäitaja. Madal määr võib tähendada, et agendid käituvad hästi, et enamik riskidest peatatakse muude tehniliste piirangutega või et monitor ei tunne kõiki kõrvalekaldeid ära. Hindamiseks on vaja teada monitori täpsust kontrollitud ründekatsetes, valepositiivseid tulemusi ja tagantjärele avastatud sündmusi, millest reaalajakontroll mööda vaatas.

Anthropic ise tunnistab, et on sellist seiret teinud kuid, mitte aastaid, ning täielik pilt kõigist võimalikest käitumistest puudub. See reservatsioon on eriti oluline, sest haruldane viga muutub 30 000 samaaegse agendi ja miljardite otsuste korral regulaarseks operatsiooniriskiks.

Arvutusvõimsuse jaotus lisab kolmanda kontrollpunkti

Kolmas mõõdik kirjeldab arvutusvõimsuse jaotust 13.–20. juulil. Umbes 6% AI teadus- ja arendustöö arvutusest liigitati ohutustööks; AI-agentide tehtud AI-arenduse arvutusest oli ohutusele suunatud umbes 12%.

Anthropic nimetab neid hinnanguid konservatiivseks, sest võrdselt ohutust ja võimekust edendanud töö loeti võimekuse poolele. Samas klassifitseeris töökoormusi taas Claude ning valim hõlmas üht nädalat. Arvutusmaht ei võrdu töö mõjuga: tõhusam ohutuskatse võib kasutada vähem kiipe, kuid anda parema tulemuse.

Nende arvude väärtus on eelkõige korduv mõõtmine. Kui definitsioonid püsivad, saab jälgida, kas automatiseerimine kasvab kiiremini kui järelevalve ning kas ohutusele eraldatud ressurss liigub koos agentide mõju suurenemisega. Laborite võrdlemiseks oleks vaja ühist metoodikat ja sõltumatut kontrolli.

Eesti ettevõttele on tähtis mõõta kontrollitud tulemust

Sama raamistik sobib ka väiksemale organisatsioonile, kuigi 542 kategooriaga indeksit pole vaja. Alustada võib töövoogudest: kui suur osa analüüsist, koodimuudatustest või klienditeenindusest sünnib AI abiga, millal agent tegutseb iseseisvalt ja millise sammu kinnitab inimene.

„AI juhib” peab olema seotud tulemuse kvaliteediga. Mõõta tuleks tootmisse jõudnud korrektseid muudatusi, tagasipööramisi, parandamisele kulunud inimtunde, kasutatud mudelikulu ja intsidente. Automatiseerimise osakaalu kasv ei ole võit, kui inimese järelkontroll või vigade taastamine kallineb kiiremini.

Agendi identiteet peab säilima üle mudeliversioonide ning iga tegevus peab olema seotud konkreetse agendi, õiguse ja sisendiga. Anthropicu kirjeldatud avatud sõnumisüsteem annab siin kasuliku põhimõtte: agentide omavaheline suhtlus peab olema sama auditeeritav kui nende tööriistakutsed.

Juhtkonnale sobiv tulemuskaart ühendab automatiseerimise taseme, monitori katvuse, ülevaatuse viivituse, eskalatsioonimäära ja kontrollitud ärilise tulemuse. Üks number, olgu see 26% või üks blokeering 47 000-st, ei kirjelda süsteemi ohutust ega tootlikkust piisavalt.

Indeks vajab versioonihaldust ja võrreldavat baastaset

Anthropic külmutas töökorvi, et sama ülesannete kogumit saaks kuust kuusse võrrelda. See lahendab ühe probleemi, kuid loob teise: kui inimesed liiguvad automatiseeritud tegevustelt täiesti uutele ülesannetele, võib indeks näidata kiiret automatiseerimist ilma organisatsiooni tegeliku tööjaotuse muutust täielikult tabamata. Ettevõte võrdles juuli korvi jaanuari omaga ega leidnud oma detailsustasemel uute ülesannete osakaalu kasvu, kuid lubab korvi perioodiliselt uuesti koostada.

Iga uuendusega tuleb seetõttu avaldada metoodika versioon, muutunud kategooriad ja võimaluse korral nii vana kui ka uue korvi järgi arvutatud kattuv periood. Muidu võib näitaja hüpe tuleneda ümberklassifitseerimisest, mitte Claude'i uuest võimekusest. Sama põhimõte kehtib ettevõtte sisemise tulemuskaardi puhul: automatiseerimise arengut ei saa ausalt esitada, kui tööde definitsioone, kaale või kvaliteedilävendeid muudetakse tagasiulatuvalt nähtamatult.

Avalik ajalugu peab säilitama ka varasemad tulemused, et välised hindajad saaksid muutuse põhjust kontrollida.

Korduma kippuvad küsimused

Mida tähendab, et Claude „juhib” 26% arendustööst?

See tähendab AL4 automatiseerimistaset kaalutud ülesandekorvis: inimene annab kõrgetasemelise ülesande, Claude teeb suurema osa tööst ning inimene jälgib ja otsustab lõpliku kasutuselevõtu. See ei tähenda, et Claude teeb 26% kõigist töötundidest või asendab veerandi töötajatest.

Kas Claude arendab juba oma järglast täiesti iseseisvalt?

Ei. Anthropic ei hinnanud Claude'i üheski mõõdetud AI-arenduse alamhulgas AL5 ehk täielikult autonoomsele tasemele.

Kuidas indeks koostati?

Claude'i agendid kaardistasid juulis ligikaudu 15 000 ülesannet, koondasid need tööliikideks ning eraldi mudel hindas automatiseerimistaset. Tulemused kaaluti ülesannetele kulunud inimtöö ligikaudse osakaalu järgi.

Kas tulemused on sõltumatult auditeeritud?

Veel mitte. Anthropic kontrollis mudelihinnanguid töötajate hinnangutega ja lubab anda sõltumatutele hindajatele ligipääsu, kuid avaldatud näitajad pärinevad ettevõtte enda süsteemidest.

Mida tähendab üks blokeering 47 000 tegevuse kohta?

See on reaalajamonitori blokeerimismäär enam kui miljardi otsuse seas 2026. aasta augustis. Ilma monitori avastamistäpsuse ja möödalastud juhtumite arvuta ei saa seda käsitleda üldise ohutusmäärana.

Milliseid näitajaid peaks ettevõte oma agentide puhul kasutama?

Vähemalt automatiseerimise tase, monitori katvus, ülevaatuse viivitus, eskalatsioonid, avastamata intsidendid, inimese parandusaeg ja kontrollitud tulemus ühe euro kohta. Neid tuleb vaadata koos, mitte eraldiseisvate edunumbritega.

Allikad

  1. 01

    Anthropic

    Anthropic, „Measurements for understanding the pace of AI development inside frontier labs“, 17. september 2026

    anthropic.com(avaneb uuel vahelehel)
  2. 02

    Reuters

    Reuters, „Anthropic says Claude now leads a quarter of work building its next AI models“, 17. september 2026

    marketscreener.com(avaneb uuel vahelehel)
  3. 03

    Associated Press

    Associated Press, „Anthropic says its AI is doing more of the work to build its successor“, 18. september 2026

    apnews.com(avaneb uuel vahelehel)
MärksõnadAnthropicClaudeR&D Automation IndexAI-agendidautomatiseerimineagentide järelevalve

Jaga artiklit

Saada see lugu kolleegile või salvesta hilisemaks.

AI-RADARi uudiskiri

Saa järgmine AI-RADAR postkasti

Kui järgmine praktiline AI-signaal või tööriistamuutus avaldatakse, saad selle otse e-postile.

Arutelu

0 kommentaari

0/1500

Laen kommentaare...
Loe edasi

Seotud teemad AI-RADARis

Kõik uudised