
Z.ai avaldas Ox Alpha nimega testitud GLM-5.3-Flashi avatud kaalud
Z.ai kinnitas, et anonüümne Ox Alpha oli GLM-5.3-Flash, ja avaldas 320 miljardi parameetriga mudeli MIT-litsentsiga. Odav API ei taga siiski kiireimat ega odavaimat tervikülesannet.
Lühidalt
- Z.ai avaldas 26. augustil GLM-5.3-Flashi ning kinnitas, et sama mudelit oli varem OpenRouteris ja OpenCode'is anonüümselt testitud Ox Alpha nime all.
- Mudelil on 320 miljardit parameetrit, millest ühe tokeni töötlemisel aktiveerub 18 miljardit, kuni miljoni tokeni kontekst ning teksti, piltide, video ja failide sisend.
- Mudelikaalud avaldati Hugging Face'is MIT-litsentsiga ning Z.ai API baashind on 0,15 dollarit miljoni sisend- ja 0,50 dollarit miljoni väljundtokeni eest.
- Artificial Analysis andis mudelile intelligentsusindeksis 57 punkti, kuid mõõtis suuremat väljundmahtu ja aeglasemat genereerimist kui võrreldavate avatud kaaludega mudelite mediaan.
Z.ai avaldas 26. augustil GLM-5.3-Flashi ja lõpetas kuus päeva kestnud Ox Alpha anonüümse testi. OpenRouterisse 20. augustil ilmunud tasuta mudeli operaator oli seni avaldamata; nüüd kinnitas Z.ai, et tegu oli GLM-seeria uue mudeli väljalaske-eelse prooviga.
Nimeline väljalase lisab info, mida Ox Alpha kasutajal varem ei olnud: arendaja, arhitektuur, mudelikaalud, MIT-litsents, ametlik API-hind ja juurutusjuhised. Seetõttu on tegu varasema Ox Alpha uudise sisulise jätkuga, mitte sama anonüümse teenuse uue nime all ümberjutustamisega.
GLM-5.3-Flash on Z.ai esimene GLM-5 seeria natiivselt multimodaalne mudel. See töötleb teksti, pilte, videot ja faile ning väljastab teksti. Kuni miljoni tokeni kontekst võib mahutada suure koodihoidla või dokumendikogumi, kuid konteksti ülempiir ei tõesta, et mudel kasutab kogu sisendit ühtlaselt täpselt.
320 miljardist parameetrist töötab tokeni kohta 18 miljardit
Mudel kasutab ekspertide segu arhitektuuri: kõiki 320 miljardit parameetrit ei rakendata iga tokeni puhul. Z.ai järgi aktiveerub ühe tokeni töötlemisel 18 miljardit parameetrit. See vähendab arvutust võrreldes sama suure tiheda mudeliga, kuid kogu kaalude komplekt peab endiselt mälus või kiiresti kättesaadav olema.
GLM-5.3-Flash ühendab hõreda ja lineaarse attention'i. Z.ai väidab, et võrreldes suurema GLM-5.3-ga väheneb attention'i arvutus ligikaudu kolm korda ja KV-vahemälu suurus 4,44 korda. Need on arhitektuuri põhjal tehtud ettevõtte võrdlused, mitte sõltumatu mõõtmine konkreetses Eesti pilve- või kohalikus taristus.
Avatud kaalud annavad võimaluse väiteid korrata, mudelit oma andmekeskuses käitada ja kontrollida, milline andmeliiklus väljub organisatsioonist. See ei muuda isemajutust väikeseks. 320 miljardi parameetriga kaalud, pikk kontekst ja multimodaalne sisend nõuavad mitme suure mälumahuga kiirendi, kiire ühenduse ning optimeeritud käitusmootori kombinatsiooni.
Z.ai mudelikaart nimetab toetatud teenindusraamistikena SGLangi, vLLM-i, TokenSpeedi ja KTransformersit. Tehniline kättesaadavus ei võrdu tootmisvalmidusega: juurutaja peab mõõtma mälu, läbilaskevõimet, esimese tokeni latentsust, samaaegseid kasutajaid ja mudeliversiooni uuendamise kulu.
MIT-litsents eemaldab suure osa ärilisest ebakindlusest
Hugging Face'i mudelikaart tähistab kaalud MIT-litsentsiga. See on ärikasutuse ja tuletatud tööde jaoks lubavam kui paljude „avatud“ mudelite eritellimusel litsentsid, mis seavad kasutajate või tulu piire. Organisatsioon peab siiski kontrollima mudeliga kasutatavate andmete, käituskoodi ja tuletatud komponentide eraldi õigusi.
Anonüümse Ox Alpha ajal oli teenuse praktiline risk päritolu ja andmekäitluse ebaselgus. OpenRouter märkis, et operaator säilitas päringud ja vastused, kuigi ei kasutanud neid treenimiseks. Kaalude avaldamine võimaldab nüüd valida teise hostija või isemajutuse, kuid ei muuda tagasiulatuvalt varasema tasuta prooviperioodi andmekäitlust.
Nime avaldamine parandab ka tarneahela dokumenteerimist. Ettevõte saab fikseerida mudeli päritolu, versiooni, kontrollsumma, litsentsi ja käitusraamistiku. See on oluline nii turvaaudiitides kui mudeli tulemuste kordamisel.
Tokenihind on madal, ülesande kogukulu mitte tingimata
Z.ai API baashind on Artificial Analysise järgi 0,15 dollarit miljoni sisendtokeni ja 0,50 dollarit miljoni väljundtokeni eest. Vahemälust loetud sisend maksab vähem. Kampaaniad, OpenRouteri hind ja teiste hostijate teenustasud võivad erineda, mistõttu tuleb hinnavõrdluses fikseerida teenusepakkuja ning kuupäev.
Odav token võib olla petlik, kui mudel kasutab vastamiseks rohkem tokeneid või vajab rohkem parandusringe. Artificial Analysise intelligentsusindeksi jooksus genereeris GLM-5.3-Flash 150 miljonit väljundtokenit, samas kui võrreldavate mudelite mediaan oli 110 miljonit. Kogu indeksi käitamine maksis mõõtmise järgi 138,02 dollarit.
Sama allikas mõõtis Z.ai API-l ligikaudu 50 väljundtokenit sekundis, võrreldava avatud kaaludega suurusklassi mediaan oli umbes 67. Esimese tokeni aeg oli konkurentsivõimeline, kuid pikk ja jutukas väljund venitab ülesande lõpuaega. Agenditöös liitub see iga tööriistakutse ning parandusringiga.
Õige ühik on seetõttu õnnestunud ülesanne. Kodeerimistestis tuleks mõõta esimesel katsel läbitud testid, inimese parandusaeg, tokenikulu, tööriistakutsete arv ja kogu kestus. Dokumenditöös lisanduvad faktivead, viidete jälgitavus ja vormingu parandamine.
57 punkti on tugev signaal, mitte üldine kvaliteeditempel
Artificial Analysise 57-punktiline indeks asetab GLM-5.3-Flashi nende mõõtmises suurte avatud kaaludega mudelite seas kõrgele. Indeks koondab üheksa hindamist, sealhulgas kodeerimise, teadusülesanded, teadmised ja pika konteksti. See ei ennusta iga ettevõtte töövoogu sama hästi.
Z.ai enda tabelites ületab mudel GLM-5.2 mitmes kodeerimis- ja agenditestides ning läheneb mõnes katses Claude Opus 4.8-le. Võrdlused sõltuvad agentide raamistikust, ajapiirist, kontekstist, temperatuurist ja kohtunikmudelist; ühe tabeli põhjal ei saa väita üldist paremust.
Praktiline eelis on see, et kaale saab nüüd sõltumatult testida. Arendaja saab käitada sama kontrollpunkti oma ülesannetel, valida range väljundipiiri ja võrrelda API-d isemajutusega. Ox Alpha anonüümses faasis oli võimalik mõõta ainult teenuse käitumist, mitte kontrollida mudeli täpset versiooni või juurutust.
Eesti ettevõte peaks võrdlema API-d ja isemajutust eraldi
Eesti organisatsioonile annab MIT-litsentsiga mudel täiendava valiku andmeresidentsuse ja tarnijasõltuvuse juhtimiseks. Kaale saab põhimõtteliselt käitada Euroopa pilves või oma taristus. Mudeli päritolu, turvaaudit, käituspakettide tarneahel ja logimine vajavad siiski eraldi hindamist.
Väikese ja ebaühtlase päringumahu puhul on API tõenäoliselt lihtsam lähtepunkt. Püsiva suure koormuse, tundlike andmete või põhjaliku kohandamise korral võib isemajutus muutuda põhjendatuks, kuid siis tuleb tokenihinna asemel arvutada kiirendite kasutusaste, elektrikulu, töökindlus, haldus ja uuendused.
Mõistlik piloot kasutab kolme päris ülesandeklassi: koodi muutmine testidega, pikkade dokumentide analüüs ja visuaalse sisendiga töövoog. Iga ülesande puhul tuleks võrrelda vähemalt üht kinnist ja üht teist avatud kaaludega mudelit samade õiguste, ajapiiri ja kvaliteedikriteeriumidega.
Korduma kippuvad küsimused
Mis seos on GLM-5.3-Flashil ja Ox Alphal?
Z.ai kinnitas, et testis GLM-5.3-Flashi enne nimelist väljalaset OpenRouteris ja OpenCode'is Ox Alpha nime all. 26. augusti väljalase avaldas mudeli tegeliku päritolu, arhitektuuri, hinna, kaalud ja litsentsi.
Kui suur on GLM-5.3-Flash?
Mudelil on kokku 320 miljardit parameetrit, millest ühe tokeni töötlemisel aktiveerub 18 miljardit. Hõre arhitektuur vähendab arvutust, kuid kogu mudeli majutamine nõuab endiselt suure mälumahuga taristut.
Kas mudelikaalud on avalikud?
Jah. Z.ai avaldas kaalud Hugging Face'is MIT-litsentsiga ning kirjeldab käitamist SGLangi, vLLM-i, TokenSpeedi ja KTransformersi abil.
Kui palju Z.ai API maksab?
Baashind on 0,15 dollarit miljoni sisendtokeni ja 0,50 dollarit miljoni väljundtokeni eest. Kampaaniad ning teiste teenusepakkujate hinnad võivad erineda.
Kas miljoni tokeni kontekst tähendab, et mudel loeb kogu koodihoidlat veatult?
Ei. See on sisendi tehniline ülempiir, mitte garantii, et mudel leiab pika konteksti igast osast õige info või seostab seda veatult. Pika dokumendi ja koodihoidla täpsust tuleb eraldi testida.
Mida näitas Artificial Analysis?
Mudel sai intelligentsusindeksis 57 punkti, kuid genereeris testis rohkem väljundtokeneid ja oli väljundkiiruselt võrreldavate avatud mudelite mediaanist aeglasem. Tulemus toetab võimekuse väidet, kuid näitab, miks tokenihind üksi ei kirjelda ülesande kulu.
Kuidas mudelit ettevõttes võrrelda?
Kasutage samu päris ülesandeid, õigusi, ajapiire ja kvaliteedikriteeriume. Mõõtke õnnestumise määra, tokenikulu, tööriistakutseid, parandusaega, lõpuaega ning API või isemajutuse kogu elutsükli kulu.
Allikad
- 01
- 02
- 03
Artificial Analysis
Artificial Analysis, „GLM-5.3-Flash - Intelligence, Performance & Price Analysis“, vaadatud 27. augustil 2026
artificialanalysis.ai(avaneb uuel vahelehel) - 04
SiliconANGLE
SiliconANGLE, „Z.ai open-sources ‘Ox Alpha’ model as GLM-5.3-Flash“, 26. august 2026
siliconangle.com(avaneb uuel vahelehel)
Saa järgmine AI-RADAR postkasti
Kui järgmine praktiline AI-signaal või tööriistamuutus avaldatakse, saad selle otse e-postile.
Arutelu
0 kommentaari
Seotud teemad AI-RADARis

OpenRouterisse ilmus anonüümse operaatori tasuta Ox Alpha mudel
Ox Alpha pakub tasuta miljoni tokeni konteksti ja tööriistakutseid, kuid anonüümne operaator säilitab päringud ning vastused. Tundlikku koodi või isikuandmeid ei tasu saata.
Kimi K3 mudelikaalud jõudsid avalikkuse ette, kuid isemajutus nõuab andmekeskuse taristut
Moonshot AI avaldas Kimi K3 mudelikaalud. 2,8 triljoni parameetriga mudelit saab ise käitada, kuid selle mälu- ja taristukulu jääb väga suureks.

Meta Muse Glimmer toob tehisaruagendi ühe graafikakaardiga arvutisse
Meta avaldas Muse Glimmeri kohalike agentide jaoks. Ühe graafikakaardi nõue vähendab pilvekulu, kuid sõltumatud jõudlustestid alles puuduvad.