MISTERIOZNI OX ALPHA OTKRIVEN
Kompanija Z.ai zvanično je predstavila GLM-5.3-Flash i potvrdila da se iza misterioznog modela Ox Alpha. Model je od 20. avgusta bio dostupan za besplatno testiranje na platformi OpenRouter, zapravo nalazio njihov novi sistem veštačke inteligencije. Model je objavljen sa otvorenim težinama pod MIT licencom i ima ukupno 320 milijardi parametara. Za obradu svakog tokena aktivno oko 18 milijardi. GLM-5.3-Flash podržava kontekstni prozor od čak 1.048.576 tokena i predstavlja prvi nativno multimodalni model u porodici GLM-5.
Z.ai je model posebno usmerio na programiranje i agentske zadatke, odnosno situacije u kojima AI može da planira i izvršava složene operacije uz korišćenje različitih alata. Kompanija navodi rezultat od 84,3 na Terminal-Bench 2.1 i 63,4 na DeepSWE, tvrdeći da se GLM-5.3-Flash na pojedinim testovima približava ili nadmašuje rezultate modela Claude Opus 4.8. Te rezultate ipak treba posmatrati kao podatke koje je objavio proizvođač. Nezavisna testiranja pokazati koliko su takva poređenja održiva.
VELIKA SNAGA UZ MANJE TROŠKOVE
Posebno je zanimljiva arhitektura modela. Iako poseduje 320 milijardi parametara, tokom obrade pojedinačnog tokena aktivno je približno 18 milijardi. To omogućava efikasnije korišćenje računarskih resursa. Takav pristup je naročito važan kod AI agenata, gde jedan zadatak može zahtevati veliki broj uzastopnih operacija. Veliki kontekstni prozor dodatno omogućava modelu da istovremeno radi sa ogromnom količinom teksta, koda i drugih podataka.
Najveće iznenađenje ipak predstavlja cena. Z.ai navodi da GLM-5.3-Flash košta samo 0,15 dolara za milion ulaznih tokena i 0,50 dolara za milion izlaznih tokena, što je prema kompaniji približno deset puta manje od cene prethodnog modela. Ukoliko se takav odnos cene i performansi potvrdi u široj upotrebi, mogao bi da izvrši dodatni pritisak na konkurentske AI kompanije i ubrza trend pojeftinjenja naprednih modela.
KINESKI ČIPOVI I NOVA AI TRKA
Z.ai je saopštio i da je tokom testiranja modela Ox Alpha koristio kineske AI čipove, uz prijavljeno trostruko poboljšanje performansi u odnosu na početnu referentnu vrednost. Pri 4-bitnoj kvantizaciji, same težine modela zahtevaju približno 160 gigabajta memorije, ne računajući dodatnu memoriju potrebnu za kontekst i izvršavanje. To znači da je, uprkos otvorenim težinama, za njegovo lokalno pokretanje potrebna ozbiljna računarska infrastruktura.
GLM-5.3-Flash tako objedinjuje otvorene težine, multimodalnost, kontekst od više od milion tokena, agentsko programiranje i veoma niske troškove korišćenja. Njegovo pojavljivanje predstavlja još jedan pokazatelj koliko je konkurencija na tržištu veštačke inteligencije postala intenzivna. Ako se rezultati Z.ai potvrde i u nezavisnim testovima, ovaj model mogao bi da bude važan dokaz da se budućnost AI industrije neće određivati samo prema tome ko ima najveći model, već i prema tome ko može da ponudi najveću snagu uz najmanje troškove.