Buildrya
Tagasi AI-RADARisse
Soovituslik skeem GPU välismälust liigutatavate mudelikaalude ja Taalase mudelipõhise kiibi võrdlusest.
Taristu7 min lugemistKristjan Krimm

AMD ostab Taalase ja panustab mudelipõhistele inferentsikiipidele

AMD sõlmis kokkuleppe Taalase ostmiseks. Mudeli kaalude viimine kiibi lähedale võib vähendada inferentsikulu, kuid seob riistvara ühe mudeliga.

FacebookXLinkedIn

Lühidalt

  • AMD sõlmis 6. augustil siduva kokkuleppe Toronto kiibi-idufirma Taalase omandamiseks.
  • Taalas kohandab räni konkreetse tehisarumudeli jaoks, et vähendada mudelikaalude liigutamist välismälust arvutusüksustesse.
  • Lahendus võib parandada kiirust ja energiakasutust suure püsikoormuse korral, kuid mudeli oluline muutmine võib nõuda uut kiibiversiooni.
  • AMD ei avaldanud tehingu hinda, regulatiivset lõpetamisgraafikut ega esimese ühise toote kuupäeva.

AMD teatas 6. augustil, et ostab Toronto idufirma Taalase, mis arendab konkreetse tehisarumudeli jaoks kohandatud inferentsikiipe. Osapooled sõlmisid siduva omandamiskokkuleppe, kuid tehingu väärtus ja lõpetamise täpne aeg jäid avaldamata.

Taalase põhiidee erineb universaalsest graafikaprotsessorist. Suure keelemudeli kaalud paigutatakse võimalikult lähedale arvutusahelatele ning osa mudeli struktuurist seotakse füüsilise kiibiga. Nii väheneb vajadus tõsta suuri andmemahte suure läbilaskevõimega HBM-mälust pidevalt arvutusüksustesse.

AMD kavatseb Taalase tehnoloogia siduda Instincti kiirendite, EPYC protsessorite, Heliose rack-süsteemide ja ROCm-i tarkvaraga. See ei tähenda, et Taalase kiip asendaks kogu GPU-valiku. Tõenäolisem on tööjaotus, kus universaalne riistvara teenindab kiiresti muutuvaid mudeleid ning erikiip suure mahuga stabiilset inferentsi.

Mudeli kaalud muudavad mälu pudelikaelaks

Inferents on juba treenitud mudeli kasutamine vastuse, ennustuse või tegevuse loomiseks. Iga sammu ajal peab kiip lugema mudeli kaale ja vahetulemusi. Kui kaalud asuvad välises mälus, kulub arvestatav osa ajast ja energiast nende liigutamisele, mitte matemaatiliste tehete tegemisele.

GPU tugevus on paindlikkus. Sama kiirendi saab käitada eri arhitektuure, täpsusformaate ja kiiresti muutuvaid mudeleid. Selle eest makstakse üldotstarbeliste juhtplokkide, suure mälusüsteemi ja tarkvarakihi keerukusega. Väga suure ning korduva koormuse korral võib osa sellest paindlikkusest olla tarbetu kulu.

Taalas püüab vahetada paindlikkuse efektiivsuse vastu. Kui andmevood ja kaalud on räni ülesehitusega tihedalt seotud, saab eemaldada üldotstarbelisi osi ja lühendada andmete teed. Ettevõtte jõudlus- ja kulueelised on siiski Taalase enda väited; sõltumatuid suure mahu tootmiskeskkonna mõõtmisi pole omandamisteates avaldatud.

Mudeli kiibile viimine ei tähenda tingimata, et iga üksik kaal oleks muutumatu transistor. Teostus võib kasutada kiibilähedast mälu, spetsiaalseid andmeradu ja mudeli struktuurile kohandatud arvutusplokke. Hankija jaoks on olulisem praktiline küsimus: kui palju saab mudelit tarkvaraliselt uuendada enne, kui jõudluseelis kaob või vajatakse uut räni.

Suurim risk on mudeli vananemine

Kiibi projekteerimine, tootmine ja kvalifitseerimine kestab kauem kui tavapärane mudeliuuendus. Kui mudelilabor muudab arhitektuuri, konteksti, eksperdikihti või kaalude suurust enne kiibi valmimist, võib spetsialiseeritud disain kaotada osa eelisest. Uue maskikomplekti ja tootmistsükli hind muudab eksimuse kalliks.

Seetõttu sobib mudelipõhine kiip kõige paremini koormusele, mille maht on suur ja mudel piisavalt stabiilne. Näiteks tasuta assistendi vaikemudel, otsingu järjestaja või suur ettevõttesisene klassifitseerija võib teenindada miljardeid sarnaseid päringuid. Väikese mahu või iganädalaselt vahetuva mudeli puhul on universaalne GPU tõenäoliselt mõistlikum.

Ka mudeli turvalisus ja parandused vajavad lahendust. Tarkvaramudelit saab vea korral uuesti treenida või kaalud kiiresti välja vahetada. Füüsilise kiibiga tihedalt seotud mudel nõuab piisavat muudetavust, varukihti või uut tootmispartiid. Avalik teade ei kirjelda, kui kiiresti Taalase arhitektuur sellise paranduse kasutusele võtab.

AMD ehitab GPU kõrvale erikihtide portfelli

AMD konkureerib Nvidiaga Instincti GPU-de ja kogu rack-süsteemi tasandil. Taalase ost näitab, et ettevõte ei eelda kõigi inferentsikoormuste jäämist universaalsele kiirendile. Spetsialiseeritud kiip võib töötada Heliose süsteemis GPU kõrval ning võtta üle mudeli kõige korduvama osa.

ROCm-i roll on muuta eririistvara arendajale kasutatavaks. Kui uue kiibi jaoks tuleb kogu mudeliteenus ümber kirjutada, väheneb riistvara säästu väärtus. Kompilaator, käituskeskkond, monitooring ja olemasolevad mudeliserverid peavad suutma töö õigesse seadmesse suunata.

Tehingu hind oleks oluline, et hinnata AMD panuse suurust, kuid seda ei avaldatud. Samuti puudub esimese ühise toote, kliendi või tootmismahu ajakava. Seetõttu kinnitab uudis tehnoloogilise suuna, mitte veel müügivalmis toote konkurentsieelise.

Ettevõte peab võrdlema lõpetatud vastuse hinda

GPU ja mudelipõhise kiibi võrdlus ei tohiks piirduda tippläbilaskevõimega. Mõõta tuleb ühe korrektse vastuse energiat, viivitust eri koormustel, vajalikku partiisuurust, riistvara kasutusastet, veamäära ja tarkvara ülalpidamist. Odav kiip võib muutuda kalliks, kui mudeliuuendus nõuab teenuse ümbertegemist.

Eesti ettevõte tõenäoliselt Taalase kiipi otse ei osta. Mõju jõuab siia pilve- või API-hinna, uute instantsitüüpide ja mudeli versioonipoliitika kaudu. Teenusepakkujalt tasub küsida, kas mudel on vabalt vahetatav, kui pikk on toeperiood ja kuidas parandatakse turvavigu.

Euroopa hanke puhul lisandub tarneahela läbipaistvus. Mudeli, kompilaatori, kiibi, tootja ja pilveoperaatori vastutus peab olema eristatav. Kui üks kiht on seotud konkreetse mudeliga, suureneb tarnijalõksu risk isegi siis, kui ühe päringu hind langeb.

Taalase tehnoloogia võib anda AMD-le uue viisi inferentsi energiakulu vähendada, kuid selle väärtus selgub alles tootmiskiibi, kliendikoormuse ja mudeliuuenduse katses. Jälgida tasub esimese toote ajakava, toetatud mudeleid, sõltumatuid võrdlusteste ning seda, mitu kiibiversiooni vajab üks mudeliperekond aastas.

Spetsialiseerimine vajab selget tasuvuspiiri

Enne erikiibi valimist peab teenusepakkuja arvutama, kui palju päringuid mudel kogu kiibi eluea jooksul teenindab. Prototüübi ja maskide püsikulu jaguneb iga vastuse peale; väikese mahu korral ei korva energiasääst projekteerimise ning tootmise hinda. Suure mahu juures võib sama püsikulu muutuda ühe päringu kohta väikeseks.

Tasuvusmudelisse kuulub ka kapitali ooteaeg. Raha seotakse kiipi enne, kui toode hakkab tulu teenima, ning mudel võib vahepeal vananeda. Pilveoperaator vajab seetõttu pikaajalist nõudlusprognoosi või ankurklienti, kes võtab osa mahuriskist enda kanda.

Tehniline katse peaks kasutama vähemalt kolme koormust: lühike interaktiivne vastus, suure partiiga taustatöö ja pika kontekstiga päring. Üks kiip võib võita läbilaskevõimes, kuid kaotada esimese tokeni viivituses või mälumahus. Mõõtmine peab hõlmama kogu serverit, võrku ja jahutust, mitte ainult räni nimivõimsust.

Avatud liidesed vähendavad investeeringuriski. Kui mudeliserver saab sama API kaudu suunata töö GPU-le või Taalase kiibile, jääb kliendil võimalus koormust ümber jagada. Kui rakendus tuleb siduda ühe suletud kompilaatori ja mudeliformaadiga, peab võimalik hinnavõit katma ka migratsiooni ning väljumise kulu.

Teenuse töökindlus vajab eraldi varuplaani. Mudelipõhise kiibi rikke või tarnepuuduse korral peab koormus saama liikuda GPU-le, isegi kui ühe päringu hind ajutiselt kasvab. Selline ülevoog vähendab erikiibi maksimaalset säästu, kuid kaitseb klienti olukorras, kus spetsialiseeritud tootmispartiid pole kiiresti asendada.

Ka mudeli omanik ja kiibitootja vajavad selget versioonilepingut. Peab olema teada, kui kaua üht kaalude versiooni toetatakse, millised parandused mahuvad olemasolevale kiibile ja kes maksab uue versiooni kvalifitseerimise. Ilma selle kokkuleppeta võib odav inferents tekitada kalli organisatsioonilise vaidluse iga mudeliuuenduse ajal.

Ostuotsus peaks seetõttu sisaldama vähemalt ühe täieliku mudelivahetuse proovi koos ajakulu, katkestuse ja tarkvaramuudatuste mõõtmisega. Alles selline katse näitab spetsialiseerimise tegelikku elutsüklikulu.

Tulemus peab olema võrreldav sama koormuse GPU-põhise varuplaaniga.

Korduma kippuvad küsimused

Mida AMD Taalasega teeb?

AMD sõlmis kokkuleppe Taalase omandamiseks ja kavatseb selle mudelipõhise inferentsitehnoloogia ühendada oma andmekeskuse portfelliga. Tehing pole veel avalikult lõpetatuks kuulutatud.

Mis on mudelipõhine inferentsikiip?

Mudelipõhine inferentsikiip kohandab arvutusahelad ja mälu konkreetse mudeli struktuuri ning kaalude jaoks. Eesmärk on vähendada andmete liigutamist ja ühe vastuse energiakulu.

Miks ei piisa tavalisest GPU-st?

GPU sobib paljude mudelite ja kiiresti muutuva tarkvara jaoks, kuid universaalsus lisab andmeliikumist ning üldotstarbelisi komponente. Suure püsikoormuse korral võib erikiip olla odavam ja energiatõhusam.

Mis on tehnoloogia suurim piirang?

Suurim piirang on vähene paindlikkus mudeli olulise muutmise korral. Uus arhitektuur või kaalude paigutus võib nõuda uut kiibiversiooni ja tootmistsüklit.

Kas Taalase jõudluseelis on sõltumatult kinnitatud?

Avalik omandamisteade ei anna piisavaid sõltumatuid tootmiskeskkonna teste. Taalase jõudlus- ja kulueeliseid tuleb käsitleda ettevõtte väidetena, kuni ilmuvad võrreldavad mõõtmised.

Millal tuleb esimene AMD ja Taalase toode?

Esimese ühise toote kuupäeva pole avaldatud. AMD ei avaldanud ka tehingu hinda ega konkreetset esimest klienti.

Mida tähendab tehing Eesti ettevõttele?

Eesti ettevõttele võib mõju jõuda odavama pilveinferentsi või uute instantsitüüpide kaudu. Hinnavõidu kõrval tuleb hinnata mudeliversiooni tuge ja tarnijalõksu.

Allikad

  1. 01

    AMD

    AMD, „AMD Acquires Taalas to Advance Compute Solutions for Rapidly Growing AI Inference Market“, 6. august 2026

    ir.amd.com(avaneb uuel vahelehel)
  2. 02

    Reuters

    Reuters, „AMD deepens AI inference bet with Taalas deal as chip race heats up“, 6. august 2026

    reuters.com(avaneb uuel vahelehel)
  3. 03

    ServeTheHome

    ServeTheHome, „AMD to Acquire Taalas for Model-Specific AI Inference Chips“, 6. august 2026

    servethehome.com(avaneb uuel vahelehel)
MärksõnadAMDTaalasinferentsAI-kiipASICInstinctROCmpooljuhid

Jaga artiklit

Saada see lugu kolleegile või salvesta hilisemaks.

AI-RADARi uudiskiri

Saa järgmine AI-RADAR postkasti

Kui järgmine praktiline AI-signaal või tööriistamuutus avaldatakse, saad selle otse e-postile.

Arutelu

0 kommentaari

0/1500

Laen kommentaare...
Loe edasi

Seotud teemad AI-RADARis

Kõik uudised