Buildrya
Tagasi AI-RADARisse
Valgustatud Nvidia logo ettevõtte messialal.
Mudelid7 min lugemistKristjan Krimm

Nvidia paneb odavama mudeli agentide rutiinitööd tegema

Nvidia avaldas Nemotron 3.5 Lightningu ja NeMo Switchyardi, mis suunab agendi alamülesanded hinna, kiiruse ning kvaliteedi järgi eri mudelitele.

FacebookXLinkedIn

Lühidalt

  • Nvidia avaldas 11. augustil avatud kaaludega 30 miljardi parameetriga Nemotron 3.5 Lightningu, mis on mõeldud agentide korduvate alamülesannete täitmiseks.
  • Koos mudeliga avaldatud avatud lähtekoodiga NeMo Switchyard valib iga tööetapi jaoks mudeli hinna, kiiruse ja kvaliteedi alusel.
  • Nvidia enda testide järgi võib Lightning olla võrreldavatest mudelitest kuni neli korda kiirem ning ruutimine vähendada töövoo kulu ligikaudu kolmandikuni.
  • Tulemused ei ole veel laialt sõltumatult korratud ning Nvidia dokumentatsioon kirjeldab praegust NeMo Relay ühendust varajase ligipääsu lahendusena.

Nvidia avaldas 11. augustil Nemotron 3.5 Lightningu ja NeMo Switchyardi, mille ühine eesmärk on lõpetada kõige kallima mudeli kasutamine tehisaruagendi igas tööetapis. Nemotron 3.5 Lightning on 30 miljardi parameetriga avatud kaaludega mixture-of-experts-mudel ehk hõre eksperdimudel, mis rakendab ühe vastuse loomiseks vaid osa oma võrgust.

NeMo Switchyard on avatud lähtekoodiga mudeliruuter. See hindab agendi iga sammu ning suunab lihtsama töö odavamale või kiiremale mudelile ja keerulisema ülesande võimekamale mudelile. Ühes töövoos võivad olla Nvidia enda mudelid, teised avatud mudelid ja suletud API-teenused.

Uudise keskne lubadus on majanduslik, mitte üksnes tehniline. Agent kulutab palju tokeneid tööriistakutsetele, väljundi vormistamisele, kontrollidele ja muudele korduvatele sammudele. Kui kõiki neid täidab kõige kallim mudel, võib agent olla usaldusväärne, kuid tarbetult kulukas.

Nemotron 3.5 Lightning on agendi täitmismudel

Nvidia positsioneerib Lightningu suurema agentarhitektuuri täitmiskihina. Sobivate näidetena nimetab ettevõte koodi ülevaatamist, turvahäirete analüüsi ja tööriistade kasutamist. Mudeli roll ei ole tingimata kogu ülesande planeerimine, vaid hästi piiritletud alamülesande kiire lõpetamine.

Hõreda eksperdimudeli mõte on vähendada ühe tokeni loomiseks vajalikku arvutust. Mudelis on palju eri osadele spetsialiseerunud alamvõrke, kuid iga sisendi puhul aktiveeritakse neist vaid valik. Parameetrite koguarv kirjeldab mudeli mahtu, mitte iga vastuse tegelikku arvutuskoormust.

Avatud kaalud võimaldavad organisatsioonil mudelit oma taristus käitada ja seadistust kontrollida. Mõiste ei tähenda automaatselt, et treeningandmed, kogu õpetusprotsess ja litsents on samas ulatuses avatud kui tavapärases avatud lähtekoodiga tarkvaras. Kasutaja peab seetõttu kontrollima eraldi nii kaalude litsentsi, käituskeskkonda kui ka vajalikke Nvidia komponente.

Lightning võib olla mõistlik siis, kui töö on korduv, mõõdetav ja madala tagajärjega. Ebamäärase planeerimise, ebatavalise vea või õigusliku otsuse puhul võib suurema mudeli lisakulu olla odavam kui nõrga vastuse parandamine.

NeMo Switchyard teeb mudelivalikust taristukihi

Tavalises rakenduses valib arendaja mudeli enne päringu saatmist. Switchyard viib selle otsuse töövoo sisse: ruuter saab valida mudeli iga sammu jaoks eraldi. Nii võib üks agent kasutada planeerimiseks suurt mudelit, andmete vormistamiseks väiksemat kohalikku mudelit ja erandliku juhtumi jaoks kolmandat teenust.

Ruuteri kvaliteet määrab, kas sääst on päris. Liiga konservatiivne reegel saadab peaaegu kõik ülesanded kallile mudelile ning majanduslik võit jääb väikeseks. Liiga agressiivne reegel valib nõrga mudeli ka keerulises olukorras, mis võib põhjustada uue katse, vigase tööriistakutse või inimese parandusringi.

Nvidia dokumentatsioon näitab, et praegune NeMo Relay ühendus on varajase ligipääsu funktsioon. Olemasolev pistikprogramm on märgitud asendamisele minevaks ning selle asemele kavandatakse Switchyardi enda ühendust. See ei tähenda, et Switchyard oleks lõpetatud, kuid tootmiskeskkonna kasutaja peab arvestama muutuva liidese ja eraldi töötava otsustus-API-ga.

Turvalisuse jaoks on tähtis teenusepiir. Nvidia kirjelduse järgi valib Switchyard sihtmudeli, kuid NeMo Relay hoiab teenusepakkujate võtmeid, kontrollib otsust, teeb päringu ning haldab varuvalikuid ja jälgitavust. Ruuterile ei ole vaja anda kõiki mudeliteenuste salasõnu.

Nvidia kuluväited vajavad kogukulu mõõtmist

Nvidia teatel oli Lightningu väljundikiirus võrreldavate mudelite omast kuni neli korda suurem. Switchyard vähendas ettevõtte katsetes töövoo maksumuse ligikaudu kolmandikuni võrreldes ühe suure mudeli järjepideva kasutamisega. Need on tootja mõõtmised ning tulemus sõltub riistvarast, ülesannetest, mudelihindadest ja kvaliteedilävendist.

Partneri näide näitab kompromissi selgemalt. Nvidia avaldatud andmete järgi saavutas LangChain 74-protsendise kulusäästu, kuid täpsus langes kuue protsendipunkti võrra. See võib olla vastuvõetav sisemise abivahendi puhul, kuid lubamatu töövoos, kus iga vale tulemus vajab kallist uurimist või mõjutab klienti.

Õige mõõdik pole seetõttu hind ühe tokeni või ühe sammu kohta. Ettevõte peab mõõtma valminud ja kontrollitud ülesande kogukulu: mudelitasud, viivitus, korduskatsed, tööriistade kasutus ning inimese parandusaeg. Sääst muutub sisuliseks alles siis, kui lõpptulemuse kvaliteet jääb kokkulepitud piiridesse.

Võrdluskatse peab kasutama päris ülesandeid ja sama hindamisreeglit. Iga ruutimisotsuse juurde tasub salvestada valitud mudel, otsuse põhjus, mudeli väljund, hilisem kontroll ning võimalik ümbersuunamine. Ilma selle logita ei saa eristada mudeliviga ruuteri veast.

Eesti ettevõttele sobib piiratud ruutimiskatse

Eesti tarkvarafirma või avaliku sektori arendustiim saab ruutimist katsetada madala riskiga töös: koodi liigitamine, vormingu teisendamine või sisemise dokumendi esmase mustandi tegemine. Esimene eesmärk ei peaks olema maksimaalne sääst, vaid teada saada, milliste ülesannete raskust ruuter järjekindlalt õigesti hindab.

Kohalik avatud mudel võib vähendada tundlike andmete saatmist välisele API-le, kuid ruuter ise ei lahenda andmekaitset. Logidesse võivad jääda sisendid, mudelivalikud ja väljundid. Organisatsioon peab määrama, millist infot tohib millisele mudelile saata, kus otsustusajalugu säilitatakse ning kellel on sellele ligipääs.

Euroopa Liidu vaates jääb vastutus kasutusjuhu omanikule. Mitme mudeli kasutamine ei muuda kõrge mõjuga otsust madala riskiga otsuseks ning eri teenusepakkujad võivad lisada eraldi andmetöötlustingimused. Arhitektuur peab näitama, milline mudel tegi millise sammu ja kuidas inimene sai tulemust kontrollida.

Ruuter vajab enne kasutuselevõttu varirežiimi

Turvaline katse algab varirežiimist, kus Switchyard teeb mudelivaliku, kuid päris ülesande täidab endiselt senine kontrollitud mudel. Meeskond saab võrrelda hüpoteetilist säästu ja kvaliteeti ilma, et ruuteri otsus mõjutaks kasutajat. Alles piisava testimahu järel tasub lubada nõrgemal mudelil täita piiratud ülesandeklasse.

Kasutuselevõtt peaks toimuma ülesande, mitte kogu agendi kaupa. Näiteks võib vormingu kontrolli suunata Lightningule, kuid turvapoliitika muudatuse jätta suurele mudelile ja inimesele. Iga laiendus vajab oma kvaliteedilävendit ning automaatset tagasiteed, kui vea- või korduskatsete määr kasvab.

Hinna muutumine võib ruutimisreegli kiiresti vanandada. Kui teenusepakkuja langetab suure mudeli hinda või kohalik käitus kallineb, ei pruugi eilne valik enam säästa. Ruuter peab seetõttu arvestama ajakohast hinnakirja ja meeskond peab majanduskatset regulaarselt kordama. Võrdlusse tuleb lisada ka kohapealse riistvara elektri-, hooldus- ja amortisatsioonikulu ning kasutamata võimsuse hind.

Kokkuvõte

Nemotron 3.5 Lightning ja NeMo Switchyard muudavad mudeli valiku agendi püsivaks taristuotsuseks. Nvidia pakub loogilise tööjaotuse: keerukas planeerimine jääb suurele mudelile, rutiinsed sammud täidab kiirem ja odavam mudel.

Tõestamata on, kui suur on sääst eri organisatsioonide päris töövoogudes pärast vigade, korduskatsete ja inimkontrolli arvestamist. Jälgida tasub sõltumatuid võrdlusi, Switchyardi liidese küpsemist ning seda, kas ruutimislogi võimaldab iga vale otsuse hiljem täpselt taastada.

Korduma kippuvad küsimused

Mis on Nvidia Nemotron 3.5 Lightning?

Nemotron 3.5 Lightning on Nvidia 11. augustil 2026 avaldatud 30 miljardi parameetriga avatud kaaludega hõre eksperdimudel. Nvidia kavandas selle agentide korduvate alamülesannete kiireks täitmiseks.

Mis on NeMo Switchyard?

NeMo Switchyard on avatud lähtekoodiga mudeliruuter, mis valib agenttöövoo igale sammule sobiva mudeli. Valik saab arvestada kvaliteeti, hinda ja kiirust ning hõlmata nii avatud kui suletud mudeleid.

Kui palju võib mudeliruutimine säästa?

Nvidia enda testides vähenes Switchyardiga töövoo kulu ligikaudu kolmandikuni. LangChaini näites oli sääst 74 protsenti, kuid täpsus langes kuue protsendipunkti võrra, mistõttu ei saa kulunumbrit kvaliteedist lahutada.

Kas Nvidia kiirus- ja kulutulemused on sõltumatult kinnitatud?

Laialdast sõltumatut kinnitust veel ei ole. Avaldatud võidud põhinevad peamiselt Nvidia ja tema partnerite testidel ning sõltuvad ülesandest, riistvarast, hindadest ja hindamismetoodikast.

Mis on mudeliruuteri suurim risk?

Suurim risk on liiga nõrga mudeli valimine keeruka või kõrge mõjuga ülesande jaoks. Näiliselt odav samm võib siis põhjustada vigase tööriistakutse, korduskatse või kuluka inimese sekkumise.

Kas Switchyard on valmis stabiilseks tootmiskasutuseks?

Switchyard on avaldatud, kuid Nvidia kirjeldab praegust NeMo Relay ühendust varajase ligipääsu funktsioonina. Olemasolev pistikprogramm asendatakse kavandatava uue ühendusega, seega tuleb arvestada liidese muutumise ja migratsiooniga.

Mida tähendab lahendus Eesti või EL-i ettevõttele?

Eesti ja EL-i ettevõte võib ruutimisega vähendada API-kulu ning hoida osa tööst kohalikus mudelis. Organisatsioon peab siiski logima mudelivalikud, määrama andmete saatmise reeglid ja säilitama inimese kontrolli kõrge mõjuga otsuste üle.

Allikad

  1. 01

    Nvidia

    Nvidia, „NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI“, 11. august 2026

    blogs.nvidia.com(avaneb uuel vahelehel)
  2. 02

    Nvidia Developer

    Nvidia Developer, „Route AI Agents Across Models with NVIDIA NeMo Switchyard“, 11. august 2026

    developer.nvidia.com(avaneb uuel vahelehel)
  3. 03

    Nvidia Documentation

    Nvidia Documentation, „Switchyard (Deprecated) | NVIDIA NeMo Relay“, vaadatud 12. augustil 2026

    docs.nvidia.com(avaneb uuel vahelehel)
  4. 04

    The Wall Street Journal

    The Wall Street Journal, „Nvidia Releases New Open Model“, 11. august 2026

    wsj.com(avaneb uuel vahelehel)
MärksõnadNvidiaNemotron 3.5 LightningNeMo Switchyardmudeliruutertehisaruagendidavatud kaaludmixture of experts

Jaga artiklit

Saada see lugu kolleegile või salvesta hilisemaks.

AI-RADARi uudiskiri

Saa järgmine AI-RADAR postkasti

Kui järgmine praktiline AI-signaal või tööriistamuutus avaldatakse, saad selle otse e-postile.

Arutelu

0 kommentaari

0/1500

Laen kommentaare...
Loe edasi

Seotud teemad AI-RADARis

Kõik uudised