Kuvittele palvelinpiiri, joka ei ainoastaan aja mallia, vaan seuraa hienovaraisesti sen toimintatapaa. Googlen insinöörit rakentavat hiljaisesti juuri tällaista: Frozen v2 -koodinimellä kulkevaa palvelinohjainta, joka upottaa osia Geminin arkkitehtuurista piisiruksiin tavoitellen radikaalisti parempaa energiatehokkuutta ja alhaisempaa latenssia.
Tiedot perustuvat The Informationin raporttiin, jossa viitataan kahteen sisäpiiriläiseen. Väite on huomattava: Frozen v2 voisi käsitellä kuusi–kymmenen kertaa enemmän tokeneita wattia kohden kuin Googlen uusimmat tensorinkäsittelyyksiköt. Tavoitevuosi on 2028. Motivaatiota ei tarvitse etsiä kaukaa, kun pilvipalveluiden kysyntä ylittää kapasiteetin; Google Cloudin on raporttien mukaan täytynyt kieltäytyä joistakin asiakastilauksista AI-laskennan ahtauden vuoksi.
Upotettu arkkitehtuuri sääntöjen sijaan
Perinteiset TPU:t ja GPU:t ovat yleistyökaluja. Malli ladataan, ja laitteisto tekee monia ajonaikaisia päätöksiä, kuten miten dataa siirretään, mitkä operaatiot ajoitetaan ja milloin muistia haetaan. Tämä joustavuus on voimakas etu, mutta siihen liittyy ylimääräistä kustannusta. Frozen v2 valitsee toisen tien: se kiinnittää tietyt Gemini-spesifiset päätökset transistoritason logiikkaan. Tuloksena on vähemmän suoritusvaiheita ja vähemmän tietojen siirtoa jokaista pyyntöä kohti. Vähemmän liikettä. Vähemmän ylikuormitusta. Alhaisempi latenssi. Uudet reaaliaikaiset käyttötapaukset muuttuvat mahdollisiksi.

Taustalla oli vieläkin rohkeampi ajatus. Varhaiset Jeff Deanin johtamat Frozen-suunnitelmat yrittivät raporttien mukaan kovakoodata mallipainot suoraan piisiruihin. Se olisi radikaali optimointi, mutta myös nopeasti vanhentuva: tietyyn malliversioon sidotulla piirillä on hyvin lyhyt käyttöikä. Google löysi kompromissin. Frozen v2 upottaa arkkitehtuurin rungon mutta pitää painot päivitettävänä, jotta sama piiri voi palvella useita Gemini-julkaisuja niin kauan kuin ne noudattavat samanlaisia arkkitehtuurimalleja.
Tämä lähestymistapa voisi lyhentää vasteaikoja niin, että avautuu uusia luokkia interaktiivisia ja alhaisen latenssin AI-sovelluksia.
Google ei aio korvata TPU-kantaansa Frozen v2:lla. Ajattele sitä kokeellisena kehityslinjana, joka kulkee rinnakkain TPU-tuotannon kanssa, eräänlaisena kokeiluympäristönä erikoistetummalle piiliratkaisulle samalla kun mallit vakiintuvat. TPU-tuotteen tiekartta erotti äskettäin koulutuksen ja päättelyn tarpeet, kun kahdeksannen sukupolven sirut julkistettiin Cloud Next -tapahtumassa huhtikuussa. Frozen v2 -hanke on pienimuotoisempi; Google ei suunnittele massatuotantoon samalla tasolla kuin TPU:ita.
Frozen v2:n odotettu saapuminen ajoittuu myös muiden alan siirtojen kanssa. Google on raporttien mukaan sopinut Intelin kanssa yli kolmen miljoonan TPU-piirin paketoinnista vuoteen 2028 mennessä. Samalla startupit ja kilpailijat tutkivat jo mallitietoista piiriarkkitehtuuria. Torontolainen Taalas lanseerasi HC1-piirinsä yhdistettynä Llama 3.1 8B -malliin ja kertoo saavuttavansa 17 000 tokenia sekunnissa ilman paketissa olevaa HBM-muistia. Startup keräsi noin 186 miljoonaa euroa rahoitusta. Viime vuonna Nvidia solmi teknologiakäyttöoikeussopimuksen Groqin kanssa arvoltaan noin 18,6 miljardia euroa, mikä osoittaa, että markkinat näkevät suuren arvon mallikäyttäytymisen ja laitteiston yhdistämisessä.
On kompromisseja. Arkkitehtuurin upottaminen vähentää eräitä joustavuuden muotoja. Se suosii käyttötapauksia, joissa malliperheet pysyvät ajan saatossa yhtenäisinä. Se myös muuttaa tuotteen elinkaarta: mallin arkkitehtuurin ympärille suunniteltu piiri vaatii perustelun ennustettavan suunnittelustabiilisuuden ja käyttöönoton laajuuden avulla. Tämä selittää Googlen varovaisen kannan. Frozen v2 on kokeellinen; kaikki kokeilut eivät muutu tuotteiksi.
Tähän mennessä Google ei ole vahvistanut Frozen v2:ta julkisesti. Yrityksen edustaja muistutti The Informationille, että monet sisäiset projektit eivät koskaan päädy tuotantoon. Silti perusajatus, siirtää osa mallilogiikasta piiriin energiansäästön ja viiveen pienentämisen vuoksi, on siirtynyt akateemisesta uteliaisuudesta kilpailustrategiaksi. Odota, että yhä useammat yritykset kokeilevat samanlaisia yhdistelmiä mallitietoista laitteistoa ja päivitettäviä painoja, kun tehokkaan ja alhaisen latenssin AI:n kysyntä jatkaa kasvuaan.





Keskustelu
Jätä kommentti
Kommentit
Ei vielä kommentteja. Ole ensimmäinen.