Kuvittele palvelinsali täynnä piirejä, jokainen siru työskentelemässä valtavan tekstimassan parissa. Tämä on kuva, jota Huawein tutkimusryhmä tarjoaa ilmoittaessaan kouluttaneensa DeepSeek V4-Proin, 1,6 biljoonan parametrin mallin, klusterissa, joka perustui vähintään tuhanteen Ascend 910C -siruun.
Tarinan voi kuulla yksinkertaisena: kotimainen tekoälypiiri selviytyy vihdoin suurten mallien tehtävistä. Todellisuus on kuitenkin moniulotteisempi. Huawei kertoo, että tiimi suoritti täysparametriset päivitykset, eli jokainen mallin paino opettettiin sen sijaan, että olisi lisätty vain ohut adapterikerros, ja että V4-Proin esikoulutus käytti huikeaa korpusta, jonka kerrotaan ylittäneen 32 biljoonaa tokenia. Esikoulutus rakentaa mallin ydinkyvykkyydet; myöhempi hienosäätövaihe muovaa käyttäytymistä ohjeistuksen säätämisellä ja turvallisuuslinjauksella.
Miksi sillä on merkitystä? Koska täysparametrinen koulutus vaatii huomattavasti enemmän kuin kevyet tekniikat, jotka muuttavat vain pienen osan verkosta. Se edellyttää jatkuvaa läpivirtausta, vakaita väyläyhteyksiä ja tarkkaa orkestrointia sirujen välillä. Historiallisesti kiinalaiset ryhmät ovat kamppailleet siirtäessään raskaita koulutuskuormia pois Nvidian laitteista törmätessään suorituskyky- ja yhteysvakavuuspullonkauloihin.

Huawei nostaa esiin Ascend 910C:n kaksoissuunnittelun käännekohtana. Aiemmat riippumattomat testit aiemmista DeepSeek-kokeiluista antoivat ymmärtää, että Ascend-osanen voisi tarjota noin 60 % Nvidian H100:n päättelysuorituskyvystä, mutta kyse oli päättelystä, ei laajamittaisesta synkronoidusta koulutuksesta. Koulutuskuormat paljastavat erilaisia heikkouksia: ryhmän välinen viestintä, muistin hallinta ja ohjelmiston kypsyys nousevat ratkaiseviksi tekijöiksi.
Silti väitteessä on varauksia. Tutkijat raportoivat täysparametrisen koulutuksen valmistumisesta, mutta eivät antaneet tiukkoja vertailuarvoja: ei kellotettua aikaa, ei läpivirtauksia, ei suoraa vertailua H100-klustereihin eikä yksityiskohtaista erittelyä tehon tai tehokkuuden osalta. Ilman näitä lukuja ilmoitus kuulostaa juuri siltä kuin on: kannustava tekninen virstanpylväs, mutta ei vielä riippumatonta näyttöä siitä, että Ascend-klusterit vastaavat tai ylittävät vakiintuneita vaihtoehtoja huippuluokan esikoulutuksessa.
Varovaisuuteen on perusteita. Aiemmat raportit kertoivat, että yritykset kouluttaa toista mallia, R2:ta, Huawein piireillä kohtasivat epävakautta ja hitaita sirujen välisiä yhteyksiä. Siirtyminen onnistuneista päättelynäytöksistä luotettavaan laajamittaiseen esikoulutukseen on iso harppaus. Yritykset voivat joskus kasata riittävästi tekniikkaa suorittaakseen yksittäisen ajon, vaikka ne eivät olisikaan saavuttaneet vaadittavaa luotettavuutta rutiininomaiseen mallikehitykseen mittakaavassa.
Joten mikä on laajempi johtopäätös tekoälykentälle? Jos Huawein kertomus kestää tarkastelun, se kertoo kiinalaisen tekoälylaitteiston kasvavasta kilpailukyvystä ja kypsyvästä ohjelmistopinosta, joka pystyy orkestroimaan tuhansien sirujen koulutustöitä. Jos ei, se korostaa sitä, että innostus voi olla edellä todentunutta kehitystä. Joka tapauksessa seuraava askel on selvä: riippumattomat vertailut ja läpinäkyvä ajoaikatieto.
Seuraamme näitä lukuja. Riippumaton varmistus kertoo, onko kyse todellisesta käänteestä globaalissa tekoälyinfrastruktuurissa vai vain kunnianhimoisesta konseptinäytteestä.




Keskustelu
Jätä kommentti
Kommentit
Ei vielä kommentteja. Ole ensimmäinen.