Iedomājieties serveru telpu, pilnu ar silikonu, kur katra mikroshēma apstrādā milzīgu teksta apjomu. Tāds ir tēls, ko Huawei pētniecības grupa piedāvā, paziņojot, ka viņi apmācīja DeepSeek V4-Pro, 1,6 triljonu parametru modeli, izmantojot klasteri, kas veidots ap vismaz tūkstoš Ascend 910C čipiem.
Stāsts šķiet vienkāršs: lokāli ražots mākslīgā intelekta silikons beidzot apstrādā lielu modeļu slodzi. Taču realitāte ir daudzslāņaina. Huawei apgalvo, ka komanda veica pilna parametru atjaunināšanu, proti, tika trenēts katrs svara parametrs modelī, nevis tikai pievienots plāns adaptera slānis, un ka V4-Pro iepriekšējai apmācībai tika apstrādāts milzīgs korpuss, par kuru ziņots, ka pārsniedz 32 triljonus tokenu. Iepriekšēja apmācība veido modeļa pamatspējas; vēlākā smalkā pielāgošana veido uzvedību, izmantojot instrukciju pielāgošanu un drošības saskaņošanu.
Kāpēc tas ir svarīgi? Tāpēc, ka pilna parametru apmācība ir daudz prasīgāka nekā vieglas korekcijas paņēmieni, kas maina tikai nelielu tīkla daļu. Tā prasa pastāvīgu caurlaidspēju, stabilas savienojumu saskarnes un stingru orķestrāciju starp čipiem. Vēsturiskā skatījumā ķīniešu pētniekiem bija grūtības pārvietot smagas apmācību slodzes no Nvidia aparatūras, nesaskaroties ar veiktspējas un savienojumu stabilitātes šaurumiem.

Huawei norāda uz Ascend 910C divkāršās arhitektūras dizainu kā pagrieziena punktu. Neatkarīgi testi no agrākiem DeepSeek eksperimentiem liecināja, ka Ascend mikroshēma varētu nodrošināt aptuveni 60% no Nvidia H100 secināšanas veiktspējas, tomēr tas attiecās uz secināšanas režīmu, nevis liela mēroga sinhronizētu apmācību. Apmācību slodzes atklāj citas vājās vietas: kolektīvā komunikācija, atmiņas pārvaldība un programmatūras briedums kļūst izšķiroši.
Tomēr apgalvojumam ir piezīmes. Pētnieki ziņoja par pilna parametru apmācības pabeigšanu, bet neiesniedza stingrus etalonus: nav sienas pulksteņa laika, nav caurlaidspējas metriku, nav tiešas salīdzināšanas ar H100 klasteriem un nav detalizētas enerģijas vai efektivitātes sadalījuma. Bez šiem skaitļiem paziņojums izklausās tieši tā, kāds tas ir, t.i., iedrošinošs tehnisks sasniegums, taču vēl ne neatkarīgs pierādījums, ka Ascend klasteri atbilst vai pārspēj ierastās alternatīvas vadošajai iepriekšējai apmācībai.
Ir iemesls piesardzībai. Agrākie ziņojumi norādīja, ka mēģinājumi apmācīt citu modeli, R2, uz Huawei silikona saskārās ar nestabilitāti un lēniem čipu savienojumiem. Pāreja no veiksmīgām demonstrācijām secināšanā uz uzticamu, liela mēroga iepriekšēju apmācību ir liels lēciens. Uzņēmumi dažkārt var salikt kopā pietiekami inženierijas, lai pabeigtu vienu palaišanu, bet joprojām trūkt izturības, kas nepieciešama rutīnas modeļu izstrādei mērogā.
Ko tas nozīmē plašākai mākslīgā intelekta ekosistēmai? Ja Huawei apraksts iztur pārbaudi, tas signalizē par Ķīnas mākslīgā intelekta aparatūras konkurētspējas pieaugumu un programmatūras klāsta nobriešanu, kas spēj orķestrēt tūkstošiem čipu lielas apmācību darbus. Ja nē, tas uzsver, ka ažiotāža joprojām apsteidz pārbaudāmu progresu. Katrā gadījumā nākamais solis ir skaidrs: neatkarīgi etaloni un caurspīdīgi darbības dati.
Mēs sekosim šiem skaitļiem. Neatkarīga pārbaude pateiks, vai tas ir patiesi pagrieziena punkts globālajā mākslīgā intelekta infrastruktūrā vai vien ambiciozs koncepcijas pierādījums.



.webp)
Diskusija
Atstāt komentāru
Komentāri
Vēl nav komentāru. Esiet pirmais.