Iedomājieties servera mikroshēmu, kas ne tikai izpilda modeli, bet maigi seko tā darbības plānam. Google inženieri klusi būvē tieši to: servera akseleratoru ar kodu nosaukumu Frozen v2, kas iemontē daļas no Gemini arhitektūras silīcijā, ar mērķi būtiski uzlabot energoefektivitāti un samazināt latentumu.
Šī informācija nāk no The Information ziņojuma, kurā atsaucas uz diviem iekšējiem avotiem. Viņu apgalvojums ir ievērības cienīgs: Frozen v2 varētu apstrādāt sešas līdz desmit reizes vairāk tokenu uz vatu nekā Google jaunākās tensora apstrādes vienības. Mērķa datums? 2028. Motivācija ir skaidra un pazīstama ikvienam, kas redzējis, kā mākoņu pieprasījums pārsniedz kapacitāti. Pēc ziņām Google Cloud bija jāatsaka daži klientu darījumi AI apstrādes noslodzes dēļ.
Arhitektūras iebūvēšana, nevis noteikumu izmantošana
Tradicionālās TPU un GPU ir vispārīgas ierīces. Jūs ielādējat modeli, un aparatūra pieņem daudz izpildes laikā nepieciešamu lēmumu, piemēram, kā pārvietot datus, kuras operācijas plānot un kad piekļūt atmiņai. Šī elastība ir jaudīga, bet tai ir savas izmaksas. Frozen v2 izvēlas citu pieeju: tas fiksē noteiktus Gemini specifiskus lēmumus tranzistoru līmeņa loģikā. Rezultātā izpildes soļu ir mazāk un uz vienu pieprasījumu tiek pārvietots mazāk datu. Mazāk datu pārvietošanas. Mazāks režijas slogs. Zemāks latentums. Parādās jaunas reāllaika lietojumprogrammu iespējas.

Bija pat vēl drosmīgāka ideja. Agrīnie Frozen dizaini, ko pēc ziņām vadīja Jeff Dean, mēģināja cieti ierakstīt modeļa svarus tieši silīcijā. Tas būtu radikāls optimizējums. Tas arī ātri novecotu, jo mikroshēmas, kas piesaistītas vienai modeļa versijai, ir praktiski lietojamas ļoti īsu laiku. Google izvēlējās kompromisu. Frozen v2 iebūvētu arhitektūras skeletu, saglabājot iespēju atjaunināt svarus, tādējādi tā pati mikroshēma varētu apkalpot vairākus Gemini izlaidumus, kamēr tie saglabā līdzīgas arhitektūras iezīmes.
Šī pieeja var samazināt atbilžu laikus pietiekami, lai padarītu iespējamas jaunas interaktīvas un zemu latentuma AI lietojumprogrammas.
Google neplāno aizstāt savu TPU floti ar Frozen v2. Domājiet par to kā par eksperimentālu līniju, kas darbojas paralēli TPU ražošanai, testa lauku specializētam silīcijam, kamēr modeļu dizaini stabilizējas. Pašas TPU produktu attīstības ceļkartē nesen tika atdalītas apmācības un inferenču vajadzības ar astotās paaudzes mikroshēmām, izziņotām Cloud Next pasākumā aprīlī. Frozen v2 iniciatīva ir mazāka mērogā; Google neplāno masveida ražošanu tādā līmenī kā TPU.
Frozen v2 sagaidāmais parādīšanās laiks sakrīt arī ar citiem nozares soļiem. Pēc ziņām Google ir pasūtījis Intel iesaiņot vairāk nekā trīs miljonus TPU mikroshēmu līdz 2028. Tikmēr jaunuzņēmumi un konkurenti jau izpēta modeļiem pielāgotu silīciju. Toronto bāzētais Taalas izlaida savu HC1 mikroshēmu, savienotu ar Llama 3.1 8B, un apgalvo, ka sasniedz 17 000 tokenu sekundē bez uz paketes iebūvēta HBM. Jaunuzņēmums piesaistīja aptuveni 186 miljonu eiro finansējumu. Pagājušajā gadā Nvidia parakstīja tehnoloģiju licences līgumu ar Groq, kura vērtība ir aptuveni 18,6 miljardu eiro, un tas liecina, ka tirgus redz lielu vērtību modeļu uzvedības un aparatūras integrācijā.
Ir kompromisi. Arhitektūras iebūvēšana samazina dažas elastības formas. Tā dod priekšroku gadījumiem, kur modelu saimes saglabā konsekvenci laika gaitā. Tā arī maina produkta dzīves ciklu: silīciju, kas projektēts ap konkrētu modeļa arhitektūru, jāattaisno ar prognozējamu dizaina stabilitāti un izvietošanas apmēru. Tas izskaidro Google piesardzīgo nostāju. Frozen v2 ir eksperimentāls; ne visi eksperimenti kļūst par produktiem.
Pašlaik Google nav publiski apstiprinājis Frozen v2. Uzņēmuma pārstāvis The Information atgādināja, ka daudzi iekšējie projekti nekad nesasniedz ražošanu. Tomēr pamatideja, pārvietot daļu modeļa loģikas uz silīciju, lai ietaupītu enerģiju un samazinātu latentumu, ir pārvērtusies no akadēmiska interešu lauka par konkurences stratēģiju. Sagaidiet vairāk uzņēmumu, kas testēs līdzīgas kombinācijas starp modeļiem apzinātu aparatūru un atjaunināmiem svariem, jo pieprasījums pēc efektīva, zemu latentuma AI turpina pieaugt.




.webp)
Diskusija
Atstāt komentāru
Komentāri
Vēl nav komentāru. Esiet pirmais.