Photo by <a href="https://unsplash.com/@tvick?utm_source=WP+Agent&utm_medium=referral">Taylor Vick</a> on <a href="https://unsplash.com/?utm_source=WP+Agent&utm_medium=referral">Unsplash</a>
„Huawei“ nori milijoną procesorių paversti vienu milžinišku kompiuteriu
„Huawei“ pristatė naują „Peerium Computing Architecture“ architektūrą, kurios ambicija skamba neįprastai net DI infrastruktūros mastais: iki milijono procesorių turėtų veikti kaip vienas bendras kompiuteris.
„Huawei“ teigimu, architektūra naudoja hierarchinį lygiagretumą, vieningą atminties adresavimą ir naują „UnifiedBus“ jungčių technologiją.
Kam reikalingas toks mastas?
Didžiausių DI modelių mokymas reikalauja dešimčių ar šimtų tūkstančių lustų. Kuo jų daugiau, tuo sunkiau efektyviai dalintis duomenimis ir išvengti situacijos, kai dalis procesorių laukia kitų.
„Huawei“ siekia sumažinti šias komunikacijos sąnaudas ir leisti programuotojams didžiulį klasterį traktuoti kaip vientisesnę sistemą. Tai ypač svarbu Kinijai, kuri dėl eksporto apribojimų negali laisvai pirkti pažangiausių „Nvidia“ lustų.
Kova vyksta ne tik dėl lustų
DI infrastruktūros našumą lemia ne vien procesoriaus sparta. Vis svarbesnės tampa jungtys, atmintis, tinklo architektūra ir programinė įranga. Todėl „Huawei“ bando konkuruoti visos sistemos lygiu.
Milijono procesorių architektūra skamba ekstremaliai, tačiau didžiausių DI modelių mastas iš tikrųjų stumia infrastruktūrą būtent šia kryptimi. Kai skaičiavimas padalijamas tarp dešimčių ar šimtų tūkstančių lustų, problema tampa ne vien jų greitis, o tai, kiek laiko jie praleidžia laukdami duomenų vienas iš kito.
Todėl jungtys tarp procesorių tampa kritiniu komponentu. Jei tinklas per lėtas arba turi per didelę delsą, papildomas lustas gali duoti labai mažai realaus našumo. Didelės sistemos turi derinti modelio sluoksnių padalijimą, duomenų paralelizmą ir atminties srautus taip, kad kuo mažiau skaičiavimo vienetų stovėtų be darbo.
„Huawei“ tai ypač svarbu dėl prieigos prie pažangiausių vakarietiškų lustų ribojimų. Jei atskiras procesorius nusileidžia konkurentui, dalį skirtumo galima kompensuoti sistemos architektūra – efektyvesniu sujungimu, programine įranga ir didesniu lustų kiekiu. Tai nėra paprastas pakaitalas, nes energijos sąnaudos ir infrastruktūros sudėtingumas auga, tačiau sistemos lygio optimizacija gali gerokai pakeisti bendrą rezultatą.
Vieningas atminties adresavimas taip pat svarbus programuotojams. Kuo mažiau jiems reikia galvoti, kuriame konkrečiame procesoriuje yra duomenys, tuo lengviau rašyti programas milžiniškiems klasteriams. Vis dėlto po šiuo abstrakcijos sluoksniu aparatūra vis tiek turi fiziškai perkelti duomenis tarp mazgų, todėl „vienas kompiuteris“ yra labiau programinis tikslas nei tiesioginė fizinė realybė.
Jei „Peerium“ veiks taip, kaip žadama, „Huawei“ bandys konkuruoti ne vien vieno lusto našumu, bet visos DI gamyklos efektyvumu. Būtent tai ir tampa svarbiausia naujos kartos infrastruktūroje: laimi ne tas, kas turi greičiausią procesorių, o tas, kas geriausiai sujungia skaičiavimą, atmintį, tinklą ir programinę įrangą.
Energijos sąnaudos bus viena didžiausių tokios architektūros ribų. Milijonas procesorių gali suteikti milžinišką skaičiavimo galią, bet kartu reikalauti milžiniško elektros ir aušinimo kiekio. Jei tinklo efektyvumas prastas, dalis energijos sunaudojama tiesiog duomenims judinti, o ne naudingam skaičiavimui.
Todėl „vienas milžiniškas kompiuteris“ turi būti vertinamas pagal bendrą efektyvumą: kiek mokymo darbo atliekama vienai kilovatvalandei, kiek laiko užtrunka modelio mokymas ir kiek infrastruktūros reikia rezultatui pasiekti. DI duomenų centrų eroje būtent sistemos energinis efektyvumas gali tapti ne mažiau svarbiu konkurencijos rodikliu nei teorinis FLOPS skaičius.
Ši kryptis taip pat gali skatinti specializuotų duomenų centrų dizainą. Jei architektūra optimizuota milijoniniams procesorių klasteriams, tinklo topologija, aušinimas ir net pastato elektros infrastruktūra turi būti projektuojami kaip viena sistema. Tai jau nebe tiesiog serverių salė, o milžiniška skaičiavimo mašina.
Tokio masto architektūros patikimumas taip pat sudėtingas. Kuo daugiau procesorių, tuo dažniau kažkuris mazgas suges ar bus laikinai nepasiekiamas. Sistema turi tęsti skaičiavimą nepaisydama atskirų gedimų, automatiškai perskirstyti užduotis ir išsaugoti tarpinius modelio taškus. Todėl patikimumo programinė įranga tampa esmine viso superklasterio dalimi.
Daugiau apie DI lustus ir infrastruktūrą skaitykite TechNaujienos.lt DI rubrikoje.
Kaip vertinate šį straipsnį?
Prenumeruokite mūsų „YouTube“ kanalą ir mėgaukitės įdomiais vaizdo reportažais apie mokslą ir technologijas.
Trumpai, aiškiai ir be triukšmo – gaukite svarbiausias technologijų ir mokslo naujienas pirmieji.
DIENOS SKAITOMIAUSI
Išvykimo krepšys karo ar krizės atvejui: ką jame turėtų turėti Lietuvos gyventojas
2NASA aptiko 84 paslaptingus objektus – astronomai tokių dar nematė
3Priedanga, slėptuvė ar rūsys? Kur iš tikrųjų saugiausia slėptis Lietuvoje
4Dingo elektra: ar vis dar veiks šviesolaidis, „Wi-Fi“ ir 5G?
5„Anthropic“ statymas stulbina: DI infrastruktūrai – 518 mlrd. JAV dolerių
NAUJAUSI
Taip pat skaitykite
Atrinkome panašius straipsnius, kurie gali jums patikti.