Ievads: vairāk nekā tikai ēka ar serveriem
Viens AI treniņu statīvs, kas ielādēts ar NVIDIA GPU, var patērēt 130 līdz 140 kilovatus. Tas ir aptuveni visas tradicionālās datu centra rindas, kas iepakotas vienā skapī, enerģijas patēriņš. Ietekme uz iekārtu projektēšanu ir dziļa: dzesēšanas sistēmas, kas paredzētas 5 kW plauktiem, nevar apstrādāt 140 kW plauktus. Enerģijas sadales lielums uzņēmuma darba slodzei nevar barot GPU klasterus. Un vecā datu centra izveides rokasgrāmata, kas lieliski darbojās divdesmit gadus, tiek pārrakstīta reāllaikā.
Datu centra izveide 2026. gadā nav tāda, kāda tā bija pat pirms pieciem gadiem. Tas ir daudznozaru uzņēmums, kas skar nekustamo īpašumu, elektrotehniku, mehāniskās sistēmas, telekomunikācijas, informācijas drošību, atbilstību normatīvajiem aktiem un arvien vairāk vides ilgtspējību. Neatkarīgi no tā, vai veidojat nelielu malu iekārtu, lai atbalstītu 5G latentuma prasības, izvietošanas centru reģionālajiem uzņēmumiem vai hipermēroga pilsētiņu mākslīgā intelekta darba slodzei, pamatprincipi ir vienādi, pat ja mērogs krasi mainās.
Šajā rokasgrāmatā ir aprakstīti visi svarīgākie datu centra dzīves cikla lēmumu pieņemšanas punkti, sākot no pirmā objekta apmeklējuma līdz pēdējai nodošanas ekspluatācijā pārbaudei. Mēs apskatīsim standartus un sertifikātus, enerģijas un dzesēšanas arhitektūru, tīkla dizainu, fizisko drošību, izmaksu realitāti un ilgtspējības spiedienu, kas pārveido nozari. Nav mārketinga spīduma. Nav pārāk vienkāršotu kontrolsarakstu. Tikai inženiertehniskie un biznesa lēmumi, kas nosaka, vai jūsu iekārta ir veiksmīga vai neveiksmīga.
Kas īsti ir datu centrs?
Datu centrs nav ēka, kas pilna ar serveriem. Tas ir tāpat kā saukt lidostu par ēku, kas pilna ar lidmašīnām. Ēka ir vismazāk interesantākā daļa. Svarīga ir infrastruktūra: energosistēmas, kas nodrošina elektrības plūsmu bez pārtraukumiem, dzesēšanas sistēmas, kas atdala tūkstošiem procesoru radīto siltumu, tīkla infrastruktūra, kas savieno šos procesorus ar ārpasauli, un drošības sistēmas, kas aizsargā visu, kas atrodas iekšā.
Datu centra pamatā ir rūpīgi izstrādāta vide, kas izstrādāta, lai nodrošinātu četras lietas: uzticamu barošanu, efektīvu dzesēšanu, lielu{0}}joslas platuma savienojumu un fizisko drošību. Viss pārējais, serveri, krātuves masīvi, tīkla slēdži, GPU, ir kravas. Iekārta pastāv, lai radītu apstākļus, kādos šī krava var darboties bez traucējumiem divdesmit-četras stundas dienā, septiņas dienas nedēļā, gadiem ilgi.
Datu centri ir dažādi, sākot no vienas telpas biroju ēkā ar 50 kilovatu jaudu līdz hipermēroga pilsētiņām, kas patērē vairāk nekā 300 megavatus. Neliela malu iekārta varētu apkalpot vietējās 5G bāzes stacijas. Izvietošanas centrā varētu būt aprīkojums desmitiem uzņēmumu. Hipermēroga pilsētiņa var apmācīt AI modeļus miljoniem lietotāju vienlaikus. Mērogs mainās, bet inženiertehniskie principi paliek ļoti konsekventi.
Standarti un līmeņi: uzticamības valoda
Pirms kaut ko veidojat, jums jāizlemj, cik tam ir jābūt uzticamam. Tas nav filozofisks jautājums. Tas nosaka katru turpmāko dizaina lēmumu, sākot no tā, cik UPS vienību iegādājaties, un beidzot ar to, cik dzesēšanas torņu uzstādāt. Un atbildei ir tiešas, izmērāmas izmaksas.
Uptime Institute līmeņa sistēma
Uptime Institute pirms vairāk nekā trīsdesmit gadiem izstrādāja četru{0} līmeņu klasifikācijas sistēmu, kas ir kļuvusi par nozares kopējo uzticamības valodu. Sistēma novērtē objekta enerģijas, dzesēšanas un fiziskās infrastruktūras noturību, nevis tajā esošās IT iekārtas. Katrs līmenis balstās uz visu zemāko līmeņu prasībām.
I līmenis (pamata ietilpība)piedāvā 99,671% pieejamību ar 28,8 stundu ikgadēju dīkstāvi. Ir viens strāvas ceļš, nav dublēšanas, un jebkurai apkopei ir nepieciešama -visa vietne. Tas ir piemērots biroja IT vai izstrādes vidēm, kur dīkstāve ir neērtības, nevis katastrofa.
II līmenis (daļēja atlaišana)pievieno N+1 enerģijas un dzesēšanas rezerves, uzlabojot pieejamību līdz 99,741% ar 22 stundu ikgadēju dīkstāvi. Lieku komponentu apkope ir iespējama bez izslēgšanas, taču primārajām sistēmām joprojām ir nepieciešami plānoti pārtraukumi.
III līmenis (vienlaicīgi apkopjams)ir nozares standarts komerciālām iekārtām. Tas nodrošina 99,982% pieejamību ar tikai 1,6 stundu ikgadēju dīkstāvi, pateicoties pilnai N+1 redundancei un vairākiem neatkarīgiem barošanas un dzesēšanas ceļiem. Jebkuru atsevišķu komponentu var izmantot bezsaistē apkopei, neizjaucot datu zāli. 2024. gadā 57,4% no visas ASV datu centru būvniecības tika uzbūvētas atbilstoši III līmeņa standartiem, un parastās izmaksas bija no 8 līdz 15 miljoniem USD par megavatu.
IV līmenis (kļūdu izturīgs)iet tālāk ar 2N vai 2N+1 dublēšanu, kas nozīmē, ka katrai kritiskajai sistēmai ir fiziski izolēta, pilnībā aktīva dublēšana. Pieejamība sasniedz 99,995% ar tikai 26,3 minūšu gada dīkstāvi. Izmaksu prēmija ir par 20 līdz 40% augstāka nekā III līmenī. 10 MW objektam tas palielina būvniecības izmaksas no 16 līdz 60 miljoniem USD. Katra ikgadējā dīkstāves samazināšanas minūte maksā aptuveni USD 228 000 līdz USD 857 000 uz 10 MW jaudas. IV līmeņa telpas ir reti sastopamas, un tās parasti ir paredzētas finanšu iestādēm, valdības operācijām un misijas{20}}kritiskajai infrastruktūrai.
TIA-942: plašāks standarts
Lai gan Uptime Institute Tiers koncentrējas uz elektrisko un mehānisko infrastruktūru, ANSI/TIA-942 (jaunākā versija 2024. gadā) aptver plašāku darbības jomu: telekomunikācijas, arhitektūras, elektriskās, mehāniskās, vietas izvēle, ugunsdrošība un fiziskā drošība. Tas novērtē četras apakšsistēmas neatkarīgi skalā no Rated-1 līdz Rated-4, un objekta kopējo vērtējumu nosaka zemākais vērtējums starp apakšsistēmām. Datu centrs nevar pretendēt uz reitinga 3 statusu, ja tā elektrosistēmai ir tikai 2.
Šī ir svarīga atšķirība: pieprasīt TIA-942 Rated-3 datu centru nav tas pats, kas pieprasīt Uptime Institute III līmeņa iekārtu. Atšķiras darbības jomas, atšķiras auditoru kvalifikācija un atšķiras sertifikācijas procesi. Atjautīgas iepirkumu komandas norāda, kurš standarts tām ir nepieciešams, un pārbauda sertifikācijas posmu, jo objekts, kuram ir tikai dizaina sertifikācija, nav pierādījis, ka būvniecība atbilst projektam.
Vietnes izvēle: kur jūs būvējat, tas ir svarīgāks par to, ko jūs veidojat
Jūs varat izveidot visefektīvāko datu centru pasaulē, taču, ja to uzbūvēsit nepareizā vietā, jūs to nožēlosiet visu objekta mūžu. Vietnes izvēle ir vienīgais visnozīmīgākais lēmums visā procesā, un to arī visbiežāk nosaka ar inženieriju nesaistīti faktori: nodokļu atvieglojumi, zemes izmaksas un galvenās mītnes tuvums.
Šeit ir neērtā realitāte: hipermēroga pilsētiņa var patērēt vairāk nekā 300 megavatus. Lai nodrošinātu tik daudz enerģijas no tīkla, nav jāizraksta čeks. Tādos-augsta pieprasījuma tirgos kā Ziemeļvirdžīnija un Singapūra starpsavienojumu rindas var pagarināties no 36 līdz 48 mēnešiem. 70 MW projekts Nevadā tika apturēts uz 18 mēnešiem, jo tuvākajai pārvades līnijai nebija pieejama jauda. Sāciet sarunas par komunālajiem pakalpojumiem laicīgi un jautājiet ne tikai par to, vai varat iegūt 50 MW, bet arī kad un par kādu cenu.
| Faktors | Kāpēc tas ir svarīgi | Sarkanais karogs |
|---|---|---|
| Elektrotīkls | 300+ MW nepieciešams hiperskalai; starpsavienojums aizņem 18-48 mēnešus | Viena komunālā padeve, bez atlaišanas plāna |
| Šķiedru maršruti | Nepieciešami vairāki operatori, lai nodrošinātu atlaišanu un konkurētspējīgas cenas | Pieejams tikai viens šķiedras ceļš |
| Klimats | Dzesēšana ir 30-40% no enerģijas patēriņa; auksts klimats=brīva dzesēšana | Karsts, mitrs klimats ar sliktu gaisa kvalitāti |
| Dabas katastrofas | Plūdi, zemestrīces, viesuļvētras izraisa ilgstošus pārtraukumus | Vietne FEMA plūdu zonā vai seismiskā lūzuma līnijā |
| Noteikumi | Zonējums, ūdens ierobežojumi, ESG atbilstība atšķiras atkarībā no reģiona | Ūdens-stresota vieta, kas liedz iztvaikošanas dzesēšanu |
| Stimuli | Nodokļu samazinājumi, aprīkojuma atbrīvojumi var ietaupīt miljonus | Stimuli ar atgūšanas klauzulām, kas saistītas ar darba metriku |
Klimats ir pelnījis īpašu uzmanību, jo tas tieši ietekmē jūsu ekspluatācijas izmaksas. 10 MW iekārta Fīniksā dzesēšanai katru gadu var tērēt līdz pat 20% vairāk nekā līdzīga vieta Portlendā. Vēsāks klimats nodrošina brīvu-gaisa dzesēšanu, kur āra gaiss tiek izmantots tieši, kad temperatūra un mitrums ir piemērotas, ievērojami samazinot mehāniskās dzesēšanas enerģiju. Tāpēc Ziemeļeiropas hiperskalas iekārtas regulāri ziņo par PUE vērtībām no 1,03 līdz 1,12.
Dabas katastrofu risks jānovērtē, izmantojot FEMA bīstamības kartes, USGS seismiskos datus un vēsturiskos laikapstākļu modeļus. Ūdens pieejamība tiek arvien vairāk pārbaudīta: Jūta un Arizona ir apturējušas vai atteikušas atļaujas jauniem datu centriem ūdens problēmu dēļ, un dažās jurisdikcijās tagad ir nepieciešamas slēgtas-cilpas vai sausās{2}}dzesēšanas sistēmas.
Enerģijas infrastruktūra: iekārtas sirds
Elektriskās sistēmas veido 40 līdz 50% no kopējām datu centra būvniecības izmaksām. Tās ir vienīgā visdārgākā apakšsistēma, un tās ir arī viskritiskākās: bez strāvas nekam citam nav nozīmes. Izpratne par jaudas arhitektūru nozīmē kompromisu starp izmaksām un uzticamību.
UPS sistēmas: dubultā-reklāmguvums salīdzinājumā ar līniju-interaktīvu
Nepārtrauktās barošanas avots ir tilts starp komunālo tīklu un jūsu ģeneratoriem. Ja elektrotīkla strāva pazūd, UPS nodrošina tūlītēju jaudu no akumulatoriem, kamēr ģeneratori griežas, process, kas parasti aizņem 10 līdz 30 sekundes. UPS topoloģijas izvēle ietekmē gan izmaksas, gan uzticamību.
Dubultā{0}}reklāmguvuma (tiešsaistes) UPSnepārtraukti pārvērš ienākošo maiņstrāvu par līdzstrāvu un atpakaļ uz tīru maiņstrāvu, nodrošinot pilnīgu elektrisko izolāciju no elektrotīkla traucējumiem. Strāvas padeves pārtraukumu laikā pārsūtīšanas laiks ir nulle. Šai topoloģijai pieder 44,65% ieņēmumu daļa datu centru UPS tirgū, un tā ir standarts III un IV līmeņa iekārtām. Mūsdienu sistēmas, piemēram, Schneider Electric 2025 Galaxy VXL, sasniedz 99% efektivitāti eConversion režīmā, samazinot zudumus zem 1%. Izmaksas ir aptuveni par 35% augstākas nekā interaktīvās alternatīvas.
Line{0}}interaktīvā UPSir izmaksu{0}}efektīva alternatīva maziem-līdz-vidējiem izvietojumiem, piedāvājot par aptuveni 40% zemākas izmaksas. Tas ir piemērots I un II līmeņa iekārtām, bet nav ieteicams III vai IV līmeņa datu centriem, kur harmoniskie kropļojumi un pārsūtīšanas laiks ir nepieņemami.
Redundances topoloģijas: N+1 vs. 2N vs. 2N+1
Redundances topoloģija nosaka, kas notiek, ja komponents neizdodas. Trīs primārās arhitektūras atspoguļo dažādus punktus izmaksu-uzticamības līknē:
| Topoloģija | Apraksts | Pacieš | Labākais priekš |
|---|---|---|---|
| N+1 | Viena rezerves vienība katrai kritiskajai sistēmai | Viena komponenta kļūme | Uzņēmums, mērens darbības laiks |
| 2N | Divi pilnībā neatkarīgi jaudas ceļi, katrs paredzēts 100% slodzei | Viena visa ceļa zaudēšana | III/IV līmenis, AI apmācība |
| 2N+1 | Divi neatkarīgi ceļi plus viena koplietojama lieka vienība | Ceļa kļūme plus vienības atteice | IV līmenis, kritiskā infrastruktūra |
AI apmācības klasteriem izvēlei starp N+1 un 2N ir ekonomiskas sekas, kas pārsniedz tikai uzticamību. AI apmācības darbi zaudē progresu neplānota jaudas zuduma dēļ, un tiem ir nepieciešama restartēšana no pēdējā kontrolpunkta. Ja darba ilgums ir garš un kontrolpunktu intervāli ir plaši, vienas restartēšanas izmaksas bieži pārsniedz kapitāla starpību starp N+1 un 2N. Operatoriem pirms izvēles ir jāsamēro darba ilgums un kontrolpunktu biežums attiecībā pret jaudas ceļa remonta laiku.
Jaudas blīvums: AI revolūcija
Tradicionālie uzņēmumu datu centri darbojas ar 3 līdz 5 kW uz vienu statīvu. Mūsdienu hipermēroga iekārtu mērķis ir no 10 līdz 30 kW. AI-optimizētas iespējas? 50 līdz 140 kW uz plauktu. NVIDIA GB200 NVL72 statīvu jauda ir no 130 līdz 140 kW. Meta OCP ORv3-HPR V4 plaukti stumjamās skapja kravnesība līdz 800 kW. Vertiv prognozē, ka AI statīva līmeņa jaudas blīvums pieaugs no 50 kW līdz 1 megavatam no 2024. līdz 2029. gadam.
Tās nav pakāpeniskas izmaiņas. Tā ir paradigmas maiņa. Objektā, kas pirms desmit gadiem celts 5 kW plauktiem, ir elektroenerģijas sadale, dzesēšana un kabeļu pārvaldība, kas paredzēta šim blīvumam. Jūs nevarat nomest 140 kW GPU statīvu šajā objektā un gaidīt, ka tas darbosies. Kopne, PDU, slēdža panelis, dzesēšanas iekārta un paaugstinātā grīda bija piemērotas citam laikmetam. Tāpēc AI-optimizētās iekārtas maksā 20 miljonus USD vai vairāk par megavatu, salīdzinot ar 10–12 miljoniem USD par standarta hipermēroga būvniecību.
Dzesēšanas stratēģija: siltuma pārvietošana, nevis tikai aukstuma radīšana
Dzesēšana veido 30 līdz 40% no datu centra kopējā enerģijas patēriņa. Tas ir lielākais kontrolējamais faktors PUE pēc pašas IT ielādes. Un tieši šajā jomā AI revolūcijai ir bijusi visdramatiskākā ietekme, jo tradicionālā gaisa dzesēšana vienkārši nespēj tikt līdzi 140 kW plauktiem.
Tradicionālā gaisa dzesēšana: CRAC un CRAH
Datortelpas gaisa kondicionēšanas (CRAC) un Computer Room Air Handler (CRAH) ierīces atdzesē gaisu, pirms to recirkulē caur datu zāli. Šī pieeja labi darbojas blīvumam līdz 10 līdz 30 kW uz vienu statīvu, taču, palielinoties blīvumam, ventilatora enerģijas patēriņš strauji palielinās un efektivitāte samazinās. Apvienojumā ar karstās ejas/aukstās ejas ierobežošanu, kas atdala karsto izplūdes gaisu no aukstā pieplūdes gaisa, tradicionālā gaisa dzesēšana var sasniegt PUE vērtības no 1,4 līdz 1,8.
Karstās/aukstās ejas ierobežošana ir konstrukcijas prasība jebkuram nopietnam PUE mērķim, kas mazāks par 1,2. Bez ierobežošanas, karstā un aukstā gaisa maisījuma dzesēšanas sistēma darbojas grūtāk, un efektivitāte strauji samazinās. Blakuspaneļi tukšās plaukta pozīcijās, aizzīmogoti grīdas caurumi un kontrolēti atgaitas gaisa ceļi nav papildu līdzekļi; tās ir dizaina pamatprasības.
Šķidruma dzesēšana: neizbēgamā maiņa
Ja blīvums pārsniedz 30 līdz 50 kW uz vienu statīvu, gaisa dzesēšana skar fizisko sienu. Gaisa daudzums, kas nepieciešams, lai noņemtu tik daudz siltuma, kļūst nepraktisks: dominē ventilatora enerģija, trokšņa līmenis kļūst bīstams, un milzīgais gaisa kustības apjoms rada strukturālas problēmas. Šeit attēlā nonāk šķidruma dzesēšana.
Tieša šķidruma dzesēšanacirkulē dzesēšanas šķidrumu caur aukstajām plāksnēm, kas uzstādītas tieši uz CPU un GPU, noņemot siltumu pie avota, pirms tas izplatās pa serveri. Šī pieeja nodrošina PUE vērtības no 1,03 līdz 1,15 un atbalsta statīva blīvumu no 50 līdz 80 kW. Kompromiss-ir cauruļu un sūkņu tīkls, kas palielina noplūžu risku un rada bažas par aparatūras saderību.
Viena{0}}fāzes iegremdēšanas dzesēšanaiegremdē veselus serverus -nevadošā dielektriskā šķidrumā, pilnībā novēršot vajadzību pēc iekšējiem servera ventilatoriem. Tādējādi tiek sasniegtas PUE vērtības no 1,02 līdz 1,10, un tas var atbalstīt blīvumu, kas pārsniedz 100 kW uz vienu statīvu. Darbības darbplūsmas izmaiņas ir būtiskas: tehniķi nevar nejauši atvērt serveri, lai nomainītu DIMM. Bet siltuma veiktspēja ir nepārspējama.
Divu{0}}fāžu iegremdēšanas dzesēšanaizmanto noslēgtu sistēmu, kurā dielektriskais šķidrums vārās un kondensējas siltuma pārnesei, sasniedzot zemākās PUE vērtības (1,02 līdz 1,08) un augstāko blīvuma spēju. Gandrīz visu servera siltumu uztver šķidrums, radot vienotus termiskos apstākļus, kas pagarina komponentu kalpošanas laiku. Kompromiss-ir lielāks sākotnējais ieguldījums un sarežģīta šķidruma pārvaldība.
Degradēto teritoriju objektiem, kas paplašinās līdz AI darba slodzei, hibrīda dzesēšana apvieno gaisa un šķidruma dzesēšanu tajā pašā ēkā. Tas ļauj saglabāt esošos gaisa-dzesēšanas plauktus, vienlaikus izmantojot šķidruma dzesēšanu, kur to prasa blīvums, ļaujot pakāpeniski modernizēt bez pilnīgas pārbūves. Šķidruma dzesēšana nodrošina arī izmērāmus ilgtspējības ieguvumus: Microsoft pētījumi liecina, ka tas samazina siltumnīcefekta gāzu emisijas par 15 līdz 21%, enerģijas pieprasījumu par 20% un ūdens patēriņu par 52%, salīdzinot ar gaisa dzesēšanu.
PUE: universālā efektivitātes metrika
Enerģijas izmantošanas efektivitāte ir kopējās iekārtas jaudas attiecība pret IT aprīkojuma jaudu. PUE 1,0 nozīmē, ka katrs vats tiek izmantots skaitļošanai. PUE 1,5 nozīmē pusvatu pieskaitāmās izmaksas par katru aprēķinu vatu. Tas ir vienīgais visvairāk citētais datu centra efektivitātes rādītājs, un ir ļoti svarīgi saprast jūsu stāvokli attiecībā pret nozares etaloniem.
Saskaņā ar Uptime Institute 2024. gada globālo datu centra aptauju nozares vidējais PUE ir aptuveni 1,56. Google ziņo 1.09. Microsoft ziņo 1.12. AWS ziņo 1.15. Labākās-iekārtas, izmantojot iegremdēšanas dzesēšanu vēsā klimatā, sasniedz 1,03–1,08. Tipiski uzņēmumu datu centri darbojas no 1,4 līdz 1,6, un iekārtas, kas pārsniedz 1,6, tiek uzskatītas par zemu vidējo.
Kā hiperskalori sasniedz tik zemas PUE vērtības? Tā nav viena tehnoloģija, bet gan kombinācija: gaisa-sānu ekonomaizera dzesēšana, kas izmanto āra gaisu, kad ir piemērota temperatūra, ūdens-ekonomaizera sistēmas, kas atgrūž siltumu bez mehāniskas saspiešanas, augstāka atdzesēta ūdens padeves temperatūra (paaugstinot no 6 līdz 8 grādiem līdz 14 līdz 18 grādiem pēc Celsija), tiešs dzesēšanas šķidrums, kas noņem siltumu, un AI iegremdēšana gaisa plūsmas optimizācija, kas var samazināt dzesēšanas enerģiju līdz pat 30%.
Normatīvais spiediens palielina likmes. Vācijas Energoefektivitātes likumā noteikts, ka no 2026. gada jūlija jauniem datu centriem ir jāsasniedz PUE 1,2 vai labāks, esošajām iekārtām līdz 2027. gadam ir jāsasniedz 1,5 un līdz 2030. gadam — 1,3. ES Energoefektivitātes direktīva nosaka, ka datu centriem, kuru jauda pārsniedz 500 kW, ir jāiesniedz ikgadēji ilgtspējības ziņojumi par uzstādīto IT jaudu, aptverot 24 atjaunojamo enerģijas rādītājus, jaunus PUE rādītājus. un enerģijas atkārtotas izmantošanas faktors.
Tīkla arhitektūra: nervu sistēma
Datu centrs bez tīkla ir tikai dārga noliktava, pilna ar karstu metālu. Tīkla dizains nosaka, cik ātri dati tiek pārvietoti starp serveriem, kā iekārta savienojas ar ārpasauli un cik graciozi sistēma apstrādā kļūmes. AI darba slodzēm tīkla dizains neapšaubāmi ir svarīgāks par neapstrādātu skaitļošanas jaudu, jo GPU kopas pavada ievērojamu sava laika daļu, gaidot datus.
Mugurkaula-Lapa: mūsdienu standarts
Mugurkaula-lapu arhitektūra ir aizstājusi tradicionālos trīs-līmeņu (pamata-apkopošanas-piekļuves) dizainu mūsdienu datu centros. Tā ir plakana, divu{5}}līmeņu topoloģija, kurā katrs lapas (-statīva augšdaļa) slēdzis ir savienots ar katru mugurkaula slēdzi, radot ne-bloķējošu, zemu-latenci. Katrs serveris var sasniegt katru otro serveri tieši divos lēcienos, kas ir ļoti svarīgi AI darba slodzēm, kur GPU{11}}uz{12}}GPU komunikācijas latentums tieši ietekmē apmācības laiku.
AI klasteriem, kuros tiek izmantoti NVIDIA H100 vai B200 GPU ar 400G Ethernet vai NDR400 InfiniBand, mugurkaula-lapu audums gandrīz vienmēr ir{5}}balstīts no mugurkaula-uz-lapām un lapām-uz{9}10}savienojumu{9}{1} GPU-uz-GPU audums statīvā izmanto NVLink/NVSwitch īpaši-zemas-latences saziņai, savukārt optiskās šķiedras MPO saites apstrādā mērogošanas-tīklu starp slēdžiem un statīviem.
Šķiedru izvēle: OM4, OM5 vai OS2?
Šķiedras veida izvēle ir viena no visbiežāk apspriestajām tēmām datu centru tīklu veidošanā, un pareizā atbilde ir pilnībā atkarīga no jūsu sasniedzamības un optikas stratēģijas.
| Šķiedras veids | Labākais priekš | Sasniedziet 400 G | Izmaksas |
|---|---|---|---|
| OM3 | Mantojums uzņēmums, zems blīvums | 100 G-SR4 līdz 300 m | Zemākais |
| OM4 | Standarta AI lapas{0}}mugurkauls, īsas saites | 400 G-SR8 līdz 100 m | Mērens |
| OM5 | Vairāki-viļņu garumi ar SWDM4 | Tikai 400 G-SR8 līdz 150 m | Premium |
| OS2 | Mugurkauls, starp{0}}ēka, DCI | 400 G-DR4 līdz 500 m | Augstākas optikas izmaksas |
Pašreizējām mākslīgā intelekta klasteriem, kuru saites ir mazākas par 100 metriem, OM4 joprojām ir visrentablākā izvēle-. Pie 400 G daudzmodu raiduztvērēji parasti ir par 30–50% lētāki par vienu portu nekā viena režīma alternatīvas. Tomēr turpmākai-pielāgošanai daudzi operatori izmanto OS2 tumšo šķiedru kopā ar OM4, ļaujot jaunināt uz 800 G vai 1,6 T bez atkārtotas{14}}kabeļu pievienošanas. Šķiedru kabelis pats par sevi ir lēts; optika ir vieta, kur uzkrājas izmaksas.
Kabeļu pārvaldība: velns slēpjas detaļās
Viena no jomām, kur datu centri pastāvīgi nedarbojas, ir savienotāju tīrība. Pirms savienošanas ar rokas mikroskopu 200x vai 400x palielinājumā ir jāpārbauda katra MPO savienotāja gala virsma. Viena putekļu daļiņa uz MPO savienotāja var izraisīt bitu kļūdas, atkārtotas pārraides un GPU kolektīvās darbības taimautu, ko ir ārkārtīgi grūti diagnosticēt. Notīriet savienotājus, izmantojot sauso klikšķinātāju vai mitrās -sausās metodi saskaņā ar IEC 61300-3-35. Pārbaudiet MPO maģistrālo kabeļu polaritāti ar kalibrētu nepārtrauktības testeri, jo neatbilstoša A/B tipa polaritāte izraisa saišu kļūmes, kas šķiet periodiskas un nejaušas.
Daudzmodu šķiedras minimālais liekuma rādiuss ir 10 reizes lielāks par kabeļa diametru zem slodzes un 7,5 reizes bez slodzes. Liekuma rādiusa pārkāpums izraisa makrolieces zudumus, kas klusi pasliktina signāla kvalitāti. Viena -režīmu šķiedras serdes zonā 0 līdz 25 mikrometru rādiusā nav pieļaujami skrāpējumi vai defekti. Šīs detaļas šķiet triviālas, līdz vairāku{8}}miljonu-dolāru AI treniņš neizdodas netīra savienotāja dēļ.
Izmaksu realitāte: kas tam patiesībā nepieciešams
Parunāsim par naudu, jo viss pārējais šajā rakstā ir teorētisks, līdz jūs saprotat izmaksu struktūru. Standarta hipermēroga datu centrs 2025. gadā maksā no 10 līdz 12 miljoniem USD par megavatu. 50 MW iekārta maksā no 800 miljoniem līdz 1 miljardam dolāru. AI-optimizēta iekārta pārsniedz USD 1 miljardu uz 50 MW un var sasniegt USD 20 miljonus vai vairāk par MW. Kampusa-mēroga AI būvējumi ar 1 gigavatu vai vairāk var sasniegt 45–55 miljardus USD par GW.
Izmaksu sadalījums stāsta par to: elektriskās sistēmas veido 40 līdz 50% no būvniecības izmaksām, mehāniskās un dzesēšanas sistēmas 15 līdz 20%, bet atlikušo daļu veido konstrukcijas apvalks un kodols. IT aparatūra papildus būvniecībai rada 20–40 miljonus ASV dolāru par megavatu, un AI GPU{7}}pielāgošana papildina 25 miljonus $ vai vairāk par megavatu. 100 MW AI{11}}optimizētai iekārtai ir nepieciešami 2–4 miljardi ASV dolāru serveros, tīklos un paātrinātājos, tādējādi kopējās sākotnējās investīcijas sasniedz 3–5,2 miljardus USD.
Darbības ziņā lielākās izmaksas ir jauda, parasti 40 līdz 60% no visiem darbības izdevumiem. 1 GW AI datu centrs ar pilnu jaudu patērē aptuveni 8,76 TWh gadā, kas nozīmē aptuveni 350 miljonus ASV dolāru gadā ar 40 ASV dolāriem par MWh. 0,15 ASV dolāri par kWh — gigavatu-mēroga vietne saskaras ar aptuveni 1,3 miljardu dolāru gada enerģijas izmaksām. Aparatūras atsvaidzināšana 3–5 gadu dzīves ciklā jaunākajiem GPU{14}}palielina simtiem miljonu efektīvus ikgadējos izdevumus.
Ceļš uz priekšu: kas mainās un kāpēc tas ir svarīgi
Datu centru nozare atrodas nozīmīgākās pārvērtības savā vēsturē. Saplūst trīs spēki: mākslīgā intelekta skaitļošanas sprādziens, pāreja uz malu un modulāru izvietošanu un ilgtspējības nepieciešamība. Šo tendenču izpratne nav obligāta ikvienam, kas iesaistīts objektu plānošanā.
Moduļu datu centri pārveido izvietošanas grafikus. Globālā moduļu tirgus vērtība 2025. gadā tika novērtēta 34,84 miljardu dolāru apmērā, un tiek prognozēts, ka līdz 2034. gadam tas sasniegs 143,08 miljardus ASV dolāru ar 17,2% CAGR. Moduļu iekārtas tiek izmantotas 12–16 nedēļās, salīdzinot ar tradicionālo būvniecību, un tās maksā par aptuveni 30% mazāk par kW un samazina atkritumu daudzumu uz vietas līdz pat 90%. Malu skaitļošanai un 5G integrācijai modularitāte ir vienīgā dzīvotspējīgā pieeja vajadzīgajam izvietošanas apjomam.
HVDC barošanas arhitektūra kļūst arvien populārāka AI iekārtām. Delta Electronics lēš, ka HVDC ķēdes efektivitāte ir aptuveni 92%, salīdzinot ar tradicionālo UPS efektivitāti, kas ir 88%, novēršot vairākus maiņstrāvas-uz-līdzstrāvas un līdzstrāvas-uz-maiņstrāvas pārveidošanas soļus. Lielie operatori varētu ietaupīt aptuveni 3,6 miljonus ASV dolāru gadā elektroenerģijas izmaksās, pieņemot HVDC. Meta OCP ORv3-HPR V4 statīvi, kas tika prezentēti 2025. gada EMEA augstākā līmeņa sanāksmē, izmanto 800 V HVDC risinājumu, kas palielina skapja kravnesību līdz 800 kW.
AI secinājumi drīz pārspēs apmācību kā galveno skaitļošanas pieprasījuma virzītājspēku, un tiek prognozēts, ka tas notiks 2027. gadā. Šī pārmaiņa ietekmē datu centru dizainu: apmācību kopas lielās centrālajās iekārtās, secinājumi tiek sadalīti pa malām, kas ir tuvāk lietotājiem. Nozare virzās uz mezgla-reģiona-malu daudzslāņu arhitektūru.
Secinājums: ēka nākamajiem divdesmit gadiem
Datu centra izveide ir kompromisu vingrinājums. Katrs lēmums ir saistīts ar izmaksu līdzsvarošanu ar uzticamību, efektivitāti un sarežģītību, ātrumu un pamatīgumu. Līmeņu sistēma norāda, cik uzticamam jums ir jābūt. PUE parāda jūsu efektivitāti. TIA-942 norāda, vai jūsu dizains ir visaptverošs. Taču neviens no šiem ietvariem nepieņems lēmumus jūsu vietā.
Pamatnoteikumi ir šādi: izvēlieties vietni, pamatojoties uz enerģijas pieejamību un klimatu, nevis tikai zemes izmaksām. Plānojiet savu jaudu un dzesēšanu atbilstoši tam blīvumam, kuru jūs faktiski darbosit, nevis blīvumu, kādu cerat kādreiz darboties. Izveidojiet mugurkaula-lapu tīklu, izmantojot OM4 šķiedru īsām saitēm un OS2 mugurkaulam. Ieviesiet fizisko drošību koncentriskās zonās no pirmās dienas. Izvietojiet DCIM, pirms tas ir nepieciešams, nevis pēc pirmā incidenta. Budžets jaudai ir jūsu lielākais darbības izdevumi un plānojiet ilgtspējību nevis kā atbilstības slogu, bet gan kā konkurences priekšrocību.
Un atcerieties to: datu centrs, ko veidojat šodien, darbosies 15 līdz 25 gadus. Darba slodzes, kuras tas darbosies 2035. gadā, vēl nepastāv. Jaudas blīvums, kas tam būs jāatbalsta, pārsniedz lielāko daļu pašreizējo dizainu. Veidojiet elastību, izveidojiet blīvumu un izveidojiet iespēju, ka viss, ko jūs domājat zināt par datu centru inženieriju, tiks pārrakstīts līdz brīdim, kad jūsu iestāde sasniegs pusmūžu.