Az AI nemcsak GPU-kat és megawattokat fogyaszt: a felhasznált energia jelentős része végül hővé alakul. Az LG az AI-boom kevésbé látványos oldalát célozza új Air-Cooled Centrifugal Chiller adatközponti hűtőberendezésével, amely 480–600 RT teljesítményosztályokban érhető el. Ez átszámítva körülbelül 1,7–2,1 MW hűtőteljesítményt jelent egységenként.

A vállalat képein hosszú ipari berendezés látható, tucatnyi ventilátorral, kompresszorral, csővezetékkel és hőcserélővel. Fontos tisztázni: nem egy olyan eszközről van szó, amely közvetlenül az NVIDIA GPU-kra fújja a hideg levegőt a rackekben.

A chiller az adatközpont infrastruktúrájában keringő vizet hűti. A kör ezután CRAH egységekkel klimatizálhatja a géptermet, vagy CDU-kon keresztül egészen közel viheti a hűtőfolyadékot a processzorokhoz és gyorsítókhoz. Ez tehát a hőnek a chiptől az épületen kívüli környezetig vezető lánc egyik nagyméretű eleme.

Az AI-adatközpontok hűtése is megawattos feladat: új LG chiller érkezett
Az AI-adatközpontok hűtése is megawattos feladat: új LG chiller érkezett 2

Mágnesesen lebegő, olajmentes kompresszor

A műszakilag érdekesebb elem a mágneses csapágyazású centrifugálkompresszor. Forgórészét mágneses erők tartják a helyén, ezért normál működés közben nincs mechanikus érintkezés.

Ez szükségtelenné teszi a hagyományos olajkenési kört, és mérsékli a súrlódási veszteségeket. A kenéshez kapcsolódó kevesebb alkatrész egyben kevesebb karbantartási pontot is jelent.

Az LG hűtőközeges free-cooling technológiát is alkalmaz. A név nem ingyenes hűtést jelent.

Elég alacsony külső hőmérsékletnél a kinti levegő nagyobb részt vállalhat a hőterhelésből, így a kompresszoroknak kevesebbet kell dolgozniuk. Az LG megoldásában a hűtőközeg közvetlenül kering, köztes hőcserélő és egyes hagyományos rendszerekben alkalmazott glikolkör nélkül.

A cél egyszerű: kisebb hő- és nyomásveszteség, valamint könnyebben karbantartható rendszer.

30%-os energiamegtakarítás? Igen, de LG-szimulációban

Itt érdemes fenntartással kezelni a legfeltűnőbb számot. Az LG szerint hűtőközeges free-cooling technológiája évente körülbelül 30%-kal kevesebb energiát fogyaszthat a waterside free-coolingnál.

Ez azonban nem egy kereskedelmi adatközpontban, egy éven át mért eredmény, hanem az LG belső szimulációja, amely egy 100%-os terhelésen üzemelő, 1750 kW-os berendezést és Szöul nagyvárosi térségének időjárási viszonyait vette alapul.

A vállalat számítása szerint:

  • 1 044 824 kWh/év a hűtőközeges free-cooling esetén;
  • 1 479 655 kWh/év a vizes változatnál.

A különbség jelentős, de valós telepítésben függ az éghajlattól, a vízhőmérsékletektől, az IT-terheléstől és a teljes hűtési rendszer kialakításától. A magyarországi szezonális viszonyok ezért önmagukban nem vetíthetők rá a szöuli szimulációra.

Az LG a Series Counter Flow (SCF) technológiát is használja, amely elosztja a hűtési terhelést a kompresszorok között. Nem változtatja meg az alapelvet, de változó hűtési igénynél igyekszik hatékony tartományban tartani a rendszert.

Áramszünet után három percen belül visszatérhet a teljes kapacitás

Beépített UPS is van, de ezt nem egy óriási akkumulátorként kell elképzelni, amely áramszünetben tovább működteti a megawattos hűtést.

Feladata célzottabb: ellátja a mágnesesen tartott forgórész biztonságos leállításához szükséges komponenseket, csökkentve a csapágyak sérülésének kockázatát.

Az áramellátás helyreállása után az LG szerint a rendszer legfeljebb három percen belül újra elérheti a maximális hűtőteljesítményt. A gyártó hozzáteszi, hogy az érték a tesztkörülményektől függhet.

A gépi tanulás is szerepet kap, de nem a berendezéssel való társalgásra. Az algoritmusok figyelik a kompresszor viselkedését, és a működést úgy szabályozzák, hogy mérsékeljék a surge kockázatát, vagyis azt az állapotot, amikor a centrifugálkompresszor áramlása instabillá válik.

A chiptől a kültéri hűtőberendezésig

A chiller nem önálló termékként érkezik: az LG az AI-adatközpontok teljes hőkezelési láncának egyre nagyobb részét kívánja lefedni.

A vállalatnak már van egy 2,6 MW-os, NVIDIA DSX Ready minősítésű CDU-ja, amely közvetlenül a chipek hűtésére szolgál. Fontos különbség, hogy a NVIDIA-minősítés a CDU-ra, nem az új chillerre vonatkozik.

A CDU a CPU-k és GPU-k környezetében keringő folyadékkörből a létesítmény hűtési infrastruktúrájába továbbítja a hőt. A chiller ennek az infrastruktúrának az egyik hőelvezető eleme. Az LG erre a kombinációra a „Chip-to-Chiller” kifejezést használja.

A stratégia az NVIDIA-val való szélesebb együttműködéssel is bővült: az LG nemrég csatlakozott az NVIDIA Partner Networkhöz mint Power and Cooling Solution Preferred Partner. A vállalatnak már 600 kW-os, 1 MW-os és 2,6 MW-os, különböző NVIDIA-minősítési folyamatokon átesett CDU-modelljei vannak, és egy 4 MW-os változatot is előkészít.

Ez is jelzi, hogy az AI-infrastruktúráért folyó verseny már nem kizárólag a GPU-król szól. A Google, a Microsoft, az Amazon és a Meta hatalmas összegeket fordít energiára és adatközpontokra, és ebben az egyenletben a hűtés egyre fontosabb tényező.

Ilyen számítási sűrűség mellett a GPU-k által felvett energia szinte teljes egészében hővé alakul, amelyet el kell vezetni az épületből. Ha pedig maga a hűtőrendszer is túl sok energiát igényel, tovább nő az üzemeltetési költség és a szükséges villamos infrastruktúra mérete.

Ezért jelennek meg olyan projektek is, amelyekben az NVIDIA és a Google az AI-adatközpontok terhelését a villamos hálózat kevésbé túlterhelt időszakaihoz próbálja igazítani.

A hűtési rendszer is egyre inkább előre összeállított csomagként érkezik

Az LG egy moduláris hidronikus megoldást is fejleszt, amelyben olyan elemek, mint a hűtöttvíz-szivattyúk és a hőtároló puffertartály előregyártott modulba kerülnek.

Ahelyett, hogy a rendszer nagy részét helyszínen, elemenként építenék ki, a modulok gyárban szerelhetők össze, majd később telepíthetők. Ez főként logisztikai előny: az adatközpont új rackek üzembe állításával fokozatosan bővítheti kapacitását, anélkül hogy minden alkalommal a teljes hűtési rendszert újra kellene tervezni.

Egy chiller talán nem olyan látványos, mint egy több ezer CUDA-maggal felszerelt gyorsító, de az AI-infrastruktúra valósága itt válik nyilvánvalóvá: a megawattnyi számítás megawattnyi hővel jár, és ezt a hőt valakinek el kell vezetnie.