Miért állnak gyakran kihasználatlanul a drága AI-GPU-k?

Amikor egy vállalat mesterségesintelligencia-infrastruktúrát épít, könnyű a leglátványosabb komponensekre koncentrálni. Milyen GPU-kra van szükség? Hány gyorsítót érdemes beszerezni? Mekkora számítási teljesítményt kell biztosítani?

A beruházás egyik legdrágább eleme azonban önmagában nem garantálja a megfelelő teljesítményt. Hiába áll rendelkezésre több tucat vagy akár több száz nagy teljesítményű pl. NVIDIA H100 GPU, ha azok nem kapják meg időben azt az adatot, amellyel dolgozniuk kell. Ilyenkor a számítási kapacitás egy része kihasználatlanul marad, miközben a vállalat továbbra is fizeti az infrastruktúra és az energia költségét.

Az AI-infrastruktúrában ezért egyre fontosabb kérdéssé válik, hogy nemcsak mennyi számítási kapacitás áll rendelkezésre, hanem milyen hatékonyan lehet azt adatokkal ellátni.

Amikor a GPU nem számol, hanem vár

Egy nagyobb AI-környezet kihasználtsági adatait vizsgálva könnyen előfordulhat, hogy a GPU-k messze nem működnek folyamatosan, és közel sem maximális kapacitásukon. Ennek elsőre több oka is lehet, de a háttérben gyakran ugyanaz a probléma húzódik meg: az adatok nem érkeznek meg elég gyorsan a feldolgozáshoz.

Egy AI-feladat ugyanis nem a GPU bekapcsolásával kezdődik. Az adatoknak először rendelkezésre kell állniuk a megfelelő forrásrendszerekben, el kell jutniuk a feldolgozási folyamatokhoz, majd végül hozzáférhetővé kell válniuk az AI-szolgáltatás számára. Ha ebben a láncban bárhol késés alakul ki, azt a GPU is megérzi.

Nagyvállalati környezetben ez különösen összetett lehet. Az egyik rendszerből érkező adatra vár egy feldolgozási folyamat, amelyre egy másik AI-feladat vár, miközben az adatforrás saját változásaihoz, karbantartási időablakaihoz vagy egyéb korlátaihoz is alkalmazkodni kell. A végeredmény az lehet, hogy a vállalat jelentős összeget költ a számítási kapacitásra, miközben annak egy része egyszerűen várakozik.

Ezért érdemes az AI-teljesítményt nem kizárólag a GPU-k oldaláról vizsgálni. Legalább ilyen fontos az az infrastruktúra is, amely az adatokat eljuttatja hozzájuk.

Nem minden adat mozgatható szabadon

A probléma egyszerű megoldásnak tűnhet: ha az AI-rendszernek szüksége van az adatokra, másoljuk őket oda, ahol az AI dolgozik.

Egy újonnan kialakított, kisebb környezetben ez valóban működőképes lehet. A nagyvállalati adatkörnyezetek azonban ritkán ilyen egyszerűek. Az adatok általában számos különböző rendszerben, tárolóplatformon, adatbázisban vagy felhőkörnyezetben találhatók, és nem feltétlenül lehet őket egyetlen helyre átmásolni.

Ennek lehetnek szabályozási okai: bizonyos adatokat egy adott országban vagy régióban kell tárolni. Lehetnek biztonsági és adatvédelmi követelmények, amelyek kizárják az adatok szabad mozgatását. Az is előfordulhat, hogy egy üzleti alkalmazás szorosan kapcsolódik az adataihoz, ezért azok áthelyezése komoly változtatásokat vagy hosszabb karbantartási időt igényelne.

Közben maga az adatmennyiség is folyamatosan növekszik. A vállalatok telemetriai adatokat, ügyfélinterakciókat, tranzakciókat és egyéb információkat termelnek egyre nagyobb sebességgel. Mire egy adat egy másik rendszerbe történő másolása befejeződik, már újabb adatok keletkezhetnek.

Ha az AI-rendszer működésének feltétele az, hogy minden adat előbb egy meghatározott tárolási környezetbe kerüljön, az adatmozgatás könnyen az egész infrastruktúra egyik szűk keresztmetszetévé válhat.

Az AI-ban nem minden adat egyforma

A helyzetet tovább bonyolítja, hogy az AI-rendszerekben használt adatok nem feltétlenül ugyanazt a szerepet töltik be.

A Dell az AI-adatkörnyezet három különböző formáját különíti el: magát az adatot, az adatokhoz kapcsolódó metaadatokat, valamint a vektorokat. Ezek eltérő tulajdonságokkal és eltérő infrastruktúra-igényekkel rendelkeznek.

A nagy mennyiségű eredeti adat például maradhat azon a helyen, ahol a vállalat azt szabályozott és biztonságos környezetben kezeli. Az adatokhoz kapcsolódó metaadatok segítségével ugyanakkor az AI-rendszer információt kaphat arról, hogy milyen adatok állnak rendelkezésre és hol találhatók.

A vektorok pedig – amelyek az AI számára fontos jelentésbeli összefüggéseket reprezentálják – más módon használhatók fel, és bizonyos esetekben jóval nagyobb sebességű hozzáférést igényelnek.

Ez a különbség különösen érdekes a nagy nyelvi modellek esetében, ahol egy speciális adatszerkezet, a KV cache is komoly hatással lehet a teljesítményre.

Miért fontos a KV cache?

A nagy nyelvi modellek egy lekérdezés feldolgozása során különféle köztes információkat tárolnak, amelyek segítségével nem kell minden alkalommal a teljes korábbi számítást elölről elvégezni. Ezt a gyorsítótárat nevezzük KV cache-nek (Key-Value cache).

A gyorsítótárat a GPU memóriájában tartani gyors hozzáférést biztosít, ugyanakkor a GPU memóriája korlátozott. Ha a rendszer kiüríti a gyorsítótárat, majd később újra el kell végeznie a szükséges számításokat, az ismételt számítás jelentős többletterhelést jelenthet.

A harmadik lehetőség, hogy a KV cache egy részét a tárolási infrastruktúrába helyezzük át. Ebben az esetben viszont már egyáltalán nem mindegy, milyen gyorsan és milyen hatékonyan tudja a tárolórendszer kiszolgálni a GPU-kat.

A KV cache tehát jó példája annak, hogy az AI-infrastruktúrában a tárolás és a számítási teljesítmény közötti kapcsolat jóval szorosabb lehet, mint egy hagyományos alkalmazás esetében. Nem egyszerűen arról van szó, hogy mennyi adat fér el a tárolón, hanem arról is, hogy az AI milyen gyorsan tud hozzáférni ahhoz, amire éppen szüksége van.

Nem mindegy, mi történik a gyakorlatban

A Dell 2025 októberében Qwen3-32B modellel végzett összehasonlító teszteket, amelyekben többek között a KV cache tárolásának hatását vizsgálták. A mérés során az első token megjelenéséig eltelt időt, vagyis a felhasználó által érzékelt első válasz késleltetését vizsgálták.

A Dell által közölt eredmények szerint a tesztkörnyezetben a PowerScale 0,82 másodperces, az ObjectScale 0,86 másodperces, míg a VAST 1,5 másodperces eredményt ért el. A KV cache kihelyezése nélkül használt standard vLLM-konfiguráció esetében ugyanez az érték 11,8 másodperc volt.

Ezeket az eredményeket természetesen az adott tesztkonfiguráció részeként érdemes értelmezni, nem általános, minden AI-rendszerre érvényes benchmarkként. A mérés ugyanakkor jól szemlélteti azt az alapvető összefüggést, amelyre a Dell felhívja a figyelmet: a tárolási architektúra közvetlenül és drasztikusan befolyásolhatja az AI-feladatok teljesítményét és a GPU-k kihasználtságát.

Az AI-infrastruktúrát már nem elég hagyományos tárolóként vizsgálni

Egy hagyományos tárolórendszer kiválasztásakor természetesen fontos szempont a kapacitás, a sávszélesség és a teljesítmény. AI-környezetben azonban ezek önmagukban már nem adnak teljes képet.

Érdemes azt is megvizsgálni, hogy egy adott infrastruktúra milyen GPU-kihasználtságot tesz lehetővé valódi AI-feladatok során. Mi történik akkor, ha az adatok több különböző rendszerben találhatók? Hogyan működik a rendszer akkor, ha egyes adatokat szabályozási vagy üzleti okokból nem lehet átmásolni? Milyen gyorsan válik egy új adatforrás használhatóvá az AI számára?

Ezek a kérdések már nem pusztán a tároló teljesítményéről szólnak. Arról szólnak, hogy a teljes adatkörnyezet mennyire képes kiszolgálni az AI-rendszert.

A Dell AI Data Platform más megközelítést alkalmaz

A Dell AI Data Platform ennek megfelelően nem abból az alapfeltevésből indul ki, hogy minden adatnak először egyetlen, központi tárolási környezetbe kell kerülnie.

A platform célja, hogy a GPU-k az adatokhoz ott férjenek hozzá, ahol azok ténylegesen találhatók. Ez magában foglalhatja a Dell PowerScale és ObjectScale rendszereit, külső tárolókat, adattárházakat és felhőkörnyezeteket is.

Ennek a megközelítésnek fontos előnye lehet, hogy a nagy mennyiségű eredeti adatnak nem feltétlenül kell elhagynia azt a környezetet, ahol a vállalat kezeli. Az adatokhoz kapcsolódó metaadatok ugyanakkor elérhetővé tehetik az AI-réteg számára a teljes adatkörnyezet áttekintését, míg a vektorok – beleértve a KV cache speciális esetét is – az AI-feldolgozáshoz szükséges sebességgel és közelséggel kezelhetők.

A megközelítés lényege tehát nem egyszerűen egy gyorsabb tároló kialakítása, hanem annak újragondolása, hogyan kapcsolódik egymáshoz az adat, a tárolás és a számítási kapacitás.

Összegzés

Amikor egy vállalat jelentős összeget fordít AI-infrastruktúrára, természetes, hogy elsősorban a számítási kapacitásra koncentrál. Egy nagy teljesítményű GPU azonban csak akkor tudja azt a teljesítményt nyújtani, amire képes, ha az infrastruktúra megfelelően ki is szolgálja.

Ezért az AI-infrastruktúra tervezésekor érdemes nemcsak azt megkérdezni, hogy hány GPU-ra van szükség, hanem azt is, hogy hogyan jut el hozzájuk az adat, milyen gyorsan érhető el, és mi történik akkor, ha az adatok egy része nem helyezhető át egy központi rendszerbe.

A Dell megközelítése erre a problémára a federált adatkezelés és a GPU-k közvetlenebb kiszolgálása felől ad választ. A cél az, hogy a számítási kapacitás minél több időt töltsön tényleges munkával, és minél kevesebbet várjon az adat-infrastruktúrára.

Mert egy AI-infrastruktúra valódi értékét végső soron nem az mutatja meg, hogy hány GPU található benne, hanem az is, hogy ezekből mennyi kapacitást tudsz ténylegesen munkára fogni.

Ha AI-infrastruktúra kialakítását, bővítését vagy meglévő környezeted optimalizálását tervezed, a HRP Europe szakértői segíthetnek megtalálni a vállalatod igényeihez legjobban illeszkedő megoldást.
Elnyerte a tetszését cikkünk? Ossza meg másokkal is!
Megosztás Facebookon
Megosztás Twitteren
Megosztás Linkedinen
Megosztás Emailben
Legutóbbi cikkeink