Állás · Senior

Vezető AI/HPC-architekt

Software Architect • Senior • Remote • Teljes munkaidő • Olaszország Olaszország

Az NTT DATA AI Factories részlegében a legnagyobb nagyvállalati ügyfelek komplex AI-infrastruktúra-megoldásait tervezed: GPU- és gyorsítós számítási kapacitást, tárolást és AI-hálózatot. A szerep architekturális és előértékesítési feladatokat is magában foglal.

Feladatok

  • ▹Nagy, összetett AI-infrastruktúra-megoldások teljes körű tervezése vállalati, szuverén AI- és AI Factory-ügyfeleknek: gyorsított számítási kapacitás (NVIDIA H100/H200/B200 és GB200 NVL72, AMD Instinct MI300X/MI325X, Intel Gaudi 3), CPU-platformok (Intel Xeon, AMD EPYC, NVIDIA Grace), nagy áteresztőképességű tárolási rétegek és veszteségmentes AI-hálózat
  • ▹Referencia-architektúrák kialakítása NVIDIA DGX/HGX SuperPOD, Dell AI Factory with NVIDIA, Cisco Nexus HyperFabric AI, valamint HPE / Lenovo / Supermicro és egyenértékű platformokra, az egyetlen csomópont teljesítménye és a klaszter szintű hatékonyság egyensúlyával
  • ▹GPU-klaszterek méretezése és validálása valós terheléseken (alapmodell-előtanítás, elosztott finomhangolás, RAG, valós idejű és kötegelt inferencia) NVLink/NVSwitch, InfiniBand NDR/XDR, Ultra Ethernet és NVIDIA Spectrum-X hálózatokkal, valamint többszintű NVMe- és párhuzamos tárolással (VAST, WEKA, DDN, Pure FlashBlade, NetApp ONTAP AI, Dell PowerScale)
  • ▹A támogató adatközponti terv meghatározása: nagy sűrűségű áramellátás (50-140 kW/rack), közvetlen chiphűtés és hátsó ajtós folyadékhűtés, AI-hálózatok strukturált kábelezése, moduláris telepítési modellek on-prem, colo és szuverén felhős környezetben
  • ▹Az értékesítési csapattal együttműködve az AI-infrastruktúra-ajánlatok előértékesítési folyamatának vezetése: ügyfélfelmérés, műszaki workshopok, ajánlatírás, vezetői prezentációk, pályázatvédés
  • ▹Az ügyfelek AI-céljainak és üzleti eredményeinek lefordítása hardver- és platform-ütemtervre, az NTT DATA teljes portfóliójának (szilícium, rendszerek, tárolás, hálózat, MLOps-stack, menedzselt szolgáltatások) pozicionálása
  • ▹Számítási kapacitás, tárolás, hálózat, AI-szoftverstack (CUDA, ROCm, Triton, NIM, NVIDIA AI Enterprise, Run:ai, Slurm, Kubernetes / Kubeflow) és menedzselt szolgáltatási üzemeltetési modellek integrációjának vezetése több szakterületen, szállítási egységen és régión át
  • ▹Üzleti esetek, TCO- és egységgazdaságossági modellek (tokenenkénti költség, tanítási futásonkénti költség, GPU-óra gazdaságtan), valamint átállási ütemtervek készítése felhőből privát AI-ba és szuverén AI-telepítésekhez
  • ▹Az AI-infrastruktúra architekturális elveinek meghatározása (gyorsítók kihasználtsága, adatgravitáció, többbérlős működés, modell-életciklus, energiahatékonyság) és alkalmazásuk az architekturális döntésekben és irányításban
  • ▹As-Is, Vision, FMO és To-Be AI-platform-architektúrák kidolgozása, hiányosságok azonosítása, átállási ütemtervek készítése
  • ▹Az AI-szilícium, a memóriahierarchiák (HBM3e, CXL), az összekötők és az AI-szoftverstackek aktuális és jövőbeli trendjeinek összevetése az ügyfelek stratégiai céljaival bizonyítékokon alapuló megoldások érdekében
  • ▹Hozzájárulás az NTT DATA AI Factories tudásbázisához referencia-architektúrák, méretezőeszközök és tanulságok megosztásával belső csapatoknak és ügyfeleknek

Elvárások

  • ▹Mély, gyakorlati ismeret az AI-hardverről: GPU- és gyorsítóportfóliók (NVIDIA Hopper / Blackwell, AMD MI300/MI325, Intel Gaudi 3, feltörekvő egyedi szilícium), gazda-CPU platformok (Intel Xeon, AMD EPYC, NVIDIA Grace), rendszertopológiák (HGX, DGX, MGX, OAM), és hogy az egyes döntések hogyan illeszkednek az AI-terhelésekhez
  • ▹Erős ismeret az AI-osztályú tárolásról: párhuzamos fájlrendszerek, all-flash NVMe platformok, S3-osztályú objektumtárak, checkpoint- és adathalmaz-folyamatok, nagy léptékű tanítás és inferencia I/O-mintái (VAST, WEKA, DDN EXAScaler, Pure FlashBlade, NetApp ONTAP AI, Dell PowerScale)
  • ▹Biztos tudás az AI-hálózatokról: InfiniBand NDR/XDR, RoCEv2, NVIDIA Spectrum-X, Ultra Ethernet, NVLink/NVSwitch, torlódáskezelés, rail-optimalizált és fat-tree topológiák tervezése
  • ▹Gyakorlati ismeret az AI-szoftver- és orkesztrációs stackről: CUDA, cuDNN, NCCL, ROCm, Triton Inference Server, NIM, vLLM, TensorRT-LLM, Slurm, Kubernetes (GPU Operatorral), Kubeflow, Run:ai, MLflow és NVIDIA AI Enterprise
  • ▹Jártasság az AI-terhelések adatközponti létesítménymérnökségében: nagy sűrűségű áramellátás, folyadékhűtés (DLC, hátsó ajtós, immerziós), PUE/WUE-optimalizálás, meglévő colo-terek gyorsított számításra való átalakításának gyakorlati korlátai
  • ▹Kiváló írásbeli és szóbeli kommunikáció: összetett műszaki fogalmak közvetítése műszaki és nem műszaki vezetői közönségnek
  • ▹Erős rendszerszemlélet és stratégiai gondolkodás: egy rendszer kulcselemeinek egyszerű absztrakcióba foglalása a jó döntések megalapozásához
  • ▹Erős üzleti pénzügyi készségek: költség-haszon elemzés, CAPEX és OPEX összehasonlítás, költségvetés-kezelés
  • ▹Ismeret a felhős, hibrid és szuverén AI-telepítési mintákról, valamint az Agile, DevSecOps és MLOps architekturális irányításáról
  • ▹Jelentős ismeret a menedzselt szolgáltatási portfólió artefaktumairól, technikáiról, demóiról, eszközeiről és leszállítandó elemeiről, AI-platform-üzemeltetésre alkalmazva
  • ▹Alapdiploma vagy egyenértékű végzettség informatikai, mérnöki, számítástudományi vagy kapcsolódó területen
  • ▹Jelentős tapasztalat tanácsadói, előértékesítési vagy architekt szerepkörben nagy, lehetőleg multinacionális technológiai szolgáltatói környezetben, AI-infrastruktúra-ajánlatok vezetésében szerzett referenciákkal
  • ▹Igazolt tapasztalat éles AI-platformok tervezésében és szállításában, az egyetlen több-GPU-s szervertől a több rackes tanítási klaszterekig és inferencia-üzemekig
  • ▹Erős gyakorlati ismeret az AI-hardverszállítói piacról (NVIDIA, AMD, Intel, Dell, HPE, Lenovo, Supermicro, Cisco, Pure, VAST, WEKA, DDN, NetApp) és a partneri ökoszisztéma versenyképes pozicionálásáról
  • ▹Bizonyított képesség az AI-terhelési követelmények (modellméret, paraméterszám, szekvenciahossz, áteresztőképességi SLO-k, késleltetési célok) pontos hardveres anyagjegyzékekre és méretezési indoklásokra fordítására
  • ▹Jelentős ügyfélkapcsolati és tanácsadói tapasztalat: igényfelmérés, változáskezelés, új AI-infrastruktúra- és menedzseltszolgáltatás-lehetőségek azonosítása
  • ▹Jelentős üzletfejlesztési és előértékesítési tapasztalat infrastruktúra-alapú üzletekben, lehetőleg szuverén AI, AI Factory vagy szabályozott iparági GenAI-programok területén
  • ▹Erős megértés arról, hogyan kapcsolódik az AI-infrastruktúra az üzleti folyamatokhoz, alkalmazásokhoz, adatplatformokhoz és a meglévő vállalati architektúrához

Előny

  • ▹Mester- vagy doktori fokozat
  • ▹Szállítói és technológiai tanúsítványok az AI-infrastruktúra területén, például NVIDIA-Certified Associate / Professional (AI Infrastructure, AI Operations), Dell Technologies AI Factory, Cisco / Nutanix / HPE gyorsított számítás, Red Hat OpenShift AI, Run:ai, valamint releváns tárolási és hálózati tanúsítványok
  • ▹Scaled Agile tanúsítvány

Soft skillek

Kiváló kommunikáció műszaki és vezetői közönség előttRendszerszemlélet és stratégiai gondolkodásÜgyfélkapcsolati és tanácsadói készség

Amit kínálunk

  • ▹Távmunka

A munkáltatóról

Az NTT DATA üzleti és technológiai szolgáltatások vezető vállalata, évi több mint 30 milliárd dolláros bevétellel, a Fortune Global 100 75%-át kiszolgálva. Az NTT Csoport tagja, amely évente több mint 3 milliárd dollárt fektet K+F-be, szakértői pedig több mint 50 országban dolgoznak.

Végzettség: Alapdiploma vagy egyenértékű végzettség informatikai, mérnöki, számítástudományi vagy kapcsolódó területen; mester- vagy doktori fokozat előny

Hasonló állások