Állás

Industrial AI Cloud – infrastruktúra-mérnök

Platform Engineer • Helyszíni • Teljes munkaidő • Magyarország Budapest, Magyarország

Az NVIDIA és a Deutsche Telekom közös ipari AI-felhőjének számítási, hálózati és tárolási környezetét építed, automatizálod és üzemelteted: nagyméretű GPU-klasztereket, bare-metal szervereket, IaC-automatizálást és monitoringot ITIL-folyamatok mentén.

Feladatok

  • ▹Az adatközponti csapatokkal való üzemeltetési koordináció: hardver-életciklus tevékenységek (telepítés, GPU-bővítés, tárbővítés, firmware-frissítés), szerver- és hálózati összeköttetések és a kapcsolódó dokumentáció (NetBox) kezelése
  • ▹Bare-metal szerverek és GPU-csomópontok telepítése és karbantartása (PXE boot, OS-telepítés, firmware-frissítés)
  • ▹Az NVIDIA AI-hoz kapcsolódó infrastruktúra-stack tervezése és üzemeltetése
  • ▹Ansible és Terraform playbookok fejlesztése és karbantartása a provisioninghoz, konfigurációhoz és telepítésekhez
  • ▹Debian-alapú környezetek karbantartása, patchelés, firmware-frissítések nagy léptékben
  • ▹Keycloak, Entra ID / CAIMAN és AD integrálása és karbantartása a felhasználók hitelesítéséhez és jogosultságkezeléséhez
  • ▹Elosztott AI-terhelések futtatásának támogatása bare-metal hosztokon és Kubernetes környezetben
  • ▹Prometheus és Grafana alapú monitoring és riasztás üzemeltetése
  • ▹Nagy teljesítményű tárolókörnyezetek (WEKA by Hitachi) adminisztrációja
  • ▹Incidens-, probléma- és változáskezelési folyamatok követése és javítása, runbookok és szabványos működési eljárások dokumentálása; a ZERO Outage irányelvek betartása
  • ▹Projekt-szállítmányok elkészítése az NVIDIA technológiai stackre fókuszálva

Elvárások

  • ▹Tapasztalat hardvertelepítésben, karbantartásban és üzemeltetésben
  • ▹Haladó Linux-ismeret (lehetőleg Debian) éles környezetben
  • ▹Gyakorlat Infrastructure-as-Code eszközökkel (Ansible, Terraform); a Redfish ismerete előny
  • ▹NVIDIA GPU-gyorsított szerverplatformok ismerete
  • ▹Az NVIDIA AI szoftverstack ismerete a GPU-orchestrációhoz
  • ▹GPU-alapú felhőplatform-szoftverstack és az alatta lévő rétegektől való függőségeinek ismerete
  • ▹Hálózati alapok biztos ismerete (IP, routing, VLAN, DNS, tűzfalak, L1, L2)
  • ▹Tapasztalat identitás- és hozzáférés-kezelő rendszerekkel (Keycloak, Entra ID, LDAP)
  • ▹Monitoring stackek (Prometheus, Grafana) ismerete
  • ▹Nagy teljesítményű tárolórendszerek ismerete (a WEKA by Hitachi előny)
  • ▹Az ITIL-folyamatok (incidens, probléma, változás) gyakorlati ismerete
  • ▹Erős hibakereső és üzemeltetés-támogató készség 24/7-es, üzletkritikus környezetben

Előny

  • ▹Tapasztalat nagy GPU-klaszterekkel, HPC- vagy adatközponti környezetekkel
  • ▹A szuverén felhő, valamint az adatbiztonsági és megfelelőségi követelmények ismerete
  • ▹Terraform és GitOps ismerete infrastruktúra-változtatásokhoz

Soft skillek

Több csapat közötti koordináció

Amit kínálunk

  • ▹Munka Európa első ipari AI-felhőjén, élvonalbeli technológiákkal
  • ▹Közvetlen együttműködés NVIDIA és Deutsche Telekom szakértőkkel
  • ▹Hibrid munkavégzés, képzési lehetőségek és karrierfejlődés
  • ▹Távmunka csak Magyarország területén lehetséges

A munkáltatóról

A Deutsche Telekom IT Solutions a Deutsche Telekom csoport leányvállalata, több mint 5300 munkatárssal; négy magyarországi telephelye Budapesten, Debrecenben, Pécsett és Szegeden van. Az NVIDIA-val közösen fejlesztett ipari AI-felhő egy németországi AI-gyár, amely 10 000 GPU-t fog futtatni.

Hasonló állások