Állás · Senior

Senior HPC-klaszter rendszergazda (deep learning keretrendszerek infrastruktúrája)

AI / ML Engineer • Senior • Remote • Teljes munkaidő • Lengyelország Lengyelország

Az NVIDIA Deep Learning Frameworks infrastruktúra-csapata senior HPC-klaszter rendszergazdát keres, aki a nagy léptékű GPU-klaszterek tervezését, telepítését és megbízhatóságát vezeti, a DGX/HGX platformoktól a Grace Blackwell rendszerekig.

Feladatok

  • ▹A GPU-klaszterek teljes életciklusának kezelése (beszerzés, üzembe helyezés, konfigurációkezelés, monitorozás, kivezetés) heterogén Linux környezetben (DGX, HGX, embedded rendszerek)
  • ▹Tárolási megoldások (NFS, Lustre, WekaFS vagy egyenértékű) tervezése és skálázása, világos kapacitás- és teljesítményterv mellett
  • ▹Az infrastruktúra automatizálásának vezetése modern IaC-eszközökkel (Ansible, Terraform) és CI/CD-pipeline-okkal (GitLab)
  • ▹Feladatütemezés kezelése és optimalizálása Slurmmal, beleértve a fair-share szabályokat, a foglalásokat és a MIG/GPU-particionálási stratégiákat
  • ▹Megfigyelhetőségi rendszerek (Prometheus, Grafana, DCGM) karbantartása és fejlesztése, a hardver- és szoftverincidensek proaktív megoldása
  • ▹Együttműködés ML-mérnökökkel és szoftvercsapatokkal a klaszterkonfiguráció hangolásához nagy léptékű elosztott tanítási feladatokra
  • ▹Új technológiák (hálózati fabricek: InfiniBand, NVLink, EFA/RDMA; tárolási szintek; konténer-futtatókörnyezetek) értékelése és bevezetése a teljesítmény és megbízhatóság javításáért
  • ▹Junior mérnökök mentorálása és a csapat mérnöki szabványaihoz való hozzájárulás

Elvárások

  • ▹BS/MS diploma informatikából, villamosmérnöki vagy számítógép-mérnöki területen, vagy azzal egyenértékű gyakorlati tapasztalat
  • ▹5+ év tapasztalat nagy léptékű HPC- vagy ML-tanító klaszterek telepítésében és üzemeltetésében
  • ▹Mély Linux rendszergazdai szakértelem nagy léptékben
  • ▹Erős szkriptelési és automatizálási készség Pythonban és/vagy bashben
  • ▹Gyakorlati Slurm-tapasztalat (ütemezés, accounting, cgroup-konfiguráció)
  • ▹Konfigurációkezelés és IaC ismerete (Ansible szükséges; a Terraform előny)
  • ▹Konténertechnológiák ismerete (Docker, Apptainer/Singularity, Kubernetes)
  • ▹A nagy sebességű hálózatok (InfiniBand, RoCE, RDMA, EFA) szilárd ismerete
  • ▹Tapasztalat elosztott/párhuzamos fájlrendszerekkel és tárolási architektúrával
  • ▹Problémák végpontig történő kezelése, világos kommunikáció mérnöki és vezetői szereplőkkel

Előny

  • ▹NVIDIA GPU-infrastruktúra eszközök ismerete (DCGM, nvidia-smi, MIG, NVSwitch diagnosztika)
  • ▹Klaszterkezelő platformok ismerete (Colossus, Bright Cluster Manager, xCAT vagy hasonló)
  • ▹Nagy léptékű elosztott deep learning feladatok támogatásában szerzett tapasztalat (PyTorch, JAX, Megatron)
  • ▹BMC/IPMI/Redfish ismerete sávon kívüli kezeléshez és a hardver életciklusához
  • ▹MLOps-eszközök vagy ML-platform mérnöki háttér

Soft skillek

Problémák végpontig történő felelős kezeléseVilágos kommunikáció mérnöki és vezetői szereplőkkelMentorálás

Amit kínálunk

  • ▹Alapbér Lengyelországban: 221 250–383 500 PLN a 3. szinten, 292 500–507 000 PLN a 4. szinten
  • ▹Befogadó, együttműködő munkakörnyezet

A munkáltatóról

Az NVIDIA Deep Learning Frameworks (DLFW) infrastruktúra-csapata azokat a nagy léptékű GPU-klasztereket üzemelteti, amelyeken az iparág legigényesebb deep learning tanítási, inferencia- és HPC-feladatai futnak.

Végzettség: BS/MS informatikából, villamosmérnöki vagy számítógép-mérnöki területen, vagy egyenértékű gyakorlati tapasztalat

Hasonló állások