Állás

HPC infrastruktúra megbízhatósági mérnök (SRE)

DevOps / SRE • Remote • Teljes munkaidő • Európai Unió Gloucestershire, EU/EMEA

Egy gyorsan növekvő GPU-as-a-Service szolgáltató keres senior szintű infrastruktúra SRE-t, aki nagy léptékű, elosztott rendszerekben és GPU-alapú HPC/AI infrastruktúrában szerzett tapasztalattal rendelkezik. A szerep 24/7 ügyeleti környezetben biztosítja a kritikus infrastruktúra megbízhatóságát és teljesítményét.

Feladatok

  • ▹Kritikus HPC/AI infrastruktúra üzemeltetése 24/7 ügyeletben
  • ▹GPU-alapú HPC rendszerek hibaelhárítása több rétegen át
  • ▹Új HPC környezetek teljesítményértékelése és üzembe helyezési tesztelése
  • ▹Megfigyelhetőség (observability) és automatizálás fejlesztése
  • ▹Együttműködés hálózati, platform-SRE és adatközponti csapatokkal
  • ▹Visszacsatolás az infrastruktúra-tervezési döntésekhez

Elvárások

  • ▹Nagy léptékű, elosztott rendszerek üzemeltetésében szerzett tapasztalat
  • ▹Friss, gyakorlati HPC és AI infrastruktúra tapasztalat
  • ▹Erős Linux és elosztott rendszerek ismeret
  • ▹NVIDIA GPU ökoszisztéma és RDMA hálózatok (RoCE, InfiniBand) ismerete
  • ▹Tapasztalat bare metal, hálózat, tárolás, virtualizáció és orchestration terén

Előny

  • ▹Legújabb, nagy sűrűségű AI compute platformok ismerete
  • ▹Teljesítmény-validálási és benchmarking tapasztalat
  • ▹Ansible, Prometheus, Grafana eszközök használata

Soft skillek

Kereszt-funkcionális együttműködés több csapattalMélytechnikai, problémamegoldó gondolkodásÖnálló helytállás gyorsan változó, kritikus környezetben

Amit kínálunk

  • ▹Hozzáférés a legmodernebb GPU/CPU platformokhoz
  • ▹Munka a világ legfejlettebb HPC infrastruktúráin

A munkáltatóról

Gyorsan növekvő GPU-as-a-Service szolgáltató, amely skálázható, nagy teljesítményű compute infrastruktúrát biztosít AI és HPC munkaterhelésekhez globális adatközpontokban.

Hasonló állások