Állás · Senior

Senior Site Reliability Engineer, DGX Cloud

DevOps / SRE • Senior • Remote • Teljes munkaidő • Svájc Svájc

Az NVIDIA DGX Cloud csapatához keresnek tapasztalt Senior SRE-t, aki nagy teljesítményű, felhő alapú AI-klasztereket üzemeltet és tart megbízhatóan működésben kutatók és vállalati ügyfelek számára világszerte.

Feladatok

  • ▹Nagyméretű Kubernetes-klaszterek üzemeltetési és megbízhatósági támogatása
  • ▹SLO/SLI-k meghatározása és hibaköltségvetés (error budget) monitorozása
  • ▹Szolgáltatások bevezetés előtti és utáni támogatása, kapacitástervezés
  • ▹GPU-terhelések üzemeltetése AWS, GCP, Azure, OCI és privát felhőkön
  • ▹Rendszerek automatizált skálázása és megbízhatósági fejlesztése
  • ▹Súlyos incidensek kivizsgálása és gyökérok-elemzés vezetése
  • ▹Részvétel ügyeleti (on-call) rotációban

Elvárások

  • ▹Informatika vagy rokon terület BSc, vagy azzal egyenértékű tapasztalat
  • ▹10+ év tapasztalat éles szolgáltatások üzemeltetésében
  • ▹Kiváló szintű Kubernetes-adminisztráció és konténerizáció
  • ▹Infrastruktúra-automatizálási eszközök (Terraform, Ansible, Chef, Puppet)
  • ▹Legalább egy magas szintű nyelv (pl. Python, Go)
  • ▹Mély Linux és hálózati (TCP/IP) ismeretek, felhőbiztonsági szabványok
  • ▹SRE-alapelvek: SLO, SLI, hibaköltségvetés, incidenskezelés
  • ▹Observability-stack építése (OpenTelemetry, Prometheus, Grafana, ELK, Splunk)

Előny

  • ▹GPU-gyorsított klaszterek üzemeltetése KubeVirttel éles környezetben
  • ▹Generatív AI alkalmazása az üzemeltetési terhek csökkentésére
  • ▹Munkafolyamat-orkesztráló platformok (Temporal, Cadence, Airflow, Argo Workflows)

Soft skillek

Kiegyensúlyozott incidenskezelés, hibáztatásmentes utóelemzésCsapatmunka és kereszt-funkcionális együttműködés

A munkáltatóról

Az NVIDIA több mint 25 éve alakítja át a számítógépes grafikát és a gyorsított számítástechnikát; a DGX Cloud egy teljes körűen menedzselt AI-platform a vezető felhőszolgáltatóknál.

Hasonló állások