Állás

Adatközponti infrastruktúra-szakértő

Egyéb • Remote • Teljes munkaidő • Európai Unió EU/EMEA

A Runpod globális, nagy sűrűségű GPU-flottájának üzemeltetési és életciklus-kezelési szakértőjét keresik, aki a hardverpartnerek és a belső mérnökcsapatok közötti technikai összekötő. A szerep HPC-rendszermérnökséget, hálózati hibaelhárítást és folyamatautomatizálást ötvöz.

Feladatok

  • ▹Új hardverek validálása és tesztelése, hogy a partnerek telepítései megfeleljenek az elosztott AI/ML munkaterhelések előírásainak
  • ▹A flotta állapotának figyelése a teljesítményromlás korai észleléséhez; az állásidők auditálása és a szükséges műszaki adatok biztosítása az ügyfél-SLA-k védelméhez
  • ▹LLM-ekkel és AI-ügynökökkel a hálózati hibaelhárítás automatizálása és dinamikus üzemeltetési kézikönyvek készítése
  • ▹Műszaki incidenskommunikáció koordinálása, a kiesések érthető, megoldás felé vezető összefoglalása
  • ▹Az infrastruktúra-partnerek növekedésének műszaki támogatása

Elvárások

  • ▹3-5 év tapasztalat infrastruktúra-üzemeltetésben, rendszermegbízhatóságban vagy adatközponti mérnöki munkában
  • ▹Erős ismeretek az adatközponti hálózatok és a teljesítmény-hibaelhárítás területén
  • ▹Gyakorlati tapasztalat az NVIDIA szoftververemmel (illesztőprogram-telepítés, teljesítményeszközök) és a többcsomópontos teljesítményhangolás ismerete
  • ▹Megbízható Linux-rendszergazdai tudás és tapasztalat konténerizációval (Docker)

Előny

  • ▹RDMA, InfiniBand vagy RoCE ismerete (erősen előnyös)

Soft skillek

KommunikációFelelősségvállalás

Amit kínálunk

  • ▹Távoli munkavégzés (remote-first csapat)

A munkáltatóról

A Runpod az AI Developer Cloud: több mint egymillió fejlesztő használja AI-modellek kísérletezésére, tanítására, finomhangolására és üzemeltetésére. A platform több mint 20 milliárd inferenciakérést dolgozott fel, a cég 2026 júniusában 100 millió dolláros A sorozatú finanszírozást zárt. Kis, remote-first csapat.

Hasonló állások