Állás

Infrastruktúra-mérnöki igazgató

Platform Engineer • Remote • Teljes munkaidő Amerikai Egyesült Államok USA

Vezetői pozíció a Runpod alapvető cloud és bare-metal infrastruktúrájának (SRE, globális hálózat, HPC hálózatok, elosztott tárolás) irányítására és skálázására, szoros együttműködésben a termék- és GTM-vezetéssel.

Feladatok

  • Több mérnöki csapat (SRE, hálózat, tárolás) vezetése és irányítása
  • Szigorú SRE gyakorlatok kialakítása: SLA/SLO-k, incidenskezelés, megfigyelhetőség, automatizált helyreállítás
  • Globális hálózati gerinchálózat és ultraalacsony késleltetésű HPC klaszterhálózatok tervezése, skálázása és üzemeltetése
  • InfiniBand és RDMA over Converged Ethernet (RoCE) bevezetése és optimalizálása nagy méretű, több csomópontos GPU-tréning terhelésekhez
  • Nagy skálázhatóságú, elosztott tárolórendszerek architektúrájának és teljesítmény-hangolásának irányítása
  • Erős, technikailag képzett szervezet felépítése: toborzás, mentorálás, csapatvezetők és senior mérnökök fejlesztése
  • Kapacitástervezés és technikai útiterv alakítása a Program Management és Product csapatokkal
  • Mérhető javulás elérése a megbízhatósági és teljesítménymutatókban (deploy gyakoriság, MTTR, IaC lefedettség, uptime)
  • Architekturális felügyelet bare-metal provisioning, virtualizáció, hálózati fabric-ek és tárolóklaszterek terén
  • Keresztfunkcionális együttműködés a termék- és platformcsapatokkal

Elvárások

  • 7+ év vezetői tapasztalat szoftver-, infrastruktúra-, SRE- vagy hálózati csapatok irányításában, menedzserek és több csapat vezetésével, magas rendelkezésre állású felhőkörnyezetek skálázásában bizonyított eredményekkel
  • 8+ év nagy méretű elosztott rendszerek, bare-metal infrastruktúra vagy publikus/privát felhőplatformok építésében és üzemeltetésében
  • Gyakorlati vagy erős architekturális háttér ultraalacsony késleltetésű hálózatokban: InfiniBand és/vagy RoCE, spine-leaf architektúrák, globális WAN routing (BGP)
  • Nagy teljesítményű elosztott tárolórendszerek és párhuzamos fájlrendszerek (pl. Ceph, Lustre, Weka, NVMe-oF) építésének, üzemeltetésének vagy hangolásának tapasztalata
  • Erős SRE/DevOps kultúra: megbízhatósági mérnökség, infrastructure-as-code (Terraform, Ansible), konténer-orkesztráció (Kubernetes), modern megfigyelhetőségi stackek
  • Remote-first működési kiválóság: kultúra-, felelősség- és lendületépítés elosztott technikai csapatokban
  • Egyértelmű írásbeli és szóbeli kommunikáció, erős stakeholder-menedzsment, nyugodt döntéshozatal magas tétű incidensek során
  • Sikeres háttérellenőrzés

Előny

  • Közvetlen tapasztalat GPU-klaszterekre és AI/ML terhelésekre optimalizált infrastruktúra tervezésében
  • Hardverarchitektúrák, GPU összeköttetések (NVLink) és adatközponti topológia mély ismerete
  • Infrastruktúra-csapatok skálázása gyorsan növekvő startup környezetekben
  • Nyílt forráskódú hozzájárulások vagy elismertség az infrastruktúra-, hálózati vagy Kubernetes-közösségekben

Soft skillek

Nyugodt, határozott vezetés magas tétű üzemeltetési incidensek soránErős stakeholder-menedzsmentVilágos írásbeli és szóbeli kommunikáció

Amit kínálunk

  • 225 000–325 000 USD versenyképes alapfizetés
  • Valódi részvényopció egy gyorsan növekvő vállalatnál
  • Bőkezű egészség-, fog- és látásbiztosítás
  • Rugalmas fizetett szabadság
  • 1200 USD home office és eszköz támogatás
  • Elsősorban remote, együttműködő, Slack-alapú munkakörnyezet

A munkáltatóról

A Runpod az AI Developer Cloud: több mint egymillió fejlesztő használja platformját kísérletezésre, tréningre és skálázásra. A vállalat 2026 júniusában 100 millió dolláros Series A kört zárt, és a következő generációs fejlesztői platform építésén dolgozik.

Hasonló állások