
A Runpod Reliability csapatának SRE pozíciója, amely a globális platform elérhetőségéért, teljesítményéért és üzemeltetési kiválóságáért felel, SLO-kialakítással, megfigyelhetőséggel és automatizálással.
Feladatok
- ▹SLI-k/SLO-k meghatározása és bevezetése kritikus szolgáltatásokra
- ▹Incidenskezelés vezetése és keresztcsapati mitigáció koordinálása
- ▹Blameless postmortem-ek lefolytatása, javító intézkedések nyomon követése
- ▹Production readiness review-k végzése új szolgáltatásokra és funkciókra
- ▹Rendszerszintű kockázatok azonosítása és megelőző fejlesztések vezetése
- ▹Monitoring, riasztási rendszerek és dashboardok tervezése és fejlesztése (Prometheus, Grafana)
- ▹A riasztási jel-zaj arány javítása, riasztási fáradtság csökkentése
- ▹Ismétlődő operatív folyamatok automatizálása (Python, Go, Bash)
- ▹CI/CD megbízhatóság és release-folyamatok erősítése
- ▹Együttműködés mérnöki csapatokkal a rendszer-reziliencia, hibatűrés és skálázhatóság javításáért
Elvárások
- ▹5+ év tapasztalat SRE, Reliability Engineering vagy Production Engineering területen
- ▹Erős Linux rendszer- és hálózati ismeretek
- ▹Konténerizált éles rendszerek üzemeltetési tapasztalata
- ▹Elosztott rendszerek és hibamódok erős ismerete
- ▹SLI-k/SLO-k meghatározásának és kezelésének tapasztalata
- ▹Bizonyított incidenskezelési és postmortem-vezetési tapasztalat
- ▹Erős scriptelési vagy programozási készség
- ▹Monitoring és riasztási rendszerek tapasztalata
- ▹Kiváló írásbeli kommunikáció
- ▹Sikeres háttérellenőrzés
Előny
- ▹GPU infrastruktúra vagy AI/ML platform tapasztalat
- ▹Megbízhatóság javítása gyors növekedésű vagy nagy méretű környezetekben
- ▹GPU megfigyelhetőségi eszközök ismerete
- ▹Infrastructure as Code tapasztalat
- ▹Startup környezetben szerzett tapasztalat
- ▹Belső megbízhatósági platformok vagy keretrendszerek építésének tapasztalata
Soft skillek
Proaktív problémamegoldásAutomatizálás-központú gondolkodásErős felelősségvállalás éles rendszerekért
Amit kínálunk
- ▹150 000–200 000 USD versenyképes alapfizetés
- ▹Valódi részvényopció egy gyorsan növekvő vállalatnál
- ▹Bőkezű egészség-, fog- és látásbiztosítás
- ▹Rugalmas fizetett szabadság
- ▹Elsősorban remote, együttműködő, Slack-alapú munkakörnyezet
A munkáltatóról
A Runpod az AI Developer Cloud: több mint egymillió fejlesztő használja platformját kísérletezésre, tréningre és skálázásra, 20 milliárdnál is több inferencia-kérést kiszolgálva. A vállalat 2026 júniusában 100 millió dolláros Series A kört zárt.
Hasonló állások

Állás
Site Reliability Engineer 2
Kong
ArgocdClickhouse
+12
💰 Bér: nincs megadva
🔀 Hibrid
Washington
🗣️ EN

Állás
DevOps Director
Air
CloudformationCypress
+15
💰 Bér: nincs megadva
🏢 Helyszíni
Pittsburgh
🗣️ EN

Állás
Site Reliability Engineer - AI Accelerator Infrastructure - Contract
D Matrix
AI/ML
+9
💰 Bér: nincs megadva
🔀 Hibrid
Santa Clara
🗣️ EN

Állás
Site Reliability Engineer
Axle
AI/ML
+18
140 000–155 000 USD/év
bruttó
🏢 Helyszíni
Frederick
🗣️ EN
Állás
Site Reliability Engineer (SRE)
Bright Vision Technologies
Datadog
+8
100 000–150 000 USD/év
bruttó
🌍 Remote
New Jersey 🇺🇸 United States of America
🗣️ EN

Állás
DevOps Engineer Backend
Airapps
Argocd
+16
109 000–194 000 USD/év
bruttó
🏢 Helyszíni
San Francisco
🗣️ EN