
Állás
Site Reliability Engineer - AI & ML Infrastruktúra (Kubernetes, AWS és Terraform)
DevOps / SRE
• Remote
• Teljes munkaidő
•
USA
A Deepgram tapasztalt Site Reliability Engineert keres, aki felépíti és üzemelteti a cég hibrid AI/ML infrastruktúráját, amely AWS-t és saját (bare metal) adatközponti szervereket egyaránt magába foglal.
Feladatok
- ▹Kubernetes-alapú számítási platform kiépítése és karbantartása AWS-en és helyszíni környezetben
- ▹Infrastruktúra fejlesztése és kezelése Terraformmal (Infrastructure-as-Code elvek szerint)
- ▹AI/ML feladatütemező rendszerek tervezése Slurm és Kubernetes integrációjával a GPU-erőforrások kezelésére
- ▹Bare metal GPU-szerverek beüzemelése és üzemeltetése nagy teljesítményű számításokhoz
- ▹Hálózati (CNI, service mesh) és tárolási (CSI, S3) megoldások implementálása
- ▹Átfogó megfigyelhetőségi (monitoring, logging, tracing) rendszer kiépítése, automatizálás üzemeltetési feladatokhoz
- ▹Együttműködés AI-kutatókkal és ML-mérnökökkel az infrastrukturális igények megértése érdekében
- ▹Egybérlős, menedzselt telepítések életciklusának automatizálása
Elvárások
- ▹Minimum 5 év tapasztalat Platform Engineering, DevOps vagy Site Reliability Engineering (SRE) területen
- ▹Igazolt, gyakorlati tapasztalat Terraformmal épített és kezelt éles infrastruktúrában
- ▹Szakértői szintű Kubernetes-architektúra és -üzemeltetési ismeret nagy léptékű környezetben
- ▹Tapasztalat HPC feladatütemezőkkel (kifejezetten Slurm) GPU-intenzív AI-terhelések kezelésében
- ▹Bare metal infrastruktúra kezelése (pl. PXE boot, MAAS), konfiguráció és életciklus-menedzsment
- ▹Erős szkriptelési és automatizálási készségek (pl. Python, Go, Bash)
Előny
- ▹Tapasztalat CI/CD rendszerekkel (pl. GitLab CI, Jenkins, ArgoCD) és fejlesztői eszközök építésével
- ▹FinOps alapelvek és felhő-költségoptimalizálási ismeretek
- ▹Kubernetes hálózati (pl. Calico, Cilium) és tárolási (pl. Ceph, Rook) megoldások ismerete
- ▹Tapasztalat több régiós vagy hibrid felhő környezetben
Soft skillek
Szenvedélyesen elkötelezett a fejlesztőket és kutatókat támogató platformok építése irántÉlvezi az elegáns, automatizált megoldások kidolgozását komplex infrastrukturális kihívásokraMotivált a hibrid infrastruktúra teljesítmény, költség és megbízhatóság szerinti optimalizálásában
A munkáltatóról
A Deepgram a hangalapú mesterséges intelligencia (Voice AI) vezető platformja, valós idejű beszédfelismerési (STT) és szövegfelolvasási (TTS) API-kat, valamint termelési szintű hangügynököket kínál. Több mint 200 000 fejlesztő és 1300+ szervezet - köztük a Twilio, Cloudflare és Sierra - épít rá megoldásokat; a céget friss Series C körben vezető globális befektetők finanszírozták.
Hasonló állások

Állás
DevOps Engineer (5431)
Shield Ai
Azure Devops
+10
150 000–220 000 USD/év
bruttó
🏢 Helyszíni
Dallas
🗣️ EN

Állás
DevOps Engineer
Accenture Federal Services
Cloudformation
+6
118 700–225 100 USD/év
bruttó
🏢 Helyszíni
Chantilly
🗣️ EN
Állás
Director, Engineering – Release Engineering, DevOps & SRE
Ddn
AI/MLGithub Actions
+8
250 000–300 000 USD/év
bruttó
🌍 Remote
North Carolina
🗣️ EN

Állás
Site Reliability Engineer III (DBA)
Backblaze
+11
125 000–150 000 USD/év
bruttó
🌍 Remote
🗣️ EN

Állás
Cloud DevOps Engineer
Accenture Federal Services
+10
103 200–196 400 USD/év
bruttó
🏢 Helyszíni
Huntsville
🗣️ EN

Állás
Cloud DevOps Engineer
Accenture Federal Services
Argocd
+6
100 200–203 400 USD/év
bruttó
🏢 Helyszíni
Los Angeles
🗣️ EN