
Állás
· Principal
AI infrastruktúra mérnök (Member of Technical Staff)
Platform Engineer
• Principal
• Hibrid
• Teljes munkaidő
•
London, Egyesült Királyság
Növekvő csapatunkba keresünk AI infrastruktúra mérnököt, aki a nagyméretű AI tréning- és inferencia-klaszterek fejlesztéséért, üzemeltetéséért és optimalizálásáért felel, szoros együttműködésben az Inference és Research csapatokkal.
Feladatok
- ▹Skálázható Kubernetes-klaszterek tervezése, telepítése és karbantartása AI modell-inferenciához és tréninghez
- ▹Slurm-alapú HPC környezetek kezelése és optimalizálása nagy nyelvi modellek elosztott tréningjéhez
- ▹Robusztus API-k és orkesztrációs rendszerek fejlesztése tréning- és inferencia-pipeline-okhoz
- ▹Erőforrás-ütemezési és job-kezelési rendszerek bevezetése heterogén compute-környezetekben
- ▹Rendszer-teljesítmény mérése, szűk keresztmetszetek diagnosztizálása és fejlesztése tréning és inferencia infrastruktúrán egyaránt
- ▹Monitoring, riasztási és megfigyelhetőségi megoldások kiépítése ML-terhelésekre Kubernetesen és Slurmon
- ▹Gyors reagálás üzemzavarokra, csapatközi együttműködés a kritikus tréningfutások és inferencia-szolgáltatások magas rendelkezésre állásáért
- ▹Klaszterkihasználtság optimalizálása és autoscaling-stratégiák bevezetése dinamikus terheléshez
Elvárások
- ▹Erős Kubernetes-adminisztrációs tapasztalat (CRD-k, operátorok, klaszterkezelés)
- ▹Gyakorlati Slurm workload-management tapasztalat (job-ütemezés, erőforrás-allokáció, klaszter-optimalizálás)
- ▹Elosztott tréningrendszerek nagy léptékű telepítésének és üzemeltetésének tapasztalata
- ▹Konténer-orkesztráció és elosztott rendszerarchitektúrák mély ismerete
- ▹LLM-architektúra és tréningfolyamatok magas szintű ismerete (Multi-Head Attention, Multi/Grouped-Query, elosztott tréningstratégiák)
- ▹GPU-klaszterek kezelésének és compute-kihasználtság optimalizálásának tapasztalata
- ▹Kiváló szintű Kubernetes-adminisztráció és YAML-konfigurációkezelés
- ▹Python és C++ programozás rendszer- és infrastruktúra-automatizálási fókusszal
- ▹Gyakorlati tapasztalat ML-keretrendszerekkel (PyTorch) elosztott tréning kontextusban
- ▹Hálózat, storage és compute erőforrás-kezelés erős ismerete ML-terhelésekhez
- ▹API-fejlesztés és elosztott rendszerek kezelése batch és real-time terhelésekre
- ▹Solid debug és monitoring képességek konténerizált környezetekhez
Előny
- ▹Kubernetes-operátorok és egyedi kontrollerek ML-terhelésekhez
- ▹Haladó Slurm-adminisztráció, multi-cluster federáció, fejlett ütemezési szabályok
- ▹GPU-klaszter kezelés és CUDA-optimalizálás
- ▹Más ML-keretrendszerek (TensorFlow) vagy elosztott tréning-könyvtárak ismerete
- ▹HPC-környezet, párhuzamos számítás és nagy teljesítményű hálózat háttér
- ▹Infrastruktúra mint kód (Terraform, Ansible) és GitOps ismeret
- ▹Konténerregisztry-k, image-optimalizálás, multi-stage build-ek ML-workloadokhoz
Soft skillek
Gyors reagálás és helytállás nyomás alatt üzemzavarok eseténCsapatközi együttműködés
Hasonló állások

Állás
· Principal
Principal Platform Infrastructure Engineer (SRE Enablement)
Menlosecurity
+6
💰 Bér: nincs megadva
🌍 Remote
EMEA - Distributed (UK)
🗣️ EN

Állás
· Principal
Principal Platform Engineer
Clarity Innovations
+6
113 000–300 000 USD/év
bruttó
🏢 Helyszíni
Herndon
🗣️ EN

Állás
· Principal
Senior Principal Platform Engineer
Clarity Innovations
AI/MLArgocd
+16
123 000–322 000 USD/év
bruttó
🏢 Helyszíni
Jessup
🗣️ EN

Állás
· Principal
Principal AI Platform Engineer
Arm
Llm
💰 Bér: nincs megadva
🏢 Helyszíni
Cambridge
🗣️ EN

Állás
· Principal
Senior Staff Machine Learning Platform Engineer
Faire
AI/MLDatabricksDatadog
+16
295 000–405 500 USD/év
bruttó
🔀 Hibrid
San Francisco
🗣️ EN

Állás
· Principal
Staff AI Infrastructure Engineer
Anduril
AI/MLCpp
+3
220 000–292 000 USD/év
bruttó
🏢 Helyszíni
Costa Mesa
🗣️ EN