Állás · Principal

AI infrastruktúra mérnök (Member of Technical Staff)

Platform Engineer • Principal • Hibrid • Teljes munkaidő Egyesült Királyság London, Egyesült Királyság

Növekvő csapatunkba keresünk AI infrastruktúra mérnököt, aki a nagyméretű AI tréning- és inferencia-klaszterek fejlesztéséért, üzemeltetéséért és optimalizálásáért felel, szoros együttműködésben az Inference és Research csapatokkal.

Feladatok

  • Skálázható Kubernetes-klaszterek tervezése, telepítése és karbantartása AI modell-inferenciához és tréninghez
  • Slurm-alapú HPC környezetek kezelése és optimalizálása nagy nyelvi modellek elosztott tréningjéhez
  • Robusztus API-k és orkesztrációs rendszerek fejlesztése tréning- és inferencia-pipeline-okhoz
  • Erőforrás-ütemezési és job-kezelési rendszerek bevezetése heterogén compute-környezetekben
  • Rendszer-teljesítmény mérése, szűk keresztmetszetek diagnosztizálása és fejlesztése tréning és inferencia infrastruktúrán egyaránt
  • Monitoring, riasztási és megfigyelhetőségi megoldások kiépítése ML-terhelésekre Kubernetesen és Slurmon
  • Gyors reagálás üzemzavarokra, csapatközi együttműködés a kritikus tréningfutások és inferencia-szolgáltatások magas rendelkezésre állásáért
  • Klaszterkihasználtság optimalizálása és autoscaling-stratégiák bevezetése dinamikus terheléshez

Elvárások

  • Erős Kubernetes-adminisztrációs tapasztalat (CRD-k, operátorok, klaszterkezelés)
  • Gyakorlati Slurm workload-management tapasztalat (job-ütemezés, erőforrás-allokáció, klaszter-optimalizálás)
  • Elosztott tréningrendszerek nagy léptékű telepítésének és üzemeltetésének tapasztalata
  • Konténer-orkesztráció és elosztott rendszerarchitektúrák mély ismerete
  • LLM-architektúra és tréningfolyamatok magas szintű ismerete (Multi-Head Attention, Multi/Grouped-Query, elosztott tréningstratégiák)
  • GPU-klaszterek kezelésének és compute-kihasználtság optimalizálásának tapasztalata
  • Kiváló szintű Kubernetes-adminisztráció és YAML-konfigurációkezelés
  • Python és C++ programozás rendszer- és infrastruktúra-automatizálási fókusszal
  • Gyakorlati tapasztalat ML-keretrendszerekkel (PyTorch) elosztott tréning kontextusban
  • Hálózat, storage és compute erőforrás-kezelés erős ismerete ML-terhelésekhez
  • API-fejlesztés és elosztott rendszerek kezelése batch és real-time terhelésekre
  • Solid debug és monitoring képességek konténerizált környezetekhez

Előny

  • Kubernetes-operátorok és egyedi kontrollerek ML-terhelésekhez
  • Haladó Slurm-adminisztráció, multi-cluster federáció, fejlett ütemezési szabályok
  • GPU-klaszter kezelés és CUDA-optimalizálás
  • Más ML-keretrendszerek (TensorFlow) vagy elosztott tréning-könyvtárak ismerete
  • HPC-környezet, párhuzamos számítás és nagy teljesítményű hálózat háttér
  • Infrastruktúra mint kód (Terraform, Ansible) és GitOps ismeret
  • Konténerregisztry-k, image-optimalizálás, multi-stage build-ek ML-workloadokhoz

Soft skillek

Gyors reagálás és helytállás nyomás alatt üzemzavarok eseténCsapatközi együttműködés

Hasonló állások