Állás · Senior

Senior Site Reliability Engineer (globális felvétel)

DevOps / SRE • Senior • Remote • Teljes munkaidő Szerbia Szerbia

Elosztott, kamera-alapú videómegfigyelő és AI-riasztó platform üzemeltetése. A szerep megbízhatóság-központú: SLO-k, hibaköltségvetések, megbízható riasztás, kapacitástervezés és katasztrófa utáni helyreállítás felelőse egy vegyes felhő-edge infrastruktúrán.

Feladatok

  • SLI/SLO-k meghatározása és hibaköltségvetések kezelése
  • Megbízható megfigyelhetőség kialakítása (dashboardok, egyedi metrikák, OpenTelemetry)
  • Incidenskezelés vezetése, blameless postmortemek készítése
  • Ügyeleti rotáció felügyelete és javítása
  • Kapacitás- és teljesítménytervezés (GPU, Kafka/MSK, RDS, Redis)
  • Üzletmenet-folytonosság és katasztrófa utáni helyreállítás (backup, replikáció, failover)

Elvárások

  • Tapasztalat nagy léptékű, vegyes (felhő + edge) infrastruktúra üzemeltetésében
  • SLO/hibaköltségvetés alapú gondolkodásmód
  • Java mikroszolgáltatások, Python szolgáltatások, AWS ismerete
  • Kafka (MSK), PostgreSQL/RDS, Redis, DynamoDB tapasztalat
  • Docker, Terraform, megfigyelhetőségi eszközök (Datadog, Grafana, Prometheus)

Soft skillek

Nyugodt, higgadt incidenskezelésMegbízhatóság mint mérhető szám, nem érzésProaktivitás a zajos rendszerek megszelídítésében

A munkáltatóról

A cég elosztott, kamera-alapú videómegfigyelő és AI-riasztó platformot üzemeltet, amely felhő- és több ezer helyszíni edge eszközt kapcsol össze.

Hasonló állások