Állás · Senior

Senior Site Reliability Engineer (SRE)

DevOps / SRE • Senior • Remote • Teljes munkaidő Spanyolország Spanyolország

A növekvő SRE csapatba keresünk tapasztalt mérnököt, aki a kritikus szolgáltatások megbízhatóságáért, skálázhatóságáért és teljesítményéért felel, és vezető szerepet vállal az automatizálásban.

Feladatok

  • Magas rendelkezésre állású, skálázható, ellenálló rendszerek tervezése és karbantartása
  • Megfigyelhetőségi (observability) szakértői szerep: monitorozás, riasztás, naplózás, nyomkövetés, dashboardok, szintetikus tesztelés
  • Robusztus, karbantartható szoftverek és önkiszolgáló eszközök fejlesztése az üzemeltetési feladatok automatizálására
  • Üzemeltetési terhek csökkentése automatizálással és folyamatfejlesztéssel
  • Incidenskezelés vezetése, ügyeleti rotációban részvétel, hibamentes utóelemzések (blameless postmortem)
  • SLI, SLO és hibaköltségvetés (error budget) meghatározása és nyomon követése
  • Infrastructure as code, GitOps gyakorlatok és CI/CD automatizálás Terraform, Flux és GitHub Actions eszközökkel
  • Megbízhatósági szakértelem biztosítása rendszertervezési felülvizsgálatokon
  • Folyamatok dokumentálása, runbookok készítése, mérnökök mentorálása
  • AI eszközök felelős használata vizsgálatok gyorsítására, dokumentációhoz, terhek csökkentéséhez

Elvárások

  • Bizonyított tapasztalat éles rendszerek üzemeltetésében és fejlesztésében SRE, Production Engineering vagy Platform Engineering szerepkörben
  • Képesség komplex elosztott rendszerek gyors, pontos megértésére infrastruktúra, alkalmazás, hálózat, identitás és observability területeken
  • Erős hibaelhárítási készség, módszeres, bizonyítékalapú megközelítés incidenskezelésben és gyökérok-elemzésben
  • Tapasztalat SLI, SLO és error budget alapú megbízhatósági döntéshozatalban
  • Kiváló írásbeli és szóbeli kommunikációs készség
  • Kubernetes platformok (köztük Amazon EKS), service mesh technológiák (Istio)
  • AWS felhőinfrastruktúra és szolgáltatások
  • Identitás- és hozzáférés-kezelési rendszerek (Auth0, AWS IAM)
  • Hálózati alapismeretek: DNS, terheléselosztás, routing, TLS, kapcsolódási hibaelhárítás
  • GitOps munkafolyamatok és infrastruktúra-automatizálás (Flux, Terraform)
  • Observability platformok és gyakorlatok
  • CI/CD rendszerek és mérnöki munkafolyamatok

Soft skillek

Szolgáltatás-stabilitás és ügyfélhatás előtérbe helyezése incidens közbenNyugodt, tényalapú működés nyomás alatt, tiszta kommunikációRendszerszemléletű problémamegoldásRövid és hosszú távú megoldások egyensúlyba hozása

Hasonló állások