Állás · Senior

Senior site reliability engineer

DevOps / SRE • Senior • Helyszíni • Teljes munkaidő • Írország Dublin, Írország

Senior SRE a Salesforce dublini Site Reliability szervezetében: automatizálással, observability-vel és AI-alapú eszközökkel növeled a felhőszolgáltatások megbízhatóságát, és technikai vezetőként irányítod az incidenskezelést.

Feladatok

  • ▹Incidensek felderítésének, kezelésének és megoldásának vezetése: gyökérok-elemzés, postmortem-ek és megelőző intézkedések a magas rendelkezésre állásért
  • ▹Incidens utáni áttekintések vezetése, rendszerszintű javítások a korrekciós intézkedésekkel
  • ▹Összetett automatizálási platformok, önjavító rendszerek és AI-alapú üzemeltetési eszközök önálló tervezése és megvalósítása tartós workflow-motorokkal (Temporal, Airflow, Argo Workflows)
  • ▹Éles, produkciós minőségű observability-megoldások (monitorozás, logolás, riasztás, tracing) tervezése és építése a proaktív észleléshez és az autonóm hibaelhárításhoz
  • ▹AI/ML-alapú üzemeltetési eszközök tervezése: anomáliadetektálás, prediktív elemzés, intelligens runbook-automatizálás, prompt-tervezett üzemeltetési ágensek (MCP-alapú)
  • ▹A rendszerteljesítmény, a megbízhatóság és a költséghatékonyság optimalizálása proaktív monitorozással és hangolással
  • ▹A Site Reliability csapat munkájának megfelelése a vállalat belső megfelelőségi szabályzatainak
  • ▹Átfogó technikai epicek kidolgozása jól megfogalmazott problémákkal, részletes dokumentációval és mérhető üzleti eredményekkel
  • ▹Technikai coaching a junior kollégáknak páros programozással, design review-kkal és code review-kkal
  • ▹SLA-k és SLO-k meghatározása és betartatása a fejlesztő- és termékcsapatokkal
  • ▹Produkciós minőségű szoftver építése modern mérnöki gyakorlatokkal, az AI-t a fejlesztési munkafolyamat központi részeként használva
  • ▹Olyan rendszerek tervezése és összehangolása, ahol az AI-ágensek az emberi munkafolyamatokba illeszkednek
  • ▹Az emberi és az AI által generált kód helyességének, minőségének, biztonságának és teljesítményének kritikus értékelése
  • ▹Hozzájárulás a megosztott rendszerkontextus építéséhez és karbantartásához

Elvárások

  • ▹Legalább 5 év rendszer- és szoftvermérnöki tapasztalat nagy léptékű, internetes szolgáltatásoknál
  • ▹Gyakorlati tapasztalat konténerizált architektúrákkal (Docker, Kubernetes) és orkesztrációs platformokkal
  • ▹Elosztott rendszerek és Linux/Unix belső működés erős ismerete, teljesítményhangolás és hibaelhárítás nagy léptékben
  • ▹Nagy léptékű internetes szolgáltatások architektúrájának ismerete (DNS, HTTP, terheléselosztás, gyorsítótárazás stb.)
  • ▹Bizonyított Python és Go tudás, erős szoftvermérnöki gyakorlatokkal (tesztelés, code review, CI/CD)
  • ▹Éles környezetben szerzett tapasztalat observability-platformok építésében és üzemeltetésében (Grafana, Prometheus, ELK, Splunk, Datadog vagy hasonló)
  • ▹Szilárd háttér az incidenskezelésben: ügyeleti részvétel, gyökérok-elemzés, postmortem-gyakorlat
  • ▹Az SRE-elvek erős ismerete: SLI/SLO, error budget, toil csökkentése, hibáztatásmentes kultúra, kapacitástervezés
  • ▹Gyakorlati tapasztalat workflow-/orkesztrációs motorokkal (Temporal, Airflow, Argo Workflows vagy hasonló) tartós automatizálási folyamatokhoz
  • ▹Tapasztalat az AI/ML üzemeltetési alkalmazásában: anomáliadetektálás, prediktív elemzés, LLM-alapú automatizálás, prompt engineering intelligens üzemeltetési ágensekhez
  • ▹Kiváló kommunikációs készség, bizonyított képesség a vezetésre nagy nyomású incidensek alatt, műszaki tervek bemutatására a vezetőségnek és junior mérnökök mentorálására
  • ▹Tapasztalat más mérnökök mentorálásában és technikai coachingjában
  • ▹Képesség 24/7-es globális üzemeltetési modellben dolgozni, több prioritást kezelve időkritikus helyzetekben
  • ▹Növekedési szemlélet, kíváncsiság az új technológiák iránt és folyamatos fejlődésre való törekvés
  • ▹Valódi, AI-first mérnöki szemlélet: az AI használata a gyorsabb haladásra és a saját szakterületen túli tudás építésére
  • ▹Tapasztalat AI-eszközök (pl. Claude Code, GitHub Copilot, Codex, Cursor) használatában a fejlesztési munkafolyamatban
  • ▹Haladó prompt engineering készség: pontos, strukturált promptok írása és a megbízható, biztonságos, éles használatra kész AI-kimenetet biztosító rendszerkontextus kialakítása
  • ▹Az AI/ML üzemeltetési alkalmazásának ismerete (pl. anomáliadetektálás, prediktív elemzés)
  • ▹Releváns műszaki diploma

Előny

  • ▹Tapasztalat AI-ágens keretrendszerekkel, MCP-vel (Model Context Protocol) vagy LLM-alapú üzemeltetési eszközök építésével
  • ▹Hozzájárulás nyílt forráskódú megbízhatósági/observability eszközökhöz
  • ▹AWS/GCP professional szintű tanúsítványok
  • ▹Tapasztalat multi-cloud vagy hyperscale környezeteket támogató SRE-szervezetekben
  • ▹Python és Go tudás rendszerszintű eszközökhöz
  • ▹Tapasztalat a chaos engineeringgel és a game day gyakorlatokkal

Soft skillek

Kiváló kommunikációs készségVezetői készség nagy nyomású helyzetekbenMentorálás és technikai coachingNövekedési szemlélet és kíváncsiságTöbb prioritás kezelése időkritikus helyzetekben

A munkáltatóról

A Salesforce a saját bemutatkozása szerint az első számú AI CRM; a Site Reliability szervezet globális, nap-követő modellben figyeli a felhőszolgáltatások rendelkezésre állását.

Végzettség: Releváns műszaki diploma

Hasonló állások