
Állás
· Senior
Senior site reliability engineer
DevOps / SRE
• Senior
• Helyszíni
• Teljes munkaidő
•
Dublin, Írország
Senior SRE a Salesforce dublini Site Reliability szervezetében: automatizálással, observability-vel és AI-alapú eszközökkel növeled a felhőszolgáltatások megbízhatóságát, és technikai vezetőként irányítod az incidenskezelést.
Stack
Feladatok
- ▹Incidensek felderítésének, kezelésének és megoldásának vezetése: gyökérok-elemzés, postmortem-ek és megelőző intézkedések a magas rendelkezésre állásért
- ▹Incidens utáni áttekintések vezetése, rendszerszintű javítások a korrekciós intézkedésekkel
- ▹Összetett automatizálási platformok, önjavító rendszerek és AI-alapú üzemeltetési eszközök önálló tervezése és megvalósítása tartós workflow-motorokkal (Temporal, Airflow, Argo Workflows)
- ▹Éles, produkciós minőségű observability-megoldások (monitorozás, logolás, riasztás, tracing) tervezése és építése a proaktív észleléshez és az autonóm hibaelhárításhoz
- ▹AI/ML-alapú üzemeltetési eszközök tervezése: anomáliadetektálás, prediktív elemzés, intelligens runbook-automatizálás, prompt-tervezett üzemeltetési ágensek (MCP-alapú)
- ▹A rendszerteljesítmény, a megbízhatóság és a költséghatékonyság optimalizálása proaktív monitorozással és hangolással
- ▹A Site Reliability csapat munkájának megfelelése a vállalat belső megfelelőségi szabályzatainak
- ▹Átfogó technikai epicek kidolgozása jól megfogalmazott problémákkal, részletes dokumentációval és mérhető üzleti eredményekkel
- ▹Technikai coaching a junior kollégáknak páros programozással, design review-kkal és code review-kkal
- ▹SLA-k és SLO-k meghatározása és betartatása a fejlesztő- és termékcsapatokkal
- ▹Produkciós minőségű szoftver építése modern mérnöki gyakorlatokkal, az AI-t a fejlesztési munkafolyamat központi részeként használva
- ▹Olyan rendszerek tervezése és összehangolása, ahol az AI-ágensek az emberi munkafolyamatokba illeszkednek
- ▹Az emberi és az AI által generált kód helyességének, minőségének, biztonságának és teljesítményének kritikus értékelése
- ▹Hozzájárulás a megosztott rendszerkontextus építéséhez és karbantartásához
Elvárások
- ▹Legalább 5 év rendszer- és szoftvermérnöki tapasztalat nagy léptékű, internetes szolgáltatásoknál
- ▹Gyakorlati tapasztalat konténerizált architektúrákkal (Docker, Kubernetes) és orkesztrációs platformokkal
- ▹Elosztott rendszerek és Linux/Unix belső működés erős ismerete, teljesítményhangolás és hibaelhárítás nagy léptékben
- ▹Nagy léptékű internetes szolgáltatások architektúrájának ismerete (DNS, HTTP, terheléselosztás, gyorsítótárazás stb.)
- ▹Bizonyított Python és Go tudás, erős szoftvermérnöki gyakorlatokkal (tesztelés, code review, CI/CD)
- ▹Éles környezetben szerzett tapasztalat observability-platformok építésében és üzemeltetésében (Grafana, Prometheus, ELK, Splunk, Datadog vagy hasonló)
- ▹Szilárd háttér az incidenskezelésben: ügyeleti részvétel, gyökérok-elemzés, postmortem-gyakorlat
- ▹Az SRE-elvek erős ismerete: SLI/SLO, error budget, toil csökkentése, hibáztatásmentes kultúra, kapacitástervezés
- ▹Gyakorlati tapasztalat workflow-/orkesztrációs motorokkal (Temporal, Airflow, Argo Workflows vagy hasonló) tartós automatizálási folyamatokhoz
- ▹Tapasztalat az AI/ML üzemeltetési alkalmazásában: anomáliadetektálás, prediktív elemzés, LLM-alapú automatizálás, prompt engineering intelligens üzemeltetési ágensekhez
- ▹Kiváló kommunikációs készség, bizonyított képesség a vezetésre nagy nyomású incidensek alatt, műszaki tervek bemutatására a vezetőségnek és junior mérnökök mentorálására
- ▹Tapasztalat más mérnökök mentorálásában és technikai coachingjában
- ▹Képesség 24/7-es globális üzemeltetési modellben dolgozni, több prioritást kezelve időkritikus helyzetekben
- ▹Növekedési szemlélet, kíváncsiság az új technológiák iránt és folyamatos fejlődésre való törekvés
- ▹Valódi, AI-first mérnöki szemlélet: az AI használata a gyorsabb haladásra és a saját szakterületen túli tudás építésére
- ▹Tapasztalat AI-eszközök (pl. Claude Code, GitHub Copilot, Codex, Cursor) használatában a fejlesztési munkafolyamatban
- ▹Haladó prompt engineering készség: pontos, strukturált promptok írása és a megbízható, biztonságos, éles használatra kész AI-kimenetet biztosító rendszerkontextus kialakítása
- ▹Az AI/ML üzemeltetési alkalmazásának ismerete (pl. anomáliadetektálás, prediktív elemzés)
- ▹Releváns műszaki diploma
Előny
- ▹Tapasztalat AI-ágens keretrendszerekkel, MCP-vel (Model Context Protocol) vagy LLM-alapú üzemeltetési eszközök építésével
- ▹Hozzájárulás nyílt forráskódú megbízhatósági/observability eszközökhöz
- ▹AWS/GCP professional szintű tanúsítványok
- ▹Tapasztalat multi-cloud vagy hyperscale környezeteket támogató SRE-szervezetekben
- ▹Python és Go tudás rendszerszintű eszközökhöz
- ▹Tapasztalat a chaos engineeringgel és a game day gyakorlatokkal
Soft skillek
Kiváló kommunikációs készségVezetői készség nagy nyomású helyzetekbenMentorálás és technikai coachingNövekedési szemlélet és kíváncsiságTöbb prioritás kezelése időkritikus helyzetekben
A munkáltatóról
A Salesforce a saját bemutatkozása szerint az első számú AI CRM; a Site Reliability szervezet globális, nap-követő modellben figyeli a felhőszolgáltatások rendelkezésre állását.
Végzettség: Releváns műszaki diploma
Hasonló állások

Állás
· Senior
Senior Site Reliability Engineer - Platform Reliability (Resilience)
Elastic
+2
98 400–126 900 EUR/év
bruttó
🏢 Helyszíni
🗣️ EN

Állás
· Senior
Senior Site Reliability Engineer
Okta
AI/MLArgocd
+7
76 000–104 500 EUR/év
bruttó
🏢 Helyszíni
Dublin
🗣️ EN

Állás
· Senior
Senior Site Reliability Engineer
Fivetran
Argocd
+14
💰 Bér: nincs megadva
🏢 Helyszíni
Dublin
🗣️ EN

Állás
· Senior
Senior Site Reliability Engineer (MAAS)
Pragmatike
+6
💰 Bér: nincs megadva
🔀 Hibrid
Armenia
🗣️ EN

Állás
· Senior
Senior DevOps Engineer – Observability Platform
Qualcomm
CppCloudformation
+7
💰 Bér: nincs megadva
🏢 Helyszíni
Chennai
🗣️ EN

Állás
· Senior
Senior DevOps mérnök (felhőnatív, MI-vezérelt platform)
septeo
AI/MLBitbucket
+16
💰 Bér: nincs megadva
🌍 Remote
España la Vieja
🗣️ EN