Állás · Senior

Senior site reliability engineer

DevOps / SRE • Senior • Remote • Teljes munkaidő • Európai Unió EU/EMEA

A Runware SRE-je a platform megbízhatóságáért, rendelkezésre állásáért és teljesítményéért felel: gyakorlatias, erősen technikai szerep szoftver, infrastruktúra és éles üzemeltetés határán.

Feladatok

  • ▹A kritikus éles szolgáltatások megbízhatóságának, rendelkezésre állásának és teljesítményének gondozása és javítása
  • ▹A megbízhatósági gyakorlatok kialakítása és fejlesztése: SLI-k, SLO-k, riasztás, megfigyelhetőség, production-readiness sztenderdek
  • ▹Összetett éles hibák kivizsgálása elosztott rendszerekben, API-kban, hálózatban, sorokban, adatbázisokban és GPU-s terhelésekben, részvétel az ügyeleti rotációban
  • ▹Incidens-áttekintések és RCA-k vezetése, az ismétlődő hibamódok tartós mérnöki javításokká alakítása
  • ▹Az üzemeltetési kézimunka csökkentése automatizálással, automatikus helyreállítással, biztonságosabb telepítéssel és ellenállóbb rendszerekkel
  • ▹Együttműködés a mérnöki és DevOps-csapattal kapacitástervezésben, teljesítményben, skálázásban és architekturális fejlesztésekben

Elvárások

  • ▹Erős tapasztalat éles rendszerek nagy léptékű üzemeltetésében és hibaelhárításában SRE, production engineering, platform engineering vagy hasonló szerepben
  • ▹Az elosztott rendszerek erős ismerete, hibakeresés alkalmazások, adatbázisok, sorok, konténerek, hálózat és infrastruktúra között
  • ▹Megfigyelhetőségi rendszerek tervezésének és üzemeltetésének tapasztalata metrikákkal, naplókkal és elosztott nyomkövetéssel
  • ▹Az SRE-elvek ismerete: SLI, SLO, hibakeret, kapacitástervezés, incidenskezelés, üzemeltetési kézimunka csökkentése
  • ▹Tapasztalat Kubernetesszel, konténerekkel, IaC-vel és automatizált telepítéssel, valamint szoftver- és automatizálásírás Python, Go vagy PHP nyelven
  • ▹Erős felelősségvállalás az éles problémákért, készség az ügyeleti rotációban való részvételre

Előny

  • ▹Nagy átviteli sebességű vagy alacsony késleltetésű API-k és elosztott rendszerek üzemeltetése
  • ▹Bare-metal infrastruktúra, GPU-környezetek vagy MI/ML-terhelések tapasztalata
  • ▹RabbitMQ vagy más elosztott üzenetküldő és sorkezelő rendszer tapasztalata
  • ▹MySQL, Redis, ClickHouse vagy hasonló éles adatrendszerek üzemeltetése
  • ▹Globális forgalomirányítás, terheléselosztás, CDN és hibrid infrastruktúra tapasztalata
  • ▹Automatikus skálázó, kapacitáskezelő vagy önjavító rendszerek építése

Soft skillek

Erős felelősségvállalásKooperáció a csapatokkal

Amit kínálunk

  • ▹Remote-first működés, évente kétszer személyes találkozóval
  • ▹Közös core hours, azon kívül szabad időbeosztás
  • ▹Gyors, intenzív kiadási ciklusok utáni valódi pihenőidő

A munkáltatóról

A Runware nagy teljesítményű infrastruktúrát és termékeket épít a kép-, videó- és újabb modalitású gyors, skálázható inferenciához. Serverless platformján az ügyfelek saját MI-modelljeiket telepíthetik és skálázhatják éles GPU-infrastruktúrán.

Hasonló állások