
Állás
· Lead
Team Lead - Site Reliability Engineering (all genders)
DevOps / SRE
• Lead
• Helyszíni
• Teljes munkaidő
•
Berlin, Németország
FACT-Finder entwickelt Product-Discovery-Technologie für den eCommerce und ist mit den Produkten Next Generation und Infinity bei führenden Online-Shops in Europa im Einsatz. Aktuell modernisieren wir unser Hosting konsequent in Richtung Kubernetes auf Harvester – als on-prem Hybrid mit der Option, mittelfristig vollständig in die Cloud zu skalieren. Als Team Lead Site Reliability Engineering (all genders) verantwortest du Reliability, Skalierbarkeit und Kosten unserer Hosting-Umgebungen, treibst diese Transformation end-to-end voran und führst das Team, das sie umsetzt. Du verantwortest die operative Gesundheit unseres Hostings über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – Verfügbarkeit, Performance, Incident Management. Du treibst die Modernisierung in Richtung Kubernetes auf Harvester aktiv voran: Cluster-Topologie, Storage (Longhorn), Networking (VLAN, Load Balancing, Ingress), Backup und Disaster Recovery. Du baust eine produktionsreife k8s-Plattform auf: Lifecycle, Upgrades, RBAC, Secrets, GitOps (Argo CD / Flux), Observability und Policy-Guardrails. Du gestaltest den NG Search Operator (Custom Kubernetes Operator) und löst Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler) für die aktuelle Architektur. Du definierst unser On-Prem-Hybrid-Modell konkret: welche Workloads laufen wo, wie burst’en wir in die Cloud, wie halten wir Latenz und Kosten im Griff – und hältst die Architektur portabel genug für einen späteren Cloud-Only-Schritt. Du verantwortest Kapazitätsplanung und Hosting-Kosten und machst Kosten zu einem gezielt steuerbaren Hebel. Du führst und entwickelst unser derzeit 4-köpfiges Hosting-Team fachlich und disziplinarisch, verantwortest Performance und prägst die technische Standards- und Ownership-Kultur. Du machst AI zum festen Bestandteil unserer Operations: Diagnose, Automatisierung, Monitoring und Insight. Fundierter Hintergrund in Infrastructure oder Platform Engineering über On-Premise und Cloud hinweg. Hands-on Tiefe mit Kubernetes in Produktion: Cluster-Lifecycle, Upgrades, Networking, Storage, RBAC, Observability, GitOps-Delivery. Nachweislich starke Führungserfahrung, exzellente Kommunikation und Stakeholder-Management. Idealerweise praktische Erfahrung mit Harvester oder vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack). Erfahrung mit einer echten Migration von Bare Metal / klassischen VMs auf eine k8s-basierte Plattform – inklusive stateful Workloads, Storage-Migration, Cutover und Rollback. Sicherer Umgang mit Kubernetes Operators (Custom Controllers / CRDs), idealerweise für stateful Systeme wie Search, Datenbanken oder Streaming. Solides Verständnis von Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und deren Zusammenspiel mit Kapazitätsplanung. Erfahrung mit On-Prem-Hybrid-Architekturen und der Verantwortung für Reliability, Kapazität und Kosten produktiver Systeme. Hands-on Fluency im Einsatz von AI-Tools im operativen Betrieb. Sehr gute Englischkenntnisse; Deutsch von Vorteil. Impact from day one: Deine Arbeit wirkt direkt auf die Umsätze führender eCommerce-Marken in Europa. Führungsrolle mit Gestaltungsspielraum: Du führst ein eingespieltes Team und gestaltest unsere Plattform in einer entscheidenden Phase unserer Transformation. Moderner Tech-Stack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg in Richtung Cloud – mit Raum, Dinge neu und richtig zu bauen. AI-first Mindset: Wir nutzen AI nicht als Buzzword, sondern als festen Bestandteil unserer täglichen Arbeit. Ownership & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, deine Rolle aktiv mitzugestalten. Flexibles Arbeiten: Hybrides Arbeitsmodell mit Fokus auf Ergebnisse. Starkes Team: Erfahrene Engineers, offene Feedback-Kultur und ein Umfeld, in dem Reliability als Engineering-Disziplin ernst genommen wird. Attraktive Benefits: Wettbewerbsfähiges Gehalt, moderne Ausstattung, Weiterbildungsbudget und regelmäßige Team-Events. Berlin, München, Pforzheim oder Stockholm (hybrid)
Hasonló állások

Állás
· Senior
Senior Site Reliability Engineer (all genders)
fact-finder
ArgocdOpenstackVmware
💰 Bér: nincs megadva
🏢 Helyszíni
Berlin
🗣️ német kell

Állás
· Senior
Senior Site Reliability Engineer - Ceph / On-Prem Cloud Storage (m/f/d)
Gridscale
Argocd
+6
💰 Bér: nincs megadva
🏢 Helyszíni
Köln
🗣️ EN

Állás
· Lead
Lead Site Reliability Engineer
Zego
ArgocdDatadogIstio
+2
💰 Bér: nincs megadva
🔀 Hibrid
London
🗣️ EN

Állás
Sovereign Cloud Expert DevOps Engineer (f/m/d) - SAP Business Data Cloud (BDC)
SAP
ArgocdArtifactory
+15
💰 Bér: nincs megadva
🏢 Helyszíni
St. Leon-Rot
🗣️ német kell

Állás
· Lead
DevOps Team Lead
Teleoffice Viewcom AB
Argocd
+14
💰 Bér: nincs megadva
🏢 Helyszíni
Danderyd

Állás
· Lead
Lead DevOps Engineer
Elliptic
ArgocdDatabricksDatadog
+12
💰 Bér: nincs megadva
🔀 Hibrid
London
🗣️ EN