Site Reliability Engineer (m/w/d)
experienced
full-time
Du analysierst eingehende Anfragen, grenzt Fehler strukturiert ein und gehst Problemen technisch auf den Grund. Dafür arbeitest du mit Logs, Metriken, Deployments und Konfigurationen und nutzt unser Monitoring, um Ursachen möglichst schnell und sauber zu identifizieren. Gleichzeitig bist du nah an unseren Kunden, hältst sie über den Status auf dem Laufenden und sorgst dafür, dass Lösungen nachvollziehbar dokumentiert werden.
Wir betreiben und supporten unsere Kubernetes-Umgebungen über kloudease, unsere Managed-Kubernetes-Plattform.
Grundsätzlich solltest du bereit sein Rufbereitschaft zu übernehmen. Hast du Rufbereitschaft und übernimmst einen Einsatz werden beide Tätigkeiten selbstverständlich gesondert vergütet und können deinem Monatsgehalt einen ordentlichen Boost geben.
- Technischer Support: Du bearbeitest eingehende Tickets rund um unsere Kubernetes-Umgebungen, priorisierst Anfragen und hältst unsere Kunden transparent über den Status auf dem Laufenden
- Troubleshooting & Debugging: Du analysierst technische Probleme anhand von Logs, Metriken, Deployments und Konfigurationen und grenzt Fehler systematisch ein
- Monitoring & Alerting: Du arbeitest mit Prometheus und weiteren Monitoring-Lösungen, wertest Metriken aus und nutzt Alerts gezielt für die Fehleranalyse
- GitOps: Du arbeitest mit GitLab sowie GitOps-basierten Setups mit Argo CD oder Flux CD und unterstützt bei der Analyse von Deployment- und Konfigurationsproblemen
- Dokumentation & Kommunikation: Du dokumentierst Ursachen und Lösungen nachvollziehbar und übersetzt technische Findings in klare nächste Schritte – intern wie extern
- Du bringst praktische Erfahrung im Betrieb und Support von Kubernetes-Umgebungen mit
- Freude an Kundenkontakt: du kommunizierst klar, freundlich und lösungsorientiert, auch wenn’s mal stressig wird
- Du bist sicher im Troubleshooting und Debugging und kannst Logs, Metriken und Systemzustände strukturiert analysieren
- Du hast Erfahrung mit GitOps, GitLab und Tools wie Argo CD oder Flux CD
- Du kennst dich mit Monitoring und Alerting, insbesondere mit Prometheus, aus
- Du hast idealerweise Erfahrung mit Traefik oder vergleichbaren Ingress Controllern
- Du arbeitest strukturiert, priorisierst Tickets sinnvoll und bleibst auch bei komplexeren technischen Problemen dran
- Du kommunizierst sicher auf Deutsch und Englisch und kannst technische Zusammenhänge auch gegenüber Kunden verständlich erklären
- Dein Leben, dein Plan: Flexibles und selbstorganisiertes Arbeiten in agiler Unternehmenskultur ohne Hierarchieebenen. Remote oder im Office.
- Attraktive Zusatzleistungen wie Jobrad, vergünstigtes Deutschland-Ticket, Corporate Benefits, Workation, Sabbatical, betriebliche Altersvorsorge, umfangreiches Health-Package für deine körperliche und mentale Gesundheit (EGYM Wellpass, Plus Card, OpenUp)
- Effizienz trifft Komfort: Individuell gestaltbares Arbeitsumfeld mit modernster Hard- und Software
- Stehenbleiben ist nicht: 2.000€ persönliches Weiterbildungsbudget sowie AOE Academy
- Nie ohne mein Team: Summerparty, Teamevents, After Work, interne FIFA-Liga, Brettspielabend, Filmabend
- Coolstes Büro Wiesbadens: Mitten in der City, kostenlose Parkplätze, Thaimassage, eigener Koch, Playarea (Kicker, Tischtennis, Billard), Obst, Snacks, Getränke






