remotely.living

Lead Site Reliability Engineer | Branża Technologiczna

Edge One Solutions Sp. z o.o · Remote · 2026-09-16

Apply for this job

Job description

O kliencie

Nasz Klient to międzynarodowa firma technologiczna działająca w obszarze rozwiązań zwiększających bezpieczeństwo transportu i flot. Organizacja rozwija zaawansowaną platformę chmurową wykorzystywaną przez klientów na wielu rynkach, łącząc rozwiązania cyfrowe, monitoring oraz technologie wspierające bezpieczeństwo użytkowników

O projekcie

Projekt ma na celu rozwój praktyk Site Reliability Engineering oraz zwiększenie niezawodności rozbudowanej platformy chmurowej opartej na Azure, Kubernetes i architekturze mikroserwisowej. Koncentruje się na wdrożeniu SLI, SLO i error budgetów, rozwoju observability oraz usprawnieniu procesów zarządzania incydentami

Współpraca będzie odbywać się z zespołami Cloud Engineering, Infrastructure i Development oraz kadrą zarządzającą. Rola zapewnia dużą samodzielność i możliwość wyznaczania standardów SRE oraz kierunku rozwoju niezawodności systemów w całej organizacji

Tryb świadczenia usług

Świadczenie usług odbywa się w trybie zdalnym.

Współpraca z międzynarodowymi zespołami działającymi w różnych strefach czasowych

Elastyczne godziny pracy umożliwiające udział w wybranych spotkaniach z zespołami z USA i Kanady

Realizację projektu ułatwi Ci

- Minimum 3 lata doświadczenia w obszarze Site Reliability Engineering

- Praktyczne doświadczenie we wdrażaniu SLI, SLO i error budgetów na poziomie organizacji

- Bardzo dobra znajomość Microsoft Azure w obszarze PaaS i IaaS

- Doświadczenie w pracy z Kubernetes oraz złożonymi środowiskami produkcyjnymi

- Znajomość systemów rozproszonych, mikroserwisów i architektury cloud native

- Doświadczenie w projektowaniu scentralizowanych dashboardów do monitorowania wydajności i dostępności systemów

- Znajomość narzędzi Prometheus, Grafana, Elasticsearch oraz Elastic APM

- Doświadczenie w monitorowaniu złożonej infrastruktury chmurowej

- Znajomość procesów zarządzania incydentami oraz doświadczenie w tworzeniu procedur SOP i analiz RCA

- Umiejętność prowadzenia inicjatyw obejmujących wiele zespołów technicznych

- Umiejętność współpracy z osobami na różnych poziomach organizacji

- Umiejętność przedstawiania zagadnień technicznych w kontekście celów, ryzyka i wartości biznesowej

- Doświadczenie w przygotowywaniu uzasadnień biznesowych, rekomendacji i prezentacji dla kadry zarządzającej

- Bardzo dobra znajomość języka angielskiego w mowie i piśmie

- Samodzielność, analityczne podejście i umiejętność rozwiązywania złożonych problemów

Mile widziane

- Doświadczenie w roli Lead lub Principal Site Reliability Engineer

- Doświadczenie w budowaniu lub rozwijaniu praktyki SRE

- Znajomość OpsGenie

- Doświadczenie w monitorowaniu baz danych MongoDB, Cosmos DB, MySQL i SQL Server

- Znajomość środowisk obejmujących Kubernetes oraz starsze aplikacje uruchamiane na maszynach wirtualnych z systemem Windows

- Doświadczenie z aplikacjami działającymi w modelu single-tenant i multi-tenant

Twój wkład do projektu

- Rozwijanie praktyk SRE i strategii niezawodności w organizacji

- Definiowanie i wdrażanie SLI, SLO oraz error budgetów

- Projektowanie centralnych dashboardów prezentujących dostępność, wydajność i kondycję systemów

- Rozwijanie monitoringu, alertingu i observability dla środowiska produkcyjnego

- Analizowanie trendów i identyfikowanie obszarów wymagających poprawy

- Wspieranie procesu zarządzania incydentami oraz obsługa eskalacji wymagających zaawansowanej wiedzy technicznej

- Tworzenie i doskonalenie procedur operacyjnych oraz standardów RCA

- Współpraca z zespołem wsparcia odpowiedzialnym za obsługę incydentów w trybie 24/7

- Współpraca z zespołami Cloud Engineering, Infrastructure i Development przy realizacji inicjatyw SRE

- Wspieranie zespołów w identyfikowaniu i eliminowaniu przyczyn źródłowych awarii

- Przygotowywanie kierunku rozwoju obszaru SRE oraz mierzenie postępów realizowanych inicjatyw

- Tworzenie uzasadnień biznesowych dla inwestycji w niezawodność i rozwój infrastruktury

- Prezentowanie rekomendacji, priorytetów i wyników kadrze zarządzającej

Tak o Ciebie zadbamy

Dołączając do Edge One Solutions, otrzymujesz pełne wsparcie w rozwoju zawodowym i osobistym, co daje Ci realną szansę na budowanie kariery zgodnie z własnymi celami.

- Zyskujesz indywidualne wsparcie Service Delivery Managera, który pomoże Ci zaplanować ścieżkę kariery i zadba o Twój komfort i satysfakcję z pracy w projekcie

- Szkolenia, certyfikaty i konferencje - dofinansowujemy lub w pełni pokrywamy koszty rozwoju kompetencji technicznych

- #SmartChange – umożliwiamy zmianę projektu i dobieramy kolejny zgodnie z Twoimi preferencjami

- Dbamy o Twój work-life balance, dlatego poza pracą oferujemy wyjścia integracyjne, aktywności sportowe i inspirujące webinary #edge1talks, które rozwijają i łączą ludzi

- Aktywność fizyczna – wspieramy sportowe inicjatywy i wynajem sal treningowych

- Pakiet zdrowotny – prywatna opieka, karta sportowa, ubezpieczenie i platforma ze wsparciem psychologicznym

- Elastyczne benefity – sam decydujesz, na co przeznaczasz punkty w naszym systemie benefitowym

Nie spełniasz wszystkich wymagań, a projekt Cię zainteresował? Nie wahaj się i aplikuj. Porozmawiajmy!