Site Reliability Engineer - SRE (f / m/x) - Regular
Chennai, PolskaОсновні характеристики вакансії
Мін. 3 роки досвіду
Дані: SQL / BI / Python
Телекомунікації: мережі / установки / волоконна оптика
Повний робочий день
Віддалена робота - без поїздок
Opis
Szukamy utalentowanego i zorientowanego na niezawodność Inżyniera Niezawodności Systemów (SRE), aby wzmocnić nasz zespół inżynieryjny. W tej roli połączysz praktyczne doświadczenie w wsparciu 2. poziomu z monitorowaniem, automatyzacją i inżynierią niezawodności. Odegrasz kluczową rolę w zapewnieniu stabilności i obserwowalności krytycznego komponentu naszego łańcucha dostarczania danych referencyjnych.
Benefity
Zróżnicowane portfolio klientów
Szeroki wachlarz technologii
Stabilne zatrudnienie
Możliwość pracy zdalnej
Kontrakty z globalnymi markami
Great Place to Work w Europie
Wielu ekspertów, od których możesz się uczyć
Otwarty i dostępny zarząd
Wymagania
Minimum 4-letnie doświadczenie w Site Reliability Engineering, DevOps lub wsparciu produkcyjnym 2. poziomu
Praktyczne doświadczenie z Elastic Stack i Grafana w zakresie monitorowania, logowania i obserwowalności
Silne doświadczenie z Ansible w zakresie zarządzania konfiguracją i automatyzacji
Dobre praktyczne doświadczenie z Git/GitLab i praktykami CI/CD
Znajomość języków skryptowych i automatyzacji procesów operacyjnych
Znajomość technologii baz danych SQL i NoSQL
Dobre zrozumienie podstaw sieci, w tym TCP/IP, DNS i HTTP
Doświadczenie z systemami Linux i skryptowaniem powłoki
Silne umiejętności analityczne, rozwiązywania problemów, oraz odpowiedzialności w złożonych środowiskach
Biegła znajomość języka angielskiego jest wymagana; preferowani są kandydaci, którzy mogą dołączyć natychmiast lub aktualnie odbywają okres wypowiedzenia
Zakres obowiązków
Projektowanie, wdrażanie i utrzymywanie pulpitów monitorujących
Poprawa jakości powiadomień i redukcja szumów poprzez efektywne projektowanie progów i metryk
Analiza logów, metryk i zachowań systemu w celu proaktywnego wykrywania anomalii
Automatyzacja procesów operacyjnych przy użyciu Ansible i skryptów
Wkład w poprawę niezawodności CI/CD i wdrożeń
Ciężka optymalizacja niezawodności systemu, dostępności i efektywności operacyjnej
Zapewnianie wsparcia 2. poziomu dla systemów produkcyjnych i krytycznych aplikacji biznesowych
Badanie, rozwiązywanie i usuwanie incydentów oraz problemów z wydajnością
Przeprowadzanie analizy przyczyn źródłowych (RCA) i dokumentowanie ustaleń w uporządkowany sposób
Współpraca z zespołami deweloperskimi w zakresie zrównoważonego rozwiązywania problemów oraz wkład w przeglądy po incydentach i inicjatywy ciągłego doskonalenia