Senior Data Scientist (f / m/x)
Białystok, Polska, Bydgoszcz, Polska, Kraków, Polska +10Najważniejsze cechy oferty
Min. 5 lat doświadczenia
Data: SQL / BI / Python
Pełny etat
Praca zdalna - bez dojazdów
Prywatna opieka medyczna
Opis
Szukamy Senior Data Scientist, który dołączy do projektu skoncentrowanego na budowaniu systemu operacyjnego opartego na AI dla marketingu w służbie zdrowia. W tej roli zaprojektujesz i wdrożysz ekstrakcję encji, łączenie i rozwiązywanie na dużą skalę, godząc duże i fragmentaryczne zbiory danych w wiarygodne encje i atrybuty. Będziesz pracować nad produktami produkcyjnymi, które tworzą realną wartość w przemyśle nauk przyrodniczych, zapewniając integralność i jakość danych wykorzystywanych do dotarcia do odbiorców i uzyskiwania wglądów.
Benefity
Great Place to Work
Stabilna sytuacja finansowa
Kontrakty z globalnymi markami
Centrum szkoleń wewnętrznych
Wielu ekspertów, od których możesz się uczyć
Otwarty i dostępny zarząd
Profit sharing
Program Sponsoringu Pasji
Cykliczne imprezy i wyjazdy integracyjne
Komfortowe i dobrze wyposażone biura
Aplikacja MySii
Opieka medyczna
Wymagania
Minimum 5-letnie doświadczenie w dostarczaniu produkcyjnych prac z zakresu ML lub data science, w tym praktyczne doświadczenie w łączeniu i rozwiązywaniu encji na dużą skalę
Dogłębna znajomość Pythona, w tym kodu produkcyjnego, testowanego i z adnotacjami typów
Silna znajomość SQL oraz doświadczenie z FastAPI, Dockerem, pytest, Gitem i praktykami CI/CD
Praktyczne doświadczenie w metodach probabilistycznych do oceny dopasowania, wyboru progów i ewaluacji
Znajomość algorytmów grafowych i technik ML grafów, w tym osadzeń i GNN
Doświadczenie w inżynierii danych i ML, w tym procesach ETL w dużych zbiorach danych oraz monitorowaniu jakości danych
Znajomość rozproszonych magazynów SQL, takich jak Snowflake, BigQuery lub Databricks, oraz technologii grafowych, takich jak Neo4j lub Amazon Neptune
Zaawansowany poziom języka angielskiego
Zakres obowiązków
Ekstrakcja encji i atrybutów z heterogenicznych źródeł, w tym tabel magazynowych, rejestrów i dokumentów
Projektowanie i wdrażanie probabilistycznego łączenia encji oraz deduplikacji w wielu dużych zbiorach danych medycznych
Odpowiedzialność za pipeline łączenia od początku do końca, w tym ocena par i ocena oparta na grafach oraz skalibrowane prawdopodobieństwa dopasowania
Definiowanie, jak jakość łączenia jest mierzona poprzez precyzję, czułość, kalibrację i analizę błędów
Łączenie encji i atrybutów z kontrolowanymi słownikami medycznymi w celu zapewnienia spójności między źródłami
Wykorzystanie reprezentacji grafów i technik ML grafów do łączenia, w tym klasteryzacji, centralności i prognozowania łączeń
Budowanie i utrzymywanie zasobów danych i grafów, w tym transformacji magazynów i monitorowania
Poprawa wydajności istniejących algorytmów w odpowiedzi na zmieniające się źródła danych i ich objętości