Senior Automation Test Engineer – AI Systems (f / m/x)
Białystok, Polska, Bydgoszcz, Polska, Kraków, Polska +10Najważniejsze cechy oferty
Min. 5 lat doświadczenia
Backend: Java / .NET / Node / Python
Pełny etat
Praca zdalna - bez dojazdów
Prywatna opieka medyczna
Opis
Szukamy Senior QA Engineera, który dołączy do naszego zespołu i przyczyni się do budowy systemu operacyjnego opartego na AI dla marketingu w służbie zdrowia. W tej roli wykraczysz poza tradycyjne testowanie end-to-end, przejmując odpowiedzialność za jakość, ocenę i monitorowanie złożonych systemów AI. Będziesz pracować nad produktami o rzeczywistej wartości produkcyjnej, zapewniając stabilność naszej architektury full-stack, jednocześnie projektując i skalując pipeline'y oceny AI oraz systemy monitorowania dryfu ML. Jeśli pasjonujesz się opracowywaniem solidnych ram testowych i oceny dla nowoczesnych systemów opartych na AI i ML, chcemy usłyszeć od Ciebie.
Benefity
Great Place to Work
Stabilna sytuacja finansowa
Kontrakty z globalnymi markami
Centrum szkoleń wewnętrznych
Wielu ekspertów, od których możesz się uczyć
Otwarty i dostępny zarząd
Profit sharing
Program Sponsoringu Pasji
Cykliczne imprezy i wyjazdy integracyjne
Komfortowe i dobrze wyposażone biura
Aplikacja MySii
Opieka medyczna
Wymagania
Minimum 5-letnie doświadczenie w testowaniu oprogramowania lub inżynierii jakości, z co najmniej 2-letnim doświadczeniem w testowaniu lub ocenie aplikacji AI/ML, przepływów pracy LLM lub systemów agentowych
Biegłość w Pythonie do skryptów testowych backend/AI oraz znajomość JavaScript/TypeScript w ekosystemach testowych Node.js i Angular
Doświadczenie z ramami oceny takimi jak LangSmith, Langfuse, EvidentlyAI, Ragas lub MLflow oraz umiejętność wyboru odpowiednich metryk dla problemów klasyfikacji lub jakości generacji
Znajomość koncepcji monitorowania dryfu ML, śledzenia metryk oraz narzędzi do obserwowalności, takich jak Datadog lub Grafana
Silne umiejętności projektowania na poziomie systemu oraz zdolność do budowania infrastruktury testowej i oceny opartej na produkcji od podstaw
Zaawansowany poziom języka angielskiego
Zakres obowiązków
Projektowanie, budowanie i utrzymywanie ram oceny dla dużych modeli językowych (LLM) oraz niestandardowych systemów agentowych
Opracowywanie zautomatyzowanych mechanizmów oceny, asercji i zestawów testowych do pomiaru dokładności agentów, niezawodności rozumowania, wskaźników halucynacji oraz poprawności użycia narzędzi
Symulowanie złożonych, wieloetapowych przepływów pracy agentów w celu odkrywania przypadków brzegowych w autonomicznym podejmowaniu decyzji
Współpraca z zespołami inżynieryjnymi w celu ustanowienia solidnych ram monitorowania dla dryfu danych, dryfu koncepcji oraz degradacji wydajności modeli w produkcji
Implementacja systemów telemetrycznych i alarmowych do śledzenia opóźnień, użycia tokenów, efektywności kosztowej oraz jakości wyników w czasie
Odpowiedzialność za strategię testowania end-to-end w całym naszym stosie, zapewniając płynne połączenie między frontendem Angular, backendem Node.js oraz mikroserwisami AI opartymi na Pythonie
Pisanie czystych, łatwych w utrzymaniu i skalowalnych skryptów testowych w Pythonie oraz JavaScript/TypeScript
Przeprowadzanie rygorystycznych testów API, testów integracyjnych oraz testów wydajności/obciążenia dla mikroserwisów o wysokiej przepustowości
Integracja systemów oceny i testowania AI w naszych pipeline'ach CI/CD, aby zapewnić ciągłe egzekwowanie jakości przed wdrożeniem
Definiowanie i śledzenie kluczowych wskaźników jakości (KPI) dla niezawodności oprogramowania i zachowania modeli AI