JustJoin.IT Praca zdalna Senior

GPU & ML Infrastructure Engineer

Svitla Systems

⚲ Warszawa, Gdańsk, Kraków, Lublin, Łódź, Wrocław, Szczecin, Toruń, Poznań, Gliwice

Do uzgodnienia

Wymagania

  • doświadczenie w deployowaniu workloadów LLM (inference i training) na GPU, w tym modeli kwantyzowanych
  • samodzielna diagnoza problemów z sensorami i samplingiem w danych telemetrycznych (szeregi czasowe)
  • rozumienie zapewniania powtarzalności workloadu GPU run-to-run (kontrola źródeł niedeterminizmu)
  • mocna znajomość Linux, stosów sterowników GPU, orkiestracji procesów, schedulingu i zachowań timingowych
  • doświadczenie w programistycznym zbieraniu telemetrii sprzętowej in-band (NVML, DCGM) i out-of-band (BMC/IPMI/Redfish)

Mile widziane

  • doświadczenie w budowie pipeline'ów zbierania danych do testów sprzętu, kwalifikacji lub badań systemowych
  • znajomość narzędzi benchmarkowych i stress (compute, memory bandwidth, komunikacja multi-GPU) oraz metodologii benchmarków
  • rozumienie zarządzania energią i termiką GPU (np. przyczyny throttlingu zegarów) oraz skalowania multi-GPU (NCCL, tensor/pipeline parallelism)

Opis stanowiska

Budowa systemu generowania danych telemetrycznych z GPU dla startupu tworzącego model fizyczny do monitorowania zdrowia kart graficznych i compute. Będziesz odpowiadać za stronę generowania danych end-to-end: przenoszenie procedur testowych na nowe typy węzłów, automatyzację deploymentu, jakość telemetrii i publikację udokumentowanych zbiorów. Realnie pracujesz z workloadami LLM (inference i training, modele kwantyzowane) i dbasz o ich powtarzalność run-to-run. To rola dla kogoś, kto samodzielnie diagnozuje problemy z sensorami i samplingiem w danych szeregów czasowych oraz zna Linux, sterowniki GPU i zbieranie telemetrii in-band (NVML, DCGM) i out-of-band (BMC/IPMI/Redfish). Uwaga: zakres jest bardzo szeroki — od tworzenia procedur po ich wdrażanie i zapewnianie jakości — a ogłoszenie jest miejscami urwane, więc warto dopytać o pełny zakres i wsparcie zespołu.

🔍 Dekoder Ogłoszenia

🔴
You will own the data generation side end-to-end
Będziesz odpowiedzialny za cały proces tworzenia danych, od początku do końca, co może oznaczać dużą odpowiedzialność i brak wsparcia.
🔴
porting test procedures to new node types, automating deployment, ensuring telemetry quality and consistency across every target, and landing documented datasets in storage
Zakres obowiązków jest szeroki i obejmuje zarówno tworzenie procedur, jak i ich wdrażanie oraz zapewnienie jakości danych.
🟡
The suite includes LLM inference and training workloads (Llama-family models at several sizes, quantized and full precision), extending to larger models as we move to higher-memory GPUs.
Praca będzie skupiona na konkretnych modelach LLM, a nie na szerszym spektrum ML, co może być ograniczeniem dla osób szukających różnorodności.
🟡
Repeatability is crucial: identical load every run, so the variation comes from the hardware, not the workload.
Kładziony jest nacisk na powtarzalność testów, co może oznaczać monotonną pracę polegającą na wielokrotnym uruchamianiu tych samych procedur.
🔴
You are building the system that reliably p
Fragment jest urwany, co sugeruje niedokończone lub niekompletne ogłoszenie, które może wymagać dodatkowych wyjaśnień.