Pracuj.pl Praca zdalna Senior

ML/AI Infrastructure Engineer

SQUARE ONE RESOURCES sp. z o.o.

⚲ Warszawa, Mokotów

180–190 zł netto (+ VAT) / godz.

Wymagania

  • GPU
  • Ansible
  • Terraform
  • Linux
  • Kubernetes
  • Slurm
  • HPC

Opis stanowiska

Nasze wymagania:
Praktyczne doświadczenie w projektowaniu i administracji środowisk HPC.
Bardzo dobra znajomość systemu Linux.
Bardzo dobra znajomość Kubernetes.
Doświadczenie z systemem kolejkowania Slurm.
Znajomość technologii InfiniBand.
Doświadczenie z systemami plików Ceph i/lub Lustre.
Umiejętność optymalizacji wydajności infrastruktury oraz aplikacji HPC.
Umiejętność diagnozowania problemów w środowiskach o wysokiej dostępności.

Mile widziane:
Doświadczenie z platformami GPU dla AI.
Znajomość NVIDIA AI Enterprise.
Doświadczenie z GPUaaS lub Run.
Znajomość Ansible i Terraform.
Doświadczenie w automatyzacji oraz Infrastructure as Code.
Wiedza z zakresu monitoringu i wydajności środowisk produkcyjnych.

O projekcie:
Dołącz do projektu, którego celem jest budowa nowoczesnej infrastruktury AI/ML opartej na GPU. Będziesz mieć realny wpływ na projektowanie, wdrażanie i rozwój środowisk High Performance Computing (HPC), wykorzystywanych do trenowania modeli sztucznej inteligencji oraz realizacji zaawansowanych obliczeń.

Zakres obowiązków:
Projektowanie, wdrażanie i rozwój środowisk HPC.
Budowa oraz administracja klastrami GPU dla obciążeń AI/ML.
Zarządzanie i optymalizacja środowisk opartych o Linux i Kubernetes.
Konfiguracja oraz administracja schedulerem Slurm.
Wdrażanie i utrzymanie wydajnych systemów storage (Ceph i/lub Lustre).
Optymalizacja wydajności infrastruktury oraz profilowanie aplikacji HPC.
Monitoring, diagnozowanie i rozwiązywanie problemów w środowiskach produkcyjnych.
Automatyzacja wdrożeń z wykorzystaniem Ansible i Terraform.
Współpraca z zespołami odpowiedzialnymi za rozwiązania AI oraz infrastrukturę centrów danych.

Oferujemy:
Praca w pełni zdalnie
Zatrudnienie na B2B
Długoterminowa współpraca

🔍 Dekoder Ogłoszenia

🔴
Praktyczne doświadczenie w projektowaniu i administracji środowisk HPC.
Oczekują, że będziesz w stanie samodzielnie zaprojektować i utrzymać złożone systemy obliczeniowe wysokiej wydajności, a nie tylko wykonywać polecenia.
🔴
Umiejętność optymalizacji wydajności infrastruktury oraz aplikacji HPC.
Nie wystarczy, że coś będzie działać, musisz umieć sprawić, żeby działało jak najszybciej i najefektywniej, co może wymagać głębokiej analizy i eksperymentów.
🔴
Umiejętność diagnozowania problemów w środowiskach o wysokiej dostępności.
Oczekują, że będziesz w stanie szybko i skutecznie rozwiązywać skomplikowane problemy, które mogą wpływać na ciągłość działania systemu.
🟡
Doświadczenie z platformami GPU dla AI.
Może oznaczać zarówno pracę z gotowymi rozwiązaniami, jak i konieczność konfiguracji i optymalizacji sprzętu i oprogramowania pod kątem specyficznych potrzeb.
🔴
Doświadczenie w automatyzacji oraz Infrastructure as Code.
Oczekują, że będziesz tworzyć i utrzymywać kod definiujący infrastrukturę, co wymaga nie tylko znajomości narzędzi, ale też umiejętności projektowania skalowalnych i powtarzalnych rozwiązań.