JustJoin.IT Hybrydowo Senior

Senior Site Reliability Engineer

EPAM Systems

⚲ Warsaw

Do uzgodnienia

Wymagania

  • min. 5 lat doświadczenia w operowaniu produkcyjnymi systemami w chmurze
  • doświadczenie w skalowaniu, definiowaniu SLO i zarządzaniu on-call rotations
  • doświadczenie w Azure IaaS/PaaS operations
  • doświadczenie w IaC (Terraform/Bicep) i CI/CD
  • doświadczenie w observability stacks z LLM tracing i container orchestration
  • znajomość Python/Bash do automatyzacji
  • znajomość podstaw FinOps dla workloads AI
  • doświadczenie w codziennym użyciu AI w pracy operacyjnej (incident triage, runbooki, analiza logów)

Opis stanowiska

Senior SRE w EPAM — będziesz odpowiadać za niezawodność, observability i zdrowie operacyjne produkcyjnych systemów AI na Azure. W zakres wchodzi IaC, CI/CD, LLM-aware observability (tracing, drift detection, guardrails), definiowanie SLO, incident management, on-call, FinOps dla AI oraz bezpieczeństwo. Uwaga: opis wprost mówi o 'embedding cost, security, and quality discipline into every solution's lifecycle' — zakres odpowiedzialności jest bardzo szeroki, warto dopytać o realne obciążenie i podział zadań w zespole.

🔍 Dekoder Ogłoszenia

🟡
bridging the gap between deployment and long-term operability
Ogólnikowe sformułowanie — może oznaczać, że rola łączy wiele odpowiedzialności bez jasno określonych granic
🔴
embedding cost, security, and quality discipline into every solution's lifecycle
Szeroki zakres odpowiedzialności — ryzyko przeciążenia obowiązkami