Data Engineer (PySpark)
⚲ Warszawa
120–150 zł netto (+ VAT) / godz.
Wymagania
- 2-4 lata doświadczenia jako Data Engineer lub na podobnym stanowisku
- praktyczne doświadczenie z PySpark / Apache Spark
- rozumienie kluczowych konceptów Sparka: partycjonowanie, shuffle, repartition vs coalesce, broadcast joins, data skew
- praktyczne doświadczenie z AWS, zwłaszcza AWS Glue, Amazon S3, Amazon CloudWatch
- doświadczenie w budowie, utrzymaniu lub rozwoju pipeline'ów ETL
- doświadczenie w obsłudze scenariuszy błędów ETL: retry, reprocessing, partial failures
- podstawowe rozumienie idempotencji i bezpiecznego restartu po awariach
- mocne umiejętności SQL (joins, aggregations, filtering, grouping, ranking)
Opis stanowiska
Utrzymanie i rozwój produkcyjnych pipeline'ów ETL na AWS w oparciu o PySpark i AWS Glue. Rola skupia się na praktycznej implementacji, diagnozowaniu problemów produkcyjnych i optymalizacji wydajności Sparka, a nie na projektowaniu architektury end-to-end. Dobra oferta dla data engineera, który lubi pracować z dużymi wolumenami danych i rozwiązywać konkretne problemy operacyjne. Uwaga: zakres jest zawężony do implementacji i utrzymania istniejących rozwiązań, bez projektowania architektury od podstaw.
🔍 Dekoder Ogłoszenia
🔴
This position focuses on practical implementation and operational excellence rather than end-to-end architecture design.
Oznacza to, że będziesz głównie zajmować się utrzymaniem i poprawianiem istniejących rozwiązań, a nie tworzeniem nowych od podstaw.
🟡
independently deliver tasks
Oczekuje się, że będziesz w stanie samodzielnie realizować powierzone zadania bez ciągłego nadzoru.
🟡
diagnose common production issues
Będziesz musiał radzić sobie z problemami, które pojawiają się w działających systemach, a nie tylko z nowymi implementacjami.
🟡
Basic understanding of idempotency and safe restart strategies after failures.
Wymagane jest podstawowe zrozumienie tych koncepcji, co może oznaczać, że nie będziesz ich projektować, ale musisz je rozumieć w kontekście istniejących rozwiązań.