Mid Data Engineer (AWS)
⚲ Warszawa
Do uzgodnienia
Wymagania
- Python
- PySpark
- AWS
Opis stanowiska
Opis projektu:
• Rozwijamy platformę Data Lake/Lakehouse w AWS opartą o skalowalne przetwarzanie danych.
• Budujemy framework przetwarzania danych oraz wysokowydajne pipeline'y ETL/ELT.
• Stosujemy architekturę medalionową, wykorzystując formaty Apache Iceberg i Parquet.
• Rozwijamy produkt z naciskiem na wydajność, niezawodność i jakoś danych.
• Standaryzujemy Data Governance i automatyzujemy wszystko, co generuje koszty operacyjne.
Twoje zadania:
• Projektowanie i rozwój pipeline'ów w Python, PySpark i MWAA (Airflow).
• Implementacja rozwiązań w oparciu o S3, Glue, EMR, Athena, Lambda, MSK (Kafka) i Kinesis Data Streams.
• Optymalizacja przetwarzania, storage'u i kosztów platformy AWS Data Lake.
• Rozwój infrastruktury z wykorzystaniem Terraform, GitHub i Jenkins.
• Implementacja mechanizmów Data Quality / Data Governance oraz współpraca przy budowie produktu.
• Debugowanie pipeline'ów, zanim zrobi to rachunek z AWS.
Wymagania:
• Kilka lat doświadczenia jako Data Engineer.
• Bardzo dobra znajomość: Python, PySpark oraz procesów ETL/ELT.
• Praktyczne doświadczenie z Data Lake/Lakehouse, Apache Iceberg, Parquet i architekturą medalionową (lub inną nomenklaturą, ważne jest rozumienie całego procesu przetwarzania danych od źródła do konsumenta)
• Dobra znajomość usług AWS: S3, Glue, EMR, Athena, MWAA (Airflow), Lambda, MSK (Kafka), Kinesis Data Streams.
• Doświadczenie z Terraform, GitHub oraz Jenkins.
• Świadomość, że źle zaprojektowany pipeline najpierw niszczy wydajność, a potem budżet.
Mile widziane:
• Doświadczenie z Data Governance, Data Quality, Great Expectations (GX) i DataHub.
• Umiejętność współpracy z zespołami analitycznymi przy rozwoju produktów data.
• Dobra znajomość języka angielskiego.
• Przekonanie, że najlepszą optymalizacją kosztów jest pipeline, którego nie trzeba uruchamiać kilka razy ;-)
• Rozwijamy platformę Data Lake/Lakehouse w AWS opartą o skalowalne przetwarzanie danych.
• Budujemy framework przetwarzania danych oraz wysokowydajne pipeline'y ETL/ELT.
• Stosujemy architekturę medalionową, wykorzystując formaty Apache Iceberg i Parquet.
• Rozwijamy produkt z naciskiem na wydajność, niezawodność i jakoś danych.
• Standaryzujemy Data Governance i automatyzujemy wszystko, co generuje koszty operacyjne.
Twoje zadania:
• Projektowanie i rozwój pipeline'ów w Python, PySpark i MWAA (Airflow).
• Implementacja rozwiązań w oparciu o S3, Glue, EMR, Athena, Lambda, MSK (Kafka) i Kinesis Data Streams.
• Optymalizacja przetwarzania, storage'u i kosztów platformy AWS Data Lake.
• Rozwój infrastruktury z wykorzystaniem Terraform, GitHub i Jenkins.
• Implementacja mechanizmów Data Quality / Data Governance oraz współpraca przy budowie produktu.
• Debugowanie pipeline'ów, zanim zrobi to rachunek z AWS.
Wymagania:
• Kilka lat doświadczenia jako Data Engineer.
• Bardzo dobra znajomość: Python, PySpark oraz procesów ETL/ELT.
• Praktyczne doświadczenie z Data Lake/Lakehouse, Apache Iceberg, Parquet i architekturą medalionową (lub inną nomenklaturą, ważne jest rozumienie całego procesu przetwarzania danych od źródła do konsumenta)
• Dobra znajomość usług AWS: S3, Glue, EMR, Athena, MWAA (Airflow), Lambda, MSK (Kafka), Kinesis Data Streams.
• Doświadczenie z Terraform, GitHub oraz Jenkins.
• Świadomość, że źle zaprojektowany pipeline najpierw niszczy wydajność, a potem budżet.
Mile widziane:
• Doświadczenie z Data Governance, Data Quality, Great Expectations (GX) i DataHub.
• Umiejętność współpracy z zespołami analitycznymi przy rozwoju produktów data.
• Dobra znajomość języka angielskiego.
• Przekonanie, że najlepszą optymalizacją kosztów jest pipeline, którego nie trzeba uruchamiać kilka razy ;-)
🔍 Dekoder Ogłoszenia
🔴
Debugowanie pipeline'ów, zanim zrobi to rachunek z AWS.
Oczekuje się, że będziesz proaktywnie identyfikować i rozwiązywać problemy z wydajnością i kosztami, aby uniknąć nieprzewidzianych wydatków.
🔴
Standaryzujemy Data Governance i automatyzujemy wszystko, co generuje koszty operacyjne.
Może to oznaczać, że obecne procesy są nieefektywne i będziesz miał dużo pracy związanej z porządkowaniem i optymalizacją.
🔴
Rozwijamy produkt z naciskiem na wydajność, niezawodność i jakość danych.
Choć brzmi to pozytywnie, może sugerować, że obecny produkt ma problemy z tymi obszarami i będziesz musiał je naprawić.
🔴
Optymalizacja przetwarzania, storage'u i kosztów platformy AWS Data Lake.
Jest duża szansa, że będziesz musiał zmierzyć się z istniejącymi problemami związanymi z wydajnością i kosztami platformy.
🟡
Świadomość, że źle zaprojektowany pipeline najpierw niszczy wydajność
Podkreśla to wagę poprawnego projektowania, ale może też sugerować, że w przeszłości zdarzały się takie problemy.