Állás

Data engineer – onboarding

Data Engineer • Remote • Teljes munkaidő • Európai Unió EU/EMEA

A Sardine pénzügyi bűnözés elleni platformjához keresnek senior adat-/ML-mérnököt, aki a megfelelőségi döntések mögötti adat- és gépitanulás-alapot építi. A szerep az adatfolyamoktól a modellekig az onboardingot futtató pipeline-ok teljes körű gazdája; a pozíció távoli, az Egyesült Államokból vagy Kanadából.

Feladatok

  • ▹Az adatbetöltési réteg kezelése, amely az eszköztelemetriát, tranzakciós eseményeket, KYC/identitás-jeleket és harmadik féltől származó adatdúsítást hozza a platformra: streaming (Pub/Sub, Apache Beam Dataflow-n, Flink) és batch pipeline-ok (Python, Airflow Cloud Composeren, Spark Dataproc-on) tervezése
  • ▹A feature platform építése és fejlesztése, ahol ugyanazokat a Chronon feature-definíciókat számolja a Flink streamelve és a Spark batch módban, egy órától 300 napig terjedő aggregációs ablakokkal, másodperc alatti időkeretben kiszolgálva a szabálymotort és a modelleket
  • ▹A feature-helyesség mérnöki fegyelemmé tétele: streaming és batch összevetése, újraszámítási tesztek a tárházon, train/serve egyezőségi ellenőrzések és drift-monitorozás
  • ▹Csalás- és identitás-ML-modellek produktívvá tétele: tanítási pipeline-ok Vertex AI-on és Kubeflow-n, gradient-boosted és fa alapú modellek (XGBoost, LightGBM, CatBoost, scikit-learn), hiperparaméter-keresés, SHAP-alapú magyarázatok és pontszám-normalizálás
  • ▹Automatizált újratanítás, champion/challenger előléptetés és visszagörgetés megvalósítása
  • ▹KYC-, AML- és identitáskockázati jelek előállítása: dokumentumellenőrzés, szankciós/PEP/negatív média szűrés, e-mail- és telefonkockázat, szintetikus identitás jelei, bank- és számlaellenőrzés, időszakos ügyfél-átvilágítás
  • ▹Új adatforrások integrálása és megerősítése, köztük 30+ harmadik fél adatdúsító szolgáltató párhuzamos hívása a kérés útvonalán, valamint az ügyfelek közötti konzorciumi hálózat; feladatátvétel, időkeretek, fokozatos lebomlás, gyorsítótárazás és költség kezelése
  • ▹A BigQuery-beli tárház- és modellezési réteg kezelése: particionálás, staging-mart rétegek, tanító adathalmazok, folyamatban lévő migráció a dbt-ről ütemezett SQL- és Python-pipeline-okra
  • ▹Entitásfeloldási és gráfadatok tervezése, amelyek összekötik az ügyfeleket, eszközöket, e-maileket, telefonszámokat, kártyákat, bankszámlákat és kriptocímeket az ügyfelek között, nagyléptékű connected components munkával
  • ▹A platform biztonságossá tétele: mezőszintű titkosítás az érzékeny azonosítókhoz, régiós adattárolás érvényesítése a pipeline-definíciókban, PII-kezelés és törlési útvonalak, feature-szintű kapcsolás, hogy egy hibás jelet telepítés nélkül ki lehessen kapcsolni
  • ▹Műszaki irány kijelölése és a csapat színvonalának emelése: tervdokumentumok, review-k, mentorálás, build vagy buy döntések

Elvárások

  • ▹8+ év tapasztalat éles adat- és ML-rendszerek építésében, valódi felelősséggel a pipeline és a modell oldalon is
  • ▹Olyan modellek szállítása, amelyek jelentős automatizált döntéseket hoztak, nem csupán dashboardok
  • ▹Mély Python- és erős SQL-tudás
  • ▹Folyékony használat egy elosztott feldolgozó keretrendszerben (Spark, Beam vagy Flink), a streaming szemantika (ablakozás, watermark, késői adatok, exactly-once és at-least-once) ismerete
  • ▹Gyakorlati tapasztalat modern felhős adatstackkel: elsősorban GCP (BigQuery, Dataflow, Dataproc, Pub/Sub, Bigtable, Composer, Vertex AI) vagy az AWS megfelelői, valamint Docker, Kubernetes, Terraform és CI/CD
  • ▹Gyakorlati ML-mérnöki mélység: feature store-ok és feature pipeline-ok, training/serving skew, gradient-boosted fa modellek, osztályaránytalanság és ritka események modellezése, küszöb- és költségérzékeny hangolás, modellmonitorozás, drift-észlelés és magyarázhatóság
  • ▹Tapasztalat nagy forgalmú, alacsony késleltetésű kiszolgálásban, ahol a feature-lekérésre néhány száz ezredmásodperc jut és nincs újrapróbálkozási keret
  • ▹Csalás, kockázat, fizetések, hitelezés vagy identitás/KYC területi tapasztalat, vagy a szabályozott terület gyors elsajátításának bizonyított képessége
  • ▹A címkekésleltetés, a visszacsatolási hurkok és az ellenséges drift miatti különbség megértése a csalásmodellezés és a hagyományos felügyelt tanulás között
  • ▹Adatkormányzási ismeretek szabályozott környezetben: PII, titkosítás, hozzáférés-szabályozás, régiós adattárolás, auditálhatóság
  • ▹Erős írásbeli kommunikáció: modellezési kompromisszumok elmagyarázása csalás-elemzőknek és pipeline-tervezés backend mérnököknek

Előny

  • ▹Tapasztalat ügyfélfelé néző ML-ben: bring-your-own-model integrációk, modellmagyarázhatóság hátrányos döntésekhez vagy szabályozói felülvizsgálathoz, shadow/challenger pontozási keretrendszerek

Soft skillek

Erős írásbeli kommunikációExtrém felelősségvállalás és növekedésorientáltságKezdeményezőkészség és komfort a bizonytalanságbanMentorálás és műszaki irányadás

Amit kínálunk

  • ▹Távoli munka bárhonnan, remote-first kultúra
  • ▹Az Egyesült Államokból vagy Kanadából végezhető munka
  • ▹Hubok a Bay Area-ban, New Yorkban, Austinban, Torontóban és São Paulóban
  • ▹Rugalmas munkabeosztás: a teljesítményt értékelik, nem a ledolgozott órákat

A munkáltatóról

A Sardine a pénzügyi bűnözés elleni küzdelem vezető ügynökalapú kockázati platformja, amely egységesíti a kockázati csapatok adatait a csalások valós idejű megállításához és a csalás- és AML-műveletek automatizálásához. Ügyfelei között van a FIS, a GoDaddy, az Intuit, az Edward Jones, a ZoomInfo és a Checkout.com.

Hasonló állások