
A Sardine pénzügyi bűnözés elleni platformjához keresnek senior adat-/ML-mérnököt, aki a megfelelőségi döntések mögötti adat- és gépitanulás-alapot építi. A szerep az adatfolyamoktól a modellekig az onboardingot futtató pipeline-ok teljes körű gazdája; a pozíció távoli, az Egyesült Államokból vagy Kanadából.
Stack
Feladatok
- ▹Az adatbetöltési réteg kezelése, amely az eszköztelemetriát, tranzakciós eseményeket, KYC/identitás-jeleket és harmadik féltől származó adatdúsítást hozza a platformra: streaming (Pub/Sub, Apache Beam Dataflow-n, Flink) és batch pipeline-ok (Python, Airflow Cloud Composeren, Spark Dataproc-on) tervezése
- ▹A feature platform építése és fejlesztése, ahol ugyanazokat a Chronon feature-definíciókat számolja a Flink streamelve és a Spark batch módban, egy órától 300 napig terjedő aggregációs ablakokkal, másodperc alatti időkeretben kiszolgálva a szabálymotort és a modelleket
- ▹A feature-helyesség mérnöki fegyelemmé tétele: streaming és batch összevetése, újraszámítási tesztek a tárházon, train/serve egyezőségi ellenőrzések és drift-monitorozás
- ▹Csalás- és identitás-ML-modellek produktívvá tétele: tanítási pipeline-ok Vertex AI-on és Kubeflow-n, gradient-boosted és fa alapú modellek (XGBoost, LightGBM, CatBoost, scikit-learn), hiperparaméter-keresés, SHAP-alapú magyarázatok és pontszám-normalizálás
- ▹Automatizált újratanítás, champion/challenger előléptetés és visszagörgetés megvalósítása
- ▹KYC-, AML- és identitáskockázati jelek előállítása: dokumentumellenőrzés, szankciós/PEP/negatív média szűrés, e-mail- és telefonkockázat, szintetikus identitás jelei, bank- és számlaellenőrzés, időszakos ügyfél-átvilágítás
- ▹Új adatforrások integrálása és megerősítése, köztük 30+ harmadik fél adatdúsító szolgáltató párhuzamos hívása a kérés útvonalán, valamint az ügyfelek közötti konzorciumi hálózat; feladatátvétel, időkeretek, fokozatos lebomlás, gyorsítótárazás és költség kezelése
- ▹A BigQuery-beli tárház- és modellezési réteg kezelése: particionálás, staging-mart rétegek, tanító adathalmazok, folyamatban lévő migráció a dbt-ről ütemezett SQL- és Python-pipeline-okra
- ▹Entitásfeloldási és gráfadatok tervezése, amelyek összekötik az ügyfeleket, eszközöket, e-maileket, telefonszámokat, kártyákat, bankszámlákat és kriptocímeket az ügyfelek között, nagyléptékű connected components munkával
- ▹A platform biztonságossá tétele: mezőszintű titkosítás az érzékeny azonosítókhoz, régiós adattárolás érvényesítése a pipeline-definíciókban, PII-kezelés és törlési útvonalak, feature-szintű kapcsolás, hogy egy hibás jelet telepítés nélkül ki lehessen kapcsolni
- ▹Műszaki irány kijelölése és a csapat színvonalának emelése: tervdokumentumok, review-k, mentorálás, build vagy buy döntések
Elvárások
- ▹8+ év tapasztalat éles adat- és ML-rendszerek építésében, valódi felelősséggel a pipeline és a modell oldalon is
- ▹Olyan modellek szállítása, amelyek jelentős automatizált döntéseket hoztak, nem csupán dashboardok
- ▹Mély Python- és erős SQL-tudás
- ▹Folyékony használat egy elosztott feldolgozó keretrendszerben (Spark, Beam vagy Flink), a streaming szemantika (ablakozás, watermark, késői adatok, exactly-once és at-least-once) ismerete
- ▹Gyakorlati tapasztalat modern felhős adatstackkel: elsősorban GCP (BigQuery, Dataflow, Dataproc, Pub/Sub, Bigtable, Composer, Vertex AI) vagy az AWS megfelelői, valamint Docker, Kubernetes, Terraform és CI/CD
- ▹Gyakorlati ML-mérnöki mélység: feature store-ok és feature pipeline-ok, training/serving skew, gradient-boosted fa modellek, osztályaránytalanság és ritka események modellezése, küszöb- és költségérzékeny hangolás, modellmonitorozás, drift-észlelés és magyarázhatóság
- ▹Tapasztalat nagy forgalmú, alacsony késleltetésű kiszolgálásban, ahol a feature-lekérésre néhány száz ezredmásodperc jut és nincs újrapróbálkozási keret
- ▹Csalás, kockázat, fizetések, hitelezés vagy identitás/KYC területi tapasztalat, vagy a szabályozott terület gyors elsajátításának bizonyított képessége
- ▹A címkekésleltetés, a visszacsatolási hurkok és az ellenséges drift miatti különbség megértése a csalásmodellezés és a hagyományos felügyelt tanulás között
- ▹Adatkormányzási ismeretek szabályozott környezetben: PII, titkosítás, hozzáférés-szabályozás, régiós adattárolás, auditálhatóság
- ▹Erős írásbeli kommunikáció: modellezési kompromisszumok elmagyarázása csalás-elemzőknek és pipeline-tervezés backend mérnököknek
Előny
- ▹Tapasztalat ügyfélfelé néző ML-ben: bring-your-own-model integrációk, modellmagyarázhatóság hátrányos döntésekhez vagy szabályozói felülvizsgálathoz, shadow/challenger pontozási keretrendszerek
Soft skillek
Erős írásbeli kommunikációExtrém felelősségvállalás és növekedésorientáltságKezdeményezőkészség és komfort a bizonytalanságbanMentorálás és műszaki irányadás
Amit kínálunk
- ▹Távoli munka bárhonnan, remote-first kultúra
- ▹Az Egyesült Államokból vagy Kanadából végezhető munka
- ▹Hubok a Bay Area-ban, New Yorkban, Austinban, Torontóban és São Paulóban
- ▹Rugalmas munkabeosztás: a teljesítményt értékelik, nem a ledolgozott órákat
A munkáltatóról
A Sardine a pénzügyi bűnözés elleni küzdelem vezető ügynökalapú kockázati platformja, amely egységesíti a kockázati csapatok adatait a csalások valós idejű megállításához és a csalás- és AML-műveletek automatizálásához. Ügyfelei között van a FIS, a GoDaddy, az Intuit, az Edward Jones, a ZoomInfo és a Checkout.com.
Hasonló állások

Állás
Data Engineer Manager
Artefact
AI/ML
+3
💰 Bér: nincs megadva
🏢 Helyszíni
🗣️ EN

Állás
Igazgató, analitikai engineering (2 pozíció)
Novartis
AI/MLBigqueryDatabricksData Science
+5
194 600–361 400 USD/év
bruttó
🌍 Remote
Position
🗣️ EN
Állás
Manager, Data Platform
ZoomInfo Technologies LLC
AI/MLBigqueryDatabricks
+8
💰 Bér: nincs megadva
🌍 Remote
Anywhere in the World
🗣️ EN

Állás
Cloud Data Engineer (m/w/d)
Dataciders
DatabricksData Science
+6
💰 Bér: nincs megadva
🏢 Helyszíni
Dataciders Standort
🗣️ német kell

Állás
Analitikai Mérnök
Dandelionhealth
AI/MLData ScienceDbt
+6
140 000–150 000 USD/év
bruttó
🌍 Remote
🗣️ EN

Állás
Data Analytics Engineer
Ruby Labs
BigqueryClickhouseDagsterDbt
+5
💰 Bér: nincs megadva
🌍 Remote
🗣️ EN