Állás · Senior

Senior gépi tanulás mérnök – LLM-inferencia optimalizálás

AI / ML Engineer • Senior • Remote • Teljes munkaidő • Európai Unió EU/EMEA

A Nebius Applied AI csapatában a modellek és végpontok optimalizálásáért felelsz a modellműtermékektől az éles üzemig, a késleltetés, az átviteli sebesség és a tokenenkénti költség javításával.

Feladatok

  • ▹Meghatározott modellcsaládok, ügyfélvégpontok vagy kiszolgáló háttérrendszerek optimalizálása
  • ▹Inferenciamotorok összehasonlítása és gyakorlati kiszolgálási konfigurációk javasolása
  • ▹Modellminőségi vagy teljesítményromlások felderítése éles bevezetéskor
  • ▹LLM- és VLM-végpontok optimalizálása késleltetésre, átviteli sebességre, memóriahatékonyságra, GPU-kihasználtságra, minőségre és tokenenkénti költségre
  • ▹Inferenciamotorok (vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo) telepítése, beállítása, mérése és bővítése
  • ▹Modelltömörítési folyamatok építése: kvantálás, kvantálásra tudatos tanítás, desztilláció, alacsony bitszámú kiszolgálás
  • ▹Spekulatív dekódolás, KV-cache optimalizálás, prefix caching, chunked prefill, folyamatos kötegelés és szétválasztott prefill/decode kiszolgálás megvalósítása
  • ▹Reprodukálható mérőkörnyezetek építése (TTFT, TPOT, token/s GPU-nként, p95/p99 késleltetés, GPU-memória, megbízhatóság, tokenenkénti költség)
  • ▹Szűk keresztmetszetek felderítése a GPU-kernel- és platformmérnökökkel közösen
  • ▹Tervdokumentumok, teljesítményjelentések, bevezetési tervek és ügyfeleknek szóló műszaki magyarázatok írása

Elvárások

  • ▹Erős Python és PyTorch mérnöki tudás
  • ▹Gyakorlati tapasztalat LLM-, VLM- vagy nagy áteresztőképességű transzformer-inferenciarendszerek telepítésében vagy optimalizálásában
  • ▹Gyakorlati ismeret legalább egy modern inferenciaverembe (vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe vagy hasonló)
  • ▹A transzformer-inferencia szűk keresztmetszeteinek mély ismerete (KV-cache, attention, memória-sávszélesség, kötegelés, párhuzamosítás)

A munkáltatóról

A Nebius az MI-gazdaság számára épít teljes körű AI-felhőplatformot, az adatoktól és modelltanítástól az éles üzemig. Az amszterdami székhelyű, tőzsdén jegyzett cégnél több mint 1500 fős csapat dolgozik.

Hasonló állások