Állás · Principal

Staff szoftvermérnök, GPU inferencia

Szoftverfejlesztő • Principal • Remote • Teljes munkaidő • Kanada Toronto Office, Kanada

A Cerebras új generációs, szétválasztott AI-inferencia rendszereket épít, amelyek GPU-gyorsított prefill-t kombinálnak a Cerebras Wafer-Scale Engine ultragyors decode-jával. A pozíció a GPU-kiszolgáló stack éles minőségűvé tételéért és optimalizálásáért felel, egyedi inferencia API-kon, a vLLM futtatókörnyezeten, az AMD ROCm szoftverstacken és rack-szintű AMD GPU-infrastruktúrán keresztül. Kézzelfogható szerep, mély hibakereséssel és optimalizálással alkalmazás-, futtatókörnyezet-, elosztott rendszer- és hardverszinten.

Feladatok

  • ▹A GPU-inferencia stack éles minőségűvé tétele: a teljes GPU prefill útvonal tervezése, építése és karbantartása (API szolgáltatások, modellkiszolgáló workerek, vLLM, PyTorch, ROCm, GPU-node-ok, hálózat, rack-szintű infrastruktúra)
  • ▹GPU-üzemeltetési készenlét kialakítása: telepítési, frissítési, visszaállítási, állapotellenőrzési és hibaelhárítási gyakorlatok kidolgozása az AMD GPU-flottára
  • ▹Megbízhatóság vezetése éles környezetben: SLI/SLO-k definiálása, hibaizolálás, kecses degradáció és automatizált helyreállítás javítása
  • ▹Inferencia-teljesítmény javítása: time-to-first-token, átviteli sebesség, tail latency, GPU-kihasználtság és memóriahatékonyság profilozása és optimalizálása
  • ▹Modellkiszolgálási viselkedés hangolása: ütemezés, folyamatos batch-elés, prefix cache, KV-cache kezelés, tenzor- és expert-parallelizmus
  • ▹Hibakeresés rendszerrétegeken át: alkalmazáskód, vLLM, PyTorch, ROCm/HIP, kollektív kommunikációs könyvtárak, kernelek, driverek, firmware
  • ▹Numerikus helyesség biztosítása: validációs és regressziós infrastruktúra modellminőséghez, pontossághoz, kvantáláshoz
  • ▹Teljesítmény- és helyesség-infrastruktúra építése: benchmarkok, workload-replay eszközök, profilozás-automatizálás, dashboardok

Elvárások

  • ▹8+ év szoftverfejlesztői tapasztalat, komplex éles rendszerek önálló felelősségvállalásával
  • ▹Nagy nyelvi modellek vagy hasonlóan igényes GPU-munkaterhelések éles inferencia-rendszereinek építése, üzemeltetése vagy optimalizálása
  • ▹Erős C++ és Python programozási tudás, többszálúsággal, konkurenciával, memóriakezeléssel
  • ▹Gyakorlati tapasztalat nagy teljesítményű modellkiszolgáló keretrendszerrel (pl. vLLM, SGLang, TensorRT-LLM, Triton Inference Server)
  • ▹GPU-végrehajtás és teljesítmény erős ismerete: aszinkron végrehajtás, memóriamozgatás, szinkronizáció, profilozási módszertan
  • ▹Elosztott rendszerek hibakeresésének tapasztalata több rétegen át
  • ▹Linux, konténerek, Kubernetes vagy hasonló orchesztrációs rendszerek, megfigyelhetőség, CI/CD tapasztalata
  • ▹Szigorú benchmarkok tervezésének és zajos teljesítményeredmények értelmezésének képessége
  • ▹Erős kommunikációs és technikai vezetői készségek
  • ▹Számítástechnikai, számítógép-mérnöki, villamosmérnöki vagy kapcsolódó alapszak, vagy azzal egyenértékű gyakorlati tapasztalat

Előny

  • ▹Tapasztalat AMD Instinct gyorsítókkal és a ROCm ökoszisztémával (HIP, RCCL, rocprofiler, AMD SMI stb.)
  • ▹Mély CUDA-tapasztalat, amely GPU-rendszerismeret átvitelét mutatja más gyorsítóplatformokra
  • ▹Hozzájárulás vLLM, SGLang, PyTorch, Triton vagy TensorRT-LLM projektekhez
  • ▹Prefill-nehéz vagy szétválasztott prefill/decode inferencia-architektúrák optimalizálásának tapasztalata
  • ▹KV-cache átvitel, prefix cache, folyamatos batch-elés és ütemezés ismerete
  • ▹Multi-GPU és multi-node inferencia tapasztalata (tenzor-, pipeline-, expert-parallelizmus, RDMA)
  • ▹Mixture-of-Experts vagy multimodális modellek optimalizálása
  • ▹GPU-kernel optimalizálás, operátor-fúzió, figyelem-kernelek, GEMM-hangolás ismerete
  • ▹Csökkentett pontosságú inferencia és kvantálási formátumok (BF16, FP8, FP4, INT8, INT4) tapasztalata
  • ▹Numerikus összehasonlító, determinisztikus vagy regressziós tesztrendszerek építése
  • ▹Együttműködés gyorsítógyártókkal, keretrendszer-fenntartókkal vagy nyílt forráskódú közösségekkel

Soft skillek

Erős kommunikációs és technikai vezetői készségekKétértelmű, cross-funkcionális projektek végigvitelének képességePrecíz, rendszerszintű hibakeresési szemléletÖnálló felelősségvállalás komplex problémákban

A munkáltatóról

A Cerebras Systems a világ legnagyobb AI-chipjét építi, amely 56-szor nagyobb, mint egy GPU. Ez az architektúra iparágvezető betanítási és inferencia-sebességet biztosít, több mint 10-szer gyorsabbat, mint a GPU-alapú hyperscale felhő inferenciaszolgáltatások. Az OpenAI nemrég többéves partnerséget jelentett be a Cerebrasszal 750 megawattnyi kapacitás telepítésére.

Végzettség: Számítástechnikai, számítógép-mérnöki, villamosmérnöki vagy kapcsolódó alapszak (BSc), vagy azzal egyenértékű gyakorlati tapasztalat

Hasonló állások