Állás · Principal

Staff szoftvermérnök, GPU inferencia

Szoftverfejlesztő • Principal • Remote • Teljes munkaidő Kanada Toronto Office, Kanada

A Cerebras új generációs, szétválasztott AI-inferencia rendszereket épít, amelyek GPU-gyorsított prefill-t kombinálnak a Cerebras Wafer-Scale Engine ultragyors decode-jával. A pozíció a GPU-kiszolgáló stack éles minőségűvé tételéért és optimalizálásáért felel, egyedi inferencia API-kon, a vLLM futtatókörnyezeten, az AMD ROCm szoftverstacken és rack-szintű AMD GPU-infrastruktúrán keresztül. Kézzelfogható szerep, mély hibakereséssel és optimalizálással alkalmazás-, futtatókörnyezet-, elosztott rendszer- és hardverszinten.

Feladatok

  • A GPU-inferencia stack éles minőségűvé tétele: a teljes GPU prefill útvonal tervezése, építése és karbantartása (API szolgáltatások, modellkiszolgáló workerek, vLLM, PyTorch, ROCm, GPU-node-ok, hálózat, rack-szintű infrastruktúra)
  • GPU-üzemeltetési készenlét kialakítása: telepítési, frissítési, visszaállítási, állapotellenőrzési és hibaelhárítási gyakorlatok kidolgozása az AMD GPU-flottára
  • Megbízhatóság vezetése éles környezetben: SLI/SLO-k definiálása, hibaizolálás, kecses degradáció és automatizált helyreállítás javítása
  • Inferencia-teljesítmény javítása: time-to-first-token, átviteli sebesség, tail latency, GPU-kihasználtság és memóriahatékonyság profilozása és optimalizálása
  • Modellkiszolgálási viselkedés hangolása: ütemezés, folyamatos batch-elés, prefix cache, KV-cache kezelés, tenzor- és expert-parallelizmus
  • Hibakeresés rendszerrétegeken át: alkalmazáskód, vLLM, PyTorch, ROCm/HIP, kollektív kommunikációs könyvtárak, kernelek, driverek, firmware
  • Numerikus helyesség biztosítása: validációs és regressziós infrastruktúra modellminőséghez, pontossághoz, kvantáláshoz
  • Teljesítmény- és helyesség-infrastruktúra építése: benchmarkok, workload-replay eszközök, profilozás-automatizálás, dashboardok

Elvárások

  • 8+ év szoftverfejlesztői tapasztalat, komplex éles rendszerek önálló felelősségvállalásával
  • Nagy nyelvi modellek vagy hasonlóan igényes GPU-munkaterhelések éles inferencia-rendszereinek építése, üzemeltetése vagy optimalizálása
  • Erős C++ és Python programozási tudás, többszálúsággal, konkurenciával, memóriakezeléssel
  • Gyakorlati tapasztalat nagy teljesítményű modellkiszolgáló keretrendszerrel (pl. vLLM, SGLang, TensorRT-LLM, Triton Inference Server)
  • GPU-végrehajtás és teljesítmény erős ismerete: aszinkron végrehajtás, memóriamozgatás, szinkronizáció, profilozási módszertan
  • Elosztott rendszerek hibakeresésének tapasztalata több rétegen át
  • Linux, konténerek, Kubernetes vagy hasonló orchesztrációs rendszerek, megfigyelhetőség, CI/CD tapasztalata
  • Szigorú benchmarkok tervezésének és zajos teljesítményeredmények értelmezésének képessége
  • Erős kommunikációs és technikai vezetői készségek
  • Számítástechnikai, számítógép-mérnöki, villamosmérnöki vagy kapcsolódó alapszak, vagy azzal egyenértékű gyakorlati tapasztalat

Előny

  • Tapasztalat AMD Instinct gyorsítókkal és a ROCm ökoszisztémával (HIP, RCCL, rocprofiler, AMD SMI stb.)
  • Mély CUDA-tapasztalat, amely GPU-rendszerismeret átvitelét mutatja más gyorsítóplatformokra
  • Hozzájárulás vLLM, SGLang, PyTorch, Triton vagy TensorRT-LLM projektekhez
  • Prefill-nehéz vagy szétválasztott prefill/decode inferencia-architektúrák optimalizálásának tapasztalata
  • KV-cache átvitel, prefix cache, folyamatos batch-elés és ütemezés ismerete
  • Multi-GPU és multi-node inferencia tapasztalata (tenzor-, pipeline-, expert-parallelizmus, RDMA)
  • Mixture-of-Experts vagy multimodális modellek optimalizálása
  • GPU-kernel optimalizálás, operátor-fúzió, figyelem-kernelek, GEMM-hangolás ismerete
  • Csökkentett pontosságú inferencia és kvantálási formátumok (BF16, FP8, FP4, INT8, INT4) tapasztalata
  • Numerikus összehasonlító, determinisztikus vagy regressziós tesztrendszerek építése
  • Együttműködés gyorsítógyártókkal, keretrendszer-fenntartókkal vagy nyílt forráskódú közösségekkel

Soft skillek

Erős kommunikációs és technikai vezetői készségekKétértelmű, cross-funkcionális projektek végigvitelének képességePrecíz, rendszerszintű hibakeresési szemléletÖnálló felelősségvállalás komplex problémákban

A munkáltatóról

A Cerebras Systems a világ legnagyobb AI-chipjét építi, amely 56-szor nagyobb, mint egy GPU. Ez az architektúra iparágvezető betanítási és inferencia-sebességet biztosít, több mint 10-szer gyorsabbat, mint a GPU-alapú hyperscale felhő inferenciaszolgáltatások. Az OpenAI nemrég többéves partnerséget jelentett be a Cerebrasszal 750 megawattnyi kapacitás telepítésére.

Végzettség: Számítástechnikai, számítógép-mérnöki, villamosmérnöki vagy kapcsolódó alapszak (BSc), vagy azzal egyenértékű gyakorlati tapasztalat

Hasonló állások