
Staff szoftvermérnök, GPU inferencia
A Cerebras új generációs, szétválasztott AI-inferencia rendszereket épít, amelyek GPU-gyorsított prefill-t kombinálnak a Cerebras Wafer-Scale Engine ultragyors decode-jával. A pozíció a GPU-kiszolgáló stack éles minőségűvé tételéért és optimalizálásáért felel, egyedi inferencia API-kon, a vLLM futtatókörnyezeten, az AMD ROCm szoftverstacken és rack-szintű AMD GPU-infrastruktúrán keresztül. Kézzelfogható szerep, mély hibakereséssel és optimalizálással alkalmazás-, futtatókörnyezet-, elosztott rendszer- és hardverszinten.
Feladatok
- ▹A GPU-inferencia stack éles minőségűvé tétele: a teljes GPU prefill útvonal tervezése, építése és karbantartása (API szolgáltatások, modellkiszolgáló workerek, vLLM, PyTorch, ROCm, GPU-node-ok, hálózat, rack-szintű infrastruktúra)
- ▹GPU-üzemeltetési készenlét kialakítása: telepítési, frissítési, visszaállítási, állapotellenőrzési és hibaelhárítási gyakorlatok kidolgozása az AMD GPU-flottára
- ▹Megbízhatóság vezetése éles környezetben: SLI/SLO-k definiálása, hibaizolálás, kecses degradáció és automatizált helyreállítás javítása
- ▹Inferencia-teljesítmény javítása: time-to-first-token, átviteli sebesség, tail latency, GPU-kihasználtság és memóriahatékonyság profilozása és optimalizálása
- ▹Modellkiszolgálási viselkedés hangolása: ütemezés, folyamatos batch-elés, prefix cache, KV-cache kezelés, tenzor- és expert-parallelizmus
- ▹Hibakeresés rendszerrétegeken át: alkalmazáskód, vLLM, PyTorch, ROCm/HIP, kollektív kommunikációs könyvtárak, kernelek, driverek, firmware
- ▹Numerikus helyesség biztosítása: validációs és regressziós infrastruktúra modellminőséghez, pontossághoz, kvantáláshoz
- ▹Teljesítmény- és helyesség-infrastruktúra építése: benchmarkok, workload-replay eszközök, profilozás-automatizálás, dashboardok
Elvárások
- ▹8+ év szoftverfejlesztői tapasztalat, komplex éles rendszerek önálló felelősségvállalásával
- ▹Nagy nyelvi modellek vagy hasonlóan igényes GPU-munkaterhelések éles inferencia-rendszereinek építése, üzemeltetése vagy optimalizálása
- ▹Erős C++ és Python programozási tudás, többszálúsággal, konkurenciával, memóriakezeléssel
- ▹Gyakorlati tapasztalat nagy teljesítményű modellkiszolgáló keretrendszerrel (pl. vLLM, SGLang, TensorRT-LLM, Triton Inference Server)
- ▹GPU-végrehajtás és teljesítmény erős ismerete: aszinkron végrehajtás, memóriamozgatás, szinkronizáció, profilozási módszertan
- ▹Elosztott rendszerek hibakeresésének tapasztalata több rétegen át
- ▹Linux, konténerek, Kubernetes vagy hasonló orchesztrációs rendszerek, megfigyelhetőség, CI/CD tapasztalata
- ▹Szigorú benchmarkok tervezésének és zajos teljesítményeredmények értelmezésének képessége
- ▹Erős kommunikációs és technikai vezetői készségek
- ▹Számítástechnikai, számítógép-mérnöki, villamosmérnöki vagy kapcsolódó alapszak, vagy azzal egyenértékű gyakorlati tapasztalat
Előny
- ▹Tapasztalat AMD Instinct gyorsítókkal és a ROCm ökoszisztémával (HIP, RCCL, rocprofiler, AMD SMI stb.)
- ▹Mély CUDA-tapasztalat, amely GPU-rendszerismeret átvitelét mutatja más gyorsítóplatformokra
- ▹Hozzájárulás vLLM, SGLang, PyTorch, Triton vagy TensorRT-LLM projektekhez
- ▹Prefill-nehéz vagy szétválasztott prefill/decode inferencia-architektúrák optimalizálásának tapasztalata
- ▹KV-cache átvitel, prefix cache, folyamatos batch-elés és ütemezés ismerete
- ▹Multi-GPU és multi-node inferencia tapasztalata (tenzor-, pipeline-, expert-parallelizmus, RDMA)
- ▹Mixture-of-Experts vagy multimodális modellek optimalizálása
- ▹GPU-kernel optimalizálás, operátor-fúzió, figyelem-kernelek, GEMM-hangolás ismerete
- ▹Csökkentett pontosságú inferencia és kvantálási formátumok (BF16, FP8, FP4, INT8, INT4) tapasztalata
- ▹Numerikus összehasonlító, determinisztikus vagy regressziós tesztrendszerek építése
- ▹Együttműködés gyorsítógyártókkal, keretrendszer-fenntartókkal vagy nyílt forráskódú közösségekkel
Soft skillek
A munkáltatóról
A Cerebras Systems a világ legnagyobb AI-chipjét építi, amely 56-szor nagyobb, mint egy GPU. Ez az architektúra iparágvezető betanítási és inferencia-sebességet biztosít, több mint 10-szer gyorsabbat, mint a GPU-alapú hyperscale felhő inferenciaszolgáltatások. Az OpenAI nemrég többéves partnerséget jelentett be a Cerebrasszal 750 megawattnyi kapacitás telepítésére.
Hasonló állások

Principal Software Engineer (Libraries Platform)

Principal System Software Engineer, AI Inference Execution

Staff Software Engineer, Backend

Staff Software Engineer (ML QA)

Staff Software Engineer (ML QA)
