
Staff szoftvermérnök, GPU inferencia
A Cerebras új generációs, szétválasztott AI-inferencia rendszereket épít, amelyek GPU-gyorsított prefill-t kombinálnak a Cerebras Wafer-Scale Engine ultragyors decode-jával. A pozíció a GPU-kiszolgáló stack éles minőségűvé tételéért és optimalizálásáért felel, egyedi inferencia API-kon, a vLLM futtatókörnyezeten, az AMD ROCm szoftverstacken és rack-szintű AMD GPU-infrastruktúrán keresztül. Kézzelfogható szerep, mély hibakereséssel és optimalizálással alkalmazás-, futtatókörnyezet-, elosztott rendszer- és hardverszinten.
Feladatok
- ▹A GPU-inferencia stack éles minőségűvé tétele: a teljes GPU prefill útvonal tervezése, építése és karbantartása (API szolgáltatások, modellkiszolgáló workerek, vLLM, PyTorch, ROCm, GPU-node-ok, hálózat, rack-szintű infrastruktúra)
- ▹GPU-üzemeltetési készenlét kialakítása: telepítési, frissítési, visszaállítási, állapotellenőrzési és hibaelhárítási gyakorlatok kidolgozása az AMD GPU-flottára
- ▹Megbízhatóság vezetése éles környezetben: SLI/SLO-k definiálása, hibaizolálás, kecses degradáció és automatizált helyreállítás javítása
- ▹Inferencia-teljesítmény javítása: time-to-first-token, átviteli sebesség, tail latency, GPU-kihasználtság és memóriahatékonyság profilozása és optimalizálása
- ▹Modellkiszolgálási viselkedés hangolása: ütemezés, folyamatos batch-elés, prefix cache, KV-cache kezelés, tenzor- és expert-parallelizmus
- ▹Hibakeresés rendszerrétegeken át: alkalmazáskód, vLLM, PyTorch, ROCm/HIP, kollektív kommunikációs könyvtárak, kernelek, driverek, firmware
- ▹Numerikus helyesség biztosítása: validációs és regressziós infrastruktúra modellminőséghez, pontossághoz, kvantáláshoz
- ▹Teljesítmény- és helyesség-infrastruktúra építése: benchmarkok, workload-replay eszközök, profilozás-automatizálás, dashboardok
Elvárások
- ▹8+ év szoftverfejlesztői tapasztalat, komplex éles rendszerek önálló felelősségvállalásával
- ▹Nagy nyelvi modellek vagy hasonlóan igényes GPU-munkaterhelések éles inferencia-rendszereinek építése, üzemeltetése vagy optimalizálása
- ▹Erős C++ és Python programozási tudás, többszálúsággal, konkurenciával, memóriakezeléssel
- ▹Gyakorlati tapasztalat nagy teljesítményű modellkiszolgáló keretrendszerrel (pl. vLLM, SGLang, TensorRT-LLM, Triton Inference Server)
- ▹GPU-végrehajtás és teljesítmény erős ismerete: aszinkron végrehajtás, memóriamozgatás, szinkronizáció, profilozási módszertan
- ▹Elosztott rendszerek hibakeresésének tapasztalata több rétegen át
- ▹Linux, konténerek, Kubernetes vagy hasonló orchesztrációs rendszerek, megfigyelhetőség, CI/CD tapasztalata
- ▹Szigorú benchmarkok tervezésének és zajos teljesítményeredmények értelmezésének képessége
- ▹Erős kommunikációs és technikai vezetői készségek
- ▹Számítástechnikai, számítógép-mérnöki, villamosmérnöki vagy kapcsolódó alapszak, vagy azzal egyenértékű gyakorlati tapasztalat
Előny
- ▹Tapasztalat AMD Instinct gyorsítókkal és a ROCm ökoszisztémával (HIP, RCCL, rocprofiler, AMD SMI stb.)
- ▹Mély CUDA-tapasztalat, amely GPU-rendszerismeret átvitelét mutatja más gyorsítóplatformokra
- ▹Hozzájárulás vLLM, SGLang, PyTorch, Triton vagy TensorRT-LLM projektekhez
- ▹Prefill-nehéz vagy szétválasztott prefill/decode inferencia-architektúrák optimalizálásának tapasztalata
- ▹KV-cache átvitel, prefix cache, folyamatos batch-elés és ütemezés ismerete
- ▹Multi-GPU és multi-node inferencia tapasztalata (tenzor-, pipeline-, expert-parallelizmus, RDMA)
- ▹Mixture-of-Experts vagy multimodális modellek optimalizálása
- ▹GPU-kernel optimalizálás, operátor-fúzió, figyelem-kernelek, GEMM-hangolás ismerete
- ▹Csökkentett pontosságú inferencia és kvantálási formátumok (BF16, FP8, FP4, INT8, INT4) tapasztalata
- ▹Numerikus összehasonlító, determinisztikus vagy regressziós tesztrendszerek építése
- ▹Együttműködés gyorsítógyártókkal, keretrendszer-fenntartókkal vagy nyílt forráskódú közösségekkel
Soft skillek
A munkáltatóról
A Cerebras Systems a világ legnagyobb AI-chipjét építi, amely 56-szor nagyobb, mint egy GPU. Ez az architektúra iparágvezető betanítási és inferencia-sebességet biztosít, több mint 10-szer gyorsabbat, mint a GPU-alapú hyperscale felhő inferenciaszolgáltatások. Az OpenAI nemrég többéves partnerséget jelentett be a Cerebrasszal 750 megawattnyi kapacitás telepítésére.
Hasonló állások

Staff Software Engineer, Inference API

Principal Software Engineer, AI Software Automotive Lead

Principal System Software Engineer, AI Inference Execution
