Engineering Jobs
GPU-Accelerated LLM Inference Engineer
Rakuten Asia Pte Ltd
Job Description
Rakuten Asia Pte. Ltd. in Singapore is seeking an LLM Inference Optimization Engineer to maximize the performance, efficiency, and scalability of large-scale inference workloads on GPU clusters. You will optimize engines and GPU kernels to ensure peak model serving efficiency. The role requires deep expertise in CUDA/Triton, inference internals, and experience with at least one serving engine. Collaboration with global teams across Rakuten will be essential. J-18808-Ljbffr
Jobs provided by Adzuna