Staff ML Performance Engineer (Inference Optimisation)
- Location
- Greater London, England, United Kingdom
memory, bandwidth, power/thermal, or cost). Strong proficiency with at least one relevant stack/toolchain (e.g. TensorRT, CUDA, Qualcomm QNN, Triton, OpenCL) and confidence learning adjacent frameworks quickly. Comfort operating at multiple levels of abstraction — from high‐level model behaviour down to low‐level kernel/ ...