职位描述
智能驾驶TransformerTensorFlowPyTorch多模型训练人工智能半导体/芯片
Responsibilities
参与自动驾驶模型训练加速与性能优化,包括:
Data Pipeline Optimization(数据流水线优化)、GPU utilization optimization(GPU利用率优化)、Training throughput optimization(训练吞吐优化)
参与分布式训练系统优化,包括:
Multi-GPU / Multi-node Training(多机多卡训练)、Communication Optimization(通信优化)、Overlap Communication & Computation(通信计算重叠)
参与训练框架与 Runtime 优化:
PyTorch Runtime Optimization、CUDA Kernel Optimization、Memory Optimization(显存优化)、Mixed Precision Training(混合精度训练)
分析并优化模型训练瓶颈,包括:
GPU compute bottleneck、Data loading bottleneck、Kernel launch overhead、Distributed synchronization overhead
参与自动化性能 Benchmark 与 Profiling 系统建设:
GPU profiling、Training regression analysis、Performance benchmarking
跟踪并研究前沿训练加速技术,包括:
FlashAttention、Fused Operators、Torch Compile、CUDA Graph、Triton Kernel、Distributed Training Optimization
Requirements
计算机、电子工程、人工智能或相关专业本科/硕士,具备较强工程能力与学习能力。
熟悉 Python 或 C++ 编程,具备良好的代码能力。
熟悉深度学习框架之一:
PyTorch、TensorFlow 或 JAX
对 GPU / 并行计算 有一定理解,包括:
CUDA execution model、GPU memory hierarchy、Thread / Warp execution、GPU performance basics
熟悉深度学习训练流程:
Forward / Backward propagation、Optimizer、Distributed Data Parallel(DDP)、Mixed Precision Training
具备基本性能分析能力,能够使用 profiling 工具定位性能瓶颈。
Preferred Qualifications
有以下方向经验之一:
CUDA Programming、Distributed Training、GPU Kernel Optimization、AI Compiler、ML Systems
熟悉以下工具或框架之一:
Nsight Systems、Nsight Compute、PyTorch Profiler、DeepSpeed、Megatron-LM、Horovod
有以下优化经验之一:
CUDA Kernel Fusion、Memory Optimization、Communication Optimization、Training Throughput Optimization
熟悉自动驾驶 / 多模态模型 / 大模型训练相关技术。
有开源项目、竞赛或科研经历加分。
base:苏州/杭州
参与自动驾驶模型训练加速与性能优化,包括:
Data Pipeline Optimization(数据流水线优化)、GPU utilization optimization(GPU利用率优化)、Training throughput optimization(训练吞吐优化)
参与分布式训练系统优化,包括:
Multi-GPU / Multi-node Training(多机多卡训练)、Communication Optimization(通信优化)、Overlap Communication & Computation(通信计算重叠)
参与训练框架与 Runtime 优化:
PyTorch Runtime Optimization、CUDA Kernel Optimization、Memory Optimization(显存优化)、Mixed Precision Training(混合精度训练)
分析并优化模型训练瓶颈,包括:
GPU compute bottleneck、Data loading bottleneck、Kernel launch overhead、Distributed synchronization overhead
参与自动化性能 Benchmark 与 Profiling 系统建设:
GPU profiling、Training regression analysis、Performance benchmarking
跟踪并研究前沿训练加速技术,包括:
FlashAttention、Fused Operators、Torch Compile、CUDA Graph、Triton Kernel、Distributed Training Optimization
Requirements
计算机、电子工程、人工智能或相关专业本科/硕士,具备较强工程能力与学习能力。
熟悉 Python 或 C++ 编程,具备良好的代码能力。
熟悉深度学习框架之一:
PyTorch、TensorFlow 或 JAX
对 GPU / 并行计算 有一定理解,包括:
CUDA execution model、GPU memory hierarchy、Thread / Warp execution、GPU performance basics
熟悉深度学习训练流程:
Forward / Backward propagation、Optimizer、Distributed Data Parallel(DDP)、Mixed Precision Training
具备基本性能分析能力,能够使用 profiling 工具定位性能瓶颈。
Preferred Qualifications
有以下方向经验之一:
CUDA Programming、Distributed Training、GPU Kernel Optimization、AI Compiler、ML Systems
熟悉以下工具或框架之一:
Nsight Systems、Nsight Compute、PyTorch Profiler、DeepSpeed、Megatron-LM、Horovod
有以下优化经验之一:
CUDA Kernel Fusion、Memory Optimization、Communication Optimization、Training Throughput Optimization
熟悉自动驾驶 / 多模态模型 / 大模型训练相关技术。
有开源项目、竞赛或科研经历加分。
base:苏州/杭州
登录查看完整内容
工作地点
苏州*********

客户公司信息
客户公司名称 某建筑公司
客户公司地址 深圳南山区
客户公司人数 10000人以上
公司信息
公司介绍
Libtalent Pte Ltd是一家总部位于新加坡的专业猎头公司,Libtalent拥有悠久的人力资源专业化服务历史、丰富的市场经验以及完备的服务资质。2015年强势登录中国,并在多地陆续成立了分公司,专注于中国领袖企业高端人才寻募,为在华客户提供360°招聘新体验和国际化的视野人才解决方案。Libtalent目前在深圳、北京、武汉、上海、广州成立分支机构,在新能源、环保、汽车、物业、地产、高端制造以及航空航天等领域有着卓越的业绩,在行业客户中拥有良好的口碑,已成为国内行业领域中当之无愧的最佳人才战略合作商。Libtalent团队来自于国内外著名人才中介机构、跨国公司和国内大型优秀企业,具有良好的专业背景、丰富的人力资源管理和中高层管理经验。我们能够很好地理解客户的运作商业策略和竞争态势。同时,借助于丰富的行业知识和广泛的人脉网络,结合专业行业知识达到快速人才交付和高性价比的招聘体验。
工商信息
企业名称 广州泽尔马管理咨询有限公司
企业类型 有限责任公司(自然人独资)
法人代表 白艳平
经营状态 在营(开业)
成立时间 2021-07-22
注册资本 100万元
认证资质
营业执照信息 人力资源服务许可证




