Research Scientist Engineer Training Infrastructure

Luma AI develops multimodal creative AI agents, video and image generation models, and an API for generative media workflows.

Redwood City, United States
About Luma AI

Luma AI is an active AI company whose Luma Agents product plans, generates, iterates, and refines creative work across video, image, audio, and text. Its first-party materials describe proprietary Ray video and Uni image models, as well as developer API access.

View jobs by Luma AI

Skills

Candidate Availability

Required and preferred rules are kept separate and reflect the wording in the original posting.

About the Role

You will design, implement, and optimize distributed training systems across thousands of GPUs. You will implement advanced parallelization, build monitoring and debugging tools, and improve training stability, convergence, and resource utilization across large clusters.

Requirements

  • Extensive distributed PyTorch training and foundation-model parallelism experience
  • Deep understanding of GPU clusters, networking, and storage systems
  • Familiarity with NCCL, MPI, and distributed-system optimization

Responsibilities

  • Design, implement, and optimize distributed training systems
  • Implement advanced training parallelization
  • Build monitoring, visualization, and debugging tools
  • Optimize training stability, convergence, and resource utilization
Research Scientist Engineer Training Infrastructure at Luma AI | JobStash