← Все вакансии/Senior/Яндекс
SeniorHybridСанкт-Петербург, Москва

CUDA Inference Team Lead

Я
Яндекс
Уровень
Senior
Формат
Hybrid
О роли

Описание вакансии

О компании

Мы ускоряем инференс нейронных сетей для задач автономного вождения — моделей восприятия сцены и планирования, которые работают непосредственно на бортовом железе автомобиля. ML-команды отвечают за обучение и качество моделей. Наша задача — обеспечить эффективное выполнение моделей на целевых платформах с минимальной потерей точности.

Обязанности
  • Руководство командой CUDA-оптимизации инференса: people management, формирование технических планов и приоритетов, контроль исполнения проектов и ответственность за достижение измеримых результатов по latency, throughput и эффективности использования памяти на целевом железе.
  • Проектирование и оптимизация вычислительных ядер: разработка и оптимизация CUDA-kernel и fusion операций для ключевых блоков моделей (matmul, conv, attention и др.), снижая memory traffic и launch overhead. Стремление к устойчивому ускорению в end-to-end сценариях.
  • Работа с архитектурой GPU: эффективное использование memory hierarchy, layout данных, tiling-подходы, tensor cores и механизмы повышения occupancy. Системный анализ bottleneck с помощью Nsight и других профилировщиков и формирование вариантов оптимизаций с учётом ограничений железа.
Требования
  • Сильный опыт CUDA performance engineering
  • Работа с kernel для matmul/conv/attention
  • Хорошее знание C++
  • Понимание memory hierarchy GPU и cost model вычислительных операций
  • Умение находить bottleneck через профилирование и доводить оптимизации до измеримого ускорения
  • Способность к техническому лидерству или управлению командой
  • Умение аргументировать performance-решения и работать в кросс-командной среде

Будет плюсом, если вы:

  • Работали с CUTLASS / Triton / кастомными inference-движками
  • Оптимизировали модели под конкретные GPU-архитектуры
  • Работали с quantization / mixed precision
  • Строили roofline-модели или latency/bandwidth-оценки
  • Знаете о fusion-подходах и graph-level оптимизациях
Стек и навыки

С чем работаем