О компании
Мы ускоряем инференс нейронных сетей для задач автономного вождения — моделей восприятия сцены и планирования, которые работают непосредственно на бортовом железе автомобиля. ML-команды отвечают за обучение и качество моделей. Наша задача — обеспечить эффективное выполнение моделей на целевых платформах с минимальной потерей точности.
Обязанности
- Руководство командой CUDA-оптимизации инференса: people management, формирование технических планов и приоритетов, контроль исполнения проектов и ответственность за достижение измеримых результатов по latency, throughput и эффективности использования памяти на целевом железе.
- Проектирование и оптимизация вычислительных ядер: разработка и оптимизация CUDA-kernel и fusion операций для ключевых блоков моделей (matmul, conv, attention и др.), снижая memory traffic и launch overhead. Стремление к устойчивому ускорению в end-to-end сценариях.
- Работа с архитектурой GPU: эффективное использование memory hierarchy, layout данных, tiling-подходы, tensor cores и механизмы повышения occupancy. Системный анализ bottleneck с помощью Nsight и других профилировщиков и формирование вариантов оптимизаций с учётом ограничений железа.
Требования
- Сильный опыт CUDA performance engineering
- Работа с kernel для matmul/conv/attention
- Хорошее знание C++
- Понимание memory hierarchy GPU и cost model вычислительных операций
- Умение находить bottleneck через профилирование и доводить оптимизации до измеримого ускорения
- Способность к техническому лидерству или управлению командой
- Умение аргументировать performance-решения и работать в кросс-командной среде
Будет плюсом, если вы:
- Работали с CUTLASS / Triton / кастомными inference-движками
- Оптимизировали модели под конкретные GPU-архитектуры
- Работали с quantization / mixed precision
- Строили roofline-модели или latency/bandwidth-оценки
- Знаете о fusion-подходах и graph-level оптимизациях