Опыт промышленной разработки, внедрения или эксплуатации GenAI-, ML- или Data-платформ.
Практический опыт работы с LLM-инференсом: vLLM, Text Generation Inference, Triton Inference Server, llama.cpp или аналогичные решения.
Понимание особенностей эксплуатации LLM: задержки, throughput, batch-запросы, потоковая генерация, контекстное окно, потребление памяти, GPU-ресурсы и стоимость инференса.
Опыт проектирования или эксплуатации API для доступа к моделям, включая OpenAI-совместимые интерфейсы, авторизацию, лимиты, маршрутизацию и отказоустойчивость.
Понимание принципов RAG: разбиение документов на фрагменты, эмбеддинги, векторный и гибридный поиск, reranking, фильтрация, версионирование индексов и оценка качества retrieval.