← Все вакансии/Middle/Яндекс
MiddleHybridМосква

ML Analyst

Я
Яндекс
Уровень
Middle
Формат
Hybrid
О роли

Описание вакансии

О компании

Алиса помогает миллионам людей решать повседневные задачи. В команде Алисы AI мы строим Мою Память — единое место для того, что важно пользователю: заметок, дел, списков, планов и файлов. Но наша цель — не просто сделать ещё один заметочник. Мы создаём контекстный слой Алисы: пользователь сможет без лишних усилий сохранить важное, найти это обычными словами и получить нужный контекст в подходящий момент — в чате, с помощью колонки или на другом устройстве с Алисой.

В основе сценария — LLM, которая понимает намерение пользователя, вызывает нужные инструменты для создания, поиска и изменения записей и формирует итоговый ответ. Здесь особенно важны точность и надёжность: Алиса не должна забывать сохранить обещанное, менять не ту запись или уверенно говорить о действии, которого не произошло.

Обязанности
  • Создание системы оценки качества AI-продукта: формировать целостную картину качества сценария, определять ключевые метрики и раскладывать их по этапам, связывать офлайн-оценку моделей с поведением продукта в реальном потоке, проектировать мониторинги и дашборды, находить срезы, в которых общая метрика скрывает проблемы.
  • Приёмка новых моделей и изменений: собирать репрезентативные eval-наборы и приёмочные корзинки, сравнивать версии моделей и разбирать регрессии, развивать LLM-as-a-judge и проверять его согласованность с человеческой оценкой, определять критерии готовности к эксперименту и запуску, проводить постанализ после выкладки.
  • Разбор ошибок модели и поиск точек роста: работать с живыми пользовательскими сценариями и текстовыми логами, искать срабатывания false positive и false negative, разбирать DSAT и проблемные диалоги, кластеризовать ошибки, выявлять повторяющиеся паттерны через data mining и эвристики, превращать наблюдения в проверяемые гипотезы.
  • Подготовка данных для улучшения моделей и проверка изменений онлайн: формировать выборки для обучения, валидации и независимой приёмки, следить за покрытием сценариев и смещениями в данных, помогать определять разметку и таксономию ошибок, оценивать качество датасетов и автоматической разметки, делать воспроизводимые исследования, проектировать и анализировать A/B-эксперименты.
Требования
  • Уверенное владение SQL и Python, умение самостоятельно проводить исследование от сырых данных до вывода
  • Умение работать с большими объёмами событийных данных и текстовых логов
  • Знание основ математической статистики и A/B-тестирования
  • Умение проектировать метрики, проверять их валидность и объяснять ограничения
  • Способность превратить размытый вопрос о качестве продукта в конкретные метрики и исследования
Условия
  • Гибридный формат работы
  • Офисы в Москве
Стек и навыки

С чем работаем