О компании
Алиса помогает миллионам людей решать повседневные задачи. В команде Алисы AI мы строим Мою Память — единое место для того, что важно пользователю: заметок, дел, списков, планов и файлов. Но наша цель — не просто сделать ещё один заметочник. Мы создаём контекстный слой Алисы: пользователь сможет без лишних усилий сохранить важное, найти это обычными словами и получить нужный контекст в подходящий момент — в чате, с помощью колонки или на другом устройстве с Алисой.
В основе сценария — LLM, которая понимает намерение пользователя, вызывает нужные инструменты для создания, поиска и изменения записей и формирует итоговый ответ. Здесь особенно важны точность и надёжность: Алиса не должна забывать сохранить обещанное, менять не ту запись или уверенно говорить о действии, которого не произошло.
Обязанности
- Создание системы оценки качества AI-продукта: формировать целостную картину качества сценария, определять ключевые метрики и раскладывать их по этапам, связывать офлайн-оценку моделей с поведением продукта в реальном потоке, проектировать мониторинги и дашборды, находить срезы, в которых общая метрика скрывает проблемы.
- Приёмка новых моделей и изменений: собирать репрезентативные eval-наборы и приёмочные корзинки, сравнивать версии моделей и разбирать регрессии, развивать LLM-as-a-judge и проверять его согласованность с человеческой оценкой, определять критерии готовности к эксперименту и запуску, проводить постанализ после выкладки.
- Разбор ошибок модели и поиск точек роста: работать с живыми пользовательскими сценариями и текстовыми логами, искать срабатывания false positive и false negative, разбирать DSAT и проблемные диалоги, кластеризовать ошибки, выявлять повторяющиеся паттерны через data mining и эвристики, превращать наблюдения в проверяемые гипотезы.
- Подготовка данных для улучшения моделей и проверка изменений онлайн: формировать выборки для обучения, валидации и независимой приёмки, следить за покрытием сценариев и смещениями в данных, помогать определять разметку и таксономию ошибок, оценивать качество датасетов и автоматической разметки, делать воспроизводимые исследования, проектировать и анализировать A/B-эксперименты.
Требования
- Уверенное владение SQL и Python, умение самостоятельно проводить исследование от сырых данных до вывода
- Умение работать с большими объёмами событийных данных и текстовых логов
- Знание основ математической статистики и A/B-тестирования
- Умение проектировать метрики, проверять их валидность и объяснять ограничения
- Способность превратить размытый вопрос о качестве продукта в конкретные метрики и исследования
Условия
- Гибридный формат работы
- Офисы в Москве