О компании
Xsolla — глобальная коммерческая компания с надежными инструментами и сервисами, помогающими разработчикам решать неотъемлемые задачи игровой индустрии. От инди до AAA, компании сотрудничают с Xsolla, чтобы финансировать, распространять, маркетировать и монетизировать свои игры. Основанная на вере в будущее видеоигр, Xsolla непоколебима в своей миссии объединять возможности и постоянно предоставлять новые ресурсы создателям. Штаб-квартира находится в Лос-Анджелесе, Калифорния, Xsolla действует как торговый представитель и помогла более чем 1500+ разработчикам игр охватить больше игроков и развивать свой бизнес по всему миру.
Обязанности
- Владение инфраструктурой уровня приложений: Helm-чарты, конфигурации Terraform, развертывания Kubernetes, конфигурация времени выполнения, сетевое взаимодействие и интеграции на уровне сервисов
- Владение наблюдаемостью домена: проектирование и внедрение SLO/SLI, мониторов, алертов и дашбордов для критических сервисов на Datadog и инструментарии на основе OpenTelemetry
- Помощь в настройке и развитии CI/CD пайплайнов для сервисов домена (GitLab CI, GitHub Actions), включая автоматизацию деплоя и откатов
- Проведение планирования мощностей и настройки производительности перед ожидаемой нагрузкой — запуски продуктов, распродажи и региональные раскатки, включая нагрузочное тестирование и расследование регрессий производительности
- Проведение обзоров производственной готовности для новых сервисов и крупных изменений; определение и обеспечение того, что значит «готово к продакшену» для домена
- Поддержка реагирования на инциденты домена: помощь в глубоком расследовании сложных инцидентов, участие в пост-мортемах, продвижение последующих улучшений надежности и поддержание runbook'ов
- Создание доменной автоматизации, снижающей операционную рутину: автоматизация runbook'ов, помощники деплоя, повторяющиеся операционные скрипты
- Поддержание и продвижение перспективного роадмапа надежности домена совместно с лидами продуктовой инженерии
- Участие в планировании, уточнениях и архитектурных обзорах продуктовой команды, привнося перспективу надежности до того, как дизайн-решения станут дорогими для изменения
- Соавторство в общеcompany-wide стандартах SLO/SLI, мощностей и операционных стандартов вместе с более широкой SRE-командой; прямое внесение улучшений в общие подсистемы, управляемые SRE
- Участие в дежурствах SRE, поддержка разработчиков по всей компании
Требования
- 3+ года подтвержденного опыта SRE, DevOps или платформенной инженерии: дежурства или реагирование на инциденты, владение SLO/мониторингом, работа с пайплайнами деплоя и инфраструктурой для продакшен-сервисов
- Опыт разработки ПО: вы создавали и запускали бэкенд-сервисы, а не только управляли ими — уверенно читаете код приложений во время расследования и пишете продакшен-качественную автоматизацию как минимум на одном языке (например, Go, PHP)
- Практический опыт работы с Kubernetes: Helm, манифесты, стратегии деплоя, отладка производительности и сетевых проблем на уровне приложений (GKE или другой управляемый Kubernetes)
- Солидная практика наблюдаемости: создание мониторов, дашбордов и SLO/SLI на современной платформе (предпочтительно Datadog; также релевантен опыт с Prometheus/Grafana), знакомство с OpenTelemetry
- Опыт работы с Infrastructure as Code (Terraform/Terragrunt) для взаимодействия с платформенными командами
- Опыт работы с GCP (IAM, сети, управляемые сервисы)
- Опыт создания и поддержки CI/CD пайплайнов (GitLab CI и/или GitHub Actions)
- Достаточное владение программированием/скриптами для создания автоматизации и инструментов (например, Python, Go или Bash)
- Практический опыт реагирования на инциденты, пост-мортемов и продвижения улучшений надежности на основе инцидентов
- Сильные навыки сотрудничества и коммуникации — эта роль ежедневно работает встроенно с командами разработки продуктов
- Опыт в платежах, финтехе, электронной коммерции или гейминге — высоконагруженные транзакционные системы