← Все вакансии/Senior/Cloudlinux
SeniorRemoteTbilisi

Site Reliability Engineer

C
Cloudlinux
Уровень
Senior
Формат
Remote
О роли

Описание вакансии

О компании

Imunify360 — это многоуровневый Linux-набор для обеспечения безопасности серверов: WAF, IDS/IPS, сканирование и очистка вредоносных программ, упреждающая защита, управление исправлениями, репутация — работающий как агент на сотнях тысяч клиентских серверов, поддерживаемый облачной инфраструктурой сканирования, корреляции и доставки сигнатур на собственном «железе».

Обязанности
  • Определить, что означает «работает» для ~70 компонентов: провести определение SLI с лидами команд и старшими инженерами, создать таксономию, включающую сервисные SLI, SLI парка, SLI эффективности контроля, SLI доставки и SLI конвейера.
  • Соблюдать правило: SLI должен быть измерим извне шлюза того, что он измеряет.
  • Прикрепить SLO, бюджет ошибок и ответственную команду к каждому SLI.
  • Построить систему сбора: спроектировать и реализовать конвейер для получения индикаторов с парка в хранилище с поддержкой запросов: push-based, сэмплирование, ограничения конфиденциальности, бюджет кардинальности.
  • Расширить инструментирование на стороне агента и сервиса, где сигнал еще не существует, на Python, Go и Rust.
  • Консолидировать текущий разброс дашбордов, ad-hoc запросов и путей отчетности в защищаемый набор инструментов.
  • Построить алертинг и управление алертами: симптомный, привязанный к SLO, с семантикой multi-window burn-rate; трехуровневая таксономия (page / ticket / dashboard); каждый алерт с владельцем, runbook и документированным режимом отказа.
  • Построить эскалацию: карта владения компонент → команда, матрица серьезности, SLA на подтверждение, ротация follow-the-sun, практика управления инцидентами и безобвинительные постмортемы в течение 24 часов.
Требования
  • Значительный опыт в production-инженерии или SRE, включая как минимум одно окружение, где вы определяли структуру SLO, а не наследовали её.
  • Сильный Python. Уверенное чтение и модификация Go или Rust — наши агенты написаны на них, и инструментирование попадает туда.
  • Глубокое практическое понимание временных рядов и телеметрии событий в масштабе: Prometheus/OpenMetrics, Grafana, слой маршрутизации класса Alertmanager, колоночное хранилище для данных парка с высокой кардинальностью (ClickHouse или эквивалент).
  • Отладка распределенных систем на «железе» и долгоживущих хостах. Большая часть этого парка — не Kubernetes, и рефлексы, предполагающие оркестратор, не перенесутся чисто.
  • Управление конфигурацией и CI в производственном масштабе — Ansible, GitLab CI, Jenkins или близкие эквиваленты.
  • Суждение, чтобы проектировать измерения для машин, которыми вы не владеете и которые не можете скрейпить: push.
Условия
  • Полная удаленная работа (remote-only).
  • Локация: Тбилиси, удаленно.
Стек и навыки

С чем работаем