О компании
Imunify360 — это многоуровневый Linux-набор для обеспечения безопасности серверов: WAF, IDS/IPS, сканирование и очистка вредоносных программ, упреждающая защита, управление исправлениями, репутация — работающий как агент на сотнях тысяч клиентских серверов, поддерживаемый облачной инфраструктурой сканирования, корреляции и доставки сигнатур на собственном «железе».
Обязанности
- Определить, что означает «работает» для ~70 компонентов: провести определение SLI с лидами команд и старшими инженерами, создать таксономию, включающую сервисные SLI, SLI парка, SLI эффективности контроля, SLI доставки и SLI конвейера.
- Соблюдать правило: SLI должен быть измерим извне шлюза того, что он измеряет.
- Прикрепить SLO, бюджет ошибок и ответственную команду к каждому SLI.
- Построить систему сбора: спроектировать и реализовать конвейер для получения индикаторов с парка в хранилище с поддержкой запросов: push-based, сэмплирование, ограничения конфиденциальности, бюджет кардинальности.
- Расширить инструментирование на стороне агента и сервиса, где сигнал еще не существует, на Python, Go и Rust.
- Консолидировать текущий разброс дашбордов, ad-hoc запросов и путей отчетности в защищаемый набор инструментов.
- Построить алертинг и управление алертами: симптомный, привязанный к SLO, с семантикой multi-window burn-rate; трехуровневая таксономия (page / ticket / dashboard); каждый алерт с владельцем, runbook и документированным режимом отказа.
- Построить эскалацию: карта владения компонент → команда, матрица серьезности, SLA на подтверждение, ротация follow-the-sun, практика управления инцидентами и безобвинительные постмортемы в течение 24 часов.
Требования
- Значительный опыт в production-инженерии или SRE, включая как минимум одно окружение, где вы определяли структуру SLO, а не наследовали её.
- Сильный Python. Уверенное чтение и модификация Go или Rust — наши агенты написаны на них, и инструментирование попадает туда.
- Глубокое практическое понимание временных рядов и телеметрии событий в масштабе: Prometheus/OpenMetrics, Grafana, слой маршрутизации класса Alertmanager, колоночное хранилище для данных парка с высокой кардинальностью (ClickHouse или эквивалент).
- Отладка распределенных систем на «железе» и долгоживущих хостах. Большая часть этого парка — не Kubernetes, и рефлексы, предполагающие оркестратор, не перенесутся чисто.
- Управление конфигурацией и CI в производственном масштабе — Ansible, GitLab CI, Jenkins или близкие эквиваленты.
- Суждение, чтобы проектировать измерения для машин, которыми вы не владеете и которые не можете скрейпить: push.
Условия
- Полная удаленная работа (remote-only).
- Локация: Тбилиси, удаленно.