Инженер мониторинга (с ночными сменами)

BetBoom
Москва Опубликовано 29 июня 2026
Зарплата не указана
Полная занятость3–6 летТестировщик
Зарплата не указана

Описание

Мы ищем специалиста, который будет анализировать инциденты, восстанавливать цепочки событий в микросервисах, работать с логами и метриками, мониторить систему и взаимодействовать с разработкой для быстрого решения проблем.

Предусмотрен сменный график работы, есть ночные смены.

Чем предстоит заниматься:

  • Обработка заявок пользователей и их корректная классификация для дальнейшей работы. (внутренние пользователи)
  • Оперативная реакция на инциденты, включая их диагностику и устранение типичных проблем, с минимальным вмешательством команды разработки.
  • Умение восстанавливать цепочку событий в распределенной системе (микросервисы), понимать их взаимосвязь, формулирование гипотез причин инцидентов и их проверка.
  • Углубленное разбирательство в сложных инцидентах, подготовка информации и передача на 3-ю линию поддержки, если инцидент требует дальнейшего вмешательства внутренних разработчиков.
  • Эскалация и ведение инцидентов/багов с техническими командами (поддержкой) партнеров, если проблема на их стороне.
  • Регулярный мониторинг состояния системы, включая использование инструментов мониторинга и логирования для контроля за состоянием сервисов.
  • Проактивное выявление аномалий до срабатывания алертов (рост latency, memory leak, увеличение retry, рост error-rate, etc.).

Мы ожидаем:

  • Опыт работы в роли инженера технической поддержки, предпочтительно в сфере информационных технологий и высоконагруженных систем от 2-х лет.
  • Способность анализировать логи для выявления ключевых проблем и инцидентов, понимание различий между logs / metrics / traces.
  • Уверенный опыт работы с REST API, включая использование инструментов для тестирования и документирования сервисов (Postman, Swagger и аналогичные).
  • Навыки анализа логов в системах наблюдаемости (Grafana (Loki), Kibana или аналогах): поиск технических ошибок, выявление первопричин, восстановление цепочки событий и консолидация данных для последующей диагностики.
  • Опыт работы с системой JIRA для отслеживания инцидентов и багов.

Будет плюсом:

  • ​​​​​​Опыт в настройке и поддержке мониторинга для различных уровней системы (от приложений до серверной инфраструктуры)
  • Понимание HTTP-кодов, TCP/SSL handshake, сетевых ошибок, работы брокеров сообщений (RabbitMQ), принципов idempotency и retry-логики
  • Преимуществом станет знание helm chart, принципов работы с контейнерами и оркестраторами (Kubernetes) и сервис-меш Linkerd
Описание

Мы ищем специалиста, который будет анализировать инциденты, восстанавливать цепочки событий в микросервисах, работать с логами и метриками, мониторить систему и взаимодействовать с разработкой для быстрого решения проблем.

Предусмотрен сменный график работы, есть ночные смены.

Чем предстоит заниматься:

  • Обработка заявок пользователей и их корректная классификация для дальнейшей работы. (внутренние пользователи)
  • Оперативная реакция на инциденты, включая их диагностику и устранение типичных проблем, с минимальным вмешательством команды разработки.
  • Умение восстанавливать цепочку событий в распределенной системе (микросервисы), понимать их взаимосвязь, формулирование гипотез причин инцидентов и их проверка.
  • Углубленное разбирательство в сложных инцидентах, подготовка информации и передача на 3-ю линию поддержки, если инцидент требует дальнейшего вмешательства внутренних разработчиков.
  • Эскалация и ведение инцидентов/багов с техническими командами (поддержкой) партнеров, если проблема на их стороне.
  • Регулярный мониторинг состояния системы, включая использование инструментов мониторинга и логирования для контроля за состоянием сервисов.
  • Проактивное выявление аномалий до срабатывания алертов (рост latency, memory leak, увеличение retry, рост error-rate, etc.).

Мы ожидаем:

  • Опыт работы в роли инженера технической поддержки, предпочтительно в сфере информационных технологий и высоконагруженных систем от 2-х лет.
  • Способность анализировать логи для выявления ключевых проблем и инцидентов, понимание различий между logs / metrics / traces.
  • Уверенный опыт работы с REST API, включая использование инструментов для тестирования и документирования сервисов (Postman, Swagger и аналогичные).
  • Навыки анализа логов в системах наблюдаемости (Grafana (Loki), Kibana или аналогах): поиск технических ошибок, выявление первопричин, восстановление цепочки событий и консолидация данных для последующей диагностики.
  • Опыт работы с системой JIRA для отслеживания инцидентов и багов.

Будет плюсом:

  • ​​​​​​Опыт в настройке и поддержке мониторинга для различных уровней системы (от приложений до серверной инфраструктуры)
  • Понимание HTTP-кодов, TCP/SSL handshake, сетевых ошибок, работы брокеров сообщений (RabbitMQ), принципов idempotency и retry-логики
  • Преимуществом станет знание helm chart, принципов работы с контейнерами и оркестраторами (Kubernetes) и сервис-меш Linkerd

Похожие вакансии

Руководитель направления по оценке и карьерному развитию персонала
АО «ОТП Банк» (JSC «OTP Bank»)
Зарплата не указана
Полная занятостьОпыт 3–6 лет
Операционный директор (COO)
Honex Auto
от 230000 руб.
Полная занятостьОпыт 3–6 лет
Вайбкодер / AI-Developer / Vibe-Coder
Золотых Сергей Сергеевич
до 50000 руб.
Полная занятостьОпыт не требуется
Senior Frontend Developer / Старший фронтенд-разработчик (React/Next.js)
Просвещение
Зарплата не указана
Полная занятостьОпыт 3–6 лет
Бухгалтер
Dizainazona
от 70000 руб.
Полная занятостьОпыт 1–3 года
Frontend-developer Angular
АСКОН
Зарплата не указана
Полная занятостьОпыт 3–6 лет