СписокРабот
Вся Россия
    Все города

    Senior SRE

    з/п не указана
    Finstar Financial Group Москва
    Удаленная работа Постоянная занятость опыт от 3 лет
    Откликнуться на сайте работодателя

    Описание

    Мы создаём цифровой финансовый продукт, который меняет подход к кредитованию: карту без процентов и годового обслуживания, полностью управляемую через мобильное приложение. Продукт работает в трёх регионах, обслуживает около 300 000 пользователей и выдерживает нагрузку более 500 RPS. Мы ищем Senior SRE, который возьмёт на себя ответственность за процессы Monitoring & Event Management и Availability & Capacity Management. В этой роли важно не просто реагировать на инциденты, а выстраивать системную надёжность: прогнозировать нагрузку, определять измеримые цели по доступности, развивать observability и превращать выводы из сбоев в устойчивые изменения. Ключевые зоны ответственности Availability & Capacity Management: доступность, производительность, прогнозирование нагрузки и достаточность ресурсов. Monitoring & Event Management: качество мониторинга, событий, алертов и процессов реакции. Observability: метрики, логи, трассировки, дашборды и диагностическая готовность систем. Reliability governance: SLI/SLO, анализ инцидентов, disaster recovery и системные улучшения. Чем предстоит заниматься Сформировать SLI/SLO для критичных пользовательских сценариев совместно с бизнесом и техническими командами и внедрить контроль их соблюдения. Развивать мониторинг на базе Grafana, Prometheus, Zabbix и CloudWatch; проектировать информативные дашборды, улучшать алерты и снижать шум событий. Развивать централизованные логи в CloudWatch Logs и распределённую трассировку: расширять применение OpenTelemetry и оценивать использование AWS X-Ray. Прогнозировать нагрузку и потребность в ресурсах, выявлять узкие места и формировать рекомендации по масштабированию. Участвовать в нагрузочных испытаниях вместе с отдельным специалистом и использовать результаты для Capacity Management. Подключаться к production-инцидентам как технический эксперт, при необходимости координировать восстановление и регулярно проводить RCA. Обеспечивать выполнение корректирующих действий по итогам RCA и превращать выводы из инцидентов в устойчивые изменения систем и процессов. Отвечать за disaster recovery: определять и согласовывать RTO/RPO, контролировать резервное копирование, проводить тесты восстановления и проверять сценарии отказа AWS-региона. Контролировать доступность внешних систем, самостоятельно взаимодействовать с поддержкой поставщиков, координировать устранение сбоев и контролировать выполнение SLA. Участвовать во внутренних аудитах, учитывать требования регуляторов и обеспечивать корректную работу с персональными данными. Что для нас важно Не менее трёх лет опыта в роли SRE, DevOps или Infrastructure Engineer и готовность работать на уровне Senior. Практический опыт построения и развития процессов Monitoring & Event Management, Availability & Capacity Management и observability. Опыт определения SLI/SLO и внедрения измеримых целей надёжности. Уверенная работа с AWS, Kubernetes и Terraform в production-среде. Практический опыт администрирования и настройки Grafana и Zabbix; понимание Prometheus и CloudWatch. Понимание метрик, логов и распределённой трассировки, а также умение выстраивать диагностику сложных сбоев. Глубокое понимание Linux, сетевых протоколов и принципов работы распределённых систем. Опыт incident response, RCA и контроля выполнения корректирующих действий. Способность создавать поддерживаемые инструменты автоматизации, скрипты и интеграции; конкретный язык программирования не принципиален. Практическое владение инструментами, в том числе AI, для написания и ревью кода, анализа логов и инцидентов, подготовки RCA, runbook и работы с инфраструктурой — с обязательной проверкой результатов перед применением в production. Свободный русский и английский не ниже B2: предстоит регулярно общаться с мексиканскими коллегами, партнёрами и вендорами. Будет плюсом Опыт эксплуатации multi-region инфраструктуры и подготовки сценариев регионального отказа. Опыт мониторинга мобильных приложений и внешних финансовых интеграций. Практический опыт внедрения OpenTelemetry или AWS X-Ray. Опыт работы в финтехе и понимание требований PCI DSS. Опыт взаимодействия с регуляторами и участия в технических аудитах.

    Источник: hh · Опубликовано: 3 дня назад

    Ещё вакансии в городе Москва

    Все
    Вильштейн Людмила Григорьевна Москва
    Гибкий график Частичная занятость опыт от 1 года

    LUJE — это пространство частной эстетики, безупречного вкуса и высокого профессионализма в самом сердце мегаполиса. Мы создаем атмосферу приватности и восстановления для самых взыскательных гостей, работая в одном здании…

    Пятёрочка Москва
    Гибкий график Частичная занятость без опыта

    «Пятерочка» приглашает на вакансию: Продавец-кассир ОТ НАС:Трудоустраиваем с 16 летБыстрое оформление по ТК РФ - с помощью ГосуслугФиксированный оклад с регулярной индексацией + премии и надбавки за стаж. Средний доход 8…

    ДЖЕЙКЕТ Москва
    Полный день Постоянная занятость без опыта

    Вакансия компании: ООО "ЕвроКомфорт"Мы производители корпусной мебели динамично развивающийся магазин на ВБ ОЗОН 5+ лет на рынке, ТОП - 3 в категориях мебель. Работаем быстро, на цифрах, без бюрократии, на результат. Ище…

    ДЖЕЙКЕТ Москва
    Полный день Постоянная занятость опыт от 3 лет

    Вакансия компании: ООО "ВЕКТОР"Мы производим одежду среднего и высокого класса. На рынке более 20 лет успешного производства и торговли. Собственное производство в Китае, также сотрудничаем с турецкими фабриками. Занимае…