Senior SRE инженер
Описание
Наш продукт - это сложная высоконагруженная система (сотни микросервисов), обрабатывающая большие объемы данных. Наш технологический стек: Инфраструктура: Managed Kubernetes, GCP, Yandex Cloud, Selectel. Сети: Cloud, Cilium, Linkerd (Service Mesh). Observability: Victoriametrics, Grafana, Tempo, Elasticsearch, OTLP, Pyr-oscope, Sentry. IaaC & CI/CD: Terraform, Terragrunt, Ansible (минимально), GitLab CI. Сервисы и БД: Node.js, Go (HTTP/gRPC), PostgreSQL (CloudNative-PG), ClickHouse, RabbitMQ, Redis. Автоматизации: внутренние инструменты на Go Чем вы будете заниматься: Основной фокус на надежность и наблюдаемость: Обеспечение стабильности, доступности и отказоустойчивости production-окружения совместно с командами разработки. Развитие и поддержка системы observability на основе современного стека (Victoriametrics, Grafana, Tempo, Elasticsearch, Pyroscope, Sentry) для полного контроля над системой. Оперативное участие в инцидентах: диагностика, устранение, последующий разбор и реализация мер по предотвращению их повторения. Автоматизация и развитие инфраструктуры: разработка автоматизаций для устранения рутины и повышения надежности (на Golang). Мы ищем специалиста, который: Имеет опыт работы SRE инженером в высоконагруженных production-средах более 6 лет. Обладает глубоким пониманием Kubernetes и опыт отладки приложений в нем. Обладает глубоким опытом работы с PostgreSQL (не только бэкапы/репликация, а понимание внутреннего устройства: индексы, WAL, запросы) Имеет практический опыт построения и использования систем observability (мониторинг, логи, трейсинг). Понимает принципы сетевого взаимодействия, работы протоколов (HTTP/gRPC) и уметь диагностировать проблемы на этом уровне. Имеет базовые навыки программирования на Go или другом ЯП для создания автоматизаций. Обязательно умеет работать самостоятельно, генерировать задачи и проактивно решать проблемы. Не ждет готовых ТЗ.