Системный инженер
Описание
Компания КОМС является разработчиком собственной системы мониторинга и сопровождает несколько крупных продуктивных инсталляций в закрытых контурах заказчиков.Мы в поисках Системного инженера с сильной экспертизой PostgreSQL, который станет одним из владельцев стабильности продукта и будет отвечать не только за эксплуатацию инфраструктуры, но и за системное повышение надёжности, производительности и наблюдаемости решения.Основные задачи: Поддержка и развитие продуктивной инфраструктуры приложения в закрытых контурах заказчиков; Самостоятельная диагностика и устранение сложных инцидентов третьей линии; Поиск причин деградации на уровне Linux, Docker, Kubernetes, PostgreSQL, RabbitMQ, сетевого взаимодействия и приложения; Администрирование и тюнинг PostgreSQL, TimescaleDB, Patroni и etcd; Анализ блокировок, соединений, медленных запросов и планов выполнения; Подготовка требований к SQL-запросам, индексам, миграциям и структуре данных совместно с разработчиками; Ревью потенциально тяжёлых запросов и изменений БД перед выходом в production; Настройка репликации, резервного копирования, восстановления и процедур аварийного переключения; Администрирование и восстановление кластеров RabbitMQ; Развитие CI/CD и автоматизации на базе GitLab CI и Ansible; Администрирование Docker-инфраструктуры и Kubernetes-кластеров; Развитие мониторинга и observability на базе Prometheus, Grafana, Zabbix и ELK/OpenSearch; Участие в проектировании архитектуры, сайзинге и подготовке требований к инфраструктурным ресурсам; Проведение технических разборов инцидентов и формирование корректирующих мероприятий; Автоматизация типовых операций и снижение количества ручных вмешательств. Мы ожидаем: Опыт работы Системным/SRE инженером в эксплуатации высоконагруженных систем от пяти лет; Глубокое знание Linux и сетевых технологий; Сильная практическая экспертиза PostgreSQL; Опыт работы с репликацией, резервным копированием и восстановлением PostgreSQL; Опыт построения кластеров PostgreSQL с Patroni и etcd; Опыт оптимизации SQL-запросов, индексов и параметров PostgreSQL; Опыт диагностики проблем взаимодействия приложений и БД; Опыт администрирования RabbitMQ; Уверенная работа с Docker; Практический опыт эксплуатации Kubernetes-кластеров; Умение самостоятельно диагностировать сложные production-инциденты; Готовность глубоко погружаться в архитектуру и внутреннее устройство продукта; Готовность участвовать в дежурствах третьей линии (предусмотрено участие в ротации третьей линии поддержки. Подключение требуется только к инцидентам, которые не смогли устранить предыдущие линии поддержки). Желательно: Опыт эксплуатации TimescaleDB; Опыт работы с геораспределёнными системами и несколькими ЦОД; Опыт работы в закрытых или государственных инфраструктурных контурах; Опыт работы с Zabbix, ELK или OpenSearch; Опыт работы с Prometheus; Опыт диагностики приложений на PHP или Go; Опыт проведения postmortem и контроля корректирующих мероприятий; Опыт работы с FreeIPA; Опыт работы с GitLab CI и Ansible. Наш технологический стек:Linux, Docker, Kubernetes, PostgreSQL, TimescaleDB, Patroni, etcd, PgBouncer, RabbitMQ, GitLab CI, Ansible, Prometheus, Grafana, Zabbix, ELK/OpenSearch, PHP, Go, Selenium/Selenoid, FreeIPA.*Не требуется быть экспертом во всех перечисленных технологиях. Наиболее важны Linux, PostgreSQL, Docker, диагностика production-систем, автоматизация и observability.Мы предлагаем: Официальное трудоустройство в стабильной ИТ аккредитованной компании; Интересные задачи и возможность влияния на процессы и стек; Удаленный формат работы Возможность профессионального и карьерного роста; Работа в команде профессионалов; Возможность получать дополнительное образование, посещать конференции за счет компании; Возможность выбирать соц. программу (ДМС или компенсация трат на фитнес/обучение/изучение языков и многое другое).