Старший DevOps-инженер (bare-metal, SRE)
Описание
Обязанности: Разработка архитектуры инфраструктуры с учетом требований высокой доступности (SLA 99.99%) и масштабируемости (горизонтальное масштабирование БД и приложений). Внедрение GitOps-подхода (ArgoCD) для декларативного управления кластером, отказ от ручных деплоев. Performance: активный мониторинг и проактивное устранение проблем производительности на уровне ядра, сети и БД. Проведение Load-тестирования совместно с разработкой. Внедрение политик безопасности (PodSecurityPolicy / OPA Gatekeeper), управление сертификатами (cert-manager), ротация секретов в Vault. Ведение документации по Runbook и архитектуре, онбординг новых разработчиков в процессы деплоя (PostgreSQL). Требования: Глубокое знание Unix-like систем (Debian, RHEL). Kubernetes: практический опыт на bare-metal (или VM без облачных провайдеров). Умение строить кластеры "с нуля" (k3s, k3sup) и чинить их при падении etcd. Глубокое знание best-practices (multi-stage, non-root user, слои, безопасность). Опыт сборки Java-приложений (особенно Quarkus и Spring Boot). GitOps: Опыт работы с Helm (написание чартов с нуля, шаблонизация, helmfile) и ArgoCD для доставки. Построение пайплайнов в GitLab CI (включая dynamic child pipelines, правильный кэш, артефакты). IaC (Infrastructure as Code) и Конфигурация Следование подходу Terraform / OpenTofu для управления VM-инфраструктурой (vSphere/Proxmox или чистый API). Управление конфигурациями через Ansible (роли, inventory, dynamic inventory). Tarantool: самостоятельное развертывание и эксплуатация отказоустойчивых кластеров Tarantool в высоконагруженной среде. Управление топологией через Tarantool Cartridge (настройка репликации, шардирования, ролей, процедура failover). Глубокое понимание движков memtx (In-Memory) и vinyl (дисковое хранилище). Умение анализировать профиль нагрузки и тонко настраивать параметры box.cfg для достижения минимальной задержки. Навыки диагностики проблем (снапшоты, WAL-логи, управление памятью без утечек). Kafka: построение и сопровождение отказоустойчивых кластеров Apache Kafka (желательно версии 3.x и выше) на bare-metal/VM. Экспертное управление темами: выбор количества партиций, настройка retention, планирование емкости (sizing) дискового пространства. Мониторинг lag потребителей и настройка производительности брокеров (OS page cache, параметры JVM). Опыт миграции кластеров и настройки KRaft (без ZooKeeper) приветствуется. Построение систем с нуля: Prometheus + VictoriaMetrics, Grafana. Алертинг (писать нетривиальные запросы PromQL, использовать Record Rules). Bash — на высоком уровне (работа с sed/awk, подстановки, trap). Опыт работы с OpenVZ на ядре 2.6. Rancher Stack: практика с K3s, Longhorn (распределенные хранилища) и Harvester (HCI решение). Опыт внедрения Falco (детектирование аномалий), управление уязвимостями (Trivy/Grype), работа с SBOM. Service Mesh: базовое понимание Istio или Linkerd. Мы предлагаем: Гибкие и комфортные условия труда: Работа в офисе или удаленно с возможностью гибко подстраивать график; Конкурентная заработная плата и бонусы; Опыт работы в распределенной команде. Заботу о вас и вашем здоровье: Бесплатное пользование услугами профессиональных медицинских онлайн-консультаций "Онлайн Доктор"; Дополнительные оплачиваемые дни больничного; Бесплатное пользование программой корпоративных привилегий PrimeZone; Оказываем материальную поддержку от компании в трудных жизненных ситуациях. Постоянное развитие: Внутреннее обучение (предлагаем большое количество образовательных программ); Возможность развития и получения новых технических навыков, включая языки программирования (Python, Java, React и др.); Корпоративная библиотека (в нашей коллекции уже более 350 книг по развитию Soft и Hard Skills; Возможность изучения английского языка с нуля на корпоративных краткосрочных курсах, а также по желанию – участие в Speaking Club или Business Skills Development (практические сессии по развитию деловых навыков на английском языке); Внешнее обучение (оплачиваем ваши внешние курсы и программы обучения по необходимости); Поощряем участие в конференциях. Насыщенную корпоративную жизнь: Ведём корпоративный канал в Телеграм, чтобы все были в курсе новостей и событий в Компании; Проводим различные корпоративные мероприятия; Организовываем встречи с экспертами (как с внутренними, так и с приглашенными спикерами); Устраиваем челленджи и конкурсы; Смотрим кино с коллегами онлайн; Дарим подарки детям сотрудников на Новый Год.