DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB
Описание
DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB Привет! Меня зовут Эля, я HR компании «Амбрелла».Мы — аккредитованная IT-компания в сфере информационной безопасности. Развиваем высоконагруженную SIEM-платформу для сбора, хранения и обработки событий ИБ.Сейчас ищем DevOps / SRE-инженера уровня Middle+/Senior с глубокой практической экспертизой по ClickHouse и уверенным опытом эксплуатации MariaDB.Основной фокус роли — промышленная эксплуатация ClickHouse: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, backup/restore, мониторинг, безопасность и безопасное проведение изменений в production.Вторая важная зона — MariaDB: эксплуатация, репликация, отказоустойчивость, Galera Cluster, backup/restore, disaster recovery, performance tuning и миграция с master-master-репликации на более надёжную кластерную архитектуру.Нам нужен инженер, который умеет не просто «поднять базу», а безопасно эксплуатировать production-инфраструктуру с критически важными данными: проверять гипотезы на стендах, оценивать риски, готовить rollback-план, участвовать в расследовании инцидентов и фиксировать результаты в документации.Чем предстоит заниматься: ClickHouse:— Администрировать продуктивные и тестовые кластеры ClickHouse;— Контролировать состояние шардов, реплик, Distributed-таблиц и ReplicatedMergeTree-таблиц;— Диагностировать replication queue, merges, mutations, inserts, деградацию запросов и проблемы с дисковой подсистемой;— Анализировать системные таблицы ClickHouse и состояние кластера;— Участвовать в изменении топологии кластера: добавление шардов, реплик, серверов, изменение Distributed-таблиц;— Планировать горизонтальное масштабирование ClickHouse-кластера;— Оптимизировать схемы данных, партиционирование, ключи сортировки, TTL, индексы, storage policy и настройки сервера;— Работать с хранением данных: локальные диски, LUN, DAS, hot / warm storage, S3-совместимое хранилище;— Прорабатывать дедупликацию данных, повышение уровня сжатия и механизм токенизации / full text search по событиям;— Настраивать и сопровождать ClickHouse Keeper / ZooKeeper;— Настраивать TLS/SSL для клиентских подключений и межсерверного взаимодействия;— Разрабатывать и проверять backup/restore и disaster recovery;— Настраивать мониторинг, алерты и дашборды по ClickHouse;— Готовить Ansible playbooks / roles, runbook’и, инструкции, чек-листы и технические отчёты. MariaDB:— Администрировать продуктивные и тестовые инсталляции MariaDB;— контролировать состояние серверов, репликации, соединений, транзакций, блокировок и фоновых процессов;— Настраивать и сопровождать репликацию: master-slave, master-master, GTID-based replication;— Диагностировать replication lag, ошибки SQL thread / IO thread, рассинхронизацию данных и конфликты при master-master-схемах;— Участвовать в миграции MariaDB с master-master-репликации на Galera Cluster;— Настраивать, сопровождать и диагностировать Galera Cluster;— Прорабатывать HA-архитектуру MariaDB: failover, fencing, VIP / proxy layer, split-brain-риски;— Разрабатывать и проверять disaster recovery-сценарии, RPO / RTO и восстановимость резервных копий;— Анализировать производительность: slow queries, EXPLAIN, индексы, locks, deadlocks, buffer pool, connection pool, disk IO;— Оптимизировать конфигурацию MariaDB с учётом нагрузки, объёма данных, RAM, CPU, дисковой подсистемы и сети;— Настраивать TLS/SSL для клиентских подключений и репликации;— Настраивать мониторинг, алерты, дашборды и runbook’и по MariaDB.Production, автоматизация и взаимодействие:— Участвовать в расследовании production-инцидентов, связанных с ClickHouse, MariaDB, Linux, сетью или дисковой подсистемой;— Анализировать метрики, логи, системные таблицы, состояние репликации, блокировки, диски, сеть и конфигурации;— Формулировать технические гипотезы, проверять их и отделять первопричину от сопутствующих факторов;— Готовить технические выводы по итогам инцидентов и участвовать в postmortem-разборах;— Разворачивать тестовые стенды ClickHouse и MariaDB для проверки архитектурных решений;— Проверять обновления, изменение топологии, расширение хранилища, storage policy и параметры ClickHouse / MariaDB до применения в production;— Автоматизировать типовые операции через Ansible / Bash / Python / Terraform или аналогичные инструменты;— Взаимодействовать с заказчиками, объяснять технические риски понятным языком, предлагать решения и лидировать технические обсуждения.Обязательные требования:— Практический опыт промышленной эксплуатации ClickHouse;— Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree, MergeTree family;— Опыт диагностики replication queue, merges, mutations, insert/select latency, деградации запросов и проблем с дисковой подсистемой;— Понимание партиционирования, ключей сортировки, TTL, storage policies, disks, volumes, data skipping indexes;— Опыт изменения топологии ClickHouse-кластера или глубокое понимание порядка и рисков таких изменений;— Опыт настройки TLS/SSL для ClickHouse;— Опыт эксплуатации MariaDB в продуктивной или близкой к продуктивной среде;— Понимание MariaDB, InnoDB, транзакций, индексов, блокировок, deadlocks, isolation levels;— Опыт настройки и диагностики репликации MariaDB;— Понимание GTID, binary logs, relay logs, replication lag, failover и рисков master-master-репликации;— Опыт настройки backup/restore MariaDB и проверки восстановимости резервных копий;—Опыт диагностики производительности MariaDB: slow query log, EXPLAIN, индексы, locks, buffer pool, disk IO;— Опыт эксплуатации Linux-серверов;— Понимание влияния CPU, RAM, disk IO, network и filesystem на работу ClickHouse и MariaDB;— Опыт настройки мониторинга и алертов для ClickHouse, MariaDB и инфраструктуры;— Опыт работы с Prometheus, Grafana, Zabbix или аналогичными системами мониторинга;— Опыт автоматизации через Ansible, Bash, Python или аналогичные инструменты;— Умение аккуратно проводить изменения в production: план работ, оценка рисков, rollback-план, проверка результата;— Умение писать техническую документацию: инструкции, runbook’и, чек-листы, postmortem-отчёты.Желательные требования:— Опыт или уверенное понимание Galera Cluster;— Опыт эксплуатации ClickHouse и MariaDB в составе SIEM, SOC, log management, observability, telemetry или других высоконагруженных систем;— Опыт работы с большими объёмами данных: десятки или сотни ТБ;— Опыт работы с ClickHouse Keeper или ZooKeeper;— Опыт эксплуатации ClickHouse / MariaDB на bare metal;— Опыт работы с LUN, DAS, локальными дисковыми массивами и S3-совместимыми объектными хранилищами;— Опыт нагрузочного тестирования ClickHouse и MariaDB;— Опыт построения процедур disaster recovery;— Опыт подготовки архитектурных и эксплуатационных документов для заказчиков;— Опыт работы с ProxySQL, MaxScale, HAProxy, Keepalived, Pacemaker / Corosync или аналогичными решениями;— Опыт проведения регламентных работ с минимальным downtime;— Опыт аудита продуктивных инсталляций у заказчиков.Что важно в кандидате:— Инженерная аккуратность и понимание рисков production-среды;— Умение сначала проверять гипотезы на стенде, а не сразу применять изменения в production;— Способность разбираться в сложных инцидентах на стыке приложения, БД, Linux, сети и дисковой подсистемы;— Клиентоориентированность и зрелая коммуникация;— Дисциплина: приходить на встречи вовремя, готовиться к ним, выполнять договорённости и заранее предупреждать о рисках;— Способность лидировать технические встречи, фиксировать решения и следующие шаги;— Готовность документировать решения и передавать знания команде.Условия:— Постоянная занятость;— Работа с продуктивной, тестовой и лабораторной инфраструктурой;— Взаимодействие с командой эксплуатации, инженерами SIEM, разработчиками, архитекторами и техническими представителями заказчика;— Участие в планировании изменений, разборе инцидентов и развитии архитектуры хранения данных.Всегда рады новым талантам и новым успехам наших сотрудников!