Senior DBA PostgreSQL/ClickHouse
Описание
Наша распределенная команда Dev насчитывает более 800 специалистов и разрабатывает собственные продукты с 2012 года – рекламные платформы, мобильные приложения, финтех-продукты и решения. У нас проектно-ориентированный подход, матричная структура с привязкой специалистов к одному проекту, но при этом мы работаем командой. В работе мы применяем SCRUM, Agile.Сейчас мы ищем в департамент инфраструктуры Senior Database Administrator (PostgreSQL/ClickHouse) Задачи: Проектирование, внедрение и эксплуатация кластеров PostgreSQL и ClickHouse Разработка и развитие архитектуры схем репликации, отказоустойчивости и disaster recovery Планирование и проведение капасити-планирования, оптимизация производительности под высокие нагрузки Разбор и устранение сложных инцидентов, включая расследование деградации и потерь данных Настройка и развитие процессов резервного копирования и восстановления Ревью и оптимизация SQL-запросов и схем данных совместно с разработчиками Разработка и поддержка автоматизации (Ansible, Terraform) для управления инфраструктурой БД Менторство младших коллег, участие в найме и код-ревью Формирование стандартов и best practices эксплуатации БД в компании Мы ждем от вас:Linux Уверенное владение systemd, tuning ядра ОС под нагрузку БД (`sysctl`, лимиты, huge pages) Глубокое понимание файловых систем, работы с дисковой подсистемой (RAID, LVM, влияние I/O scheduler) Продвинутая диагностика ресурсов: `perf`, `strace`/`ltrace`, `iostat`, `vmstat`, анализ узких мест CPU/IO/Memory под нагрузкой БД Сеть: настройка и диагностика сложных сетевых сценариев (VIP, балансировка, latency между репликами) Написание bash/Python скриптов для автоматизации рутинных и нетривиальных операционных задач Опыт эксплуатации БД в контейнеризированных средах (Docker, Kubernetes — StatefulSet, Operators) будет плюсом Базы данных — теория (продвинутый уровень) Глубокое понимание MVCC, уровней изоляции транзакций, влияния на блокировки и производительность Понимание внутреннего устройства СУБД: WAL, checkpoint, vacuum (для PostgreSQL), merge tree механика (для ClickHouse) Проектирование схем данных с учётом нормализации/денормализации под конкретные паттерны нагрузки (OLTP vs OLAP) Продвинутая работа с индексами: B-Tree, GIN, GiST, BRIN (PostgreSQL); индексы и партиционирование в ClickHouse Понимание CAP-теоремы, компромиссов согласованности и доступности в распределённых системах PostgreSQL Экспертная работа с CLI (`psql`), администрирование ролей и прав, Row-Level Security Настройка и тюнинг конфигурации (`postgresql.conf`), понимание влияния ключевых параметров на производительность Работа с расширениями (`pg_stat_statements`, `pg_repack`, `pgaudit`, `postgis` и др.) Партиционирование таблиц, работа с `EXPLAIN ANALYZE`, оптимизация планов запросов Настройка потоковой репликации (streaming replication), логической репликации, Patroni/repmgr для отказоустойчивости Опыт миграции и апгрейда мажорных версий PostgreSQL ClickHouse Проектирование схем таблиц (MergeTree и его модификации), выбор партиционирования и ключей сортировки Настройка распределённых кластеров (Distributed engine, шардирование, репликация через ZooKeeper/ClickHouse Keeper) Оптимизация запросов и материализованных представлений под аналитические нагрузки Настройка TTL, компрессии и политик хранения данных Мониторинг и диагностика типовых проблем ClickHouse (merge-задержки, распределение нагрузки по шардам) Backup & Restore Проектирование стратегий backup/restore для PostgreSQL (`pg_basebackup`, `pgBackRest`, WAL-archiving) и ClickHouse (`clickhouse-backup`) Разработка и тестирование DR-планов, регулярная проверка восстанавливаемости бэкапов Point-in-time recovery Репликация и отказоустойчивость Проектирование и внедрение схем high availability (Patroni, repmgr, ClickHouse Keeper) Настройка автоматического failover, работа с VIP/балансировщиками Диагностика и устранение репликационного лага, split-brain сценариев Мониторинг Проектирование дашбордов и алертинга (Grafana/Prometheus) под специфику PostgreSQL и ClickHouse Глубокий анализ slow query логов, построение процессов проактивного выявления проблем производительности Automation & Tools Уверенное владение Git (в т.ч. code review, ветвление, работа в команде) Разработка и поддержка Ansible-плейбуков и/или Terraform-модулей для управления инфраструктурой БД Опыт работы с CI/CD пайплайнами применительно к изменениям схем БД Также будет плюсом: Опыт миграции с других СУБД на PostgreSQL/ClickHouse Опыт работы с Kafka/message-брокерами в связке с ClickHouse (для near-realtime аналитики) Участие в проектировании архитектуры данных на уровне компании Опыт выступлений на митапах/внутренних докладах, менторства Как мы работаем и что предлагаем: Несколько вариантов оформления и способов выплат; Full remote или гибридный офис, работа из любой страны с удобным часовым поясом; Гибкий график - лояльное начало дня с 9.00 до 11.00 по МСК, 8 часов рабочий день; Возможность выбрать привычное оборудование с доставкой на дом; Performance review и непрерывное обучение: у нас есть внутренняя Академия, а также много партнёрских программ, которые поделятся знаниям не только в профессиональной сфере, но и поддержат твои хобби; Развитая культура коммуникаций: турниры онлайн и оффлайн, тех комьюнити, митапы, co-working дни, встречи и пати на летней веранде, тимбилдинги; Офис с панорамой на Москву-реку и летняя веранда с гамаками и пиццей для тех, кто работает в Москве и локальные тимбилдинги в других городах и странах для удаленщиков.