Главный (Senior) инженер DevOps в команду развития и эксплуатации ClickHouse
Описание
Мы в поиске Senior DevOps Engineer в команду ClickHouse DBA. Команда отвечает за развитие и поддержку платформы ClickHouse, обеспечивая ее надежность, отказоустойчивость и доступность для внутренних продуктов и сервисов компании. Перед вами будут стоять задачи по развитию и сопровождению ClickHouse-платформы, автоматизации процессов, обеспечению надежности сервисов и развитию внутренних инструментов управления инфраструктурой данных. Роль предполагает глубокую работу с инфраструктурой и автоматизацией, участие в принятии технических решений и развитие платформенных сервисов вокруг ClickHouse. Команда: Team Lead, 2 DevOps-инженера Стек: ClickHouse, ClickHouse Keeper, Linux, Ansible, GitLab CI/CD, Kubernetes, S3, Grafana, Prometheus, VictoriaMetrics, Python, Kafka, Hadoop. Чем ты будешь заниматься Проектировать и развивать отказоустойчивые ClickHouse-кластеры с использованием шардирования и репликации Автоматизировать процессы развертывания, масштабирования и сопровождения инфраструктуры с помощью Ansible и Terraform Интегрировать платформу данных с внутренними сервисами и инфраструктурными решениями компании Развивать инструменты self-service для работы команд с аналитическими данными Настраивать мониторинг, алертинг и дашборды для обеспечения стабильности платформы Обеспечивать резервное копирование и восстановление данных с использованием S3-совместимых хранилищ Анализировать производительность платформы и обеспечивать выполнение SLA/SLO Мы ожидаем Опыт работы в роли DevOps-инженера или инфраструктурного инженера от 5 лет Опыт эксплуатации ClickHouse в production-среде от 2 лет Глубокое понимание архитектуры ClickHouse, принципов шардирования, репликации и построения отказоустойчивых кластеров Уверенные знания Linux и опыт диагностики инфраструктурных проблем Практический опыт автоматизации инфраструктуры с использованием Ansible или Terraform Опыт работы с Kubernetes и контейнеризированными приложениями. Опыт построения и сопровождения CI/CD-пайплайнов Опыт настройки и сопровождения мониторинга, алертинга и систем сбора метрик. Знание принципов High Availability (HA) и Disaster Recovery (DR) Опыт работы с S3-совместимыми хранилищами, резервным копированием и восстановлением данных Навыки разработки на Python для автоматизации инфраструктурных процессов. Опыт интеграции инфраструктурных сервисов и работы с Vault, PKI или аналогичными решениями Понимание принципов построения OLAP-систем и аналитических платформ данных Будет плюсом Опыт работы с Kafka и потоковой обработкой данных Наличие сертификаций по Kubernetes Участие в open-source проектах, связанных с ClickHouse или инфраструктурными технологиями