DevOps-инженер Data-платформы
Описание
Проект «База знаний» - это внедрение базовой дисциплины управления критическими* данными корпоративного хранилища: как структурированными (таблицы, витрины, отчёты); так и неструктурированными (Confluence, Wiki — знания о данных). Цель проекта – создание работающей системы управления критическими данными, обеспечивающей: полную идентификацию и описание источников, измеримое качество через дата-контракты, единую навигацию по данным и знаниям о них, дисциплину поддержания актуальности, наличие источников в целевом состоянии. Чем предстоит заниматься: Разрабатывать, настраивать и поддерживать CI/CD-пайплайны для ETL-процессов, скриптов и автоматизированных проверок качества данных; Организовывать версионирование и управление исходным кодом всех проектных артефактов: ETL-скриптов, тестов, конфигураций и технической документации; Поддерживать среды разработки, тестирования и промышленной эксплуатации, обеспечивать их стабильность и согласованность; Автоматизировать развертывание инструментов контроля качества данных и их интеграцию с существующими пайплайнами; Настраивать автоматизированные проверки качества данных на инфраструктурном уровне, включая контроль доступности и потребления инфраструктурных ресурсов; Разрабатывать и поддерживать систему мониторинга, метрик, логирования и алертинга для ETL-процессов и инфраструктуры; Настраивать централизованный сбор и поиск логов, корреляцию событий и диагностику инцидентов при переносе процессов на целевую архитектуру; Автоматизировать повторный запуск и пересборку данных при сбоях, минимизируя ручное вмешательство и время восстановления; Настройка разработанной ролевой модели доступа в разворачиваемых системах; Контролировать и оптимизировать производительность инфраструктуры: масштабирование, распределение ресурсов, оптимизацию запросов и управление ресурсами кластера; Настраивать резервное копирование данных и конфигураций, регулярно проверять процедуры восстановления; Разрабатывать и поддерживать планы аварийного восстановления, инструкции и регламенты с учетом целевых показателей RTO/RPO; Участвовать в управлении инцидентами: анализировать метрики и логи, диагностировать инфраструктурные проблемы, выполнять эскалацию и проводить пост-инцидентный анализ; Документировать архитектуру инфраструктуры, пайплайны, процессы развертывания, мониторинга и восстановления; Координировать технические зависимости с инфраструктурными и платформенными командами: выделение ресурсов, настройка доступов, обновление компонентов и устранение ограничений. Наши пожелания к кандидатам: Опыт работы DevOps-, DataOps-, SRE- или Platform-инженером от 3 лет; Опыт работы с data-платформами (DWH/Data Lake/Data Lakehouse и т.п.) и корпоративными хранилищами данных; Практический опыт построения и сопровождения CI/CD-пайплайнов; Опыт автоматизации развертывания приложений, ETL-процессов и инфраструктурных компонентов; Опыт работы с Linux и написания скриптов автоматизации на Bash, Python или другом подходящем языке; Практический опыт работы с объектными хранилищами данных, совместимыми с S3 API; Практический опыт работы с Kubernetes или совместимыми платформами контейнерной оркестрации, включая OKD, OpenShift или аналогичные решения; Опыт настройки мониторинга, метрик, логирования и алертинга; Опыт работы с резервным копированием, восстановлением и тестированием disaster recovery-процедур; Умение анализировать производительность систем, находить узкие места и оптимизировать использование ресурсов. Будет преимуществом: Знание ClickHouse, Greenplum или других платформ хранения и обработки данных; Опыт проведения сайзинга (Capacity Planning): расчет необходимых вычислительных ресурсов (CPU, RAM, Storage, Network) под текущие и прогнозируемые нагрузки систем; Навык работы с ИИ. Мы предлагаем: Доступ к современным AI-инструментам; Работу в стабильной и активно развивающейся компании – лидере инвестиционного рынка; Современный стек технологий, амбициозные проекты, возможность профессионального развития; Гибридный или удаленный режим работы; ДМС с первого месяца работы.