Инженер-аналитик данных
Описание
О роли: Analytics Engineer - это позиция для того, кто хочет не просто тянуть и раскладывать сырые данные, но и заниматься непосредственно анализом данных и построением дашбордов. По сути, нужно будет: взять сырые данные, очистить их (DQ - 30%), смоделировать витрины в DWH (40%) и отдать бизнесу в виде готового BI-слоя (30%). Мы ищем опытного специалиста на стыке аналитики, инженерии и QA, который станет главным гарантом качества наших данных. Вам предстоит развивать хранилище данных, выстраивать систему автоматизированного контроля качества, внедрять подходы MDM и разрабатывать надежные дашборды. Мы активно поощряем использование AI-инструментов для автоматизации проверок, нечеткого поиска, ускорения рутины. Управление мастер-данными (MDM / НСИ) и Контроль качества: Разработка алгоритмов сопоставления (мэтчинга) и дедупликации справочников из разрозненных систем (1С, веб-сервисы, Excel). Централизованное ведение маппингов (карт соответствия) справочников и обеспечение консистентности нормативно-справочной информации (НСИ). Внедрение автоматизированных скриптов на Python и SQL для проверки целостности, полноты и консистентности данных на всех этапах загрузки. Настройка систем алертинга (уведомлений) о появлении дубликатов, нераспознанных сущностей или бизнес-аномалий. Работа с базами данных и Инженерия (ETL/ELT): Интеграция шагов валидации данных и MDM-проверок (DQ-гейтов) в пайплайны Apache Airflow. Написание SQL-запросов (PostgreSQL / MySQL) для поиска логических ошибок, расхождений и профилирования данных. Проектирование сущностей в хранилищах данных; внедрение изменений. BI и Аналитика (Apache Superset): Построение дашбордов в Apache Superset для визуального мониторинга «здоровья» данных (метрики качества, процент дубликатов, статус обогащения справочников). Разработка бизнес-дашбордов на основе уже очищенных, связанных и проверенных витрин данных. Взаимодействие с заказчиками: разбор инцидентов расхождения цифр, поиск корневых причин (Root Cause Analysis). Использование искусственного интеллекта (AI): Применение AI-ассистентов для разного рода задач, например: Реализации алгоритмов нечеткого поиска (Fuzzy Matching) и NLP-методов для сопоставления текстовых справочников. Генерации SQL-скриптов для покрытия данных edge-кейсами и тестами. Написания сложных регулярных выражений (RegEx) для очистки сырых текстовых данных. Важно: глубокое понимание ограничений LLM, обязательное ревью, тестирование и валидация сгенерированного кода перед внедрением. Hard Skills: SQL: продвинутый уровень (оконные функции, CTE, сложные джойны, понимание планов выполнения). Python: уверенное владение. Понимание принципов Master Data Management (MDM): подходы к дедупликации, слиянию записей (merge/survivorship rules), ведению НСИ. Опыт профилирования и поиска аномалий в реляционных БД (PostgreSQL / MySQL). Понимание метрик качества данных (полнота, точность, уникальность, согласованность). Опыт работы с Apache Superset (включая использование Jinja). Soft Skills: Здоровый педантизм, любовь к порядку в данных. Насмотренность в части создания дашбордов. Умение выстраивать процессы «с нуля» и брать на себя ответственность за архитектурные решения в рамках MDM. Будет плюсом: Глубокое понимание архитектуры 1С (Справочники, Регистры). Опыт работы со специализированными фреймворками для тестирования данных. Навыки работы с Linux (bash) и Git/Docker. Условия: География проектов: Москва, МО, Санкт-Петербург, регионы РФ Конкурентоспособная заработная плата Официальное трудоустройство согласно ТК РФ График работы: 5/2 с 9:00 до 18:00 Дружный коллектив и комфортная рабочая атмосфера Возможности для профессионального роста и развития Если вы ищете стабильную работу в дружном коллективе и готовы развиваться вместе с нами, отправляйте свое резюме!