Data Engineer
Описание
Привет! Мы - ООО «Датаномика», решаем проблемы структурирования разнородных данных, которые сложно поддаются анализу, помогаем среднему и малому бизнесу, банкам, ритейлу использовать данные о клиентах для оценки конъюнктуры спроса и экономических показателей, помогаем повысить качество сервиса финансового планирования и аналитики для клиентов. Сейчас у нас открыта вакансия Data-инженера в команду крупного российского Банка. Что входит в задачи: Разработка и поддержка ядра репликации: Проектирование и реализация высоконагруженных пайплайнов потоковой передачи данных из ERP-системы в КХД. Разработка механизмов гарантированной доставки (at-least-once, exactly-once semantics) и обработки сбоев без потери целостности финансовых данных. Оптимизация производительности потоков Kafka и Spark Streaming (управление партиционированием, сжатием, батчингом). Работа с витринами данных: Разработка ETL/ELT-процессов трансформации модели данных Банка. Написание сложных SQL-запросов, оконных функций и хранимых процедур для агрегации банковских метрик. Поддержка актуальности витрин данных, оптимизация их переформирования при изменении источников Миграция данных (Data Migration): Участие в проектах вывода из эксплуатации легаси-систем (включая исторические АБС). Разработка утилит-перекладчиков для извлечения, очистки, обогащения и загрузки исторических массивов данных в новую модель с сохранением ссылочной целостности. Качество данных и мониторинг: Внедрение автоматических проверок качества данных (Data Quality checks): профилирование, поиск дублей, проверка консистентности контрольных сумм. Настройка мониторинга задержек репликации (lag) и алертинга через Prometheus/Grafana или аналоги. Взаимодействие: Работа по методологии Agile (Scrum/Kanban). Плотное взаимодействие с архитекторами DWH, администраторами БД PostgreSQL, владельцами продуктов (Product Owners) и аналитиками. AI-native: Опыт проектирования с использованием ИИ-инструментов (LLM, Промт-инжениринг, GIT c Агенты). Технические навыки и инструменты: Язык программирования Java: уверенное владение Core, понимание многопоточности и принципов эффективной работы со стримами. Опыт промышленной разработки от 2 лет. Знание Kotlin как преимущество. Apache Spark: опыт разработки приложений на фрейморке Spark. Глубокое понимание архитектуры (драйверы, исполнители), управления памятью. Умение читать планы выполнения запросов (Explain plan). Apache Kafka: практический опыт настройки продюсеров и консьюмеров, идемпотентности и распределенных коммитов оффсетов. Базы данных и SQL: хороший уровень написания SQL (оконные функции, CTE, рекурсивные запросы). Опыт оптимизации тяжелых запросов через анализ планов исполнения. Желателен опыт работы с СУБД, Hive, Greenplum (приветствуется). Инструменты CI/CD и версионирования: Git (умение работать с ветками, разрешать конфликты, писать понятные мерж-реквесты), Maven, Docker. Базовое понимание Jenkins/GitLab CI для автоматизации сборки артефактов. Форматы данных: хорошеее понимание Avro (схема-на-лету, эволюция схем), Parquet (колоночное хранение, predicate pushdown). Легаси и миграция: опыт анализа чужого кода на PL/SQL; умение проектировать мэппинг полей между старой и новой моделями. Мы предлагаем: Гибридный формат работы; Работа в ИТ-аккредитованной компании; Регулярное обучение и профильные конференции за счёт компании, Современное оборудование для работы. Официальная «белая» зарплата; Оформление с первого рабочего дня, полное соблюдение ТК РФ; Интересные, амбициозные задачи с достижимым результатом; Достаточную свободу действий, инструментарий и необходимые ресурсы.