Data Engineer (Senior)
Описание
О роли Twinby — один из крупнейших российских дейтинг-сервисов, миллионы пользователей. Мы перестраиваем разработку Twinby CIS и собираем команду данных заново. Данные продукта приходят из множества источников — продуктовые сервисы, события приложений, платежи, маркетинг — и должны надёжно доезжать туда, где на них строят аналитику и принимают решения. Data Engineer здесь — единая точка ответственности за движение данных: чтобы они доехали полностью, без потерь и дублей, вовремя и в предсказуемом виде. Ты строишь и держишь пайплайны как настоящий продакшн-сервис, а не как набор разовых выгрузок. За что ты отвечаешь Захват и доставку данных из продуктовых источников в аналитический контур: потоковый и пакетный ingestion, изменения и удаления, а не только «снимок на вчера». Надёжность доставки: идемпотентность и дедупликация, обработка поздних и переупорядоченных событий, воспроизводимый пересчёт после сбоя. Оркестрацию пайплайнов: запуск по готовности источников, а не по таймеру; зависимости, ретраи, бэкфиллы без даунтайма и без задвоения. Качество данных: тесты данных, проверки свежести и полноты, сверки с источниками, обнаружение аномалий — так, чтобы расхождение было видно раньше, чем его заметит потребитель. Наблюдаемость пайплайнов: метрики доставки, лаг, алерты на разрыв; разбор инцидентов данных до причины и защита от повтора. Контракты и эволюцию схемы: изменения источника не должны молча ломать поток; обратная совместимость и понятные границы ответственности. Ты работаешь в связке с командой аналитики: ты отвечаешь за то, что данные доезжают надёжно, аналитика — за модель и метрики поверх них. Кого мы ищем Data Engineer, который владел движением данных целиком, а не писал разовые выгрузки. Для этого направления это значит: Инженерия доставки. Ты думаешь про гарантии доставки, идемпотентность и дедуп на рефлексе; перезапуск пайплайна для тебя не повод бояться дублей. Поток, а не только снапшот. Тебе близок захват изменений из меняющихся под тобой баз, поздние и out-of-order события, инкрементальная загрузка на больших объёмах. Качество как часть инженерии. Ты сам ставишь тесты данных, проверки свежести и сверки, а не ждёшь, пока кто-то заметит, что данных не хватает. Надёжность пайплайнов. SLA на свежесть, наблюдаемость, разбор инцидентов без поиска виноватого — для тебя это обычная инженерная гигиена. Зрелость в выборе. Ты решаешь, где достаточно at-least-once с дедупом, а где нужна более строгая семантика, и не усложняешь там, где не нужно. Мы смотрим на доказанную глубину владения движением данных, а не на длину списка инструментов. Будет плюсом Опыт построения потоковой доставки или захвата изменений с продуктовых баз на масштабе. Опыт бэкафилла большой истории и миграции хранилища без остановки потока. Опыт работы с платёжными или иными потоками, где дубль и потеря стоят дорого. Чего НЕ требуем Заученного синтаксиса конкретного оркестратора, сертификатов, знания именно нашего стека или домена дейтинга. Важнее инженерная зрелость и то, что данные у тебя доезжают надёжно и предсказуемо. Технический стек Потоковая и пакетная обработка данных, захват изменений (CDC), оркестрация пайплайнов, аналитические хранилища, Python и SQL. Clickhouse, Apache Airflow Что предлагаем Планку с нуля: команда данных собирается заново — то, что ты заложишь в надёжность и качество данных, станет стандартом. Настоящую инженерную систему: пайплайны как продакшн-сервис, тесты данных и наблюдаемость вместо ручных сверок, разбор инцидентов без вины. Автономию владельца — ты решаешь «как» движется поток данных; цели и направление обсуждаешь с командой и руководителем. Масштаб и большие данные, где инженерия движения имеет вес. Формат: удалёнка, РФ.