Data Platform Engineer
Описание
Иви — один из лидеров рынка онлайн-кинотеатров в РФ и странах СНГ. №1 в рейтинге Лучших работодателей России четыре года подряд. Уже 16 лет мы работаем на рынке профессионального легального видеоконтента, каждый день решая интересные задачи в атмосфере свободы, доверия, открытости.Наша команда не только предоставляет миллионам пользователей доступ к кино и сериалам, но и создает их сама. Чем предстоит заниматься: Развивать платформу для расчёта ML-признаков в batch-, streaming- и nearline-сценариях Строить и поддерживать пайплайны для исторических расчётов, backfill и обновления признаков Собирать обучающие датасеты так, чтобы в них не попадали данные «из будущего» Работать с потоковыми данными: окнами, опоздавшими событиями и разными типами времени Следить за тем, чтобы признаки одинаково и корректно считались в offline- и online-контурах Развивать единые и переиспользуемые подходы к описанию feature pipelines и датасетов Обеспечивать воспроизводимость и качество данных: версионирование, lineage, проверки и контроль результатов расчётов Оптимизировать Spark- и streaming-задачи по скорости, памяти и стоимости вычислений Развивать incremental-расчёты, чтобы не пересчитывать большие объёмы данных без необходимости Интегрировать платформу с Feature Store, Airflow/Kubeflow, Kafka, хранилищами и внутренними сервисами Добавлять метрики, трассировку и инструменты диагностики, чтобы быстро находить проблемы в проде Проверять систему под нагрузкой и в сценариях с отказами Участвовать в сопровождении своего прод-контура и разборе инцидентов Вместе с ML-инженерами превращать решения под конкретные задачи в общие возможности платформы Оценивать готовые open-source решения и выбирать, где лучше интегрировать существующий инструмент, а где действительно нужна собственная разработка Ожидания Иви от кандидата: Уверенное знание Python и/или JVM-языка Опыт разработки и поддержки конвейеров обработки данных Глубокое понимание Spark или другой распределённую систему обработки данных Опыт с Airflow, Kubeflow Pipelines или аналогами Понимание partitioning, shuffle, skew, retry, backfill и идемпотентности Опыт проектирования схемы данных и работы с большими объёмами Опыт работы в batch- и streaming-обработке: event time, processing time, окна, watermark, late data Понимание point-in-time joins, temporal leakage и гарантии at-least-once / exactly-once Знание подходов к incremental computation, caching, state и пересчётам Работае с Git, code review, тестированием, CI/CD и observability Будет плюсом: Опыт работы с хранилищами признаков и платформами машинного обучения Опыт разработки потоковых систем и работы с Kafka Опыт версионирования, отслеживания происхождения и проверки качества данных Опыт оптимизации Spark-задач по скорости, памяти и стоимости вычислений Опыт создания переиспользуемых решений для команд данных и машинного обучения И, самое приятное. Со своей стороны Иви обещает с первых дней: Официальное трудоустройство и конкурентную заработную плату. Мы аккредитованная ИТ-компания! Удаленный формат работы или гибридный в уютном и современном офисе в шаговой доступности от станций метро Дмитровская, Савеловская, рядом с Флаконом и Хлебозаводом Предоставление современной рабочей техники, дополнительный монитор и многое другое для комфортной работы Гибкое начало рабочего дня по согласованию с руководителем Заботу о здоровье: после испытательного срока — ДМС со стоматологией, страхование от несчастных случаев и критических заболеваний, а ещё возможность получать консультации психолога, юриста, финансового консультанта и специалиста по ЗОЖ Поддержку в обмене знаниями и идеями: поощряем выступления на митапах и помогаем с подготовкой докладов Бесплатную подписку на сервис корпоративных скидок и предложений BestBenefits, а также доступ к онлайн-библиотеке издательства «МИФ» Вишенка на торте: специальное предложение по подписке Иви