Senior Data Eningeer
Описание
Команда Data Engineering отвечает за Market Data Platform — lakehouse-инфраструктуру, которая покрывает весь путь данных: от сырых биржевых фидов до надёжного хранилища петабайтного масштаба для исследований, бэктестинга и торговли в реальном времени. Опыт работы с биржевыми данными не обязателен: ключевое для нас — сильная экспертиза в lakehouse-системах. Доменный контекст команда даст сама. Обязанности: Развивать lakehouse на Apache Iceberg over AWS S3: партиционирование и сортировка данных, эволюция схемы, snapshots, time travel, compaction, TTL, point-in-time correctness для reference data. Оптимизировать производительность запросов и стоимость хранения. Строить batch- и streaming-пайплайны на Airflow, Spark и dbt для tick data и reference data. Развивать сбор и нормализацию market data: биржевые фиды (PCAP, multicast UDP, ITCH, FIX) и данные провайдеров (OneTick, Refinitiv, Bloomberg, ICE), реконструкция L2/L3 order book, обработка пропусков и сверка данных. Разрабатывать внутренние библиотеки и единый слой доступа к данным (Spark, Polars): управление схемами, data contracts, валидация, lineage. Отвечать за мониторинг, алертинг, SLAs/SLOs и CI/CD на Kubernetes / EKS. Требования: 5+ лет опыта разработки систем обработки данных в продакшене Практический опыт работы с крупными data lake / lakehouse-системами и понимание типичных проблем их эксплуатации Опыт работы с Apache Iceberg или аналогичными табличными форматами (Delta, Hudi): партиционирование, эволюция схемы, snapshots, compaction, работа с каталогом. Понимание внутреннего устройства Spark и Iceberg и опыт построения пайплайнов end-to-end, а не только работы поверх готовых фреймворков. Сильный Python, включая опыт с Polars и/или PySpark. Понимание Apache Arrow и колоночных форматов данных. Опыт с Airflow и Apache Spark или аналогичными системами оркестрации и распределённой обработки. Продвинутый SQL: сложные агрегации, оконные функции, оптимизация запросов, partition pruning. Уверенное знание Linux, практический опыт с Docker, Kubernetes/ EKS, AWS S3. Понимание принципов хранения и оптимизации структурированных, неструктурированных и бинарных данных: партиционирование, сжатие, управление стоимостью. Английский от B2 — для работы с документацией и общения с международной командой. Будет плюсом: Опыт с market data или network packet capture: PCAP, ITCH, FIX/FAST, multicast UDP, реконструкция order book, time-series data. Опыт нормализации market data из нескольких источников (OneTick, Refinitiv/Reuters, Bloomberg, ICE) в единую схему данных и symbology. Опыт со StarRocks или другими аналитическими query engines. Опыт с Terraform, ArgoCD, Grafana, Prometheus. Знание Rust или опыт его использования для high-performance capture/decoding. Условия: Полностью удалённая работа с обязательным пересечением с командой с 12:00 до 18:00 по Москве (GMT+3). Компенсация медицинской страховки, спорта и обучения. Отсутствие бюрократии и реальная свобода в том, как выстраивать свою работу. Возможность расширять зону ответственности по мере роста команды.