Стажёр Data Scientist (uplift & causal inference)
Описание
Мы команда Causal AI в блоке «Финансы» ПАО Сбербанк — развиваем решения в области uplift-моделирования, causal inference и сценарного анализа для задач клиентских коммуникаций и оценки эффектов. Нам интересны не только прикладные модели, но и корректная причинно-следственная интерпретация результатов: какие факторы действительно влияют на целевые переменные, как это экспериментально проверить и впоследствии использовать в принятии решений. Сейчас мы ищем стажёра на задачи causal inference — оценка эффектов, поиск причинно-следственных связей и uplift-моделирование. Наш стек: Python (scikit-learn, CatBoost, causal-learn, DoWhy, EconML, Hypex), Hadoop (PySpark, Hive, HDFS) Обязанности собирать и готовить данные, участвовать в сборке витрин проводить EDA и feature engineering, проверять качество и полноту данных обучать и валидировать ML-модели помогать в дизайне и анализе A/B-тестов: расчёт размера выборки, проверка корректности сплита, разбор результатов воспроизводить методы из статей и открытых библиотек, проводить сравнения с внутренними бейзлайнами на наших данных писать переиспользуемый код, тесты и документацию для нашей внутренней uplift-платформы поддерживать текущую аналитику: багфиксы моделей и ad hoc запросы от команды и заказчиков. Требования неоконченное высшее образование (находишься на последних курсах университета) по техническому направлению имеешь прочный математический фундамент, особенно в теории вероятностей и статистике (понимаешь смысл p-value и доверительного интервала, знаешь характеристики основных распределений) умеешь и любишь писать код на python, стараешься его оптимизировать, не боишься разбираться в чужом коде владеешь основными библиотеками для анализа данных (базовый минимум - pandas, numpy, sklearn) понимаешь, как устроены основные алгоритмы классического ML (линейные и древовидные модели) умеешь превратить расплывчатый вопрос в проверяемую гипотезу (например: у этой группы клиентов метрика выше – это эффект коммуникации или они и без неё были активнее?). Будет плюсом читал про uplift-модели (T-learner, X-learner, DR-learner, IPW, PSM) и пробовал их хотя бы на учебных данных имеешь опыт с DoWhy, EconML, causal-learn, Hypex знаешь, что такое causal discovery и DAG — понимаешь, почему конфаундер смещает оценку эффекта запускал или анализировал A/B-тесты работал с большими данными (Spark, Hadoop) разрабатывал LLM-агентов имеешь опыт решения задач маркетинга, ценообразования или банковской аналитики участвовал в соревнованиях по ML. Условия комфортный современный офис рядом с м. Ленинский проспект возможность выбрать удобный график – офис/гибрид срочный трудовой договор на 3 месяца корпоративный спортзал и зоны отдыха более 400 образовательных программ СберУниверситета для профессионального и карьерного развития программа адаптации и помощь руководителя на старте (для вакансий уровня Junior) расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ подписка Прайм с возможностью совместного использования на трёх близких вознаграждение за рекомендацию друзей в команду Сбера.