Ведущий инженер данных (LLM)
Описание
Мы запустили новый продукт - LLM-платформу для наших клиентов из госсектора и enterprise-сегмента и развиваем его.Сейчас мы усиливаем усиливаем продуктовую команду и ищем Ведущего инженера данных, который будет отвечать за организацию и подготовку данных для AI-решений (от подключения внешних источников и проектирования модели данных до подготовки данных для поиска и RAG).КАКИЕ ЗАДАЧИ НЕОБХОДИМО РЕШАТЬ: Определять источники данных для AI-решений: базы данных, документы, API, файловые хранилища, внешние системы и потоки обновлений Проектировать модели данных: сущности и связи, версии, метаданные, lineage, права доступа и правила актуализации Организовывать сбор и обработку данных из внешних источников: очистку, нормализацию, дедупликацию, классификацию и разметку Формировать единое эталонное представление объекта (golden record) при объединении данных из нескольких источников Подготавливать данные для поиска и RAG: chunking, embeddings, индексация, векторный и гибридный поиск Настраивать retrieval и reranking, обеспечивать обновление индексов при изменении исходных данных При необходимости готовить датасеты для обучения или дообучения моделей, если задача не решается с помощью RAG Определять показатели качества данных и retrieval, организовывать их мониторинг: полнота, актуальность, precision/recall, latency и другие показатели Взаимодействовать с LLM-инженерами, аналитиками и разработчиками при проектировании AI-решений НАШИ ОЖИДАНИЯ: От 4 лет опыта в Data Engineering, Data Platform, Data Architecture или смежной области Уверенное знание SQL и реляционных баз данных Опыт построения ETL/ELT-процессов и data pipelines Опыт интеграции данных из различных источников: БД, API, файлов и внешних систем Практический опыт проектирования моделей данных и работы с качеством данных, метаданными и версиями Опыт работы с большими объёмами данных Практический опыт подготовки данных для поиска, ML или LLM/RAG-систем Понимание принципов chunking, embeddings, vector search и hybrid search Опыт работы с векторными хранилищами или поисковыми системами Умение самостоятельно разбираться в структуре и качестве новых источников данных БУДЕТ ПЛЮСОМ: Опыт разработки и эксплуатации RAG-систем в production Опыт оптимизации retrieval и reranking Python для обработки данных и разработки data pipelines Kafka или другие системы потоковой обработки данных Airflow или аналогичные инструменты оркестрации PostgreSQL, ClickHouse, Elasticsearch/OpenSearch, векторные хранилища и аналогичные технологии Опыт подготовки датасетов для supervised learning / fine-tuning Понимание метрик оценки RAG: retrieval quality, groundedness, faithfulness, coverage