Data Science (LLM/RAG)
Описание
Чем предстоит заниматься: Разработка и оптимизация RAG-систем на базе LLM (LLaMA, GPT-подобные модели) для обработки внутренних документов, отчётов и регламентов ключевых заказчиков; Реализация и тонкая настройка классических NLP-моделей: текстовая классификация, извлечение именованных сущностей (NER), семантический анализ, извлечение ключевых метаданных; Интеграция NLP-моделей в существующие ETL- и BI-процессы, обеспечение стабильной работы в продуктивной среде; Работа с большими объёмами структурированных и неструктурированных данных (PDF, DOCX, XML, логи, базы данных); Документирование архитектуры, метрик качества и процессов развертывания моделей; Участие в проектах предиктивной аналитики для клиентов из ритейла, транспорта и промышленности: прогнозирование спроса, оптимизация логистики, предиктивное обслуживание оборудования; Разработка ML-моделей на основе внешних признаков, обработанных LLM (погода, новости, рыночные индикаторы, геоданные, телеметрия); Создание автоматизированных ML-отчётов и инфографик с визуализацией результатов (Power BI, Streamlit, Plotly, Tableau) — с акцентом на понятность для бизнес-пользователей; Применение LLM для генерации текстовых резюме, аналитических выводов и рекомендаций на основе данных (например: “Снижение спроса на товар X в регионе Y связано с ростом цен на логистику и погодными условиями”); Построение пайплайнов ML/LLMOps: от сбора данных до деплоя и мониторинга моделей; Участие в презентациях для клиентов: демонстрация результатов, объяснение моделей, подготовка кейсов. Здорово, если у тебя есть: Высшее образование (IT, техническое, математическое); Опыт разработки RAG-систем (векторные базы, реранкинг, retrieval-стратегии); Глубокое понимание классических NLP-задач: классификация, NER, сущностное извлечение, токенизация, эмбеддинги (BERT, RoBERTa, FastText и др.); Практический опыт работы с LLM (Hugging Face, LangChain, LlamaIndex, vLLM, Ollama) и их адаптацией под бизнес-задачи; Уверенное владение Python (Pandas, Scikit-learn, PyTorch/TensorFlow), SQL, Git, Docker; Опыт работы с ML-отчётами и инфографикой: умение превращать сложные модели в понятные визуализации для бизнеса; Опыт работы в проектах с внешними данными (API, окрытые данные, телеметрия, гео, рынок) — преимущество; Понимание основ MLOps (MLflow, Weights & Biases, Airflow) — желательно; Готовность к быстрому погружению в новые направления (ритейл, транспорт, промышленность); Английский язык — на уровне чтения технической документации.