Python-разработчик AI-сервисов (LLM / RAG)
Описание
TEAMLY – это IT-платформа для совместной работы и управления знаниями. Она бесшовно объединяет функции командной работы, ведения базы знаний и корпоративного обучения.Благодаря разнообразному функционалу она позволяет переводить весь накопленный опыт компании в реально работающие навыки и знания сотрудников.Нам доверяют свои знания известные компании: ВкусВилл, Аналитический центр при Правительстве РФ, Капитал Life, 1С-Рарус, Интерлизинг. А также средний и малый бизнес.В данный момент команда TEAMLY активно растет, в связи с чем мы будем рады видеть в нашей команде ИИ - разработчика. Востребованный продукт гарантирует быстрый рост и интересные задачи.Чем предстоит заниматься Развивать HTTP API и бизнес-логику двух асинхронных Python-сервисов на FastAPI. Проектировать и реализовывать RAG-пайплайны: retrieval, query rewriting, multi-hop поиск, сбор контекста, structured output, цитирование источников и обработку частичных ответов. Развивать агентные сценарии на LangChain, LangGraph и deepagents: инструменты, middleware, ограничения числа вызовов, защита от циклов и контроль контрактов ответа. Улучшать качество семантического поиска: chunking, dense/sparse retrieval, фильтры Qdrant, reranking, RRF и token budget. Развивать событийную индексацию статей, файлов и структурированного контента через Kafka. Обеспечивать корректную мультитенантность и фильтрацию результатов по правам пользователей, групп и сообществ. Интегрировать и заменять LLM-, embedding- и reranking-провайдеры, включая OpenAI-compatible API, vLLM и Ollama. Работать с PostgreSQL, Redis и Qdrant, проектировать модели данных и Alembic-миграции. Диагностировать проблемы качества, производительности и надежности на границах внешних сервисов. Развивать автоматические тесты и quality gates, поддерживать воспроизводимые локальные и CI-окружения. Улучшать наблюдаемость: структурированные логи, технические метрики, OpenTelemetry и трассировку LLM/RAG через Langfuse. Участвовать в декомпозиции задач, ревью кода и принятии архитектурных решений. Технологический стек Python 3.12, async/await; FastAPI, Pydantic 2; SQLAlchemy 2 async, Alembic, PostgreSQL; Redis, Apache Kafka, aiokafka; Qdrant, dense/sparse vectors, embeddings, reranking, RRF; LangChain, LangGraph, deepagents; OpenAI-compatible API, vLLM, Ollama; Pytest, pytest-asyncio, mypy, Black, Flake8; Docker, Docker Compose, Kubernetes, GitLab CI; Langfuse, OpenTelemetry. Что для нас важно Уверенное владение Python и практический опыт разработки backend-сервисов. Хорошее понимание асинхронного программирования: event loop, конкурентный I/O, таймауты, отмена, управление ресурсами и graceful shutdown. Опыт разработки API на FastAPI или сопоставимом Python-фреймворке. Практический опыт с PostgreSQL и SQLAlchemy: транзакции, конкурентный доступ, индексы, миграции и диагностика запросов. Опыт интеграции внешних сервисов и проектирования устойчивого взаимодействия: retry/backoff, timeout, idempotency, ограничение параллелизма и обработка частичных отказов. Понимание событийной архитектуры и семантики Kafka consumer: consumer groups, offset commit, rebalance, повторная доставка и идемпотентная обработка. Понимание устройства RAG: chunking, embeddings, retrieval, reranking, контекстное окно, ограничения LLM и способы снижения галлюцинаций. Умение писать unit- и интеграционные тесты для асинхронного кода, отделяя бизнес-логику от внешней инфраструктуры. Способность разбираться в существующей кодовой базе, находить причины проблем и предлагать минимальные, проверяемые изменения. Будет преимуществом Production-опыт с Qdrant или другой векторной базой. Практический опыт hybrid search, sparse retrieval, reranker и оценки ранжирования по Precision@K, Recall@K, MRR, MAP или NDCG. Опыт разработки LLM-приложений на LangChain/LangGraph или другом orchestration framework. Опыт работы со structured output, function/tool calling и потоковой генерацией. Понимание prompt injection, разграничения доступа к данным и других рисков безопасности RAG/agent-систем. Опыт эксплуатации сервисов в Kubernetes и настройки observability. Опыт работы с локальными моделями и inference-серверами: vLLM, Ollama, embedding/reranking inference. Офисный формат работы с возможностью перейти на гибрид Развитие – оплачиваем внешние курсы, даем корпоративную скидку на английский, поддерживаем выступления на конференциях, участие в митапах и вебинарах. Нам хочется развивать экспертность каждого сотрудника! Крупный и реально интересный продукт, который меняет мир к лучшему. Мы используем инновационные технологии, создаём передовые решения и предлагаем уникальную возможность быть частью команды, где ваши идеи и навыки могут повлиять на жизни многих людей; Комфорт – у нас классный офис в центре Москвы (Китай-город, Курская, Чистые пруды) с уютными рабочими местами. Предоставляем все необходимое для работы: хорошее железо, дополнительные мониторы, лицензированный софт и платные доступы; Команда – в TEAMLY действительно сплочённая команда профессионалов. Мы ценим работу каждого сотрудника, поддерживаем инициативы и помогаем с решением проблем; Яркая жизнь вне работы – каждый месяц устраиваем корпоративы, все вместе выезжаем на природу, ходим в бары и на квизы, участвуем в спортивных мероприятиях, играем в страйкбол, проводим вечера кино и смотрим шоу в комнате отдыха. Cтараемся, чтобы не только работать было комфортно, но и отдыхать хотелось вместе!Данное описание вакансии не является офертой.