Junior+ / Middle- AI Engineer (On-Premise LLM)
Описание
О продукте:Business Studio — лидер рынка систем бизнес-моделирования с 20-летней историей. Нашими клиентами являются более, чем 3000 компаний из 10 стран, а партнерская сеть по продвижению и сопровождению системы насчитывает более 60 ведущих консалтинговых и ИТ-компаний. Более 180 вузов и бизнес-школ используют Business Studio в рамках программ подготовки и повышения квалификации управленческих кадров (магистратура, MBA, EMBA). О проекте и роли: Мы разрабатываем крупное тиражируемое коробочное решение для enterprise-клиентов и внедряем в ядро продукта генеративный AI. Архитектура гибридная: Базовый режим: Автономный On-Premise запуск открытых моделей строго внутри изолированного периметра клиента (air-gapped контуры, без доступа в интернет). Опциональный режим: Подключение через API российских облачных провайдеров (GigaChat, YandexGPT) для клиентов без собственных вычислительных мощностей. Важный контекст: Тема локального поднятия открытых LLM молодая, поэтому мы не ждем десятилетнего коммерческого опыта. Однако менторов и готовой ML-команды для обучения у нас нет. С нашей стороны — четкие ТЗ от системных архитекторов коробки, инфраструктура и железо. С вашей стороны — фундаментальная база, умение читать исходники, разбираться в статьях с arXiv, быстро тестировать гипотезы и доводить решение до стабильного продакшена своими руками. Обязательные требования: Профильное образование: Оконченное высшее техническое образование (приветствуются ВШЭ, МФТИ, МГУ, МГТУ им. Баумана, СПбГУ, ИТМО или сильные региональные физмат-школы). Направления: Прикладная математика, Информатика, Программная инженерия, Computer Science. Красный диплом (диплом с отличием) или подтвержденный средний балл (GPA) от 4.8. Нам критически важны дисциплина мышления, математическая база и навык самостоятельно докапываться до сути сложных задач. Уверенный Python: структуры данных, алгоритмическая сложность (Big O), чистота кода, асинхронность (AsyncIO). Понимание фундамента Deep Learning: математика за трансформерами (self-attention, токенизация, расчет контекстного окна, квантование, функции потерь). Системная грамотность: уверенная работа в командной строке Linux, Docker, базовое понимание архитектуры железа (RAM, VRAM, пропускная способность шины PCIe). Автономность: способность по техническому заданию взять открытый фреймворк или статью, развернуть, замерить метрики и встроить в систему без нянек. Желательные требования: Наличие работающих pet-проектов на GitHub (любые самостоятельные эксперименты с RAG, парсерами, ботами или инференсом моделей). Базовое понимание C/C++ (пригодится для отладки низкоуровневых вещей вроде llama.cpp). Опыт участия в олимпиадах по программированию, хакатонах или Kaggle. Обязанности: On-Premise инференс: Самостоятельный подъем и оптимизация открытых моделей (Qwen, DeepSeek, Llama и др.) через современные движки: vLLM, llama.cpp, Ollama, TensorRT-LLM. Квантование и оптимизация: Сжатие весов (GGUF, AWQ, GPTQ), бенчмаркинг скорости генерации токенов и замеры деградации качества ответов. Локальный RAG: Развертывание и связка self-hosted векторных баз (Qdrant, pgvector) с локальными эмбеддингами и реранкерами для поиска по корпоративным документам. Интеграция облачных API: Написание модульных коннекторов к YandexGPT API и GigaChat API в рамках единого интерфейса коробки. Упаковка под Air-Gapped: Контейнеризация AI-сервисов в Docker для развертывания на серверах клиентов без интернета. Условия: Четко сформулированные технические задачи и требования к результату от архитекторов коробки. Доступ к серверам и GPU-мощностям для тестов и бенчмарков. Прямое влияние на ключевую фичу продукта. Адекватное руководство, гибкий график, прозрачные условия пересмотра дохода по итогам внедрения работающих решений.В сопроводительном письме обязательно укажите средний балл вашего диплома и расскажите о вашем увлечении AI.