LlmOps-DevOps
Описание
Обязанности: Готовить LLM и другие генеративные модели к промышленному запуску; Выбирать inference-движок с учетом архитектуры модели, оборудования и требований продукта; Создавать воспроизводимые контейнерные образы и конфигурации model serving; Настраивать tensor parallelism, pipeline parallelism, batching, KV cache, длину контекста и управление памятью; Подбирать методы квантизации и оптимизации с контролем влияния на качество модели; Определять оптимальное количество и тип GPU для целевых latency, throughput и нагрузки; Проводить профилирование, функциональные и нагрузочные тесты моделей; Находить узкие места на уровне модели, inference-движка, CUDA, GPU, сети и хранилища; Автоматизировать развертывание, обновление, откат и масштабирование моделей в Kubernetes; Настраивать метрики, логи и трассировку model-serving-сервисов; Формировать эталонные конфигурации и таблицы производительности поддерживаемых моделей; Контролировать потребление GPU, утилизацию памяти и стоимость inference; Участвовать в настройке маршрутизации, балансировки и отказоустойчивости сервисов моделей; Адаптировать конфигурации моделей для облачной и on-premise-инфраструктуры; Оценивать новые модели, inference-фреймворки, методы оптимизации и аппаратные платформы; Консультировать продуктовые команды по возможностям, ограничениям и инфраструктурным требованиям моделей; Взаимодействовать с командами разработки моделей, DevOps/SRE, Agents Space и частных инсталляций. Требования: Практический опыт запуска LLM или других крупных генеративных моделей в production либо на высоконагруженных стендах; Хорошее понимание архитектуры Transformer и жизненного цикла inference-запроса; Опыт работы хотя бы с одним современным inference-движком: vLLM, NVIDIA TensorRT-LLM, Triton Inference Server, Hugging Face TGI или аналогичным; Понимание tensor/pipeline parallelism, continuous batching, KV cache и методов управления памятью; Знание методов квантизации и их влияния на качество и производительность; Практический опыт работы с GPU, CUDA и инструментами диагностики; Уверенное владение Python; Опыт контейнеризации с Docker и развертывания сервисов в Kubernetes; Опыт проведения нагрузочных тестов и анализа latency, throughput, time to first token и inter-token latency; Опыт настройки мониторинга и профилирования inference-сервисов; Знание Linux, Git и основных принципов CI/CD; Умение документировать эксперименты и принимать решения на основании измеримых результатов. ## Будет преимуществом Опыт работы с NVIDIA GPU Operator, DCGM, MIG, NCCL и multi-node inference; Знание PyTorch и Hugging Face Transformers; Опыт оптимизации моделей с помощью TensorRT, ONNX или custom kernels; Опыт работы с Ray Serve, KServe, Seldon или аналогичными системами; Понимание особенностей MoE-моделей, speculative decoding и prefix caching; Опыт построения автоматизированного контура оценки качества LLM; Опыт эксплуатации моделей в on-premise или изолированных средах; Опыт расчета и оптимизации unit-экономики inference.