AI / LLM Inference Engineer
Описание
ITKey разрабатывает инфраструктурные решения для крупных корпоративных заказчиков. Основной технологический контур компании: OpenStack, Kubernetes, Linux и инструменты автоматизации инфраструктуры. Сейчас мы создаём новый продукт для запуска и эксплуатации AI-моделей на GPU-инфраструктуре заказчиков. Ищем инженера с практическим опытом запуска готовых моделей на GPU. Основной фокус роли: подобрать конфигурацию, проверить её под нагрузкой, найти ограничения и настроить инференс под требования к скорости, стабильности и потреблению ресурсов. Что предстоит делать: запускать LLM и другие модели на GPU-инфраструктуре; подбирать конфигурацию под модель, оборудование и профиль нагрузки; работать с vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогичными решениями; проводить бенчмарки и нагрузочное тестирование; анализировать latency, throughput, TTFT, потребление GPU-памяти и загрузку ускорителей; разбираться с OOM, низкой производительностью и нестабильной работой моделей; настраивать batching, длину контекста, KV-cache, precision, quantization и parallelism; участвовать в проработке продукта: определять необходимые параметры запуска, метрики и сценарии управления AI-нагрузками; вместе с командами разработки и инфраструктуры запускать решение в контуре заказчика. Что для нас важно: практический опыт запуска и оптимизации моделей на GPU; опыт работы хотя бы с одним inference engine: vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогом; понимание влияния настроек инференса на latency, throughput и потребление GPU-памяти; опыт проведения бенчмарков и анализа производительности; умение диагностировать OOM, низкую загрузку GPU и деградацию производительности; уверенная работа с Linux, Docker и Python; понимание архитектуры современных LLM; умение анализировать проблему по логам, метрикам и результатам тестов. Будет плюсом: опыт запуска Qwen, Llama, Mistral или других открытых моделей; знание CUDA и инструментов профилирования GPU; опыт работы с Kubernetes и GPU-операторами; понимание MIG, MPS и других механизмов распределения GPU-ресурсов; опыт построения ML- или AI-платформ; опыт работы с OpenStack; опыт в MLOps: model serving, CI/CD, мониторинг и autoscaling; знание Prometheus, Grafana, GitLab CI, Terraform или Ansible. Технологический контур: OpenStack, Kubernetes, Docker, Linux, NVIDIA GPU, Python, Prometheus, Grafana, GitLab CI, Terraform, Ansible. Условия: — график работы 5/2 с возможностью удалённого участия( офис у м. Цветной бульвар) — бессрочный трудовой договор. — бонусная система, включая проектные премии. — ДМС, программы психологической поддержки. — компания оплачивает обучение и сертификацию. — преимущества работы в IT-компании.