DevOps / MLOps Engineer (LLM Infrastructure)
Описание
Локация: Москва, работа в офисе работодателя; возможна удалёнка
Зарплата: от 120 000 RUB в месяц, до вычета налогов
Компания
Разработка B2B-платформы автономных ИИ-агентов для рынка США.
Что делать
Обслуживать облачную инфраструктуру, включая виртуальные машины, Kubernetes-кластеры, сети, хранилища, резервное копирование и контроль расходов.
Разворачивать и сопровождать сервисы в инфраструктуре клиентов, выполнять удалённую диагностику, обновления без простоя и техническое документирование.
Строить CI/CD, GitOps и Infrastructure as Code, автоматизировать воспроизводимые релизы, canary- и blue-green-развёртывания, rollback и disaster recovery.
Эксплуатировать managed LLM API и inference-сервисы для open-source моделей, настраивать маршрутизацию, квоты, rate limits, retry и fallback.
Развивать наблюдаемость и производительность LLM-платформы: метрики, логи, трассировку, алерты, latency, throughput, доступность, расход токенов и стоимость.
Участвовать в on-call, расследовать инциденты, проводить RCA и postmortem, управлять секретами, доступами, сетевой изоляцией и аудитом.
Требования
От 3 лет опыта в DevOps/MLOps и практический опыт развёртывания или поддержки LLM- или GenAI-сервисов.
Опыт администрирования Linux в облаке и эксплуатации Kubernetes в production, включая Helm, autoscaling, storage, networking и безопасные обновления.
Практический опыт CI/CD, GitOps, Infrastructure as Code и автоматизации; GitLab CI, GitHub Actions, Argo CD, Terraform и Ansible или аналоги.
Опыт эксплуатации managed LLM API и/или развёртывания open-source моделей через vLLM, TGI, Triton, Ollama или аналоги.
Навыки production-наблюдаемости, on-call, RCA, runbooks, управления доступами через SSO/MFA/RBAC и защищённого удалённого доступа через VPN или Zero Trust.
Английский B1 или выше; Python и Bash на уровне автоматизации инфраструктуры и диагностики production-сервисов.
Хорошо, если есть
Опыт эксплуатации GPU-кластеров, NVIDIA GPU Operator, scheduling, autoscaling и capacity planning.
Опыт оптимизации inference: batching, caching, quantization, latency, throughput и стоимости.
Знание RAG-инфраструктуры, векторных хранилищ, data pipelines и инструментов наблюдаемости LLM-приложений.
Опыт работы с MLflow, Kubeflow, Ray, KServe или аналогичными компонентами serving ML-моделей.
Опыт развёртывания решений у корпоративных клиентов, в регулируемой среде или прохождения аудитов SOC 2/ISO 27001.
Культура и преимущества
Полная занятость и работа в офисе в Москве; возможен удалённый формат.
Возможность определять инфраструктурные стандарты LLM-платформы на ранней стадии.
Высокая самостоятельность в выборе инженерных решений.
Сложные задачи на стыке DevOps, MLOps, облачной инфраструктуры и production AI.
Процесс найма
В отклике необходимо описать production-опыт с LLM- или GenAI-сервисом, личную зону ответственности и масштаб проекта.
Нужно разобрать сложный инфраструктурный инцидент, его первопричину, изменения и проверку результата.
Общие формулировки без конкретного production-опыта не рассматриваются; при возможности следует приложить подтверждающие материалы.