СписокРабот
Вся Россия
    Все города

    Ведущий инженер вычислительного кластера

    з/п не указана
    БЮРО 1440 Москва
    Полный день Постоянная занятость опыт от 6 лет
    Откликнуться на сайте работодателя

    Описание

    Чем предстоит заниматься Проектирование и аудит инфраструктуры: Провести технический аудит существующего HPC-пилота и разрозненных вычислительных серверов. Описать текущую архитектуру, конфигурации, технический долг и основные эксплуатационные риски. Спроектировать целевую архитектуру инфраструктурного слоя HPC-контура. Определить стандарты для CPU- и GPU-серверов, сетевого оборудования, систем хранения и системного программного обеспечения. Прорабатывать конфигурации новых вычислительных узлов и готовить технические требования к оборудованию. Участвовать в выборе, приемке, настройке и вводе оборудования в эксплуатацию. Управление кластером и распределение ресурсов: Развивать и сопровождать Slurm-кластер. Настраивать очереди, разделы, приоритеты, квоты, учет пользователей и распределение ресурсов. Сопровождение, мониторинг и интеграция: Стандартизировать Linux-окружения, драйверы, CUDA/ROCm, библиотеки и контейнерные среды. Автоматизировать установку операционных систем, подключение новых узлов и управление конфигурациями. Организовать мониторинг оборудования, операционных систем, сетей, хранилищ и сервисов Slurm. Обеспечить резервное копирование критических конфигураций и возможность восстановления инфраструктуры. Анализировать загрузку CPU-, GPU-, сетевых и storage-ресурсов. Выявлять узкие места и готовить предложения по масштабированию инфраструктуры. Обеспечивать техническую интеграцию HPC-контура с разрабатываемой вычислительной платформой. Совместно с платформенной командой определять интерфейсы между Slurm, серверами, хранилищами и пользовательскими сервисами. Помогать внутренним командам переносить вычислительные нагрузки в общий HPC-контур. Разбирать сложные проблемы производительности и эксплуатации. Платформенные интерфейсы и доступ пользователей: Помогать в проектировании и создании API-слоя и облачных интерфейсов как единой точки взаимодействия между кластером Slurm и пользователями/продуктовыми командами. Интегрировать API-слой с внутренними сервисами платформы для единого жизненного цикла задач. Процессы, документация и техническое лидерство: Выстроить процессы управления изменениями, реагирования на инциденты и анализа причин сбоев. Поддерживать техническую документацию по архитектуре, конфигурациям и процедурам. Участвовать в найме и развитии инженеров HPC-инфраструктуры. Проводить технические ревью и контролировать качество инфраструктурных изменений. На первом этапе лично участвовать в реализации ключевых технических решений. Что мы ожидаем Ключевой опыт и стек: Сильный практический опыт администрирования Linux. Опыт проектирования и эксплуатации HPC-кластеров. Практический опыт работы со Slurm или другим планировщиком вычислительных задач. Глубокое понимание серверного оборудования и архитектуры CPU- и GPU-систем. Опыт работы с физическими серверами: установка, диагностика, настройка, обновление прошивок и тестирование компонентов. Понимание принципов построения сетевой инфраструктуры и систем хранения. Опыт эксплуатации GPU-стека, включая драйверы, CUDA или ROCm. Опыт автоматизации инфраструктуры с использованием Ansible или аналогичных инструментов. Опыт построения мониторинга, логирования и оповещений. Понимание контейнерных технологий и воспроизводимых вычислительных окружений. Компетенции и подход: Способность находить причины проблем на уровнях оборудования, ОС, сети, драйверов, Slurm и пользовательской нагрузки. Умение принимать технические решения и самостоятельно доводить их до работающего результата. Готовность сочетать архитектурную работу с непосредственной инженерной реализацией. Умение взаимодействовать с разработчиками, исследователями, инженерами, поставщиками и внутренними пользователями. Опыт или понимание принципов создания API-брокеров/шлюзов между планировщиками задач и пользовательскими интерфейсами. Будет преимуществом: Опыт создания инфраструктурной основы для внутреннего облака или вычислительной платформы. Опыт эксплуатации Kubernetes, OpenStack или других систем управления инфраструктурой. Опыт работы с высокоскоростными сетями, включая InfiniBand или RoCE. Опыт эксплуатации распределенных и параллельных файловых систем. Опыт работы с крупными GPU-контурами. Опыт автоматизированной установки серверов по сети. Знание MPI, NCCL и основных библиотек высокопроизводительных вычислений. Понимание задач машинного обучения, численного моделирования или инженерных расчетов. Опыт профилирования и оптимизации вычислительных приложений. Опыт технического руководства небольшой командой инженеров. Практический опыт разработки API (REST/gRPC) на Python/Go/Java и интеграции с SLURM через python-scheduler, srun API или аналоги.

    Источник: hh · Опубликовано: 17.08.2026

    Ещё вакансии в городе Москва

    Все

    Коммерческий директор

    з/п не указана
    Инжиниринговая Компания Девон Москва
    Полный день Постоянная занятость опыт от 1 года

    ЧИТАЙТЕ ВНИМАТЕЛЬНО!!! Мы ищем коммерческого директора к нам в команду. Наш профиль —ИНЖЕНЕРНЫЕ ИЗЫСКАНИЯ. ВНИМАНИЕ !!! Опыт в инженерных изыскания обязателен!!! Ключевая задача на этой должности — привлечение новых клие…

    КореаТрейд Москва
    Полный день Постоянная занятость опыт от 1 года

    ООО «Korea Trade» - ведущий дистрибьютор корейской косметики и индийских товаров для здоровья и правильного питания. Более 10 лет мы сотрудничаем со многими ведущими производителями, осуществляем быструю доставку по всей…

    Betone Woman (ИП Крашенинникова Александра Сергеевна) Москва
    Сменный график Постоянная занятость опыт от 1 года

    Салон красоты Betone Woman в поисках администратора Ⓜ️ Беломорская (5 мин пешком) Мы ищем ответственного, коммуникабельного и любящего сферу красоты администратора Обязанности: 🟣 работа с Yclients(подробное ведение базы,…

    Lamoda Москва
    Полный день Постоянная занятость без опыта

    85 000-100 000 ₽ в месяц при выполнении целей + бонусы.Если тебе интересны спорт, мода и популярные бренды, присоединяйся к команде Lamoda Sport.Здесь ты не просто работаешь в магазине — ты помогаешь людям подобрать экип…