СписокРабот
Вся Россия
    Все города

    Инженер по оценке качества ГенИИ-моделей (GenAI Evaluation Engineer)

    з/п не указана
    СБЕР Москва
    Полный день Постоянная занятость опыт от 3 лет
    Откликнуться на сайте работодателя

    Описание

    Наша команда отвечает за независимую оценку и контроль качества генеративных моделей Банка. Наша основная задача оценить флагманские генеративные модели Сбера – GigaChat, Kandinsky, GigaCode и PhysicalAI решений. Мы первыми видим, на что способна новая модель и проводим оценку новых возможностей прежде чем она выйдет к пользователям. Мы не просто «проверяем метрики», а: глубоко разбираемся в подходах команд-разработчиков и в бизнес-процессах, где работают модели критически рассматриваем архитектурные и методологические решения и предлагаем улучшения разрабатываем собственные проверки, метрики и бенчмарки и фреймворки для их запуска проводим оценку логов пользователей для построения наиболее релевантного тестирования Отдельный фокус – R&D деятельность: создание новых методологий оценки качества участие в разработке и развитии передовых банковских и российских бенчмарков (MERA, POLLUX и др.) адаптация передовых мировых бенчмарков под специфику банковских кейсов и многое другое Эта роль про независимое измерение фундаментального качества модели: не про их обучение – этим занимается отдельная команда. Обязанности Придумывать, как вообще измерить модель ИИ стремительно развивается в мире и выходят новые модели и их виды, однако не всегда любая новая модель стала лучше предыдущей. Вам будет необходимо создать план по её проверке: что именно измерять, на какой выборке, с чем сравнивать, какая разница вообще будет считаться разницей в реальном качестве. Отвечать за достоверность измерений Полученные метрики не всегда отражают только лишь качество модели. Нужно уметь отделять реальный прирост качества от прочих факторов: ловить утечки данных в обучение, отличать дефект модели от дефекта замера, промпта или обвязки и проявлять тот же скепсис к собственной методологии: измеряем ли мы то, что заявили. Разбираться в причинах ошибок «Модель ошиблась» – это не вывод, а начало работы. Найденная вами причина той или иной проблемы модели превращается в рекомендацию команде разработки, а рекомендация – в следующую версию модели, которая этой ошибки уже не делает. Строить автоматическую оценку Разрабатывать LLM- и VLM-судей под конкретные задачи, разрабатывать с нуля собственные или дорабатывать существующие библиотеки валидации полного цикла и следим за фронтиром AI-исследований в области оценки моделей. Строить то, чем пользуются другие Фреймворки оценки, который вы развиваете – общие для команд по всему Банку. Бенчмарки, которые вы делаете, являются достоверной базой реального качества для разработчиков Банка и вне. Требования Умение проводить технический и научный ресерч: находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации; переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов. Статистика и дизайн эксперимента: доверительные интервалы, размер выборки, проверка гипотез, поправки на множественные сравнения Понимание современных AI-агентов и агентных систем: понимать, чем агент отличается от обычного вызова LLM; знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация; Понимаете, как устроены генеративным модели изнутри: трансформер и механизм внимания, диффузии, токенизация, параметры генерации, этапы обучения Опыт с генеративными моделями и понимание, как их оценивают: метрики, бенчмарки, human evaluation, Model-as-a-judge и его ограничения Продуктовое мышление: связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта, понимать влияние результатов на релиз и дальнейшее развитие модели. Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой. Будет плюсом: R&D-опыт или участие в создании бенчмарков; мультимодальные модели (изображения, видео, аудио); evaluation-фреймворки и harness; RAG; работа с асессорами; coding-агенты (Claude Code, Codex, Cursor); опыт работы с оркестрацией: LangGraph, OpenClaw, навыки вайбкодинга и AI-assisted coding Стек: Python, pandas, NumPy, PyTorch, HuggingFace (transformers, datasets), vLLM, SGLang, инференс-API, S3, Git, Docker, CI/CD, Linux, Bash. Условия комфортный современный офис рядом с м. Кутузовская гибкий формат и удаленной работы, в т.ч. на территории РФ ежегодный пересмотр зарплаты и годовая премия корпоративный спортзал и зоны отдыха более 400 образовательных программ СберУниверситета для профессионального и карьерного развития расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ подписка Прайм с возможностью совместного использования на трёх близких скидки на продукты компаний-партнеров вознаграждение за рекомендацию друзей в команду Сбера.

    Источник: hh · Опубликовано: 5 дней назад

    Ещё вакансии в городе Москва

    Все

    Коммерческий директор

    з/п не указана
    Инжиниринговая Компания Девон Москва
    Полный день Постоянная занятость опыт от 1 года

    ЧИТАЙТЕ ВНИМАТЕЛЬНО!!! Мы ищем коммерческого директора к нам в команду. Наш профиль —ИНЖЕНЕРНЫЕ ИЗЫСКАНИЯ. ВНИМАНИЕ !!! Опыт в инженерных изыскания обязателен!!! Ключевая задача на этой должности — привлечение новых клие…

    КореаТрейд Москва
    Полный день Постоянная занятость опыт от 1 года

    ООО «Korea Trade» - ведущий дистрибьютор корейской косметики и индийских товаров для здоровья и правильного питания. Более 10 лет мы сотрудничаем со многими ведущими производителями, осуществляем быструю доставку по всей…

    Betone Woman (ИП Крашенинникова Александра Сергеевна) Москва
    Сменный график Постоянная занятость опыт от 1 года

    Салон красоты Betone Woman в поисках администратора Ⓜ️ Беломорская (5 мин пешком) Мы ищем ответственного, коммуникабельного и любящего сферу красоты администратора Обязанности: 🟣 работа с Yclients(подробное ведение базы,…

    Lamoda Москва
    Полный день Постоянная занятость без опыта

    85 000-100 000 ₽ в месяц при выполнении целей + бонусы.Если тебе интересны спорт, мода и популярные бренды, присоединяйся к команде Lamoda Sport.Здесь ты не просто работаешь в магазине — ты помогаешь людям подобрать экип…