Локация

NLP engineer (GigaChat Pretrain Data)

СБЕР
Москва Опыт работы от 3 лет Постоянная занятость Полный день
Поделиться

Описание

Мы - команда GigaChat Pretrain Data, готовим pretrain данные для GigaChat и GigaChat Vision. Pretrain данные - это фундамент, с которого начинается путь современной LLM модели и то, от чего наиболее зависит ее итоговое качество. Сырых данных более 40Пб и основная задача заключается в том, чтобы из этого хаоса сделать датасет, на котором будет обучена лучшая LLM в России.

Обязанности

  • генерировать синтетические данные: математика, код, произвольная синтетика с сидами - документами из Web
  • исследовать токенизацию и ее влияния на качество модели (возможно написание статей)
  • решать задачи кластеризации миллиардов документов
  • исследовать разные факторы, которыми обладают текстовые данные
  • генерировать Vision данные для прокачки VLM
  • разрабатывать новые алгоритмы парсинга HTML и исследовать его влияние на качество модели
  • исследовать зависимости между pretrain данными и agentic capabilities итоговой модели
  • разрабатывать стабильную инфраструктуру, которая будет поддерживать проведение сотен и тысяч экспериментов над данными.

Требования

  • имеешь коммерческий релевантный опыт связанный с NLP или построением инфраструктуры для данных от двух лет.

Будет плюсом

  • навыки работы с генеративными AI-моделями; опыт создания AI-агентов и использования их в работе будет преимуществом
  • опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов
  • инструментальное владение AI для анализа, генерации и автоматизации.
  • диплом ШАД/ ВШЭ Факультета компьютерных наук/ МФТИ школы прикладной математики и информатики и/или есть опыт с MapReduce системами, например, YT.

Условия

  • комфортный современный офис рядом с м. Кутузовская
  • гибридный формат работы (2 дня в офисе, 3 дня на удалёнке)
  • ежегодный пересмотр зарплаты, годовая премия
  • корпоративный спортзал и зоны отдыха
  • система обучения для профессионального и карьерного развития
  • расширенный полис ДМС с первого дня работы и страхование для семьи
  • льготная программа ипотеки для сотрудников
  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.
6 дней назад Источник: hh.ru
Обращаем Ваше внимание, что вакансия взята с внешнего источника hh.ru. Администрация сайта не несет ответственность за ее содержание.
Рекомендуемые вакансии

NLP engineer (GigaChat Pretrain Data)

  • СБЕР
  • Москва
... Описание Мы - команда GigaChat Pretrain Data, готовим pretrain данные для GigaChat и GigaChat Vision. Pretrain данные - это ... коммерческий релевантный опыт в роли NLP Engineer от двух лет навыки ...
25.12.2025

NLP Engineer (GigaChat Pretrain)

  • СБЕР
  • Москва
Описание Эта вакансия участник пилота по использованию AI. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог ...
29.12.2025

NLP Engineer (команда GigaChat Pretrain)

  • СБЕР
  • Москва
Описание Мы в GigaChat делаем core-технологию генеративной языковой модели: она пишет тексты, генерирует изображения, пишет код, отвечает на вопросы и ведёт диалоги. Прошлой осенью мы выпустили ...
25.12.2025