DevOps engineer AI
Описание
Привет!Сейчас мы активно развиваем новые направления. У тебя будет возможность войти в core-команду финтех-продукта на самом старте и вместе с ИИ-агентами развивать инфраструктуру, с учетом особенностей рассматриваем только кандидатов, находящихся за пределами РФЧем будем заниматься: CI/CD. Построение и сопровождение пайплайнов непрерывной интеграции и доставки (GitHub Actions / GitLab CI), автоматизация сборки, тестирования и деплоя с быстрым откатом; Infrastructure as Code. Описание и версионирование инфраструктуры через Terraform/Pulumi, GitOps-подход, стандартизация окружений dev/staging/prod; Контейнеризация и оркестрация. Управление Docker и Kubernetes, настройка кластеров, networking и ресурсных лимитов; Observability. Настройка мониторинга, логирования и алертинга (Prometheus, Grafana, ELK/Loki, OpenTelemetry), построение дашбордов и распределённого трейсинга; Надёжность и SRE. Определение и поддержка SLA/SLO/SLI, инцидент-менеджмент, postmortem-практики, дежурства on-call, capacity planning; Инфраструктура AI-агентов. Развёртывание и поддержка среды для запуска агентов и агентных циклов (agent loops): оркестрация воркфлоу, управление очередями задач и пулами воркеров; LLM-инфраструктура. Управление model serving, API-шлюзами, балансировкой, rate limiting и фоллбэками;роутинг между моделями и провайдерами для отказоустойчивости; Observability агентных циклов. Трассировка вызовов инструментов (tools), метрики числа итераций, латентности, расхода токенов и success rate; защита от «зацикливания» и runaway-процессов; FinOps. Контроль и оптимизация затрат на облако и LLM-API, бюджетирование токенов и ресурсов, алерты по аномальному потреблению; Безопасность и автоматизация. Управление секретами и ключами (Vault), RBAC, sandboxing исполнения агентов, изоляция данных, автоматизация рутинных операций. Что для этого от тебя необходимо: AWS или Яндекс Облако: опыт от 3 лет; Глубокое понимание distributed systems и failure modes; Advanced observability: metrics, logs, traces, correlation model; Capacity planning, performance и degradation analysis; Recovery / DR / failover design; Понимание cloud / platform failure domains и межсистемных зависимостей; Graceful degradation, load shedding, backpressure, retry budgets, idempotency; Blameless postmortem с контролем corrective actions; Chaos-informed thinking, gamedays и failure injection; Проведение incident review и post-mortem; Проактивность и самостоятельность — готовность действовать без тикетов на каждый шаг; Умение считать стоимость инфраструктуры и принимать решения с оглядкой на cost. Что предлагаем: Полностью удаленный формат работы с гибким началом рабочего дня; Стек без legacy: AWS, Kubernetes, GitLab CI/CD, Grafana + Prometheus, IaC; Открытая корпоративная культура, общение на ты, поддержка инициатив; Работа в технологической компании, которая создаёт сервисы, приносящие пользу миллионам людей; Бенефиты и плюшки для сотрудников.