site reliability engineer
генерация резюме под вакансию
сопроводительное письмо
описание
Команда разрабатывает решение для блокчейн-технологий: систему кодогенерации на новом языке программирования смарт-контрактов с использованием LLM-моделей. Архитектура построена на мультиагентном подходе, где несколько ИИ-агентов последовательно решают подзадачи от анализа требований до генерации, проверки и оптимизации кода.
задачи
- Обеспечивать надёжность, масштабируемость и отказоустойчивость инфраструктуры для запуска агентных систем в Kubernetes;
- Управлять конвейерами CI/CD на базе Jenkins и BitBucket;
- Внедрять подходы GitOps с использованием Helm для декларативного управления релизами;
- Настраивать мониторинг, логирование и трассировку инфраструктурных компонентов;
- Внедрять трассировку цепочек рассуждений агентов;
- Интегрировать PGVector и Qdrant для отслеживания качества RAG-запросов и семантического поиска;
- Определять и контролировать показатели SLI: долю успешных генераций кода, точность, время выполнения задачи и стоимость токенов;
- Разрабатывать конвейеры регрессионного тестирования агентов и проводить нагрузочное тестирование агентных систем;
- Внедрять предохранители для защиты от каскадных отказов и автоматического ограничения нагрузки;
- Контролировать поведение агентов для обнаружения аномалий и отклонений от штатного режима;
- Разрабатывать сценарии автономного восстановления агентов при типовых инцидентах;
- Переводить инструкции и процедурные знания в исполняемые сценарии для агентов;
- Планировать работы и оценивать задачи;
- Вести документацию.
требования
- Опыт работы в роли SRE или DevOps от 3 лет;
- Опыт эксплуатации высоконагруженных распределённых систем;
- Глубокое понимание Kubernetes, включая архитектуру, операторы, Custom Resources, Helm и сетевые политики;
- Опыт эксплуатации кластеров в промышленной среде;
- Опыт работы с Jenkins, написания конвейеров на Groovy, управления артефактами и интеграции с BitBucket;
- Продвинутый Python;
- Опыт написания скриптов, инструментов автоматизации, клиентов API и тестов;
- Опыт работы с PGVector или Qdrant, PostgreSQL;
- Опыт работы с Prometheus, Grafana, Loki и OpenTelemetry;
- Умение строить дашборды и оповещения для SLO и SLI;
- Уверенное владение Jira;
- Опыт написания модульных и интеграционных тестов на Python;
- Опыт нагрузочного тестирования;
- Будет плюсом опыт работы с ЦФА, блокчейнами и смарт-контрактами, опыт с LLM и агентными фреймворками, понимание архитектуры RAG, работа с LangChain или LlamaIndex, знание особенностей провайдеров LLM, опыт работы с инструментами наблюдаемости для LLM, опыт развёртывания и оптимизации GPU-нагрузок, опыт Chaos Engineering и тестирования отказоустойчивости.
условия
- Москва, пр. Кутузовский, 32к1;
- Ежегодный пересмотр зарплаты;
- Годовая премия;
- Корпоративный спортзал и зоны отдыха;
- Более 400 образовательных программ СберУниверситета;
- Расширенный ДМС;
- Льготное страхование для семьи;
- Корпоративная пенсионная программа;
- Ипотека на льготных условиях до 7%;
- Подписка Прайм с возможностью совместного использования с тремя близкими;
- Вознаграждение за рекомендацию друзей в команду.
навыки
Если просят войти через iCloud, отправить коды из SMS, запустить код, что-то установить, перевести деньги или сделать что угодно, связанное с деньгами, не соглашайтесь: это признаки мошенничества.