Роман О. , Senior, DevOps

Male avatar
Роман О.
Россия, Санкт-Петербург
3 105 ₽/час 496 800 ₽/мес. без НДС
Опыт работы:
Более 6 лет
Языки:

Английский — C2

ПисьменныйРазговорный

О специалисте

Навыки
Ansible
Linux
Kubernetes
Bash
Grafana
Git
Nginx
Prometheus
Python
Terraform
Helm
DevOps
CI/CD
Jenkins
ELK
Zabbix
Apache Kafka
Redis
Yandex Cloud
Ubuntu
Администрирование серверов Linux
docker-compose
Kafka
ArgoCD
VMware
Applications:
Docker
Database:
PostgreSQL
Source_control:
Gitlab CI
GitLab
Technology:
SQL
Формат работы
Удалённо
Описание о специалисте

Senior SRE/DevOps-инженер с экспертизой в Kubernetes, Linux, CI/CD, мониторинге, автоматизации инфраструктуры, сетевой инфраструктуре и эксплуатации production-сервисов. Работаю на стыке backend-разработки, инфраструктуры, сетей, reliability engineering и ML-инфраструктуры: умею не только поддерживать сервисы, но и проектировать их так, чтобы они стабильно деплоились, мониторились, масштабировались и восстанавливались после сбоев.


Основной стек: Linux, Kubernetes, Docker, GitLab CI, Python, Go, Bash, Ansible, Prometheus/Grafana, PostgreSQL, ClickHouse, Redis, Kafka, Nginx/HAProxy, Vault, NetBox, Proxmox/KVM. Есть опыт с ML/LLM-направлением: NLP-модели, embeddings, transformers, bi-encoder/cross-encoder, FAISS, RAG-пайплайны, self-hosted LLM-сервисы, MLflow и GPU-инфраструктура на уровне эксплуатации.


В ML-задачах занимался разработкой и эксплуатацией сервисов для семантического поиска, суммаризации, Q&A по внутренним данным и извлечения структурированной информации из текстов. Работал с production-подходом: контейнеризация, деплой в Kubernetes, healthcheck’и, мониторинг, алерты, диагностика latency/OOM и стабильности инференса.


Сильные стороны: системное мышление, хорошая алгоритмическая база, умение разбирать сложные инциденты, внимательность к деталям, понимание production-рисков, ответственность за результат и способность быстро погружаться в новые домены.


Примеры работ

NDA
Описание задачи/проекта

Развитие и эксплуатация инфраструктурных сервисов сетевого контура банка.

Позиция на проекте
Senior SRE/DevOps Engineer
Размер команды
1 тимлид, 10 SRE/DevOps, 6 сетевых инженеров
Ответственность
  1. Эксплуатировал и развивал инфраструктурные сервисы сетевого контура: Linux, Docker, Docker Compose, Kubernetes, GitLab CI/CD, Ansible, Kafka, ClickHouse, Grafana/Prometheus.
  2. Поддерживал контейнеризированные сервисы в Kubernetes: деплой приложений, настройка манифестов, probes, resources, securityContext, CronJob/Job, анализ статусов Pod/ReplicaSet/Deployment.
  3. Сопровождал CI/CD-процессы в GitLab CI: сборка Docker-образов, доставка артефактов, деплой в Kubernetes, работа с переменными окружения, секретами и пайплайнами доставки.
  4. Развивал систему автоматического сбора конфигурационных бэкапов примерно с 4000 сетевых устройств.
  5. Оптимизировал сбор бэкапов за счёт асинхронного подхода на Python, работы с SSH/Telnet, настройки таймаутов, обработки ошибок и управления конкурентностью.
  6. Развивал легаси-систему управления конфигурациями сетевых устройств на базе NetBox: дорабатывал модели, API, валидации, бизнес-логику и пользовательские сценарии применения конфигураций.
  7. Развернул и сопровождал внутренний Looking Glass для диагностики сетевой связности, маршрутизации и доступности сетевых направлений.
  8. Участвовал в администрировании ClickHouse для хранения и анализа BMP/сетевых логов.
  9. Повышал наблюдаемость инфраструктуры: развивал Grafana-дашборды, настраивал метрики, алерты и правила выявления аномалий для быстрого обнаружения деградаций.
  10. Участвовал в расследовании production-инцидентов: анализировал логи, метрики, сетевое взаимодействие, поведение сервисов и причины деградаций.
  11. Работал с DR-сценариями и устойчивостью сервисов: проверял отказоустойчивость, участвовал в эксплуатационных работах, планировал безопасные изменения и сопровождал критичные инфраструктурные компоненты.
  12. Автоматизировал настройку серверов через Ansible: писал и поддерживал playbook’и, шаблоны конфигураций, роли и сценарии для повторяемого администрирования инфраструктуры.
  13. Участвовал в регулярных on-call дежурствах 24/7: реагировал на алерты, выполнял аварийные и плановые работы, координировал восстановление сервисов и снижал влияние инцидентов на пользователей.
  14. Поддерживал внутренние Python-библиотеки и сервисы: исправлял баги, обновлял зависимости, улучшал обработку ошибок, логирование, производительность и стабильность приложений.
  15. Работал с Kafka: участвовал в разработке внутренних библиотек и интеграций для обмена событиями между сервисами.
  16. Оптимизировал нагрузку на сервер после рефакторинга приложения: улучшал работу с памятью, параллелизмом и обработкой больших объёмов данных.
  17. Разработал и внедрил внутренний LLM-сервис для технической поддержки: semantic search по похожим обращениям, суммаризация тредов и автоматизированная подготовка ответов на основе найденного контекста.
  18. Спроектировал end-to-end pipeline обработки текстов: сбор данных, нормализация, построение эмбеддингов, поиск релевантных документов, reranking и генерация ответа.
  19. Реализовал поиск релевантного контекста на базе Bi-Encoder + Cross-Encoder, FAISS и transformer-моделей.
  20. Интегрировал Qwen API / LLM API в контур генерации ответов: подготовил промпты, правила работы с контекстом, постобработку результата и ограничения для снижения некорректных ответов.
  21. Контейнеризировал ML/LLM-сервис и развернул его в Kubernetes.
  22. Настроил GitLab CI/CD для сборки Docker-образов, доставки изменений и обновления ML-сервиса в кластере.
  23. Подготовил эксплуатационный контур для ML-сервиса: health-check’и, логирование, конфигурацию через env/secrets, воспроизводимый деплой и базовые метрики для сопровождения.
  24. Решал задачи на стыке SRE, DevOps и MLOps: от разработки backend/ML-логики до промышленного развертывания, мониторинга и поддержки сервиса.
Технологии и инструменты
aiohttp, Ansible, Asyncio, Bash, bgp, ceph, Cisco, Clickhouse, DNS, Docker, Gitlab CI, Go, Grafana, HAProxy, Huawei, Kafka, Kubernetes, Linux, NAT, Nginx, ntp, OSPF, PostgreSQL, Prometheus, Python, Redis, SMTP, SSH, telnet, Terraform, Yandex Cloud, ACL, FastAPI/Starlette, asyncssh, NetBox, Proxmox/KVM, Vault/Kubernetes Secrets, Juniper, Arista, SNR, Qtech, IS-IS, DRP
Период работы/продолжительность
Март 2024 г. - Сентябрь 2026 г.
NDA
Описание задачи/проекта

Инфраструктурная поддержка и развитие внутренних backend-сервисов банка.

Позиция на проекте
SRE/DevOps Engineer
Размер команды
1 тимлид, 2 SRE/DevOps, 5 аналитиков, 2 разработчика
Ответственность
  1. Поддержка production-сервисов в Linux/Kubernetes-окружении.
  2. Настройка CI/CD-пайплайнов для сборки, тестирования и деплоя приложений.
  3. Работа с Docker-образами, registry, переменными окружения и секретами.
  4. Настройка Kubernetes Deployment, Service, ConfigMap, Secret, probes, requests/limits.
  5. Диагностика падений pod’ов, ошибок запуска, нехватки ресурсов, проблем с доступами и сетевыми зависимостями.
  6. Настройка мониторинга и алертинга через Prometheus/Grafana.
  7. Анализ логов, метрик, ошибок приложений и инфраструктурных событий.
  8. Автоматизация повторяющихся операций через Bash/Python-скрипты.
  9. Работа с PostgreSQL/Redis/Kafka на уровне эксплуатации и диагностики интеграций.
  10. Участие в разборе инцидентов и post-incident activities.
Технологии и инструменты
Bash, CI/CD, Docker, Git, Gitlab CI, Grafana, HAProxy, Helm, Kafka, Kubernetes, Linux, MySQL, Nginx, PostgreSQL, Prometheus, Python, Redis, REST API, Vault/Kubernetes Secrets
Период работы/продолжительность
Февраль 2023 г. - Март 2024 г.
NDA
Описание задачи/проекта

Разработка и внедрение ML- и backend-сервисов для автоматизации бизнес-процессов, обработки изображений, распознавания лиц, сбора данных из внешних источников и интеграции с внутренними системами.

Позиция на проекте
Backend/DevOps Engineer
Размер команды
1 PM, 1 тимлид/технический руководитель, 3 backend, 2 DevOps
Ответственность
  1. Разработал систему распознавания лиц для задач идентификации и верификации пользователей.
  2. Реализовал полный ML-пайплайн: детекция лиц, извлечение эмбеддингов, сравнение по cosine similarity, thresholding и обработка результатов.
  3. Работал с предобученными моделями компьютерного зрения и адаптацией моделей под конкретную задачу.
  4. Занимался подготовкой и аугментацией датасетов: очистка изображений, удаление битых/шумных данных, нормализация, подготовка train/test-наборов.
  5. Оптимизировал inference ML-моделей: batching, снижение latency, использование GPU, подготовка моделей к production-запуску.
  6. Выполнял конвертацию и упаковку моделей через ONNX / TorchScript для более удобного и стабильного инференса.
  7. Оборачивал ML-модели в backend-сервисы с REST API для инференса.
  8. Реализовывал очереди задач для асинхронной обработки изображений и данных.
  9. Разработка Telegram-ботов.
  10. Разрабатывал data pipeline: сбор данных, нормализация, хранение изображений и метаданных, подготовка данных для ML-моделей.
  11. Организовывал хранение данных в PostgreSQL / ClickHouse и S3-совместимом хранилище MinIO.
  12. Разрабатывал парсеры для внешних источников: API, HTML-страницы, нестабильные источники данных.
  13. Обрабатывал rate limits, временные блокировки, нестабильные ответы, ошибки сети и антибот-защиту.
  14. Перевёл часть парсинга на асинхронную модель через asyncio / aiohttp.
  15. Использовал batching, очереди и параллельную обработку для ускорения сбора данных.
  16. Контейнеризировал backend- и ML-сервисы через Docker.
  17. Настраивал окружения через Docker Compose, переменные окружения, конфигурационные файлы и секреты.
  18. Поддерживал CI/CD-процессы в GitLab CI: сборка образов, тестирование, деплой сервисов.
  19. Настраивал базовый мониторинг, логирование, healthcheck’и и диагностику ошибок для production-сервисов.
Технологии и инструменты
aiohttp, Apache, Asyncio, Clickhouse, Cron, Docker, Docker Compose, FastAPI, Flask, GitLab CI/CD, Kubernetes, Linux, MinIo, Nginx, Numpy, ONNX, OpenCV, Pandas, PostgreSQL, Python, PyTorch, RabbitMQ, Redis, REST API, swarm, Tarantool, Tensorflow, API integrations, Airflow, TorchScript, HTML parsing, InsightFace, FaceNet, S3-compatible storage, Grafana/Prometheus
Период работы/продолжительность
Январь 2021 г. - Февраль 2023 г.

Образование

Магистр
Название учебного заведения/курса
Национальный исследовательский университет ИТМО
Специальность
программирование и интернет-технологии
Аналогичные специалисты
Не нашли, кого искали?

Оставьте заявку и, наша команда в кратчайшие сроки подберёт необходимого специалиста за вас!

Помните, что заключение договора и оплата услуг происходит после того, как вы выбрали специалиста

Request Poster