Алексей Ч. , Senior, Data инженер

Male avatar
Алексей Ч.
Россия, Москва
3 335 ₽/час 533 600 ₽/мес. без НДС
Опыт работы:
От 3 до 6 лет

О специалисте

Навыки
Python
PySpark
Scala
Apache Spark
Spark Structured Streaming
Apache Kafka
Hadoop
HDFS
Yarn
Apache AirFlow
Apache NiFi
MS SQL
Clickhouse
GreenPlum
Hive
S3
Jenkins
Git
Grafana
Prometheus
Pandas
Numpy
Excel
Power Query
ETL
elt
DWH
DataOps
CI/CD
Technology:
SQL
Database:
PostgreSQL
Applications:
Docker
Формат работы
Удалённо
Описание о специалисте

Разработка и сопровождение высоконагруженных ETL/ELT-процессов для обработки терабайтов данных. Проектирование архитектуры DWH и витрин данных для аналитики и регуляторной отчётности. Оптимизация производительности Spark- и SQL-процессов. Настройка CI/CD для data-pipeline’ов, контроль качества данных и обеспечение SLA. Интеграция данных из разнородных источников (RDBMS, Kafka, API, файловые системы). Взаимодействие с аналитиками, ML-командой и бизнес-подразделениями. Ведение задач в Jira, контроль версий в Git, работа в Agile/Scrum.

Примеры работ

Платформа анализа финансовых рисков
Описание задачи/проекта

Высоконагруженная data-платформа для обработки и анализа финансовых данных с целью расчёта рисковых метрик, выявления аномалий и подготовки регуляторной отчётности. Система объединяет данные из различных источников, обеспечивает потоковую и пакетную обработку и поддерживает SLA для критически важных расчётов.

Позиция на проекте
Data Engineer
Ответственность
  1. Реализация интеграционных потоков в режиме real-time через Apache Kafka и Spark Structured Streaming (producer/consumer, offset management, window-агрегации, watermarking, exactly-once / at-least-once семантика).
  2. Проектирование и реализация отказоустойчивых ETL/ELT-пайплайнов в Apache Airflow (регламентные процессы расчёта витрин, контроль SLA, управление зависимостями).
  3. Обработка терабайтов данных в экосистеме Hadoop (HDFS, YARN) с использованием Apache Spark (PySpark, Scala).
  4. Создание и оптимизация аналитических витрин в ClickHouse и PostgreSQL (партиционирование, индексы, оконные функции, CTE, анализ execution plan).
  5. Реализация процессов загрузки и обновления данных в PostgreSQL (bulk insert, upsert, транзакционная целостность).
  6. Реализация DQ-процессов (валидация полноты, корректности, уникальности данных), автоматическая блокировка публикации витрин при ошибках.
  7. Реализация системы алертинга и оповещений при нарушении SLA, DQ-инцидентах и сбоях загрузки.
  8. Внедрение практик DataOps: CI/CD (Jenkins), версионирование в Git, автоматизированное тестирование и контроль качества данных.
  9. Мониторинг пайплайнов и кластера (Grafana, Prometheus), обеспечение стабильности работы платформы.
  10. Документирование архитектуры и потоков данных в Confluence.
Технологии и инструменты
Apache AirFlow, Apache Kafka, Apache Spark, Clickhouse, elt, ETL, Git, Grafana, Hadoop, HDFS, Hive, Jenkins, PostgreSQL, Prometheus, PySpark, Python, Scala, SQL, Yarn, Spark Structured Streaming, DataOps
Период работы/продолжительность
Сентябрь 2024 г. - Январь 2026 г.
Data-интеграция и аналитическая платформа
Описание задачи/проекта

Разработка и сопровождение хранилищ данных и ETL-процессов для проектов финансового и управленческого консалтинга. Платформа обеспечивала интеграцию данных из разнородных источников, автоматизацию бизнес-логики и подготовку аналитических отчётов для клиентов.

Позиция на проекте
Data Engineer
Ответственность
  1. Проектирование и оптимизация реляционных БД (MS SQL, PostgreSQL), нормализация и проектирование схем.
  2. Разработка и рефакторинг хранимых процедур, функций, триггеров; оптимизация SQL-запросов (индексы, CTE, временные таблицы).
  3. Реализация ETL-процессов в Apache NiFi, автоматизация миграции и трансформации данных.
  4. Интеграция данных из API, файловых источников и внешних БД.
  5. Автоматизация расчётов и обработки данных на Python (Pandas, NumPy).
  6. Настройка Git-workflow, контроль версий ETL-конфигураций и SQL-скриптов.
  7. Поддержка и мониторинг пайплайнов, устранение инцидентов в продакшене.
Технологии и инструменты
Apache NiFi, CI/CD, Docker, DWH, ETL, Excel, Git, GreenPlum, MS SQL, PostgreSQL, Power Query, Python, S3, SQL
Период работы/продолжительность
Ноябрь 2021 г. - Август 2024 г.

Образование

Бакалавр
Название учебного заведения/курса
Московский государственный технический университет имени Н.Э. Баумана (национальный исследовательский университет)
Специальность
Оптотехника
Аналогичные специалисты
Не нашли, кого искали?

Оставьте заявку и, наша команда в кратчайшие сроки подберёт необходимого специалиста за вас!

Помните, что заключение договора и оплата услуг происходит после того, как вы выбрали специалиста

Request Poster