Илья У. , Senior, Data инженер

Male avatar
Илья У.
Россия, Москва
2 875 ₽/час 460 000 ₽/мес. без НДС
Опыт работы:
Более 6 лет

О специалисте

Навыки
GreenPlum
Clickhouse
HDFS
Spark
Kafka
Airflow
DBT
Informatica PowerCenter
PL/pgSQL
Python
Звезда
Снежинка
Data vault
Git
Jira
Confluence
EDA
Linux
Bash
Database:
PostgreSQL
Technology:
SQL
Формат работы
Удалённо
Описание о специалисте

Анализ данных, EDA, построение BI-витрин, многопоточное программирование, Linux, Bash

Примеры работ

Автоматизация финансовой PnL-отчетности и оптимизация инфраструктуры DWH для сервисов рекламы
Описание задачи/проекта

Построение отказоустойчивых end-to-end пайплайнов данных для расчета ключевых финансовых показателей (Net Revenue, OPEX, EBITDA, FCF) по пилотным и стратегическим проектам. Оптимизация производительности распределенных MapReduce-процедур и внедрение инженерной культуры разработки (CI/CD, Data Quality).

Позиция на проекте
Tech Lead / Senior Data Engineer
Ответственность
  1. Спроектировал единую DWH-модель и автоматизированные ETL-пайплайны для интеграции финансовых потоков из разрозненных систем.
  2. Провел рефакторинг и оптимизацию 4 ключевых MapReduce-процедур: проанализировал планы выполнения (Query Execution Plans), применил раннюю фильтрацию, CTE и оконные функции, устранив повторные чтения данных.
  3. Внедрил комплексный фреймворк Data Quality (source-to-target проверки) с автоблокировкой загрузки корректных/аномальных данных и автосозданием тикетов на команды-поставщики.
  4. Развернул изолированный тестовый контур (CI/CD) для безопасной обкатки изменений и раскатки релизов без сбоев в проде.
  5. Разработал интерактивный BI-дашборд с детализацией по проектам и статьям расходов.
  6. Проводил согласование методологии расчета финансовых метрик с бизнесом и финансовыми партнерами.
  7. Внедрил обязательный Code Review, стандарты версионирования кода и ведения техдокументации.
Технологии и инструменты
CI/CD, DataLens, DBT, Git, Python, Spark, SQL, Jupyter Notebook, YTsaurus, Data Quality, Tracker
Период работы/продолжительность
Январь 2025 г. - Июль 2026 г.
Построение с нуля ETL-инфраструктуры для MDM-системы
Описание задачи/проекта

Интеграция клиентских данных (B2B и B2C), а также реализация высоконагруженного сервиса миграции и обработки клиентских согласий.

Позиция на проекте
Data Engineer
Ответственность
  1. Спроектировал и развернул с нуля ETL-архитектуру на базе Apache Airflow для объединения данных клиентов-юрлиц и физлиц из CRM, АБС и ДБО.
  2. Разработал кастомные Airflow-операторы на Python/ODBC для миграции и извлечения данных из гетерогенных источников (Oracle, PostgreSQL, NoSQL).
  3. Спроектировал алгоритмы батчевой (потоковой) обработки данных для миграции 1.5+ ТБ исторического массива клиентских согласий в условиях строгих аппаратных ограничений (4 CPU / 16 GB RAM).
  4. Разработал и внедрил механизм фиксации точек восстановления (checkpointing / fallback recovery), обеспечивающий автоматическое возобновление загрузки при сбоях без дублирования данных.
  5. Реализовал инкрементальные и идемпотентные пайплайны ежедневного обновления данных (20–30 ГБ/день).
  6. Провел факторный EDA-анализ причин возникновения дублей клиентских карточек на Python (pandas) и SQL, оцифровал бизнес-логику каналов привлечения.
  7. Построил витрины данных в DWH и разработал интерактивный BI-дашборд в Apache Superset для мониторинга дубликатов.
Технологии и инструменты
Apache AirFlow, Apache Superset, AWS S3, Confluence, Docker, Git, GreenPlum, Hadoop, Jira, Kafka, MongoDB, Oracle Pl/SQL, Pandas, PostgreSQL, PySpark, Python, RabbitMQ, REST API, SQL
Период работы/продолжительность
Июнь 2022 г. - Октябрь 2025 г.
Разработка масштабируемой программно-аппаратной платформы для агентного и симуляционного моделирования
Описание задачи/проекта

Построение распределенного ETL-пайплайна для параллельной генерации, асинхронного сбора и распределенной обработки больших объемов симуляционных данных (50+ ГБ).

Позиция на проекте
Data Engineer
Ответственность
  1. Проектирование архитектуры системы распределенной симуляции с использованием агентного подхода для моделирования экономических агентов.
  2. Разработка параллельного ETL-пайплайна на PySpark для высокоскоростной обработки и трансформации результатов симуляций в реальном времени.
  3. Интеграция асинхронных очередей сообщений на базе ActiveMQ для надежной передачи событий и координации распределенных агентов без потери данных.
  4. Настройка контура вычислений на базе GPU-ускорителей для распараллеливания тяжелых математических расчетов и статистических моделей.
  5. Проведение серии исследовательских экспериментов, сбор и очистка 50+ ГБ экспериментальных данных, подготовка аналитических витрин для научных отчетов.
  6. Документирование архитектуры системы, подготовка научных публикаций и защита результатов в рамках магистерской диссертации.
Технологии и инструменты
ActiveMQ, Bash, C++, CUDA, Git, Hadoop, Java, Linux, PostgreSQL, PySpark, Python, SQL, Distributed Systems
Период работы/продолжительность
Март 2020 г. - Апрель 2022 г.

Образование

Высшее
Название учебного заведения/курса
МФТИ
Специальность
Прикладная математика и физика
Аналогичные специалисты
Не нашли, кого искали?

Оставьте заявку и, наша команда в кратчайшие сроки подберёт необходимого специалиста за вас!

Помните, что заключение договора и оплата услуг происходит после того, как вы выбрали специалиста

Request Poster