Фатима С. , Senior, Data Scientist

Female avatar
Фатима С.
Россия, Казань
3 220 ₽/час 515 200 ₽/мес. без НДС
Опыт работы:
От 3 до 6 лет

О специалисте

Навыки
Python
PyTorch
Tensorflow
Transformers (Hugging Face)
langchain
LlamaIndex
TensorFlow Federated
FastAPI
Kubernetes
Redis
Apache Kafka
Apache Flink
Grafana
Prometheus
Streamlit
openai api
PEFT/LoRA
Sentence Transformers
Gensim
SpaCy
NLTK
yolov5
Detectron2
OpenCV
PyOD
shap
Biopython
Scanpy
Pandas
Numpy
Scikit-learn
Jupyter
Elasticsearch
ChromaDB
FAISS
Sphinx/MkDocs
Pytest
Black/isort
Plotly
dash
R (tidyverse, Bioconductor)
CRM-системы
Jira
Confluence
Applications:
Docker
Database:
PostgreSQL
Source_control:
GitLab CI/CD
Формат работы
Удалённо
Описание о специалисте

Разработка, внедрение и поддержка end-to-end ML-систем в продакшн Оптимизация производительности моделей (инференс, память, точность). Настройка MLOps-пайплайнов (CI/CD, мониторинг, версионирование). Работа с LLM, Computer Vision, Anomaly Detection, NLP Интеграция моделей в продуктовые сервисы и микросервисную архитектуру. Анализ данных, формулирование гипотез, проектирование признаков Обучение и валидация моделей машинного обучения Интерпретация результатов, подготовка отчетов и дашбордов Консультирование заказчиков, перевод бизнес-задач в ML-постановки. Проведение исследований и экспериментов для улучшения продуктов.

Примеры работ

Категоризатор веб-страниц на основе LLM
Описание задачи/проекта

Разработка end-to-end системы автоматической категоризации веб-страниц с использованием современных NLP-технологий. Система анализирует контент веб-страниц и присваивает им тематические категории для последующей аналитики и персонализации.

Позиция на проекте
ML Engineer / Data Science Consultant
Ответственность
  1. Проектирование и реализация пайплайна обработки текстовых данных (веб-скрапинг, очистка, токенизация).
  2. Сравнительный анализ подходов к извлечению признаков: TF-IDF, word2vec (Gensim), контекстные эмбеддинги (BERT).
  3. Обучение и тонкая настройка (fine-tuning) модели Llama 3 для задачи классификации.
  4. Оптимизация производительности модели: устранение "галлюцинаций", увеличение скорости инференса в 3 раза.
  5. Интеграция локальной LLM (Qwen) в продакшн-окружение с обеспечением работы в реальном времени.
  6. Оптимизация инференса LLM с использованием vLLM, ONNX Runtime и TensorRT, что позволило ускорить обработку в 3.5 раза.
  7. Применение RLHF для калибровки уверенности модели на основе фидбека модераторов.
  8. Настройка мониторинга качества предсказаний и дрифта данных.
Технологии и инструменты
Bert, Docker, FastAPI, Gensim, PostgreSQL, Python, PyTorch, Scikit-learn, TF-IDF, Qwen, Prometheus/Grafana, Transformers (Hugging Face), Llama 3
Период работы/продолжительность
Август 2023 г. - Июнь 2026 г.
RAG система для смыслового поиска по внутренней документации
Описание задачи/проекта

Создание с нуля Retrieval-Augmented Generation системы для интеллектуального поиска по корпоративной документации. Система позволяет находить релевантные документы по семантическим запросам и генерировать развернутые ответы на основе извлеченной информации.

Позиция на проекте
ML Engineer / Data Science Consultant
Ответственность
  1. Разработка пайплайна индексации документов: парсинг PDF/DOCX, сегментация текста, создание эмбеддингов.
  2. Настройка векторной базы данных (ChromaDB) для хранения и поиска семантических эмбеддингов.
  3. Реализация RAG-архитектуры с каскадным поиском (семантический + ключевые слова).
  4. Оптимизация промптов и цепочек рассуждений (Chain-of-Thought) для улучшения релевантности ответов.
  5. Создание системы оценки качества поиска (метрики Recall@K, MRR, человеческая оценка).
  6. Разработка комплексной системы оценки с метриками BLEU.
  7. Проведение A/B тестирования различных моделей эмбеддингов и реранкеров.
Технологии и инструменты
Docker, Elasticsearch, langchain, NLTK, Python, SpaCy, Streamlit, FAISS, Mistral, LlamaIndex, ChromaDB, Sentence Transformers, Llama 3
Период работы/продолжительность
Июнь 2021 г. - Август 2023 г.
LLM помощник разработчика
Описание задачи/проекта

Реализация системы автоматической генерации технической документации на основе исходного кода. Решение помогает разработчикам поддерживать актуальную документацию, снижая manual work на 70%.

Позиция на проекте
ML Engineer / Data Science Consultant
Ответственность
  1. Разработка двухэтапного пайплайна: извлечение структуры кода → генерация описаний.
  2. Сложный промпт-инжиниринг с использованием шаблонов few-shot и chain-of-thought.
  3. Дообучение Llama 3 на датасете пар "код-документация" с применением LoRA/PEFT.
  4. Создание системы валидации сгенерированной документации (синтаксическая и семантическая проверка).
  5. Интеграция с CI/CD для автоматической генерации документации при коммитах.
  6. Оптимизация стоимости инференса через квантизацию и кэширование.
Технологии и инструменты
Docker, FastAPI, Pytest, Python, transformers, PEFT/LoRA, Sphinx/MkDocs, Black/isort, Llama 3, GitLab API
Период работы/продолжительность
Июнь 2021 г. - Август 2023 г.
Антифрод-система на основе автоэнкодеров
Описание задачи/проекта

Разработка системы детекции мошеннических паттернов в рекламных аукционах с использованием методов глубокого обучения для поиска аномалий.

Позиция на проекте
ML Engineer / Data Science Consultant
Ответственность
  1. Сбор и анализ данных о поведении пользователей в рекламных аукционах (100M+ событий).
  2. Проектирование и обучение вариационного автоэнкодера (VAE) для reconstruction-based anomaly detection.
  3. Эксперименты с различными архитектурами: стандартные AE, VAE, Adversarial Autoencoders.
  4. Калибровка порогов обнаружения для минимизации ложных срабатываний при сохранении высокой recall.
  5. Разработка системы интерпретации аномалий (SHAP/LIME для объяснения предсказаний).
  6. Интеграция модели в продакшн с near-real-time инференсом (задержка < 100 мс).
  7. Создание дашбордов для мониторинга эффективности системы.
Технологии и инструменты
Apache Kafka, Docker, Grafana, Kubernetes, PostgreSQL, Python, PyTorch, Redis, shap, Tensorflow, Apache Flink, PyOD, Variational Autoencoders
Период работы/продолжительность
Июнь 2021 г. - Август 2023 г.
Детекция объектов на изображениях для in-image рекламы
Описание задачи/проекта

Исследование и разработка системы компьютерного зрения для автоматического анализа изображений и определения оптимальных позиций для размещения in-image рекламы.

Позиция на проекте
ML Engineer / Data Science Consultant
Ответственность
  1. Сбор и аннотирование датасета изображений (50k+ изображений с bounding boxes).
  2. Сравнительный анализ моделей детекции объектов: YOLOv5, Faster R-CNN, RetinaNet, DETR.
  3. Тонкая настройка (fine-tuning) предобученных моделей на доменных данных.
  4. Оптимизация модели для баланса между точностью и скоростью инференса.
  5. Разработка алгоритма выбора рекламных мест на основе семантики объектов и композиции изображения.
  6. Создание прототипа системы для оценки бизнес-метрик (CTR, engagement rate).
  7. Подготовка технико-экономического обоснования для внедрения в продакшн.
Технологии и инструменты
Docker, OpenCV, Python, PyTorch, Streamlit, Tensorboard, yolov5, albumentations, Detectron2 (Faster R-CNN), COCO API
Период работы/продолжительность
Июнь 2021 г. - Август 2023 г.

Образование

Высшее
Название учебного заведения/курса
КФУ, Казань, ИФМиБ
Специальность
Разработка, внедрение и поддержка end-to-end ML-систем в продакшн
Не нашли, кого искали?

Оставьте заявку и, наша команда в кратчайшие сроки подберёт необходимого специалиста за вас!

Помните, что заключение договора и оплата услуг происходит после того, как вы выбрали специалиста

Request Poster