Бакалавр — Информационная безопасность (Инженерно-экономический институт)
2020 — 2024Национальный исследовательский университет «МЭИ», Москва
6 лет 11 месяцев
Национальный исследовательский университет «МЭИ», Москва
Московская Школа Программистов
Я — LLMOps-инженер в Альфа-Банке. Эксплуатирую и развиваю LLM-платформу банка: вывожу модели в эксплуатацию и веду их жизненный цикл в on-prem Kubernetes-контуре.
Мой основной стек — инференс на vLLM и SGLang (FP8/BF16-квантизация, тензорный параллелизм, иерархический KV-cache, speculative decoding), GitOps-деплой через Helm и ArgoCD, шлюз LiteLLM, а также нагрузочные стенды, SLO-бенчмарки и capacity-планирование GPU-кластеров.
До этого собрал с нуля и довёл до эксплуатации RAG-агента для техподдержки: парсинг документов, эмбеддинги и поиск в Qdrant, reranking и дообучение embeddings на корпоративном корпусе, инференс облачных и локальных моделей. Параллельно разрабатывал корпоративные web-приложения на Django и занимался пентестами.
В свободное время веду pet-проекты с LLM — этот сайт и домашняя инфраструктура на Proxmox с локальными моделями тоже из их числа. Слежу за open-source экосистемой и люблю доводить решения до эксплуатации и масштаба.
Альфа-Банк
Эксплуатирую и развиваю LLM-платформу банка. Вывод моделей в эксплуатацию и их жизненный цикл.
Деплой через Helm-чарты и ArgoCD (GitOps). Единый шаблон чарта для флота моделей, обновления без потери инференс-настроек, ConfigMaps и секреты, интеграция Vault, политики Kyverno, маршрутизация Istio, операции с весами моделей на PVC.
Стек инференса — vLLM и SGLang. FP8/BF16-квантизация, тензорный параллелизм, иерархический KV-cache (L2/L3), speculative decoding, PDD-разнесение, тюнинг моделей, диагностика инцидентов планировщика и несовместимостей CUDA/PyTorch, работа с DeepGEMM.
LLM-шлюз LiteLLM. Управление ключами и правами доступа (скрипты автоматизации), диагностика ретраев, таймаутов и метрик, обновления через GitOps без прерывания обслуживания.
Качество и ёмкость. Собственный нагрузочный стенд с 5 фазами тестирования, SLO-бенчмарки инференса, разбор деградаций производительности, capacity-расчёты GPU и токеномика моделей, планирование мощностей кластеров.
Разработка корпоративной документации. Описание техник и методик подбора параметров деплоя моделей, оценка и выделение ресурсов под инференс, расчёт потребления и утилизации. Статьи LLMOps в Confluence, README пайплайнов, матрицы моделей (модальности, контекст, скорость), security review изменений.
MCP-серверы поверх Bitbucket, Jira, Confluence и Kubernetes-контура — агентные сценарии, массовая аналитика тикетов, автоматическая сборка еженедельных отчётов активности.
Онбординг и наставничество. Помощь в адаптации сотрудникам, введение в бизнес-процессы.
Управление и ведение проектов. Предложение и выполнение под ключ решений по оптимизации рабочих процессов: автоматизация, стандартизация, контроль чувствительных данных.
Коммуникация. Тесное сотрудничество со связанными отделами, делегирование и мониторинг работ. Организация расследований инцидентов: диагностика, локализация, оперативное реагирование, меры предотвращения.
Стек: Kubernetes, Helm, ArgoCD, Istio, Kyverno, Vault, LiteLLM, vLLM, SGLang, Whisper, Docker, Python, Git, Bitbucket, Jira, Confluence, API.
Код безопасности
Разрабатывал RAG-агента для сотрудников техподдержки. Поиск информации по корпоративной документации, формирование ответов в формате «ссылка + выдержка + итог».
Построил pipeline: обработка/парсинг документов (Docling), векторизация, хранение эмбеддингов и поиск в Qdrant, метаданные и связи — PostgreSQL.
Использовал reranker и дообученную (fine-tuned) модель embeddings на корпусе корпоративной документации.
Инференс LLM — облачные (OpenAI, GigaChat) + локальные модели в контуре (Ollama, vLLM) — подбор режима под ограничения on-prem/стоимости/скорости.
Docker + GitLab CI/CD, on-prem деплой; MLflow для трекинга; самописные тесты корректности RAG и стресс-нагрузки инференса.
Open-WebUI, n8n (пользовательские цепочки, запуск сценариев, сбор фидбэка).
Параллельно: пентесты внутренних и внешних продуктов, разработка корпоративных web-приложений на Django, автоматизация внутренних процессов.
Управление в рамках отдельных проектов — декомпозиция задач, синхронизации со стейкхолдерами, контроль выполнения, отчётность.
Стек: Python, Django, Qdrant, PostgreSQL, Docling, OpenAI, GigaChat, Ollama, vLLM, MLflow, Docker, GitLab, Open-WebUI, n8n.
Ростелеком
Диагностика и поддержка рабочих мест/сетевой инфраструктуры, настройка оборудования, поддержка удалённых сотрудников.
Cristalix
Разработка серверной логики/механик (Java, Gradle).
Интеграции, работа с данными, оптимизация и сопровождение функционала.
Проектирование/поддержка БД (MySQL, SQLite).
МАГНИТ
Разработка учебного WEB-сервиса (задачи от куратора).
Фриланс
Ведение проектов web-разработки: коммуникация с заказчиком, декомпозиция и распределение задач, контроль выполнения, работа по Agile-подходу.
Фриланс
Python backend (Django), базы данных, web-разработка.
GameCloud
Разработка решений на Java (в т.ч. под игровые серверы), участие в командной разработке.
Django-сайт. Профиль, динамические блоки (образование, навыки, стаж, опыт, проекты, лента), SQLite. Выведен за edge-шлюз Traefik (TLS, маршрутизация), Gunicorn в LXC на Proxmox.
Собственный MCP-сервер lan-ssh (read/mutate классификация команд, allowlist хостов), единый cost-proxy с учётом стоимости токенов во всех диалогах, SSH-туннели -R к гостям Proxmox, watchdog, контекстные агенты по узлам сети.
Игровой сервер на отдельной VM. Код-моды на C# (Harmony-патчи, баланс, фиксы совместимости), локализация, эксплуатация 24/7; стек мониторинга Grafana + InfluxDB + Telegraf в Docker.
Новости, статьи, кейсы, заметки и важные события.
В ходе аудита безопасности локальной сети обнаружена уязвимость в программном обеспечении роутера. Производитель уведомлён, заявка на присвоение идентификатора CVE подана в MITRE. Технические детали намеренно не раскрываются до завершения скоординированного раскрытия.