Кого ищем
Нужен инженер, который заставляет модели работать на "грязных" реальных данных, а не на чистом бенчмарке.
Важное про характер работы, чтобы не было расхождения ожиданий: это на 90% инференс-инжиниринг, а не обучение моделей. Обучения и разметки в проекте почти нет. Больше того — у нас правило: если задачу можно решить детерминированно (правилами, геометрией, справочником), мы решаем её детерминированно, и только потом тянемся к модели.
Если тебе интереснее файнтюнить и публиковаться — тебе будет скучно. Если тебе нравится «взять зоопарк готовых моделей и собрать из них работающий продукт» — тебе будет очень интересно.
Что предстоит делать
- OCR/TSR на реальных сканах: чертежи, таблицы, документы разного качества и ориентации.
- Компьютерное зрение по штампам и основным надписям: локализация, чтение полей, детекция подписей, печатей, QR-кодов. Комбинация геометрических эвристик, OCR и VLM как добивки нечитаемого.
- Семантический поиск по всему пакету документов: чанкование, индексация, векторный поиск, ранжирование, привязка результата к листу и области на странице.
- LLM-извлечение структурированных данных из текста: метаданные проекта, показатели, коэффициенты.
- Оптимизация инференса и ресурсов: батчинг, GPU, время обработки пакета под контрольным лимитом.
Must have
- 2+ года опыта продакшен-работы с ML-системами.
- Глубокое понимание ML на практике: метрики, диагностика качества, оптимизация инференса.
- Опыт с "грязными" реальными данными в одной из областей: OCR/CV по документам, либо RAG/векторный поиск, либо извлечение структуры из текста. Именно на продакшен-данных.
- Уверенный бэкенд: FastAPI/аналог, очереди, Docker.
- Готовность выбрать простое решение вместо элегантного, когда простое работает.
Будет большим плюсом
- PDF-стек изнутри: PyMuPDF, рендер, DPI, память.
- vLLM и локальный инференс open-source моделей (у нас Qwen VLM), распределение CPU/GPU.
- Опыт с векторными БД (Qdrant или аналог) и построением RAG на разнородных документах.
- Разметка и подготовка датасетов: умеешь поставить задачу разметчикам и проверить результат.
- Домен технической документации: чертежи, нормативка, любой опыт с документами, написанными по стандарту, который никто не соблюдает.
Стек
PyTorch, vLLM (Qwen VLM), OCR/TSR, векторный поиск, Python + FastAPI, PostgreSQL, Redis, RabbitMQ, Docker. ML-тир — на Ray.