Ищем AI/ML-инженера, который создаст AI SilkNet ассистента и модели для анализа научных статей, отчётов по проектам и патентов: семантический поиск, RAG, классификация и кластеризация текстов, выявление трендов и слабых сигналов. Модели вс…
НАЦИОНАЛЬНАЯ АКАДЕМИЯ НАУК РЕСПУБЛИКИ КАЗАХСТАН ПРИ ПРЕЗИДЕНТЕ РЕСПУБЛИКИ КАЗАХСТАН На сервисе с: 06.10.26 16:13
Ищем AI/ML-инженера, который создаст AI SilkNet ассистента и модели для анализа научных статей, отчётов по проектам и патентов: семантический поиск, RAG, классификация и кластеризация текстов, выявление трендов и слабых сигналов. Модели встраиваются в платформу через API и работают только внутри защищённого контура , внешние API (OpenAI, Anthropic и др.) не используются.
Обязанности
• Разрабатывать AI-ассистента на основе RAG с проверяемыми ответами по первичным источникам.
• Разворачивать открытые LLM и модели эмбеддингов на серверах внутри контура.
• Строить семантический поиск, классификацию и кластеризацию больших текстовых массивов (статьи, отчёты, патенты), в т.ч. по кластерам KISTI.
• Извлекать из текстов сущности и связи; выявлять тематические кластеры, тренды, аномалии и слабые сигналы.
• Тестировать и валидировать модели: тестовые выборки, метрики качества, проверка на «галлюцинации».
• Интегрировать модели с backend через API (Python, FastAPI, Docker) совместно с backend-командой на Go.
• Документировать модели, методы, показатели качества и ограничения.
Ключевые требования
• Уверенное владение Python.
• Практический опыт разработки и применения моделей Machine Learning / NLP.
• Опыт работы с PyTorch, Hugging Face или сопоставимыми ML-инструментами.
• Практический опыт применения LLM и интеграции языковых моделей в информационные системы.
• Опыт запуска открытых LLM на собственных серверах (vLLM, Ollama, llama.cpp или аналоги) без использования внешних API.
• Опыт работы с embeddings, vector search и RAG.
• Знание методов тематической классификации и кластеризации больших текстовых массивов; понимание topic modelling.
• Опыт семантического анализа текстов, similarity search, извлечения сущностей и связей.
• Опыт обработки текстов на русском языке; извлечение текста и таблиц из PDF и DOCX.
• Навыки анализа динамики данных, выявления трендов, аномалий и слабых сигналов.
• Опыт разработки и оценки AI/ML-моделей: тестовые выборки, метрики качества, валидация результатов.
• Понимание проблемы hallucinations LLM и методов обеспечения проверяемости AI-выводов по первичным источникам.
• Опыт интеграции ML/AI-моделей с backend/API; Git, Docker.
• Способность документировать модели, методы, показатели качества и ограничения.
HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.