C

Senior/Staff AI Engineer (Quality & Evals) (Python)

We’re Cortea , a Berlin startup transforming audits with AI . Manual, document-heavy audits waste expert time while demand keeps rising. Our AI-powered software and specialized AI agents remove the repetitive work so auditors can focus on…

cortea · На сервисе с: 09.09.26 19:55

Зарплата не указанаГерманияБерлин
About Us

We’re Cortea, a Berlin startup transforming audits with AI. Manual, document-heavy audits waste expert time while demand keeps rising. Our AI-powered software and specialized AI agents remove the repetitive work so auditors can focus on judgment.

Backed by top-tier VCs with >15m EUR funding, with a working product and paying customers, we’re rapidly scaling.

We value first-principles thinking, speed, trust, and kindness. We build side by side in our Berlin office.

Your Role

We are looking for an engineer with strong backend, data, and AI systems experience to build the evaluation and observability foundation for production-grade LLM agents used in complex audit workflows.

This role sits at the intersection of backend engineering, data infrastructure, and AI quality. You will build the evaluation systems that power our multimodal retrieval agents and continuously improve critical quality metrics across current and future pipelines.

You’ll work at the edge of applied AI and information retrieval, building multimodal agentic pipelines and solving hard context and agent-harness engineering problems.

This is not a traditional analytics, BI, or dashboarding role. You should expect to write production code, design data architecture, work inside backend systems, and directly improve the quality, cost, reliability, and performance of LLM-based agents.

What You’ll Do

You will help build and operate the technical systems around our AI agents, with a focus on data infrastructure, evaluation, observability, and optimization. You will:

  • Build online and offline evaluation systems for LLM agents, including pipelines that use golden datasets, ground-truth data, human review workflows, and experiment results.
  • Create automated quality gates so changes to prompts, context, models, or agent logic can be tested before reaching production.
  • Analyze large volumes of agent traces and executions in columnar and analytical databases such as BigQuery or ClickHouse to identify failure modes, quality regressions, latency issues, reliability gaps, and cost optimization opportunities.
  • Build reliable data retention and replay mechanisms for long-term analysis of production agent behavior.
  • Manage observability tools for tracing, monitoring, debugging, and experiment management of our audit agents.
  • Team up with backend engineers to improve the speed and reliability of our retrieval and reasoning agents.

You will fit into the role if you...

  • Have strong Python and/or backend engineering experience.
  • Have a solid understanding of how LLM and agent systems are evaluated—including deterministic checks, ground truth, LLM-as-judge, human review, and quality metrics—and can reason about when each approach is appropriate.
  • Have deployed and operated systems in the cloud, ideally on GCP.
  • Have hands-on experience building end-to-end retrieval or ML pipeline evaluation systems and using LLM observability or experimentation tools such as Braintrust, MLflow, Langfuse, or Weights & Biases.
  • Are comfortable working with analytical databases, data warehouses, columnar stores, and high-volume event or trace data.
  • Understand system design, reliability, observability, monitoring, logging, debugging, and operational trade-offs.
  • Bring senior-level engineering judgment: you can make architectural decisions, communicate trade-offs, and build systems that other engineers can extend.
  • Are comfortable with ambiguity, able to reason from first principles, and excited to build infrastructure for AI systems that are actively used in production.

Nice-to-haves that are a plus:

  • Designing data pipelines, ETL/ELT workflows, event-processing systems, or feedback loops for production data.
  • Building infrastructure around LLM-based products or agentic systems, including optimizing LLM usage, context windows, reasoning tokens, or model selection.
  • Working with production traces from complex distributed systems.
  • Building internal platforms for engineers, domain experts, or operations teams.
  • Using workflow orchestration systems such as Temporal or similar.
  • Familiarity with audit, finance, compliance, or other high-accuracy domains.
  • Experience in an early-stage startup or fast-moving engineering environment.

No-one checks every box. If you’ve shipped retrieval systems and like owning evaluations and pipelines, let’s talk.

What we offer

  • High impact & growth: Shape strategy at a scaling AI startup from day one.
  • Mission-driven culture: Ambitious team valuing first-principles thinking and bold ideas.
  • Attractive compensation: competitive salary plus significant equity.
  • Best tools for the job: Generous coding tools budget so you can use the best tools for the job.
  • Startup perks: Flexible vacation, team lunches, retreats, central Berlin office.

Interview process

  • First Call — Intro to Cortea with Liza
  • Second Call — Technical interview with Vlad
  • Third Call — Deep dive into our culture with our Co-Founder Philipp
  • On-site Day (Berlin) — Meet the team and work on a real problem together

We’re an equal-opportunity team and encourage women and underrepresented groups to apply.

Похожие вакансии AI инженер

hh.ru
народный банк казахстана. it

Middle AI Engineer

народный банк казахстана. itНа сервисе с: 24.09.26 16:44
Зарплата не указанаКазахстанАлматыОфис

Halyk Банк – это мощная экосистема, где технологии сочетаются с ценностями.
Мы гордимся более чем 14 000 работниками, которые делают нас лучшим местом работы. Мы предоставляем услуги во всех сегментах финансового рынка: банковском, страховом, лизинговом и т.д.
Мы стремимся стать ведущим цифровым банком, внедряя инновации и предоставляя возможности для роста и развития.
Мы ищем талантливых специалистов, готовых развиваться вместе с нами!

Обязанности:

  • Разработка и внедрение LLM/VLM-решений для бизнес-задач компании;
  • Проектирование и построение RAG-пайплайнов для работы с корпоративными данными Разработка и оптимизация мульти-агентных систем на базе LangGraph и LangChain Настройка и обслуживание инференс-серверов (vLLM, TGI, TensorRT-LLM) Fine-tuning моделей (LoRA, QLoRA, RLHF, DPO) под специфические задачи;
  • Разработка REST API на FastAPI для интеграции ML-сервисов в продукт;
  • Контейнеризация и деплой ML-сервисов с помощью Docker и Kubernetes;
  • Оптимизация производительности моделей: квантизация, батчинг, управление GPU-памятью;
  • Проектирование и поддержка векторных баз данных для хранения эмбеддингов;
  • Написание и поддержка автоматических тестов для ML-пайплайнов;
  • Мониторинг качества моделей в продакшене (LangSmith, OpenTelemetry);
  • Проведение бенчмарков и A/B-тестов для сравнения моделей и подходов;
  • Работа с GPU-инфраструктурой: настройка multi-GPU, распределённое обучение
  • Подготовка и очистка данных для обучения и оценки моделей;
  • Исследование и внедрение новых моделей, техник и фреймворков;
  • Написание технической документации и ADR (Architecture Decision Records);
  • Участие в код-ревью и менторинг младших специалистов;
  • Взаимодействие с продуктовой командой для определения требований и приоритетов;
  • Оптимизация стоимости облачной GPU-инфраструктуры;
  • Обеспечение безопасности и надёжности ML-сервисов в продакшене.

Требования:

  • Python;
  • Python 3.10+ (async/await, type hints, dataclasses). SOLID, Clean Architecture, DI. pytest + mocks, Ruff/Black/MyPy, Poetry/uv, Git & CI/CD;
  • LLM / VLM
  • Transformer (attention, KV-cache).
    Модели: GPT-4, LLaMA 3, Mistral, Qwen, LLaVA, GPT-4o.
    Fine-tuning: LoRA/QLoRA, PEFT, RLHF, DPO.
    Prompting: CoT, ReAct, Few-shot. Evaluation: LLM-as-judge, perplexity. Tokenization (tiktoken);
  • LangChain & LangGraph
    LangChain (LCEL, Agents, Tools, Memory), LangGraph (multi-agent graphs), RAG-пайплайны, Vector DB (Chroma, Pinecone, Qdrant, pgvector), LangSmith;
  • Инференс
    vLLM (PagedAttention, continuous batching), Quantization (GPTQ, AWQ, GGUF), Serving (vLLM, TGI, TensorRT-LLM), OpenAI-compatible API.
    PyTorch & DL
    PyTorch, Hugging Face (Transformers, PEFT, TRL), Distributed (DDP, FSDP, DeepSpeed), BF16/FP16.
    GPU & Инфраструктура
    NVIDIA (H100, A100, RTX 4090), multi-GPU parallelism, Cloud (AWS/GCP/RunPod), мониторинг nvidia-smi;
  • Backend
    FastAPI, Pydantic v2, async (asyncio, httpx), WebSockets/SSE, JWT.
    DevOps
    Docker (GPU), Docker Compose, Kubernetes basics, GitHub Actions, Prometheus/Grafana;
  • Хранилища
    PostgreSQL + pgvector, Redis, S3, Vector DBs, Kafka/RabbitMQ.
    Nice to Have
    CrewAI, AutoGen, MLflow/W&B, Airflow, Streamlit/Gradio.
  • Уровни опыта:
    Junior: Python, PyTorch, LangChain, Docker
    Middle: Fine-tuning, RAG, vLLM, FastAPI, LangGraph
    Senior: Архитектура, distributed training, MLOps
    Lead: Стратегия, оптимизация затрат, лидерство
    Soft Skills: Аналитическое мышление, техническая коммуникация, быстрое обучение, English B2+, Agile.

Условия:

  • Заработная плата и бонусы: конкурентоспособная оплата труда благодаря системе грейдирования, премии ко Дню Независимости и годовой бонус.
  • Социальный пакет: ДМС и страхование жизни, мобильная связь и скидки от партнеров.
  • Отпуск и отдых: 26 дней отпуска с возможностью взять дополнительные дни при наступлении важных событий.
  • Бонусы за рекомендации.
  • Рабочие условия: льготные условия на паркинг, свободный стиль одежды (smart casual).
  • Обучение и развитие: тренинги, вебинары и доступ к корпоративной библиотеке, четкая система карьерного роста.
  • Корпоративная культура: открытая и дружеская рабочая атмосфера, спортивные турниры и активная корпоративная жизнь.
  • Инициативы и проекты: возможность участия в социальных проектах, реализация идей в новых проектах группы «Halyk» с использованием современных digital-инструментов.
  • Команда: творческая и поддерживающая команда для реализации ваших идей.
  • Присоединяйтесь к нам и становитесь частью команды «Halyk»!
hh.ru
витай ворлд

Junior Developer (AI-assisted)

витай ворлдНа сервисе с: 24.09.26 15:32
Зарплата не указанаБеларусьМинскОфис

VitAi World строит цифровые продукты для бизнеса и не только: сайты, внутреннюю CRM-платформу, игры, ботов, интеграции и автоматизацию. Проектов много и они разные, поэтому много и небольших задач: поправить интерфейс, собрать страницу, починить баг, подключить форму.

Мы ищем junior-разработчика, который возьмёт эти задачи на себя. Код у нас в основном пишется с помощью ИИ-агентов вроде Claude Code и Cursor. От вас нужно не набирать код быстро, а аккуратно доводить задачу до конца и понимать, что именно вы сделали.

Какие задачи:

• Сайты и лендинги: вёрстка, правки, адаптация под телефоны, перенос с конструкторов вроде Тильды в код.

• Интерфейс внутренней платформы: экраны, таблицы, формы, доработки по готовому описанию.

• Боты, скрипты и автоматизации, в том числе с LLM.

• Мелкие баги в любом из проектов: воспроизвести, найти причину, исправить.

• Уборка кода, документация, тесты на готовую логику.

Кого мы ищем:

• Знаете хотя бы один язык (JavaScript, TypeScript, Python или другой) на уровне, достаточном, чтобы читать чужой код и понимать, что он делает.

• Делали хотя бы один живой проект: сайт, бота или автоматизацию, которой кто-то пользуется.

• Пользуетесь ИИ-инструментами в работе и проверяете то, что они написали, а не принимаете всё подряд.

• Понимаете основы: клиент и сервер, как работает запрос, зачем нужны git и ветки.

• Спокойно переключаетесь между проектами и быстро разбираетесь в незнакомом коде.

• Сначала разбираетесь в задаче, потом делаете.

• Честно говорите, когда не понимаете или ошиблись, и задаёте вопросы вовремя.

Будет плюсом:

• React, Next.js или TypeScript.

• Tailwind и адаптивная вёрстка.

• Опыт с Тильдой или другими конструкторами сайтов.

• Свой VPS, Docker, опыт выкатки проекта.

• Боты и автоматизации с LLM API.

Как устроена работа:

• Каждая задача в отдельной ветке и через pull request.

• Сначала простые и хорошо проверяемые задачи, потом сложнее по мере того, как растёт опыт.

• Внутренние правила и договорённости записаны, их не нужно угадывать.

Что мы даём:

• Разные реальные проекты, которыми пользуются люди, а не учебные задания.

• Full-time или part-time, удалённо или гибрид.

• Оплата обсуждается по уровню и растёт вместе с задачами.

В отклике покажите проект, который вы сделали сами, и расскажите один случай, когда ИИ написал что-то не то, а вы это заметили.

hh.ru
мтс, технический блок

Senior NLP Enginee

мтс, технический блокНа сервисе с: 24.09.26 14:35
Зарплата не указанаРоссияМоскваГибрид

MWS AI – это часть экосистемы МТС Web Services, где создаются AI-решения будущего. Здесь мы разрабатываем современные AI-решения для различных сфер: от банковской до медицины и телекома. Мы стремимся к инновациям в области речевого ИИ, видеоаналитики и Gen AI: активно занимаемся исследованиями и публикуем научные статьи. В MWS AI вы найдете профессиональное сообщество единомышленников и возможности для реализации прорывных проектов.

Сейчас мы ищем ML инженера в команду Gen AI, который поможет превратить наши исследования в передовые продукты для бизнеса.

В этой роли вы будете:

  • Разрабатывать NLP-компоненты для автоматизации службы клиентской поддержки: классификацию, извлечение сущностей, поиск, RAG и агентские сценарии

  • Дообучать и адаптировать ML модели, готовить данные для обучения и разметки

  • Выстраивать оценку качества: метрики, «золотые» сеты, анализ ошибок, статистически корректное сравнение версий, связь ML-метрик с бизнес-метриками

  • Выводить модели в production, проводить бенчмарки latency и throughput

  • Следить за публикациями, быстро проверять идеи через MVP и доводить удачные до production-ready кода

  • Участвовать в код-ревью и технических обсуждениях, менторить младших коллег

Требования:

  • Python на уровне промышленной разработки: ООП, генераторы и контекстные менеджеры, профилирование, unit-тесты, type hinting

  • Уверенная база в ML и DL: функции потерь, регуляризация, кросс-валидация, работа с дисбалансом классов, оптимизаторы

  • Глубокое понимание трансформеров, механизма внимания, токенизации, transfer learning и fine-tuning

  • Практический опыт с PyTorch и экосистемой Hugging Face (Transformers, Trainer, PEFT); Mixed Precision, gradient accumulation и checkpointing, обучение на нескольких GPU (DDP)

  • Практика работы с LLM: промпт-инжиниринг, zero/few-shot, стратегии генерации, построение RAG-систем

  • Опыт вывода моделей в прод: упаковка модели в сервис, ONNX Runtime, квантование (FP16/INT8), развертывание через vLLM или Triton, понимание KV-кэша и PagedAttention

  • Умение выстроить валидацию: метрики классификации и генерации, метрики RAG, статистическое сравнение моделей, ablation study

  • Инженерная база: Git (rebase, MR, CI/CD в GitLab), Docker, воспроизводимые эксперименты (конфиги через Hydra или аналог, трекинг в ClearML или W&B)

  • Умение готовить данные к разметке, писать однозначные инструкции для асессоров и интерпретировать метрики согласия

  • Самостоятельность в условиях неопределенности: декомпозиция задачи, оценка сроков и рисков, аргументированная защита технических решений

Желаемый опыт:

  • От 3 лет в NLP

  • NLP-проекты полного цикла, выведенные в прод: от данных и бейзлайна до мониторинга

  • Построение RAG-систем или агентских сценариев для реальных пользователей

  • Реализация методов из статей, в том числе без официального кода

  • Менторство младших коллег и регулярное код-ревью

Будет плюсом:

  • Синтез обучающих данных с помощью LLM, пайплайны LLM-as-a-judge

  • Проектирование агентских систем: память, function calling, гардрейлы; методы борьбы с галлюцинациями и uncertainty estimation

  • Мониторинг моделей в проде: детекция data drift и concept drift

  • Active Learning и Weak Supervision; знание Cohen's Kappa и альфы Криппендорфа

  • Знание статистики: проверка гипотез, доверительные интервалы, бутстрэп

  • Профильное высшее образование

  • Публикации, выступления на конференциях и митапах, участие в соревнованиях

  • Английский на уровне чтения статей и технического письма

Что мы предлагаем:

  • 5/2, гибридный формат, гибкое начало дня.
  • Оклад + квартальные и годовые бонусы.
  • Комфортный офис в 10 минутах пешком от метро Таганская.
  • ДМС со стоматологией, страхование при поездках за рубеж, страхование жизни.
  • Участие в конференциях и митапах, обучение за счет компании.
  • Бесплатная мобильная связь.
  • Специальные предложения от партнеров и друзей МТС.

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.