Говорухин Пётр Алексеевич

Python-разработчик - парсинг и сбор данных (Middle/Middle+)

Ищем Python-разработчика в команду для создания и поддержки системы сбора данных из открытых источников: сайтов, поисковых сервисов, социальных сетей и т.д.

Говорухин Пётр Алексеевич На сервисе с: 21.09.26 12:16

180k–250k ₽РоссияМоскваОфис

Ищем Python-разработчика в команду для создания и поддержки системы сбора данных из открытых источников: сайтов, поисковых сервисов, социальных сетей и т.д.
Предстоит разрабатывать парсинг-сервисы, приводить данные к единому формату и сохранять их в базы данных и файловое хранилище. Планируем работать с более 15 источников и объёмом от 1 млн профилей.
Зарплата: 180 000–230 000 ₽ на руки в месяц, по результатам технического собеседования. Полная занятость, офис.

Что предстоит делать:

- Разрабатывать сборщики на Python: получать данные через API и HTTP-запросы, извлекать информацию из HTML, использовать браузерную автоматизацию.
- Собирать доступные сведения о профилях, публикациях и активности, загружать фотографии и другие материалы.
- Проверять и нормализовать данные, обрабатывать пропуски, предотвращать дубли.
- Реализовывать запись и обновление данных в PostgreSQL, связывать записи с файлами в объектном хранилище.
- Сохранять источник и время получения данных, фиксировать изменения при повторном сборе.
- Настраивать регулярные запуски, обработку ошибок и повторные попытки.
- Поддерживать сборщики при изменении источников, писать тесты и добавлять логи для диагностики.

Что важно:

- Практический опыт разработки на Python и реализации сборщиков или интеграций с внешними API.
- Понимание HTTP, JSON, HTML, пагинации, таймаутов и ограничений частоты запросов.
- Опыт с requests, HTTPX или aiohttp, а также BeautifulSoup, lxml или Scrapy. Владение всеми библиотеками одновременно не требуется.
- Умение пользоваться DevTools браузера для изучения страниц и сетевых запросов.
- Уверенный базовый SQL: выборки, связи таблиц, вставка и обновление данных. Желателен опыт PostgreSQL.
- Понимание того, как проверять результат сбора и избегать повторных записей.
- Работа с Git, опыт отладки и написания тестов, например на pytest.
- Умение реализовывать согласованные решения, обсуждать вопросы и работать с ревью.
- Playwright или Selenium.
- Асинхронный Python и asyncio.

Будет плюсом:

- SQLAlchemy и Alembic.
- Docker, Linux, запуск задач по расписанию.
- Celery, RQ или другие инструменты фоновой обработки.
- S3-совместимые хранилища.
- Опыт длительного сопровождения нескольких источников.

Похожие вакансии Python

Сайты компаний
N

Senior Software Engineer (Token Factory)

nebiusНа сервисе с: 06.10.26 01:22↑ Вакансия с автоподнятием
Зарплата не указанаВеликобританияГерманияНидерландыЧехияИзраильAmsterdam

About Nebius:

Nebius is leading a new era in cloud infrastructure for the global AI economy. We are building a full-stack AI cloud platform that supports developers and enterprises from data and model training through to production deployment, without the cost and complexity of building large in-house AI/ML infrastructure.

Built by engineers, for engineers. From large-scale GPU orchestration to inference optimization, we own the hard problems across compute, storage, networking and applied AI.

Listed on Nasdaq (NBIS) and headquartered in Amsterdam, we have a global footprint with R&D hubs across Europe, the UK, North America and Israel. Our team of 1,500+ includes hundreds of engineers with deep expertise across hardware, software and AI R&D.

The role

This role is for Nebius AI R&D, a team focused on applied research and the development of AI-heavy products. Examples of applied research that we have recently published include:

  • investigating how test-time guided search can be used to build more powerful agents;
  • dramatically scaling task data collection to power reinforcement learning for SWE agents;
  • maximizing efficiency of LLM training on agentic trajectories.

One example of an AI product that we are deeply involved in is Nebius Token Factory — an inference and fine-tuning platform for AI models.

This role will require expertise in distributed systems to build large-scale LLM training platform.

Your responsibilities will include: 

  • Designing and developing LLM training platform.
  • Maintaining our ML infrastructure, ensuring optimal performance, scalability and reliability.
  • Improving job scheduling strategies to minimize resource fragmentation. 

We expect you to have:

  • 5+ years of professional software development experience.
  • Strong software engineering skills (we mostly use Python and Go).
  • Proficiency in contemporary software engineering approaches, including CI/CD, version control and unit testing.
  • Experience with developing web services.
  • A commitment to maintaining extreme rigor in all job-related activities.

Nice to have:

  • Previous experience working with language models or other similar NLP technologies.
  • A track record of building and delivering products (not necessarily ML-related) in a dynamic startup-like environment.
  • Strong engineering skills, including experience in developing large distributed systems or high-load web services.
  • Open-source projects that showcase your engineering prowess.

Benefits & Perks:

  • Competitive compensation
  • Career growth and learning opportunities
  • Flexibility and ownership
  • Collaborative and innovative culture
  • Opportunity to work on impactful AI projects
  • International environment and talented teams

What's it like to work at Nebius:

Fast moving - Bold thinking - Constant growth - Meaningful impact - Trust and real ownership - Opportunity to shape the future of AI 

Equal Opportunity Statement:

Nebius is an equal opportunity employer. We are committed to fostering an inclusive and diverse workplace and to providing equal employment opportunities in all aspects of employment. We do not discriminate on the basis of race, color, religion, sex (including pregnancy), national origin, ancestry, age, disability, genetic information, marital status, veteran status, sexual orientation, gender identity or expression, or any other characteristic protected by applicable law.

Applicants must be authorized to work in the country in which they apply and will be required to provide proof of employment eligibility as a condition of hire. 

If you need accommodations during the application process, please let us know.

Сайты компаний
яндекс
Зарплата не указанаРоссияМосква

Вам предстоит работать в команде, которая создаёт инструменты разработки и внутреннюю платформу. Наша главная цель — повышать эффективность инженеров за счёт улучшения процессов разработки: от написания кода до установки на флот и тестовые стенды. Мы адаптируем инфраструктуру Яндекса под специфичные нужды бизнеса автономного транспорта.

Оптимизация CI и распределённой сборки

Вы будете отвечать за скорость сборок и проверок в CI на стадии прекоммита. Предстоит делать сборочный граф проекта оптимальным, развивать и настраивать систему распределённой сборки, используя обширный кластер серверов и современные облачные технологии.

Создание инструментов разработки

Мы делаем много тулинга вокруг компилятора: например, организуем и развиваем системы статической проверки кода. Вы будете создавать технологии автоматизации, которые избавляют разработчиков от рутины и повышают качество кодовой базы.

Внедрение автомобильных стандартов безопасности

Мы ведём крупный проект по внедрению инструментов для функциональной безопасности и поддержке стандарта ASIL. Это уникальная возможность поработать с практиками safety-critical-систем на масштабе Яндекса.

Проектирование и реализация компонентов платформы

Вам предстоит снижать сложность системы, анализировать узкие места, участвовать в доработке инфраструктуры, а также улучшать или создавать с нуля её новые части.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

* Готовы писать на Python — основном языке разработки наших инструментов
* Стремитесь выбирать хорошие архитектурные решения, писать качественный код и покрывать его тестами
* Способны работать на стыке технологий, глубоко погружаться в инфраструктуру и постоянно изучать новое

* Знаете C++ или Go
* Знакомы с системами сборки (Make, CMake, Bazel) и выполняли сборку чужого исходного кода
* Понимаете принципы работы компиляторов или работали со статическими анализаторами кода

Сайты компаний
яндекс

Разработчик бэкенда в команду ОС SONiC

яндексНа сервисе с: 11.06.26 23:58↑ Вакансия с автоподнятием
Зарплата не указанаРоссияМосква

Сервисы Яндекса работают бесперебойно благодаря сетевой инфраструктуре. Десятки тысяч сетевых устройств участвуют в маршрутизации и фильтрации десятков терабит трафика в секунду. Чтобы управлять этой сетью максимально гибко, мы развиваем собственную сетевую операционную систему на базе открытого проекта SONiC — Software for Open Networking in the Cloud.

SONiC — это Linux для сетевых устройств. Эта ОС позволяет нам взять «железо» у производителя и превратить его в устройство с нужными нам функциями. Мы адаптируем ядро, оптимизируем компоненты и собираем дистрибутив так, чтобы он идеально работал с нашими специфическими задачами. Мы создаём прозрачную инфраструктуру: пишем собственные демоны и утилиты, которые работают прямо на коммутаторе и позволяют нашим мониторингам и системам автоматизации эффективно управлять устройством.

Мы ищем инженера, который будет развивать нашу внутреннюю сборку SONiC, чтобы сетевая ОС была надёжной.

Если вам интересно заниматься сетевыми операционными системами, работать на стыке системного программирования и сетей, делать инструменты для управления и автоматизации сети Яндекса, то вам у нас понравится. Опыт с SONiC не обязателен — главное иметь сильную инженерную базу, остальному научим.

Развитие собственной сборки SONiC

Вам предстоит развивать и поддерживать собственную сборку SONiC для сетевого оборудования дата-центров Яндекса: интегрировать её с новым «железом», разбираться с vendor stack / BSP и обеспечивать стабильную работу в продакшене.

Отладка и разбор сложных системных проблем

Нужно будет разбираться с проблемами на стыке Linux, networking и hardware: анализировать нестандартное поведение системы, искать причины неисправностей и аккуратно внедрять изменения под нагрузкой.

Интеграция с инфраструктурой Яндекса

Вы будете интегрировать сетевую ОС с внутренней экосистемой управления инфраструктурой и участвовать в развитии инструментов и автоматизации сетевой платформы.

Развитие сборочной и эксплуатационной инфраструктуры

Часть задач связана с развитием инфраструктуры сборки SONiC, поддержанием стабильности сборок и улучшением внутренних инженерных процессов сетевой ОС.

Работа с продакшен-инфраструктурой

Важная часть роли — развитие и эксплуатация живой сетевой инфраструктуры: безопасное внедрение изменений, повышение надёжности и сопровождение решений в продакшене.

Подписывайтесь на телеграм-канал Yandex Infrastructure, чтобы узнать больше о том, как мы делаем внутреннюю инфраструктуру Яндекса.

* Работали с продакшен-системами и решали сложные технические проблемы
* Уверенно владеете Python или Go: в идеале готовы писать на обоих языках
* Хорошо понимаете внутреннее устройство Linux: сеть, процессы, память, взаимодействие компонентов системы
* Знаете принципы построения отказоустойчивых и распределённых систем

* Работали с Linux networking stack и инструментами отладки: perf, strace, gdb и подобными
* Работали с сетевым оборудованием, занимались его первичной настройкой и обновлением
* Разбираетесь в устройстве компьютерных сетей и протоколах маршрутизации — в частности, BGP
* Имеете опыт чтения или написания кода на C/C++: внутри SONiC есть низкоуровневые компоненты на этих языках
* Понимаете принципы контейнеризации и работали с Docker: архитектура SONiC построена на контейнерах
* Интересуетесь infrastructure / system engineering и задачами на стыке networking и backend

HireSeeker собирает вакансии со всех площадок и присылает только релевантные. Бесплатно.