S/04сбор данных

Парсинг сайтов и разработка парсеров под ключ

Парсинг сайтов под ключ — это разработка программы, которая по расписанию собирает публичные данные с нужных вам сайтов и складывает их в базу, таблицу или отдаёт через API. Мы берём на себя всё: разбор структуры страниц, обход антибот-защиты, ротацию прокси, проверку качества выгрузки и поддержку парсера, когда сайт меняет вёрстку.

Обсудить задачуРазбор источников бесплатный, оценка за 1 день, ответ в течение 2 часов

Какие задачи закрываем

Цены конкурентов собираются руками

Сотрудник раз в неделю обходит десяток сайтов и вбивает цены в таблицу. Данные устаревают в тот же день, а история изменений не копится. Парсер делает то же самое каждый час и хранит все срезы.

Нужны данные с маркетплейсов

Ассортимент, остатки, цены и отзывы на Wildberries, Ozon и Avito нужны регулярно и в одном формате. Собираем карточки и отзывы по вашим категориям и артикулам, приводим к единой схеме и обновляем по расписанию.

Каталог поставщика в неудобном виде

Поставщик отдаёт номенклатуру только на своём сайте, без выгрузки и без API. Забираем каталог целиком — названия, характеристики, картинки, цены — и кладём в вашу базу или Google Таблицу в нужных полях.

Старый парсер сломался и не чинится

Скрипт от фрилансера работал два месяца, потом сайт поменял вёрстку — и починить некому. Разбираем существующий код, переписываем хрупкие места и берём парсер на поддержку с мониторингом падений.

Сайт отдаёт капчу и банит по IP

После сотни запросов начинаются 403, капча и пустые страницы. Лечится ротацией резидентных прокси, разумной скоростью запросов и рендерингом страниц в браузере там, где без него данные просто не отдаются.

Данные нужны внутри системы, а не файлом

Выгрузка в CSV, которую кто-то руками заливает в 1С или BI, убивает весь смысл автоматизации. Отдаём поток данных сразу в PostgreSQL, Google Таблицы или через HTTP API, который читает ваша система.

Как идёт работа

  1. Разбор источников

    1–2 дня

    Смотрим каждый сайт из списка: что лежит в HTML, что подгружается отдельными запросами, какая стоит защита. Сразу говорим, какие поля реально собрать, а какие нет.

  2. Прототип и образец данных

    2–4 дня

    Собираем рабочий прототип на одном разделе и присылаем настоящую выгрузку — 100–200 строк. Вы проверяете поля и качество до того, как начнётся основная разработка.

  3. Основная разработка и обход защиты

    5–10 дней

    Расширяем парсер на весь объём: ротация прокси, повторы, лимиты скорости, дедупликация, проверки целостности. Данные пишутся в хранилище с историей, а не перезаписываются поверх.

  4. Расписание и доставка

    1–3 дня

    Ставим запуск по расписанию, настраиваем выгрузку в базу, таблицу или API и уведомления о сбоях в Telegram или на почту. Показываем, как перезапустить задачу самому.

  5. Передача и поддержка

    1 день

    Отдаём исходный код, документацию и доступы после полной оплаты. Дальше месяц гарантии, а при желании — поддержка: следим за запусками и чиним парсер при смене вёрстки.

Стек

Стек выбираем по тому, как устроен сайт: где данные приходят обычными HTTP-запросами, там не поднимаем браузер — это в разы дешевле и стабильнее. Браузерный рендеринг и резидентные прокси включаем только там, где без них выгрузки не будет.

  • Python
  • Scrapy
  • Playwright
  • httpx
  • lxml / BeautifulSoup
  • PostgreSQL 16
  • Redis
  • Celery
  • FastAPI
  • Docker
  • Google Sheets API
  • резидентные и мобильные прокси

Сколько стоит

Один источник

от 60 000 ₽ / от $600

Один сайт или маркетплейс, до трёх типов страниц, выгрузка в CSV, Excel или Google Таблицу, запуск раз в сутки. Достаточно, чтобы начать следить за ценами конкурентов. Сильная антибот-защита двигает срок и цену вверх.

Мониторинг под задачу

от 150 000 ₽ / от $1 500

Несколько источников, приведённых к общей схеме, история цен и остатков, обход блокировок с ротацией прокси, выгрузка в вашу базу или через API, алерты о сбоях. Цену определяют число сайтов и частота обновления.

Поддержка и развитие

от 40 000 ₽ / от $400 в месяц

Мониторинг запусков, починка при смене вёрстки, добавление новых источников и полей, контроль свежести данных. Выделенный инженер, который знает ваш парсер, а не разбирается в нём заново каждый раз.

Цены указаны справочно и не являются публичной офертой (п. 1 ст. 437 ГК РФ). Итоговая стоимость, объём работ и сроки фиксируются в договоре или счёте после обсуждения задачи.

Кейс по теме

Парсер полезен ровно настолько, насколько удобно хранилище, в которое он пишет. Для сети HoReCa мы собрали учётную систему на AppSheet, где базой данных служат Google Таблицы: 20+ листов, 5 ролей доступа, 0 серверов. Тот же приём работает и для выгрузки парсера — данные приезжают туда, где люди уже умеют с ними работать.

Смотреть кейс AppSheet

Частые вопросы

Законно ли парсить чужой сайт?
Да, если это публичные данные, доступные без авторизации, и в них нет персональных данных. Мы собираем цены, характеристики товаров, тексты объявлений и отзывы в том виде, в каком их видит любой посетитель. Мы не обходим платный доступ и не лезем в закрытые разделы. Если задача выходит за эту границу, говорим об этом до старта, а не после.
Сколько стоит разработка парсера?
Один источник со стандартной выгрузкой — от 60 000 ₽ / от $600, мониторинг нескольких сайтов с историей и обходом блокировок — от 150 000 ₽ / от $1 500. Считаем по часам, ставка от 3 000 ₽ / от $30 в час, оплата 50% на старте и 50% при приёмке. Больше всего на цену влияет не количество полей, а сила защиты сайта.
Что будет, если сайт сменит верстку и парсер сломается?
Месяц после сдачи чиним бесплатно — это гарантия на всю переданную функциональность. Дальше есть поддержка от 40 000 ₽ / от $400 в месяц: мы мониторим каждый запуск, видим падение раньше вас и правим разбор страниц. Парсеры ломаются — это нормальная часть их жизни, поэтому в код закладываются проверки, которые отличают «сайт изменился» от «сайт лежит».
Как вы обходите капчу и блокировки по IP?
Ротацией резидентных и мобильных прокси, разумной скоростью запросов и повторением поведения обычного браузера. Где нужно — рендерим страницу целиком, где не нужно — обходимся HTTP-запросами, потому что это дешевле и стабильнее. Прокси можно взять наши или подключить ваш аккаунт у провайдера, трафик считается отдельно от разработки.
В каком формате я получу данные — Excel, JSON или API?
В любом из трёх, и это решается на старте. Чаще всего это таблица (Excel, CSV, Google Таблицы), запись напрямую в PostgreSQL или HTTP API, из которого ваша система забирает свежий срез. Схему полей согласуем на прототипе, до основной разработки: переделывать формат потом дороже.
Как часто можно обновлять данные?
От раза в сутки до раза в несколько минут — ограничение не в нас, а в сайте-источнике. Частые запросы быстрее приводят к блокировкам и требуют больше прокси, то есть дороже в эксплуатации. Для мониторинга цен обычно хватает 2–4 запусков в сутки, для остатков на маркетплейсе имеет смысл чаще.
Парсер будет программой у меня или сервисом на вашем сервере?
Как удобнее вам: разворачиваем на вашем сервере или на нашем с передачей доступов. Исходный код и документацию отдаём после полной оплаты, поэтому в любой момент можно перенести парсер куда угодно или передать другому подрядчику. Чаще выбирают вариант «крутится у нас, данные приезжают к вам» — тогда за прокси и обновления отвечаем мы.
Можно ли собирать данные из раздела, где нужна авторизация?
Да, если это ваш собственный аккаунт и вы имеете право на этот доступ: личный кабинет продавца на маркетплейсе, ваш аккаунт у поставщика, ваша аналитика. Чужие учётные записи мы не используем и платный доступ не обходим. Перед тем как строить парсер за логином, проверяем, нет ли официального API — он почти всегда дешевле и надёжнее.

Пришлите список сайтов

Посмотрим каждый источник, скажем, что реально собрать и чего собрать нельзя, и дадим оценку в часах и деньгах. Консультация бесплатная, ответ в течение 2 часов.

Обсудить задачу
Разработка парсеров под ключ — Corexy