Москва, ул. Верхоянская, 18к2

Парсеры
и сбор данных

Парсеры — то, с чего начинались все наши платформы. Мы собираем данные для собственных сервисов каждый день, поэтому знаем, где источник врёт, где меняется разметка и как держать сбор годами, а не одну неделю. Под задачу пишем отдельный сборщик.

с 2002 пишем парсеры
под задачу а не готовая коробка
свои платформы на этих данных
Границы задачи

Что мы собираем,
а что не станем

Разговор про сбор данных лучше начинать с границ — так обе стороны экономят время. Мы работаем с тем, что источник показывает всем: открытые страницы, публичные каталоги, цены на витрине, справочники организаций. Это те же данные, которые видит любой посетитель, только собранные и приведённые в порядок.

Персональные данные, закрытые разделы и содержимое за авторизацией — не наша работа. Если задача упирается в них, мы говорим об этом сразу, а не выясняем на середине проекта, когда бюджет уже потрачен.

Обычные задачи

  • мониторинг цен и наличия у конкурентов — регулярно, с историей изменений;
  • наполнение или сверка собственного каталога;
  • отраслевые базы: организации, площадки, сайты по теме и региону;
  • поиск клиентов по сегменту — то, что стоит за Windexa;
  • регулярные выгрузки в вашу систему, чтобы данные не переносили руками.

За это не берёмся

  • персональные данные людей;
  • содержимое, закрытое авторизацией или платной подпиской;
  • обход защиты там, где источник явно против сбора;
  • задачи, где источника данных попросту не существует — это видно на постановке, и мы скажем об этом сразу.
Что собираем

Данные, которые
можно использовать

Каталоги и товары Ассортимент, характеристики, наличие — по отрасли или по конкретным площадкам. Полезно и для анализа рынка, и для наполнения собственного каталога.
Цены и мониторинг Регулярное отслеживание цен: видно, кто и когда поменял. Смысл не в срезе на сегодня, а в истории — она показывает логику конкурента, а не одну его цифру.
Сборщики лидов Контакты и обращения по сегменту — то же, что стоит за нашей платформой Windexa. Если готового источника нет, сборщик пишется под вашу нишу отдельно.
Отраслевые базы Организации, площадки, сайты по тематике и региону. Нужны для анализа рынка, поиска партнёров и оценки конкуренции перед выходом в новый регион.
Регулярность Разовая выгрузка или сбор по расписанию. Выбор зависит от того, как быстро данные устаревают: цены живут дни, справочники — месяцы.
Форматы Excel, CSV, запись в базу, выгрузка в вашу CRM или по API. Формат обсуждается до начала — он влияет на то, как устроен сам сбор.
Очистка Дубли, мусор, битые записи, разнобой в единицах измерения. Данные приходят в рабочем виде, а не «как получилось со страницы».
Поддержка Источник поменял вёрстку — чиним, сбор продолжается. Это самая недооценённая часть работы и главная причина, по которой самописные парсеры умирают через месяц.
Из практики

Почему сбор данных
перестаёт работать

Написать парсер несложно. Сложно, чтобы он работал через год.

Источник поменял вёрстку

Самая частая причина. Сайт обновили, разметка поехала — сборщик продолжает работать и складывать пустоту. Без проверок качества это замечают через недели, когда решения уже приняты по мусору.

Данные собрались, но кривые

Цена без копеек, цена со скидкой вместо обычной, единицы измерения вперемешку. Формально сбор работает, фактически данными нельзя пользоваться.

Слишком жадный обход

Сборщик бьёт по источнику так, что тот начинает отвечать ошибками или блокирует. Аккуратный темп — не вежливость, а условие того, что сбор проживёт долго.

Защита от автоматики

Капчи, лимиты, проверки поведения. Часть источников закрывается целенаправленно — это оценивается на постановке, а не выясняется в процессе.

Никто не следит

Парсер написали, запустили и забыли. Через полгода выясняется, что половина источников отвалилась, а отчёты всё это время строились по остаткам.

Выросли объёмы

То, что работало на тысяче страниц, встаёт на миллионе. Архитектуру сбора приходится закладывать сразу под тот объём, до которого задача дорастёт.

Порядок работ

Как это устроено

1

Постановка

Что собираем, откуда, как часто и в каком виде нужен результат. Здесь же оцениваем, отдаёт ли источник данные вообще — и если нет, говорим об этом до, а не после.

несколько дней
2

Прототип

Собираем небольшой объём и показываем: то ли это, что вы ждали. На этом шаге почти всегда выясняется, что нужно чуть другое, — и это нормально, пока не написан весь сбор.

1–2 недели
3

Запуск

Ставим сбор на расписание, настраиваем выгрузку в нужном формате и проверки качества — они и ловят момент, когда источник поменялся.

по объёму
4

Сопровождение

Следим за источниками и чиним, когда те меняются. Именно этот пункт отличает работающий сбор от парсера, который когда-то запустили.

постоянно
Стоимость

Сколько стоит парсер

Два формата: собрать данные или построить систему, которая собирает их сама.

от 20 000 ₽ парсер под задачу
от 50 000 ₽ расширенный, с обвязкой
сопровождение считается отдельно

Парсер под задачу — от 20 000 ₽

  • источник, набор полей и формат выгрузки — под конкретную задачу;
  • разовый сбор или запуск по расписанию;
  • выгрузка в Excel, в базу или по API — как удобно принимающей стороне;
  • проверка данных на полноту перед сдачей: собранное «почти всё» хуже, чем ничего.

Подходит, когда нужны сами данные: каталог, цены конкурентов, отраслевая база.

Расширенный — от 50 000 ₽

  • всё, что в базовом;
  • обвязка: хранение, регулярный запуск, контроль сбоев и уведомления;
  • детализированная статистика по сборам — что собралось, что изменилось, где источник начал отдавать меньше;
  • обогащение контактов — данные из источника дополняются тем, чего в нём нет.

Подходит, когда данные нужны постоянно и на них завязан процесс, а не разовое решение.

Дальше цена зависит от числа источников, объёма, периодичности сбора и того, насколько источник сопротивляется автоматическому обходу: сайт, отдающий данные спокойно, и сайт с защитой от автоматики — это разная работа при одинаковом результате.

Сопровождение считается отдельно. Именно оно отличает работающий сбор от парсера, который когда-то запустили: источники меняют вёрстку, и без присмотра сбор молча ломается.

Частые вопросы

О чём спрашивают
про сбор данных

Это законно?

Мы собираем то, что источник показывает всем: открытые страницы, публичные каталоги, цены на витрине. Персональные данные, закрытые разделы и содержимое за авторизацией — не наша работа.

Если задача упирается в такие данные, мы говорим об этом сразу, а не выясняем на середине проекта.

Чем ваш парсер лучше готовой программы?

Готовая программа рассчитана на типовой сайт и ломается на нетиповом. Мы пишем сборщик под конкретный источник и конкретную задачу.

А главное — сопровождаем его. Разовый сбор можно сделать чем угодно; сбор, который работает год, требует, чтобы кто-то чинил его после каждого изменения на стороне источника.

Что будет, когда источник поменяет вёрстку?

Это происходит регулярно и является нормальной частью жизни любого сбора. У нас на такие изменения стоят проверки: если структура данных поехала, мы видим это по контролю качества, а не по жалобе клиента через месяц.

Починка входит в сопровождение.

А если источник закрывается от парсеров?

Часть источников защищается — капчами, лимитами, блокировками. Мы оцениваем это на этапе постановки и честно говорим, что реально, что дорого, а что не выйдет вообще.

Обещать сбор с источника, который его не отдаёт, — значит взять деньги за заведомо не решаемую задачу.

В каком виде я получу данные?

Как удобно: Excel или CSV, если данные смотрит человек; выгрузка в вашу базу или CRM, если их обрабатывает система; API, если нужно забирать по запросу.

Формат обсуждается до начала работ, потому что он влияет на то, как устроен сам сбор.

Можно собрать один раз, без подписки?

Да, разовая выгрузка — обычный формат. Учтите только, что данные устаревают: цены и наличие живут дни, каталоги — недели, справочники организаций — месяцы.

Если решение по ним будет приниматься через полгода, разумнее сразу ставить сбор на расписание.

Сколько стоит парсер?

Парсер под задачу — от 20 000 ₽: источник, набор полей, формат выгрузки, разовый сбор или запуск по расписанию.

Расширенный — от 50 000 ₽: с обвязкой (хранение, регулярный запуск, контроль сбоев), детализированной статистикой по сборам и обогащением контактов.

Дальше цена зависит от числа источников, объёма и того, насколько источник сопротивляется автоматическому обходу. Сопровождение считается отдельно — источники меняются, и без присмотра сбор молча ломается.

Сколько это занимает?

Прототип на небольшом объёме — обычно одна-две недели: мы показываем первые данные, чтобы вы убедились, что собирается именно то, что нужно.

Полный запуск зависит от объёма и от того, сколько источников в работе.

Зачем мне парсер, если я не занимаюсь SEO?

Сбор данных к SEO отношения не имеет — это отдельная линия работ. Мониторинг цен конкурентов, наполнение каталога, отраслевые базы, поиск клиентов по сегменту: всё это задачи бизнеса, а не поискового продвижения.

Опишите задачу по сбору данных

Ответим, реально ли собрать и сколько это займёт. Или позвоните: +7 (495) 777-34-90
Нажимая кнопку, вы даёте согласие на обработку персональных данных и принимаете политику обработки данных