Сбор, нормализация и проверка публично доступных ссылок из поисковой выдачи для исследований, каталогизации и аналитики.
English · Українська · 中文 · עברית
Независимый продукт. Проект не связан с Google LLC, Max, WhatsApp, Telegram или ZennoPoster и не одобрен, не спонсируется и не сертифицирован ими. Упоминания названий нужны только для описания совместимости и назначения.
Self-Correcting Public Link Parser — коммерческое решение для обработки публично доступных результатов поиска и построения структурированных наборов ссылок. Его задача — помочь исследовательским, аналитическим и контент-командам собирать открытые URL, нормализовать их, удалять дубли и контролировать качество результата.
Продукт предназначен для законной работы с публичными ссылками: например, для каталога публичных сообществ, исследования открытых источников, анализа собственной поисковой видимости или подготовки тематических подборок.
Ниже — подробная, но безопасная схема рабочего процесса. Продукт не обходит авторизацию, CAPTCHA, технические защиты или ограничения источников.
Перед запуском задаются:
- тематика, регион и языки поиска;
- набор разрешённых доменов или типов публичных страниц;
- список исключений: приватные зоны, нерелевантные домены, запрещённые категории;
- лимиты частоты, глубины и объёма обработки;
- требования к результату: CSV, JSON, таблица, очередь на последующую модерацию.
На этом этапе фиксируется правовое основание и проверяется, что сценарий соответствует условиям источников, robots.txt там, где он применим, и установленным ограничениям скорости.
Семантика формируется из согласованного списка ключей или из собственных исследовательских данных клиента. Для каждой темы создаётся очередь поисковых задач:
- исходная фраза;
- язык и регион;
- целевые домены/паттерны URL;
- приоритет;
- статус выполнения;
- дата последней обработки.
Очередь позволяет выполнять сбор последовательно, возобновлять безопасно остановленную задачу и не повторять уже обработанные комбинации.
Система обрабатывает только доступные без авторизации результаты. Для каждого запроса она соблюдает настраиваемые паузы, ограничения параллельности и таймауты. Если источник возвращает запрет, защитную страницу, CAPTCHA или требует входа, такая попытка фиксируется и останавливается, а не обходится.
Это нужно, чтобы не создавать лишнюю нагрузку на источник и не превращать сбор в обход технических мер.
Из доступной страницы извлекаются только необходимые публичные поля:
- URL результата;
- заголовок;
- краткий текстовый фрагмент, если он открыт;
- домен;
- поисковый запрос и дата обнаружения.
Сырые HTML-страницы и лишние персональные данные не должны включаться в итоговый набор, если они не нужны для согласованной цели.
Каждая ссылка приводится к единому виду:
- удаляются технические метки и известные tracking-параметры, когда это не меняет ресурс;
- унифицируются протокол, домен и завершающий
/; - отделяются redirect-URL поисковой системы от конечного адреса;
- проверяется, что URL соответствует разрешённым правилам и не ведёт в приватную/служебную зону.
Нормализация делает результаты сопоставимыми и уменьшает число ложных дублей.
Система сравнивает канонический URL, домен и правила эквивалентности. Повторяющиеся ссылки не создают новые записи: у существующей записи обновляются дата обнаружения и источник запроса.
Дополнительно выполняются проверки:
- ссылка синтаксически корректна;
- домен не находится в stop-list;
- страница не является страницей входа, ошибкой или закрытым ресурсом;
- тематика соответствует согласованному паттерну;
- результат не нарушает заданные фильтры.
«Самокоррекция» в публичном описании означает не обход защит, а контроль качества парсинга. Когда меняется структура доступной выдачи, система может:
- обнаружить снижение доли валидных ссылок;
- записать техническую причину: пустой результат, изменившийся паттерн, недоступная страница;
- переключить заранее утверждённый профиль извлечения;
- поставить задачу на ручную проверку, если уверенность недостаточна;
- сохранять метрики качества до и после изменения правила.
Никакие новые способы доступа или обхода ограничений автоматически не создаются.
Перед выгрузкой набор проходит финальную очистку:
- удаляются повторы и ошибочные URL;
- добавляется происхождение записи: запрос, дата, тип источника;
- по необходимости формируются категории и теги;
- сохраняется журнал фильтрации — почему ссылка попала в выборку или была исключена.
Результаты можно передать в согласованном формате: CSV, JSON или таблица. Для повторяющихся задач применяются плановые проверки доступности и обновление статуса, а не бесконтрольное накопление устаревших ссылок.
- Структурированный список публичных ссылок с происхождением и датой обнаружения.
- Меньше дублей и нерелевантных страниц.
- Повторяемый процесс со скоростными лимитами и журналом качества.
- Понятная база для последующей ручной модерации, исследований или разрешённой коммуникации.
- Настраиваемые поисковые очереди и тематические наборы ключей.
- Фильтрация доменов, URL-паттернов, языков и регионов.
- Нормализация, дедупликация и классификация ссылок.
- Контроль качества и журналирование причин исключения.
- Экспорт в согласованных форматах.
- Поддержка интеграционных сценариев с ZennoPoster — при наличии прав и в пределах правил источников.
- Только публично доступные URL и данные, необходимые для согласованной цели.
- Никакого обхода CAPTCHA, авторизации, paywall, anti-bot, rate limits, технических защит или запретов источника.
- Не использовать для спама, массовых рассылок, несанкционированного профилирования или сбора персональных данных.
- Клиент самостоятельно отвечает за соблюдение условий источников, прав на базы данных, требований к рекламе, защите данных и законодательства своей юрисдикции.
- Telegram: @TheBotsLab
- E-mail: BotsLab@proton.me
Исходный оффер: ZennoClub — «Самокорректирующийся парсер google».
Иллюстрация в assets/ предоставлена в материале оффера и временно используется как product visual. Она содержит сторонние товарные знаки и формулировки автора оффера; это не означает связь или одобрение со стороны соответствующих правообладателей. Обложка будет заменена нейтральной версией.
В репозитории размещена только публичная документация. Здесь нет ключевых баз, поисковых очередей клиентов, прокси-реквизитов, токенов, аккаунтов, логов, персональных данных или рабочего внутреннего кода.
