Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

2 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Self-Correcting Public Link Parser

Product illustration supplied with the original offer

Сбор, нормализация и проверка публично доступных ссылок из поисковой выдачи для исследований, каталогизации и аналитики.

English · Українська · 中文 · עברית

Независимый продукт. Проект не связан с Google LLC, Max, WhatsApp, Telegram или ZennoPoster и не одобрен, не спонсируется и не сертифицирован ими. Упоминания названий нужны только для описания совместимости и назначения.

О продукте

Self-Correcting Public Link Parser — коммерческое решение для обработки публично доступных результатов поиска и построения структурированных наборов ссылок. Его задача — помочь исследовательским, аналитическим и контент-командам собирать открытые URL, нормализовать их, удалять дубли и контролировать качество результата.

Продукт предназначен для законной работы с публичными ссылками: например, для каталога публичных сообществ, исследования открытых источников, анализа собственной поисковой видимости или подготовки тематических подборок.

Как происходит сбор ссылок

Ниже — подробная, но безопасная схема рабочего процесса. Продукт не обходит авторизацию, CAPTCHA, технические защиты или ограничения источников.

1. Постановка задачи и правила сбора

Перед запуском задаются:

  • тематика, регион и языки поиска;
  • набор разрешённых доменов или типов публичных страниц;
  • список исключений: приватные зоны, нерелевантные домены, запрещённые категории;
  • лимиты частоты, глубины и объёма обработки;
  • требования к результату: CSV, JSON, таблица, очередь на последующую модерацию.

На этом этапе фиксируется правовое основание и проверяется, что сценарий соответствует условиям источников, robots.txt там, где он применим, и установленным ограничениям скорости.

2. Формирование очереди запросов

Семантика формируется из согласованного списка ключей или из собственных исследовательских данных клиента. Для каждой темы создаётся очередь поисковых задач:

  • исходная фраза;
  • язык и регион;
  • целевые домены/паттерны URL;
  • приоритет;
  • статус выполнения;
  • дата последней обработки.

Очередь позволяет выполнять сбор последовательно, возобновлять безопасно остановленную задачу и не повторять уже обработанные комбинации.

3. Получение публичной выдачи с ограничением скорости

Система обрабатывает только доступные без авторизации результаты. Для каждого запроса она соблюдает настраиваемые паузы, ограничения параллельности и таймауты. Если источник возвращает запрет, защитную страницу, CAPTCHA или требует входа, такая попытка фиксируется и останавливается, а не обходится.

Это нужно, чтобы не создавать лишнюю нагрузку на источник и не превращать сбор в обход технических мер.

4. Извлечение кандидатов

Из доступной страницы извлекаются только необходимые публичные поля:

  • URL результата;
  • заголовок;
  • краткий текстовый фрагмент, если он открыт;
  • домен;
  • поисковый запрос и дата обнаружения.

Сырые HTML-страницы и лишние персональные данные не должны включаться в итоговый набор, если они не нужны для согласованной цели.

5. Нормализация URL

Каждая ссылка приводится к единому виду:

  • удаляются технические метки и известные tracking-параметры, когда это не меняет ресурс;
  • унифицируются протокол, домен и завершающий /;
  • отделяются redirect-URL поисковой системы от конечного адреса;
  • проверяется, что URL соответствует разрешённым правилам и не ведёт в приватную/служебную зону.

Нормализация делает результаты сопоставимыми и уменьшает число ложных дублей.

6. Дедупликация и контроль качества

Система сравнивает канонический URL, домен и правила эквивалентности. Повторяющиеся ссылки не создают новые записи: у существующей записи обновляются дата обнаружения и источник запроса.

Дополнительно выполняются проверки:

  • ссылка синтаксически корректна;
  • домен не находится в stop-list;
  • страница не является страницей входа, ошибкой или закрытым ресурсом;
  • тематика соответствует согласованному паттерну;
  • результат не нарушает заданные фильтры.

7. Самокоррекция правил извлечения

«Самокоррекция» в публичном описании означает не обход защит, а контроль качества парсинга. Когда меняется структура доступной выдачи, система может:

  • обнаружить снижение доли валидных ссылок;
  • записать техническую причину: пустой результат, изменившийся паттерн, недоступная страница;
  • переключить заранее утверждённый профиль извлечения;
  • поставить задачу на ручную проверку, если уверенность недостаточна;
  • сохранять метрики качества до и после изменения правила.

Никакие новые способы доступа или обхода ограничений автоматически не создаются.

8. Проверка перед экспортом

Перед выгрузкой набор проходит финальную очистку:

  • удаляются повторы и ошибочные URL;
  • добавляется происхождение записи: запрос, дата, тип источника;
  • по необходимости формируются категории и теги;
  • сохраняется журнал фильтрации — почему ссылка попала в выборку или была исключена.

9. Выгрузка и актуализация

Результаты можно передать в согласованном формате: CSV, JSON или таблица. Для повторяющихся задач применяются плановые проверки доступности и обновление статуса, а не бесконтрольное накопление устаревших ссылок.

Результат для команды

  • Структурированный список публичных ссылок с происхождением и датой обнаружения.
  • Меньше дублей и нерелевантных страниц.
  • Повторяемый процесс со скоростными лимитами и журналом качества.
  • Понятная база для последующей ручной модерации, исследований или разрешённой коммуникации.

Возможности

  • Настраиваемые поисковые очереди и тематические наборы ключей.
  • Фильтрация доменов, URL-паттернов, языков и регионов.
  • Нормализация, дедупликация и классификация ссылок.
  • Контроль качества и журналирование причин исключения.
  • Экспорт в согласованных форматах.
  • Поддержка интеграционных сценариев с ZennoPoster — при наличии прав и в пределах правил источников.

Ограничения и ответственное использование

  • Только публично доступные URL и данные, необходимые для согласованной цели.
  • Никакого обхода CAPTCHA, авторизации, paywall, anti-bot, rate limits, технических защит или запретов источника.
  • Не использовать для спама, массовых рассылок, несанкционированного профилирования или сбора персональных данных.
  • Клиент самостоятельно отвечает за соблюдение условий источников, прав на базы данных, требований к рекламе, защите данных и законодательства своей юрисдикции.

Контакты

Источник и материалы

Исходный оффер: ZennoClub — «Самокорректирующийся парсер google».

Иллюстрация в assets/ предоставлена в материале оффера и временно используется как product visual. Она содержит сторонние товарные знаки и формулировки автора оффера; это не означает связь или одобрение со стороны соответствующих правообладателей. Обложка будет заменена нейтральной версией.

Public-safety boundary

В репозитории размещена только публичная документация. Здесь нет ключевых баз, поисковых очередей клиентов, прокси-реквизитов, токенов, аккаунтов, логов, персональных данных или рабочего внутреннего кода.

About

Public link collection, normalisation and quality control for compliant research workflows.

Topics

Resources

Security policy

Stars

Watchers

Forks

Releases

Packages

Contributors