помощь в парсинге определенного сайта

Тема в разделе "Решение различных задач по парсингу", создана пользователем Root, 10 мар 2010.

  1. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    Нет, такого атрибута нет.

    Сделайте несколько различных вариантов повторяющихся границ парсинга.
     
  2. redfox

    redfox New Member Пользователи

    Регистрация:
    18 фев 2013
    Сообщения:
    35
    Плохо. Придется на ПХП реализовывать :)
     
  3. kagorec

    kagorec Администратор Команда форума Администратор

    Регистрация:
    3 янв 2011
    Сообщения:
    4.442
    Адрес:
    Latvia
    В глобальную поиск-замена (сочетание клавишь shift+ctrl+r)
    PHP:
    re:<a([^<>]*)href="([^'"]+)"([^<>]*)nofollow([^<>]*)>|<nado>$2</nado>
    re:<a([^<>]*)nofollow([^<>]*)href="
    ([^'"]+)"([^<>]*)>|<nado>$3</nado>
    re:<a([^<>]*)href='
    ([^'"]+)'([^<>]*)nofollow([^<>]*)>|<nado>$2</nado>
    re:<a([^<>]*)nofollow([^<>]*)href='([^'"]+)'([^<>]*)>|<nado>$3</nado>
    Для повторяющиеся границы 1 укажите начало <nado> и конец </nado>
     
  4. redfox

    redfox New Member Пользователи

    Регистрация:
    18 фев 2013
    Сообщения:
    35
    Доктор, метод лечения не подошел пациенту :)
    Какие то маски поддерживаются при задании границ?
    По идее, вот такое бы сработало:
    <a(*)noffollow(*)>
    вместо (*) какая то маска.
     
  5. kagorec

    kagorec Администратор Команда форума Администратор

    Регистрация:
    3 янв 2011
    Сообщения:
    4.442
    Адрес:
    Latvia
    Выше перечисленные регулярные выражения хорошо справляются с выделением ссылок с nofollow
    При ссылке: <a href="sayt.ru/page.php" rel="nofollow">ankor</a>
    Результат: <nado>sayt.ru/page.php</nado>ankor</a>

    Если не получается, предоставьте адрес страницы (под хайдом)
     
  6. redfox

    redfox New Member Пользователи

    Регистрация:
    18 фев 2013
    Сообщения:
    35
    ОК.
    Скрытое содержимое:
    **Скрытое содержимое: доступно при наличии 1 постов.**
    noffollow может быть в начале или конце. тут как кто решит из создателей софта.
     
  7. kagorec

    kagorec Администратор Команда форума Администратор

    Регистрация:
    3 янв 2011
    Сообщения:
    4.442
    Адрес:
    Latvia
    Скрытое содержимое:
    **Скрытое содержимое: доступно при наличии 1 постов.**
    табы и переходы строки мешались, фиксим первой строкой замены
     
    Последнее редактирование: 4 фев 2015
  8. shtiljr

    shtiljr New Member Пользователи

    Регистрация:
    20 мар 2015
    Сообщения:
    1
    Привет. Я недавно приобрел программу и мне нужна помощь.
    Мне нужна спарсить статьи с одного блога.
    Я уже спарсил ссылки с этого блога. И не могу понять как настроить программу, чтобы она начала парсить контент по указанным ссылкам.
    Если не сложно намекните или дайте ссылку, где об этом можно прочесть. Заранее спасибо!
     
  9. Kreol

    Kreol Модератор Команда форума Модератор

    Регистрация:
    6 янв 2013
    Сообщения:
    2.666
    Здравствуйте!
    Вся основная информация тут: Ссылки недоступны для гостей
    Если нужны более детальные разъяснения. пишите на форум в соответствующие разделы с внятным ТЗ, что откуда и куда.
    Также можете заказать платную настройку у наших коллег Ссылки недоступны для гостей
     
  10. Александр Сео

    Александр Сео New Member Пользователи

    Регистрация:
    27 мар 2015
    Сообщения:
    9
    Добрый день! Подскажите пожалуйста как спарсить базу сайтов с miralinks_ru. Какими инструментами Content Downloader нужно пользоваться?
     
  11. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    Здравствуйте.

    Открыл главную страницу сайта Миралинкс и никакой базы сайтов там не увидел. Соответственно, не могу помочь вам в решении данного вопроса.

    Следует указывать, что именно нужно парсить и с каких именно WEB-страниц.

    С уважением к вам, Сергей.
     
  12. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    Для решения этой задачи нужна версия Content Downloader ULTIMATE.

    Файлы проектов я прикрепил к сообщению.

    1). В Content Downloader: меню - файл - загрузить проект;
    2). Перейти во вкладку "Контент", нажать кнопку с изображением ключика, в появившемся браузере ввести логин и пароль с опцией "запомнить", закрыть окно браузера (это была авторизация на сайте);
    2). Вернуться во вкладку "Ссылки", нажать ctrl+w и указать там путь к файлу проекта WBApp для парсинга ссылок (прикреплен к сообщению), затем закрыть окно, открытое нажатием ctrl+w;
    3). Нажать кнопку "выполнить предпросмотр элемента" на панели инструментов главного окна программы и ждать, пока программа прокликает все страницы.

    С уважением к вам, Сергей...
     

    Вложения:

  13. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    Вот результат парсинга
     

    Вложения:

    • sample.zip
      Размер файла:
      37,9 КБ
      Просмотров:
      4
  14. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    На ночь поставил с другими настройками, теперь собрано 8000+ ссылок (все ссылки).
     

    Вложения:

  15. Александр Сео

    Александр Сео New Member Пользователи

    Регистрация:
    27 мар 2015
    Сообщения:
    9
    Уважаемый Сергей, спасибо огромное за проект и сайты, сайты очень пригодились! Проект не может почему то до конца все сайты спарсить. У меня парсинг доходил максимум до 6000 спарсенных сайтов глючит IE. еще на сайте немного интерфейс поменял, сейчас не получается парсинг запустить к сожалению.
     
    Последнее редактирование: 2 апр 2015
  16. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    Здравствуйте еще раз.

    Пожалуйста.

    Только что проверил проект WBApp miralinks_ru_modified.wbapp - все работает (может быть вы не указали путь к нему в ctrl+w?).

    Из рекомендаций:
    Перед парсингом открыть WBApp, перейти на страницу
    Скрытое содержимое:
    **Скрытое содержимое: доступно при наличии 1 постов.**
    И на этой веб-странице опцию "показывать на странице" сменить со значения 20 на значение 50. Также обратить внимание на "настройки таблицы", где оставить галочку ТОЛЬКО напротив "URL площадки".

    После этих действий у меня проходит все страницы...

    С уважением к вам, Сергей...
     
  17. Александр Сео

    Александр Сео New Member Пользователи

    Регистрация:
    27 мар 2015
    Сообщения:
    9
    Сергей, такое впечатление, что не могу авторизоваться через куки. Может с настройками IE у меня что то не так.
     
  18. kagorec

    kagorec Администратор Команда форума Администратор

    Регистрация:
    3 янв 2011
    Сообщения:
    4.442
    Адрес:
    Latvia
    Миралинкс можно через iMacros (или Selenium) каждый шаг сохранять на компьютер, тоесть страницу в формате .html
    Content Downloader-ом распарсить .html в удобный формат csv
     
  19. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    Здравствуйте еще раз.

    Через куки там авторизацию проходить не нужно.
    Это я вам написал для того, чтобы не передать куки, а пройти авторизацию на этом сайте в браузере Internet Explorer (он используется, как модуль в программе). Тогда и WBApp будет авторизован на этом сайте (там тоже используется модуль IE).

    Проекты я вам предоставил, скачайте их и следуйте инструкциям, которые к ним были приложены. При соблюдении всех рекомендаций и указаний, у вас должно парситься без проблем.

    Если проблемы все же остаются, можете обратиться за помощью специалистов Ссылки недоступны для гостей (чтобы они удаленно проконтролировали ваши действия и указали на ошибку(и)).

    Спасибо!

    С уважением к вам, Сергей...
     
  20. Александр Сео

    Александр Сео New Member Пользователи

    Регистрация:
    27 мар 2015
    Сообщения:
    9
    Уважаемые Сергей и kagorec, спасибо за помощь! Подскажите пожалуйста как Content Downloader скормить получившиеся html файлы?
     

Поделиться этой страницей