Парсинг тубов.

Тема в разделе "Разное", создана пользователем wnetwork, 3 май 2011.

  1. wnetwork

    wnetwork New Member Пользователи

    Регистрация:
    3 май 2011
    Сообщения:
    3
    Здравствуйте!
    Сначала хочу поблагодарить автора за действительно обалденный продукт.

    Просмотрел все сообщения на форуме в ветке CD однако не нашел ответа.

    Очень много сайтов сейчас работают по принципу Тубов.
    Т.е на некоторой странице показывается картинка + ссылочка в которой описание. Перейдя по ссылке появляется плеер с видео.
    Как спарсить видео мне понятно. НО. Как спарсить картинку? При переходе на страницу видео в ней картинки нет.

    У вас есть пример парсинга youtube. Однако там тоже парсится только видео + название. Картинка не выдирается.

    Как можно реализовать такое?
    Возможно ли добавление такой функции в новую версию.
     
  2. boodooboo

    boodooboo New Member Пользователи

    Регистрация:
    15 мар 2010
    Сообщения:
    27
    Смотри в сторону CMS. Например, Друпал.
     
  3. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    Здравствуйте, спасибо!
    Прошу показать конкретный сайт, там уже на примере и разберем.
    С уважением к вам, Сергей.
     
  4. wnetwork

    wnetwork New Member Пользователи

    Регистрация:
    3 май 2011
    Сообщения:
    3
    Например тот же smotri.com или video.mail.ru.

    Можно ли реализовать граб картинок при сборе ссылок.
    Тогда картинки как бы на первом этапе собираются, а затем уже грабится нужный контент по ссылкам которые собраны.
    Я думаю вот это и будет решением для данного типа сайтов.
     
  5. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    Вот как можно сделать на smotri.com
    К сообщению прикреплен файл проекта Content Downloader (меню - файл - загрузить проект).
     

    Вложения:

    • smotri_com.zip
      Размер файла:
      4,2 КБ
      Просмотров:
      28
  6. wnetwork

    wnetwork New Member Пользователи

    Регистрация:
    3 май 2011
    Сообщения:
    3
    Спасибо огромное!
    Однако есть момент. В случае со smotri, там есть в странице парсинга ссылка на картинку. А что делать если ее нет или она находится на странице списка роликов.

    Можно ли сначала спарсить картинки, ссылки со страниц списка роликов, сохранить их в файлике, затем спарсить нужные контент с страниц роликов, а потом как то все объединить? Может так попробовать?
     
  7. Root

    Root Администратор Администратор

    Регистрация:
    10 мар 2010
    Сообщения:
    14.818
    Город:
    Барнаул
    Не вижу решения как это все объединить, парсите моим способом.
    Есть еще второй способ: Ссылки недоступны для гостей
     
  8. bork75

    bork75 New Member Пользователи

    Регистрация:
    2 сен 2010
    Сообщения:
    97
    Тоже присоединяюсь к вопросу о тубах.

    Речь даже не об отдельных картинках, а о парсинге со страниц, с которых мы получаем список линков. А если ещё точнее - ступенчатый парсинг.

    Сейчас CD отлично парсит, если короткая новость ведёт на полную.

    Но если материал разбит, например короткая новость ведёт на продолжение материала, то здесь есть проблемы.
    Таких сайтов не мало, это и все видео сайты, где тумба ведёт на ролик и пример выше с авто сайтом, где на странице есть ссылки на "отдельные страницы" с фото, это и сайты с какими-нибудь большим разбитым контентом.

    Есть идея по реализации:

    Например сайт имеет структуру:

    -page=1
    --material_1
    ---prodolzhenie_1
    --material_2
    ---prodolzhenie_1
    --material_3
    ---prodolzhenie_3
    -page=2
    --material_1
    ---prodolzhenie_1
    --material_2
    ---prodolzhenie_1
    --material_3
    ---prodolzhenie_3

    Сейчас можно указать CD страницы -page=1, -page=2, с которых он получит ссылки (с учётом фильтров) на материалы
    --material_1
    --material_2


    А что если бы CD работал так:

    Мы указали страницы:
    -page=1, -page=2 ...
    и всё!
    Дальше открываем их в визульном редакторе, который сейчас отлично работает и просто задаём границы!

    -указываем что нужно спарсить с -page=1, -page=2 (как обычно)
    -(это нужно добавить) "параметр ссылка" - кликнули, что CD нужно пройтись по ссылке и появилось окно для написания фильтра для этой ссылке (что бы проще писать фильтр, можно добавить параметр - в рамках границ или нет)
    - в визуальном редакторе прошли по этой ссылке ( с -page=1 переходим на --material_1) и как обычно начали задавать границы парсинга для уже этой страницы
    -если есть ещё вложенность ---prodolzhenie_1, так же указываем по какой ссылке пройтись CD и всё как выше описал.

    Что даст эта реализация?

    - можно будет парсить любой предшествующий контент.
    - можно будет парсить разбитые страницы (как page break в Joomla или комментарии разбитые на страницы - мы указали фильтр и CD пройдётся по всем)
    - можно будет парсить сайты со сложно вложенной структурой страниц (зашли на страницу, а с этой страницы ссылки на отдельные страницы)
    - можно будет спарсить все элементы со страницы, а не гадать сколько их будет (Ссылки недоступны для гостей) т.е. мы указали фильтр для ссылки, если картинок 7. то CD пройдётся по всем и заберёт с них картинки
    - проще будет писать фильтр для ссылок (если будет параметр "рассматривать в рамках границ" парсинга)

    Надеюсь понятно изложил.
    Предлагаю обсудить.
     
    Последнее редактирование: 10 июн 2011

Поделиться этой страницей