Можно ли импортировать в программу 1 большой документ

Тема в разделе "Импорт CSV", создана пользователем nor, 17 июл 2012.

  1. nor

    nor New Member Пользователи

    Регистрация:
    12 июл 2012
    Сообщения:
    5
    Здравствуйте

    Вопрос: могу ли я импортировать один большой документ MS WORD, в котором есть множество статей, которые оформлены следующим образом:

    Заголовок статьи
    статья -----------
    ------------------

    Заголовок статьи
    -----------------
    -----------------

    Может ли программа сама "разбить" один большой файл на статьи?

    Спасибо.
     
  2. Valiks

    Valiks New Member Супер Модератор

    Регистрация:
    18 янв 2012
    Сообщения:
    554
    Адрес:
    Всё время в скэйпе
    Программа имеет иное предназначение. То, что вы просите можно сделать через Zebroid, Textkit и другие программы обработки. Но и там, надо сначала сохранить файл из Ворда в html-формате, затем импортировать и разбивать.
     
  3. nor

    nor New Member Пользователи

    Регистрация:
    12 июл 2012
    Сообщения:
    5
    Понятно, спасибо.

    Про зеброид и тексткит я знал, просто хотел узнать про CD.
     
  4. zilon

    zilon New Member Пользователи

    Регистрация:
    24 дек 2011
    Сообщения:
    80
    если шаблон вывода настроить и спасить этот документ, то можно импортировать в базу.
     
  5. nikolas1612

    nikolas1612 Member Пользователи

    Регистрация:
    27 ноя 2011
    Сообщения:
    439
    резка файла на отдельные статьи

    Так уж получилось, что у меня программа решает множество задач, которые и сам автор, вероятно, для нее никогда не планировал. И я вам могу уверенно сказать: да, она может разбить текстовый файл на отдельные статьи, если они разделены циклическими (повторяющимися) границами. И неважно, какое там у нее предназначение.

    Рабочий вариант решения задачи средствами Content Downloader (предполагаем, что статьи в документе отделены друг от друга кодом 555):

    1. Первым проектом парсим большой текстовый файл по границе "555 (тег 0) - 555 (тег 1)". Это будет первая статья в нашей нарезке.

    2. Вторым проектом парсим этот же большой текстовый файл, но уже наоборот - от границы 555 (тег 1) до конца файла (это можно сделать макросами REPLACE и DOCSOURCE). Самое важное: результат парсинга, при помощи DOCSNAMES, сохраняем поверх того самого файла, который только что спарсили, с тем же именем.

    3. Ставим проекты 1 и 2 в очередь планировщика, и задаем его перезапуск с периодом, скажем, в 3-5 секунд. В результате, циклы 1 и 2 начнут повторяться, и файл порежется на статьи.

    Может, кому-то и пригодится...
     
    Последнее редактирование: 12 сен 2012
  6. AlexS

    AlexS New Member Пользователи

    Регистрация:
    28 июн 2012
    Сообщения:
    56
    Как-то вычурно. А почему не обычная повторяющаяся граница по 555?
     
  7. nikolas1612

    nikolas1612 Member Пользователи

    Регистрация:
    27 ноя 2011
    Сообщения:
    439
    хм. не совсем понимаю, как это реализовать обычной повторяющейся границей. обратите внимание - речь идет не о парсинге как таковом. задача - ПОРЕЗАТЬ 1 файл на множество мелких. в этом и заключается проблема. повторяющейся границей вы либо сделаете из 20 файлов 20, либо сведете 20 файлов в 1, но не наоборот.

    программа (в ее сегодняшнем виде) отлично парсит и ОБЪЕДИНЯЕТ результаты парсинга, а вот делить их на отдельные файлы - не умеет. хотя не исключаю, может, это я чего-то не доглядел или не додумал..

    если вы можете решить задачу проще - расскажите поподробнее, как. для меня эта задача актуальна, буду признателен.
     
    Последнее редактирование: 15 сен 2012

Поделиться этой страницей