PDF в две колонки выходит с перемешанными колонками
Вы выделяете текст статьи, набранной в две колонки, копируете его, вставляете в Word — и за строкой левой колонки идёт строка правой, и так снова и снова. Два разных рассуждения оказываются сплетены, и уже не понять, где кончается предложение.
Причина в том, что PDF не хранит структуру колонок. Внутри файла — только указания: «нарисуй этот глиф в этих координатах». Нигде не записано, где начинается одна колонка и где кончается другая. Копирование и извлечение текста идут по странице сверху вниз, строка за строкой, по месту отрисовки, поэтому две колонки на одной высоте берутся попеременно, по строке.
Значит, колонки нужно перечитать из вёрстки. PDFIntact находит на странице блоки — текст, заголовки, таблицы, иллюстрации — и возвращает их в порядок чтения, прежде чем записать в Word, Markdown и JSON. Сама вёрстка в колонки не воспроизводится: получается одноколоночный документ в порядке чтения.
Попробовать
Проверьте на своём PDF
Проверка выполняется целиком внутри браузера. Файл никуда не загружается, регистрация не нужна. До оплаты видно, сколько страниц, таблиц и рисунков удастся извлечь.
Пример
行の拾われ方が変わります
左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。
コピーしたとき(描かれた位置の順)
左の段 1行目 右の段 1行目 左の段 2行目 右の段 2行目 左の段 3行目 右の段 3行目
PDFIntact を通したとき(読み順)
左の段 1行目 左の段 2行目 左の段 3行目 右の段 1行目 右の段 2行目 右の段 3行目
形式ごとに、どう入るか
同じ読み順でも、書き出す形式によって入り方が違います。
Word(.docx)
読み順のまま、1段の段落として並びます。段組は再現しません。
Markdown(.md)
同じ範囲を、ページごとの見出しの下に読み順で置きます。
JSON
ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。
Excel(.xlsx)
本文は入りません。Excelに書き出すのは表とグラフだけです。
脚注・キャプション・ページ番号
これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。
Частые вопросы
- Почему колонки перемешиваются при копировании PDF в две колонки?
- Потому что PDF не хранит колонку как колонку. В файле есть только «нарисуй этот глиф в этих координатах», и ничто не отмечает, где начинается одна колонка и кончается другая. Копирование идёт по странице сверху вниз, строка за строкой, поэтому две колонки на одной высоте берутся попеременно, по строке.
- Как восстанавливается порядок чтения?
- Сначала на странице находятся блоки — текст, заголовки, таблицы, иллюстрации, — а затем они возвращаются в порядок чтения, и только после этого что-либо записывается. Сама вёрстка в две колонки не воспроизводится: в Word и Markdown попадает одноколоночный документ в порядке чтения.
- Что происходит со сносками и подписями к рисункам?
- Они выходят отдельными блоками, абзацами, на своём месте в порядке чтения. В наших проверках подписи к рисункам оставались отдельно от текста, всё ниже линии сноски становилось отдельным блоком, а колонцифры не смешивались с текстом. Сносками Word они не становятся — приходят абзацами.
- В какие форматы можно выгрузить текст?
- Word, Markdown и JSON. В JSON есть ещё тип блока, номер страницы и положение на странице, поэтому видно, из какой колонки и с какого места взят фрагмент. Основной текст в Excel не попадает: выгрузка в Excel содержит только таблицы и диаграммы.
- Если порядок чтения верен, верны ли и символы?
- Это разные вещи. Порядок чтения может сохраниться, а распознавание символов — развалиться; именно так вышло на одном образце. Поэтому у каждого блока есть отметка достоверности: прочитано, оценено или не прочитано. Сверяйте результат с исходным PDF.
Проверить файл сразу по всем симптомам/ Чем отличаются форматы