Конвертер PDF в TXT

Из PDF в TXT уходит чистый текст, для скана включается распознавание, оформление при этом отбрасывается.

Конвертер PDF в TXT вынимает из документа один только текст. Файл со сканами он отличает от обычного сам и включает для него распознавание.

Что происходит при конвертации PDF в TXT

Внутри PDF текст разложен по координатам: каждая строка знает своё место на листе, но не знает, что стоит после неё. Скопировать пару абзацев мышью можно, а вот отдать содержимое скрипту, поиску или переводчику в таком виде не выйдет.

TXT снимает всю разметку и оставляет символы. Дальше с ними работает что угодно: скрипт на любом языке, текстовый редактор, система поиска. Если текстового слоя в файле нет, страницы уходят на распознавание, и текст собирается из картинок.

  • Абзацы и переносы строк сохраняются, разбивка на страницы исчезает.
  • Шрифты, начертания, колонки и колонтитулы отбрасываются: в TXT их хранить негде.
  • Изображения и подписи под ними в результат не попадают.
  • Скан распознаётся автоматически, отдельную настройку включать не нужно.
  • Распознавание рассчитано на латиницу, поэтому русский скан даст ошибки в словах.

Как конвертировать PDF в TXT

  1. Загрузите PDF-файл на этой странице.
  2. Выберите формат TXT.
  3. Нажмите «Конвертировать».
  4. Скачайте текстовый файл.

Кому нужен голый текст

  • Загрузить содержимое договоров в поиск или базу знаний, где оформление только мешает.
  • Прогнать документ через скрипт: разобрать по строкам, посчитать вхождения, вытащить номера.
  • Перенести текст статьи в редактор, не таща за собой чужие шрифты и отступы.
  • Отдать материал на перевод, где важны слова, а не вёрстка.
  • Прочитать документ на устройстве, которое тяжёлый PDF открывает с трудом.

Проверьте PDF до загрузки

  1. Попробуйте выделить строку мышью. Если выделяется текст, извлечение пойдёт напрямую и без ошибок; если выделяется вся страница, включится распознавание.
  2. Посмотрите на язык скана: распознавание настроено на латиницу, кириллица распознаётся хуже.
  3. Оцените объём: файл длиннее 500 страниц придётся разделить на части.

Ограничения

  • Размер файла: до 50 МБ без регистрации, до 100 МБ с бесплатным аккаунтом.
  • Объём: до 500 страниц в одном PDF.
  • Скан распознаётся дольше обычного файла: на большой документ уходит до 10 минут.

Как выбрать формат под задачу

  • Нужны таблицы. В TXT строки таблицы сольются в сплошной текст. Ячейки по столбцам разложит конвертер PDF в Excel (XLSX).
  • Текст пойдёт в программу. Для машинной обработки удобнее конвертер PDF в JSON: там текст и таблицы уже разделены по полям.
  • Документ нужно править с оформлением. Вёрстку, картинки и таблицы сохранит конвертер PDF в Word (DOCX).

Другие направления с PDF

Частые вопросы

Распознаётся ли текст со скана?

Да, это единственное направление из PDF, где распознавание включается само. Сканированные страницы определяются автоматически.

Сохранятся ли таблицы?

Как таблицы нет: ячейки станут обычными строками текста, поэтому для расчётов лучше подходит выгрузка в XLSX или CSV.

Почему в тексте со скана попадаются опечатки?

Распознавание настроено на английский язык. На русских сканах часть слов разбирается неверно, особенно при низком качестве съёмки.

Останется ли деление на страницы?

Нет. В TXT нет понятия страницы, текст идёт сплошным потоком с сохранением абзацев.

Похожие конвертации

Подробнее о форматах

Что это за формат, чем открыть и чем отличается от других.