Конвертер PDF в TXT
Из PDF в TXT уходит чистый текст, для скана включается распознавание, оформление при этом отбрасывается.
Конвертер PDF в TXT вынимает из документа один только текст. Файл со сканами он отличает от обычного сам и включает для него распознавание.
Что происходит при конвертации PDF в TXT
Внутри PDF текст разложен по координатам: каждая строка знает своё место на листе, но не знает, что стоит после неё. Скопировать пару абзацев мышью можно, а вот отдать содержимое скрипту, поиску или переводчику в таком виде не выйдет.
TXT снимает всю разметку и оставляет символы. Дальше с ними работает что угодно: скрипт на любом языке, текстовый редактор, система поиска. Если текстового слоя в файле нет, страницы уходят на распознавание, и текст собирается из картинок.
- Абзацы и переносы строк сохраняются, разбивка на страницы исчезает.
- Шрифты, начертания, колонки и колонтитулы отбрасываются: в TXT их хранить негде.
- Изображения и подписи под ними в результат не попадают.
- Скан распознаётся автоматически, отдельную настройку включать не нужно.
- Распознавание рассчитано на латиницу, поэтому русский скан даст ошибки в словах.
Как конвертировать PDF в TXT
- Загрузите PDF-файл на этой странице.
- Выберите формат TXT.
- Нажмите «Конвертировать».
- Скачайте текстовый файл.
Кому нужен голый текст
- Загрузить содержимое договоров в поиск или базу знаний, где оформление только мешает.
- Прогнать документ через скрипт: разобрать по строкам, посчитать вхождения, вытащить номера.
- Перенести текст статьи в редактор, не таща за собой чужие шрифты и отступы.
- Отдать материал на перевод, где важны слова, а не вёрстка.
- Прочитать документ на устройстве, которое тяжёлый PDF открывает с трудом.
Проверьте PDF до загрузки
- Попробуйте выделить строку мышью. Если выделяется текст, извлечение пойдёт напрямую и без ошибок; если выделяется вся страница, включится распознавание.
- Посмотрите на язык скана: распознавание настроено на латиницу, кириллица распознаётся хуже.
- Оцените объём: файл длиннее 500 страниц придётся разделить на части.
Ограничения
- Размер файла: до 50 МБ без регистрации, до 100 МБ с бесплатным аккаунтом.
- Объём: до 500 страниц в одном PDF.
- Скан распознаётся дольше обычного файла: на большой документ уходит до 10 минут.
Как выбрать формат под задачу
- Нужны таблицы. В TXT строки таблицы сольются в сплошной текст. Ячейки по столбцам разложит конвертер PDF в Excel (XLSX).
- Текст пойдёт в программу. Для машинной обработки удобнее конвертер PDF в JSON: там текст и таблицы уже разделены по полям.
- Документ нужно править с оформлением. Вёрстку, картинки и таблицы сохранит конвертер PDF в Word (DOCX).
Другие направления с PDF
- Из выписки или прайса нужны колонки цифр: их выдаст конвертер PDF в CSV.
- Документ пора вернуть в редактируемый вид: этим займётся конвертер PDF в Word (DOCX).
- Данные предстоит загрузить в стороннюю систему: подойдёт конвертер PDF в JSON.
Частые вопросы
Распознаётся ли текст со скана?
Да, это единственное направление из PDF, где распознавание включается само. Сканированные страницы определяются автоматически.
Сохранятся ли таблицы?
Как таблицы нет: ячейки станут обычными строками текста, поэтому для расчётов лучше подходит выгрузка в XLSX или CSV.
Почему в тексте со скана попадаются опечатки?
Распознавание настроено на английский язык. На русских сканах часть слов разбирается неверно, особенно при низком качестве съёмки.
Останется ли деление на страницы?
Нет. В TXT нет понятия страницы, текст идёт сплошным потоком с сохранением абзацев.
Подробнее о форматах
Что это за формат, чем открыть и чем отличается от других.