Считать текст из PDF файла
Описание
Блок считывает текстовое содержимое PDF-файла - всего документа или только указанных страниц. Дополнительно можно включить удаление повторяющихся водяных знаков из результата.
Описание параметров
Блок имеет несколько параметров:
- Путь к файлу PDF — путь к исходному PDF-файлу.
Тип данных:
str (Строка)Пример:
C:\Users\User\Desktop\document.pdf - Считать страницы - страницы, текст которых требуется считать. Если оставить Ничто, считывается весь документ.
Тип данных:
int (Целое число) | list (Список) | None (Ничто)Пример:
[1, 2] - Удалить водяные знаки — удаление повторяющихся водяных знаков из извлеченного текста.
Тип данных:
checkbox (Чекбокс)Пример:
Истина
Возвращаемое значение
Тип данных: str (Строка)
Пример: Строка с извлечённым текстом из документа.
Пример использования
Блок считывает содержимое первых двух страниц PDF файла с текстовым слоем.
Результат
Уведомление с текстом первых двух страниц документа: