Перейти к содержимому

Извлечь таблицы (Tesseract)

image_1

Описание

Блок извлекает таблицы из файла с помощью Tesseract OCR и сохраняет результат в Excel-файл. Каждая найденная таблица записывается на отдельный лист.



Описание параметров

  1. Путь к файлу (PDF, JPEG, PNG) — путь к входному файлу с таблицами.

    Тип данных: str (Строка)

    Пример: C:\\docs\\table.pdf

  2. Сохранить результат распознавания в — путь к итоговому Excel-файлу.

    Тип данных: str (Строка)

    Пример: C:\\docs\\tables.xlsx

  3. Языковая модель — язык распознавания текста:

    • RUS — русский язык;
    • ENG — английский язык;
    • RUS+ENG — одновременное распознавание русского и английского языков.
  4. Коррекция перекоса изображения — автоматическое выравнивание изображения перед распознаванием.

    Тип данных: checkbox (Чекбокс)

    Пример: Истина

  5. Идентифицировать неявные строки — попытка восстановить строки таблицы, даже если они слабо выражены визуально.

    Тип данных: checkbox (Чекбокс)

    Пример: Ложь

  6. Извлечь таблицы без полей — поиск таблиц без явных границ ячеек.

    Тип данных: checkbox (Чекбокс)

    Пример: Ложь

  7. Минимальный уровень достоверности — порог уверенности распознавания OCR (от 0 до 100).

    Тип данных: int | float (Число)

    Пример: 50


Пример использования

В данном примере блок извлекает таблицы из файла table.pdf с языковой моделью RUS+ENG, включенной коррекцией перекоса и сохраняет результат в tables.xlsx.

image_2

Результат

Сохраненная таблица в Excel-файле:

image_3