OCR сканов ТЗ: как извлечь характеристики из PDF-картинки
Как распознать сканированное ТЗ в PDF и извлечь характеристики товара для заявки: OCR, типичные ошибки распознавания таблиц и проверка результата.

ИИ-ассистент для тендеров под ваши задачи — обсудим на бесплатной консультации
Заказчик выложил техническое задание картинкой: PDF, внутри которого не текст, а фотография или скан страницы. Скопировать характеристики мышью нельзя, поиск по документу не работает, а форму 2 заполнять надо точно по тексту ТЗ. Дальше — как распознать ТЗ из скана, извлечь характеристики из PDF и проверить результат, чтобы заявку не отклонили из-за ошибки распознавания.
Почему скан ТЗ — это проблема, а не мелочь
В электронном аукционе по 44-ФЗ участник указывает в форме 2 конкретные показатели товара. Эти значения сверяют с диапазонами и требованиями из технического задания заказчика. Основание — статья 33 закона 44-ФЗ, правила описания объекта закупки: заказчик задаёт минимальные и максимальные значения, неизменяемые показатели, а поставщик отвечает точными цифрами.
Когда ТЗ — это нормальный текстовый PDF, вы копируете требования и сверяете их с паспортом товара. Когда ТЗ — картинка, текста для копирования нет. Остаётся два пути: переписывать характеристики глазами вручную или прогнать файл через распознавание.
Ручной перенос на большом лоте — это десятки позиций по 10–20 параметров. Каждая опечатка в форме 2 — потенциальное отклонение первой части заявки. «1,5 мм» вместо «15 мм», «не менее» вместо «не более», потерянная единица измерения — комиссия читает буквально.
Сканированная документация тендера опасна не самим фактом скана, а тем, что её нельзя сверить поиском. Глаз пропускает то, что Ctrl+F нашёл бы за секунду.
Как отличить скан от текстового PDF
Сначала поймите, с чем имеете дело. Не каждый PDF — картинка.
- Откройте файл и попробуйте выделить строку мышью. Выделяется текст — PDF текстовый, OCR не нужен.
- Нажмите Ctrl+F и поищите слово из документа. Находит — текст есть.
- Если выделяется весь лист одним прямоугольником, а поиск ничего не находит — перед вами скан, страница лежит внутри PDF как изображение.
Встречается смешанный вариант: часть страниц — текст, часть — вклеенные сканы (например, подписанные приложения или таблицы из старого документа). Тогда распознавать нужно только картиночные страницы.
OCR сканов ТЗ: как извлечь характеристики из PDF-картинки
OCR — оптическое распознавание символов. Программа находит на изображении буквы и цифры и превращает их в текст, который можно копировать и искать. Базовая процедура одинакова для большинства инструментов.
- Подготовьте файл. Если скан кривой или бледный, выпрямите страницы и поднимите контраст — чище картинка, меньше ошибок распознавания.
- Выберите язык распознавания — русский, при наличии латиницы в марках и стандартах добавьте английский.
- Запустите OCR. На выходе получите текстовый слой поверх картинки либо отдельный текст/таблицу.
- Выгрузите результат в удобный формат: текст для копирования в форму 2, таблицу — в Excel для построчной сверки.
- Сохраните исходный скан рядом. Сверять распознанное всегда нужно с оригиналом, а не с памятью.
Какие инструменты подходят:
- Онлайн-OCR и офисные пакеты — быстро для одной-двух страниц. Минус: чужой сервис видит ваш файл, а закупочная документация бывает чувствительной.
- Десктопные программы распознавания — лучше держат таблицы и многостраничные документы, работают локально.
- ИИ-распознавание — современные модели читают сложные таблицы и рукописные пометки точнее классического OCR, но любой результат всё равно проверяют.
Где OCR ошибается на таблицах ТЗ
Характеристики в ТЗ почти всегда лежат в таблице: позиция, наименование, параметр, требование, единица. Именно таблицы — слабое место распознавания. Типичные ошибки:
| Что в скане | Во что превращает OCR | Чем грозит |
|---|---|---|
| Цифра 0 и буква О | путает их местами | искажается значение показателя |
| 5 и S, 1 и I, 8 и B | подменяет символы | неверная марка, артикул, стандарт |
| Запятая в «1,5» | теряет или ставит точку | «15» вместо «1,5» |
| «≤», «≥», «±» | дропает или заменяет знак | переворачивается смысл требования |
| Объединённые ячейки | разносит данные по соседним строкам | характеристика уезжает к чужой позиции |
| Перенос строки в ячейке | склеивает две строки в одну | две позиции сливаются |
Самое коварное — сдвиг строк. Когда OCR неверно разбивает таблицу, значение из позиции 7 встаёт напротив позиции 8. Каждая отдельная цифра распознана верно, но привязана не к тому товару. Поиском такую ошибку не поймать — только построчным сравнением с картинкой.
Отдельная боль — знаки сравнения. «Не менее» и «не более», «≥» и «≤» решают, проходит ваш товар или нет. Если разбираете требования с диапазонами и знаками, держите под рукой разбор про знаки больше и меньше в заявке — распознавание этих символов ошибается чаще всего.
Как проверить распознанные характеристики
Распознать — половина дела. Вторая половина — убедиться, что текст совпадает с оригиналом. Чек-лист проверки перед переносом в форму 2:
- Сверьте каждую строку таблицы с картинкой: позиция, параметр, значение, единица.
- Проверьте все числа отдельно — особенно с запятой и нулями.
- Проверьте знаки сравнения и диапазоны «от — до»: где «не менее», где «не более».
- Проверьте единицы измерения: мм или см, кг или г, Вт или кВт.
- Проверьте марки, ГОСТ, артикулы — там OCR путает похожие символы.
- Убедитесь, что число строк в распознанной таблице равно числу позиций в ТЗ. Разошлось — ищите сдвиг или склейку.
Дальше идёт смысловая сверка: совпадают ли распознанные требования с тем, что вы готовы поставить. Заполняя форму 2, отвечайте конкретными значениями, а не переписывайте диапазон заказчика — дублирование диапазона вместо точного показателя остаётся частой причиной отклонения. Механику разобрали в материале про заполнение формы 2 конкретными показателями.
Если в распознанном тексте требования противоречат сами себе или физически несовместимы — это повод не гадать, а отправить запрос на разъяснение документации. Иногда дело не в OCR, а в самой ТЗ.
Где здесь помогает автоматизация
Ручная сверка скана съедает время, которого перед дедлайном подачи нет. Связка «OCR + ИИ» закрывает рутину: распознаёт страницы-картинки, вытаскивает характеристики в структурированный вид и сопоставляет требования ТЗ с позицией КТРУ и с вашим товаром.
TenderScan читает документацию тендера, включая сканы, и сверяет характеристики товара с ТЗ и КТРУ автоматически — показывает, где ваш товар проходит по требованиям, а где параметр не совпадает. Как устроена сама сверка, описано в статье про ИИ-сверку характеристик товара с ТЗ и КТРУ. Автоматика снимает объём, но финальное решение и ответственность за форму 2 остаются за вами: распознанное всё равно сверяют с оригиналом скана.
Часто задаваемые вопросы
Можно ли вообще копировать характеристики из сканированного ТЗ?
Напрямую — нет, в скане нет текстового слоя. Сначала прогоните файл через OCR, получите текст, проверьте его по оригиналу, и только потом переносите значения в форму 2.
Какой OCR лучше для таблиц технического задания?
Тот, что аккуратно держит структуру таблицы и не путает строки. Классические десктопные программы распознавания и современное ИИ-распознавание справляются с таблицами лучше простых онлайн-конвертеров. Но любой результат проверяют построчно по картинке.
Что чаще всего распознаётся с ошибкой в ТЗ?
Числа с запятой, нули и буква О, знаки «≤», «≥», «±», а также объединённые ячейки таблиц. Из-за них значение либо искажается, либо уезжает к соседней позиции. Эти места проверяйте в первую очередь.
Отклонят ли заявку из-за ошибки распознавания?
Комиссия читает форму 2 буквально и сверяет показатели с ТЗ. Если из-за ошибки OCR вы указали неверное значение, риск отклонения первой части реальный. Поэтому распознанное всегда сверяют с оригиналом скана до подачи.
Что делать, если требования в распознанном ТЗ противоречат друг другу?
Не угадывать. Проверьте, не ошибка ли это OCR, сверив с картинкой. Если противоречие в самом ТЗ — направьте заказчику запрос на разъяснение документации в установленный срок до окончания подачи заявок.
ИИ-ассистент под ваши тендеры
Бесплатный аудит и консультация: разберём ваши тендерные процессы, найдём узкие места и что можно автоматизировать, а дальше — готовый ИИ-ассистент или разработка под вас. Без обязательств.