Как посчитать слова в скане для расчёта стоимости перевода

PDF не выделяет текст, а счётчик показывает ноль? Разбираем, как проверить скан, распознать текст через OCR и оценить объём без ложной точности.

Также: EN UK RU
Как посчитать слова в скане для расчёта стоимости перевода

Открываете PDF, запускаете подсчёт слов и получаете ноль, хотя перед вами несколько страниц плотного текста. Значит, счётчик, скорее всего, не сломан: он видит страницы-картинки, а не слова. Для сметы перевода сначала нужно извлечь текст или честно договориться о другом способе оценки объёма.

Сканирование сохраняет внешний вид документа, но не всегда сохраняет буквенный текст. На экране буквы есть, а для программы каждая страница может быть просто изображением. Поэтому подсчётчик в Word, переводческой программе или просмотрщике PDF не получает материал, который можно разбить на слова.

Для переводческого проекта важно не только получить цифру, но и понимать, насколько она надёжна. Ошибка OCR может превратить один символ в другой, склеить соседние слова, потерять строку таблицы или пропустить часть страницы. Даже красивое число в отчёте не доказывает, что исходный документ распознан полностью.

Почему счётчик слов показывает ноль

Сканированный PDF - это файл, внутри которого могут находиться изображения страниц вместо текста. Счётчик, который ищет текстовый слой, не распознаёт буквы на изображении самостоятельно. Google описывает свой способ решения именно как преобразование изображения или PDF в текст с помощью OCR (справка Google Drive).

OCR - оптическое распознавание символов. Программа анализирует пиксели изображения, определяет буквы и слова, а затем создаёт текст, который можно выделять, копировать и считать. Результат зависит от того, насколько чётко видны символы и насколько хорошо устроена страница.

В одном PDF могут соседствовать страницы разных типов. Например, первая страница может содержать настоящий текст, а приложение к ней - отсканированные таблицы. Счётчик обработает первую страницу и пропустит вторую, если OCR не применён ко всему документу. Полученное значение будет ненулевым, но неполным.

Проверьте файл вручную, прежде чем выбирать способ оценки:

  1. Откройте PDF в просмотрщике.
  2. Попробуйте выделить мышью несколько слов на странице.
  3. Скопируйте выделенный фрагмент и вставьте его в текстовый редактор.
  4. Сравните вставленный текст с тем, что видно на странице.
  5. Повторите проверку на странице с другим оформлением, например с таблицей или колонками.

Если слова выделяются и копируются в правильном порядке, PDF, вероятно, содержит текстовый слой. Если выделяется целая страница как единый объект, текст не копируется или вставляется пустым, перед вами, вероятно, скан. Проверка на нескольких страницах нужна потому, что структура PDF может меняться от страницы к странице.

В Chrome есть отдельный сценарий OCR для PDF со сканами физических документов. После распознавания текст становится доступен для поиска, выделения, копирования и вставки; справка Google также указывает, что в этом сценарии преобразование выполняется на устройстве пользователя, без отправки PDF Google или третьим сторонам (справка Google Chrome). Это утверждение относится именно к описанному механизму Chrome, а не ко всем OCR-программам.

В справке Google Drive сказано: «For the best results, use these tips:» - «Для лучших результатов используйте эти советы» (Google Drive Help).

Смысл этой подсказки практический: распознавание зависит от исходного изображения. Если текст размыт, перекошен или плохо освещён, программа не может надёжно восстановить то, чего не видно на странице.

Как извлечь текст и получить рабочий подсчёт

Подсчёт слов в сканированном PDF - это последовательность проверок, а не одно нажатие кнопки. Сначала получите текст, затем оцените качество OCR, и только после этого используйте счётчик. Сохраняйте исходный скан: он остаётся контрольной версией, по которой можно проверить распознанные строки.

Вариант с Google Drive

Google Drive поддерживает преобразование многостраничных PDF и изображений JPEG, PNG и GIF в текст через команду открытия файла в Google Документах (справка Google Drive). Рекомендации Google для этого процесса включают ограничение размера файла 2 МБ и высоту текста на изображении не менее 10 пикселей (справка Google Drive). Эти условия относятся к описанному Google рабочему процессу; они не гарантируют идеального распознавания каждого файла.

Рабочая последовательность выглядит так:

  1. Сохраните исходный PDF отдельно и не перезаписывайте его распознанной версией.
  2. Загрузите копию в Google Drive.
  3. Откройте файл с помощью Google Документов.
  4. Дождитесь преобразования и проверьте, появился ли текст под изображением или вместо него.
  5. Скопируйте распознанный текст в редактор либо сохраните результат в формате, который поддерживает ваш инструмент подсчёта.
  6. Сравните текст с исходными страницами, прежде чем использовать итоговое число в смете.

Google рекомендует прямую ориентацию страниц, чёткое изображение, равномерное освещение и хороший контраст; в качестве предпочтительных указаны распространённые шрифты, например Arial или Times New Roman (справка Google Drive). Для архивного скана вы не всегда можете улучшить сам документ, но можете проверить поворот страницы, контраст и читаемость перед повторным распознаванием.

В рекомендациях Google также указана минимальная высота текста 10 пикселей для предлагаемого процесса OCR (справка Google Drive). Если буквы на странице заметно меньше или сливаются, ожидайте большего числа ошибок и не принимайте результат без сверки.

Google Drive определяет язык документа при распознавании, а справочная страница ведёт к перечню поддерживаемых языков (справка Google Drive). До подсчёта проверьте, поддерживается ли язык исходника. Для смешанного документа отдельно проверьте страницы с несколькими языками, алфавитами или специализированной терминологией.

Вариант с OCR в Chrome

Если задача состоит в том, чтобы быстро проверить, можно ли искать и копировать текст, попробуйте PDF-просмотрщик Chrome. Google описывает OCR для сканированных PDF: после обработки пользователь может искать, выделять, копировать и вставлять распознанный текст (справка Google Chrome).

Такой тест помогает отделить изображение страницы от доступного текста, но сам по себе не заменяет редакторскую проверку. Наличие функции копирования показывает, что текст извлечён; оно не подтверждает, что все буквы, цифры, таблицы и сноски распознаны правильно.

Справка Google утверждает, что преобразование в описанном просмотрщике Chrome происходит на устройстве и не отправляет PDF Google или третьим сторонам (справка Google Chrome). Для документов с особыми требованиями к конфиденциальности всё равно проверяйте правила организации и настройки используемого программного обеспечения. Не переносите утверждение о локальной обработке Chrome на другие OCR-сервисы.

Как проверить результат перед подсчётом

Сравнивайте не только число слов, но и структуру. Выберите страницу с обычным текстом, страницу с мелким шрифтом и страницу с таблицей или колонками. Найдите в извлечённом тексте соответствующие фрагменты и проверьте, сохранился ли порядок чтения.

Особенно внимательно смотрите на:

  • заголовки и подписи, которые могли перейти в основной текст;
  • числа, даты и обозначения, где ошибочный символ меняет смысл;
  • переносы строк, из-за которых одно слово могло разделиться или склеиться;
  • таблицы, колонки и сноски, порядок которых OCR может перепутать;
  • страницы с печатями, фоном, рукописными пометками или слабым контрастом.

Google предупреждает, что преобразование может сохранить жирный и курсивный шрифт, размер и тип шрифта, а также разрывы строк, но списки, таблицы, колонки, сноски и примечания в конце документа распознаются ненадёжно (справка Google Drive). Если расчёт зависит от содержимого таблицы или сносок, сверьте их отдельно, а не полагайтесь на общий счётчик.

После проверки передайте извлечённый текст в текстовый редактор или инструмент подсчёта, который подходит для вашей задачи. Не смешивайте количество знаков, количество слов и число страниц: это разные величины. Уточните также, что именно считается в выбранной программе, особенно для нумерации, заголовков и таблиц.

Когда OCR нужен для расчёта переводческой сметы

OCR нужен, когда в PDF нет доступного текстового слоя, а смету требуется связать с количеством исходных слов. Электронно установленный объём даёт более определённую основу для расчёта, чем приблизительная оценка «на глаз». Руководство Apex Translations также описывает предпочтение точного электронного подсчёта, когда его можно получить (материал о подсчёте слов).

Это не означает, что любой OCR-подсчёт автоматически точен. Распознавание превращает изображение в текст, но не подтверждает, что каждая строка была прочитана верно. Если распознанный текст содержит пропуски или ошибки, число слов отражает качество OCR не меньше, чем объём исходного документа.

Для сметы полезно разделять три этапа:

  1. Получение исходного текста. Определите, можно ли выделить текст в PDF или нужен OCR.
  2. Проверка качества. Сверьте типовые и сложные страницы со сканом.
  3. Согласование модели расчёта. Укажите, будет ли основой цена за слово, страницу, час или согласованная оценка.

Представьте документ на нескольких страницах: часть текста распознаётся чисто, но таблица и сноски после OCR теряют порядок. Обычный счётчик может показать число, однако это число не включает надёжно проверенный объём таблицы. В смете стоит отдельно обозначить, что распознанный текст проверяется по скану, а элементы с ненадёжной структурой требуют ручной сверки.

Руководство Apex Translations различает PDF со сканированным содержимым и PDF, который можно посчитать электронно, а для сканов описывает преобразование с помощью OCR перед подсчётом (материал о подсчёте слов). Источник также указывает, что при невозможности надёжно определить объём исходного текста цитата может основываться на оценке объёма целевого текста. Это политика конкретного агентства, а не универсальное правило для всех переводчиков.

Переводчику и заказчику лучше письменно зафиксировать, какой текст включён в расчёт. Например, в смету можно внести основной текст и отдельно указать, что подписи, печати, плохо читаемые фрагменты и таблицы проверяются вручную. Если выбор метода влияет на стоимость, согласуйте его до начала перевода, а не после появления расхождений.

Для рабочих процессов переводческих команд полезно отделять подсчёт от редактирования: OCR создаёт черновое представление исходника, а не вычитанный документ. Если команда работает с Word, PDF и таблицами, пригодятся практические советы о сохранении форматирования при переводе документов. Для сканов и фотографий отдельно рассмотрены OCR и перевод изображений документов.

Когда OCR не нужен и чем заменить подсчёт

OCR не нужен, если текст в PDF уже выделяется, копируется и совпадает с изображением страницы. В таком случае счётчик может работать напрямую с доступным текстовым слоем. Проверьте несколько страниц, чтобы убедиться, что документ не состоит из смеси цифрового текста и сканов.

OCR также не решает проблему, если изображение настолько повреждено, что слова нельзя надёжно прочитать. Повторная обработка может изменить число распознанных символов, но не восстановит невидимые буквы. Если специалисту всё равно придётся читать каждую строку по изображению, точный подсчёт слов через OCR может добавить этап, не устранив главную неопределённость.

Плохое распознавание особенно вероятно, когда страницы повёрнуты, изображение нерезкое, освещение неравномерное или контраст слабый. Google прямо рекомендует прямую ориентацию, чёткие изображения, равномерное освещение и ясный контраст для своего рабочего процесса OCR (справка Google Drive). Если документ не соответствует этим условиям, отметьте риск до расчёта.

Когда надёжный исходный подсчёт недоступен, выберите способ, который соответствует характеру работы:

  • Оценка по страницам. Подходит для предварительной сметы, если страницы однородны и критерий страницы согласован. Уточните, считаются ли пустые страницы и как обрабатываются частично заполненные.
  • Оценка по выборке. Возьмите несколько характерных страниц, оцените плотность текста и отдельно проверьте самые сложные участки. Укажите, что результат предварительный, пока весь документ не проверен.
  • Оплата времени. Может подойти, когда основную работу составляет чтение неразборчивых страниц, ручная расшифровка или проверка таблиц. Зафиксируйте, как будет учитываться время.
  • Оценка по целевому тексту. Некоторые агентства используют её, когда нельзя установить надёжный объём исходника. Apex Translations описывает такой вариант в собственном руководстве (материал о подсчёте слов); перед применением согласуйте метод и допущения.

Ни один способ не становится правильным для всех заказов. Цена за слово понятна, если исходный объём измерен надёжно. Цена за страницу удобнее для предварительной оценки однотипных страниц, но может скрыть разницу между плотным текстом и пустым бланком. Почасовая оплата может точнее отражать ручную работу, но заказчику важно понимать, какие действия входят в оплачиваемое время.

В документе на нескольких языках считайте и проверяйте языковые фрагменты отдельно, если OCR по-разному справляется с разными письменностями. В официальной форме короткие поля могут быть важнее длинного основного текста; размер страницы тогда не показывает реальную сложность. В инструкции с большим количеством таблиц ручная проверка структуры способна занять больше времени, чем сам подсчёт слов.

Для выбора модели сметы полезно сопоставить варианты оплаты и их ограничения в материале о цене перевода за слово, страницу и документ. Главное - не называть предварительную оценку точным подсчётом, если исходник не был надёжно распознан.

Ошибки, из-за которых объём считают неправильно

Нулевая цифра - заметная проблема, но ненулевой результат способен ввести в заблуждение сильнее. Если счётчик увидел часть PDF, заказчик может решить, что обработан весь документ. Ниже - ошибки, которые проще предупредить до согласования сметы.

Считать OCR-результат без сверки со сканом

Программа может принять пятно за знак, потерять символ или склеить слова. Счётчик затем честно считает распознанную строку, даже если строка не совпадает с оригиналом. Проверяйте не только итог, но и сам текст: начните с проблемных страниц и элементов, где ошибка меняет число, имя или смысл.

Руководство Apex Translations отдельно предупреждает об ограничениях качества OCR и отмечает, что ненадёжный результат с плохого PDF нельзя считать точным подсчётом (материал о подсчёте слов). Практический вывод простой: если распознавание ошибается, смета должна описывать оценку, а не выдавать число за измеренный исходный объём.

Пропускать страницы с другим типом содержимого

Документ может объединять текстовый слой с изображениями, таблицами или вложенными сканами. Проверка только первой страницы не гарантирует, что остальные обрабатываются так же. Сверьте страницы с разными макетами и добавьте в расчёт список участков, которые счётчик мог не увидеть.

Доверять структуре таблиц после преобразования

После OCR строки и колонки могут идти не в том порядке, а подписи перемещаться внутрь соседнего текста. Google предупреждает, что таблицы, колонки, списки и сноски могут распознаваться ненадёжно (справка Google Drive). Для сметы это важно не только из-за форматирования: неправильный порядок иногда скрывает пропуски или дублирование текста.

Смешивать предварительную оценку и окончательную смету

Оценка по нескольким страницам полезна, когда скан слишком объёмен или качество неоднородное. Но предварительная цифра не должна незаметно превращаться в окончательную стоимость, если сложные страницы ещё не проверены. Запишите, какие страницы вошли в выборку, как оценивался остальной объём и при каких условиях цена изменится.

Не договориться о границах подсчёта

Слово «объём» может означать основной текст, все видимые надписи, таблицы, печати, сноски или только материал для перевода. Уточните, что входит в работу и как считаются нечитаемые фрагменты. Для команды полезно сохранить отчёт счётчика, распознанный текст и исходный PDF: эти материалы помогают объяснить расхождение без спора о том, кто что видел.

Стандарт ISO 17100:2015 описывает требования к ключевым процессам, ресурсам и другим аспектам предоставления переводческих услуг согласно применимым спецификациям (страница ISO 17100:2015). Страница стандарта не устанавливает универсальный тариф за слово, страницу или час. Поэтому способ расчёта должен быть явно согласован сторонами и соответствовать фактической задаче.

Перед отправкой сметы пройдите короткую проверку:

  • Текст в PDF выделяется или требуется OCR?
  • Все страницы обработаны, включая приложения и таблицы?
  • Поддерживается ли язык исходника в выбранном процессе распознавания?
  • Проверены ли страницы с мелким шрифтом и сложной структурой?
  • Указан ли способ расчёта и его ограничения?
  • Понимает ли заказчик, где точный счётчик, а где предварительная оценка?

Частые вопросы

Как посчитать слова в сканированном PDF для расчёта перевода?

Сначала попробуйте выделить и скопировать текст из PDF. Если текстового слоя нет, распознайте файл через OCR, сверьте результат с изображением страниц и только затем посчитайте слова в редакторе или переводческом инструменте. Ненадёжные фрагменты отметьте отдельно, а способ оценки согласуйте до начала работы.

Может ли Google Drive извлечь текст из сканированного PDF?

Да. Google Drive описывает преобразование многостраничных PDF и изображений JPEG, PNG и GIF в текст через открытие файла в Google Документах (справка Google Drive). После преобразования сравните результат с оригиналом: распознавание таблиц, колонок и сносок может быть ненадёжным.

Что делать, если OCR не даёт надёжного подсчёта слов?

Не используйте распознанное число как точный исходный объём. Проверьте ориентацию и чёткость страниц, повторно обработайте проблемные участки и, если ошибки сохраняются, договоритесь об оценке по страницам, выборке или времени. Руководство Apex Translations также предостерегает от точного подсчёта по ненадёжному OCR (материал о подсчёте слов).

Как проверить, является ли PDF сканом или текстовым документом?

Выделите предложение мышью и вставьте его в текстовый редактор. Если вместо слов появляется пустая строка или выделяется страница целиком, PDF, вероятно, содержит изображения без доступного текстового слоя. Проверьте больше одной страницы, если документ сочетает разные форматы.

Что лучше для расчёта перевода скана: цена за слово, страницу или час?

Цена за слово лучше подходит, когда исходный текст можно надёжно посчитать. Оценка по страницам может помочь для предварительной сметы однородного документа, а оплата времени - для ручной сверки или неразборчивых участков. Согласуйте критерии заранее: универсального тарифа для сканов нет.

Можно ли считать OCR точным, если получился связный текст?

Связный текст не гарантирует полного совпадения с изображением. Ошибки могут оставаться в именах, цифрах, таблицах и сносках, поэтому проверьте соответствующие места по скану. Подсчёт становится рабочей основой сметы только после оценки качества извлечённого текста.

Попробуйте ChatsControl

AI-платформа для профессиональных переводчиков

Попробовать бесплатно →