Як порахувати слова у сканованому PDF для перекладу¶
Клієнт надсилає PDF на 40 сторінок, а лічильник слів показує нуль. Ти бачиш текст і можеш його прочитати, але програма ніби не помічає жодної літери. Назвати ціну без зрозумілої основи в такій ситуації непросто.
Причина часто не в самому лічильнику. Сканований PDF може складатися із зображень сторінок, а не містити текстовий шар. Спершу розпізнай зображення за допомогою OCR, потім звір отриманий текст з оригіналом і лише тоді рахуй слова.
Тут важливе не саме число, а те, наскільки йому можна довіряти. OCR може переплутати літери, пропустити рядок або неправильно обробити таблицю. Якщо назвати такий результат точним, кошторис може не відповідати реальному обсягу роботи.
Що відбувається, коли лічильник бачить нуль¶
Лічильник слів працює з текстом, а не з картинками літер. Якщо на сторінці PDF збережено лише фотографію чи скан, програма бачить зображення, хоча ти без проблем читаєш надруковане речення.
Текстовий шар - це дані, завдяки яким можна виділяти й копіювати слова, шукати фрази та обробляти документ як текст. У PDF текстовий шар може співіснувати із зображенням сторінки. А у скані тексту, який бачить людина, може бути багато, тоді як для лічильника його немає зовсім.
Перевір PDF за кілька простих кроків:
- Відкрий файл у переглядачі.
- Спробуй виділити мишею слово або речення.
- Скопіюй виділений фрагмент і встав його в текстовий редактор.
- Знайди в документі слово, яке точно бачиш на сторінці.
Якщо текст виділяється і нормально вставляється, PDF уже має текстовий шар. Якщо ж виділяється ціла сторінка як одна картинка або нічого не копіюється, перед тобою може бути скан без тексту. Пошук теж допомагає, але не доводить, що весь файл можна порахувати одним лічильником: частина сторінок може містити текст, а решта - бути зображеннями.
Слово «сканований» не завжди означає «лише зображення». Документ могли розпізнати раніше, тож під картинкою вже є прихований текстовий шар. Буває й навпаки: чіткий цифровий PDF виявляється пласким зображенням, бо його створили фотографуванням або скануванням.
Ось як пояснює довідка Google Drive:
“Google describes Drive’s workflow as converting an image/PDF to text using OCR.”
Якщо простіше, OCR перетворює зображення символів на текстові дані, з якими вже працює лічильник. Але розпізнавання не перевіряє якість і не гарантує, що кожну літеру визначено правильно.
Для перекладача ця різниця впливає і на кошторис, і на планування. Текстовий документ можна порахувати звичайним інструментом. Скан спершу треба підготувати, а іноді ще й звірити вручну. Якщо працюєш із різними форматами, у матеріалі про збереження форматування у Word і PDF пояснено, чому витягти текст - не те саме, що зберегти структуру документа.
Як отримати текст із PDF за допомогою OCR¶
OCR, або оптичне розпізнавання символів, аналізує зображення й перетворює видимі літери на текст. Для підрахунку недостатньо просто запустити розпізнавання: перевір, чи підходить цей процес саме для твого документа й мови.
Варіант із Google Drive¶
Google Drive може перетворити багатосторінкові PDF і зображення JPEG, PNG та GIF на текст, якщо відкрити файл у Google Docs. Отриманий текст підійде як чернетка для підрахунку, але спершу його треба переглянути.
Зроби так:
- Завантаж файл у Google Drive.
- Відкрий його за допомогою Google Docs.
- Перевір, чи з’явився текст і чи можна його скопіювати.
- Скопіюй або збережи текст у редакторі, де зможеш його перевірити й порахувати слова.
- Зістав результат з оригінальним PDF, особливо на сторінках зі складним макетом.
У рекомендаціях Google Drive щодо розпізнавання, доступних на час дослідження, зазначено розмір файлу до 2 MB і висоту тексту в зображенні щонайменше 10 пікселів. Google також радить використовувати чіткі зображення з рівномірним освітленням і виразним контрастом, а сторінку тримати в правильному положенні (довідка Google Drive, сторінка без дати публікації).
Це орієнтири для рекомендованого процесу, а не доказ того, що більший чи менш чіткий файл неможливо розпізнати. Якщо документ не відповідає цим параметрам, уважніше перевір результат. Повернута набік, затемнена чи розмита сторінка може розпізнатися гірше, ніж рівний чіткий скан.
Перевір і мову документа. Google Drive визначає її автоматично, а довідка Google містить перелік підтримуваних мов. Перш ніж брати отриманий текст для кошторису, переконайся, що мова оригіналу підтримується в цьому процесі (довідка Google Drive). Якщо на сторінці є кілька мов, абревіатури чи спеціальні символи, переглянь ці місця окремо.
Варіант із переглядачем PDF у Chrome¶
Google описує й інший варіант: переглядач PDF у Chrome може розпізнати текст у сканованому PDF, щоб його можна було шукати й виділяти. Після розпізнавання текст можна шукати, копіювати й вставляти (довідка Google Chrome).
У довідці Google Chrome зазначено:
“The conversion is completed on your device without sending any data to Google or third parties.”
Це стосується саме описаного OCR у переглядачі Chrome. Не перенось це твердження на інші програми й онлайн-сервіси, доки окремо не перевіриш, як вони працюють із файлами.
Після розпізнавання перевір сторінки на початку, у середині та наприкінці документа. Знайоме слово в пошуку покаже, що текст доступний, але не підтвердить, що кожен рядок розпізнано правильно. Для кошторису додатково переглянь таблиці, примітки й сторінки з іншою орієнтацією.
Перевірка після розпізнавання¶
Порахувати слова можна в текстовому редакторі або інструменті, яким ти користуєшся для перекладацької роботи. Але джерело, з яким треба звірятися, - оригінальний скан, а не файл після автоматичного розпізнавання.
Перевір такі місця:
- заголовки й підзаголовки;
- таблиці та колонки;
- виноски й примітки;
- номери, дати й ідентифікатори;
- слова біля печаток, ліній і підписів;
- абзаци з дрібним або блідим шрифтом;
- сторінки, структура яких відрізняється від решти.
Google попереджає: після розпізнавання можуть зберегтися жирний і курсивний шрифт, його розмір і тип, а також розриви рядків. Водночас списки, таблиці, колонки, виноски й кінцеві примітки можуть визначатися ненадійно. Тож навіть на вигляд цілісний текст може йти в неправильному порядку (довідка Google Drive).
Остерігайся подвійного підрахунку. Деякі PDF містять і зображення сторінки, і прихований текстовий шар. Якщо повторно витягти текст або скопіювати його не з того шару, в результаті з’являться дублікати. Перш ніж передавати число клієнту, перевір, чи не повторюються заголовки, абзаци або цілі сторінки.
Якщо документ треба не лише розпізнати, а й перекласти, розділяй підготовку тексту та переклад. Огляд OCR для сканованих PDF і фото пояснює, чому розпізнавання й подальша робота з перекладом мають різні вимоги.
Як перетворити OCR-підрахунок на обґрунтований кошторис¶
Кошторис для сканованого PDF має пояснювати, що саме пораховано і де залишаються сумніви. Одне число без опису методу не показує, чи враховано всі сторінки, лише видимий текст або результат автоматичного розпізнавання.
Оформи роботу так:
- Зафіксуй вхідний файл. Збережи оригінальний PDF і не замінюй його розпізнаною копією. Саме оригінал потрібен, щоб перевіряти сумнівні місця.
- Перевір текстовий шар. Спробуй виділити, скопіювати й знайти фрагмент тексту.
- Запусти OCR, якщо текстового шару немає або його недостатньо. Обери процес, який підтримує формат і мову документа.
- Перевір результат на окремих ділянках. Особливо уважно звір макет, дрібний текст, таблиці й примітки.
- Порахуй слова у витягнутому тексті. Запиши, як отримано число і які елементи входять до підрахунку.
- Погодь основу ціни. Якщо розпізнавання ненадійне, не подавай його результат як точну кількість вихідних слів.
Так клієнт зрозуміє, чому оцінка може відрізнятися від числа в лічильнику, відкритому на оригінальному PDF. У кошторисі можна написати: «Попередній обсяг отримано через OCR; таблиці та примітки потрібно звірити з оригіналом». Так ти не приховаєш обмеження й не створиш враження, що автоматичне число вже повністю перевірено.
В опублікованих рекомендаціях Apex Translations радять використовувати електронний підрахунок вихідного тексту, якщо його можна надійно встановити: він дає тверду основу для розрахунку до фінансових зобов’язань. У документі також описано, як перед підрахунком перетворити сканований PDF на текст за допомогою OCR. Водночас автори зазначають, що через низьку якість скану надійного числа може не вийти (Apex Translations, опубліковані рекомендації без дати).
Ось що пише Apex Translations у рекомендаціях щодо підрахунку:
“When a reliable source word count cannot be established, its quotations may instead be based on an estimate of the target-text word count.”
Це політика конкретного бюро, а не загальне правило для всіх перекладачів. Якщо надійно порахувати вихідний текст не вдається, погодь із клієнтом іншу основу кошторису до початку роботи.
За словами, сторінками чи часом¶
Обирай модель оплати відповідно до того, що в документі можна надійно виміряти. Якщо текстовий шар якісний, підрахунок вихідних слів дає зрозумілу основу для пропозиції. Якщо OCR спотворює або пропускає текст, не вдавай, що маєш точне число.
| Основа оцінювання | Коли підходить | Що слід погодити |
|---|---|---|
| Кількість слів вихідного тексту | Текст можна витягти й перевірити | Який інструмент і які елементи входять до підрахунку |
| Оцінка слів цільового тексту | Надійний підрахунок оригіналу недоступний, але можна оцінити результат | Що це оцінка, а не точне число, і як узгоджуються відхилення |
| Кількість сторінок | Файл має однорідний макет, а швидкий підрахунок слів неможливий | Який обсяг сторінки вважається базовим і як враховуються заповненість та складність |
| Оплата за час | Розпізнавання і ручна звірка становлять значну частину роботи | Які етапи включено в оплачуваний час і як його фіксують |
Жодна модель не підходить автоматично для кожного скану. На сторінках може бути різна кількість тексту, таблиць, приміток і рукописних позначок. Підрахунок за сторінками здатен приховати цю різницю. Для погодинної оцінки теж домовся про межі: чи входять у неї виправлення OCR і звіряння з оригіналом.
ISO 17100:2015 описує вимоги до основних процесів, ресурсів та інших аспектів надання перекладацьких послуг відповідно до застосовних специфікацій. Але в описі стандарту немає універсального тарифу за слово (ISO 17100:2015). Тож професійний стандарт не визначає, чи слід оцінювати конкретний скан за словами, сторінками або часом.
Для роботи з різними моделями ціноутворення переглянь порівняння вартості за слово, сторінку й документ. Перш ніж надіслати кошторис, запиши метод підрахунку, якість доступного тексту й межі ручної перевірки. Коротке пояснення допоможе уникнути суперечки, якщо остаточна сума відрізнятиметься від попередньої оцінки.
Коли OCR не потрібен або не дає надійного результату¶
Не запускай OCR, якщо PDF уже містить повний і правильний текстовий шар. Перевір виділення на різних сторінках, скопіюй текст у редактор і порахуй слова. Повторне розпізнавання може додати нові помилки, не покращивши вихідні дані.
Не вважай OCR достатньою підставою для точної ціни, якщо скан нечіткий, текст перекошений, контраст слабкий або макет складний. Автоматичне число може не врахувати частину змісту. Google Drive радить використовувати чіткі, рівно освітлені зображення з виразним контрастом і правильною орієнтацією, а також попереджає про складні елементи макета (довідка Google Drive).
Рукописний текст - окрема проблема: розпізнавання друкованих символів не гарантує надійної обробки рукопису. Якщо рукописні помітки важливі для перекладу, не додавай їх до підтвердженого підрахунку без перевірки людиною. За потреби оціни цю частину окремо.
У PDF можуть бути сторінки різної якості. Наприклад, основний текст чіткий, а кілька додатків - бліді або сфотографовані під кутом. Одне загальне число приховує різницю. Познач проблемні сторінки й опиши їх окремо, замість того щоб поширювати точність найкращої ділянки на весь документ.
Якщо OCR не дає надійного тексту, обери практичний варіант:
- попроси клієнта надіслати вихідний DOCX або PDF із текстовим шаром, якщо такий файл є;
- перевір, чи можна використати інший, якісніший скан;
- погодь оцінювання за сторінками або часом і чітко опиши межі;
- оціни обсяг цільового тексту, якщо обидві сторони згодні на такий підхід;
- розділи документ на частини з надійним і ненадійним OCR, якщо це допоможе пояснити кошторис.
Кожен із цих варіантів допомагає чесно показати невизначеність. Якісніший файл знижує ризик помилок розпізнавання, а оплата за час або сторінки не маскує його під точну кількість слів.
Якщо документ має зберегти макет, не забувай: витягування тексту саме по собі не зберігає порядок читання таблиць і колонок. Матеріал про переклад Word і PDF зі збереженням форматування пояснює, чому після витягування тексту його структуру все одно треба звірити з оригіналом.
Поширені помилки під час підрахунку сканованого документа¶
Найчастіше підводить не програма, а впевненість у числі, яке вона показала. Конкретна цифра в кошторисі звучить переконливо, але це ще не означає, що вона надійна.
Вважати видимий текст доступним для лічильника¶
Людина читає зображення, бо розпізнає форму літер. Лічильник, який аналізує текстовий шар, не отримує цих даних. Перевір, чи можна виділити й скопіювати текст, замість того щоб робити висновок лише з того, що PDF відкривається й виглядає чітко.
Довіряти всьому розпізнаному тексту¶
OCR може замінити символ, пропустити рядок або переставити частини сторінки. Через ці помилки підрахунок здатен зрости, зменшитися або стати непридатним для роботи. Зістав результат з оригіналом, а сумнівні місця познач, не вважаючи їх правильними за замовчуванням.
Не перевіряти таблиці й примітки¶
Google прямо попереджає, що таблиці, колонки, списки, виноски й кінцеві примітки під час перетворення в Google Drive можуть визначатися ненадійно (довідка Google Drive). Якщо важлива частина документа міститься саме там, перевірка лише основних абзаців не покаже всіх пропусків.
Змішувати оцінку з підтвердженим підрахунком¶
Попередній обсяг і підтверджена кількість слів - не одне й те саме. Якщо поки що неможливо точно порахувати вихідний текст, так і напиши. Apex Translations окремо описує, як низька якість PDF заважає надійному підрахунку, і згадує оцінювання за цільовим текстом, коли встановити обсяг оригіналу не вдається (Apex Translations).
Не пояснювати спосіб оцінювання¶
Клієнт може подумати, що кошторис за сканом спирається на перевірену кількість вихідних слів. Додай до пропозиції одне речення, щоб не залишати місця для здогадів: «Обсяг отримано за OCR і ще не підтверджено вручну» або «Ціну погоджено за сторінками, оскільки OCR не дає надійного числа».
Не обіцяй точності, якої немає. Якщо одна частина PDF розпізнається добре, а інша - погано, назви обидві умови. Якщо складний макет потребує ручної перевірки, внеси цю роботу в оцінку окремо або заздалегідь погодь модель оплати.
Перш ніж надіслати пропозицію, пройдися цим коротким списком:
- чи перевірено, що PDF не має повного текстового шару;
- чи зазначено, за допомогою якого OCR отримано текст;
- чи перевірено мову й складні сторінки;
- чи звірено таблиці, колонки й примітки;
- чи названо підрахунок точним, попереднім або орієнтовним;
- чи погоджено з клієнтом основу оцінювання.
FAQ¶
Як порахувати слова у сканованому PDF для кошторису перекладу?¶
Спершу перевір, чи можна виділяти й копіювати текст. Якщо PDF містить лише зображення сторінок, виконай OCR, вичитай результат і порахуй слова в текстовому редакторі або спеціалізованому лічильнику.
Чи може Google Drive витягти текст зі сканованого PDF?¶
Так. Google Drive перетворює багатосторінкові PDF і файли JPEG, PNG та GIF на текст, якщо відкрити їх у Google Docs (довідка Google Drive). Перевір результат вручну, особливо якщо в документі є таблиці, колонки чи примітки.
Що робити, якщо OCR не дає надійного підрахунку слів?¶
Не називай приблизне число точним. Перевір якість зображень і розпізнаний текст, а тоді погодь із клієнтом основу оцінювання: ручний підрахунок, обсяг цільового тексту, сторінки або час. Apex Translations описує оцінку за цільовим текстом як власний варіант політики, а не правило для всіх (Apex Translations).
За словами, сторінками чи годинами оцінювати переклад скану?¶
Обери модель, яку можна застосувати до документа надійно. Підрахунок вихідних слів підходить, коли текстовий шар або перевірений OCR дає придатний текст. Якщо ні, заздалегідь погодь іншу основу й поясни, як визначатиметься обсяг.
Як перевірити, чи PDF сканований або придатний до пошуку?¶
Спробуй виділити речення мишею, скопіювати його або знайти слово через пошук у PDF. Якщо текст не виділяється, а пошук не знаходить видимий фрагмент, документ може бути зображенням без текстового шару. Перевір кілька сторінок: у складеному PDF можуть бути різні типи сторінок.