Сканований PDF у Word перед перекладом: порівняння способів

Порівнюємо OCR в Acrobat, Word, Google Drive та ABBYY: що краще розпізнає текст, збереже таблиці й підготує сканований PDF до перекладу.

Також: EN UK RU
Сканований PDF у Word перед перекладом: порівняння способів

47 сторінок договорів, довідок і додатків у сканованому PDF можуть здаватися готовими до перекладу. Але якщо в них немає текстового шару, програма бачить лише зображення. Спочатку запускай OCR - розпізнавання символів, а потім перевіряй текст і перекладай.

Для команди вибір конвертера - не просто питання зручності. Помилка в номері, злиті рядки таблиці чи пропущена примітка перейдуть далі й можуть змінити зміст документа. Нижче розбираємо, як перетворити сканований PDF на редагований Word і коли варто обрати кожен спосіб.

Що потрібно зробити зі сканованим PDF перед перекладом

Сканований PDF зазвичай складається із зображень сторінок, а не з тексту, який можна виділити курсором. OCR додає розпізнаний текстовий шар - після цього слова можна шукати, копіювати й редагувати. Довідка Adobe Acrobat описує такий шлях: відкрити Scan & OCR, вибрати документ, діапазон сторінок і мову, а потім натиснути Recognize Text.

Adobe Acrobat Help: “When you scan a paper document to PDF, the resulting file contains only image data, not searchable text.”

Українською: після сканування паперового документа PDF містить дані зображення, а не текст для пошуку.

Ось що це означає на практиці: відкрити PDF у Word недостатньо, щоб текст на сканованій сторінці став редагованим. Перевір, чи програма справді запустила OCR, а не просто вставила зображення сторінки в DOCX.

Перед конвертацією виріши, який результат тобі потрібен. Для простого листа може вистачити правильного тексту й приблизного оформлення. Для договору з таблицями, нумерацією та примітками важливо зберегти і слова, і зв’язки між елементами макета.

Команді зручно розділити задачу на три частини:

  1. Розпізнаний текст. Слова, цифри, назви та знаки мають збігатися зі сканом.
  2. Структура документа. Заголовки, абзаци, таблиці, колонки й примітки мають залишитися зрозумілими.
  3. Файл для перекладу. Редагований DOCX має підходити для роботи перекладача або системи машинного перекладу.

Не плутай пошуковий PDF із редагованим Word. Пошуковий PDF має текстовий шар, але залишається PDF. DOCX можна редагувати, проте під час конвертації сторінки й елементи макета можуть зміститися.

Microsoft Support: “The conversion works best with files that are mostly text.”

Українською: конвертація найкраще працює з файлами, у яких переважає текст.

Якщо команда готує пакет документів, не зупиняйся на файлі з розширенням .docx. Переконайся, що розпізнані слова можна звірити з оригіналом, а таблиці й примітки не перетворилися на випадковий набір рядків.

Про те, як оцінити обсяг роботи, читай у матеріалі як порахувати слова у сканованому PDF для перекладу. OCR може відкрити прихований текст і показати, що документа більше, ніж здавалося на перший погляд.

Які умови скану впливають на результат OCR

OCR не розпізнає будь-який документ без помилок. На результат впливають якість зображення, орієнтація сторінки, контраст, мова й складність макета.

Рекомендації RWS щодо PDF називають 300 dpi рекомендованою мінімальною роздільною здатністю для OCR. RWS також радить, якщо є змога, сканувати чорно-білим, а не у відтінках сірого чи кольорі, і зберігати PDF однією мовою. 300 dpi - це рекомендація постачальника, а не універсальна вимога для кожного документа.

Нахилена сторінка, плями, згини, рукописні фрагменти й слабкий контраст погіршують розпізнавання. Якщо людині складно розібрати текст на оригіналі, автоматична система теж може переплутати літери або пропустити їх.

Для OCR через Drive Google радить правильно орієнтувати сторінки, використовувати чіткі зображення з рівномірним освітленням і добрим контрастом. У довідці також зазначено, що висота тексту має бути щонайменше 10 пікселів, а серед рекомендованих шрифтів є Arial і Times New Roman: вимоги Google Drive до OCR. Ці поради стосуються саме Google Drive, а не всіх OCR-програм.

Перед розпізнаванням перевір:

  • чи не повернута сторінка боком або догори дриґом;
  • чи добре видно дрібні примітки, індекси та цифри;
  • чи не закривають печатки важливі слова;
  • чи правильно вибрана мова документа;
  • чи є в PDF одна мова або кілька;
  • чи не злилися в одному рядку колонки, які в оригіналі були окремими.

Мову вибирай уважно. Adobe пояснює, що система OCR використовує мовні словники, а для нелатинських систем письма в параметрах потрібно вказати відповідну мову. Якщо кириличний документ розпізнавати з налаштуванням для іншої мови, система може плутати схожі символи. Про вибір мови й сам процес читай у довідці Adobe.

Висока роздільна здатність сама по собі не виправить складний макет. RWS попереджає, що колонки, вбудовані зображення, таблиці й плаваючі текстові блоки можуть потребувати ручного вилучення та очищення перед машинним перекладом. Також RWS радить не вставляти розриви рядків або табуляції всередину речень: вони можуть погіршити результат машинного перекладу. Перевір ці рекомендації на сторінці RWS.

Уяви скан рахунка-фактури: основний текст читається добре, але суми стоять у вузьких колонках, а печатка закриває частину номерів. OCR може правильно розпізнати назви позицій і водночас пересунути цифри в сусідній стовпець. Сам факт, що в DOCX можна виділити текст, ще не означає, що файл готовий до перекладу.

Варіант 1: розпізнати PDF в Adobe Acrobat

В Adobe Acrobat є окремий сценарій OCR для сканованих PDF. У довідці Adobe шлях описано так: Scan & OCR, In this file, вибір діапазону сторінок і мови, а потім Recognize Text. Назви кнопок можуть змінюватися разом з інтерфейсом програми, тож звіряйся з актуальною довідкою Acrobat.

Після розпізнавання Acrobat створює пошукову версію PDF. Щоб отримати редагований Word-файл, перевір параметри експорту у своїй версії програми та відкрий результат у DOCX. Сам факт OCR не гарантує, що таблиці, колонки й переноси сторінок відтворені правильно.

Adobe описує обробку як одного файла, так і кількох. Тож пакетне розпізнавання може зекономити команді ручні дії, якщо надійшло багато PDF. Але воно не скасовує перевірки: переглянь кожен файл окремо, особливо якщо документи різняться якістю або мовою.

Коли Acrobat доречний: тобі потрібен пошуковий PDF і контрольований процес розпізнавання; у файлах є кілька сторінок або цілий пакет документів; важливо вручну вибрати мову й діапазон обробки.

Що перевірити після OCR: чи не зникли символи, чи збігаються заголовки, чи правильні числа, чи збереглися межі таблиць. Перевір і мову: Adobe прямо пов’язує якість розпізнавання з мовними словниками та параметрами.

Для юридичного документа зі складними таблицями заплануй окремий час на відновлення структури. Якщо колонка із сумою перетворилася на звичайний текстовий рядок, перекладач може пов’язати її не з тим описом послуги. Краще виправити DOCX до перекладу, ніж потім вгадувати, що до чого належить.

Варіант 2: відкрити PDF у Microsoft Word

Настільний Microsoft Word може відкрити PDF і створити його копію у форматі Word. Microsoft зазначає, що оригінальний PDF не змінюється, а найкраще конвертуються PDF, де переважає текст. Деталі шукай у довідці Microsoft про відкриття PDF у Word.

Якщо PDF уже має текстовий шар, цей шлях зручний: відкрий файл у настільному Word, погодься на конвертацію, перевір результат і збережи копію у форматі DOCX. Якщо PDF переважно складається зі сканованих зображень, не розраховуй на Word як на надійний OCR-інструмент.

Microsoft попереджає: якщо у PDF переважають діаграми або графіка, ціла сторінка може вставитися як зображення, а її текст не буде редагованим. Після відкриття перевір не лише кілька слів, а й те, чи можна виділити текст на кожній сторінці.

Word може також змінити макет і розриви сторінок. Microsoft називає серед проблемних елементів таблиці з проміжками між комірками, кольори й рамки сторінок, рамки тексту, примітки, що охоплюють сторінки, кінцеві примітки, закладки та коментарі. PDF має фіксований макет і може не зберігати зв’язки між абзацами, таблицями та колонками. Під час конвертації Word має відновити ці зв’язки, а не просто скопіювати готову структуру.

Microsoft також описує сценарій сканування й редагування документа. Інструкція стосується настільного Word для Microsoft 365 і підтримуваних постійних версій; веб- і мобільні програми можуть працювати інакше. Microsoft окремо попереджає, що перетворений документ не обов’язково відповідатиме оригіналу сторінка до сторінки.

Word зручний, коли: PDF переважно текстовий або має прості сторінки; у тебе є настільний Word; потрібно швидко отримати редаговану копію й потім її очистити.

Не обирай Word як єдиний крок, коли: PDF суцільно складається зі сканів; таблиці мають складні межі; потрібно зберегти точне розташування кожного елемента; у документі багато графіки чи приміток.

Перед перекладом відкрий DOCX і порівняй його з PDF. Перевір початок і кінець кожної сторінки, таблиці, нумерацію, колонтитули й переходи між сторінками. Якщо сторінка залишилася зображенням, повернися до OCR-інструмента, а не сприймай її як готовий текст.

Варіант 3: Google Drive і Google Docs

Google Drive розпізнає PDF або зображення, якщо відкрити файл за допомогою Google Docs. У довідці Google серед підтримуваних форматів названі PDF, JPEG, PNG і GIF. Для цього способу там же вказаний максимальний розмір вхідного файла 2 МБ; перед пакетною обробкою перевір актуальне обмеження в довідці Google Drive.

Процес простий: завантаж PDF у Drive, відкрий його за допомогою Google Docs і перевір результат розпізнавання. Якщо для роботи потрібен DOCX, експортуй документ із Google Docs і знову переглянь його у Word. Під час переходу між форматами оформлення може змінитися.

Google зазначає, що OCR може зберегти жирний і курсивний шрифт, розмір і тип шрифту та розриви рядків. Але в довідці є важливе попередження:

Google Drive Help: “Lists, tables, columns, footnotes, and endnotes are not likely to be detected.”

Українською: списки, таблиці, колонки, підрядкові та кінцеві примітки, найімовірніше, не будуть розпізнані.

Для листа з одним стовпцем тексту це може бути прийнятно. А от для договору з двома колонками або формуляра, де вміст комірки пов’язаний із певним полем, готуйся вручну відновлювати структуру.

Google Drive зручний як швидкий тест для невеликого чіткого файла з простим макетом. Для документів, що перевищують зазначений у довідці ліміт, або файлів із таблицями обери інший спосіб. Можна також розбити роботу на частини, якщо це не пошкодить структуру документа.

Після розпізнавання не вважай перенесення рядків доказом правильного OCR. Зістав зі сканом заголовки, списки, номери пунктів і примітки. Якщо колонки злилися в один рядок, віднови таблицю до того, як передавати документ перекладачеві.

Варіант 4: спеціалізована програма ABBYY FineReader PDF

ABBYY FineReader PDF призначений для перетворення сканів і PDF на редаговані документи Word та Excel. На сторінці продукту ABBYY описує локальне встановлення й кілька типів ліцензій; доступність залежить від ринку та умов продажу. Актуальні параметри перевіряй на офіційній сторінці цін ABBYY.

Під час підготовки матеріалу на сторінці ABBYY в європейському магазині були ціни €99 на рік для Standard для Windows, €165 на рік для Corporate для Windows і €69 на рік для Mac. Це ціни, показані під час дослідження, а не гарантований прайс для кожної країни. Перед придбанням перевір регіон, податки й умови поновлення на сторінці ABBYY.

Якщо команда регулярно обробляє документи, дивись не лише на якість OCR, а й на пакетну роботу. Для Corporate ABBYY вказує автоматизовані процедури конвертації з лімітом 5 000 сторінок на місяць. Примітка на сторінці уточнює, що це обмеження стосується автоматизованої обробки Hot Folder. Функції й ліміт перевіряй за поточними умовами на сторінці планів ABBYY.

Спеціалізований OCR-редактор має сенс, якщо ти регулярно отримуєш скани й хочеш окремо розпізнавати та вручну виправляти текст. Але назва програми не скасовує перевірки: результат залежить від скану, мови й макета. Перед вибором протестуй власні типові файли, а не лише демонстраційний документ.

Щоб порівняти інструменти, візьми той самий складний фрагмент: сторінку з таблицею, дрібним текстом, печаткою або двома колонками. Порахуй помилки в словах і числах, перевір збереження структури й зафіксуй, скільки часу йде на виправлення. Саме ручне очищення часто визначає, чи окупиться автоматизація у твоєму потоці.

Порівняння варіантів: що обрати команді

Немає інструмента, який однаково добре впорається з простим листом, багатосторінковим договором і пошкодженим архівним сканом. Порівнюй не обіцянку «конвертувати в Word», а весь процес: OCR, перевірку, відновлення макета й підготовку до перекладу.

Варіант Коли підходить Основне обмеження Що перевірити
Adobe Acrobat OCR Потрібен текстовий шар у PDF, контроль мови й діапазону сторінок або пакетне розпізнавання Пошуковий PDF не дорівнює перевіреному DOCX Експорт, мову, таблиці й точність тексту
Microsoft Word PDF переважно текстовий і потрібна редагована копія Сторінка зі скану може лишитися зображенням; можливі зміни макета Чи редагується текст на кожній сторінці
Google Drive OCR Невеликий простий файл і швидке розпізнавання через Docs У довідці вказано вхідний ліміт 2 МБ; таблиці й колонки можуть не визначитися Ліміт у поточній довідці, структуру та експорт DOCX
ABBYY FineReader PDF Команді потрібен спеціалізований OCR-процес і регулярна обробка сканів Ціна й функції залежать від ринку та плану Поточні ліцензійні умови та результат на власних файлах
Переклад PDF без попереднього DOCX Потрібно перевірити можливість прямого перекладу в хмарному сервісі Форматування сканованого PDF може втратитися; обмеження залежать від сервісу Чи підтримується саме сканований PDF і потрібний вихідний формат

Якщо команда вже має вихідний DOCX або PPTX, бери його замість PDF. У документації Google Cloud Translation сказано, що переклад редагованого DOCX чи PPTX зазвичай краще зберігає макет і стиль, ніж переклад PDF. Там же зазначено, що сервіс підтримує скановані PDF, але форматування під час перекладу може втратитися; складні таблиці, багатоколонковий макет і діаграми з підписами теж можуть втратити оформлення. Актуальні формати й обмеження дивись у документації Google Cloud Translation.

Для онлайн-запитів Google Cloud вказує ліміт PDF 20 МБ; сканований PDF обмежений 20 сторінками. Для нативного PDF документація наводить до 300 сторінок, якщо ввімкнено параметр native PDF, або 20 сторінок із видаленням тіней. Квоти можуть змінитися, тож перед виробничим запуском звір їх із поточною документацією Google Cloud.

Зверни увагу ще на один нюанс: Google Cloud зазначає, що в PDF зі змішаним нативним і сканованим вмістом сканована частина не перекладається. Перетворення PDF у DOCX для пакетного перекладу в цьому сценарії доступне для нативних PDF, а не для сканованих у такий самий спосіб. Не розраховуй, що сервіс однаково обробить усі сторінки змішаного файла.

Для перекладу зі збереженням структури можна розглянути й ChatsControl як окремий варіант для документів. Сервіс приймає DOCX, PDF і PowerPoint, а для сканів спочатку запускає OCR, після чого формує документ для перекладу. Результат можна переглядати поруч з оригіналом і перевіряти автоматичними засобами якості. Перевага цього потоку - робота з документом і його оформленням в одному процесі. Обмеження - хмарний формат роботи, менша кількість мов, ніж у Google Translate, і непридатність для рукописів та дуже поганих сканів. У продукту є безкоштовний рівень із лімітом символів та платні поповнення, але конкретну суму тут не наводимо, бо вона залежить від актуальних умов сервісу.

Якщо тобі потрібне повне керування перекладацькими пам’ятями, сегментами й командними процесами, документний перекладач не замінить CAT-систему чи TMS. Про підходи до подальшого редагування читай у матеріалі про моделі оплати MTPE: за словом, погодинно або за зусиллям.

Покроковий процес: від PDF до файла для перекладача

Не передавай на переклад перший DOCX, який створила програма. Пройди кілька кроків окремо: розпізнай текст, перевір його й лише тоді готуй файл для перекладача. Так ти не перенесеш очевидні помилки в переклад.

  1. Збережи оригінал. Не змінюй початковий PDF. Word створює копію для конвертації, а інші інструменти можуть створити пошукову версію. Оригінал потрібен для звірки.
  2. Визнач мову й тип файла. Перевір, чи PDF містить текст, зображення або і те, і те. Для OCR вибери фактичну мову документа, а не мову майбутнього перекладу.
  3. Оціни якість скану. Знайди нахилені сторінки, плями, слабкий контраст, печатки поверх тексту й рукописні доповнення. За потреби перескануй документ відповідно до рекомендацій виробника OCR.
  4. Запусти OCR. Вибери інструмент під структуру документа: для простого файла можна почати з Word або Google Drive; для спеціального OCR-процесу використовуй Acrobat чи FineReader.
  5. Перевір редагованість. Спробуй виділити текст на кожній сторінці DOCX. Якщо частина сторінки залишилася зображенням, запусти OCR повторно або познач її для ручного опрацювання.
  6. Звір важливе. Перевір за PDF імена, номери, дати, суми, заголовки, одиниці виміру й таблиці. Не покладайся на загальне враження від документа.
  7. Віднови макет. Перебудуй колонки й таблиці, якщо OCR злив їх в один текстовий потік. Якщо внутрішні розриви рядків заважають машинному перекладу, прибери їх.
  8. Передай контекст перекладачеві. Познач неоднозначні або нечіткі місця, залиш оригінал поруч і поясни, які елементи макета важливо зберегти.

Для внутрішньої перевірки зручно мати таку таблицю:

Перевірка Готово, якщо
Текст Ключові слова, імена й цифри звірені з оригіналом
Сторінки Текст не залишився зображенням без позначки
Таблиці Рядки й колонки мають зрозумілі зв’язки
Примітки Підрядкові та кінцеві примітки не зникли й не злилися з основним текстом
Неясні місця Нерозбірливий фрагмент позначено, а не вгадано
Переклад Перекладач отримав DOCX і вихідний PDF для звірки

Уяви, що в додатку до договору є перелік послуг у трьох колонках. Google Drive може розпізнати слова, але не визначити колонки, а Word - змінити їх розташування. У такому разі передай перекладачеві не лише текстовий файл: приклади вихідний PDF і віднови таблицю в DOCX, щоб було зрозуміло, який опис відповідає якій сумі.

У формах і документах із повторюваними полями перевір не лише видимий текст, а й порядок читання. OCR може поставити підпис із правої колонки після абзацу з лівої, хоча в оригіналі ці блоки не пов’язані. Під час швидкої перевірки це легко пропустити, але помилка вплине на переклад і подальше оформлення.

Підводні камені: що найчастіше ламається

Найпідступніша помилка OCR - не очевидна, а правдоподібна. Неправильно прочитаний символ у номері документа чи сумі може залишитися непоміченим, якщо ти перевіряєш лише загальну читабельність сторінки.

RWS прямо попереджає, що низька роздільна здатність, складний макет або колір можуть погіршити вилучення тексту. У рекомендаціях RWS також згадані нахил, плями, згини, рукописний текст і слабкий контраст як чинники, що заважають розпізнаванню. Докладніше про обмеження читай у документації RWS.

Окремо перевір ось що:

  • Таблиці та колонки. Система може розпізнати текст, але втратити зв’язок між значенням і заголовком стовпця. Google прямо попереджає, що таблиці й колонки можуть не визначитися.
  • Цифри й позначення. Звір номери, суми, дати, символи валют і скорочення зі сканом, а не лише між версіями DOCX.
  • Примітки. Нижні примітки можуть перейти в основний текст або зникнути. Google окремо називає виноски та кінцеві примітки проблемними для розпізнавання.
  • Рукописні фрагменти. Не покладайся на OCR, коли треба прочитати рукопис. Нечіткі доповнення звіряй з оригіналом вручну.
  • Переноси й розриви рядків. Розбите на кілька рядків слово або абзац із внутрішніми розривами може завадити наступному етапу машинного перекладу.
  • Сторінки-зображення. У Word сторінка може виглядати як документ, але насправді залишатися одним зображенням. Перевір, чи можна виділити й редагувати текст.

RWS Language Weaver documentation: “Since PDFs are complex formats, especially when resulting out of scanning another document, you may need to perform some manual extraction of the document to an editable format.”

Українською: PDF складно обробляти, особливо якщо його створено зі скану, тому перед редагуванням може знадобитися ручне вилучення вмісту.

Це не привід відмовлятися від OCR. Просто заклади ручну перевірку в процес одразу, а не виправляй помилки після перекладу. Для простого листа очищення може бути невеликим; для таблиць, колонок і приміток перевірка забере помітну частину роботи.

Не вгадуй нерозбірливий фрагмент. Познач його в документі й уточни у власника файла або попроси якісніший оригінал. Якщо перекладач не знає, що цифра чи прізвище були нечитабельними, хибне розпізнавання може здатися достовірним джерелом.

У документах із підписами й печатками розрізняй текст, який треба перекласти, та зображення, яке потрібно зберегти для ідентифікації. OCR не підтверджує справжність документа й не замінює перевірку оригіналу. Його завдання - дати текст для роботи, а не засвідчити правильність чи юридичну силу скану.

FAQ

Як конвертувати сканований PDF у редагований Word перед перекладом?

Запусти OCR у програмі, що підтримує розпізнавання PDF, і вибери фактичну мову документа. Потім експортуй або збережи результат у DOCX, звір текст і структуру з оригіналом та познач місця, які не вдалося надійно розпізнати.

Який OCR найкраще зберігає таблиці й форматування у Word?

Універсальної відповіді немає: усе залежить від якості скану, мови та складності макета. Google попереджає, що Drive OCR може не виявити таблиці й колонки, тож для складного документа порівняй кілька інструментів на однаковій сторінці й оціни обсяг ручного виправлення.

Чи може Microsoft Word перетворити сканований PDF на редагований текст?

Word може відкрити PDF і конвертувати його копію в документ Word, але Microsoft зазначає, що найкраще конвертуються файли, у яких переважає текст. Якщо PDF переважно складається з графіки чи зображень, сторінка може залишитися зображенням без редагованого тексту.

Чи підходить Google Drive для підготовки сканованого PDF до перекладу?

Google Drive може розпізнати PDF через Google Docs. Довідка Google вказує максимальний розмір вхідного файла 2 МБ і попереджає, що таблиці, колонки, списки й примітки можуть не розпізнатися. Актуальні умови перевіряй у довідці Google Drive.

Чи треба розпізнати скан перед машинним перекладом?

Так, якщо PDF містить лише зображення: системі перекладу потрібен доступний текст або окремий процес OCR. Після розпізнавання перевір цифри, назви й макет, бо помилка OCR перейде в переклад.

Чи збережеться оригінальний PDF після конвертації у Word?

У Microsoft Word конвертація створює копію, а початковий PDF залишається незмінним, згідно з довідкою Microsoft. Зберігай оригінал і звіряй із ним текст та оформлення.

Що робити, якщо OCR неправильно розпізнав таблицю або печатку?

Не передавай сумнівний DOCX одразу на переклад. Звір фрагмент зі сканом, віднови таблицю вручну й познач нерозбірливий текст для уточнення. Не вгадуй суму, ім’я чи номер документа.

Чи можна перекладати сканований PDF без конвертації у Word?

Це залежить від сервісу й типу PDF. Google Cloud Translation підтримує скановані PDF, але попереджає про можливу втрату форматування; у змішаних PDF сканована частина може не перекладатися. Перевір обмеження в документації Google Cloud і звір результат зі сканом.

Для простого документа вистачить OCR і швидкої перевірки тексту. Для договору, анкети чи таблиці заклади окремий час на відновлення структури й звіряння важливих полів. Передай перекладачеві перевірений DOCX разом з оригінальним PDF: так він матиме контекст і зможе перевірити сумнівні місця.

Спробуйте ChatsControl

AI-платформа для професійних перекладачів

Спробувати безкоштовно →