Сканований PDF у Trados і memoQ: чому не імпортується

Чому Trados і memoQ не читають сканований PDF, як розпізнати проблему з текстовим шаром і побудувати надійний OCR-процес для агенції.

Також: EN UK RU
Сканований PDF у Trados і memoQ: чому не імпортується

Коли сканований PDF зупиняє проєкт

Клієнт надсилає PDF на переклад, дедлайн уже погоджений, а Trados або memoQ не створює проєкт чи показує порожні сегменти. Перша думка - щось не так із ліцензією, фільтром або CAT-інструментом. Але часто причина простіша: PDF складається із зображень, а тексту, який програма могла б прочитати, у файлі немає.

На екрані PDF виглядає як документ, але його сторінки можуть бути просто фотографіями літер. Ти бачиш текст, програма - пікселі. Щоб перетворити ці пікселі на слова, потрібен OCR, тобто оптичне розпізнавання символів. OCR знаходить символи на зображенні й створює текстовий шар, який можна шукати, копіювати й обробляти в CAT-системі.

Саме різниця між видимим текстом і текстовим шаром пояснює більшість проблем з імпортом. PDF може містити справжній текст, зображення сторінок або зображення з уже доданим OCR-шаром. На вигляд ці файли можуть бути однаковими, але для Trados і memoQ це різні вхідні дані.

У примітці RWS про зміну технології перетворення PDF є така порада:

У примітці RWS про зміну технології перетворення PDF сказано: “PDF should always be seen as a workaround to the situation where the original file cannot be made available.” Переклад: PDF варто вважати запасним варіантом, коли оригінальний файл недоступний.

Порада не лише про зручність. PDF часто зберігає вигляд сторінки, але не структуру документа: абзаци, таблиці, заголовки й порядок читання можуть не збігатися з тим, чого очікує CAT-інструмент. Якщо клієнт має вихідний DOCX, презентацію чи інший редагований файл, агенція часто заощадить час на розпізнаванні та відновленні макета.

Спершу з’ясуй, з чим маєш справу: з помилкою імпорту чи з файлом, який треба підготувати. Якщо текст можна виділити, але після імпорту він спотворений, проблема може бути в порядку читання або перетворенні структури. Якщо слова взагалі не виділяються, починай з OCR, а не з повторного налаштування проєкту.

Як порахувати слова у сканованому PDF для перекладу пояснює, чому підрахунок за кількістю сторінок ненадійний і що врахувати до оцінки замовлення. Для агенції ця перевірка потрібна ще до запуску проєкту: нечіткий скан може вимагати не лише розпізнавання, а й ручного звіряння.

Що саме бачать Trados і memoQ у PDF

PDF - це формат відображення сторінки, а не гарантія, що програма зможе прочитати текст. CAT-система має витягти текст із файлу, розбити його на сегменти й підготувати до перекладу. Якщо документ складається із зображень, витягати текст просто ні звідки.

Розрізняй три типи файлів:

Тип PDF Що містить файл Що перевірити перед імпортом
Текстовий PDF Текстові об’єкти, створені з документа або редактора Чи виділяються слова і чи зберігається читабельний порядок
Сканований PDF Зображення сторінок без машинозчитуваного тексту Чи потрібне OCR для кожної сторінки
Сканований PDF з OCR-шаром Зображення сторінок і розпізнаний текстовий шар Чи збігається розпізнаний текст із зображенням

Швидко перевірити файл можна без CAT-системи. Відкрий PDF у програмі для читання, виділи слово й скопіюй його в текстовий редактор. Якщо виділяється окреме слово, текстовий шар, найімовірніше, є. Якщо мишка лише малює прямокутник навколо всієї сторінки або копіювання не дає тексту, сторінка може бути зображенням.

Однієї сторінки для перевірки не завжди досить. PDF може бути змішаним: перші сторінки створені з DOCX, а додатки відскановані; частина сторінок має OCR-шар, а частина - ні. Перевір кілька сторінок, особливо ті, де є таблиці, печатки, дрібний шрифт або рукописні позначки.

Документація memoQ прямо каже: програма не витягує текст зі сканованих PDF, сторінки яких збережені як зображення. Такий файл спершу треба обробити зовнішньою програмою OCR, а тоді імпортувати результат у memoQ: довідка memoQ про PDF.

У довідці memoQ обмеження сформульоване прямо:

Довідка memoQ формулює обмеження прямо: “Can’t import scanned PDF files: memoQ doesn’t extract text from scanned PDF files, where the pages are saved as images and not as text.” Переклад: memoQ не витягує текст зі сканованих PDF, сторінки яких збережені як зображення.

Для менеджера проєкту це означає, що наступний крок зрозумілий. Повторний імпорт того самого зображення в memoQ не створить текстовий шар. Потрібно або отримати вихідний файл, або виконати OCR поза CAT-системою.

У Trados усе залежить від технології та версії. У примітці RWS про нову технологію конвертації PDF, запроваджену 13 березня 2023 року та пов’язану з Studio CU6, зазначено: система не перетворює звичайне зображення скану, хоча може спробувати обробити сканований текст, який уже можна виділити. Тож якщо PDF відкрився в Trados, це ще не означає, що програма розпізнала сторінки-зображення.

Перед тим як скористатися старою інструкцією, перевір, для якої версії її писали. RWS повідомляла про зміни в PDF-перетворенні від березня 2023 року, а документація параметрів PDF для Trados Studio 2024 SR1 описує окремі режими відновлення макета. Інструкція для іншої версії або старого додатка може не підійти: документація PDF-фільтра Trados Studio 2024 SR1.

Як агенція готує скан до перекладу

Зі сканованим PDF зручніше працювати, якщо розбити підготовку на окремі перевірки. Мета не просто відкрити файл у CAT-інструменті. Потрібен текст, що збігається із зображенням, має правильний порядок читання і придатний для перекладу та контролю.

  1. Перевірте, чи доступний вихідний файл. Попросіть клієнта надати DOCX, файл верстки або інший редагований оригінал. RWS радить використовувати PDF як обхідний шлях, коли вихідний файл отримати неможливо. Робота з оригінальним форматом зазвичай означає менше ручного відновлення структури.

  2. З’ясуйте, чи є в PDF текстовий шар. Відкрийте файл і спробуйте виділити та скопіювати слово. Якщо документ змішаний або зібраний із матеріалів різного походження, перевірте кілька сторінок. Немає тексту - позначте файл як такий, що потребує OCR.

  3. Оцініть якість зображення. Перевірте різкість, контраст, нахил сторінок, плями, обрізані поля й читабельність дрібного шрифту. Рукописні частини та погана якість потребуватимуть особливої уваги: OCR може видати правдоподібний, але неправильний текст.

  4. Розпізнайте текст у зовнішній програмі. Для memoQ офіційна довідка наводить приклади програм для читання сторінок - Nuance OmniPage та ABBYY FineReader. Виконайте в такій програмі OCR і збережіть результат у DOCX, намагаючись зберегти потік тексту й форматування. Конкретний інструмент агенція обирає за доступністю, сумісністю та результатом на тестовій сторінці.

  5. Перевірте DOCX до імпорту. Відкрийте конвертований документ і звірте кожну сторінку з PDF. Виправте порядок блоків, розірвані рядки, помилково розпізнані символи, пропущені колонки й злиті комірки таблиць. Окремо перевірте заголовки, імена, числа, одиниці вимірювання та позначки, які OCR може переплутати.

  6. Оберіть формат і режим імпорту в CAT-системі. Для перекладу memoQ рекомендує DOCX із текстом і форматуванням, наскільки їх вдалося зберегти. Plain text може втратити форматування і, за довідкою memoQ, не рекомендований для документів, які перекладатимуть. Такий спосіб може підійти для корпусу LiveDocs або вирівнювання.

  7. Перевірте сегментацію та підготуйте експорт. Після імпорту перегляньте початок, середину й кінець документа, а також таблиці та фрагменти з незвичною версткою. Після перекладу звірте структуру експортованого DOCX із погодженим способом здавання. memoQ не створює перекладений PDF із PDF-джерела, а експортує DOCX або звичайний текст - залежно від способу імпорту.

Розподіліть відповідальність між командою. Технічний виконавець відповідає за OCR і початкове виправлення файлу; перекладач повідомляє про підозрілі фрагменти; менеджер проєкту погоджує з клієнтом, що можна відновити і який фінальний формат потрібен. Якщо перекладач помітив безглузде ім’я, дивну цифру чи обірваний абзац, не треба мовчки перекладати здогад. Спершу звірте фрагмент із зображенням.

Перевірка перед імпортом не має перетворюватися на повне переверстування. Завдання агенції - підготувати правильний текстовий потік для перекладу й передбачуваний результат, а не обов’язково відтворити кожен декоративний елемент сторінки. Вимоги до фінального макета погоджуйте окремо, особливо якщо потрібен PDF, схожий на оригінал.

Де ламається розпізнавання і як обрати метод

OCR не читає документ так, як людина. Програма знаходить контури символів і намагається визначити слова за зображенням та алгоритмами розпізнавання. Помилки з’являються не лише через поганий скан: складна верстка, кілька колонок і незвичні символи теж можуть збити порядок або змінити вміст.

Поширена помилка в агенціях - оцінювати OCR лише за тим, що DOCX відкривається і містить текст. Але сам факт, що текст є, ще не доводить його точності. У файлі можуть бути пропуски, випадкові розриви рядків, переплутані колонки чи цифри, схожі на літери. Така помилка може пройти через переклад і потрапити у фінальну версію.

Ситуація після OCR Що перевірити Наступна дія
Текст читається, але абзаци перемішані Порядок колонок, заголовків і приміток Перебудувати текстовий потік до імпорту
Таблиця перетворилася на рядки тексту Межі колонок, одиниці та зв’язок значень із заголовками Відновити таблицю або погодити інший формат
Ім’я чи номер виглядає підозріло Зображення оригіналу, схожі символи, розділові знаки Звірити вручну й позначити непевні місця
Частина сторінок порожня Наявність текстового шару, якість скану, обрізані поля Повторити OCR для сторінок або запитати кращий файл
Розпізнаний текст коректний, але макет незручний Потребу в точній верстці проти потреби в читабельному потоці Обрати режим відновлення й узгодити вихідний формат

Документація memoQ попереджає: PDF не є текстовим форматом, тому потік тексту після імпорту може бути відсутнім або йти не в тому порядку. Якщо імпортований текст спотворений, довідка радить виконати OCR. Під час перетворення PDF у DOCX memoQ описує компроміс: можна зберегти потік тексту, пожертвувавши частиною форматування, або намагатися зберегти форматування, ризикуючи втратити частину тексту.

На таблицях це особливо помітно. Якщо головне - послідовно прочитати й перекласти вміст, режим із правильним потоком тексту може бути кориснішим за майже точне розташування елементів. Якщо значення має залишатися поруч із заголовком, втрата зв’язку між колонками може стати серйозною помилкою. Спершу визнач, що критично для конкретного документа, і лише тоді обирай режим конвертації.

У Trados Studio 2024 SR1 документація описує режими Flowing, Continuous та Exact. Exact використовує текстові поля Word, щоб відтворити вигляд сторінки, а Flowing зберігає потік тексту й елементи сторінки. Ці режими описані для конкретної версії, і жоден із них не гарантує однакового результату для кожного PDF: налаштування PDF у Trados Studio 2024 SR1.

Exact може стати в пригоді, якщо важливо бачити компонування сторінки, але текстові поля здатні ускладнити редагування. Flowing краще підходить для послідовного перекладу, зате може змінити зовнішній вигляд. Якщо документ складний, випробуй обидва підходи на характерній сторінці. Не обирай режим лише за назвою.

У матеріалі memoQ про PDF у memoQ 8.1 Пітер Рейнольдс писав:

У матеріалі memoQ про PDF у memoQ 8.1 Пітер Рейнольдс писав: “Image-based PDFs will still cause you problems as they will any other OCR software. Problems can include characters and formatting.” Переклад: PDF із зображеннями створюватимуть труднощі й в інших OCR-програмах; проблеми можуть стосуватися символів і форматування.

Цитата описує історичний контекст інтеграції memoQ 8.1 і TransPDF, а не поточний спосіб роботи. Але нагадування досі слушне: після OCR текст усе одно треба перевірити. Поточна довідка memoQ зазначає, що TransPDF більше недоступний у memoQ 10.4 і новіших версіях. Тож старі інструкції з цією інтеграцією не описують актуальний вбудований процес: поточна документація memoQ.

Старі рекомендації щодо Trados теж перевіряй перед використанням. RWS повідомляла, що старий тип PDF, який працював з IRIS, припинили використовувати в березні 2023 року. Сторінка додатка вказує на несумісність із Studio 2022, починаючи з версії 4.0.0.0: статус IRIS PDF OCR Support for Studio. Тож порада «встановіть IRIS» може не спрацювати у твоєму середовищі. Перш ніж додавати інструмент до процесу агенції, перевір сумісність із конкретною версією Trados.

Коли прямий імпорт не потрібен і що узгодити з клієнтом

OCR не завжди має бути наступним кроком. Перед конвертацією з’ясуй, чи потрібен агенції саме PDF як джерело. Якщо завдання стосується тексту, а клієнт має редагований оригінал, із ним зазвичай простіше працювати, ніж відновлювати текст із картинки.

Попроси вихідний файл, якщо з PDF не вдається надійно витягти текст або він містить таблиці й складну багатоколонкову структуру. RWS радить за можливості брати оригінальний файл і називає PDF обхідним шляхом, що додає обробки. Файл із програми верстки, DOCX або презентація може зберегти логічні блоки, яких не видно на зображенні сторінки.

Якщо вихідного файла немає, погодь із клієнтом межі підготовки. Запитай, чи підійде переклад у DOCX, чи потрібен PDF зі схожим на оригінал виглядом і чи мають печатки та підписи залишитися як зображення. Окремо домовтеся, хто підтверджує нечіткі фрагменти: агенція може відновити очевидний текст, але не повинна вгадувати нерозбірливі реквізити.

Рукописні нотатки теж узгодь окремо. Посібник Trados про переклад PDF попереджає, що якість OCR залежить від якості скану й мови. Перекошений, розмитий, блідий, забруднений або рукописний текст може погано підходити для описаного там процесу. Цей матеріал стосується старішого воркфлоу Solid Documents, тож його перелік не є гарантованим описом сучасних версій. Практичний висновок простий: тестуй конкретний файл і звіряй результат із зображенням.

Для чіткого скану з друкованим текстом почни з пробної конвертації кількох типових сторінок. Якщо якість дуже погана, є рукопис або критичні числові дані, одразу закладай ручне звіряння. Огляд можливостей та обмежень AI-OCR для PDF і сканів допоможе розрізнити розпізнавання, автоматичне відновлення макета й переклад. Це різні задачі.

Не кожен PDF треба перетворювати на сегменти для перекладу. Якщо потрібно лише додати документ до корпусу або виконати вирівнювання, memoQ описує plain-text імпорт як варіант для LiveDocs або alignment. Він втрачає форматування й не рекомендований для документів, які перекладатимуть. Обирай його лише тоді, коли вміст не проходитиме повний перекладацький цикл зі збереженням структури.

Якщо клієнт просить готовий PDF, заздалегідь перевір увесь ланцюжок експорту. memoQ не експортує перекладений PDF із PDF-джерела: залежно від способу імпорту результатом буде DOCX або звичайний текст. Перекладений DOCX можна перевірити й передати на наступний етап підготовки, але не обіцяй готовий PDF лише тому, що джерело мало розширення .pdf.

Поширені помилки в агенційному процесі

Проблема зі сканом рідко вирішується однією кнопкою. Зазвичай команда пропускає діагностику, бере за основу застарілу інструкцію або вважає, що документи зі схожим виглядом мають однаковий текст усередині.

Повторно імпортувати той самий файл, не перевіривши текстовий шар. Якщо сторінки збережені як картинки, повторний імпорт не додасть до них текст. Перевір, чи можна виділити й скопіювати слово, а за потреби виконай OCR поза CAT-системою. Саме це випливає з поточної документації memoQ і пояснення RWS про обмеження нової технології PDF-перетворення.

Вважати, що Trados завжди сам розпізнає скан. RWS розрізняє скановане зображення і сканований текст, який уже можна виділити. Не розраховуй, що нова технологія PDF-конвертації, описана для Trados від Studio CU6, автоматично дістане текст зі сторінки-зображення. Спочатку з’ясуй, який файл отримала агенція.

Скористатися давньою інструкцією, не перевіривши версію. Допис на форумі або старий блог можуть описувати іншу технологію, додаток чи інтеграцію. Наприклад, memoQ повідомляє, що TransPDF недоступний у версіях 10.4 і новіших, а сторінка RWS вказує, що IRIS від версії 4.0.0.0 більше не сумісний із Studio 2022. Звіряй інструкцію з конкретною версією продукту й офіційною довідкою.

Перевірити лише першу сторінку. Перша сторінка може бути текстовою, а скановані додатки - починатися далі. У різних частинах PDF можуть відрізнятися якість, нахил і спосіб створення. Перевір репрезентативні сторінки, зокрема таблиці, додатки та розділи з дрібним текстом.

Сплутати неправильний порядок читання з мовною помилкою. Після імпорту PDF із колонками рядки можуть перемішатися. Перевір структуру до перекладу: перекладачеві важко відновити початкову послідовність, коли сегменти вже розбиті на фрагменти. Якщо текст іде не в тому порядку, зміни конвертацію або виправ DOCX.

Не звірити імена й цифри. OCR може перетворити знак, розділовий символ або літеру на інший символ. Перекладач має бачити сумнівне місце в джерелі, а не вгадувати, що хотів написати автор. Звіряй зображення з іменами, номерами, датами, одиницями й кодами, а непевні фрагменти передавай менеджеру проєкту.

Обрати точне форматування замість правильного текстового потоку без тесту. Налаштування, яке найкраще відтворює вигляд сторінки, не обов’язково найкраще підходить для редагування та сегментації. Документація memoQ описує компроміс між порядком тексту й збереженням форматування, а Trados Studio 2024 SR1 пропонує режими відновлення макета. Вибір залежить від задачі, тож протестуй типову сторінку до обробки всього файла.

Не помітити діалогове вікно під час конвертації. У спільноті Trados описали випадок Studio 2024, коли конвертація зупинилася, поки Word відкривався й показував запит на підтвердження. Учасник обговорення помітив запит лише після очікування кілька хвилин. Це окремий випадок, а не універсальне рішення: обговорення проблем зі сканованими PDF у Trados 2024.

У цій дискусії Пол Філкін із RWS написав:

У цій дискусії Пол Філкін із RWS написав: “The new one isn’t as functional, hence the reason why we built the plugin to try and provide better support.” Переклад: новий механізм не настільки функціональний, тому створили додаток, який має поліпшити підтримку.

Коментар стосується розмови про Trados 2024 і не гарантує поведінку кожної версії або файла. Якщо конвертація зависла, не списуй проблему на пошкоджений PDF одразу: перевір, чи Word не чекає на підтвердження, а тоді з’ясуй, чи була це технічна пауза, чи справжня помилка конвертації.

Не домовитися, хто відновлює макет після перекладу. OCR та імпорт у CAT-систему не гарантують, що фінальний документ виглядатиме як початковий PDF. Погодь, чи входить верстка до послуги, який формат здається і хто затверджує вигляд. Так агенція не опиниться в ситуації, коли передала коректний переклад, а клієнт чекає на відновлену копію оригінальної сторінки.

FAQ

Чому Trados Studio не імпортує сканований PDF?

Сканований PDF може містити лише зображення сторінок, а не текстовий шар. За поясненням RWS щодо нової технології PDF-перетворення від березня 2023 року, звичайне зображення скану не перетворюється так само, як текст, який уже можна виділити. Спершу виконай OCR або попроси вихідний файл.

Чи може memoQ імпортувати сканований PDF напряму?

Ні. Поточна довідка memoQ каже, що система не витягує текст зі сканованого PDF, сторінки якого збережені як зображення. Оброби файл у зовнішній програмі OCR, збережи результат у DOCX і перевір його до імпорту.

Як агенції перетворюють сканований PDF для Trados або memoQ?

Спершу агенція перевіряє, чи є в PDF текстовий шар, і просить вихідний файл, якщо він доступний. Якщо джерелом лишається скан, команда виконує OCR у зовнішній програмі, перевіряє порядок тексту й помилки, зберігає DOCX і лише тоді імпортує його в CAT-систему.

Що робити, якщо OCR порушив макет PDF?

Не запускай переклад, доки не перевіриш DOCX. Віднови порядок колонок, таблиць і заголовків; якщо форматування конфліктує з потоком тексту, визнач пріоритет і протестуй інший режим конвертації. Якщо файл сильно пошкоджений, попроси вихідний документ або погодь окрему роботу з макетом.

Чи розпізнає Trados PDF Assistant скановані документи?

У першому описаному RWS випуску PDF Assistant використовував Microsoft Word для перетворення PDF у DOCX і спирався на можливості Word для сканів, двонапрямних письмових систем та азійських мов. Опис стосується першого випуску, тож перед побудовою робочого процесу перевір сумісність і поточну поведінку додатка.

Чи створює memoQ перекладений PDF із PDF-оригіналу?

Ні. Документація memoQ каже, що після роботи з PDF система експортує звичайний текст або DOCX, залежно від способу імпорту, а не перекладений PDF. Якщо клієнту потрібен фінальний PDF, погодь підготовку файла окремо.

Чи можна імпортувати PDF із паролем у memoQ?

Ні. Довідка memoQ зазначає, що система не може імпортувати PDF, захищені паролем. Якщо клієнт має право передати файл, попроси надати копію, доступну для обробки.

Чи зберігається форматування під час перетворення PDF у DOCX?

Форматування може зберегтися частково, але результат залежить від структури PDF і способу конвертації. У memoQ є компроміс між збереженням потоку тексту й спробою втримати форматування; Trados Studio 2024 SR1 теж описує різні режими відновлення макета. Перевір DOCX до перекладу, а не після здавання.

Джерела

Спробуйте ChatsControl

AI-платформа для професійних перекладачів

Спробувати безкоштовно →