Сканированный PDF в Trados и memoQ: почему не импортируется

Почему Trados Studio и memoQ не извлекают текст из сканированного PDF, как проверить файл, подготовить OCR и не потерять порядок, форматирование и смысл.

Также: EN UK RU
Сканированный PDF в Trados и memoQ: почему не импортируется

Сканированные PDF в Trados и memoQ: почему импорт не работает

Утром агентство получает скан договора на перевод, к обеду проект уже должен быть у переводчика, а Trados Studio или memoQ открывает пустые сегменты либо отказывается извлекать текст. Причина часто не в сбое CAT-системы: файл может выглядеть как документ, но внутри состоять только из изображений страниц.

Для человека страница читаема. Для программы изображение без текстового слоя - набор пикселей. Пока OCR (оптическое распознавание символов) не превратит изображение в машинно-читаемый текст, CAT-система не сможет корректно сегментировать содержимое.

Разберем, как отличить скан от PDF с текстом, что именно поддерживают Trados и memoQ, как устроить агентский процесс и что проверять, если распознавание перепутало колонки или имена. Если нужно отдельно оценить исходный файл и объем работы, пригодится руководство как посчитать слова в сканированном PDF. А о возможностях и ограничениях OCR для пользовательского перевода рассказывает статья перевод PDF и сканов с помощью AI-OCR.

Что происходит при импорте PDF

PDF - это формат представления страниц, а не гарантия того, что внутри лежит редактируемый текст. Один файл может содержать настоящий текстовый слой, другой - только фотографии страниц, а третий сочетать распознанный текст и изображения.

Именно состав файла определяет, что сможет извлечь CAT-инструмент. Если программа не находит текстовый слой, импорт не превращает изображение в текст автоматически.

Текстовый PDF и скан - не одно и то же

PDF с текстовым слоем хранит символы как текстовые данные. Их обычно можно выделить мышью, скопировать и вставить в текстовый редактор. Сканированный PDF хранит изображение страницы; похожие на буквы пиксели не становятся текстом сами по себе.

OCR анализирует изображение, распознает предполагаемые символы и создает текстовый слой или документ с извлеченным текстом. Результат не равен исходнику: OCR может ошибиться в букве, цифре, пробеле, переносе строки или порядке чтения.

Быстрая проверка занимает несколько секунд: откройте PDF в программе для чтения и попробуйте выделить одно слово. RWS указывает в описании новой технологии конвертации PDF, что выделяемый текст можно попытаться конвертировать, а отсутствие выделяемого текста служит признаком, что сначала нужен OCR.

Проверка полезна, но не заменяет анализ документа целиком. Один файл может содержать страницы с настоящим текстом, страницы-изображения и вставленные сканы отдельных приложений. Проверяйте несколько страниц, особенно таблицы, печати, приложения и развороты с двумя колонками.

Почему CAT-системы не «видят» буквы на картинке

CAT-система (система автоматизированного перевода) делит извлеченный текст на сегменты, показывает переводчику исходные фрагменты и применяет память переводов и терминологию. Для этого ей нужен текст, а не только изображение с визуально читаемыми символами.

Если текстового слоя нет, у системы нет исходной последовательности слов для сегментации. Импорт может завершиться ошибкой, создать пустой файл, пропустить страницы или дать неподходящий для перевода результат. Конкретное поведение зависит от способа импорта и версии программы.

Поэтому фраза «PDF открывается на компьютере» не означает «PDF готов для CAT». Просмотрщик рисует страницу для человека; фильтр импорта пытается извлечь данные, которые можно редактировать и переводить. Это разные задачи.

Как устроен предварительный этап

Рабочий процесс обычно состоит из нескольких самостоятельных операций:

  1. Проверить, выделяется ли текст и какие страницы содержат только изображения.
  2. Если текстового слоя нет, выполнить OCR во внешней программе или в подходящем конвертере.
  3. Сохранить распознанное содержимое в DOCX либо в PDF с текстовым слоем - формат зависит от дальнейшего процесса.
  4. Сверить структуру и критичные фрагменты с изображением оригинала.
  5. Только после проверки импортировать подготовленный файл в CAT-систему.

На каждом переходе возможна потеря структуры. OCR может распознать текст правильно, но поставить подпись перед основным текстом. Конвертер может сохранить таблицу визуально похожей на исходную, но превратить ее в набор несвязанных строк. Поэтому контрольный этап не стоит сводить к тому, что «файл открылся».

Для агентства полезно разделять две проверки: техническую - можно ли извлечь текст - и редакторскую - соответствует ли извлеченная последовательность оригиналу. Подробный обзор OCR для перевода документов и сканов поможет разобраться, где заканчивается распознавание и начинается вычитка.

Почему Trados Studio не импортирует сканированный PDF

В Trados Studio поведение зависит от того, есть ли в PDF текст, какая технология конвертации используется и какой результат нужен от макета. Новая технология обработки PDF, введенная с 13 марта 2023 года и Studio CU6, не конвертирует страницу, которая представляет собой только сканированное изображение. RWS описывает это ограничение в официальном объявлении.

Тот же механизм может попытаться преобразовать PDF, если сканированный текст уже распознается и его можно выделить. Важное различие здесь не между «сканом» и «не сканом» в бытовом смысле, а между изображением страницы без текста и изображением, к которому добавили распознанный текстовый слой.

Что проверить перед повторным импортом

Начните не с переустановки Trados, а с самого документа:

  • Выделяется ли текст в PDF-просмотрщике?
  • Одинаково ли ведут себя первая, средняя и последняя страницы?
  • Не защищен ли файл паролем или ограничениями доступа?
  • Есть ли в документе таблицы, колонки, формулы, подписи и нестандартные символы?
  • Получается ли открыть исходный файл в Word или другой программе и сохранить его как DOCX?

Если текст выделяется, но импорт в Trados все равно дает сбой, проверьте настройки типа файла и сделайте пробную конвертацию. Если выделение невозможно, сначала нужен OCR. Повторный импорт неизмененного скана не добавит отсутствующий текстовый слой.

В обсуждении работы со сканированными PDF в Trados 2024 представитель RWS описал случай, когда конвертация задерживалась из-за окна подтверждения в Word. В обсуждении сообщества Trados пользователь сообщил, что заметил запрос лишь через несколько минут. Этот эпизод - диагностическая зацепка, а не универсальный способ исправить любой зависший импорт.

Старый IRIS и новые варианты

Агентства могут встретить старые инструкции, которые советуют использовать IRIS для распознавания PDF в Trados. RWS сообщила, что прежний тип PDF-файла, работавший с IRIS, был снят с поддержки в марте 2023 года; страница IRIS в RWS AppStore указывает на несовместимость с Studio 2022 версии 4.0.0.0 и новее. Поэтому старый учебник не обязательно описывает текущий процесс.

RWS перечисляет несколько обходных путей: открыть PDF в Microsoft Word и сохранить как DOCX, воспользоваться преобразованием Adobe PDF-to-Word или подготовить файл в стороннем PDF/OCR-приложении, например ABBYY FineReader или Readiris. Продукты и совместимость могут меняться, поэтому агентству стоит проверять доступность выбранного инструмента и его работу на собственной версии ПО.

RWS также представила PDF Assistant for Trados Studio как альтернативу для улучшения конвертации сканированных PDF. В описании первого выпуска указано, что приложение использовало Microsoft Word для преобразования PDF в DOCX и задействовало возможности Word для сканов, двунаправленных письменностей и азиатских языков. Эти сведения относятся к первому выпуску, описанному в объявлении RWS; текущую совместимость и поведение приложения нужно проверять отдельно.

При любом маршруте DOCX сначала стоит сохранить как промежуточный файл и открыть для проверки. В статье RWS о PDF Assistant прямо оговорено, что конвертация не гарантирует стопроцентную точность и что для проблемного файла может потребоваться специализированное ПО для работы с PDF.

По словам Trados Product Management в объявлении RWS, «PDF всегда следует считать обходным решением на случай, когда исходный файл недоступен».

Для агентства практический смысл простой: если клиент может прислать исходник, запрашивайте его до того, как вкладывать время в OCR и восстановление верстки. DOCX, презентация или исходный макет часто сохраняют структуру лучше, чем конвертированная копия PDF.

Режимы восстановления макета

Документация Trados Studio 2024 SR1 описывает режимы Flowing, Continuous и Exact. Эти названия и доступность относятся к указанной версии, поэтому их не нужно автоматически переносить на другие выпуски Studio.

Режим Flowing ориентирован на сохранение потока текста и элементов страницы. Exact пытается восстановить внешний вид страницы с помощью текстовых блоков Word. Точные настройки могут быть полезны для разных задач, но визуальное сходство не гарантирует удобной редактируемости: текстовые блоки иногда осложняют дальнейшую правку и перевод.

Перед большим проектом сделайте тестовую конвертацию на представительных страницах. Выберите страницу с обычным текстом, страницу с таблицей, страницу с колонками и страницу с печатью или подписью. Сравните DOCX с PDF не только визуально, но и по порядку чтения.

RWS предупреждала, что новый тип PDF может отличаться от прежнего по статистике анализа, поиску единиц перевода, извлечению изображений, обработке специальных символов и переносу PerfectMatch. Для азиатских и других нелатинских исходных языков RWS предлагает рассмотреть альтернативную обработку. Если проект зависит от этих функций, протестируйте файл до подготовки сметы и назначения исполнителя.

Что умеет memoQ и где нужен внешний OCR

В memoQ PDF можно импортировать как содержимое, преобразованное в DOCX, или как обычный текст. Но текущая справка memoQ о PDF прямо сообщает, что программа не извлекает текст из сканированных PDF, где страницы сохранены как изображения. Перед импортом такого файла требуется OCR во внешней программе.

В справке memoQ сказано: «Не удается импортировать сканированные PDF: memoQ не извлекает текст из сканированных PDF, страницы которых сохранены как изображения, а не как текст».

Значит, попытка выбрать такой PDF напрямую не заменяет распознавание. Для перевода подготовьте DOCX с текстовым потоком и сохраненным форматированием настолько, насколько это возможно. В справке memoQ в качестве примеров программ для чтения страниц и OCR названы Nuance OmniPage и ABBYY FineReader.

Выбрать DOCX или обычный текст

При преобразовании PDF в DOCX приходится выбирать, что важнее: сохранить порядок чтения или сохранить как можно больше исходного форматирования. В справке memoQ описан этот компромисс: режим с сохранением текстового потока может пожертвовать частью оформления, а попытка сохранить форматирование может привести к потере части текста.

Импорт обычного текста убирает форматирование. Документация memoQ не рекомендует этот вариант для документов, которые будут переводить; он может пригодиться для импорта корпуса в LiveDocs или для выравнивания. Если нужно перевести договор, инструкцию или форму, plain text обычно создает дополнительную работу по восстановлению структуры.

Еще одно ограничение касается экспорта: memoQ не создает переведенный PDF из PDF-источника. В зависимости от способа импорта результатом экспорта будет обычный текст или DOCX. Если клиент ожидает готовый PDF, агентству нужно заранее включить восстановление или верстку в процесс и согласовать, кто отвечает за финальную сборку.

Документация также сообщает, что memoQ не импортирует PDF, защищенные паролем. Если импорт не срабатывает, проверьте защиту файла и попросите клиента предоставить доступную для обработки версию. Не пытайтесь обходить ограничения доступа без согласования с владельцем документа.

Не ориентируйтесь на старые инструкции TransPDF

В сети по-прежнему встречаются инструкции о связке memoQ с TransPDF. В текущей документации memoQ указано, что интеграция TransPDF недоступна в memoQ 10.4 и более поздних версиях. Значит, прежние описания нельзя считать актуальным встроенным способом обработки PDF.

Историческая статья memoQ о версии 8.1 рассказывает, что изображения в PDF требовали OCR, а распознавание могло вносить ошибки в символы и форматирование. Там же описывался платный OCR в прежнем процессе TransPDF. Эта публикация полезна как объяснение старых рабочих процессов, но не как инструкция для современного memoQ.

Агентству лучше закрепить текущий внешний маршрут в своей процедуре: кто выбирает OCR-инструмент, в какой формат сохраняет файл, кто сверяет результат и кто принимает решение, достаточно ли качества для перевода. Такая договоренность избавляет команду от попыток повторить недоступный интеграционный процесс.

Рабочий процесс агентства: от запроса исходника до CAT

Когда PDF не импортируется, самая быстрая техническая реакция не всегда самая выгодная. Внешний OCR добавляет этапы, а ошибки распознавания могут попасть в память переводов, сегментацию и итоговый документ. Устойчивый процесс начинается с вопроса клиенту об исходнике, а не с серии случайных конвертаций.

Шаг 1. Запросить исходный файл

RWS рекомендует использовать исходный или нативный файл, если он доступен: PDF неудобен для локализации и создает дополнительную обработку. Попросите DOCX, исходную презентацию, таблицу или макет, из которого экспортировали PDF.

Если исходника нет, уточните, есть ли у клиента сканирование более высокого качества или PDF с текстовым слоем. Эти варианты могут сократить ручную подготовку. Уточните также, какой результат нужен: перевод текста, DOCX для последующей верстки или файл с сохранением визуального оформления.

В той же публикации RWS рекомендует по возможности использовать исходный файл, потому что PDF создает дополнительную работу и плохо подходит для локализации.

Практический вывод для менеджера проекта: уточните формат результата до оценки срока и стоимости. Объем OCR, проверка распознавания и восстановление макета - отдельные виды работы, которые не исчезают только потому, что заказчик прислал один PDF.

Шаг 2. Провести первичную диагностику

Сохраните копию файла и проверьте несколько страниц. Выделение текста подскажет, есть ли текстовый слой, но не покажет, насколько правильно распознаны символы или порядок чтения.

Запишите, какие страницы требуют OCR, и отметьте участки повышенного риска: мелкий шрифт, бледная печать, поворот страницы, две колонки, таблицы, рукописные пометки, штампы и специальные символы. Не делайте вывод о качестве всего файла по одной странице.

Если PDF защищен паролем, запросите доступную версию у клиента. Если скан нечеткий или поврежден, согласуйте ручную сверку с оригиналом. Не обещайте, что OCR автоматически исправит плохой источник.

Шаг 3. Распознать текст и выбрать выходной формат

Для Trados и memoQ удобной промежуточной целью часто становится DOCX: его проще открыть, исправить и проверить до импорта. memoQ прямо описывает вариант с OCR во внешнем приложении и сохранением DOCX, при этом советует удержать текстовый поток и форматирование настолько, насколько позволяет конвертер.

Не смешивайте две цели: «получить редактируемый текст» и «восстановить страницу как в оригинале». Первая нужна для перевода; вторая - для удобства чтения, сверки или финальной сдачи. Один и тот же способ конвертации не всегда хорошо решает обе задачи.

Шаг 4. Сверить DOCX с изображением

Проверьте начало и конец каждой страницы, порядок колонок, таблицы, заголовки, колонтитулы, сноски и подписи. Отдельно сверьте фамилии, названия компаний, даты, номера, единицы измерения и повторяющиеся термины.

Руководство Trados по переводу PDF в Studio советует просматривать результат OCR и исправлять ошибки в исходном тексте, например путаницу похожих символов и имен. Статья описывает более старый рабочий процесс, поэтому конкретные шаги нельзя считать гарантией для каждой текущей версии, но сама проверка распознанного текста остается необходимой.

Сверка должна идти по изображению, а не по тому, насколько гладко читается DOCX. Ошибочное имя может выглядеть вполне естественно, а пропущенное отрицание - не бросаться в глаза. Для критичных мест сравните исходную страницу и извлеченный текст бок о бок.

Шаг 5. Импортировать проверенный файл

Когда DOCX проходит проверку, импортируйте его в CAT-систему и оцените результат на тестовом проекте. Посмотрите, не появились ли пустые сегменты, повторы из колонтитулов, некорректные разрывы и неожиданные символы.

После импорта проверьте статистику и несколько сегментов в начале, середине и конце документа. В Trados учитывайте возможные различия новой обработки PDF в анализе и поиске единиц перевода, о которых предупреждала RWS. Если важны PerfectMatch, изображения или специальные символы, сравните поведение на конкретном файле до начала основной работы.

Шаг 6. Согласовать, кто восстанавливает макет

Перевод в CAT-системе не означает, что исходная страница автоматически восстановлена. Уточните, кто собирает итоговый DOCX или PDF, кто проверяет расположение подписей и таблиц и входит ли эта работа в объем заказа.

Для клиента заранее разграничьте перевод текста и верстку. Для команды зафиксируйте, какой файл считается проверенным источником и где хранятся исправления OCR. Такая запись помогает не переводить заново ошибки, которые уже обнаружили на подготовительном этапе.

Что ломается после OCR и как не пропустить ошибку

OCR может создать файл, который выглядит аккуратно, но содержит опасные ошибки. Самые заметные проблемы связаны с качеством скана и сложной структурой: размытые или бледные буквы распознаются хуже, строки могут смешиваться, а заголовок боковой колонки - вклиниваться в середину абзаца.

В руководстве Trados перечислены перекошенный, размытый, бледный и смазанный текст, а также рукописные фрагменты как слабые кандидаты для описанного там OCR-процесса. Статья посвящена более старому рабочему сценарию, поэтому точное поведение зависит от используемого распознавателя. Общий риск остается: чем хуже исходное изображение, тем больше ручной проверки.

Ошибки порядка чтения

Две колонки - частый источник тихих ошибок. OCR может прочитать первую строку левой колонки, затем первую строку правой, а потом продолжить в непредсказуемом порядке. Переводчик видит грамматически странный исходник, хотя проблема возникла еще при извлечении.

Таблицы требуют отдельной проверки: значения, единицы измерения и заголовки могут разъехаться по строкам. Если импортировать такой DOCX без контроля, сегменты не обязательно покажут, какой показатель относится к какой строке или колонке.

Для теста используйте страницу со сложной структурой, а не только первую страницу с обычным текстом. Исправьте порядок чтения до импорта. Если восстановить его автоматически не получается, согласуйте ручную обработку или попросите исходный файл.

Ошибки символов, чисел и имен

OCR может спутать похожие символы, потерять знак препинания или изменить число. Риск особенно неприятен для дат, кодов, адресов и имен: переводчик может не знать, что в исходном тексте уже появилась ошибка, и аккуратно перенести ее дальше.

Создайте короткий список контрольных элементов для вычитки: имена и организации, номера документов, даты, суммы, единицы измерения, отрицания, сноски и специальные знаки. Для конкретного проекта добавьте термины и обозначения, которые важны именно этому клиенту.

Не используйте гладкость текста как критерий точности. Прочитайте DOCX рядом со сканом и сверьте элементы, которые OCR чаще всего искажает. Такой контроль дешевле, чем исправление ошибки после перевода и верстки.

Ошибки макета и потери фрагментов

Сохранение форматирования и сохранение текста могут конфликтовать. memoQ предупреждает, что при PDF-конвертации выбор в пользу форматирования может привести к потере части текста, а выбор в пользу текстового потока - к потере элементов оформления. Поэтому оценка только по внешнему виду DOCX недостаточна.

Если на странице есть рамки, колонтитулы или повторяющиеся элементы, проверьте, не попали ли они в поток несколько раз. Если текст в DOCX кажется короче исходника, не считайте это автоматическим удалением «мусора»: сверка покажет, потерялись ли подписи, строки таблицы или фрагменты мелкого текста.

Ошибки из-за старых инструкций

Советы в блогах и на форумах могут относиться к другой версии Trados или memoQ. Историческая интеграция TransPDF для memoQ не является текущим встроенным маршрутом для версии 10.4 и новее, а старый IRIS PDF file type несовместим с указанными RWS версиями Studio.

Сверяйте рекомендацию с документацией конкретной версии и проверяйте дату публикации. Если инструкция предлагает кнопку, тип файла или интеграцию, которых нет в вашей установке, не тратьте время на поиск скрытой настройки - проверьте, не устарел ли сам процесс.

FAQ

Почему Trados Studio не импортирует сканированный PDF?

PDF из одних изображений не содержит текстового слоя, который CAT-система могла бы извлечь. Сначала выполните OCR и сохраните распознанный текст в DOCX или в PDF с текстовым слоем; RWS описывает это ограничение для новой технологии обработки PDF, введенной с 13 марта 2023 года и Studio CU6 (объявление RWS).

Можно ли импортировать сканированный PDF прямо в memoQ?

Нет, текущая документация memoQ говорит, что программа не извлекает текст со страниц, сохраненных как изображения. Выполните OCR во внешней программе и импортируйте подготовленный DOCX (справка memoQ).

Как проверить, есть ли в PDF текстовый слой?

Откройте файл в программе для чтения PDF и попробуйте выделить и скопировать слово. RWS указывает, что выделяемый текст можно попытаться конвертировать, а невозможность выделения - повод выполнить OCR до импорта (объявление RWS).

Что делать, если после OCR текст в PDF идет в неправильном порядке?

Не запускайте перевод до проверки DOCX. Сверьте текст с изображениями страниц, исправьте порядок колонок и строк таблиц, а затем повторно импортируйте подготовленный файл.

Подходит ли PDF Assistant для Trados Studio для сканированных документов?

RWS описывала PDF Assistant как способ конвертировать PDF в DOCX с использованием Microsoft Word, включая сканированные документы в первом выпуске. Совместимость и поведение нужно проверить для конкретной версии приложения, а результат - вычитать, поскольку конвертация не гарантирует полной точности (описание PDF Assistant).

Можно ли получить переведенный PDF из memoQ?

Нет, memoQ не экспортирует переведенный PDF из PDF-источника. В зависимости от способа импорта экспорт будет обычным текстом или DOCX, поэтому формат сдачи и ответственность за финальную верстку лучше согласовать заранее (справка memoQ).

Попробуйте ChatsControl

AI-платформа для профессиональных переводчиков

Попробовать бесплатно →