Почему CAT-инструмент путает колонки и таблицы¶
Представьте отчет, где слева указаны показатели, а справа - их значения, или брошюру с двумя колонками. На странице все выглядит аккуратно. После импорта в CAT-инструмент заголовок первой колонки может оказаться рядом со строкой из второй, а значения таблицы - оторваться от подписей.
CAT-инструмент не обязательно читает PDF как готовую страницу. Часто программа сначала извлекает из файла текст и пытается восстановить его порядок и форматирование, а для дальнейшей работы создает редактируемый промежуточный документ. Если исходный PDF хранит только визуальное расположение символов, автоматическое восстановление структуры может ошибиться.
PDF - формат, предназначенный для сохранения представления страницы, а не для удобного редактирования и перевода. Поэтому аккуратная картинка сама по себе не сообщает программе, какой текст относится к ячейке, где начинается колонка и какую строку нужно читать первой.
Ошибка на этапе извлечения влияет не только на внешний вид. Перепутанные ячейки способны изменить смысл инструкции, отчета, спецификации или договора. Переводчик может получить грамматически корректные сегменты, которые уже соединены не с теми числами и заголовками.
Разобраться помогает разделение трех задач:
- Извлечение текста - программа получает символы из PDF.
- Восстановление структуры - программа определяет порядок чтения, абзацы, колонки и таблицы.
- Перевод и верстка - текст проходит через CAT-инструмент, после чего файл проверяют и при необходимости собирают заново.
Проблема возникает, когда эти этапы воспринимают как одно действие. Импорт не подтверждает, что извлечение прошло верно, а экспортированный DOCX не доказывает, что исходная структура сохранилась.
Особенно рискованно переводить PDF, где одновременно есть колонки, боковые заметки, сноски, подписи к графикам и таблицы. Руководство W3C по порядку чтения PDF описывает, почему сложная страница может потребовать проверки и исправления порядка чтения: программа не всегда правильно определяет, в какой последовательности нужно читать визуально соседние элементы.
Похожая ситуация возникает при работе с документами с таблицами в CAT-инструментах: система может переводить строки по отдельности, но переводчику все равно нужно понимать, к какому заголовку и столбцу относится каждая строка. CAT-инструмент помогает управлять текстом и повторяющимися фрагментами, но не может надежно восстановить отсутствующую в файле семантическую структуру.
Визуальная таблица и структурированная таблица - не одно и то же¶
PDF-таблица выглядит как сетка из строк и колонок, но изображение сетки не гарантирует, что файл содержит машинно-читаемую таблицу. Иногда текст, границы и заливки записаны как независимые элементы страницы. Человек видит ячейку благодаря их расположению, а программа получает набор объектов, которым нужно приписать отношения.
Семантическая структура описывает роль элемента, а не только его координаты. Например, тег заголовка таблицы сообщает, что текст служит названием столбца, а тег ячейки данных связывает значение с этим заголовком. Руководство PDF Association о доступности PDF объясняет, что логический порядок задается структурой тегов, а не одним только визуальным размещением.
Если файл размечен тегами правильно, программам проще понять, в каком порядке читать содержимое и как связать части таблицы. Если теги отсутствуют или расставлены неверно, чтение слева направо по координатам тоже не всегда решает задачу. В таблице с объединенными ячейками одна подпись может относиться к нескольким значениям, а сноска - к конкретному столбцу или строке.
Почему две колонки могут превратиться в одну перемешанную¶
Для человека порядок чтения двух колонок часто очевиден: сначала закончить левую, затем перейти к правой. Но PDF может хранить текстовые блоки в другом порядке - например, по координатам, по времени создания или в последовательности, не совпадающей с тем, как читатель воспринимает страницу.
Неправильно размеченная страница может извлекаться строка за строкой через обе колонки. В результате предложение из левой части склеивается с предложением из правой. Иногда порядок выглядит почти верным, но в середине текста в него попадают подпись к рисунку, сноска или текст боковой панели.
Проверяйте не только начало и конец извлеченного текста. Ошибка может появляться только там, где колонка прерывается графикой, подзаголовком или рамкой. Для многостраничного документа полезно просмотреть несколько типичных страниц: простую страницу с абзацами, страницу с таблицей и страницу с наиболее сложной компоновкой.
Что происходит при импорте PDF в CAT-инструмент¶
Практический процесс зависит от файла и настроек импорта. Один CAT-инструмент извлекает текст с приоритетом на последовательное чтение, другой старается точнее повторить внешний вид страницы, а третий предлагает несколько режимов преобразования. Названия режимов и их поведение различаются, поэтому ориентируйтесь не на обещание «сохранить PDF», а на результат предварительной проверки.
Один из типичных маршрутов выглядит так:
- CAT-инструмент или конвертер анализирует PDF.
- Программа создает редактируемый файл, часто в формате DOCX, либо текстовый вывод.
- Переводчик работает с полученными сегментами.
- После перевода документ экспортируют и проверяют отдельно от исходной страницы.
Промежуточный формат нужен для того, чтобы редактировать и переводить извлеченный текст. Но преобразование меняет контекст: переводчик видит не исходную PDF-страницу, а восстановленную структуру. Если на этом этапе две колонки уже перемешаны, сегментация разрежет неправильную последовательность на удобные для CAT-инструмента куски.
В документации W3C описаны сложности автоматического определения порядка чтения для страниц со сносками, таблицами, графикой и боковыми блоками. Такие элементы могут требовать ручного исправления тегов или порядка чтения. Утверждение касается структуры PDF: сама страница может выглядеть безупречно, но программа все равно неверно интерпретирует последовательность.
Режимы преобразования тоже предполагают компромисс. Приоритет на поток текста помогает сохранить последовательное чтение, но может изменить часть форматирования. Приоритет на внешний вид страницы способен точнее воспроизвести размещение, но не гарантирует правильного потока текста или сохранения каждого фрагмента. Значит, «похожий на оригинал DOCX» и «правильно извлеченный текст» - разные критерии проверки.
OCR нужен для PDF, сохраненного как изображение¶
Сканированный PDF содержит изображение страницы, а не обычный выделяемый текст. OCR - оптическое распознавание символов - анализирует изображение и создает текст, с которым могут работать CAT-инструмент и редактор.
OCR не превращает скан в безошибочный исходник. Распознавание может неверно прочитать знак, пропустить символ, склеить соседние слова или спутать числа. В таблице особенно опасны ошибки в десятичном разделителе, коде, артикуле, единице измерения и границе между столбцами.
Проверяйте результат OCR по изображению, а не только по тому, насколько гладко читается текст. Если система распознала строку «15,8» как «158», предложение может оставаться понятным, хотя фактическое значение изменилось. Если границы ячеек плохо видны, распознанные строки могут перейти в соседний столбец.
Рекомендации Adobe по созданию доступных PDF предупреждают, что автоматическая обработка сложной структуры и порядка чтения может дать неверный результат. Для перевода это означает простое правило: OCR и автоматическую разметку нужно считать черновым извлечением, пока человек не проверил текст и его связи на странице.
Для документов, где важна связь строки с нужным заголовком, пригодится проверка качества перевода по этапам. Сначала сверяют извлечение с оригиналом, затем перевод и только после этого итоговый файл. Проверка одного готового перевода не исправит ошибку, которая уже возникла при распознавании исходника.
Почему сегментация не спасает неправильный порядок¶
Сегментация - это деление текста на фрагменты, с которыми удобно работать в CAT-инструменте. Обычно система разбивает содержимое по предложениям, абзацам или другим правилам. Хорошая сегментация ускоряет перевод, помогает повторно использовать совпадения и облегчает контроль терминологии.
Но сегментация не понимает, что два соседних фрагмента пришли из разных колонок. Если извлечение смешало содержание, CAT-инструмент может аккуратно разделить уже испорченную последовательность. Переводчик увидит чистый список сегментов и не всегда заметит, что соседние строки на исходной странице не связаны.
Сравнивайте не только сегменты друг с другом, но и каждый проблемный участок с визуальной страницей. Проверка особенно важна для строк с числами, повторяющимися заголовками, короткими подписями и названиями столбцов. Короткий сегмент вроде «Да», «Нет» или «Примечание» может полностью изменить смысл, если он оказался рядом не с той строкой.
Почему экспортированный DOCX не обязательно станет PDF¶
Некоторые рабочие процессы заканчиваются DOCX или обычным текстом, а не исходным PDF. При обратной верстке могут измениться переносы, положение таблиц и страниц, особенно если перевод длиннее оригинала. Поэтому перед началом работы согласуйте формат результата: переводимый DOCX, PDF с восстановленной версткой или оба файла.
Если у вас есть исходник, из которого сделали PDF, проверьте, можно ли переводить именно его. DOCX, презентация или издательский файл могут сохранить таблицы и последовательность лучше, чем конвертация готового PDF. Рекомендация сначала найти оригинальный редактируемый файл есть и в руководствах по импорту PDF в CAT-системы, а общая причина понятна: лишнее преобразование добавляет еще один этап, на котором можно потерять структуру.
Как проверить файл до начала перевода¶
Предварительная проверка нужна не для того, чтобы добиться идеальной верстки до первой минуты работы. Ее задача - обнаружить ошибки извлечения до того, как перепутанные строки попадут в сегменты, переводческую память или глоссарий.
Начните с исходного PDF и выясните, какой перед вами тип файла:
- Текстовый PDF - текст можно выделить и скопировать.
- Сканированный PDF - содержимое страницы представляет собой изображение.
- Смешанный PDF - часть страниц или элементов содержит текст, а часть - изображения.
Одна страница не всегда показывает, как устроен весь документ. Смешанный PDF может включать текстовые страницы, отсканированные подписи и таблицы, добавленные как картинки. Проверяйте все типы страниц, а не только первую.
Затем импортируйте пробный фрагмент в выбранный процесс и проверьте выходной файл. Не начинайте перевод, пока не ясно, что текстовые блоки идут в нужном порядке и структура документа пригодна для работы.
Чек-лист проверки извлечения¶
- Сверьте порядок чтения. Выберите страницу с колонками и сравните текстовый вывод с оригиналом. Убедитесь, что программа не перескакивает между левым и правым столбцом.
- Проверьте таблицу по строкам. Проследите, чтобы каждое значение осталось связано с нужным заголовком. Сравните не только порядок слов, но и горизонтальные отношения между ячейками.
- Найдите объединенные ячейки и многострочные заголовки. Уточните, к каким строкам и столбцам они относятся. Визуальная сетка не всегда объясняет эту связь автоматически.
- Посмотрите разрывы страниц. Проверьте, повторяются ли заголовки таблиц и продолжаются ли строки в правильном порядке. Для длинных таблиц сверяйте связь ячейки с заголовком по обе стороны разрыва.
- Сверьте сноски, колонтитулы и боковые блоки. Убедитесь, что сноска не оказалась внутри основной строки, а подпись к графику не попала в колонку с текстом.
- Проверьте символы и числа. Сверьте даты, коды, разделители, знаки процентов, единицы измерения и номера пунктов с оригиналом.
- Определите страницы, которым нужен OCR. Если текст не выделяется, проверьте, прошел ли файл распознавание и совпадает ли распознанный текст с изображением.
- Зафиксируйте целевой формат. Согласуйте, нужен ли перевод в DOCX, исходный PDF с восстановленной версткой или отдельный файл для настольной издательской системы.
При проверке таблиц не ограничивайтесь вопросом «все ли слова на месте». Для каждой строки спросите: «К какому заголовку относится это значение?» Такая проверка ловит ошибки, которые не видны при поверхностном чтении, но меняют интерпретацию данных.
В руководстве PDF Association по Tagged PDF отдельно рассматривается значение тегов и отношений между структурными элементами. Для длинных таблиц обращайте внимание на продолжение после разрыва страницы, повторные заголовки, объединенные ячейки и вложенную структуру. Внешний вид может не давать достаточных подсказок автоматическому восстановлению.
Заранее определите, кто исправляет найденные ошибки. Иногда переводчик получает чистый DOCX и может поправить структуру сам. В другом проекте исправление таблицы затрагивает оригинальный макет, и его должен выполнять специалист по верстке. Не оставляйте ответственность неопределенной: иначе проблема обнаружится после экспорта, когда цена исправления выше.
Для подготовки текстовой базы из PDF полезно отдельно учитывать удаление колонтитулов, жестких переносов и переносов слов, а также исправление таблиц перед выравниванием. Участники обсуждения на ProZ описывали такие задачи при подготовке документов для работы с переводческой памятью. Это практические наблюдения участников форума, а не универсальная инструкция для любой версии CAT-инструмента.
Как работать со сложными файлами и что не исправит автоматизация¶
Подход выбирают по источнику ошибки, а не по обещанию программы сохранить верстку. Если PDF размечен корректно, достаточно аккуратного импорта и контрольной проверки. Если структура потеряна, нужен отдельный этап восстановления. Если файл сканированный, сначала добавляется OCR.
Когда есть исходный редактируемый документ¶
Попросите у заказчика файл, из которого экспортировали PDF. DOCX, электронная таблица или исходный файл верстки часто дают более ясные границы абзацев и ячеек. До перевода сравните такой файл с PDF, чтобы убедиться, что страницы совпадают по содержанию и ничего не исчезло при экспорте.
Исходник тоже требует проверки. В таблице могут быть скрытые строки, объединенные ячейки или формулы, которые выглядят иначе при экспорте. Сверяйте значения и заголовки, а не принимайте редактируемый файл на веру.
Когда нужно восстановить структуру вручную¶
Если извлеченный текст перемешан, сначала исправьте порядок и таблицу в промежуточном документе. Удобный вариант - разбить многоуровневую таблицу на логические блоки, дать каждому блоку понятные заголовки и проверить, что подписи остаются рядом с нужными значениями.
Для двух колонок можно выделить содержимое каждой колонки как отдельный блок и убедиться, что порядок соответствует оригиналу. Для таблицы с несколькими уровнями заголовков полезно повторить полные заголовки там, где иначе связь с данными теряется. Такой прием помогает переводчику, но конечная верстка все равно должна соответствовать требованиям проекта.
Обсуждение PDF formatting problems with Studio 2014 на ProZ описывает практический маршрут для проблемного файла: преобразовать его в редактируемый формат, исправить таблицы и макет до перевода, а затем проверить и поправить экспорт. Автор обсуждения также отмечает, что OCR не дает идеального результата и что после автоматического преобразования могут понадобиться ручные исправления. Это опыт конкретного участника форума, а не гарантия результата для любого PDF.
Практический вывод важнее конкретного инструмента: исправлять структуру лучше до перевода, пока источник и его визуальный контекст еще доступны. Если отложить работу до финальной верстки, переводчик может обнаружить, что числовой столбец уехал к соседней строке, а исходную связь уже трудно восстановить.
Когда текст нужно перевести, а верстку можно восстановить отдельно¶
Разделите языковую и верстальную проверку. Переводчик отвечает за смысл, терминологию и полноту текста; специалист по настольной издательской системе - за размещение, переносы, размеры таблиц и финальный файл. Один человек может выполнять обе задачи, но контрольные критерии все равно разные.
Такое разделение подходит для отчетов, каталогов, инструкций и многостраничных брошюр со сложной компоновкой. Если текст переводится в обычном DOCX, не считайте исходную страницу автоматически воспроизведенной. После перевода проверьте расширение фраз, переносы строк, высоту ячеек и то, не разорвалась ли таблица в неудобном месте.
Какие проблемы OCR и тегирование не решают автоматически¶
OCR помогает получить текст из изображения, но не проверяет его смысл и не устанавливает все связи в сложной таблице. Автоматическое тегирование может создать структуру, но неверный порядок чтения или ошибка связи заголовка с ячейкой все равно возможны.
Инструменты проверки порядка чтения показывают, как программа интерпретирует области страницы, и помогают исправлять ошибки. Но проверка нужна человеку, который может сравнить результат с визуальной компоновкой и понять, к чему относится каждая подпись. Даже хорошо оформленный PDF с тегами нуждается в контроле, если документ содержит вложенные таблицы, боковые панели и сноски.
Для команды полезно завести короткий протокол передачи файла:
- тип PDF и наличие сканированных страниц;
- способ извлечения или OCR;
- найденные проблемы с колонками и таблицами;
- формат, в котором переводчик получает текст;
- формат итоговой поставки;
- ответственный за исправление верстки;
- критерии проверки чисел, заголовков и связей ячеек.
Протокол не заменяет проверку конкретной страницы. Зато он помогает передать обнаруженные ограничения между менеджером проекта, переводчиком и верстальщиком, а не надеяться, что следующий участник сам заметит их в файле.
В обсуждении инструментов для выравнивания PDF и создания переводческой памяти участник перечисляет типичные задачи очистки: убрать колонтитулы и жесткие переносы строк, исправить переносы слов, восстановить колонки и таблицы, проверить пробелы, появившиеся из-за лигатур. Такие действия относятся не только к переводу: они важны и при подготовке исходного текста для выравнивания.
Рабочая последовательность для файла с таблицами обычно выглядит так:
- Найти исходный редактируемый документ, если он доступен.
- Проверить, можно ли выделить текст в PDF и какие страницы требуют OCR.
- Преобразовать контрольный фрагмент и сопоставить текстовый порядок с оригиналом.
- Исправить колонки, таблицы и переносы до перевода.
- Перевести подготовленный файл в CAT-инструменте.
- Сверить значения с заголовками и проверить числа после перевода.
- Передать файл на восстановление верстки, если исходный PDF нужно воспроизвести.
- Проверить конечный файл на страницах с наиболее сложной структурой.
Частая ловушка - считать совпадение общего числа слов доказательством корректного извлечения. Документ может содержать все слова, но в неправильной очередности. Проверяйте связи и последовательность, а не только наличие текста.
Другая ловушка - исправить видимую таблицу, не проверив повторяющиеся заголовки на следующей странице. Для многостраничной таблицы отдельно убедитесь, что продолжение относится к тем же столбцам и что подписи не потерялись при переходе между страницами. Руководство PDF Association о тегированной структуре помогает понять, почему эти отношения важно проверять на уровне структуры, а не только внешнего вида.
Когда PDF можно импортировать напрямую, а когда нужен другой маршрут¶
Прямой импорт удобен, если PDF содержит извлекаемый текст, структура страницы простая, а тестовый результат сохраняет читаемый порядок. Перед переводом все равно проверьте страницы с таблицами и колонками: качество извлечения на первой странице ничего не гарантирует для остальных.
Промежуточный DOCX подходит, когда нужно вручную поправить порядок блоков, очистить переносы или подготовить таблицу к переводу. Конвертация полезна только при условии, что после нее можно сверить содержимое с оригиналом. Если текст или связи ячеек потерялись, конвертация не решает проблему, а переносит ее в новый формат.
OCR нужен для страниц, где текст хранится изображением. После распознавания проверьте символы и таблицы по оригиналу. Если скан слишком нечеткий, элементы перекрыты или границы ячеек почти не видны, автоматического текста может быть недостаточно для безопасного перевода.
Отдельная верстка после перевода оправдана, если важен точный внешний вид документа или перевод заметно меняет длину текста. Работать в CAT-инструменте и восстановить исходную страницу - разные задачи, и для второй может понадобиться другой формат файла и отдельный контроль.
Используйте простое правило выбора:
| Условия | Подход |
|---|---|
| Текст выделяется, порядок чтения очевиден, таблицы простые | Импортируйте пробный фрагмент и проверьте результат перед переводом |
| Колонки перемешаны или таблицы потеряли связи | Исправьте структуру в редактируемом промежуточном файле |
| Страницы сохранены как изображения | Выполните OCR и сверьте результат с изображением |
| Есть исходный DOCX или другой редактируемый файл | Сравните его с PDF и рассмотрите как источник для перевода |
| Нужно точное воспроизведение макета | Согласуйте отдельную проверку и восстановление верстки |
Универсального переключателя, который исправляет любой PDF, нет. Одни режимы преобразования лучше сохраняют поток текста, другие стараются сохранить расположение элементов. Настройка может помочь выбрать приемлемый баланс, но не превращает визуальные координаты в правильную семантическую структуру.
Если файл одновременно содержит таблицу, две колонки и сканированные подписи, не пытайтесь оценить его по единственной странице. Проверьте каждую разновидность структуры на примере и запишите, что нужно исправить. Такой тест показывает, можно ли передать документ в CAT-инструмент напрямую или сначала требуется очистка и восстановление.
Материал полезен и при сравнении систем: выбор CAT-инструмента для переводчика стоит строить не только по функциям управления проектами, но и по тому, как программа обрабатывает конкретные PDF. Тестируйте собственный тип документа: рекламную брошюру, техническую таблицу и скан нельзя считать одним и тем же сценарием.
Частые вопросы¶
Почему CAT-инструмент путает таблицы при переводе PDF?¶
PDF может хранить визуально выровненный текст без структуры таблицы и логического порядка чтения. При извлечении строки и столбцы собираются в неверной последовательности, а ошибка попадает в сегменты CAT-инструмента.
Как перевести PDF в две колонки, не смешав порядок чтения?¶
Проверьте извлеченный текст до перевода: сначала должен идти полный текст левой колонки, затем правой, если именно такой порядок предусмотрен документом. При необходимости исправьте структуру в редактируемом файле или задайте порядок чтения вручную.
Нужно ли преобразовать PDF в Word перед импортом в CAT-инструмент?¶
Не всегда. DOCX удобен для проверки и исправления структуры, но конвертация может изменить форматирование или потерять часть текста. Сверьте преобразованный файл с исходным PDF до начала перевода.
Может ли CAT-инструмент перевести сканированный PDF с таблицами?¶
Текстовый импорт не извлечет слова из страницы, сохраненной как изображение. Сначала нужен OCR, а его результат необходимо сверить с оригиналом, особенно в числах, заголовках и границах ячеек.
Как проверить порядок извлечения текста из PDF до перевода?¶
Сравните текстовый вывод с визуальной страницей: проверьте очередность колонок, связи ячеек с заголовками, сноски и переносы между страницами. Для сложной структуры посмотрите и дерево тегов PDF.