iSomor
블로그로 돌아가기

PDF 번역은 왜 어려울까요? 우리는 무엇을 복원하고 있을까요?

20 분 소요Freed
막대그래프와 표가 있는 2단 PDF 페이지에 도표와 수식 카드가 가는 선으로 연결된 모습.

지난 글 「읽는 습관으로 살펴보는 PDF 번역에서 원래 레이아웃이 중요한 이유」에서는 읽는 습관을 바탕으로, PDF를 번역할 때 번역된 문장만 남겨서는 충분하지 않은 이유를 살펴봤습니다. 논문이나 보고서, 기술 자료를 읽을 때 우리는 제목을 훑고 도표를 찾으며 원문과 번역문을 오가면서 내용을 확인합니다. 원래의 레이아웃은 이 내용들이 어떻게 연결되는지 기억하는 데 도움을 줍니다.

하지만 이런 연결을 기술적으로 유지하는 일은 간단하지 않습니다.

PDF 번역은 한 언어를 다른 언어로 바꾸고 글자를 원래 위치에 돌려놓는 작업만이 아닙니다. 페이지가 무엇으로 구성되는지 이해하고, 어떤 텍스트가 한 부분에 속하는지 판단하며, 번역문 길이가 달라지면 배치를 다시 조정해야 합니다.

어려운 점은 PDF가 요소의 ‘위치’는 알려 주어도 ‘어디에 속하는지’까지 알려 주지는 않을 수 있다는 데 있습니다. 문단이 어떤 제목에 속하는지, 도표가 어떤 설명과 연결되는지, 수식의 기호를 어느 문장이 설명하는지는 위치와 스타일, 문맥을 통해 추론해야 할 때가 많습니다. 2단 구성, 도표, 수식, 표는 이런 추론을 더 복잡하게 만듭니다.

PDF 한 페이지를 단순한 텍스트 순서로 읽을 수 없는 이유

문서를 편집할 때는 보통 무엇이 제목이고 문단인지, 표의 데이터가 어느 열에 속하는지 알 수 있습니다. 반면 PDF는 ‘완성된 페이지의 모습’에 더 가깝습니다. 글자, 선, 이미지, 여백이 각 위치에 놓여 있지만 명확한 구조 정보가 함께 들어 있다고 보장할 수는 없습니다.

하나의 문단이 여러 독립된 텍스트 블록으로 나뉠 수 있고, 도표의 글자가 그림 요소와 따로 저장될 수도 있습니다. 표가 명확한 행과 열 정보 없이 선과 숫자의 집합으로만 존재하기도 합니다. 스캔 PDF는 페이지 자체가 이미지이므로 글자, 표, 수식을 먼저 이미지에서 인식해야 합니다.

따라서 번역 전에 몇 가지 질문에 답해야 합니다.

  • 어떤 텍스트가 같은 문단에 속할까요?
  • 어떤 제목이 아래의 내용에 해당할까요?
  • 두 단은 어떤 순서로 읽어야 할까요?
  • 이 설명은 어느 그림이나 표에 속할까요?
  • 머리글과 바닥글은 본문과 어떻게 구분할까요?

이런 관계를 먼저 이해하지 않고 텍스트를 추출해 블록별로 번역한 뒤 순서대로 배치하면, 모든 문장은 번역됐지만 어디서부터 읽어야 할지 알 수 없는 페이지가 될 수 있습니다.

그래서 첫 단계는 단어를 교체하는 일이 아니라 페이지 구조를 최대한 이해하는 일입니다. 기술적으로는 문자열을 읽는 것보다, 이미 완성된 페이지 위에서 ‘제목–문단–도표–설명’의 관계를 다시 세우는 작업에 가깝습니다.

2단 구성에서 정말 어려운 것은 읽는 순서입니다

논문과 기술 보고서는 2단 구성을 자주 사용합니다. 우리가 복원하려는 것은 세로로 나뉜 두 영역 자체가 아니라 독자가 페이지를 읽어 가는 경로입니다. 어느 단이 먼저인지, 제목은 어디에 속하는지, 언제 각주를 읽어야 하는지가 중요합니다.

사람은 왼쪽 단을 읽고 오른쪽으로 넘어가야 한다는 것을 금방 알 수 있습니다. 하지만 처리 시스템에는 페이지의 글자 위치가 곧 읽는 순서는 아닙니다.

문단이 여러 줄로 나뉘고 각 줄이 독립된 텍스트 블록으로 인식될 수 있습니다. 좌표나 추출 순서만 따르면 왼쪽 단이 끝나기 전에 오른쪽으로 넘어가거나, 제목이 잘못 배치되거나, 각주가 본문 중간에 들어가거나, 두 단에 걸친 도표가 한쪽 단에만 속한 것으로 처리될 수 있습니다.

기술적으로는 페이지 영역 구분, 텍스트 블록 정렬, 흐름 사이에 들어오는 특수 요소를 함께 처리해야 합니다.

  1. 단과 단 사이의 경계를 판단합니다.
  2. 제목, 본문, 각주, 머리글과 바닥글을 구분합니다.
  3. 텍스트 블록 사이의 앞뒤 순서를 복원합니다.
  4. 번역 후 사용 가능한 단 너비 안에서 줄바꿈을 다시 배치합니다.
  5. 독자가 원래 순서대로 읽을 수 있는지 확인합니다.

번역문이 길어지면 원래 텍스트 영역에 들어가지 않을 수도 있습니다. 각 줄의 위치를 억지로 고정하면 글자가 겹치거나 빈 공간이 지나치게 커집니다. 좋은 복원은 모든 글자를 원래 좌표에 고정하는 것이 아니라 2단 구성이 만드는 읽기 질서를 최대한 유지하는 것입니다.

도표는 한 장의 그림이 아니라 연결된 정보입니다

도표는 PDF 번역에서 어려움을 과소평가하기 쉬운 부분입니다. 복원해야 하는 것은 ‘비슷하게 보이는 그림’이 아니라 그래픽, 데이터, 범례, 캡션, 본문 사이의 대응 관계입니다.

독자에게는 그림과 그 근처의 글이 자연스럽게 같은 설명에 속합니다. 하지만 PDF 내부에서는 서로 독립된 객체일 수 있고, 서로 다른 콘텐츠 레이어에 있을 수도 있습니다.

본문을 모두 번역해도 도표 제목, 축, 범례, 주석을 처리하지 않으면 저자의 설명을 여전히 이해하기 어려울 수 있습니다. 반대로 도표 안의 글자만 번역하고 본문이나 캡션과의 연결을 유지하지 않아도 관련 정보가 흩어집니다.

도표에는 보통 여러 층의 정보가 있습니다.

  • 무엇을 다루는지 알려 주는 제목.
  • 숫자를 해석하는 방법을 알려 주는 축과 단위.
  • 색, 선, 기호의 의미를 설명하는 범례.
  • 특정 결과나 변화를 가리키는 도표 안의 주석.
  • 조건과 해석을 보충하는 캡션 및 본문의 참조.

이 내용은 하나의 전체로 다뤄야 합니다. 시스템은 단순히 ‘가까이 있다’는 이유만으로 연결을 판단해서는 안 됩니다.

  • 캡션은 그림 아래에 있을 수도 있고, 페이지가 나뉘면서 다음 페이지로 넘어갈 수도 있습니다.
  • 2단 페이지에서 가장 가까운 문단이 반드시 그 도표의 설명은 아닙니다.
  • 본문의 ‘그림 2 참조’가 멀리 떨어진 그림을 가리킬 수 있습니다.
  • 도표 안의 글자는 추출 가능한 텍스트일 수도, 그림에 합쳐진 이미지일 수도 있습니다.
  • 축, 범례, 데이터 레이블은 번역해야 하지만 숫자와 데이터 관계는 바꾸면 안 됩니다.

번역은 추출 가능한 문장만 처리하는 것이 아니라 데이터, 그림, 설명의 관계를 최대한 보존해야 합니다. 즉 ‘여기에 글자가 있다’뿐 아니라 ‘이 글자가 도표에서 어떤 역할을 하는가’를 판단해야 합니다.

그래서 도표 복원은 글자가 번역됐는지만으로 평가할 수 없습니다. 범례가 올바르게 대응하는지, 단위가 빠지지 않았는지, 캡션을 찾을 수 있는지, 본문의 ‘그림 2’가 실제로 그 그림을 가리키는지도 확인해야 합니다. 연결 하나가 틀리면 그림은 남아 있어도 독자가 이해하는 내용은 달라질 수 있습니다.

수식에서 어려운 것은 주변과의 관계이기도 합니다

수식 자체는 보통 번역할 필요가 없습니다. 복원해야 하는 것은 주변 글과의 관계입니다. 변수의 설명, 수식 번호 참조, 앞뒤에 적힌 조건을 유지해야 합니다.

변수가 다음 문단에서 설명되거나, 수식 번호가 본문에서 인용되거나, 주변 조건이 결론의 성립 여부를 결정할 수 있습니다. 수식만 남기고 변수 설명, 번호, 문맥과의 대응을 잃으면 여전히 활용하기 어렵습니다.

기술적으로 수식은 여러 형태로 저장될 수 있습니다. 텍스트 문자와 벡터 선을 조합한 경우도 있고, 이미 이미지가 되어 원래 편집기의 수학 구조가 남아 있지 않은 경우도 있습니다. 추출 과정에서 위첨자, 아래첨자, 근호, 그리스 문자가 분리되거나 혼동될 수 있습니다. 다시 배치할 때도 일반 문장처럼 임의로 줄을 나눌 수 없습니다. 수식, 번호, 본문의 참조가 대응해야 하며, 위치나 순서 오류로 독자가 ‘식 (3)’을 다른 식으로 받아들여서는 안 됩니다.

최소한 다음 사항을 확인해야 합니다.

  • 기호, 위첨자, 아래첨자, 특수 문자가 온전히 남아 있는지.
  • 수식 번호가 본문의 참조와 일치하는지.
  • 변수 설명이 관련 위치 가까이에 있는지.
  • 줄바꿈 후에도 수식이 명확하게 읽히는지.
  • 주변 설명문이 잘못 나뉘지는 않았는지.

논문과 기술 자료에서 수식이 ‘보기에 남아 있다’는 것은 가장 기본적인 확인일 뿐입니다. 앞뒤 문장과의 관계도 똑같이 중요합니다.

표에서는 한 칸의 어긋남이 숫자의 의미를 바꿉니다

표에서 복원할 것은 테두리와 선 자체가 아니라 행, 열, 머리글, 단위, 주석, 숫자의 관계입니다. 숫자는 올바른 행과 열, 머리글, 단위와 함께 놓여야 완전한 의미를 가집니다.

실제 파일에는 병합 셀, 페이지를 넘나드는 머리글, 테두리 없는 열, 공백으로만 맞춘 표가 있을 수 있습니다. 번역으로 한 셀의 글이 길어지면 전체 열 너비에 영향을 줄 수 있습니다. 원래 좌표에 그대로 놓으면 글이 넘치거나 다음 열을 가리거나 숫자가 다른 행에 속한 것처럼 보일 수 있습니다.

따라서 표 복원은 선을 같은 자리에 다시 그리는 일보다 행과 열의 관계, 머리글의 계층, 단위와 주석을 유지하는 일입니다.

번역문이 길어지면 페이지도 균형을 다시 잡아야 합니다

페이지 구조를 정확히 인식해도 번역 후에는 현실적인 문제가 남습니다. 같은 뜻을 표현하는 데 필요한 공간이 언어마다 다릅니다. 유지해야 하는 것은 각 글자의 좌표가 아니라 제목, 문단, 도표, 수식 사이의 명확한 공간적 관계입니다.

영어 문단을 중국어로 옮기면 짧아질 수도 있지만, 용어와 괄호, 설명 때문에 길어질 수도 있습니다. 언어가 바뀌면 단어의 줄바꿈 가능 위치, 문장부호 배치, 글꼴 너비도 달라져 최종 페이지에 영향을 줍니다.

이에 따라 다음도 달라질 수 있습니다.

  • 두 단 안에서 줄이 바뀌는 위치.
  • 제목이 두 줄을 차지해야 하는지 여부.
  • 도표 옆에 남는 공간.
  • 표의 글자가 셀 밖으로 나가는지 여부.
  • 원래 페이지 영역에 전체 번역문이 들어가는지 여부.

따라서 번역 후 배치는 기존 텍스트 상자에 새 문장을 붙여 넣는 것만으로 끝나지 않습니다. 구조의 유사성과 읽기 편안함 사이에서 균형을 찾아야 합니다.

우리는 이러한 관계를 어떻게 보존하려 할까요?

iSomor는 레이아웃 복원을 마지막에 덧붙이는 장식이 아니라 번역 과정의 일부로 봅니다. 현재는 추출 가능한 텍스트가 있는 PDF를 바탕으로 레이아웃 인식, 문단 구성, 번역, 번역문 배치를 연결합니다. 다음 단계는 무엇을 처리하고 결과의 유용성을 어떻게 판단하는지 설명합니다. 모든 복잡한 관계를 이미 자동으로 인식하고 검증할 수 있다는 뜻은 아닙니다.

먼저 의미 있는 콘텐츠 단위를 구분합니다

페이지 분석에서는 글자 위치와 레이아웃 영역을 함께 고려해 본문, 제목, 도표, 수식 등을 최대한 구분하고 번역할 문단을 구성합니다. 목표는 페이지를 더 잘게 자르는 것이 아니라 연결되어야 할 글이 분리되거나 다른 영역의 글이 섞이는 일을 줄이는 것입니다.

표가 구체적인 예입니다. 구현에서는 셀 영역 정보를 후속 문단 그룹화에 활용해 같은 셀의 여러 줄을 가능한 한 함께 이해하고 다른 셀의 내용은 섞이지 않도록 돕습니다. 그렇다고 모든 표가 정확히 재구성되는 것은 아닙니다. 테두리 없는 표, 복잡한 머리글, 한 셀 안의 여러 문단은 여전히 그룹화 오류를 일으킬 수 있어 확인이 필요합니다.

관련 정보는 가능한 한 함께 남깁니다

그림을 인식하는 것만으로는 부족합니다. 결과가 유용하려면 캡션, 범례, 본문 참조도 올바르게 대응해야 합니다. 수식 역시 번호와 변수 설명의 연결을 잃어서는 안 됩니다.

이는 우선 복원의 목표이지, 시스템이 모든 참조 관계를 이해한다는 약속이 아닙니다. 원래 그래픽과 번호, 가까운 글의 위치 관계를 보존하면 독자가 대조하기 쉽습니다. 하지만 페이지를 넘어간 캡션, 멀리 떨어진 참조, 이미지에 합쳐진 글자는 페이지가 온전해 보인다는 이유만으로 정확히 처리됐다고 볼 수 없습니다.

문단 안에서 필요한 문맥을 보존합니다

현재 번역은 각 줄을 독립된 문장으로 보지 않고 문단 단위로 처리합니다. 문단을 최대한 정확히 구성하면 문장이 잘려 문맥을 잃는 문제를 줄일 수 있습니다.

하지만 문단 그룹화가 문서 전체의 용어 일관성을 자동으로 보장하지는 않습니다. 제목, 본문, 범례, 표에서 같은 용어가 다르게 번역될 수 있고, 서로 다른 영역에 있을 때는 특히 그렇습니다. 중요한 용어와 결론은 원문과 함께 확인하는 것이 좋습니다. 번역 완료를 문서 전체의 일관성 검토 완료와 같다고 보지 않습니다.

번역문에 맞춰 공간을 다시 계산합니다

글의 길이가 달라지면 사용 가능한 영역에 맞춰 줄바꿈과 배치를 조정하면서 도표와 수식 등을 최대한 유지해야 합니다. 어려운 점은 한 문단이 들어간다고 해서 이웃 영역과 충돌하지 않는 것은 아니라는 점입니다.

두 줄이 된 제목이 아래 내용을 밀어내는지, 길어진 캡션이 공간을 벗어나는지, 표의 번역문이 옆 열에 닿는지를 살펴야 합니다. 재배치는 서로 제약을 주는 영역 안에서 읽기 좋은 구성을 찾는 일이지 글자를 원래 좌표에 하나씩 붙이는 일이 아닙니다. 단 너비의 자동 재구성, 도표의 페이지 간 이동, 페이지 나눔 재계산이 모든 파일에서 보장되는 효과라고 말하지 않습니다.

결과가 원본과 픽셀 단위로 같을 필요는 없습니다. 더 중요한 것은 제목과 본문을 구별하고, 도표의 설명을 찾고, 원래 논지를 따라 읽을 수 있다는 점입니다.

마지막에는 원문으로 돌아가 내용과 배치를 확인합니다

페이지가 깔끔하다고 해서 정확한 것은 아닙니다. 검토에서는 누락이나 중복, 잘못된 대응 관계, 겹침·잘림·순서 오류를 나눠 봐야 합니다. 이는 결과를 평가하는 기준이지 도구가 모든 내용 및 시각 검증을 자동으로 끝냈다는 뜻이 아닙니다.

도표는 온전히 보이지만 캡션과의 연결이 불분명할 수 있습니다. 수식은 있지만 위첨자나 아래첨자 위치가 틀릴 수 있습니다. 표는 정렬되어 보이지만 숫자가 옆 열로 이동했을 수 있습니다. 이런 문제는 마지막 화면만 보는 것이 아니라 내용과 구조를 대조해서 찾아야 합니다.

숫자, 용어, 수식, 결론을 확인할 때 원문은 여전히 중요한 기준입니다. 레이아웃 복원은 찾고 대조하는 부담을 줄여 주지만 핵심 내용에 대한 독자의 판단을 대신할 수 없습니다.

우리가 원하는 것은 같은 그림이 아니라 계속 읽을 수 있는 문서입니다

‘복원’이라고 하면 모든 글자와 선을 원본과 정확히 같은 위치에 놓아야 한다고 생각하기 쉽습니다. 하지만 언어가 달라진 상황에서는 항상 합리적인 목표는 아닙니다.

원래 줄 수를 유지하려고 글자를 너무 작게 줄이거나 문단을 빽빽하게 붙이면 원본과 비슷해 보여도 읽기는 더 어려워집니다. 반대로 사용 가능한 공간에서 줄바꿈, 글자 크기, 줄 간격을 적절히 조정하되 제목, 도표, 수식, 설명의 관계를 명확히 유지하면 더 쉽게 읽을 수 있습니다.

그래서 우리는 몇 가지 실질적인 질문을 더 중요하게 봅니다.

  • 내용이 빠짐없이 보존됐는가?
  • 읽는 순서가 명확한가?
  • 도표와 수식이 본문과 대응하는가?
  • 필요할 때 원문으로 돌아가 대조할 수 있는가?
  • 실제로 읽는 데 적합한 페이지인가?

이것이 iSomor가 해결하려는 문제입니다. PDF를 번역된 문장의 나열로 바꾸기보다 읽고, 필요한 부분을 찾고, 계속 활용할 수 있는 자료로 남기고자 합니다.

복잡한 파일은 여전히 확인이 필요합니다

PDF는 출처와 제작 방식에 따라 크게 다릅니다. iSomor는 현재 추출 가능한 텍스트가 포함된 PDF를 대상으로 합니다. 페이지 전체를 스캔한 이미지에 필요한 OCR은 현재 제공 범위에 포함되지 않습니다. 텍스트 PDF라도 복잡한 중첩 표, 특수 글꼴, 이미지에 합쳐진 글자는 자동 처리의 한계를 넘을 수 있습니다.

따라서 번역 후에도 특히 논문의 핵심 숫자, 수식, 도표, 결론은 원문에서 다시 확인할 가치가 있습니다. 우리는 깔끔한 배치를 내용이 완전히 정확하다는 증거로 보지 않습니다.

기술 작업의 의미는 복잡함을 독자에게 떠넘기는 것이 아니라 읽기를 끊는 요소를 최대한 미리 처리하는 데 있습니다. 다시 정리하거나 대응 위치를 찾는 수고가 하나 줄어들 때마다 독자는 자료 자체에 조금 더 집중할 수 있습니다.