Problem
기업 문서는 단순 텍스트가 아닙니다. 테이블, 중첩 섹션, 상호 참조, 엔터티 관계, 그리고 의미를 전달하는 서식을 포함합니다. 플랫 마스킹 도구는 이런 문서를 처리할 때 모든 민감 값을 동일하게 취급해, 구조적 역할과 무관하게 획일적인 대체값으로 바꿉니다. 그 결과 문서를 문서답게 만드는 관계가 사라집니다.
테이블 헤더의 고객 이름은 단락 속 같은 이름과 다른 기능을 합니다. 계약서 전문의 날짜는 결제 일정의 날짜와 의미가 다릅니다. 플랫 마스킹은 이런 구분을 무너뜨려 AI 출력 품질을 떨어뜨립니다. 값이 가려진 뒤에도 문서가 읽히려면, 어떤 값이 어디에 있고 무엇과 연결되는지가 함께 살아 있어야 합니다.
문서 구조 보존 처리는 문서의 레이아웃, 엔터티 관계, 테이블 구조, 의미적 맥락을 유지하면서 민감 요소만 대체하는 데이터 전환 방법입니다. AI 모델이 정확한 요약·추출·분석을 수행할 수 있도록, 구조적으로 온전한 문서를 그대로 전달합니다.
핵심 차이는 대체가 문서를 이해하는 방식으로 이뤄진다는 점입니다. 값 하나하나를 독립적으로 가리는 대신, 그 값이 문서 안에서 어떤 역할을 하고 어디와 연결되는지를 반영해 대체합니다. 그래서 처리가 끝난 뒤에도 문서는 여전히 하나의 문서로 읽힙니다.
Explanation — 무엇을 어떻게 보존하는가
문서 구조 보존 처리는 여러 문서 레이어에서 동시에 작동합니다. 각 레이어는 AI가 문서를 올바르게 읽기 위해 필요한 서로 다른 단서를 담고 있습니다.
- 레이아웃 보존. 테이블 구조, 열 헤더, 행 관계, 중첩 섹션이 그대로 유지됩니다. 스키마가 온전하게 남기 때문에 AI 모델이 테이블 데이터를 정확하게 추출합니다. 셀이 어느 열·행에 속하는지가 사라지면 추출 자체가 어긋납니다.
- 엔터티 일관성. 동일한 엔터티가 문서에서 여러 번 나타나면 모든 인스턴스가 같은 대체값으로 매핑됩니다. 덕분에 AI 모델이 섹션 간 엔터티 참조를 추적할 수 있습니다. 예를 들어 1조의 “차입인”은 7조의 동일한 대체값을 참조합니다. 매핑이 인스턴스마다 달라지면 모델은 이들을 서로 다른 대상으로 오인합니다.
- 의미적 맥락. 맥락 인식 데이터 제어가, 원본 그대로 내보내면 안 되는 민감 데이터와 AI가 이해에 필요한 맥락 정보를 구분합니다. 직함, 섹션 헤더, 문서 유형 표시자는 읽을 수 있게 남습니다. 이 신호가 남아야 모델이 문서의 목적과 구조를 파악합니다.
- 문서 간 일관성. 계약서와 그 수정본처럼 여러 문서로 이뤄진 세트를 처리할 때, 엔터티 매핑이 파일 간에 일관되게 유지되어 AI가 정확한 문서 간 분석을 수행합니다. 한 파일에서의 대체값이 다른 파일에서도 같은 엔터티를 가리켜야 비교와 대조가 성립합니다.
| 구분 | 플랫 마스킹 | 문서 구조 보존 처리 |
|---|---|---|
| 테이블·계층 구조 | 무너짐 | 그대로 유지 |
| 반복되는 엔터티 참조 | 제각각 대체 | 동일 대체값으로 일관 매핑 |
| 서식·의미 맥락 | 손실 | 읽을 수 있게 유지 |
| AI 출력 품질 | 저하 | 정확한 요약·추출·분석 |
플랫 마스킹과 무엇이 다른가
플랫 마스킹은 값을 가리는 데 초점을 둡니다. 필드 하나가 노출되지 않게 만드는 것이 목표이므로, 그 필드가 문서 전체에서 하는 역할은 고려하지 않습니다. 반대로 문서 구조 보존 처리는 값을 가린 뒤에도 문서가 업무에 쓸 수 있는 상태로 남는지를 기준으로 삼습니다.
차이는 결과물에서 드러납니다. 플랫 마스킹을 거친 문서는 사람이 다시 맞춰 봐야 의미가 통합니다. 어떤 대체값이 어떤 대상을 가리키는지, 표가 원래 어떤 모양이었는지 사람이 되짚어야 합니다. 사람이 결과를 다시 맞춰야 한다면 자동화라 부르기 어렵습니다. 문서 구조 보존 처리는 바로 이 재작업을 없애는 것을 목표로 합니다.
이 차이는 AI 출력 품질과 직결됩니다. 모델은 문서에 남은 구조와 관계를 단서로 삼아 요약하고 추출하고 비교합니다. 구조가 무너진 입력에서는 아무리 성능이 좋은 모델이라도 어긋난 근거 위에서 답을 만들 수밖에 없습니다. 반대로 구조가 온전하면 같은 모델이 같은 질문에 훨씬 정확하게 답합니다. 대체가 끝난 문서의 품질이 곧 AI 결과의 상한을 정하는 셈입니다.
기업 활용 시나리오
구조 보존이 실무에서 어떤 차이를 만드는지는 실제 문서를 다루는 상황에서 가장 분명하게 드러납니다. 아래 세 가지는 모두 민감 정보와 구조가 한 문서 안에 얽혀 있어, 값만 가려서는 AI가 제 역할을 하기 어려운 경우입니다.
재무제표 분석
감사법인이 15개 포트폴리오 기업의 분기별 재무제표를 AI로 비교해야 합니다. 각 재무제표에는 회사명, 임원 이름, 계좌번호, 재무 수치가 담긴 테이블 데이터가 있습니다.
문서 구조 보존 처리가 모든 테이블 구조와 엔터티 관계를 유지합니다. AI는 대체 처리된 재무제표를 대상으로 비교 분석을 수행하고, 로컬 복원이 실제 회사 데이터를 되살려 분석가가 바로 쓸 수 있는 비교 보고서를 만들어 냅니다. 원본 값과 복원 매핑은 고객 환경 안에 머뭅니다.
계약 검토
법무팀이 여러 버전의 계약서를 AI로 비교해 조항 변경을 찾아야 하는 상황을 생각해 봅니다. 계약서에는 당사자명, 금액, 날짜, 상호 참조되는 조항 번호가 얽혀 있습니다. 문서 구조 보존 처리는 조항 구조와 당사자 매핑을 파일 간에 일관되게 유지하므로, AI가 “3조의 당사자”가 개정본에서 어떻게 바뀌었는지 정확히 추적합니다. 원본 값은 고객 환경 안에 머뭅니다.
임상 요약
임상 문서를 요약하는 팀은 환자 식별 정보와 임상적으로 의미 있는 맥락을 함께 다뤄야 합니다. 민감한 식별자는 대체하되 섹션 구조와 항목 간 관계는 유지되어야, AI가 어느 수치가 어느 검사에 속하는지 혼동하지 않고 요약합니다. 레이아웃이 무너지면 요약은 그럴듯해 보여도 항목이 뒤섞입니다. 검사 결과가 다른 항목으로 옮겨 붙은 요약은 겉보기에 완결돼 보여도 그대로 신뢰하기 어렵습니다.
세 시나리오에 공통된 원리는 하나입니다. AI가 다루는 것은 값의 목록이 아니라 구조를 가진 문서라는 점입니다. 구조를 지킨 채 민감 요소만 바꾸면, 같은 문서·같은 모델·같은 질문에서 더 정확한 결과가 나옵니다.
정리
민감 요소를 가리는 것만으로는 부족합니다. 문서가 가려진 뒤에도 AI가 읽고 분석할 수 있어야 실제 업무 자동화로 이어집니다. 문서 구조 보존 처리는 레이아웃, 엔터티 관계, 의미적 맥락을 유지한 채 민감 요소만 대체해, AI 출력이 사람의 재작업 없이 실제 업무로 돌아오게 만드는 것을 목표로 합니다.