PDFIntact

PDF에서 표와 본문을 그대로 꺼냅니다

이 PDF는 복사하면 글자가 깨집니다

PDF의 본문을 선택해 복사하고 붙여 넣으면, 전혀 다른 문자 체계의 읽을 수 없는 문자열이 나옵니다. 화면에는 제대로 보이는데 복사한 순간에만 무너집니다.

원인은 PDF에 넣은 글꼴에 ToUnicode CMap, 즉 글자 모양과 문자 코드를 잇는 대응표가 빠져 있기 때문입니다. 화면에 그리는 데는 「이 모양을 그려라」만 있으면 되므로 표시는 정상입니다. 복사는 문자 코드를 필요로 하고, 바로 거기서 연결이 끊깁니다. 논문, 공공기관 자료, 오래된 조판 소프트웨어로 만든 파일에서 흔합니다.

글자가 망가진 것은 아닙니다. 페이지에는 읽을 수 있는 자형이 그려져 있습니다. 그래서 페이지를 이미지로 다시 읽으면 본문을 되찾을 수 있습니다. 글꼴을 바꾸거나 다른 프로그램에 붙여 넣어도 소용없습니다. 정보는 복사하는 순간에 이미 사라졌습니다.

지금 시도

가지고 계신 PDF로 확인해 보세요

진단은 브라우저 안에서만 이루어집니다. 파일은 어디로도 전송되지 않으며 가입도 필요 없습니다. 몇 페이지, 표와 그림이 몇 개나 나오는지 결제 전에 확인할 수 있습니다.

실례

実際のPDFからコピーした文字列

下は官公庁の資料からコピーした実物です。左が化けたもの、右が復元したものです。左をコピーして、お使いのエディタに貼ってみてください。同じ結果になります。

コピーした結果

ᆅ᪉බඹᅋయ࡟࠾ࡅࡿ᭩㠃つไࠊᢲ༳ࠊᑐ㠃つไࡢぢ┤ࡋ࡟ࡘ࠸࡚

PDFIntact で取り出した結果

地方公共団体における書面規制、押印、対面規制の見直しについて

お手元の文字列で判定する

コピーした文字列を貼ると、それがこの種類の文字化けかどうかをその場で判定します。PDFを用意しなくても、コピーした結果だけで確かめられます。

判定はこのブラウザの中だけで行っています。入力した文字列はどこにも送信されません。

자주 묻는 질문

Why does copying from a PDF produce garbled text?
Because the fonts embedded in the file are missing the table (the ToUnicode CMap) that says which character each glyph shape represents. The page displays correctly, but copying yields different characters. The text is not damaged — only the mapping is missing — so reading the pages as images recovers it.
Can the text be recovered from a garbled PDF?
Yes. PDFIntact reads the pages back as images and recovers the text with character recognition. The check runs entirely in your browser before you pay, so you can confirm it works on your file. Nothing is uploaded.
Will pasting into Word fix it?
No. The character codes are already lost at the point of copying, so the same corruption appears wherever you paste. Changing fonts does not help either.
How much does it cost?
A one-off charge based on page count: 160 JPY for 1–10 pages, 300 for 11–30, 550 for 31–60, 850 for 61–100 and 1,500 for 101–200. No account required. The check itself is free.

다른 증상도 한 번에 진단하기내보내기 형식의 차이