파일은 기기를 벗어나지 않습니다.작동 방식
PDF를 텍스트로 변환하는 방법
- 1위에 PDF를 끌어다 놓으세요(또는 클릭해서 선택하세요).
- 2텍스트 추출을 클릭하세요.
- 3모든 텍스트가 담긴 .txt 파일을 다운로드하세요.
자주 묻는 질문
- 제 파일이 업로드되나요?
- 아니요. 텍스트는 브라우저 안에서 완전히 읽어들여집니다 — PDF는 절대 기기를 벗어나지 않습니다.
- 텍스트를 찾을 수 없다고 나오는데, 왜인가요?
- PDF가 텍스트 레이어 없는 스캔본(페이지 이미지)일 가능성이 높습니다. 먼저 PDF OCR로 텍스트 레이어를 추가한 뒤 추출하세요.
- 레이아웃이 유지되나요?
- 이 도구는 읽는 순서와 줄바꿈은 유지하지만, 단 구성이나 표, 정확한 간격은 유지하지 않습니다 — 서식이 있는 문서가 아니라 깔끔한 일반 텍스트를 만들어냅니다.
PDF에서 텍스트만 뽑아내기
PDF에서 실제 텍스트가 필요할 때 — 인용하거나, 검색하거나, 다른 도구에 입력하거나, 문서에 붙여 넣을 때 — PDF to Text는 파일의 텍스트 레이어를 읽어 한 줄씩 순수 .txt 파일로 재구성합니다. 전체 과정이 브라우저 안에서만 실행되므로, 기밀 문서라도 절대 기기 밖으로 나가지 않습니다.
텍스트만, 레이아웃은 아님
이 도구는 읽기 순서와 줄바꿈은 유지하는데, 이는 복사와 재사용에 필요한 부분입니다. 다만 열, 표, 정확한 위치까지 재현하려 하지는 않습니다 — 결과물은 깔끔한 일반 텍스트입니다. 페이지는 빈 줄로 구분됩니다.
스캔한 PDF의 경우
스캔한 PDF는 텍스트 레이어가 없는 일련의 페이지 이미지이므로 추출할 것이 없습니다. 먼저 OCR PDF로 텍스트를 인식시킨 다음, 다시 돌아와 여기서 추출하세요.
추출이 실제로 작동하는 방식
실제 텍스트가 있는 PDF는 Word 문서처럼 단락을 저장하지 않습니다 — 페이지 위 정확한 좌표에 배치된 개별 글리프와, 문자 코드로 되돌아가는 매핑을 저장합니다. PDF to Text는 페이지별로 이렇게 배치된 글리프를 순회하며 좌표를 기준으로 줄을 재조합합니다. PDF 포맷 자체에는 "줄"이나 "단락"이라는 실제 개념이 없는데도 읽기 순서가 대체로 맞게 나오는 이유가 바로 이것입니다.
추출이 잘못되는 경우
간혹 PDF가 손상되었거나 비표준 폰트 인코딩으로 제작된 경우가 있습니다 — 특히 특수 소프트웨어에서 내보낸 오래된 문서에서 흔한데, 이럴 때는 시각적으로는 멀쩡해 보여도 텍스트가 깨진 문자로 나옵니다. 파일 내부의 텍스트 매핑 자체가 잘못되어 있으므로 추출 단계에서는 해결할 방법이 없습니다. 신문이나 학술 논문 같은 다단 레이아웃도 예상치 못한 순서로 뒤섞일 수 있는데, 이 도구가 시각적 열이 아니라 위치를 기준으로 읽기 때문입니다.
실제 활용 사례
흔한 활용 사례로는 큰 문서 전체를 검색하기, 숫자나 조항을 스프레드시트로 옮기기, 일반 텍스트만 받는 다른 도구에 문서를 입력하기, 스크린 리더를 위해 콘텐츠를 접근 가능하게 만들기 등이 있습니다. 추출된 텍스트가 아니라 PDF 자체의 접근성을 높이려면, 문서를 그대로 두면서 실제 텍스트 레이어를 추가하는 OCR PDF를 살펴보세요.