파일은 기기를 벗어나지 않습니다.작동 방식
PDF를 Markdown으로 변환하는 방법
- 1위 영역에 PDF를 드래그하거나 클릭해서 선택하세요.
- 2Convert to Markdown 버튼을 클릭하세요.
- 3.md 파일을 다운로드하세요.
자주 묻는 질문
- 제목과 목록은 어떻게 인식되나요?
- PDF에는 구조 정보가 따로 저장되어 있지 않기 때문에, HivePDF는 레이아웃을 보고 구조를 추론합니다. 본문보다 눈에 띄게 큰 글자는 제목으로, 글머리 기호나 번호로 시작하는 줄은 목록 항목으로 처리하고, 나머지는 문단으로 묶습니다.
- 스캔한 PDF도 변환할 수 있나요?
- 아니요. 스캔 파일은 텍스트 레이어 없이 이미지로만 이루어져 있어서 읽을 텍스트가 없습니다. 먼저 OCR로 텍스트 레이어를 추가한 뒤 Markdown으로 변환하세요.
- 파일이 업로드되나요?
- 아니요. 텍스트 추출과 변환 모두 브라우저 안에서 완전히 처리됩니다. 문서가 기기를 벗어나지 않습니다.
PDF를 깔끔한 Markdown으로
Markdown은 문서를 대형 언어 모델, 정적 사이트 생성기, 노트 앱에 전달할 때 쓰이는 공용어입니다 — 하지만 PDF는 내보낼 수 있는 구조를 갖고 있지 않습니다. PDF to Markdown은 텍스트 레이어를 읽어 합리적인 문서를 재구성합니다. 페이지 레이아웃에서 제목, 글머리 기호 목록, 번호 목록, 문단을 감지해 Markdown으로 작성합니다.
LLM 및 문서 작업 흐름을 위해 설계
RAG 파이프라인을 구축하거나 문서를 작성하거나 콘텐츠를 채팅 모델에 붙여넣는 경우, Markdown은 원본 PDF 텍스트보다 다루기가 훨씬 쉽습니다. 결과물은 제목 레벨과 목록을 유지하므로 구조가 보존되며, 이는 모델이 콘텐츠를 청크로 나누고 이해하는 데 도움이 됩니다.
참고 사항 및 제한
구조는 휴리스틱 방식으로 추론되므로 복잡한 다단 레이아웃이나 표는 완벽하게 매핑되지 않을 수 있습니다 — 중요한 내용은 결과물을 검토하세요. 스캔한 PDF는 먼저 OCR이 필요합니다. 모든 처리는 로컬에서 이루어지므로 어디에도 업로드되지 않습니다.
레이아웃이 구조로 읽히는 방식
내부적으로 HivePDF는 PDF의 텍스트 런(run)을 순회하며 각 텍스트의 글꼴 크기, 굵기, 페이지 내 위치를 기록합니다. 주변 본문 텍스트보다 눈에 띄게 크거나 한 줄만 굵게 표시된 텍스트는 제목으로 간주되며, 문서 전체 대비 상대적인 크기에 따라 결과물에서 H1, H2, H3 중 무엇이 될지 결정됩니다. 대시, 글머리 기호, 마침표가 뒤따르는 숫자로 시작하는 줄은 목록 항목이 되며, 동일한 들여쓰기 수준의 연속된 줄은 나뉘지 않고 하나의 목록으로 묶입니다.
변환이 어려움을 겪는 부분
표가 가장 큰 제한 사항입니다. PDF는 표를 행과 열이 아니라 위치가 지정된 텍스트로 저장하기 때문에, 셀이 Markdown 표가 아닌 한 줄이나 하나의 문단으로 뭉개지는 경우가 많습니다. 다단 구성의 학술 논문이나 브로슈어는 PDF 내 읽기 순서가 특이할 경우 두 단의 텍스트가 섞일 수 있습니다. 각주나 페이지 머리글·바닥글이 본문에 딸려 들어가는 경우도 있습니다. 결과물은 완벽한 왕복 변환을 기대하기보다 훌륭한 초안으로 여기고 문제 부분은 직접 수정하세요.
흔히 이어지는 다음 단계
많은 사용자가 스캔한 문서에 OCR을 실행한 뒤 이 도구를 사용하거나, 원본 PDF에 다이어그램과 텍스트가 섞여 있어 따로 보관하고 싶을 때 Extract Images와 함께 사용합니다.