Files
sisvietnamvn_01/sisvietnamvn_main/parse_pdf_detailed.py
T

17 lines
555 B
Python

import pdfplumber
import json
import re
filename = "/home/x79/sisvietnamvn_01/sisvietnamvn_Trang chính thức hiện tại/DaoTao/2.-CHUONG-TRINH-CAN-THIEP-MACH-MAU-THAN-KINH-NANG-CAO-BO-SUNG-FINAL.pdf"
with pdfplumber.open(filename) as pdf:
full_text = ""
for page in pdf.pages:
full_text += page.extract_text() + "\n"
print("Total length:", len(full_text))
# Find all headings
headings = re.findall(r'^(\d+)\.\s+(.*)$', full_text, re.MULTILINE)
print("Headings found:")
for h in headings:
print(h)