Files
sisvietnamvn_01/sisvietnamvn_main/parse_all_pdfs.py
T

20 lines
933 B
Python

import pdfplumber
import os
files = [
"/home/x79/sisvietnamvn_01/sisvietnamvn_Trang chính thức hiện tại/DaoTao/2.-CHUONG-TRINH-CAN-THIEP-MACH-MAU-THAN-KINH-NANG-CAO-BO-SUNG-FINAL.pdf",
"/home/x79/sisvietnamvn_01/sisvietnamvn_Trang chính thức hiện tại/DaoTao/CHUONG-TRINH-CAN-THIEP-MACH-MAU-CAC-TANG-VA-MACH-MAU-NGOAI-BIEN-CO-BAN.pdf",
"/home/x79/sisvietnamvn_01/sisvietnamvn_Trang chính thức hiện tại/DaoTao/CHUONG-TRINH-CHUAN-BI-DUNG-CU-VA-CHAM-SOC-BENH-NHAN-TRONG-PHONG-CHUP-MACH.pdf",
"/home/x79/sisvietnamvn_01/sisvietnamvn_Trang chính thức hiện tại/DaoTao/CHUONG-TRINH-DAO-TAO-TIM-MACH-CAN-THIEP-1.pdf"
]
for f in files:
print(f"--- {os.path.basename(f)} ---")
try:
with pdfplumber.open(f) as pdf:
page1 = pdf.pages[0].extract_text()
print(page1[:300].replace('\n', ' | '))
except Exception as e:
print(f"Error: {e}")
print()