from pypdf import PdfReader
import re

reader = PdfReader("myanmar_book.pdf")
text = ""

# pages 11-20 correspond to indices 10-19
for i in range(10, 20):
    page = reader.pages[i]
    page_text = page.extract_text()
    
    # Remove "www.burmeseclassic.com"
    page_text = page_text.replace("www.burmeseclassic.com", "")
    
    # Empty line between paragraphs: let's replace single newlines with spaces, 
    # but that might break Myanmar syllables. Actually, just adding a newline between paragraphs.
    # pypdf sometimes gives bad paragraph formatting. Let's see what it extracts first.
    
    text += f"\n\n--- Trang {i+1} ---\n\n"
    text += page_text

with open("extracted_11_20.txt", "w", encoding="utf-8") as f:
    f.write(text.strip())
