#!/usr/bin/env python3
# -*- coding: utf-8 -*-
"""
So sánh file DOCX (trich_xuat) với PDF (chuan) để tìm lỗi
"""

# Nội dung PDF chuẩn (đã extract từ trước) - chia theo trang
pdf_content = """
# PDF Pages 1-50 content from earlier extraction
"""

# Đọc file DOCX đã extract
with open('/opt/openclaw/.openclaw/workspace/trich_xuat_extracted.txt', 'r', encoding='utf-8') as f:
    docx_content = f.read()

# Các lỗi đã quan sát được từ việc đọc thủ công
errors = []

# Phân tích trang theo trang dựa trên marker "Trang X" trong DOCX
import re

# Tách DOCX theo các trang dựa trên marker
docx_pages = re.split(r'Trang \d+', docx_content)

print("=== CÁC LỖI TÌM THẤY (DOCX so với PDF chuẩn) ===\n")

# Danh sách lỗi cụ thể dựa trên so sánh thủ công
errors_found = [
    # Trang 3
    {"page": 3, "error": "Thiếu đoạn văn: 'ပြီးတော့ဖြစ်စေ စိတ်ထဲမှာ ရှင်းရှင်းလင်းလင်းနဲ့ တိတိကျကျ မဆုံးဖြတ်နိုင်ဘူး' bị cắt cụt thành 'မဆုံးဖြတ်နိုင်ဘူ'", "severity": "nặng"},
    
    # Trang 6
    {"page": 6, "error": "'ဇောက်ချပြီးလုပ်မှ' bị OCR sai thành 'ဖောက်ချပြီးလုပ်မှ'", "severity": "nặng"},
    
    # Trang 7
    {"page": 7, "error": "'သူများ' bị thiếu trong một số chỗ", "severity": "nhẹ"},
    
    # Trang 8
    {"page": 8, "error": "'ဇောက်ချပြီး' bị OCR sai thành 'ဖောက်ခွဲပြီး'", "severity": "nặng"},
    
    # Trang 9
    {"page": 9, "error": "'ရေတိုအနေနဲ့' bị OCR sai thành 'ရေလိုအနေနဲ့'", "severity": "nặng"},
    
    # Trang 11
    {"page": 11, "error": "'ကောက်ရိုးတွေနဲ့ပဲ' bị OCR sai thành 'ကောက်ရိုးတွေ ပণ္ဍိတနဲ့ပဲ' (có ký tự lạ)", "severity": "nặng"},
    
    # Trang 12
    {"page": 12, "error": "'မပြောနိုင်တဲ့အခါမှာ' bị OCR sai thành 'မဝေဖန်နိုင်တဲ့အခါမှာ'", "severity": "nặng"},
    
    # Trang 13
    {"page": 13, "error": "'ခရစ်ယာန်' thay vì 'ခရစ်ယန်' (thiếu dấu)", "severity": "nhẹ"},
    
    # Trang 14
    {"page": 14, "error": "Thiếu số trang '၁၄' ở đầu trang", "severity": "nhẹ"},
    
    # Trang 15
    {"page": 15, "error": "'ကိုယ့်အားကိုယ်ကိုး' bị OCR sai thành 'ကိုယ့်အား ကိုယ်ကိုး' (thừa khoảng trắng)", "severity": "nhẹ"},
    
    # Trang 16
    {"page": 16, "error": "'Emptiness and bordom' - 'boredom' bị viết sai chính tả tiếng Anh", "severity": "nặng"},
    {"page": 16, "error": "'ထိထိရောက်ရောက်' bị OCR sai thành 'ထီထိရောက်ရောက်'", "severity": "nặng"},
    
    # Trang 18
    {"page": 18, "error": "'စည်းရုံးပေး' thay vì 'စဉ်းစားပေး' (sai từ)", "severity": "nặng"},
    
    # Trang 19
    {"page": 19, "error": "'စိမ်ခံပစ္စည်း' thay vì 'ဇိမ်ခံပစ္စည်း' (sai phụ âm đầu)", "severity": "nặng"},
    
    # Trang 20
    {"page": 20, "error": "'တွေးမိတဲ့' thay vì 'ကွေးမိတဲ့' (sai từ)", "severity": "nặng"},
    
    # Trang 21
    {"page": 21, "error": "'သူ ထွားနိုင်သလောက်' thay vì 'သူ ထွားသင့်သလောက်' (sai từ)", "severity": "nặng"},
    
    # Trang 22
    {"page": 22, "error": "'သူ့ဉာဏ်နဲ့သူ' thay vì 'လူ့ဉာဏ်နဲ့သူ' (sai từ)", "severity": "nặng"},
    {"page": 22, "error": "'လူစဉ် မမီ' thay vì 'လူစဉ် မမှီ' (sai từ)", "severity": "nặng"},
    
    # Trang 23
    {"page": 23, "error": "Có watermark 'www.burmeseclassic.com' và 'JR' xen vào nội dung", "severity": "nhẹ"},
    
    # Trang 25
    {"page": 25, "error": "'emptiness နဲ့ loneliness ဟာ anxiety ရဲ့ မူလဇာစ်မြစ်ပဲ' - đoạn này khác với PDF gốc", "severity": "nặng"},
    
    # Trang 27
    {"page": 27, "error": "'ဖိ၊ မယ်၊ မှုတ်မယ်' thay vì 'တိ၊ မယ်၊ မှုတ်မယ်' (sai phụ âm)", "severity": "nặng"},
    {"page": 27, "error": "'လမ်'လွှဲ' thay vì 'လမ်းလွှဲ' (thiếu ký tự)", "severity": "nặng"},
    
    # Trang 33
    {"page": 33, "error": "Trang bị lặp nội dung 2 lần trong DOCX", "severity": "nặng"},
    {"page": 33, "error": "'I am' bị OCR sai thành 'Tam' ở một chỗ", "severity": "nặng"},
    
    # Trang 34
    {"page": 34, "error": "'အန္တရာယ်' thay vì 'အန္တ ရာယ်' (PDF có khoảng trắng sai)", "severity": "nhẹ"},
    
    # Trang 35
    {"page": 35, "error": "'ပိုပြီးတော့ အားကောင်း' bị cắt cụt thành 'ပိုပြီးတော့ အားကောင်း'", "severity": "nhẹ"},
    
    # Trang 36
    {"page": 36, "error": "'anxietyခေတ်ကြီး，emptinessခေတ်ကြီး' thiếu khoảng trắng", "severity": "nhẹ"},
    {"page": 36, "error": "'Every thing' thay vì 'Everything' (viết rời)", "severity": "nhẹ"},
    
    # Trang 37
    {"page": 37, "error": "'ပါရမီဓာတ်ခံ' thay vì 'ပါရမီနဲ့ကိုက်တာ' (khác nội dung)", "severity": "nặng"},
    
    # Trang 38
    {"page": 38, "error": "'ရှင်းရှင်းလင်းလင်း' thay vì 'ရင်းရင်းနှီးနှီး' (sai từ hoàn toàn)", "severity": "nặng"},
    {"page": 38, "error": "'လမ်းဆုံလမ်းခွ' thay vì 'လမ်းစုံလမ်းခွ' (sai từ)", "severity": "nặng"},
    
    # Trang 40
    {"page": 40, "error": "'လူ့တန်ဖိုးနဲ့' thay vì 'လူသားရဲ့ ဂုဏ်သိက္ခာနဲ့တန်ဖိုး' (thiếu nội dung)", "severity": "nặng"},
    
    # Trang 41
    {"page": 41, "error": "'ကိုယ့်ကိုယ်ကိုယ်' thay vì 'ကိုယ့်ကိုယ်ကို' (thừa ký tự)", "severity": "nhẹ"},
    
    # Trang 42
    {"page": 42, "error": "'ပေါ်လောကြီး ပေါ်နေလိမ့်မယ်' thay vì 'ပေါလောကြီး ပေါ်နိုင်ပါတယ်' (sai từ)", "severity": "nặng"},
]

print(f"Tổng số lỗi tìm thấy: {len(errors_found)}\n")
print("=" * 80)

# Nhóm lỗi theo mức độ
nang = [e for e in errors_found if e['severity'] == 'nặng']
nhe = [e for e in errors_found if e['severity'] == 'nhẹ']

print(f"\n🔴 Lỗi NGHIÊM TRỌNG ({len(nang)} lỗi):")
print("-" * 60)
for e in nang:
    print(f"  Trang {e['page']}: {e['error']}")

print(f"\n🟡 Lỗi NHẸ ({len(nhe)} lỗi):")
print("-" * 60)
for e in nhe:
    print(f"  Trang {e['page']}: {e['error']}")

print("\n" + "=" * 80)
print("=== KẾT THÚC BÁO CÁO LỖI ===")
