# Báo cáo tổng hợp — Dọn dẹp Header/Footer Leaks Vi Diệu Pháp Giảng Giải

**Ngày tổng kết:** 2026-05-01 23:40 ICT  
**Phạm vi:** PDF 081 → 120 (40 trang, 8 batch files)  
**Quy trình:** `Xoa-Footer-Header-Leaks.md`

---

## Tổng số dòng đã xóa

| Batch file | Trang | Dòng đã xóa | Ghi chú |
|------------|:-----:|:-----------:|---------|
| vdp-081-085 | 081→085 | **0** | Sạch hoàn toàn |
| vdp-086-090 | 086→090 | **3** | Mixed Myanmar numerals (`၁၆ ၅`, `၁၆ ၆`, `၁၆ ၉`) |
| vdp-091-095 | 091→095 | **1** | Latin numeral `029` page number leak |
| vdp-096-100 | 096→100 | **6** | `ဝီထိပိုင်း` + OCR fragments |
| vdp-101-105 | 101→105 | **8** | `နိဿယနှင့်အဓိပ္ပါယ်` ×5, stacked headers, garbage |
| vdp-106-110 | 106→110 | **9** | Bold & plain headers, OCR variants (`ပီထိပိုင်း`, `ဗီထိပိုင်း`) |
| vdp-111-115 | 111→115 | **8** | `ဝီထိပိုင်း` ×3, `နိဿယနှင့်အဓိပ္ပါယ်` ×4, `ပီထိပိုင်း` ×1 |
| vdp-116-120 | 116→120 | **7** | Bold headers, OCR variant `8ထိပိုင်း`, `အမိပ္ပါယ်` |
| **Tổng cộng** | **40 trang** | **42 dòng** | |

---

## Các pattern phát hiện

### 1. Running header `ဝီထိပိုင်း` và biến thể OCR
- **Plain:** `ဝီထိပိုင်း` — xuất hiện nhiều nhất, ở hầu hết các trang 096→120
- **Bold:** `**ဝီထိပိုင်း**` — ở trang 109, 118
- **OCR variant ဝီ→ပီ:** `ပီထိပိုင်း` — trang 109, 111
- **OCR variant ဝီ→ဗီ:** `ဗီထိပိုင်း` — trang 110
- **OCR variant ဝီ→8:** `8ထိပိုင်း` — trang 120

### 2. Running header `နိဿယနှင့်အဓိပ္ပါယ်` và biến thể
- **Plain:** `နိဿယနှင့်အဓိပ္ပါယ်` — xuất hiện 101→120
- **Bold:** `**နိဿယနှင့်အဓိပ္ပါယ်**` — trang 110, 118
- **OCR variant ဓ→မ:** `နိဿယနှင့်အမိပ္ပါယ်` — trang 117

### 3. Mixed Myanmar numerals
- Pattern `^[၀-၉]+\s+[၀-၉]+$` (2 số Myanmar cách space) — 3 dòng ở 086-090
- Dạng số trang PDF: `၂ ၆` — 1 dòng ở 105

### 4. Latin numeral page numbers
- `029`, `100` — standalone, giữa marker Trang pdf và nội dung

### 5. Stacked headers (xếp chồng)
- Trang 105: `မဟန္တာရုံဝီ` + `နိဿယနှင့်အဓိပ္ပါယ်` (2 dòng liên tiếp)
- Trang 100: `ခဏ်း` + `ထိပိုင်း` (bị OCR vỡ từ `ဝီထိပိုင်း`)

### 6. OCR garbage artifacts (giữ lại làm manh mối)
- `jo`, `၅99`, `၁.၅ ၆` (vdp-081-085)
- `ολι` (Greek chars), `၂P` (vdp-091-095)
- `JOO`, `J0J`, `Jog`, `jog`, `Je`, `Joe`, `JJJ`, `JJP` (vdp-101-120)
- `CC`, `©`, `오`, diagram artifacts (vdp-106-110)

---

## Các dòng giữ lại sau kiểm tra (heading thật)

| Dòng | File | Lý do |
|------|------|-------|
| `စေတသိက်ပိုင်းလာ` | 081-085 | Trong câu, nghĩa "phương pháp tóm tắt trong Cetasika" |
| `နိဿယနှင့်အဓိပ္ပါယ်` | 096-100, 118 | Section heading thật, có nội dung theo sau |
| `ဝီထိဆက္က` | 096-100 | Section sub-heading, duy nhất |
| `သင်္ဂဟ` | 091-095, 116, 120 | Section heading thật |
| `ပကိဏ်းပိုင်း နိဿယနှင့်` + `အဓိပ္ပါယ် ပြီးပြီ။` | 091-095 | Section conclusion |
| `ဝီထိပိုင်းနိဿယ` | 091-095 | Section heading |
| `စဉ်းစား ဖွင့်ဆိုပိုင်း` | 111-115 | Fused header đầu section |

---

## Lưu ý đặc biệt

1. **Chuyển giao section (khoảng trang 085→095):**
   - Từ `စေတသိက်ပိုင်း` (Cetasika section) → `ဝီထိပိုင်း` (Vīthi section)
   - Running header thay đổi theo section: không còn `စေတသိက်ပိုင်း` từ 091 trở đi
   - Trang 091–095 có ít leak hơn (chỉ 1 dòng) — giai đoạn chuyển tiếp

2. **OCR degradation tăng dần:**
   - 081–090: Hầu như không có OCR variant
   - 096–100: Bắt đầu xuất hiện bold variant (`**ဝိထိပိုင်း**`)
   - 101–120: OCR variant đa dạng (`ပီ`, `ဗီ`, `8`, `မ`), garbage artifacts tăng

3. **Diagram blocks (106–110):**
   - File này có nhiều diagram với ký tự đặc biệt (`CC`, `©`, `000`)
   - Các artifact nằm trong diagram không phải header leak

4. **False positive prevention đã áp dụng:**
   - Luôn kiểm tra `grep` sau khi xóa
   - Các dòng keyword còn lại được xác minh là nội dung thật (trong câu, có cấu trúc logical)
   - OCR garbage được giữ làm manh mối hiệu đính

5. **Độ sạch tăng dần:**
   - Batch 081–085: 0 dòng (sạch tuyệt đối)
   - Các batch còn lại: 3–9 dòng/batch
   - Pattern chủ yếu: running header bị OCR chèn vào nội dung khi PDF có layout 2 cột

---

## Kết luận

✅ **Đã hoàn thành dọn dẹp 40 trang (081→120), xóa tổng cộng 42 dòng header/footer leak.**  
✅ 8/8 batch files đã được kiểm tra và xác nhận sạch.  
✅ Tất cả heading thật được giữ nguyên. OCR garbage được bảo tồn.  
✅ Không phát hiện Devanagari, Lao, Khmer, hay Vietnamese garbage trong toàn bộ dự án.

---

*Báo cáo được tạo tự động bởi cron job cleanup pipeline — 2026-05-01 23:40 ICT*
