Nhật Ký Nghiên Cứu — Ngày 2026-09-13
Nghiên cứu sinh: Võ Trần Gia Hiếu
Sprint: 0/8 (Pre-project) | Tuần: 0/21 (Chuẩn bị)
Chủ đề chính: Xử lý OCR giáo trình ĐHYHN
Effort NCS thực tế: [CHƯA CÓ DỮ LIỆU] / [CHƯA CÓ DỮ LIỆU]
1. Mục Tiêu Ngày
- Giai đoạn chuẩn bị (trước khi khởi tạo workspace CXK).
- Chạy OCR giáo trình y khoa cốt lõi để xây dựng thẻ tri thức.
2. Công Việc Đã Thực Hiện
| # | Task | Trạng thái | Kết quả | File tạo/sửa |
|---|---|---|---|---|
| 1 | Chạy OCR giáo trình ĐHYHN Tập 1 & Tập 2 | ✅ Xong | Scan PDF thành JSON page blocks | 1109 file .progress tạo ra ở ngoài workspace |
3. Dữ Liệu & Bằng Chứng Thu Thập
- 10 conversations CXK (12:08 → 23:12), bao gồm 1 conversation lớn 1.4MB.
- 1109 file OCR
.progressđược tạo ra: 498 pages Tập 1 + 611 pages Tập 2.
4. Quyết Định Chuyên Môn / Kỹ Thuật Đưa Ra
- [CHƯA CÓ DỮ LIỆU]
5. Khó Khăn / Thách Thức / Blocker
- [CHƯA CÓ DỮ LIỆU]
6. Bài Học / Insight
- [CHƯA CÓ DỮ LIỆU]
7. Gate / Milestone
- [Không áp dụng]
8. Kế Hoạch Cho Ngày Tiếp Theo
- [ ] Tiếp tục xử lý OCR sâu cho các tài liệu y khoa để cải thiện chất lượng.
Cross-reference
- Kế hoạch ngày: Không áp dụng (Giai đoạn tiền dự án)
- Task board tuần: Không áp dụng (Giai đoạn tiền dự án)
✍️ BẢN VIẾT TAY — Phụ lục 3
Hướng dẫn: NCS dùng phần dưới đây làm nháp rồi chép tay vào sổ nhật ký
giấy bằng bút bi mực xanh/đen. Không in ra dán. Không dùng bút chì.
Ngày 13/09/2026
Giai đoạn: Thu thập và xử lý dữ liệu (Tiền dự án)
1. MỤC TIÊU CỤ THỂ TRONG NGÀY:
- Chạy OCR số hóa giáo trình y khoa cốt lõi ĐHYHN (Tập 1 & Tập 2) để chuẩn bị xây dựng thẻ tri thức.
2. DỤNG CỤ, VẬT LIỆU VÀ THIẾT BỊ SỬ DỤNG:
- Máy tính cá nhân, Antigravity AI Agent.
- File PDF Giáo trình ĐHYHN Tập 1 & Tập 2, công cụ bóc tách và OCR PDF.
3. TIẾN TRÌNH THỰC HIỆN VÀ HIỆN TƯỢNG QUAN SÁT:
- Khởi chạy tiến trình bóc tách và OCR song song qua 10 phiên hội thoại.
- Thực hiện scan toàn bộ các trang PDF của hai tập giáo trình thành các khối JSON page blocks.
- Ghi nhận: Quá trình quét hoàn tất 1109 trang, sinh ra lượng lớn file tiến trình, cần kiểm tra chất lượng văn bản.
4. DỮ LIỆU THÔ VÀ KẾT QUẢ:
- 10 conversations CXK (bao gồm 1 conversation lớn 1.4MB).
- 1109 file OCR .progress (498 trang Tập 1 + 611 trang Tập 2).
5. PHÂN TÍCH LỖI SAI, RỦI RO VÀ BÀI HỌC:
- Không có lỗi đáng kể; dữ liệu thô sau OCR cơ bản còn chứa ký tự lỗi, cần xử lý OCR sâu để cải thiện độ chính xác.
6. KẾ HOẠCH HÀNH ĐỘNG TIẾP THEO:
- Tiếp tục xử lý OCR sâu cho các tài liệu y khoa để cải thiện chất lượng.
Chữ ký NCS: __ Chữ ký GVHD: __