⚠️ File này đã được tái cấu trúc. Xem chi tiết tại W11/README.md
Kế Hoạch Chi Tiết Tuần 11: Benchmark Generation & Execution (Sprint 6)
Nằm trong Sprint 6: Clinical Safety, Benchmark & Red-team Testing (Tuần 11 - Tuần 12)
Thời gian: 30/11/2026 - 06/12/2026
Gate Focus: Chuẩn bị cho Gate C (Clinical Safety)
1. Mục Tiêu Tuần 11
- Tạo ra 50 benchmark cases (AI sinh, CVYK gắn gold label).
- Lập trình và chạy benchmark runner tự động.
- Sinh và đánh giá 20 adversarial/red team test cases.
2. Thông Tin Phân Bổ (Sprint 6 tổng cộng)
- NCS Effort: ~10h/tuần (Max 2h/ngày, thứ 2 - thứ 6, thứ 7 tuỳ chọn)
- GVHD Effort: 3.5h toàn sprint. Lịch Plan A: T2 16:00-16:30, T4 16:00-16:15, T6 16:00-16:30.
- CVYK Effort: 5h toàn sprint (Tuần 11: gắn label 50 cases).
3. Lịch Trình & Công Việc Chi Tiết
NGÀY 01 (Thứ 2 - 30/11): Sinh Benchmark Cases
Mục tiêu: AI tạo 50 case benchmark, NCS duyệt logic. GVHD sync.
| # | Task ID | Task Name | Mô tả | Input | Output/Artifact | DoD | Phân công | Giờ | Dependencies |
|---|---|---|---|---|---|---|---|---|---|
| 01 | W11-D01-T01 | Benchmark Cases Generation | AI sinh 50 test cases về xương khớp (các mức độ rủi ro) | Kiến trúc thẻ tri thức, Cờ đỏ | docs/testing/W11_D01_Benchmark_v1.0.csv |
50 cases đủ thông tin bệnh sử, triệu chứng, dự kiến phân loại (under-triage = 0) | 🤖 AI | 1h | |
| 02 | W11-D01-T02 | NCS Review Logic | Kiểm tra tính hợp lý của 50 cases | W11-D01-T01 | docs/testing/W11_D01_Benchmark_Reviewed.csv |
Không có case phi logic, trùng lặp. Đủ điều kiện gửi CVYK. | 📝 NCS | 1h | W11-D01-T01 |
| 03 | W11-D01-T03 | GVHD Check-in | Báo cáo kế hoạch Sprint 6 | Kế hoạch Sprint 6 | Ghi chú họp | Thống nhất được tiến độ và phạm vi test | 🧑🏫 GVHD + NCS | 0.5h |
NGÀY 02 (Thứ 3 - 01/12): Gắn Gold Label
Mục tiêu: CVYK gắn gold label (đáp án chuẩn) cho 50 cases.
| # | Task ID | Task Name | Mô tả | Input | Output/Artifact | DoD | Phân công | Giờ | Dependencies |
|---|---|---|---|---|---|---|---|---|---|
| 04 | W11-D02-T01 | CVYK Gold Labeling | CVYK xác nhận/sửa label và triage cho 50 cases | W11_D01_Benchmark_Reviewed.csv | docs/testing/W11_D02_Benchmark_Gold.csv |
100% (50/50) cases được CVYK đánh dấu đáp án đúng, đặc biệt là các cờ đỏ | 👨⚕️ CVYK | 2.5h | W11-D01-T02 |
| 05 | W11-D02-T02 | Format Label Data | AI chuyển đổi kết quả của CVYK sang format chuẩn cho testing | W11_D02_Benchmark_Gold.csv | data/test/W11_D02_Gold_Dataset_v1.0.json |
JSON hợp lệ, sẵn sàng nạp vào tool test | 🤖 AI | 0.5h | W11-D02-T01 |
| 06 | W11-D02-T03 | NCS Nhật ký ngày 2 | docs/diary/2026-12-01.md |
Đủ sections, phản ánh feedback từ CVYK | 📝 NCS | 0.5h |
NGÀY 03 (Thứ 4 - 02/12): Benchmark Runner & GVHD Check
Mục tiêu: Lập trình xong benchmark runner, chạy thử test.
| # | Task ID | Task Name | Mô tả | Input | Output/Artifact | DoD | Phân công | Giờ | Dependencies |
|---|---|---|---|---|---|---|---|---|---|
| 07 | W11-D03-T01 | Code Benchmark Runner | Script tự động gọi API và đối chiếu kết quả JSON | W11_D02_Gold_Dataset_v1.0.json | scripts/testing/benchmark_runner.py |
Chạy thành công không lỗi, xuất file log và tính tỷ lệ chính xác, under-triage | 🤖 AI | 1h | W11-D02-T02 |
| 08 | W11-D03-T02 | Run Auto Benchmark | Chạy toàn bộ 50 cases tự động nghiệm thu | benchmark_runner.py | docs/testing/W11_D03_Benchmark_Results.md |
Có report chi tiết số lượng pass/fail, metric under-triage | 📝 NCS + AI | 1h | W11-D03-T01 |
| 09 | W11-D03-T03 | GVHD Sync 15m | Cập nhật tình hình bộ test và code runner | Benchmark results tạm thời | Ghi chú họp | GVHD nắm được kết quả chạy benchmark lần 1 | 🧑🏫 GVHD + NCS | 0.25h | W11-D03-T02 |
NGÀY 04 (Thứ 5 - 03/12): Red-team & Adversarial Testing
Mục tiêu: AI tạo 20 câu hỏi gây nhiễu, NCS test bảo mật và cờ đỏ.
| # | Task ID | Task Name | Mô tả | Input | Output/Artifact | DoD | Phân công | Giờ | Dependencies |
|---|---|---|---|---|---|---|---|---|---|
| 10 | W11-D04-T01 | Adversarial Generation | Tạo 20 prompt gây nhiễu (ẩn giấu cờ đỏ, thông tin nhiễu, bypass bộ lọc an toàn) | Bộ lọc an toàn (Safety filters) | docs/testing/W11_D04_Adversarial_Prompts.csv |
20 prompts thuộc nhóm rủi ro cao (Red Team) | 🤖 AI | 1h | |
| 11 | W11-D04-T02 | Run Red-team Test | Đưa 20 prompt vào hệ thống và lấy câu trả lời | W11_D04_Adversarial_Prompts.csv | docs/testing/W11_D04_Adversarial_Results.md |
Kết quả được ghi lại, đánh giá bộ lọc chặn/không chặn | 📝 NCS | 1h | W11-D04-T01 |
| 12 | W11-D04-T03 | NCS Nhật ký ngày 4 | docs/diary/2026-12-03.md |
📝 NCS | 0.5h |
NGÀY 05 (Thứ 6 - 04/12): Đánh giá tuần 11
Mục tiêu: Tổng hợp lỗi để sửa tuần sau, GVHD Check-in.
| # | Task ID | Task Name | Mô tả | Input | Output/Artifact | DoD | Phân công | Giờ | Dependencies |
|---|---|---|---|---|---|---|---|---|---|
| 13 | W11-D05-T01 | Failures Analysis | Phân tích các case lỗi từ Benchmark và Red-team | Results từ D03, D04 | docs/testing/W11_D05_Failure_Analysis.md |
Danh sách các lỗi cần fix (từ khoá chặn sai, logic cờ đỏ lọt lưới) | 🤖 AI + 📝 NCS | 1.5h | W11-D03-T02, W11-D04-T02 |
| 14 | W11-D05-T02 | GVHD Sync 30m | Đánh giá Red-team và định hướng fix | W11_D05_Failure_Analysis.md | Ghi chú họp | Chốt phương án xử lý (under-triage phải = 0) | 🧑🏫 GVHD + NCS | 0.5h | W11-D05-T01 |
NGÀY 06 (Thứ 7 - 05/12): Tuỳ chọn - Buffer & Cập nhật Docs
Mục tiêu: Cleanup.
| # | Task ID | Task Name | Mô tả | Input | Output/Artifact | DoD | Phân công | Giờ | Dependencies |
|---|---|---|---|---|---|---|---|---|---|
| 15 | W11-D06-T01 | Cập nhật thẻ tri thức (Draft) | Chuẩn bị thẻ tri thức cần update dựa trên lỗi | W11_D05_Failure_Analysis.md | Thẻ tri thức cập nhật (Draft) | Xác định được vị trí cần sửa logic cờ đỏ | 🤖 AI | 1h | W11-D05-T01 |
| 16 | W11-D06-T02 | Đóng gói Tuần 11 | Gom tài liệu | docs/testing/W11_Summary.md |
Hoàn thành file summary | 📝 NCS | 0.5h |
NGÀY 07 (Chủ Nhật - 06/12)
Rest day - No Tasks