Tuần: W14 | : S5
ID v5.0: 5.2
Phân loại: chính
Effort NCS: 2h | Effort : 0h | Effort AI: 0h

Mô tả

Tổng hợp toàn bộ 100 test cases sau khi đã có gold label từ CVYK. Chạy thử nghiệm và so sánh kết quả sinh ra của mô hình (Gemini) với gold label để ra báo cáo độ chính xác.

File Input

  • testing/benchmark/gold_labels/testset_v1.yaml
  • Script đánh giá

File Output

  • testing/results/benchmark_report.md

Definition of Done (DoD)

  • [ ] Chạy thành công toàn bộ 100 test cases
  • [ ] Có báo cáo % pass rate
  • [ ] Phân tích các lỗi sai phổ biến

Rủi ro & Xử lý

Rủi ro Xác suất Xử lý
Mô hình trả lời sai nhiều (>20%) Trung bình Kiểm tra lại Context Loader có nạp thiếu không

Mô tả chi tiết

Nhiệm vụ D92_T2_tong_hop_100_test_cases.md tập trung vào Sprint 5 (Safety Engine, 100 test cases, Backend , ). Áp dụng kiến trúc Context Loading (KHÔNG ), sau , và . Đảm bảo tuân thủ chặt chẽ an toàn y khoa, không chẩn đoán hay kê đơn thuốc.

Rubric 5 tiêu chí

  • Task Safety: Hệ thống phát hiện chuẩn xác, auto-append hoạt động 100%.
  • Task Test cases: Bộ 100 test cases đạt gold label quality, độ phủ (coverage) tốt trên các thẻ tri thức (knowledge card).
  • Backend Architecture: FastAPI vận hành ổn định qua IIS, Context Loading xử lý tốt dung lượng thẻ tri thức, kết nối MSSQL 2022 mượt mà.
  • : Citation engine hoạt động đúng, truy vết nguồn (provenance) minh bạch đến từng tài liệu gốc.
  • Task Gate B: Bản demo pass các kịch bản kiểm thử, có CVYK () sign-off.

Phân vai trò

  • Nghiên cứu sinh (NCS): Điều phối, review mã nguồn do AI tạo, chạy test, cập nhật tài liệu chuẩn kỹ thuật.
  • Cố vấn y khoa (CVYK): Duyệt cờ đỏ (red flag), đánh giá nội dung y khoa của test cases, sign-off chất lượng (Gate B).
  • AI Hỗ trợ: Sinh boilerplate code, tạo mock data cho test cases, tối ưu truy vấn cơ sở dữ liệu.

Đánh giá AI hỗ trợ

  • Hỗ trợ tốt trong việc sinh framework test và các module Python chuẩn PEP 8.
  • Tăng tốc 80% thời gian viết 100 test cases có nhãn y khoa (gold label quality).
  • Đôi khi cần NCS can thiệp để tinh chỉnh logic truy vết nguồn (provenance) do ranh giới chunking ảo trong context.

Sub-task AI + Prompt

Sub-task 1: AI code Safety Engine

Nhiệm vụ: Viết class Python 3.11+ (chuẩn PEP 8) cho (Safety Engine).
Bối cảnh: Hệ thống cần chặn các câu hỏi y khoa nguy hiểm, không chẩn đoán bệnh hay kê đơn thuốc.
Input: Câu hỏi của người dùng (text).
Output: Kết quả kiểm duyệt (Pass/Fail) và chuỗi lời khuyên an toàn (disclaimer auto-append).
Ràng buộc: Phải áp dụng 2 lớp: keyword matching (từ khóa cờ đỏ) và LLM recheck. Cấu trúc class rõ ràng.
Tiêu chí nghiệm thu: Class chạy không lỗi, log được lý do fail, 100% tự chèn disclaimer khi phát hiện cờ đỏ.

Sub-task 2: AI sinh 100 test cases

Nhiệm vụ: Sinh 100 test cases để kiểm thử bộ lọc an toàn.
Bối cảnh: Cần dữ liệu chuẩn (gold label) để CVYK đánh giá.
Input: và thẻ tri thức.
Output: Dữ liệu chuẩn định dạng JSON.
Ràng buộc: Phân loại rõ các category (cờ đỏ, thông tin chung, không liên quan).
Tiêu chí nghiệm thu: Đủ 100 cases, cấu trúc JSON hợp lệ, expected output rõ ràng cho từng trường hợp.

Sub-task 3: AI code Citation engine

Nhiệm vụ: Xây dựng Citation engine trích xuất và liên kết nguồn dữ liệu.
Bối cảnh: Sử dụng kiến trúc Context Loading (KHÔNG RAG), cần minh bạch nguồn gốc thông tin.
Input: Phản hồi từ LLM và metadata của thẻ tri thức.
Output: API response format chứa nội dung trả lời kèm truy vết nguồn (provenance).
Ràng buộc: Phải truy vết chính xác đến chapter (chương) và trang tài liệu gốc. Python 3.11+.
Tiêu chí nghiệm thu: Response đúng chuẩn, mapping nguồn chính xác.

Sub-task 4: AI code Backend FastAPI

Nhiệm vụ: Xây dựng backend API bằng FastAPI.
Bối cảnh: Triển khai sau IIS 10, kết nối với MSSQL 2022 để lưu trữ audit logging.
Input: Yêu cầu từ frontend/.
Output: JSON API responses an toàn và ổn định.
Ràng buộc: Endpoint design chuẩn REST, tích hợp sẵn MSSQL connection pool.
Tiêu chí nghiệm thu: API log đầy đủ audit, kết nối database thành công.

Sub-task 5: AI sinh Gate B prompt

Nhiệm vụ: Tạo Demo checklist và CVYK review protocol cho Gate B.
Bối cảnh: Chuẩn bị nghiệm thu Sprint 5.
Input: Mục tiêu Sprint 5, kết quả test 100 cases.
Output: Checklist đánh giá (markdown).
Ràng buộc: Bao quát Safety Engine, Citation, Backend.
Tiêu chí nghiệm thu: Checklist chi tiết, dễ dàng dùng cho CVYK sign-off.