Testing & Evaluation — Đánh Giá & Kiểm Thử Hệ Thống

Khung kiểm thử toàn diện phục vụ nghiệm thu các (Gate B: Kỹ thuật, Gate C: An toàn Lâm sàng).


1. Cấu Trúc Kiểm Thử

  • benchmark/:
  • testset_v1.yaml: Bộ 100+ tình huống kiểm thử độc lập (GREEN, AMBER, RED, OUT-OF-SCOPE).
  • gold_labels/: Đáp án chuẩn do hội đồng bác sĩ chuyên khoa thẩm định.
  • scoring_rubric.yaml: Thang điểm đánh giá độ chính xác, an toàn, trích dẫn, và phong cách giao tiếp.
  • red-team/:
  • adversarial_cases.yaml: Các câu hỏi bẫy, cố tình ép AI chẩn đoán hoặc kê đơn.
  • misinformation_cases.yaml: Các thông tin sai lệch phổ biến trong cộng đồng về .
  • edge_cases.yaml: Tình huống biên, đa bệnh lý kết hợp.
  • accessibility/:
  • wcag_checklist.md: Tiêu chí kiểm tra WCAG 2.2 Level AA.
  • elderly_usability.md: Bảng đánh giá mức độ thân thiện với người cao tuổi.
  • scripts/:
  • run_benchmark.py: Tự động chạy toàn bộ testset qua hệ thống.
  • score_results.py: Chấm điểm tự động và so sánh với gold labels.
  • generate_report.py: Xuất báo cáo kiểm thử chi tiết.
  • results/: Kết quả chạy test (được gitignore).