Thông tin nhóm thực hiện
Dự án này là bài tập lớn cuối kỳ cho môn học: Kho dữ liệu và Khai phá dữ liệu.
| STT | Họ và tên | MSHV |
|---|---|---|
| 1 | Nguyễn Thị Phương | ................ |
| 2 | Nguyễn Hữu Huy | ................ |
| 3 | Phan Nguyễn Tấn Vũ | ................ |
| 4 | Nguyễn Tuấn Anh | ................ |
| 5 | Ma Văn Tú | ................ |
Xem chi tiết Yêu cầu Bài tập lớn
BÀI TẬP LỚN CUỐI KỲ – MÔN KHO DỮ LIỆU VÀ KHAI PHÁ DỮ LIỆU
I. Tổng quan yêu cầu
- Mỗi nhóm gồm 4–5 thành viên
- Tự chọn một đề tài liên quan đến xử lý Kho dữ liệu và Khai phá dữ liệu
- Nộp báo cáo viết, file mã nguồn, và trình bày báo cáo miệng (slide)
II. Các phần bắt buộc trong bài làm & Thang điểm đánh giá (Tổng 9.0đ)
- Lý do chọn đề tài & tổng quan (0.5đ): Trình bày rõ lý do, tính thực tiễn, công nghệ áp dụng.
- Chuẩn bị dữ liệu (1.0đ): Cách thu thập dữ liệu (crawl, API, sinh giả lập, mở...).
- Tiền xử lý & Thiết kế Data Warehouse (1.5đ): Làm sạch dữ liệu, xây dựng Star/Snowflake Schema, quy trình ETL.
- Khai phá dữ liệu (Data Mining) (1.5đ - 2.5đ): Phân loại, phân cụm, luật kết hợp. Huấn luyện mô hình, đánh giá.
- Trực quan hóa & kết quả (1.5đ - 2.5đ): Dashboard, biểu đồ thống kê, demo kết quả mô hình.
- Báo cáo, trình bày và teamwork (1.0đ): Báo cáo rõ ràng, slide đúng trọng tâm.
III. Điểm thưởng (Tối đa +1.0đ)
- Sáng tạo (+0.5đ): Tự nghiên cứu, áp dụng kiến thức nâng cao.
- Đóng gói thành sản phẩm demo (+0.5đ): Trình bày trực quan, thuyết phục.
Dự án ThayHuyOneChamp - Bài Báo Khoa Học
Dự án này sử dụng mô hình học máy (Machine Learning) kết hợp với kho dữ liệu (Data Warehouse) để phân tích và dự đoán nguy cơ mắc bệnh tim mạch. Điểm nhấn của dự án là việc áp dụng Explainable AI (SHAP) để giải thích rõ ràng các yếu tố tác động đến dự đoán rủi ro của từng cá nhân.
Kiến trúc thư mục
data/raw/: Chứa dữ liệu gốc (vd: file CSV từ Kaggle).data/processed/: Chứa dữ liệu sau khi làm sạch (ETL).src/etl/: Mã nguồn trích xuất, biến đổi và tải dữ liệu (ETL).src/dw/: Cấu hình Data Warehouse (SQLite/PostgreSQL) và các câu truy vấn.src/mining/: Mã nguồn tiền xử lý, huấn luyện mô hình học máy (XGBoost, Random Forest) và SHAP.src/visualization/: Ứng dụng Streamlit hiển thị Dashboard và công cụ dự đoán.docs/: Tài liệu báo cáo, bài báo chuẩn Scopus (Draft).
Cài đặt
- Cài đặt Python 3.9+
- Cài đặt các thư viện:
pip install -r requirements.txt
Xem mã nguồn tại: GitHub