diff --git a/New Text Document.txt b/New Text Document.txt new file mode 100644 index 0000000..dc2aa34 --- /dev/null +++ b/New Text Document.txt @@ -0,0 +1,98 @@ +# Quy Trình Phân Tích Dữ Liệu Nghiên Cứu UGS & ESS + +## I. MỤC TIÊU CHUNG & CÂU HỎI NGHIÊN CỨU +* **Mục tiêu chung:** Đánh giá nhận thức của người dân về giá trị của các Không gian xanh đô thị (UGS) và các Dịch vụ/Phi dịch vụ hệ sinh thái (ESS/DES), qua đó xác định các yếu tố (nhân khẩu học, thói quen và nhận thức) tác động đến các quyết định tài chính của họ (sự sẵn sàng quyên góp bảo tồn công viên và quyết định mua bất động sản gần không gian xanh). +* **Các câu hỏi nghiên cứu (Research Questions):** + 1. Không gian xanh nào cung cấp dịch vụ/phi dịch vụ hệ sinh thái nào? + 2. Nhận thức của người dân về các ESS có tính hệ thống không? + 3. Có thể phân chia người dân thành các cụm nhận thức như thế nào? Sự khác biệt về nhận thức giữa các nhóm nhân khẩu học và thói quen ra sao? + 4. Những yếu tố nào tác động đến quyết định đóng góp tài chính (Donation) và quyết định mua bất động sản (Decision)? + +--- + +## II. THÔNG TIN QUAN TRỌNG VỀ DỮ LIỆU & CỠ MẪU +* **Tổng cỡ mẫu tối đa:** **307 quan sát (307 hàng)**. +* **Nguyên tắc xử lý biến Income:** Do biến `Income` (Thu nhập) bị khuyết thiếu nhiều trong khảo sát và chỉ có **200 quan sát (200 hàng)** có dữ liệu đầy đủ, nên: + * Bất kỳ bước phân tích nào sử dụng biến `Income` (như mô tả riêng về Thu nhập hoặc các mô hình Hồi quy kiểm soát Thu nhập) thì **cỡ mẫu bắt buộc phải rút gọn về N = 200**. + * Đối với các bước không liên quan đến biến `Income`, sử dụng toàn bộ dữ liệu sạch với cỡ mẫu **N = 307**. + +--- + +## III. QUY TRÌNH THỰC HIỆN CHI TIẾT CÁC BƯỚC + +### Bước 0: Thống kê mô tả (Descriptive Statistics) +* **Mục tiêu:** Phác họa bức tranh tổng thể về nhân khẩu học của mẫu khảo sát và thói quen tương tác với Không gian xanh đô thị (UGS). +* **Các biến sử dụng:** + * **Nhân khẩu học:** Giới tính (`Gender`), Thu nhập (`Income`), Học vấn (`Literacy`), Nghề nghiệp (`Career`). *(Lưu ý: Không đưa biến Tuổi - Age vào phân tích)*. + * **Thói quen tương tác:** Khoảng cách đến UGS (`Distance`), Tần suất đi (`Frequency`), Thời gian lưu lại (`Time`), Phương tiện di chuyển (`Transportation`). + * **Hoạt động thường làm:** `Jogging`, `Workout`, `Petwalking`, `Sightseeing`, `Talking`, `Photography`. +* **Thuật toán / Phép thử:** Frequencies (Tần số, Tỷ lệ phần trăm) và Descriptives (Mean, Standard Deviation cho các thang đo Likert). +* **Cỡ mẫu áp dụng:** **N = 307** (Riêng đối với các mô tả liên quan trực tiếp đến biến `Income`, cỡ mẫu sử dụng là **N = 200**). +* **Kết quả mong muốn:** + * Biểu đồ tròn/cột mô tả cơ cấu nhân khẩu học. + * Bảng tóm tắt thói quen tương tác của người dân (tần suất, khoảng cách, phương tiện, hoạt động phổ biến). + +--- + +### Bước 1: Liên kết loại hình và dịch vụ (CA - Correspondence Analysis) +*(Lưu ý: Bước CA được đẩy lên chạy TRƯỚC bước PCA)* +* **Câu hỏi nghiên cứu:** Không gian xanh nào cung cấp dịch vụ hệ sinh thái nào? +* **Thuật toán:** Phân tích tương ứng (Correspondence Analysis - CA). Tuyệt đối **KHÔNG** sử dụng Phân tích tương quan chính tắc (CCA). +* **Các biến đưa vào mô hình:** + * **Tập X (UGS):** 7 loại hình không gian xanh gồm `Park`, `Residential`, `Garden`, `Rooftop`, `Recreation`, `Agriculture`, `Nature`. + * **Tập Y (ESS/DES):** Các nhóm dịch vụ/phi dịch vụ hệ sinh thái trung bình gồm `MEAN RES`, `MEAN CES`, `MEAN DES`. *(Lưu ý: Không đưa các biến Herb và Biodiversity vào phân tích)*. +* **Cỡ mẫu áp dụng:** **N = 307**. +* **Kết quả mong muốn:** + * Biểu đồ **Biplot 2D** biểu diễn mối quan hệ không gian giữa UGS (tập X) và dịch vụ (tập Y). + * **Chỉ số tương quan rho ($\rho$):** Trích xuất chỉ số để đánh giá chính xác mức độ liên kết, xác định loại hình UGS nào cung cấp dịch vụ gì. + +--- + +### Bước 2: Kiểm tra cấu trúc nhận thức (PCA) +* **Câu hỏi nghiên cứu:** Nhận thức về các ESS có tính hệ thống không? +* **Thuật toán:** Phân tích thành phần chính (Principal Component Analysis - PCA) kết hợp phép xoay Varimax để kiểm tra mức độ kết tụ của các biến. +* **Các biến đưa vào mô hình:** + * **RES (Dịch vụ điều hòa):** `Temperature`, `Noise`, `Stormwind`, `Respiratory`. + * **CES (Dịch vụ văn hóa):** `Exercises`, `Culture`, `Beauty`, `Education`, `Society`, `Spirit`. + * **DES (Phi dịch vụ):** `Dirty`, `Unsafe`, `Danger`. + * *(Lưu ý: Không đưa các biến thuộc nhóm PES/SES vào phân tích)*. +* **Cỡ mẫu áp dụng:** **N = 307**. +* **Kết quả mong muốn:** + * Hệ số **KMO & Bartlett's Test** đạt chuẩn (KMO > 0.6, p < 0.05). + * Ma trận xoay nhân tố (**Rotated Component Matrix**) để xem các biến nhận thức có nhóm lại một cách có hệ thống theo các nhân tố lớn hay không. + +--- + +### Bước 3: Phân khúc nhận thức theo đặc điểm cư dân (HCA & ANOVA) +* **Câu hỏi nghiên cứu:** Các nhóm cư dân với đặc điểm nhân khẩu học và thói quen khác nhau có nhận thức về UGS & ESS khác nhau thế nào? +* **Thuật toán:** Phân tích cụm phân cấp (Hierarchical Cluster Analysis - HCA) dựa trên Factor Scores rút ra từ bước PCA. Sau đó dùng kiểm định ANOVA để đánh giá sự khác biệt. +* **Quy trình thực hiện:** + * **Giai đoạn 3.1 - Gom cụm (HCA):** Dùng phương pháp Ward và khoảng cách Squared Euclidean trên các biến nhận thức trung bình (`MEAN RES`, `MEAN CES`, `MEAN DES`) để chia tập mẫu thành **3 cụm (clusters)** cư dân có đặc điểm nhận thức đồng nhất. + * **Giai đoạn 3.2 - Dựng chân dung cụm (Profiling):** Thực hiện so sánh chéo bằng ANOVA hoặc Chi-square: + * **Lần so sánh 1 (với Nhân khẩu học):** So sánh 3 cụm nhận thức với các đặc điểm Giới tính (`Gender`), Nghề nghiệp (`Career`), Trình độ học vấn (`Literacy`). *(Lưu ý: Không dùng biến Tuổi - Age)*. + * **Lần so sánh 2 (với Thói quen tương tác):** So sánh 3 cụm nhận thức với Khoảng cách (`Distance`), Tần suất đi (`Frequency`), Thời gian lưu lại (`Time`), Phương tiện di chuyển (`Transportation`). +* **Cỡ mẫu áp dụng:** **N = 307**. +* **Kết quả mong muốn:** Xác định đặc điểm nổi bật của từng cụm nhận thức (Ví dụ: Cụm nhận thức cao chủ yếu có thói quen đi bộ, trình độ học vấn cao...). + +--- + +### Bước 4: Hồi quy dự báo hành vi kinh tế (Regression) +*Đây là bước phân tích mô hình tác động để dự báo hai quyết định tài chính quan trọng của người dân.* + +#### 4.1. Mô hình quyết định quyên góp (Donation) +* **Thuật toán:** Hồi quy Logistic (Binary Logistic Regression) do biến phụ thuộc `Donation` là biến nhị phân (Có/Không). +* **Biến phụ thuộc (Y):** `Donation`. +* **Biến độc lập (X / Factors):** + * **Nhóm nhân khẩu học:** Giới tính (`Gender`), Nghề nghiệp (`Career`), Trình độ học vấn (`Literacy`). + * **Nhóm thói quen:** Tần suất (`Frequency`), Khoảng cách (`Distance`), Thời gian (`Time`), Phương tiện di chuyển (`Transportation`). + * **8 biến loại hình UGS.** + * *(Lưu ý: Không đưa biến Nhận thức về biến đổi khí hậu - 03.Climatechange vào mô hình)*. +* **Cỡ mẫu áp dụng:** **N = 200** (Do mô hình có kiểm soát thêm biến Thu nhập - `Income`). +* **Kết quả mong muốn:** Hệ số hồi quy Beta, Odds Ratio (EXP(B)) và trị số P-value để xác định nhân tố nào thực sự thúc đẩy/cản trở ý định đóng góp tiền cho công viên của cư dân. + +#### 4.2. Mô hình quyết định mua nhà (Decision) +* **Thuật toán:** Hồi quy Logistic nhị phân (Binary Logistic Regression) do biến phụ thuộc `Decision` là biến nhị phân. +* **Biến phụ thuộc (Y):** `Decision`. +* **Biến độc lập (X / Factors):** Sử dụng **y chang** tập biến độc lập và các nhóm nhân khẩu học, thói quen, UGS của mô hình Donation ở Bước 4.1. +* **Cỡ mẫu áp dụng:** **N = 200** (Do mô hình có kiểm soát thêm biến Thu nhập - `Income`). +* **Kết quả mong muốn:** Xác định những yếu tố về loại hình không gian xanh, đặc tính nhân khẩu và thói quen di chuyển nào tác động mạnh mẽ nhất đến quyết định chi trả cao hơn để mua bất động sản gần UGS.