Cây quyết định – phân loại bằng chuỗi câu hỏi có/không
0
Chạy mô phỏng
Cần đăng nhập để mở; tài khoản miễn phí.
Luôn dùng bản mới nhất; khi bạn sửa lần đầu mới tạo bản riêng, bản gốc không đổi.

Cây quyết định – phân loại bằng chuỗi câu hỏi có/không

Dữ liệu hai lớp trên mặt phẳng hai đặc trưng (thời tiết và việc đi chơi, táo hay chanh, kết quả bài kiểm tra). Máy dựng cây quyết định bằng cách chọn ở mỗi nút câu hỏi "đặc trưng ≤ ngưỡng?" làm giảm tạp chất Gini hoặc entropy nhiều nhất, hoặc học sinh tự bấm để cắt vùng và xem trước mức giảm tạp chất. Mặt phẳng được chia thành các hình chữ nhật, cây hiện bên dưới; đổi độ sâu tối đa để so độ chính xác trên dữ liệu huấn luyện và dữ liệu kiểm tra, thấy rõ hiện tượng quá khớp.

Cây quyết định là một mô hình học máy dễ hiểu trong chủ đề Giải quyết vấn đề với sự trợ giúp của máy tính: mô hình phân loại bằng một chuỗi câu hỏi có/không, mỗi câu so một đặc trưng với một ngưỡng. Mô phỏng dùng dữ liệu hai lớp sinh từ một quy luật ẩn có thêm nhiễu, 70% để huấn luyện và 30% để kiểm tra. Ở chế độ Máy tự dựng cây, thuật toán chọn ở mỗi nút câu hỏi làm giảm tạp chất (chỉ số Gini hoặc entropy) nhiều nhất; kéo thanh Độ sâu tối đa để thấy mặt phẳng bị chia thành nhiều hình chữ nhật nhỏ hơn, độ chính xác huấn luyện tăng dần còn độ chính xác kiểm tra có lúc giảm. Ở chế độ Tự đặt câu hỏi, học sinh chọn Cắt dọc hoặc Cắt ngang, di chuột để xem trước mức giảm tạp chất rồi bấm để chia vùng, so cây của mình với câu hỏi tốt nhất mà máy gợi ý. Biểu đồ độ chính xác theo độ sâu và cây vẽ bên dưới giúp giải thích mô hình. Câu hỏi gợi ý: – Vì sao độ chính xác trên dữ liệu huấn luyện luôn tăng khi cây sâu hơn, còn trên dữ liệu kiểm tra thì không? – Với dữ liệu "Đạt bài kiểm tra?" có ranh giới chéo, cây cần nhiều câu hỏi hơn vì sao? – Câu hỏi đầu tiên (ở gốc) mà máy chọn cho biết điều gì về dữ liệu?

Tham số điều chỉnh được

  • Số mẫu dữ liệu (40–200 mẫu)
  • Nhiễu (tỉ lệ nhãn bị đảo) (0–30 %)
  • Bộ dữ liệu
  • Độ sâu tối đa của cây (1–8)
  • Hiện dữ liệu kiểm tra
  • Tiêu chí chọn câu hỏi