Mã hoá kí tự – Unicode, ASCII và UTF-8
0
Chạy mô phỏng
Cần đăng nhập để mở; tài khoản miễn phí.
Luôn dùng bản mới nhất; khi bạn sửa lần đầu mới tạo bản riêng, bản gốc không đổi.

Mã hoá kí tự – Unicode, ASCII và UTF-8

Gõ một dòng chữ để thấy mỗi kí tự có một điểm mã Unicode và được UTF-8 ghi thành 1 đến 4 byte. Chạm vào một kí tự để xem các bit của điểm mã được chia vào từng byte, vì sao é, €, emoji cần 2, 3, 4 byte. Khung Giải mã đọc ngược một dãy byte hex hoặc nhị phân ra chữ và chỉ ra byte lỗi; khung Mojibake cho thấy chữ bị vỡ khi đọc byte UTF-8 bằng bảng mã cũ 1 byte.

Bài Một số kiểu dữ liệu và dữ liệu văn bản trong chủ đề Máy tính và xã hội tri thức của Tin học 10 giới thiệu bảng mã ASCII và Unicode, và cách máy tính lưu văn bản thành dãy byte. Mô phỏng tập trung vào UTF-8, bảng mã phổ biến nhất trên web. Ở khung Mã hoá, học sinh gõ chữ hoặc chọn văn bản mẫu; mỗi kí tự hiện điểm mã, mã ASCII 7 bit nếu có, các byte UTF-8 dạng hex và nhị phân. Chạm vào một kí tự để thấy các bit của điểm mã được chia vào 1, 2, 3 hay 4 byte theo mẫu 0xxxxxxx, 110xxxxx 10xxxxxx… và so sánh số kí tự với số byte. Khung Giải mã đọc ngược dãy byte ra chữ, đánh dấu byte lỗi; khung Mojibake cho thấy chữ vỡ thành kí tự lạ khi byte UTF-8 bị đọc bằng Latin-1 hoặc Windows-1252. Câu hỏi gợi ý: – Vì sao chữ é cần 2 byte còn chữ e chỉ cần 1 byte trong UTF-8? – Một dòng gồm 5 emoji chiếm bao nhiêu byte? – Vì sao chữ café hiện thành café trên một số trang web?

Tham số điều chỉnh được

  • Khung làm việc
  • Bảng mã đọc nhầm
  • Văn bản mẫu
  • Hiện dạng nhị phân của byte