Nguồn và giấy phép. Đây là bản dịch tiếng Việt của tụi mình cho “4 Classification”, do đội ngũ khóa học MIT 6.390 (trước đây là 6.036) biên soạn; nguồn được truy cập ngày 12/08/2026 và phát hành theo giấy phép CC BY-NC-SA 4.0. Tụi mình diễn đạt lại câu văn bằng tiếng Việt, chuyển thuật toán, ví dụ và câu hỏi sang các khối trình bày phù hợp với trang, đồng thời ghi rõ những chỗ chuẩn hóa ký hiệu. Các hình tương tác của bami-hub được dựng độc lập từ phương trình và tham số của bài học, không sao chép tài sản hình ảnh của nguồn; liên kết đến bản demo gốc vẫn được giữ lại. Bản dịch và phần đóng góp của bami-hub cũng được phát hành theo CC BY-NC-SA 4.0. MIT và đội ngũ khóa học không bảo trợ hay chứng thực bami-hub.
4.1. Phát biểu bài toán
Phân loại (classification) là bài toán học máy tìm một ánh xạ từ đầu vào thuộc đến đầu ra thuộc một tập hợp không có thứ tựĐiều này khác với đầu ra là một số thực liên tục như trong hồi quy tuyến tính..
Chẳng hạn, tập đầu ra có thể là khi ta cần nhận biết loại trái cây, hoặc khi nhân viên phòng cấp cứu cần hỗ trợ chăm sóc một bệnh nhân mới. Trước hết, chúng ta tập trung vào trường hợp đơn giản nhưng thiết yếu: phân loại nhị phân (binary classification), trong đó mục tiêu là tìm một ánh xạ từ đến hai đầu ra.
Hai đầu ra này không mang thứ tự, nhưng thường được mã hóa thuận tiện thành . Như trước, dùng — viết tắt cho giả thuyết (hypothesis) — để biểu diễn một bộ phân loại (classifier), ta có quy trình:
Giống hồi quy, phân loại là một bài toán học có giám sát (supervised learning). Ta được cung cấp tập dữ liệu huấn luyện
Ta giả sử mỗi là một vector cột kích thước . Mục đích của dữ liệu này là giúp giả thuyết đã học sinh ra đầu ra khi nhận đầu vào .
Điều gì làm nên một bộ phân loại hữu ích? Cũng như với hồi quy, ta muốn nó dự đoán tốt những mẫu mới chưa từng thấy. Tuy nhiên, khi triển khai trong thực tế, ta không biết chính xác bộ phân loại sẽ gặp dữ liệu kiểm tra nào. Vì vậy, ta phải giả định có mối liên hệ giữa dữ liệu huấn luyện và dữ liệu kiểm tra; thông thường, hai tập được lấy độc lập từ cùng một phân phối xác suất.
Trong bài toán phân loại, ta thường dùng mất mát 0–1 (0-1 loss) để đánh giá, như đã giới thiệu ở Mục 1.3: dự đoán đúng chịu mất mát 0, còn dự đoán sai chịu mất mát 1. Với lựa chọn đó, ta có thể viết lỗi huấn luyện và lỗi kiểm thử. Cụ thể, cho tập huấn luyện và bộ phân loại , lỗi huấn luyện (training error) của được định nghĩa là
Trong công thức, otherwise nghĩa là trường hợp còn lại, tức dự đoán đúng.
Trước mắt, ta sẽ tìm một bộ phân loại có lỗi huấn luyện nhỏ — sau này sẽ bổ sung thêm tiêu chí — rồi hy vọng nó tổng quát hóa tốt sang dữ liệu mới và đạt lỗi kiểm thử (test error) nhỏ:
Đại lượng này được tính trên mẫu mới không tham gia quá trình tìm bộ phân loại.
Trước tiên, ta giới thiệu lớp giả thuyết gồm các bộ phân loại tuyến tính ở Mục 4.2. Sau đó, Mục 4.3 sẽ xây dựng một khuôn khổ tối ưu để học các bộ phân loại logistic tuyến tính.
4.2. Bộ phân loại tuyến tính
Ta bắt đầu với lớp giả thuyết gồm các bộ phân loại tuyến tính (linear classifier). Chúng tương đối dễ hiểu, đơn giản về mặt toán học, tự thân đã mạnh và còn là nền tảng của nhiều phương pháp tinh vi hơn. Sau khi định nghĩa lớp giả thuyết này, ta sẽ trình bày một thuật toán học bộ phân loại.
4.2.1. Định nghĩa
Một bộ phân loại tuyến tính trong không gian chiều được xác định bởi vector tham số và vô hướng . Vì vậy, lớp giả thuyết của các bộ phân loại tuyến tính chiều được tham số hóa bởi tập hợp mọi vector trong . Ta giả sử là vector cột kích thước .
Với các giá trị cụ thể của và , bộ phân loại được định nghĩa bằng hàm bước (step function):
Nói cách khác, hàm bước trả về nhãn khi biểu thức dương và trả về nhãn trong mọi trường hợp còn lại.
Ghi chú (Ghi chú của biên tập viên về nhãn)
Mục 4.1 minh họa cách mã hóa hai lớp bằng , còn bộ phân loại tuyến tính ở Mục 4.2 dùng . Vì vậy, số ở đây là nhãn âm theo quy ước của nguồn, không phải . Tụi mình giữ nguyên cả hai quy ước để phản ánh chính xác cách trình bày của nguồn; khi triển khai một mô hình, cần chọn và dùng nhất quán một quy ước nhãn.
Nhắc lại rằng và xác định một siêu phẳng affine chiều — chính là đồ thị của trong không gian có thêm một chiều đầu ra, tương tự giả thuyết hồi quy tuyến tính ở Chương 2. Lần này, ta không quan tâm đến giá trị của đồ thị tại từng mà tập trung vào siêu phẳng phân cách (separator) do nó tạo ra trong không gian đầu vào:
Siêu phẳng phân cách này có chiều. Vector vuông góc với nó, nên được gọi là vector pháp tuyến (normal vector) của siêu phẳng phân cách.
Ghi chú (Hai siêu phẳng, hai không gian)
Trong phép so sánh với hồi quy, đồ thị của có chiều và nằm trong không gian . Còn tập là siêu phẳng phân cách có chiều trong không gian đầu vào . Tụi mình nêu rõ hai đối tượng này để tránh nhập nhằng từ cách diễn đạt rút gọn của nguồn.
Nguồn có một bản demo tương tác về siêu phẳng phân cách và vector pháp tuyến. Trong hai chiều (), siêu phẳng phân cách có một chiều nên trở thành một đường thẳng; hai thành phần của quyết định hướng của đường này.
4.2.2. Ví dụ
Ví dụ (Đường phân cách và vector pháp tuyến)
Cho là bộ phân loại tuyến tính có
Đường phân cách thỏa
hay . Trong hình của nguồn, vector được vẽ từ điểm trên đường phân cách đến điểm và vuông góc với đường này.
bằng bao nhiêu? Ta có thể tìm tham số này bằng cách thế một điểm trên đường thẳng vào phương trình. Chọn điểm nằm trên một trục thường giúp phép tính gọn hơn. Với ,
nên .
Trong ví dụ này, đường phân cách chia — không gian chứa các điểm — thành hai nửa không gian (half-space). Nửa không gian dương gồm các điểm thỏa và nằm về phía được hướng của vector pháp tuyến quy định; mọi điểm ở đó được phân loại là dương. Nửa không gian còn lại gồm các điểm thỏa và được phân loại là âm.
Ta gọi một siêu phẳng là siêu phẳng phân cách tuyến tính (linear separator) của một tập dữ liệu nếu mọi điểm mang một nhãn nằm ở một phía và mọi điểm mang nhãn còn lại nằm ở phía kia. Nếu tồn tại một siêu phẳng như vậy, tập dữ liệu được gọi là phân tách tuyến tính được (linearly separable).
Ví dụ (Phân loại hai điểm)
Cho là bộ phân loại tuyến tính có
Xét hai điểm
Khi đó,
Vì vậy, được phân loại là dương, với nhãn , còn được phân loại là âm, với nhãn .
Hãy kéo từng thành phần của và trong hình dưới đây. Quan sát đồng thời hướng của đường phân cách, phía mà vector pháp tuyến chỉ tới, và điểm số của hai mẫu. Nút “Ví dụ đường thẳng” chuyển sang bộ tham số của ví dụ đầu tiên; “Đặt lại” trở về ví dụ hai điểm.
Bộ phân loại tuyến tính trong hai chiều
Đường phân cách: −x₁ + 1.5x₂ + 3 = 0
Bài tập
Trong hình minh họa của nguồn, vector màu xanh nào là pháp tuyến của đường phân cách? Hãy viết nó dưới dạng vector cột.
Bài tập
Phải thay đổi và như thế nào để giữ nguyên vị trí của siêu phẳng phân cách nhưng đổi mọi điểm mang dấu “+” trong hình nguồn thành lớp âm và mọi điểm mang dấu “−” thành lớp dương?
4.3. Bộ phân loại logistic tuyến tính
Cho một tập dữ liệu và lớp giả thuyết gồm các bộ phân loại tuyến tính, mục tiêu của ta là tìm bộ phân loại tối ưu một hàm mục tiêu liên hệ các dự đoán với dữ liệu huấn luyện. Để bài toán có thể giải được với chi phí tính toán hợp lý, ta phải cẩn thận khi phát biểu bài toán tối ưu.
Trong phân loại, dự đoán thuộc và hàm mất mát 0–1 là một lựa chọn tự nhiên, như đã giới thiệu ở Mục 1.3:
Tuy nhiên, ngay cả với bộ phân loại tuyến tính đơn giản, việc tìm làm cực tiểu lỗi huấn luyện 0–1
là một bài toán rất khó. Bài toán này NP-khó (NP-hard), nên có lẽ việc giải những trường hợp khó nhất sẽ cần thời gian tính toán tăng theo hàm mũ của số mẫu huấn luyện Từ “có lẽ” không xuất phát từ việc nguồn ngại tra cứu. Nó liên quan đến bài toán nền tảng chưa có lời giải trong lý thuyết khoa học máy tính: P so với NP (P vs. NP)..
Điểm khiến bài toán tối ưu này khó là hàm mục tiêu không “trơn”:
- Hai giả thuyết và có thể cách nghiệm tối ưu những khoảng khác nhau trong không gian tham số nhưng phân loại sai cùng số mẫu, nên có cùng giá trị .
- Mọi dự đoán đều mang tính phân loại: bộ phân loại không thể biểu đạt mức độ chắc chắn rằng đầu vào nên nhận nhãn nào.
Vì vậy, nếu một giả thuyết đang dự đoán sai năm mẫu, ta khó biết cần thay đổi các tham số theo hướng nào để cải thiện kết quả. Điều đó cũng khiến việc thiết kế một thuật toán tìm kiếm có định hướng trong không gian giả thuyết trở nên khó khăn. Ta sẽ xét một lớp giả thuyết khác — bộ phân loại logistic tuyến tính — rồi xây dựng cách học lớp này bằng tối ưu hóa.
4.3.1. Định nghĩa
Các giả thuyết trong một bộ phân loại logistic tuyến tính (linear logistic classifier, LLC) được tham số hóa bởi vector chiều và vô hướng , giống bộ phân loại tuyến tính. Tuy nhiên, thay vì dự đoán trong , giả thuyết LLC sinh đầu ra thực thuộc khoảng :
Hình thức này trông quen thuộc. Thành phần mới là gì?
Hàm logistic (logistic function), còn gọi là hàm sigmoid (sigmoid function), được định nghĩa bởi
Đầu ra của hàm có thể được diễn giải như một xác suất vì với mọi .
Bài tập
Hãy kiểm tra rằng đầu ra của luôn thuộc khoảng . Vì sao nó không thể bằng 0 hoặc 1? Với giá trị nào thì ?
4.3.2. Ví dụ
Một LLC có hình dạng như thế nào? Trước hết, xét trường hợp đơn giản , nên các đầu vào nằm trên trục . Bộ phân cách khi đó có chiều 0, tức là một điểm. Hình trong nguồn biểu diễn ba LLC với các bộ tham số khác nhau:
Chọn lần lượt ba công thức rồi thay đổi và . Hình cho thấy điều khiển chiều và độ dốc của chuyển tiếp, còn dịch điểm cắt; cùng một điểm số affine cũng tạo đường phân cách trong hai chiều.
Khám phá sigmoid và LLC
Ngưỡng τ = 0,5 biến xác suất thành miền dự đoán; cùng phương trình đó tạo đường phân cách 2D.
Bài tập
Đường cong nào trong hình của nguồn ứng với từng biểu thức? Đại lượng nào quyết định độ dốc của đường cong? Đại lượng nào quyết định giá trị tại đó đầu ra bằng ?
Nhưng hãy khoan: theo định nghĩa, một bộ phân loại là ánh xạ từ đến hoặc một tập rời rạc khác. Như vậy, LLC với đầu ra thuộc dường như không thực sự là một bộ phân loại.
Nếu buộc phải biến đầu ra của LLC thành dự đoán trong , lựa chọn mặc định là dự đoán khi và dự đoán trong trường hợp còn lại. Giá trị đôi khi được gọi là ngưỡng dự đoán (prediction threshold).
Trong những bối cảnh khác nhau, ta có thể muốn chọn một ngưỡng khác. Lý thuyết quyết định (decision theory) nghiên cứu cách đưa ra lựa chọn này. Chẳng hạn, nếu hậu quả của việc dự đoán khi nhãn đúng là nghiêm trọng hơn nhiều so với việc dự đoán khi nhãn đúng là , ta có thể đặt ngưỡng dự đoán lớn hơn .
Bài tập
Với ngưỡng dự đoán , mỗi LLC trong hình một chiều của nguồn dự đoán cho những giá trị nào?
Khi , đầu vào nằm trong không gian hai chiều có các trục , còn đầu ra của LLC tạo thành một mặt. Nguồn minh họa trường hợp và .
Bài tập
Hãy kiểm tra rằng tập điểm thỏa — tức “biên” giữa dự đoán dương và âm khi ngưỡng bằng — là một đường thẳng trong không gian . Với tham số trong hình nguồn, đó là đường nào? Hình sẽ thay đổi thế nào nếu ? Nếu thì sao?
4.3.3. Học bộ phân loại logistic tuyến tính
Tối ưu hóa là một cách tiếp cận chủ chốt để giải bài toán học máy. Ta cũng có thể học LLC bằng cách định nghĩa một hàm mất mát thích hợp rồi tối ưu nó. Thử nghiệm đầu tiên có thể là mất mát 0–1 , bằng 0 cho dự đoán đúng và 1 cho dự đoán sai. Tuy nhiên, như vừa thấy, hàm mục tiêu sinh ra từ lựa chọn này rất khó tối ưu, nên ta cần một chiến lược khác.
Lớp giả thuyết LLC cho đầu ra trong , còn dữ liệu huấn luyện có nhãn . Ta sẽ thay đổi cách diễn giải đầu ra: xem nó là xác suất đầu vào được ánh xạ đến nhãn 1 — cũng có thể nói là xác suất đầu vào thuộc lớp 1 hoặc lớp dương.
Bài tập
Nếu là xác suất thuộc lớp , thì xác suất thuộc lớp là bao nhiêu, giả sử chỉ có hai lớp?
Ghi chú (Ghi chú của biên tập viên về nhãn âm)
Câu hỏi của nguồn viết lớp âm là , dù bộ phân loại trong Mục 4.2 dùng nhãn . Với cách mã hóa nhị phân đang dùng cho NLL, lớp dương được biểu diễn bằng và lớp âm bằng ; xác suất lớp âm là . Tụi mình giữ ký hiệu trong câu hỏi và nêu rõ phép ánh xạ để không che đi sự thiếu nhất quán của nguồn.
Về trực giác, mất mát nên nhỏ khi mô hình gán xác suất cao cho lớp đúng. Ta sẽ định nghĩa mất mát log-likelihood âm (negative log-likelihood loss, NLL) có tính chất đó. Hàm này còn mở rộng thuận tiện sang bài toán có nhiều hơn hai lớp.
Để đơn giản hóa cách trình bày, từ đây ta giả sử nhãn huấn luyện đã có — hoặc đã được chuyển về — dạng Khi học LLC bằng NLL, cần kiểm tra chắc chắn rằng các giá trị có đúng dạng này..
Ta muốn chọn tham số sao cho LLC gán xác suất lớn nhất cho các nhãn đúng trong tập huấn luyện. Đặt
Dưới giả định các dự đoán độc lập, xác suất ấy là
Ký hiệu biểu thị phép nhân nhiều thừa số, tương tự như biểu thị phép cộng nhiều số hạng. Khi , biểu thức trên có thể viết gọn thành
Ghi chú (Ghi chú của biên tập viên về tính độc lập)
Nguồn viết rút gọn là “các dự đoán độc lập.” Cách hiểu xác suất chính xác hơn là các nhãn quan sát độc lập có điều kiện khi đã biết các đầu vào và tham số mô hình, phù hợp với giả định lấy mẫu độc lập của tập dữ liệu.
Bài tập
Hãy giải thích vì sao hai biểu thức tích trên tương đương.
Tích lớn này khó xử lý trực tiếp. Vì hàm log đồng biến, bộ tham số làm cực đại tích cũng làm cực đại log của nó:
Cuối cùng, lấy đối của biểu thức biến bài toán cực đại thành bài toán cực tiểu
trong đó
Hàm này còn được gọi là mất mát log (log loss) hoặc entropy chéo (cross-entropy)Theo nguồn, lựa chọn cơ số log không tạo khác biệt thực chất ở đây. Khi nguồn yêu cầu tính số, hãy dùng cơ số , tức ..
Ghi chú (Ghi chú của biên tập viên về cơ số log)
Với riêng NLL, đổi cơ số chỉ nhân toàn bộ mất mát với một hằng số dương nên không đổi nghiệm cực tiểu. Khi có số hạng chính quy hóa và giữ nguyên , phép đổi này làm thay đổi tỷ lệ tương đối giữa hai số hạng; khi đó cần điều chỉnh tương ứng.
Hàm mục tiêu cho phân loại logistic tuyến tính là gì? Ta có thể ghép các thành phần để xây dựng hàm mục tiêu NLL có chính quy hóa cho LLC. Quá trình này thường được gọi là hồi quy logistic (logistic regression), nên ký hiệu hàm mục tiêu là
Ghi chú (Ghi chú của biên tập viên về λ)
Nguồn không nhắc lại miền của tại đây. Theo quy ước chính quy hóa đã đặt ở Chương 2, ; điều kiện này cũng cần thiết khi dùng tính lồi của số hạng trong toàn bộ hàm mục tiêu.
Bài tập
Xét dữ liệu phân tách tuyến tính được. Các giá trị tối ưu hàm mục tiêu sẽ có đặc điểm gì khi ? Khi rất lớn thì sao? Hãy thử xây dựng một ví dụ một chiều có hai điểm dữ liệu.
Chính quy hóa đóng vai trò gì đối với bộ phân loại? Hàm mục tiêu trên có cùng cấu trúc với hàm mục tiêu hồi quy ở (2.2): số hạng trong ngoặc là mất mát trung bình, còn số hạng thứ hai là chính quy hóa. Cũng như trong hồi quy, chính quy hóa cần thiết để xây dựng bộ phân loại có khả năng tổng quát hóa tốt; điều khiển sự đánh đổi giữa hai số hạng.
Nguồn minh họa một tập dữ liệu một chiều có thể được khớp rất sát bởi . Nhưng giá trị nào là tốt nhất? Khi không chính quy hóa, tức , tiến về 0 khi tăng lớn. Nhưng một vô hạn hoặc rất lớn có thực sự là giả thuyết tốt nhất không? Nó biểu thị mức độ chắc chắn rất cao rằng chuyển tiếp đột ngột giữa và xảy ra đúng tại , dù dữ liệu thực tế có một khoảng trống rộng quanh điểm đó.
Khi không có niềm tin bổ sung về nghiệm, ta có thể muốn LLC không quá tự tin và do đó ưu tiên nhỏ hơn. Một giả thuyết bớt tự tin có thể hoạt động tốt hơn trên các mẫu tương lai lấy từ cùng phân phối. Có thể thể hiện ưu tiên này bằng ; hình bên phải của nguồn dùng . Một cách nhìn khác là chính quy hóa giúp giả thuyết bớt phụ thuộc vào đúng tập huấn luyện đã quan sát: nếu dữ liệu huấn luyện thay đổi nhẹ, giả thuyết cũng không nên thay đổi quá nhiều.
Hãy thay đổi trong hình dưới đây và so sánh hai hàm mục tiêu. Với , NLL tiếp tục giảm khi mô hình ngày càng chắc chắn; số hạng tạo một cực tiểu hữu hạn và làm rõ vai trò của chính quy hóa.
Chính quy hóa giữ độ chắc chắn hữu hạn
Tập dữ liệu đối xứng có khoảng trống quanh x = 0; λ = 0 và λ = 0,2 dùng cùng một NLL.
4.4. Giảm dần theo gradient cho hồi quy logistic
Ta đã có lớp giả thuyết LLC và hàm mất mát NLL; bước tiếp theo là tìm tham số từ dữ liệu. Không có nghiệm giải tích thuận tiện như nghiệm hồi quy ở Mục 2.7.2. May thay, ta có thể áp dụng phương pháp giảm dần theo gradient cho , hoặc dùng SGD.
có những tính chất đủ thuận lợi để GD và SGD nhìn chung hoạt động tốt. Ở Mục 6.7 của nguồn, ta sẽ gặp các bài toán tối ưu khó hơn trong bối cảnh mạng neural.
Trước hết, cần đạo hàm theo cả thành phần vô hướng và thành phần vector của . Đặt , ta có
có kích thước , còn là một vô hướng vì ta đã tách khỏi .
Bài tập
Hãy kiểm tra kích thước của mọi đại lượng trên với giả định có kích thước .
Bài tập
Hãy tính bằng vector các đạo hàm riêng
có kích thước gì?
Bài tập
Hãy tính bằng cách tìm vector đạo hàm riêng theo .
Bài tập
Dùng hai kết quả vừa tìm để kiểm chứng phép suy diễn gradient ở trên.
Kết hợp các thành phần, ta thu được thuật toán GD cho hồi quy logistic của nguồn:
Thuật toán 4.1 LR-Gradient-Descent()
1:
2:
3:
4:repeat
5:
6:
7:
8:until
9:return
Hồi quy logistic, khi được triển khai bằng GD theo toàn bộ lô hoặc SGD, là một kỹ thuật học máy nền tảng và hữu ích. Sau này ta sẽ thấy nó tương ứng với một mạng neural một tầng dùng hàm kích hoạt sigmoid, nên đây cũng là bước quan trọng để hiểu mạng neural.
4.4.1. Tính lồi của hàm mất mát NLL
Tương tự mất mát bình phương trong hồi quy tuyến tính, mất mát NLL của hồi quy logistic tuyến tính có tính lồi (convexity) theo các tham số và . Vì vậy, GD với một bộ siêu tham số hợp lý sẽ có hành vi thuận lợi.
Ta dùng ba tính chất:
- Nếu đạo hàm của một hàm một biến vô hướng tăng đơn điệu, hàm đó lồi.
- Tổng các hàm lồi cũng là hàm lồi.
- Hàm lồi của một hàm affine là hàm lồi.
Đặt . Vì là hàm affine (affine function) theo , chỉ cần chứng minh
lồi theo . Với ,
Đạo hàm này tăng đơn điệu, nên lồi. Tương tự,
Đạo hàm của cũng tăng đơn điệu, nên lồi.
4.5. Xử lý nhiều lớp
Đến đây, ta chỉ xét phân loại nhị phân với hai lớp. Nếu bài toán có nhiều lớp — chẳng hạn dự đoán thể loại phim — có hai chiến lược cơ bản:
- Huấn luyện nhiều bộ phân loại nhị phân trên các phần dữ liệu khác nhau rồi kết hợp đầu ra để dự đoán lớp.
- Huấn luyện trực tiếp một bộ phân loại đa lớp bằng cách tổng quát hóa hồi quy logistic, sử dụng mã hóa one-hot (one-hot encoding) và mất mát NLL.
Phương pháp dựa trên NLL được dùng rộng rãi hơn, đặc biệt trong mạng neural, nên nguồn tập trung vào phương pháp này. Giả sử tập dữ liệu có đầu vào và đầu ra thuộc một trong lớp .
Ta mở rộng NLL sang phân loại đa lớp (multiclass classification). Nhãn huấn luyện được biểu diễn bằng vector one-hot (one-hot vector)
trong đó nếu mẫu thuộc lớp , còn các thành phần khác bằng 0. Bài toán là ánh xạ đến một đầu ra chiều có thể diễn giải như phân phối xác suất rời rạc (discrete probability distribution): mọi thành phần không âm và tổng bằng 1.
Ta thực hiện qua hai bước. Trước hết, ánh xạ đầu vào sang bằng ma trận tham số kích thước và vector kích thước :
có kích thước , có kích thước và có kích thước , nên có kích thước .
Tiếp theo, mở rộng sigmoid thành hàm softmax (softmax function), nhận vector và sinh
Ghi chú (Ghi chú của biên tập viên về chỉ số)
Nguồn viết mẫu số dưới dạng mà không ghi cận và dùng lại , ký hiệu vốn đã chỉ số mẫu dữ liệu. Tụi mình chuẩn hóa thành trong công thức trên; tổng này luôn chạy qua thành phần của cùng một vector .
có thể được diễn giải là một phân phối xác suất trên lớp. Để đưa ra nhãn dự đoán cuối cùng, ta tìm thành phần lớn nhất của , chọn lớp có chỉ số tương ứng và tạo vector one-hot dự đoán với giá trị 1 tại vị trí đó.
Bài tập
Hãy kiểm tra rằng mọi thành phần của đều không âm và tổng của chúng bằng 1.
Kết hợp hai bước, lớp giả thuyết có dạng
Ta vẫn muốn cực đại hóa xác suất mà giả thuyết gán cho đầu ra đúng. Với một mẫu , đặt , xác suất ấy là
Bài tập
Có bao nhiêu thừa số trong tích trên khác 1?
Lấy log âm của xác suất dự đoán đúng, với là vector one-hot và là vector phân phối xác suất, ta được mất mát log-likelihood âm đa lớp (multiclass negative log-likelihood, NLLM):
NLLM cũng là một hàm lồi, nhưng nguồn không trình bày chứng minh.
Bài tập
Hãy giải thích vì sao đạt giá trị nhỏ khi dự đoán gán xác suất cao cho lớp đúng.
Bài tập
Hãy chỉ ra rằng khi , tương đương với .
4.6. Độ chính xác dự đoán và kiểm định
Để phát biểu bài toán phân loại bằng một hàm mục tiêu trơn có thể tối ưu ổn định bằng GD, ta đã chuyển đầu ra từ lớp rời rạc sang giá trị xác suất và chuyển hàm mất mát từ 0–1 sang NLL. Tuy nhiên, khi thực sự dự đoán, ta thường phải đưa ra lựa chọn dứt khoát: mua cổ phiếu của Acme hay không? Kết quả được tính là đúng hoặc sai, không phụ thuộc vào mức độ chắc chắn lúc đưa ra quyết định.
Hiệu năng của bộ phân loại thường được đặc trưng bằng độ chính xác (accuracy) — tỷ lệ mẫu được dự đoán đúng khi dùng mất mát 0–1. Nhân tỷ lệ này với 100 sẽ cho tỷ lệ phần trăm. Độ chính xác của giả thuyết trên dữ liệu là phần dữ liệu không chịu mất mát:
trong đó là dự đoán lớp cuối cùng được tạo từ , chẳng hạn sau khi áp dụng ngưỡng.
Ghi chú (Ghi chú của biên tập viên về ký hiệu g)
Ở Mục 4.6, là một quyết định lớp rời rạc được đưa vào mất mát 0–1. Nó không phải vector xác suất softmax cũng được ký hiệu là ở Mục 4.5; với bài toán đa lớp, quyết định cứng thường được lấy bằng lớp có xác suất lớn nhất.
Điểm đáng chú ý là ta dùng một hàm mất mát để tối ưu và một hàm khác để đánh giá. Đây là sự đánh đổi nhằm giúp việc tính toán và tối ưu trở nên khả thi, hiệu quả hơn.
Ghi chú (Phạm vi của mục kiểm định)
Tiêu đề nguồn nhắc đến kiểm định, nhưng nội dung Mục 4.6 chỉ định nghĩa độ chính xác và phân biệt mất mát tối ưu với mất mát đánh giá; nguồn không trình bày thêm quy trình chia hay sử dụng tập kiểm định trong mục này.
Tài liệu tham khảo
- MIT 6.390 course staff, “4 Classification”, truy cập ngày 12/08/2026, giấy phép CC BY-NC-SA 4.0.