Lý thuyết Tin học 12 Bài 1 (Cánh diều): Giới thiệu về học máy
Tóm tắt lý thuyết Tin học lớp 12 Bài 1: Giới thiệu về học máy hay, chi tiết sách Cánh diều sẽ giúp học sinh nắm vững kiến thức trọng tâm, ôn luyện để học tốt Tin học 12.
Lý thuyết Tin học 12 Bài 1: Giới thiệu về học máy
1. Khái niệm về học máy
- Học máy là nhánh của trí tuệ nhân tạo (AI) giúp máy tính học từ dữ liệu để tự động phát hiện mối quan hệ trong dữ liệu.
- Bài toán phân loại và bài toán phân cụm là hai ví dụ tiêu biểu trong Học máy.
- Máy tính được huấn luyện bằng cách sử dụng dữ liệu huấn luyện để thực hiện các nhiệm vụ trên dữ liệu mới. Dữ liệu huấn luyện mô tả các đối tượng trong thế giới thực, mỗi đối tượng tương ứng với một mẫu dữ liệu.
a) Mô hình học máy:
Tóm tắt:
- Thuật toán học máy phân tích dữ liệu đầu vào để rút ra các thông tin và đặc điểm quan trọng, giúp máy tính phân biệt giữa các mẫu dữ liệu hoặc nhóm các mẫu tương tự.
- Mô hình học máy được tạo ra từ thuật toán học máy và được huấn luyện bằng dữ liệu huấn luyện. Mô hình này được đánh giá bằng dữ liệu chưa dùng trong huấn luyện để xác định hiệu quả và đáp ứng yêu cầu ứng dụng trước khi đưa vào sử dụng thực tế.
b) Quy trình học máy:
1. Thu thập dữ liệu: Lựa chọn dữ liệu phù hợp từ nhiều nguồn khác nhau, có thể là dữ liệu có cấu trúc hoặc phi cấu trúc. Dữ liệu thu thập là thô và cần chuẩn bị trước khi huấn luyện.
2.Chuẩn bị dữ liệu: Làm sạch, loại bỏ nhiễu, bổ sung giá trị thiếu, và chuyển đổi dữ liệu sang định dạng phù hợp. Chia dữ liệu thành hai phần: một phần để huấn luyện và phần còn lại để đánh giá mô hình.
3.Xây dựng mô hình: Chọn thuật toán học máy phù hợp (như hồi quy tuyến tính, cây quyết định, mạng nơron) và huấn luyện mô hình với dữ liệu.
4.Đánh giá mô hình: Áp dụng mô hình cho dữ liệu đánh giá, so sánh kết quả với tiêu chí đánh giá để xác định hiệu quả. Có thể phải điều chỉnh mô hình để cải thiện kết quả.
5. Triển khai ứng dụng mô hình**: Sử dụng mô hình đã huấn luyện vào các bài toán thực tế.
Học máy có thể chia thành hai loại chính: học có giám sát và học không giám sát.
2. Học có giám sát
- Tập dữ liệu huấn luyện: Gồm các mẫu dữ liệu được gán với nhãn đầu ra tương ứng.
- Quá trình học: Máy tính học cách phát hiện mối quan hệ giữa các mẫu dữ liệu và nhãn.
- Dự đoán: Sau khi học, máy tính có thể dự đoán nhãn cho dữ liệu mới.
Ứng dụng: Được sử dụng để giải quyết nhiều bài toán, bao gồm bài toán phân loại.
a) Bài toán phân loại:
Bài toán phân loại: Gán nhãn cho đối tượng dựa trên các thuộc tính đặc trưng.
-Bài toán 1: Phân loại với hai nhãn "spam" và "no spam".
-Bài toán 2: Phân loại với ba nhãn "tốt", "bình thường", và "xấu".
Ứng dụng:
- Xây dựng mô hình phân loại để phân loại thư rác hoặc khách hàng vay tín dụng.
- Ví dụ: Mô hình phân loại thư rác gán nhãn "spam" hoặc "no spam" cho các email dựa trên các thuộc tính đặc trưng của chúng.
Hình 3: Minh hoạ vai trò của học máy trong phân loại thư rác với các biểu tượng email thể hiện thư có hoặc không có thuộc tính của thư rác.
b) Dữ liệu huấn luyện:
Phân loại và thuộc tính đặc trưng:
- Mô tả đối tượng: Được phân loại dựa trên các thuộc tính đặc trưng.- Ví dụ phân loại email:
- Thuộc tính đặc trưng: Địa chỉ người gửi, địa chỉ người nhận, dòng tiêu đề, từ ngữ đặc trưng cho thư rác.
- Dữ liệu huấn luyện: Bao gồm các email đã được gán nhãn là "thư rác" hoặc "không phải thư rác" để huấn luyện mô hình phân loại.
c) Huấn luyện và đánh giá mô hình:
Quá trình huấn luyện và đánh giá mô hình phân loại:
- Huấn luyện máy tính: Sử dụng dữ liệu huấn luyện để dự đoán nhãn phân loại theo thuật toán học máy.
- Dự đoán nhãn: Dựa trên giá trị các thuộc tính đặc trưng của đối tượng.
- Đánh giá mô hình: Áp dụng mô hình lên dữ liệu kiểm tra, so sánh nhãn dự đoán với nhãn đã biết.
- Mục tiêu: Giảm thiểu tỷ lệ nhãn bị gán sai đến mức chấp nhận được.
3. Học không giám sát
- Tập dữ liệu: Không có nhãn.
- Ứng dụng: Giải quyết nhiều bài toán khác nhau, bao gồm bài toán phân cụm.
a) Bài toán phân cụm:
- Khái niệm: Chia tập đối tượng thành các cụm dựa trên sự tương tự và khác biệt.
- Đặc điểm: Các đối tượng trong cùng một cụm có đặc điểm tương tự nhau, còn các cụm khác có đặc điểm khác nhau.
- Ứng dụng: Học không giám sát giúp xây dựng mô hình phân cụm, ví dụ như phân cụm các loại quả dựa trên đặc điểm của chúng.
b) Dữ liệu huấn luyện:
Dữ liệu huấn luyện trong phân cụm:
- Tập dữ liệu: Bao gồm các mẫu dữ liệu mô tả thuộc tính đặc trưng của đối tượng (ví dụ: hình dạng, kích thước, màu sắc của quả).
- Đặc điểm: Không có nhãn kèm theo; chỉ có các thuộc tính đặc trưng để phân cụm.
c) Huấn luyện và đánh giá mô hình:
Huấn luyện và đánh giá mô hình phân cụm:
- Huấn luyện: Dựa trên thông tin về sự tương tự của các mẫu dữ liệu, thuật toán nhóm các mẫu thành các cụm. Các phương pháp phân cụm có thể dựa trên mật độ dữ liệu, phân phối xác suất, hoặc khoảng cách giữa các mẫu dữ liệu và tâm cụm.
- Đánh giá: Không có nhãn để kiểm tra tính chính xác. Kết quả phân cụm được đánh giá dựa trên tính chất của dữ liệu và yêu cầu phân tích dữ liệu.
4. Một số ứng dụng của Học máy
a) Nhận dạng tiếng nói:
- Ứng dụng: Chuyển lời nói thành văn bản, tìm kiếm bằng lời nói, điều khiển thiết bị thông minh bằng lời nói, dịch vụ trả lời tự động, chatbot trợ lý ảo, xác thực sinh trắc học tiếng nói.
- Ví dụ: Ứng dụng Google Dịch chuyển đổi tiếng nói thành văn bản.
b) Nhận dạng chữ viết:
- Ứng dụng: Chuyển đổi chữ viết tay thành văn bản.
- Chế độ:
+ Tĩnh (Offline): Hình ảnh chữ viết tay được thu nhận và phân tích sau.
+ Động (Online): Chữ viết được thu nhận và phân tích cùng lúc với thao tác viết, áp dụng cho xác thực sinh trắc học chữ ký.
c) Dịch máy:
- Ứng dụng: Dự đoán từ hoặc cụm từ tương ứng trong ngôn ngữ đích từ ngôn ngữ nguồn.
- Ví dụ: Google Dịch cho phép dịch văn bản, nhận dạng chữ viết tay, và tiếng nói. Cung cấp các tính năng như phiên dịch trực tiếp qua camera, dịch email, và trợ lý ảo Google Assistant hỗ trợ trò chuyện đa ngôn ngữ.
d) Chẩn đoán bệnh:
- Ứng dụng: Phân tích triệu chứng và kết quả xét nghiệm để dự đoán bệnh. Học máy giúp bác sĩ chẩn đoán nhanh và chính xác hơn.
e) Phân tích thị trường:
- Ứng dụng: Phân cụm dữ liệu khách hàng theo các thuộc tính như giới tính, độ tuổi, nhu cầu tiêu dùng. Kết quả giúp doanh nghiệp xây dựng chiến lược tiếp thị hiệu quả, tăng doanh số và nâng cao hiệu quả kinh doanh.
Trắc nghiệm: Giới thiệu về học máy
PHẦN I. Câu trắc nghiệm nhiều phương án lựa chọn. Thí sinh trả lời từ câu 1 đến câu 10. Mỗi câu hỏi thí sinh chỉ lựa chọn một phương án.
Câu 1: Học máy là nhánh của trí tuệ nhân tạo (AI) giúp máy tính làm gì?
A. Tự động phát hiện mối quan hệ trong dữ liệu.
B. Xây dựng hệ điều hành mới.
C. Tạo ra các phần mềm diệt virus.
D. Quản lý cơ sở dữ liệu.
Đáp án: A
Giải thích: Học máy giúp máy tính học từ dữ liệu để tự động phát hiện mối quan hệ và mẫu trong dữ liệu, điều này làm nổi bật khả năng học từ dữ liệu mà không cần lập trình chi tiết.
Câu 2: Trong quy trình học máy, bước nào là bước đầu tiên?
A. Chuẩn bị dữ liệu.
B. Đánh giá mô hình.
C. Thu thập dữ liệu.
D. Triển khai ứng dụng mô hình.
Đáp án: C
Giải thích: Bước đầu tiên trong quy trình học máy là thu thập dữ liệu từ nhiều nguồn khác nhau để có dữ liệu thô cần thiết cho các bước tiếp theo.
Câu 3: Mô hình học máy được tạo ra từ gì?
A. Thuật toán học máy.
B. Dữ liệu huấn luyện.
C. Các ứng dụng phần mềm.
D. Hệ điều hành.
Đáp án: A
Giải thích: Mô hình học máy được tạo ra từ thuật toán học máy và được huấn luyện bằng dữ liệu huấn luyện.
Câu 4: Trong học có giám sát, dữ liệu huấn luyện bao gồm gì?
A. Các mẫu dữ liệu được gán với nhãn đầu ra tương ứng.
B. Các dữ liệu không có nhãn.
C. Dữ liệu chỉ chứa thuộc tính đặc trưng.
D. Dữ liệu không cần chuẩn bị trước.
Đáp án: A
Giải thích: Trong học có giám sát, dữ liệu huấn luyện bao gồm các mẫu dữ liệu có nhãn đầu ra tương ứng, giúp máy tính học cách dự đoán nhãn cho dữ liệu mới.
Câu 5: Bài toán phân loại nào dưới đây là ví dụ điển hình trong học máy?
A. Phân loại thư rác.
B. Phân cụm dữ liệu khách hàng.
C. Phân tích thị trường chứng khoán.
D. Dự đoán giá cổ phiếu.
Đáp án: A
Giải thích: Phân loại thư rác là một ví dụ điển hình của bài toán phân loại, nơi các email được gán nhãn "spam" hoặc "no spam" dựa trên các thuộc tính đặc trưng của chúng.
Câu 6: Trong bài toán phân cụm, dữ liệu huấn luyện có đặc điểm gì?
A. Không có nhãn.
B. Được gán nhãn với đầu ra cụ thể.
C. Chỉ chứa các thuộc tính đặc trưng của đối tượng.
D. Dữ liệu được chuẩn bị trước và có cấu trúc.
Đáp án: A
Giải thích: Trong bài toán phân cụm, dữ liệu huấn luyện không có nhãn và chỉ chứa các thuộc tính đặc trưng của đối tượng để nhóm các mẫu dữ liệu thành các cụm dựa trên sự tương tự.
Câu 7: Bài toán nào dưới đây thuộc học không giám sát?
A. Phân cụm dữ liệu khách hàng.
B. Dự đoán giá nhà dựa trên dữ liệu lịch sử.
C. Phân tích văn bản để tìm các chủ đề.
D. Xác định spam trong email.
Đáp án: A
Giải thích: Phân cụm dữ liệu khách hàng thuộc học không giám sát, nơi dữ liệu không có nhãn và các mẫu được nhóm lại dựa trên sự tương tự giữa các thuộc tính của chúng.
Câu 8: Ứng dụng nào sau đây không phải là một ví dụ của nhận dạng tiếng nói?
A. Chuyển đổi chữ viết tay thành văn bản.
B. Tìm kiếm bằng lời nói.
C. Điều khiển thiết bị thông minh bằng lời nói.
D. Xác thực sinh trắc học tiếng nói.
Đáp án: A
Giải thích: Chuyển đổi chữ viết tay thành văn bản là một ứng dụng của nhận dạng chữ viết, không phải của nhận dạng tiếng nói.
Câu 9: Học máy có thể giúp bác sĩ trong việc nào dưới đây?
A. Phân tích triệu chứng và kết quả xét nghiệm để dự đoán bệnh.
B. Viết đơn thuốc cho bệnh nhân.
C. Điều chỉnh máy móc y tế.
D. Tổ chức lịch làm việc của bác sĩ.
Đáp án: A
Giải thích: Học máy có thể phân tích triệu chứng và kết quả xét nghiệm để hỗ trợ bác sĩ trong việc chẩn đoán bệnh nhanh chóng và chính xác hơn.
Câu 10: Trong phân tích thị trường, học máy giúp gì cho doanh nghiệp?
A. Xây dựng chiến lược tiếp thị hiệu quả.
B. Đánh giá hiệu suất nhân viên.
C. Quản lý kho hàng.
D. Tổ chức các sự kiện quảng cáo.
Đáp án: A
Giải thích: Phân tích thị trường sử dụng học máy để phân cụm dữ liệu khách hàng, giúp doanh nghiệp xây dựng chiến lược tiếp thị hiệu quả, tăng doanh số và nâng cao hiệu quả kinh doanh.
PHẦN II. Câu trắc nghiệm đúng sai. Thí sinh trả lời từ câu 1 đến câu 2. Trong mỗi ý a), b), c), d) ở mỗi câu, thí sinh chọn đúng hoặc sai
Câu 1: Hãy cho biết các phát biểu sau đây về học máy đúng hay sai:
a) Học máy là nhánh của trí tuệ nhân tạo giúp máy tính tự động phát hiện mối quan hệ trong dữ liệu mà không cần sự can thiệp của con người.
b) Bài toán phân loại là một ví dụ của học máy có giám sát, trong đó các mẫu dữ liệu được gán nhãn đầu ra tương ứng để huấn luyện mô hình.
c) Quy trình học máy bắt đầu bằng việc đánh giá mô hình trước khi thu thập và chuẩn bị dữ liệu.
d) Học không giám sát thường được sử dụng để giải quyết bài toán phân loại, mà không cần dữ liệu có nhãn.
a) Đúng – Học máy giúp máy tính phát hiện mối quan hệ trong dữ liệu một cách tự động bằng cách sử dụng các thuật toán học máy.
b) Đúng – Bài toán phân loại là một ví dụ của học máy có giám sát, nơi máy tính học cách phân loại dữ liệu dựa trên các nhãn đã biết.
c) Sai – Quy trình học máy bắt đầu bằng việc thu thập và chuẩn bị dữ liệu trước khi xây dựng và đánh giá mô hình.
d) Sai – Học không giám sát được sử dụng cho các bài toán phân cụm, không yêu cầu dữ liệu có nhãn. Phân loại yêu cầu dữ liệu có nhãn.
Câu 2: Xác định tính đúng/sai của các phát biểu sau về các ứng dụng và đặc điểm của học máy:
a) Một mô hình học máy phân loại có thể được ứng dụng để phân loại email thành "spam" hoặc "không spam".
b) Trong bài toán phân cụm, dữ liệu huấn luyện không cần có nhãn và thuật toán nhóm các mẫu dữ liệu thành các cụm dựa trên sự tương tự.
c) Học không giám sát yêu cầu dữ liệu có nhãn để huấn luyện mô hình phân cụm.
d) Ứng dụng nhận dạng chữ viết tay có thể bao gồm cả chế độ tĩnh (offline) và động (online) để chuyển đổi chữ viết tay thành văn bản.
a) Đúng – Mô hình phân loại có thể được sử dụng để phân loại email thành "spam" hoặc "không spam" dựa trên thuộc tính đặc trưng của email.
b) Đúng – Trong bài toán phân cụm, dữ liệu không có nhãn và thuật toán học không giám sát nhóm các mẫu dữ liệu thành các cụm dựa trên sự tương tự.
c) Sai – Học không giám sát không yêu cầu dữ liệu có nhãn. Phân cụm là một bài toán học không giám sát.
d) Đúng – Ứng dụng nhận dạng chữ viết tay có thể bao gồm chế độ tĩnh (offline) để phân tích hình ảnh chữ viết tay và chế độ động (online) để phân tích chữ viết trong thời gian thực.
PHẦN III. Câu trả lời ngắn. Thí sinh trả lời từ câu 1 đến câu 3
Câu 1: Học máy là gì và nó giúp máy tính làm gì?
Đáp án: Học máy là nhánh của trí tuệ nhân tạo (AI) giúp máy tính học từ dữ liệu để tự động phát hiện mối quan hệ trong dữ liệu.
Giải thích: Học máy cho phép máy tính học và cải thiện từ dữ liệu mà không cần lập trình cụ thể cho từng nhiệm vụ. Nó phân tích dữ liệu đầu vào để tìm ra các mẫu và mối quan hệ, giúp máy tính tự động đưa ra dự đoán hoặc quyết định dựa trên dữ liệu mới.
Câu 2: Quy trình học máy bao gồm các bước chính nào?
Đáp án: Quy trình học máy bao gồm các bước chính: thu thập dữ liệu, chuẩn bị dữ liệu, xây dựng mô hình, đánh giá mô hình, và triển khai ứng dụng mô hình.
Giải thích:
Thu thập dữ liệu: Lựa chọn và thu thập dữ liệu phù hợp từ các nguồn khác nhau.
Chuẩn bị dữ liệu: Làm sạch, xử lý và chuẩn bị dữ liệu cho quá trình huấn luyện.
Xây dựng mô hình: Chọn thuật toán học máy và huấn luyện mô hình với dữ liệu đã chuẩn bị.
Đánh giá mô hình: Kiểm tra mô hình với dữ liệu chưa thấy và so sánh kết quả với tiêu chí đánh giá.
Triển khai ứng dụng mô hình: Sử dụng mô hình đã huấn luyện để giải quyết các bài toán thực tế.
Câu 3: Sự khác biệt chính giữa học có giám sát và học không giám sát là gì?
Đáp án: Sự khác biệt chính là: học có giám sát sử dụng dữ liệu có nhãn, trong khi học không giám sát sử dụng dữ liệu không có nhãn.
Giải thích:
Học có giám sát: Dữ liệu huấn luyện bao gồm các mẫu dữ liệu đã được gán nhãn đầu ra. Mục tiêu là học mối quan hệ giữa đầu vào và nhãn để dự đoán nhãn cho dữ liệu mới.
Học không giám sát: Dữ liệu huấn luyện không có nhãn. Mục tiêu là tìm cấu trúc hoặc mẫu trong dữ liệu, như phân nhóm dữ liệu thành các cụm mà không cần nhãn trước đó.
Xem thêm các chương trình khác:
- Soạn văn 12 Cánh diều (hay nhất)
- Văn mẫu 12 - Cánh diều
- Tóm tắt tác phẩm Ngữ văn 12 – Cánh diều
- Tác giả tác phẩm Ngữ văn 12 - Cánh diều
- Bố cục tác phẩm Ngữ văn 12 – Cánh diều
- Nội dung chính tác phẩm Ngữ văn 12 – Cánh diều
- Giải Chuyên đề học tập Ngữ văn 12 – Cánh diều
- Giải sgk Toán 12 – Cánh diều
- Giải Chuyên đề học tập Toán 12 – Cánh diều
- Lý thuyết Toán 12 – Cánh diều
- Giải sbt Toán 12 – Cánh diều
- Giải sgk Tiếng Anh 12 - ilearn Smart World
- Trọn bộ Từ vựng Tiếng Anh lớp 12 ilearn Smart World đầy đủ nhất
- Trọn bộ Ngữ pháp Tiếng Anh lớp 12 ilearn Smart World đầy đủ nhất
- Giải sbt Tiếng Anh 12 – iLearn Smart World
- Giải sgk Vật lí 12 – Cánh diều
- Giải Chuyên đề học tập Vật lí 12 – Cánh diều
- Lý thuyết Vật lí 12 – Cánh diều
- Giải sbt Vật lí 12 – Cánh diều
- Giải sgk Hóa học 12 – Cánh diều
- Giải Chuyên đề học tập Hóa 12 – Cánh diều
- Lý thuyết Hóa 12 – Cánh diều
- Giải sbt Hóa 12 – Cánh diều
- Giải sgk Sinh học 12 – Cánh diều
- Giải Chuyên đề học tập Sinh học 12 – Cánh diều
- Lý thuyết Sinh học 12 – Cánh diều
- Giải sbt Sinh học 12 – Cánh diều
- Giải sgk Lịch sử 12 – Cánh diều
- Giải Chuyên đề học tập Lịch sử 12 – Cánh diều
- Giải sbt Lịch sử 12 – Cánh diều
- Lý thuyết Lịch sử 12 – Cánh diều
- Giải sgk Địa lí 12 – Cánh diều
- Giải Chuyên đề học tập Địa lí 12 – Cánh diều
- Giải sbt Địa lí 12 – Cánh diều
- Lý thuyết Địa lí 12 – Cánh diều
- Giải sgk Công nghệ 12 – Cánh diều
- Lý thuyết Công nghệ 12 – Cánh diều
- Giải sgk Kinh tế pháp luật 12 – Cánh diều
- Giải Chuyên đề học tập Kinh tế pháp luật 12 – Cánh diều
- Giải sbt Kinh tế pháp luật 12 – Cánh diều
- Giải sgk Giáo dục quốc phòng 12 – Cánh diều
- Giải sgk Hoạt động trải nghiệm 12 – Cánh diều
