Bỏ qua tới nội dung
Gọi kỹ thuật
  1. Trang chủ
  2. Kiến thức

Machine Learning là gì? Nguyên lý hoạt động, Phân loại và Ứng dụng

IPC · đăng 07/06/2023 · cập nhật 03/09/2026 · 12 phút đọc

Machine learning là gì? Machine learning (học máy) là nhánh của trí tuệ nhân tạo và khoa học máy tính, cho phép máy tính tìm quy luật từ dữ liệu và tự cải thiện độ chính xác qua thời gian thay vì được lập trình từng quy tắc. Bài viết trình bày nguyên lý ba bước của học máy, bốn nhóm thuật toán, khác biệt với deep learning, các ứng dụng phổ biến và cách nhà máy dùng học máy cho bảo trì dự đoán và kiểm lỗi bằng camera.

1. Machine Learning là gì?

Học máy (machine learning) là một lĩnh vực trong trí tuệ nhân tạo AI và khoa học máy tính, nghiên cứu các kỹ thuật cho phép hệ thống "học" tự động từ dữ liệu để giải quyết bài toán cụ thể. Học máy dùng dữ liệu và thuật toán để mô phỏng cách con người rút kinh nghiệm, qua đó tăng độ chính xác theo thời gian.
Minh họa machine learning: máy tính học quy luật từ dữ liệu trong hệ sinh thái công nghệ 4.0
Machine learning là thành phần cốt lõi của hệ sinh thái công nghệ 4.0

Điểm khác với lập trình truyền thống nằm ở chiều đi của quy tắc. Lập trình truyền thống: người viết quy tắc, máy áp dụng lên dữ liệu để ra kết quả. Học máy: người đưa dữ liệu và kết quả mong muốn, máy tự tìm quy tắc (mô hình) rồi dùng mô hình đó cho dữ liệu mới. Mô hình được biểu diễn bằng các tham số số học, được điều chỉnh dần trong quá trình huấn luyện.

Ứng dụng quen thuộc của học máy gồm cảnh báo tắc đường trên bản đồ, nhận diện khuôn mặt trên mạng xã hội, lọc thư rác. Trong nhà máy, học máy dùng cho dự báo hỏng máy, kiểm lỗi sản phẩm bằng camera và tối ưu thông số vận hành.

2. Nguyên lý "tự học" của Machine Learning

Về tổng quan, học máy đi từ xác định bài toán, chuẩn bị dữ liệu, huấn luyện mô hình đến triển khai và cập nhật. Sau mỗi lần xử lý, mô hình được đánh giá và điều chỉnh, nên bộ dữ liệu và độ chính xác được mở rộng dần. Quy trình khép kín này gồm ba bước.

Bước 1. Tiền xử lý dữ liệu đầu vào

Dữ liệu thô được làm sạch: loại bản ghi thiếu, sai; chuẩn hóa đơn vị; gán nhãn nếu là học có giám sát; tách thành tập huấn luyện và tập kiểm tra. Với dữ liệu nhà máy, bước này gồm đồng bộ thời gian giữa cảm biến và PLC, lọc nhiễu tín hiệu rung và cắt ảnh về đúng vùng cần kiểm tra. Chất lượng dữ liệu ở bước này quyết định phần lớn chất lượng mô hình.

Giai đoạn nạp và tiền xử lý dữ liệu đầu vào cho mô hình machine learning
Nguyên lý tự học của machine learning: giai đoạn nạp dữ liệu

Bước 2. Huấn luyện mô hình bằng thuật toán

Dữ liệu đã xử lý được đưa vào thuật toán để tìm mô hình khớp nhất với bài toán. Thuật toán tạo ra nhiều phương án, so sánh dự đoán với kết quả thật trên tập kiểm tra và loại phương án sai nhiều. Kết quả là mô hình có sai số thấp nhất sau nhiều vòng thử, kèm số đo độ chính xác để quyết định có đủ tốt để triển khai hay chưa.

Giai đoạn huấn luyện mô hình machine learning bằng thuật toán trên dữ liệu đã xử lý
Nguyên lý tự học của machine learning: xử lý dữ liệu

Bước 3. Triển khai và cải thiện liên tục

Mô hình được đưa vào chạy thật. Trong quá trình vận hành, hệ thống ghi nhận các trường hợp dự đoán sai hoặc dữ liệu mới chưa từng gặp, bổ sung vào bộ dữ liệu và huấn luyện lại theo chu kỳ. Sau nhiều vòng cập nhật, mô hình đạt độ chính xác ổn định với tốc độ xử lý nhanh hơn và ít sai sót hơn.

Vòng lặp triển khai và cải tiến liên tục của mô hình machine learning
Nguyên lý tự học và cải tiến của machine learning

3. Phân loại Machine Learning

Học máy được chia theo cách mô hình nhận phản hồi từ dữ liệu.

NhómDữ liệu đầu vàoBài toán điển hìnhVí dụ trong nhà máy
Học có giám sátĐã gán nhãn kết quảPhân lớp, hồi quyPhân loại sản phẩm đạt hoặc lỗi từ ảnh đã gán nhãn
Học không giám sátChưa gán nhãnGom cụm, phát hiện bất thườngPhát hiện rung bất thường của động cơ khi chưa có mẫu hỏng
Học bán giám sátÍt dữ liệu gán nhãn, nhiều chưa gánPhân lớp với chi phí gán nhãn thấpGán nhãn vài trăm ảnh lỗi, tận dụng hàng nghìn ảnh chưa gán
Học tăng cườngPhần thưởng từ môi trườngĐiều khiển, tối ưu chuỗi quyết địnhTối ưu thông số máy ép, lịch nạp liệu

3.1 Học máy có giám sát (Supervised Learning)

Dữ liệu huấn luyện gồm đầu vào và đáp án đúng do con người gán sẵn. Mô hình học cách ánh xạ đầu vào sang đáp án rồi áp dụng cho dữ liệu mới. Đây là kỹ thuật cho bài toán phân lớp (classification) và hồi quy (regression). Thuật toán thường dùng: máy vector hỗ trợ (SVM), cây quyết định (decision tree), mạng nơ-ron, hồi quy tuyến tính. Ví dụ quen thuộc là lọc thư rác; trong sản xuất là phân loại ảnh sản phẩm thành đạt hoặc lỗi.

Sơ đồ học máy có giám sát với dữ liệu đầu vào đã gán nhãn
Học máy có giám sát (supervised learning)

3.2 Học máy không giám sát (Unsupervised Learning)

Dữ liệu không có đáp án sẵn; thuật toán tự tìm cấu trúc bên trong dữ liệu. Bài toán điển hình là gom cụm (clustering) và phát hiện bất thường (anomaly detection). Thuật toán thường dùng: k-means, phân cụm phân cấp (HAC), bản đồ tự tổ chức (SOM), DBSCAN. Trong thương mại, học không giám sát dùng để cá nhân hóa đề xuất theo lịch sử mua; trong nhà máy, nó dùng để phát hiện máy chạy khác thường khi chưa có mẫu hỏng để học.

Sơ đồ học máy không giám sát gom cụm dữ liệu chưa gán nhãn
Học máy không giám sát (unsupervised learning)

3.3 Học bán giám sát (Semi-Supervised Learning)

Nằm giữa hai nhóm trên: một phần nhỏ dữ liệu được gán nhãn, phần lớn còn lại chưa gán. Mô hình học từ phần gán nhãn rồi mở rộng sang phần chưa gán. Cách này giảm chi phí gán nhãn, phù hợp với nhà máy nơi ảnh lỗi ít và tốn công đánh dấu. Thuật toán thường dùng: cực đại kỳ vọng (EM), SVM truyền dẫn (TSVM), self-training, co-training và phương pháp dựa trên đồ thị.

3.4 Học tăng cường (Reinforcement Learning)

Mô hình (tác tử) thử hành động trong môi trường và nhận phần thưởng hoặc phạt, từ đó học chuỗi quyết định cho tổng phần thưởng cao nhất. Ứng dụng gồm điều khiển robot, tối ưu thông số vận hành và lập lịch. Trong sản xuất, học tăng cường thường được thử nghiệm trên mô phỏng trước khi đưa ra máy thật.

4. So sánh Machine Learning và Deep Learning

Deep learning (học sâu) là một nhánh của machine learning dùng mạng nơ-ron nhiều lớp. Hai cách tiếp cận khác nhau ở dữ liệu, phần cứng và vai trò của người làm mô hình.

Nội dungMachine learning truyền thốngDeep learning
Khái niệmThuật toán học quy luật từ dữ liệu để phân loại, dự đoánNhánh của machine learning dùng mạng nơ-ron sâu (deep neural network) mô phỏng cách nơ-ron liên kết
Đặc trưng đầu vàoNgười chọn và tính đặc trưng (feature) từ dữ liệu, ví dụ biên độ rung, nhiệt độ trung bìnhMô hình tự học đặc trưng từ dữ liệu thô như ảnh, âm thanh, chuỗi thời gian
Lượng dữ liệu huấn luyệnNhỏ đến vừaLớn
Phần cứngChạy được trên CPU, kể cả máy tính công nghiệp tại máyCần GPU để huấn luyện; suy luận cần GPU hoặc bộ tăng tốc AI
Khả năng giải thíchDễ giải thích vì sao ra kết quảKhó giải thích, kiểm tra bằng thử nghiệm
Bài toán phù hợpDữ liệu bảng, dữ liệu cảm biến, dự báoẢnh, video, giọng nói, văn bản

Trong nhà máy, hai nhóm bổ sung cho nhau: bảo trì dự đoán từ dữ liệu cảm biến thường dùng machine learning truyền thống; kiểm lỗi từ ảnh camera dùng deep learning.

5. Ứng dụng phổ biến của Machine Learning hiện nay

5.1 Nhận diện giọng nói

Có hai loại: nhận dạng lời nói (speech recognition) chuyển lời nói thành văn bản bằng xử lý ngôn ngữ tự nhiên (NLP), và nhận dạng giọng nói (voice recognition) xác định người nói. Ứng dụng gồm nhập liệu bằng giọng nói, điều khiển nhà thông minh và trợ lý ảo như Siri, Google Assistant, Alexa.

5.2 Dịch vụ khách hàng

Chatbot trả lời câu hỏi thường gặp, tư vấn sản phẩm và đề xuất kích thước phù hợp trên website, Slack, Messenger. Học máy giúp chatbot hiểu câu hỏi viết theo nhiều cách khác nhau.

Chatbot ứng dụng machine learning trong dịch vụ chăm sóc khách hàng
Machine learning trong dịch vụ khách hàng

5.3 Thị giác máy tính (Computer Vision)

Thị giác máy tính cho phép máy trích xuất thông tin từ ảnh và video rồi hành động. Kỹ thuật chính là mạng nơ-ron tích chập (CNN). Ứng dụng gồm gắn thẻ ảnh trên mạng xã hội, phân tích ảnh X-quang trong y tế, xe tự lái và kiểm lỗi sản phẩm trên dây chuyền.

Hệ thống thị giác máy tính dùng machine learning phân tích hình ảnh
Machine learning và thị giác máy tính

5.4 Hệ thống đề xuất

Từ dữ liệu hành vi mua sắm trong quá khứ, thuật toán học máy phát hiện xu hướng và đề xuất sản phẩm phù hợp cho từng khách hàng. Nhà bán lẻ trực tuyến dùng cách này ở bước thanh toán và trang chủ.

5.5 Giao dịch chứng khoán tự động

Nền tảng giao dịch dùng học máy để phân tích dữ liệu thị trường và thực hiện lệnh mua bán theo quy tắc đã học, với số lượng lệnh lớn mà không cần thao tác tay. Học máy không bảo đảm chính xác cho mọi cơ hội đầu tư, nhưng giúp giảm rủi ro do quyết định cảm tính.

Machine learning phân tích dữ liệu thị trường trong giao dịch chứng khoán tự động
Machine learning trong giao dịch chứng khoán

5.6 Phát hiện gian lận

Ngân hàng dùng mô hình học có giám sát, huấn luyện trên dữ liệu giao dịch gian lận đã biết, để phát hiện giao dịch bất thường cần điều tra.

5.7 Nông nghiệp

Máy bay không người lái bón phân theo vùng đã xác định, hệ thống theo dõi sức khỏe vật nuôi và quản lý quy trình canh tác bằng thiết bị số theo tiêu chuẩn quốc tế, giúp tối ưu sản xuất và cân bằng cung cầu.

Ứng dụng machine learning trong nông nghiệp với máy bay không người lái và cảm biến
Ứng dụng machine learning trong nông nghiệp

6. Machine learning trong nhà máy: bảo trì dự đoán và kiểm lỗi thị giác

Hai bài toán được triển khai nhiều nhất tại nhà máy là bảo trì dự đoán và kiểm lỗi bằng camera. Cả hai đều cần dữ liệu thu tại máy và thiết bị tính toán đặt ngay tại xưởng.

Bài toánDữ liệu đầu vàoLoại học máyThiết bị tại xưởngKết quả
Bảo trì dự đoán (predictive maintenance)Rung, nhiệt độ, dòng điện, âm thanh của động cơ, bơm, trục chínhPhát hiện bất thường, hồi quy dự báo tuổi thọ còn lạiMáy tính công nghiệp không quạt gom dữ liệu cảm biến, chạy mô hình nhẹ trên CPUCảnh báo trước khi hỏng, lên lịch thay thế theo tình trạng
Kiểm lỗi thị giác (visual inspection)Ảnh, video từ camera công nghiệp trên băng tảiDeep learning phân lớp, phát hiện đối tượng, phân đoạnMáy tính GPU công nghiệp hoặc máy chủ AI tại xưởngPhát hiện lỗi bề mặt, sai lắp ráp, đọc ký tự trong vài chục mili giây
Tối ưu thông số vận hànhLịch sử thông số máy và chất lượng lôHồi quy, học tăng cườngMáy chủ phân tích tại nhà máyGợi ý thông số cho lô kế tiếp, giảm phế phẩm

Với bảo trì dự đoán, khó khăn thường gặp là thiếu dữ liệu lúc máy hỏng vì máy hiếm khi hỏng. Học không giám sát giải quyết bằng cách học trạng thái bình thường rồi cảnh báo khi tín hiệu lệch khỏi đó. Với kiểm lỗi thị giác, mô hình được huấn luyện ở máy chủ trung tâm trên bộ ảnh đã gán nhãn, sau đó đưa xuống máy tính GPU tại chuyền để chạy suy luận; ảnh lỗi mới được gửi ngược lên để huấn luyện lại theo chu kỳ. Khối lượng dữ liệu cảm biến và ảnh tích lũy theo tháng là bài toán big data của nhà máy, cần nơi lưu và máy chủ phân tích riêng.

Chọn thiết bị cho machine learning tại nhà máy

Thiết bị cho học máy tại xưởng chia hai lớp: máy gom dữ liệu tại máy và máy chạy mô hình. Ba tiêu chí cần xem:

  • Cổng thu dữ liệu: COM RS-232/485, DIO và mô-đun mở rộng để nối cảm biến, PLC; LAN có PoE cho camera.
  • Thiết kế không quạt, dải nhiệt rộng, chịu rung: máy đặt cạnh động cơ hoặc trên băng tải phải làm việc ổn định trong bụi và rung liên tục.
  • Khả năng gắn GPU với bài toán thị giác: card PCIe hoặc mô-đun MXM, đủ VRAM cho mô hình và số camera.

Cho lớp gom dữ liệu cảm biến, Advantech UNO-2271G là cổng biên (edge gateway) không quạt cỡ nhỏ dùng Intel Atom, có 2 cổng GbE, mở rộng RS-232/422/485 và DIO cách ly qua mô-đun iDoor, hỗ trợ giao thức fieldbus; phù hợp đặt trong tủ điện từng máy. Cho lớp chạy mô hình thị giác, Cincoze GM-1000 thuộc nhóm máy chủ công nghiệp dạng nhúng: CPU Intel Xeon hoặc Core thế hệ 9/8, một khe GPU MXM 3.1, làm việc ở -40 đến 70 °C với CPU 35 W, chịu rung 5G và sốc 50G, có mở rộng PoE cho camera; chi tiết về máy chủ chạy AI xem bài máy chủ AI là gì. Nếu chưa rõ vị trí lắp cần cấu hình nào, dùng công cụ chọn máy theo điều kiện lắp đặt để lọc theo nhiệt độ, rung, số cổng và nhu cầu GPU trước khi trao đổi với kỹ sư IPC247.

Câu hỏi thường gặp về machine learning

Machine learning là gì?

Machine learning (học máy) là nhánh của trí tuệ nhân tạo và khoa học máy tính, trong đó máy tính dùng thuật toán để tìm quy luật từ dữ liệu rồi áp dụng quy luật đó lên dữ liệu mới. Người lập trình không viết từng quy tắc; mô hình tự điều chỉnh tham số qua quá trình huấn luyện và cải thiện độ chính xác khi có thêm dữ liệu.

Machine learning khác deep learning ở điểm nào?

Deep learning là một nhánh của machine learning dùng mạng nơ-ron nhiều lớp. Machine learning truyền thống cần người chọn đặc trưng đầu vào và chạy được với dữ liệu nhỏ trên CPU; deep learning tự học đặc trưng từ dữ liệu thô như ảnh, âm thanh nhưng cần nhiều dữ liệu và GPU để huấn luyện.

Machine learning dùng trong nhà máy để làm gì?

Hai ứng dụng phổ biến là bảo trì dự đoán và kiểm lỗi bằng thị giác máy. Bảo trì dự đoán dùng dữ liệu rung, nhiệt, dòng điện của máy để dự báo hỏng hóc trước khi xảy ra. Kiểm lỗi thị giác dùng camera và mô hình học sâu để phát hiện lỗi bề mặt, sai lắp ráp trên từng sản phẩm theo nhịp băng tải.

Triển khai machine learning tại xưởng cần thiết bị gì?

Cần ba lớp: cảm biến và camera thu dữ liệu; máy tính công nghiệp không quạt tại máy để gom dữ liệu và chạy mô hình nhẹ; máy tính GPU công nghiệp hoặc máy chủ AI tại xưởng để chạy mô hình thị giác theo thời gian thực. Huấn luyện mô hình thường làm ở máy chủ trung tâm hoặc đám mây rồi đưa xuống xưởng.

Học có giám sát và học không giám sát khác nhau thế nào?

Học có giám sát dùng dữ liệu đã gán nhãn, ví dụ ảnh sản phẩm đã đánh dấu đạt hoặc lỗi, để học cách phân loại. Học không giám sát dùng dữ liệu chưa gán nhãn để tự gom cụm hoặc phát hiện điểm bất thường, phù hợp khi chưa có sẵn ví dụ lỗi.

Bài liên quan

Công cụ chọn máy · maytinhcongnghiep.com

Cần máy tính công nghiệp cho ứng dụng trong bài? Trả lời 4 câu về điều kiện lắp đặt.

Nhiệt độ, rung, bụi, nguồn điện — hệ thống gợi ý cấu hình từ hơn 2.700 mã máy trong kho dữ liệu maytinhcongnghiep.com của IPC247.