Machine learning là gì? Machine learning (học máy) là nhánh của trí tuệ nhân tạo và khoa học máy tính, cho phép máy tính tìm quy luật từ dữ liệu và tự cải thiện độ chính xác qua thời gian thay vì được lập trình từng quy tắc. Bài viết trình bày nguyên lý ba bước của học máy, bốn nhóm thuật toán, khác biệt với deep learning, các ứng dụng phổ biến và cách nhà máy dùng học máy cho bảo trì dự đoán và kiểm lỗi bằng camera.
1. Machine Learning là gì?
Học máy (machine learning) là một lĩnh vực trong trí tuệ nhân tạo AI và khoa học máy tính, nghiên cứu các kỹ thuật cho phép hệ thống "học" tự động từ dữ liệu để giải quyết bài toán cụ thể. Học máy dùng dữ liệu và thuật toán để mô phỏng cách con người rút kinh nghiệm, qua đó tăng độ chính xác theo thời gian.

Điểm khác với lập trình truyền thống nằm ở chiều đi của quy tắc. Lập trình truyền thống: người viết quy tắc, máy áp dụng lên dữ liệu để ra kết quả. Học máy: người đưa dữ liệu và kết quả mong muốn, máy tự tìm quy tắc (mô hình) rồi dùng mô hình đó cho dữ liệu mới. Mô hình được biểu diễn bằng các tham số số học, được điều chỉnh dần trong quá trình huấn luyện.
Ứng dụng quen thuộc của học máy gồm cảnh báo tắc đường trên bản đồ, nhận diện khuôn mặt trên mạng xã hội, lọc thư rác. Trong nhà máy, học máy dùng cho dự báo hỏng máy, kiểm lỗi sản phẩm bằng camera và tối ưu thông số vận hành.
2. Nguyên lý "tự học" của Machine Learning
Về tổng quan, học máy đi từ xác định bài toán, chuẩn bị dữ liệu, huấn luyện mô hình đến triển khai và cập nhật. Sau mỗi lần xử lý, mô hình được đánh giá và điều chỉnh, nên bộ dữ liệu và độ chính xác được mở rộng dần. Quy trình khép kín này gồm ba bước.
Bước 1. Tiền xử lý dữ liệu đầu vào
Dữ liệu thô được làm sạch: loại bản ghi thiếu, sai; chuẩn hóa đơn vị; gán nhãn nếu là học có giám sát; tách thành tập huấn luyện và tập kiểm tra. Với dữ liệu nhà máy, bước này gồm đồng bộ thời gian giữa cảm biến và PLC, lọc nhiễu tín hiệu rung và cắt ảnh về đúng vùng cần kiểm tra. Chất lượng dữ liệu ở bước này quyết định phần lớn chất lượng mô hình.

Bước 2. Huấn luyện mô hình bằng thuật toán
Dữ liệu đã xử lý được đưa vào thuật toán để tìm mô hình khớp nhất với bài toán. Thuật toán tạo ra nhiều phương án, so sánh dự đoán với kết quả thật trên tập kiểm tra và loại phương án sai nhiều. Kết quả là mô hình có sai số thấp nhất sau nhiều vòng thử, kèm số đo độ chính xác để quyết định có đủ tốt để triển khai hay chưa.

Bước 3. Triển khai và cải thiện liên tục
Mô hình được đưa vào chạy thật. Trong quá trình vận hành, hệ thống ghi nhận các trường hợp dự đoán sai hoặc dữ liệu mới chưa từng gặp, bổ sung vào bộ dữ liệu và huấn luyện lại theo chu kỳ. Sau nhiều vòng cập nhật, mô hình đạt độ chính xác ổn định với tốc độ xử lý nhanh hơn và ít sai sót hơn.

3. Phân loại Machine Learning
Học máy được chia theo cách mô hình nhận phản hồi từ dữ liệu.
| Nhóm | Dữ liệu đầu vào | Bài toán điển hình | Ví dụ trong nhà máy |
|---|---|---|---|
| Học có giám sát | Đã gán nhãn kết quả | Phân lớp, hồi quy | Phân loại sản phẩm đạt hoặc lỗi từ ảnh đã gán nhãn |
| Học không giám sát | Chưa gán nhãn | Gom cụm, phát hiện bất thường | Phát hiện rung bất thường của động cơ khi chưa có mẫu hỏng |
| Học bán giám sát | Ít dữ liệu gán nhãn, nhiều chưa gán | Phân lớp với chi phí gán nhãn thấp | Gán nhãn vài trăm ảnh lỗi, tận dụng hàng nghìn ảnh chưa gán |
| Học tăng cường | Phần thưởng từ môi trường | Điều khiển, tối ưu chuỗi quyết định | Tối ưu thông số máy ép, lịch nạp liệu |
3.1 Học máy có giám sát (Supervised Learning)
Dữ liệu huấn luyện gồm đầu vào và đáp án đúng do con người gán sẵn. Mô hình học cách ánh xạ đầu vào sang đáp án rồi áp dụng cho dữ liệu mới. Đây là kỹ thuật cho bài toán phân lớp (classification) và hồi quy (regression). Thuật toán thường dùng: máy vector hỗ trợ (SVM), cây quyết định (decision tree), mạng nơ-ron, hồi quy tuyến tính. Ví dụ quen thuộc là lọc thư rác; trong sản xuất là phân loại ảnh sản phẩm thành đạt hoặc lỗi.

3.2 Học máy không giám sát (Unsupervised Learning)
Dữ liệu không có đáp án sẵn; thuật toán tự tìm cấu trúc bên trong dữ liệu. Bài toán điển hình là gom cụm (clustering) và phát hiện bất thường (anomaly detection). Thuật toán thường dùng: k-means, phân cụm phân cấp (HAC), bản đồ tự tổ chức (SOM), DBSCAN. Trong thương mại, học không giám sát dùng để cá nhân hóa đề xuất theo lịch sử mua; trong nhà máy, nó dùng để phát hiện máy chạy khác thường khi chưa có mẫu hỏng để học.

3.3 Học bán giám sát (Semi-Supervised Learning)
Nằm giữa hai nhóm trên: một phần nhỏ dữ liệu được gán nhãn, phần lớn còn lại chưa gán. Mô hình học từ phần gán nhãn rồi mở rộng sang phần chưa gán. Cách này giảm chi phí gán nhãn, phù hợp với nhà máy nơi ảnh lỗi ít và tốn công đánh dấu. Thuật toán thường dùng: cực đại kỳ vọng (EM), SVM truyền dẫn (TSVM), self-training, co-training và phương pháp dựa trên đồ thị.
3.4 Học tăng cường (Reinforcement Learning)
Mô hình (tác tử) thử hành động trong môi trường và nhận phần thưởng hoặc phạt, từ đó học chuỗi quyết định cho tổng phần thưởng cao nhất. Ứng dụng gồm điều khiển robot, tối ưu thông số vận hành và lập lịch. Trong sản xuất, học tăng cường thường được thử nghiệm trên mô phỏng trước khi đưa ra máy thật.
4. So sánh Machine Learning và Deep Learning
Deep learning (học sâu) là một nhánh của machine learning dùng mạng nơ-ron nhiều lớp. Hai cách tiếp cận khác nhau ở dữ liệu, phần cứng và vai trò của người làm mô hình.
| Nội dung | Machine learning truyền thống | Deep learning |
|---|---|---|
| Khái niệm | Thuật toán học quy luật từ dữ liệu để phân loại, dự đoán | Nhánh của machine learning dùng mạng nơ-ron sâu (deep neural network) mô phỏng cách nơ-ron liên kết |
| Đặc trưng đầu vào | Người chọn và tính đặc trưng (feature) từ dữ liệu, ví dụ biên độ rung, nhiệt độ trung bình | Mô hình tự học đặc trưng từ dữ liệu thô như ảnh, âm thanh, chuỗi thời gian |
| Lượng dữ liệu huấn luyện | Nhỏ đến vừa | Lớn |
| Phần cứng | Chạy được trên CPU, kể cả máy tính công nghiệp tại máy | Cần GPU để huấn luyện; suy luận cần GPU hoặc bộ tăng tốc AI |
| Khả năng giải thích | Dễ giải thích vì sao ra kết quả | Khó giải thích, kiểm tra bằng thử nghiệm |
| Bài toán phù hợp | Dữ liệu bảng, dữ liệu cảm biến, dự báo | Ảnh, video, giọng nói, văn bản |
Trong nhà máy, hai nhóm bổ sung cho nhau: bảo trì dự đoán từ dữ liệu cảm biến thường dùng machine learning truyền thống; kiểm lỗi từ ảnh camera dùng deep learning.
5. Ứng dụng phổ biến của Machine Learning hiện nay
5.1 Nhận diện giọng nói
Có hai loại: nhận dạng lời nói (speech recognition) chuyển lời nói thành văn bản bằng xử lý ngôn ngữ tự nhiên (NLP), và nhận dạng giọng nói (voice recognition) xác định người nói. Ứng dụng gồm nhập liệu bằng giọng nói, điều khiển nhà thông minh và trợ lý ảo như Siri, Google Assistant, Alexa.
5.2 Dịch vụ khách hàng
Chatbot trả lời câu hỏi thường gặp, tư vấn sản phẩm và đề xuất kích thước phù hợp trên website, Slack, Messenger. Học máy giúp chatbot hiểu câu hỏi viết theo nhiều cách khác nhau.

5.3 Thị giác máy tính (Computer Vision)
Thị giác máy tính cho phép máy trích xuất thông tin từ ảnh và video rồi hành động. Kỹ thuật chính là mạng nơ-ron tích chập (CNN). Ứng dụng gồm gắn thẻ ảnh trên mạng xã hội, phân tích ảnh X-quang trong y tế, xe tự lái và kiểm lỗi sản phẩm trên dây chuyền.

5.4 Hệ thống đề xuất
Từ dữ liệu hành vi mua sắm trong quá khứ, thuật toán học máy phát hiện xu hướng và đề xuất sản phẩm phù hợp cho từng khách hàng. Nhà bán lẻ trực tuyến dùng cách này ở bước thanh toán và trang chủ.
5.5 Giao dịch chứng khoán tự động
Nền tảng giao dịch dùng học máy để phân tích dữ liệu thị trường và thực hiện lệnh mua bán theo quy tắc đã học, với số lượng lệnh lớn mà không cần thao tác tay. Học máy không bảo đảm chính xác cho mọi cơ hội đầu tư, nhưng giúp giảm rủi ro do quyết định cảm tính.

5.6 Phát hiện gian lận
Ngân hàng dùng mô hình học có giám sát, huấn luyện trên dữ liệu giao dịch gian lận đã biết, để phát hiện giao dịch bất thường cần điều tra.
5.7 Nông nghiệp
Máy bay không người lái bón phân theo vùng đã xác định, hệ thống theo dõi sức khỏe vật nuôi và quản lý quy trình canh tác bằng thiết bị số theo tiêu chuẩn quốc tế, giúp tối ưu sản xuất và cân bằng cung cầu.

6. Machine learning trong nhà máy: bảo trì dự đoán và kiểm lỗi thị giác
Hai bài toán được triển khai nhiều nhất tại nhà máy là bảo trì dự đoán và kiểm lỗi bằng camera. Cả hai đều cần dữ liệu thu tại máy và thiết bị tính toán đặt ngay tại xưởng.
| Bài toán | Dữ liệu đầu vào | Loại học máy | Thiết bị tại xưởng | Kết quả |
|---|---|---|---|---|
| Bảo trì dự đoán (predictive maintenance) | Rung, nhiệt độ, dòng điện, âm thanh của động cơ, bơm, trục chính | Phát hiện bất thường, hồi quy dự báo tuổi thọ còn lại | Máy tính công nghiệp không quạt gom dữ liệu cảm biến, chạy mô hình nhẹ trên CPU | Cảnh báo trước khi hỏng, lên lịch thay thế theo tình trạng |
| Kiểm lỗi thị giác (visual inspection) | Ảnh, video từ camera công nghiệp trên băng tải | Deep learning phân lớp, phát hiện đối tượng, phân đoạn | Máy tính GPU công nghiệp hoặc máy chủ AI tại xưởng | Phát hiện lỗi bề mặt, sai lắp ráp, đọc ký tự trong vài chục mili giây |
| Tối ưu thông số vận hành | Lịch sử thông số máy và chất lượng lô | Hồi quy, học tăng cường | Máy chủ phân tích tại nhà máy | Gợi ý thông số cho lô kế tiếp, giảm phế phẩm |
Với bảo trì dự đoán, khó khăn thường gặp là thiếu dữ liệu lúc máy hỏng vì máy hiếm khi hỏng. Học không giám sát giải quyết bằng cách học trạng thái bình thường rồi cảnh báo khi tín hiệu lệch khỏi đó. Với kiểm lỗi thị giác, mô hình được huấn luyện ở máy chủ trung tâm trên bộ ảnh đã gán nhãn, sau đó đưa xuống máy tính GPU tại chuyền để chạy suy luận; ảnh lỗi mới được gửi ngược lên để huấn luyện lại theo chu kỳ. Khối lượng dữ liệu cảm biến và ảnh tích lũy theo tháng là bài toán big data của nhà máy, cần nơi lưu và máy chủ phân tích riêng.
Chọn thiết bị cho machine learning tại nhà máy
Thiết bị cho học máy tại xưởng chia hai lớp: máy gom dữ liệu tại máy và máy chạy mô hình. Ba tiêu chí cần xem:
- Cổng thu dữ liệu: COM RS-232/485, DIO và mô-đun mở rộng để nối cảm biến, PLC; LAN có PoE cho camera.
- Thiết kế không quạt, dải nhiệt rộng, chịu rung: máy đặt cạnh động cơ hoặc trên băng tải phải làm việc ổn định trong bụi và rung liên tục.
- Khả năng gắn GPU với bài toán thị giác: card PCIe hoặc mô-đun MXM, đủ VRAM cho mô hình và số camera.
Cho lớp gom dữ liệu cảm biến, Advantech UNO-2271G là cổng biên (edge gateway) không quạt cỡ nhỏ dùng Intel Atom, có 2 cổng GbE, mở rộng RS-232/422/485 và DIO cách ly qua mô-đun iDoor, hỗ trợ giao thức fieldbus; phù hợp đặt trong tủ điện từng máy. Cho lớp chạy mô hình thị giác, Cincoze GM-1000 thuộc nhóm máy chủ công nghiệp dạng nhúng: CPU Intel Xeon hoặc Core thế hệ 9/8, một khe GPU MXM 3.1, làm việc ở -40 đến 70 °C với CPU 35 W, chịu rung 5G và sốc 50G, có mở rộng PoE cho camera; chi tiết về máy chủ chạy AI xem bài máy chủ AI là gì. Nếu chưa rõ vị trí lắp cần cấu hình nào, dùng công cụ chọn máy theo điều kiện lắp đặt để lọc theo nhiệt độ, rung, số cổng và nhu cầu GPU trước khi trao đổi với kỹ sư IPC247.
Câu hỏi thường gặp về machine learning
Machine learning là gì?
Machine learning (học máy) là nhánh của trí tuệ nhân tạo và khoa học máy tính, trong đó máy tính dùng thuật toán để tìm quy luật từ dữ liệu rồi áp dụng quy luật đó lên dữ liệu mới. Người lập trình không viết từng quy tắc; mô hình tự điều chỉnh tham số qua quá trình huấn luyện và cải thiện độ chính xác khi có thêm dữ liệu.
Machine learning khác deep learning ở điểm nào?
Deep learning là một nhánh của machine learning dùng mạng nơ-ron nhiều lớp. Machine learning truyền thống cần người chọn đặc trưng đầu vào và chạy được với dữ liệu nhỏ trên CPU; deep learning tự học đặc trưng từ dữ liệu thô như ảnh, âm thanh nhưng cần nhiều dữ liệu và GPU để huấn luyện.
Machine learning dùng trong nhà máy để làm gì?
Hai ứng dụng phổ biến là bảo trì dự đoán và kiểm lỗi bằng thị giác máy. Bảo trì dự đoán dùng dữ liệu rung, nhiệt, dòng điện của máy để dự báo hỏng hóc trước khi xảy ra. Kiểm lỗi thị giác dùng camera và mô hình học sâu để phát hiện lỗi bề mặt, sai lắp ráp trên từng sản phẩm theo nhịp băng tải.
Triển khai machine learning tại xưởng cần thiết bị gì?
Cần ba lớp: cảm biến và camera thu dữ liệu; máy tính công nghiệp không quạt tại máy để gom dữ liệu và chạy mô hình nhẹ; máy tính GPU công nghiệp hoặc máy chủ AI tại xưởng để chạy mô hình thị giác theo thời gian thực. Huấn luyện mô hình thường làm ở máy chủ trung tâm hoặc đám mây rồi đưa xuống xưởng.
Học có giám sát và học không giám sát khác nhau thế nào?
Học có giám sát dùng dữ liệu đã gán nhãn, ví dụ ảnh sản phẩm đã đánh dấu đạt hoặc lỗi, để học cách phân loại. Học không giám sát dùng dữ liệu chưa gán nhãn để tự gom cụm hoặc phát hiện điểm bất thường, phù hợp khi chưa có sẵn ví dụ lỗi.
