Bỏ qua tới nội dung
Gọi kỹ thuật
  1. Trang chủ
  2. Kiến thức

Big Data là gì? Khái niệm, đặc điểm và ứng dụng Big Data

IPC · đăng 27/04/2023 · cập nhật 03/09/2026 · 14 phút đọc

Big Data là gì? Big Data (dữ liệu lớn) là các tập dữ liệu có khối lượng lớn, sinh ra nhanh và nhiều định dạng đến mức công cụ quản trị cơ sở dữ liệu truyền thống không lưu trữ, xử lý kịp. Trong nhà máy, Big Data đến từ PLC, cảm biến IoT, camera, hệ thống MES và ERP; khai thác đúng cách, dữ liệu này cho biết máy nào sắp hỏng, lô nào có nguy cơ lỗi và ca nào tiêu tốn năng lượng bất thường. Bài viết trình bày khái niệm, đặc trưng 3V đến 7V, lịch sử, ứng dụng của Big Data trong sản xuất, khó khăn khi triển khai, công nghệ xử lý và thiết bị cần có.

1. Big Data là gì?

Big Data là các tập dữ liệu có khối lượng lớn và phức tạp, không thể quản trị, xử lý theo cách truyền thống vì dung lượng, tốc độ phát sinh và độ đa dạng của chúng vượt quá khả năng của một máy chủ cơ sở dữ liệu thông thường.

Big Data không chỉ là một kho dữ liệu. Thuật ngữ này còn bao hàm cách phân loại, cấu trúc và tổ chức thông tin dựa trên mối tương quan, để chuyển dữ liệu thô thành lời giải cho những bài toán không giải được bằng sức người: tìm quy luật hỏng máy trong hàng triệu mẫu đo, phát hiện lỗi ẩn trong hàng nghìn ảnh sản phẩm mỗi giờ.

Khối lượng chính xác không phải điểm mấu chốt; có thể là vài terabyte hoặc vài petabyte. Điểm mấu chốt là nếu khai thác đúng hướng, Big Data là một phần không thể thiếu của công nghiệp 4.0 và chuyển đổi số doanh nghiệp, tạo lợi thế cạnh tranh về chi phí, chất lượng và thời gian giao hàng.

Big Data là gì - dữ liệu lớn từ nhiều nguồn được gom về lưu trữ và phân tích
Big Data là gì?

2. Ba đặc trưng chính của Big Data – 3V

Ba đặc trưng 3V của Big Data - Volume khối lượng, Velocity tốc độ, Variety đa dạng
Ba đặc trưng chính của Big Data

2.1 Dung lượng – Volume

Khối lượng dữ liệu là đặc trưng đầu tiên. Big Data thường là dữ liệu phi cấu trúc, mật độ giá trị thấp, thu từ nhiều nguồn: nhật ký nhấp chuột trên web, dữ liệu cảm biến, ảnh camera. Trong nhà máy, một dây chuyền vài trăm điểm đo ghi mỗi giây đã tạo ra hàng chục triệu bản ghi mỗi ngày; thêm ảnh kiểm tra chất lượng, dung lượng lên tới terabyte mỗi tháng.

2.2 Tốc độ xử lý – Velocity

Velocity chỉ tốc độ dữ liệu được sinh ra, nhận về và xử lý. Với dữ liệu tốc độ cao, luồng thường được xử lý ngay trong bộ nhớ thay vì ghi xuống đĩa rồi mới đọc lại. Nhiều thiết bị thông minh nối mạng cần phân tích và ra quyết định theo thời gian thực hoặc gần thời gian thực: dừng máy khi rung vượt ngưỡng, loại sản phẩm lỗi ngay trên băng tải.

Velocity - tốc độ sinh và xử lý dữ liệu lớn theo thời gian thực
Tốc độ xử lý

2.3 Tính đa dạng – Variety

Variety chỉ nhiều loại dữ liệu cùng tồn tại. Trong cơ sở dữ liệu quan hệ, dữ liệu có cấu trúc bảng rõ ràng. Big Data bổ sung dữ liệu bán cấu trúc và phi cấu trúc: văn bản, log máy, âm thanh, ảnh, video, cần tiền xử lý để gán ý nghĩa và tạo siêu dữ liệu trước khi phân tích. Trong nhà máy, dữ liệu gồm chuỗi thời gian từ PLC, sự kiện cảnh báo, ảnh kiểm tra, phiếu bảo trì viết tay và đơn hàng từ ERP.

2.4 Mở rộng thành 5V và 7V

Ba V gốc được bổ sung theo thời gian để nhấn mạnh chất lượng dữ liệu và mục đích phân tích. Bảng dưới liệt kê 7V kèm ý nghĩa trong dữ liệu sản xuất.

VNghĩaTrong dữ liệu nhà máy
VolumeKhối lượngHàng triệu bản ghi cảm biến, ảnh mỗi ngày
VelocityTốc độChu kỳ đọc PLC mili giây, cảnh báo phải ra trong vài giây
VarietyĐa dạngChuỗi thời gian, sự kiện, ảnh, tài liệu, giao dịch ERP
VeracityĐộ tin cậyCảm biến trôi, mất gói, nhập tay sai, đồng hồ máy lệch giờ
ValueGiá trịGiảm dừng máy, giảm phế phẩm, giảm điện năng đo được bằng tiền
VariabilityBiến thiênCùng cảm biến, ý nghĩa thay đổi theo mã hàng, theo ca, theo mùa
VisualizationTrực quan hoáBảng OEE, biểu đồ xu hướng trên màn hình xưởng, báo cáo cho quản lý

3. Lịch sử phát triển của Big Data

Thuật ngữ Big Data còn khá mới, nhưng các tập dữ liệu lớn có từ thập niên 1960–1970 với những trung tâm dữ liệu đầu tiên và sự ra đời của cơ sở dữ liệu quan hệ. Khoảng năm 2005, lượng dữ liệu người dùng tạo ra trên các dịch vụ trực tuyến tăng vọt; Hadoop ra đời cùng thời điểm để lưu trữ và xử lý phân tán trên phần cứng phổ thông, và các cơ sở dữ liệu NoSQL bắt đầu phổ biến.

Các khung mã nguồn mở, đặc biệt là Spark, đẩy Big Data đi xa hơn vì giúp làm việc với dữ liệu lớn dễ hơn và giảm chi phí lưu trữ. Sự xuất hiện của Internet vạn vật (IoT) đưa thêm hàng tỷ thiết bị lên mạng để thu dữ liệu về cách sử dụng và hiệu suất sản phẩm; máy học (machine learning) vừa tiêu thụ vừa tạo ra thêm dữ liệu, và cung cấp công cụ tự động để thu thập, phân tích, tích hợp dữ liệu.

Điện toán đám mây mở rộng khả năng của Big Data nhờ co giãn tài nguyên theo nhu cầu: chỉ cần tạo cụm máy tạm thời để thử một phần dữ liệu. Cơ sở dữ liệu đồ thị và cơ sở dữ liệu chuỗi thời gian (time-series database) trở nên quan trọng với dữ liệu cảm biến. Bước gần nhất là điện toán biên (edge computing): xử lý ngay tại xưởng để giảm băng thông và trễ, chỉ gửi kết quả và dữ liệu đã lọc lên máy chủ hoặc đám mây.

4. Ứng dụng của Big Data trong sản xuất

Big Data và phân tích dữ liệu áp dụng được cho nhiều ngành. Với nhà máy, giá trị nằm ở chỗ dữ liệu vốn đã có sẵn trong PLC, SCADA, MES và camera nhưng chưa được gom lại và phân tích. Các ứng dụng dưới đây là những bài toán có kết quả đo được bằng tiền.

4.1 Bảo trì dự đoán

Dữ liệu rung, nhiệt độ, dòng điện, áp suất từ động cơ, bơm, trục chính được ghi liên tục và so với mẫu vận hành bình thường. Mô hình thống kê hoặc máy học phát hiện xu hướng xấu đi trước khi hỏng, lập lịch thay thế vào giờ dừng kế hoạch thay cho bảo trì định kỳ cố định. Kết quả: giảm dừng máy ngoài kế hoạch và giảm chi phí thay linh kiện còn tốt.

4.2 Kiểm soát chất lượng và truy xuất nguồn gốc

Mỗi sản phẩm gắn với bộ tham số quá trình lúc sản xuất: nhiệt độ khuôn, lực ép, tốc độ, lô nguyên liệu, ca, máy. Khi có lỗi ở khách hàng, nhà máy truy ngược được lô, máy và điều kiện gây lỗi trong vài phút. Phân tích tương quan giữa tham số và tỷ lệ lỗi cho biết cửa sổ vận hành tốt nhất để đưa vào tiêu chuẩn; ảnh kiểm tra từ camera được dùng để huấn luyện mô hình thị giác máy phát hiện lỗi tự động.

4.3 Tính OEE và tìm nguyên nhân dừng máy

Trạng thái chạy, dừng, số sản phẩm đạt và lỗi được đọc trực tiếp từ PLC thay vì ghi tay cuối ca. Hệ thống MES tính OEE theo máy, theo ca, theo mã hàng gần như tức thời; dữ liệu lịch sử cho phép xếp hạng nguyên nhân dừng máy theo tổng thời gian mất và tập trung cải tiến vào nguyên nhân lớn nhất.

4.4 Quản lý năng lượng

Đồng hồ điện, nước, khí nén ở từng khu vực đọc theo phút và ghép với dữ liệu sản lượng cho ra suất tiêu hao trên mỗi sản phẩm. Phân tích phát hiện máy chạy không tải, rò khí nén, điều hoà chạy ngoài giờ và đề xuất lịch chạy tránh giờ cao điểm.

4.5 Chuỗi cung ứng và tồn kho

Dữ liệu đơn hàng, tiến độ sản xuất, tồn kho và thời gian giao của nhà cung cấp gộp lại để dự báo nhu cầu vật tư, đặt điểm đặt hàng lại theo dữ liệu thực và cảnh báo sớm khi một nhà cung cấp có xu hướng giao trễ. Với sản xuất kéo, dữ liệu tiêu thụ thực ở từng công đoạn là đầu vào để điều chỉnh số thẻ Kanban.

4.6 Ứng dụng Big Data ở các ngành khác

  • Ngân hàng: phát hiện giao dịch gian lận bằng máy học, dự báo lượng tiền mặt cần tại từng chi nhánh, chọn vị trí mở chi nhánh mới theo phân cụm khách hàng.
  • Y tế: theo dõi bệnh nhân qua hồ sơ điện tử và thiết bị đeo, dự báo nhu cầu nhân sự theo thời điểm, cảnh báo sớm khu vực có nguy cơ bùng dịch.
  • Thương mại điện tử và bán lẻ: phân tích hành vi mua để đề xuất sản phẩm, tối ưu trưng bày, dự báo cung cầu để tránh hàng tồn không bán được.
  • Tiếp thị số: phân khúc khách hàng theo nhân khẩu học và sở thích, đo hiệu quả từng chiến dịch và tạo tập đối tượng tương tự.
  • Giáo dục: theo dõi tiến trình học tập trên hệ thống quản lý học tập, đánh giá hiệu quả giảng dạy; thách thức là gộp dữ liệu từ nhiều nguồn và bảo mật thông tin người học.
  • Lọc nội dung: tiện ích chặn quảng cáo và lọc nội dung dùng dữ liệu thu từ nhiều người dùng để nhận diện phần tử cần chặn, dữ liệu càng nhiều nhận diện càng chính xác.

5. Khó khăn khi làm việc với Big Data

5.1 Thách thức kỹ thuật

Thách thức lớn nhất là khối lượng dữ liệu tăng nhanh, gây áp lực lên lưu trữ và băng thông. Thời gian chuẩn bị dữ liệu chiếm phần lớn công sức của đội phân tích: làm sạch, đồng bộ thời gian, gán nhãn. Trong nhà máy còn thêm rào cản giữa mạng vận hành (OT) và mạng công nghệ thông tin (IT): PLC nhiều hãng, giao thức khác nhau, đồng hồ máy lệch giờ và không được phép làm chậm chu kỳ điều khiển khi đọc dữ liệu. Chất lượng dữ liệu không bảo đảm sẽ cho kết quả phân tích sai.

5.2 Chi phí và con người

Đầu tư Big Data không nhỏ: hạ tầng lưu trữ, phần mềm, và quan trọng hơn là người biết đặt câu hỏi đúng và đọc kết quả. Nhiều doanh nghiệp đầu tư hệ thống nhưng chỉ một phần nhân sự thực sự dùng được dữ liệu, gây lãng phí. Cách làm ít rủi ro là bắt đầu từ một bài toán cụ thể có giá trị đo được, như OEE của một chuyền hoặc bảo trì dự đoán cho nhóm máy hay hỏng, rồi mở rộng.

5.3 Quyền riêng tư và phụ thuộc vào dữ liệu

Việc thu thập dữ liệu người dùng bị phê phán khi xâm phạm quyền riêng tư và ở nhiều quốc gia có thể vi phạm pháp luật; dữ liệu về người lao động trong nhà máy cũng cần quy định rõ mục đích sử dụng. Một số nhà nghiên cứu còn cảnh báo việc quản lý quá phụ thuộc vào mẫu thống kê từ Big Data mà bỏ qua hiểu biết nghiệp vụ, dẫn tới quyết định sai khi dữ liệu thiên lệch.

6. Công nghệ ứng dụng cho Big Data

Có nhiều công nghệ để lưu trữ và xử lý Big Data, tiêu biểu là Apache Hadoop, Apache Spark, Apache Kafka. Bảng dưới đặt các công nghệ này vào bốn tầng của một hệ thống dữ liệu nhà máy.

TầngNhiệm vụCông nghệ, giao thứcThiết bị
Thu thậpĐọc PLC, cảm biến, đồng hồ, cameraModbus, OPC UA, MQTT, ProfinetCổng gom dữ liệu, máy tính nhúng trong tủ điện
BiênLọc, nén, tính toán thời gian thực, suy luận AIKafka, cơ sở dữ liệu chuỗi thời gian, mô hình AI đã huấn luyệnMáy tính biên, máy chủ biên tại xưởng
Lưu trữ và xử lýLưu dài hạn, xử lý theo lô, huấn luyện mô hìnhHadoop HDFS, Spark, kho dữ liệu SQL/NoSQLMáy chủ công nghiệp dạng rack, máy chủ AI có GPU
Trình bàyBảng điều khiển, báo cáo, cảnh báoMES, SCADA, công cụ BI, webTrạm vận hành, màn hình xưởng, thiết bị di động
Công nghệ Big Data - Apache Hadoop, Spark, Kafka xử lý dữ liệu lớn phân tán
Công nghệ Big Data

6.1 Apache Hadoop

Hadoop là khung mã nguồn mở viết bằng Java, cho phép xử lý phân tán (distributed processing) các tập dữ liệu lớn trên cụm máy tính (cluster) bằng mô hình lập trình đơn giản. Hadoop được thiết kế để mở rộng từ một máy chủ đến hàng nghìn máy, mỗi máy có tính toán và lưu trữ cục bộ, nên chịu được hỏng hóc phần cứng riêng lẻ.

6.2 Apache Spark

Spark là công cụ tính toán đa dụng cho xử lý quy mô lớn, giữ dữ liệu trung gian trong bộ nhớ thay vì ghi xuống đĩa như MapReduce, nên nhanh hơn nhiều với các bài toán lặp như huấn luyện mô hình. Spark có thư viện cho SQL, xử lý luồng, máy học và đồ thị.

6.3 Apache Kafka

Kafka là hệ thống truyền thông điệp phân tán, thông lượng cao, thường dùng cùng Hadoop và Spark. Trong nhà máy, Kafka nhận luồng sự kiện từ hàng nghìn điểm đo, giữ theo thứ tự thời gian và phân phối cho nhiều ứng dụng tiêu thụ: cảnh báo, ghi lịch sử, tính OEE.

6.4 Tầng biên và máy chủ trong nhà máy

Khác với dữ liệu web, dữ liệu nhà máy sinh ra ở nơi không có phòng máy: tủ điện, chuyền, kho lạnh. Vì vậy tầng thu thập và tầng biên phải chạy trên máy tính công nghiệp không quạt, đọc trực tiếp giao thức PLC và hoạt động khi mất kết nối với máy chủ. Máy chủ lưu trữ và máy chủ AI huấn luyện mô hình đặt tại phòng máy hoặc thuê trên đám mây; mô hình sau khi huấn luyện được đưa ngược về máy tính biên để suy luận tại chỗ.

Các tổ chức đã bắt đầu xem sáng kiến Big Data là cách quản lý dữ liệu tốt hơn: trực quan hoá, hiểu rõ dữ liệu khi cần và tìm cơ hội cải tiến từ chính dữ liệu vận hành của mình.

Chọn thiết bị cho hệ thống Big Data trong nhà máy

Ba tiêu chí khi chọn phần cứng cho dữ liệu sản xuất: tầng thu thập cần cổng RS-485 và LAN để đọc PLC, đồng hồ điện bằng Modbus, OPC UA và chạy không quạt trong tủ điện; tầng biên cần CPU đủ để chạy cơ sở dữ liệu chuỗi thời gian và suy luận AI, có lưu trữ SSD công nghiệp để ghi liên tục; tầng máy chủ cần khay ổ cứng tháo nóng, RAID và nguồn dự phòng vì đây là nơi lưu lịch sử nhiều năm.

Cho tầng thu thập, Advantech UNO-2271G là cổng gom dữ liệu kích thước nhỏ, 2 cổng LAN, tuỳ chọn 2 cổng RS-232/422/485 và mô-đun iDoor cho giao thức fieldbus, lắp gọn trong tủ điện hiện có. Cho tầng biên, dòng máy chủ công nghiệp Advantech EIS như EIS-D150 cấu hình sẵn Core i5 dòng U, RAM 4 GB, SSD 64 GB, kèm gói phần mềm WISE-PaaS và WebAccess/SCADA để tiền xử lý dữ liệu ngay tại xưởng và giám sát động cơ, robot theo thời gian thực. Cho tầng lưu trữ, máy chủ công nghiệp HPC-7442 dạng rack 4U có 4 khay ổ SAS/SATA tháo nóng (mở rộng tới 8 khay), hỗ trợ nguồn dự phòng 1+1, bo máy chủ với CPU Xeon E3 và RAM ECC, có mô-đun quản lý từ xa. Để rà nhanh theo điều kiện lắp đặt thực tế, dùng công cụ chọn máy theo điều kiện lắp đặt.

Câu hỏi thường gặp về Big Data

Big Data là gì?

Big Data (dữ liệu lớn) là các tập dữ liệu có khối lượng lớn, sinh ra nhanh và nhiều định dạng đến mức công cụ quản trị cơ sở dữ liệu truyền thống không lưu trữ, xử lý kịp. Giá trị của Big Data không nằm ở dung lượng mà ở khả năng phân tích để ra quyết định, ví dụ dự đoán hỏng máy từ dữ liệu rung và nhiệt độ.

7V của Big Data là gì?

7V gồm Volume (khối lượng), Velocity (tốc độ), Variety (đa dạng), Veracity (độ tin cậy), Value (giá trị), Variability (biến thiên) và Visualization (trực quan hoá). Ba V đầu là định nghĩa gốc; bốn V sau được bổ sung để nhấn mạnh chất lượng dữ liệu, mục đích phân tích và cách trình bày kết quả.

Big Data khác dữ liệu thông thường ở điểm nào?

Dữ liệu thông thường có cấu trúc bảng, dung lượng vừa, lưu trong một máy chủ cơ sở dữ liệu và truy vấn bằng SQL. Big Data gồm cả dữ liệu phi cấu trúc như ảnh, video, log máy, sinh ra liên tục, phải lưu phân tán trên nhiều máy và xử lý song song bằng Hadoop, Spark hoặc nền tảng đám mây.

Big Data ứng dụng trong nhà máy như thế nào?

Nhà máy dùng Big Data cho bảo trì dự đoán từ dữ liệu rung, nhiệt, dòng điện; kiểm soát chất lượng và truy xuất nguồn gốc theo từng sản phẩm; tính OEE và tìm nguyên nhân dừng máy; tối ưu tiêu thụ năng lượng; dự báo nhu cầu vật tư. Dữ liệu được gom từ PLC, cảm biến IoT và MES rồi xử lý một phần ở máy tính biên, phần còn lại ở máy chủ.

Nhà máy cần thiết bị gì để triển khai Big Data?

Ba lớp thiết bị: cổng gom dữ liệu tại tủ điện đọc PLC và cảm biến; máy tính biên hoặc máy chủ biên đặt tại xưởng để lọc, nén và phân tích thời gian thực; máy chủ công nghiệp dạng rack tại phòng máy để lưu trữ dài hạn và huấn luyện mô hình. Tất cả nên là thiết bị công nghiệp chạy 24/7, có SSD công nghiệp và nguồn dự phòng.

Bài liên quan

Công cụ chọn máy · maytinhcongnghiep.com

Cần máy tính công nghiệp cho ứng dụng trong bài? Trả lời 4 câu về điều kiện lắp đặt.

Nhiệt độ, rung, bụi, nguồn điện — hệ thống gợi ý cấu hình từ hơn 2.700 mã máy trong kho dữ liệu maytinhcongnghiep.com của IPC247.