Overview

Tổng quan
Data Pipeline là luồng xử lý dữ liệu gồm ba thành phần chính:
Sources → Transformations → Destinations
- Sources (Nguồn dữ liệu): Nơi dữ liệu được thu thập và đưa vào pipeline.
- Transformations (Chuyển đổi dữ liệu): Bước xử lý dữ liệu trước khi chuyển đến đích.
- Destinations (Đích dữ liệu): Nơi tiếp nhận dữ liệu sau khi hoàn tất quá trình xử lý.
Vai trò của từng thành phần
1. Sources
Sources là điểm bắt đầu của Data Pipeline, chịu trách nhiệm kết nối và thu thập dữ liệu từ hệ thống nguồn. Nguồn dữ liệu có thể là một dịch vụ, ứng dụng hoặc nền tảng bên ngoài như Kafka và SentinelOne.
Vai trò chính của Sources:
- Khởi tạo kết nối từ các Connector template có sẵn trên hệ thống. Mỗi template cung cấp các trường cấu hình và phương thức xác thực phù hợp với từng loại nguồn dữ liệu.
- Thu thập dữ liệu theo hai cơ chế:
- Push: Hệ thống nguồn chủ động gửi dữ liệu đến CMC SecOps thông qua endpoint hoặc Sensor được cấu hình.
- Pull: CMC SecOps chủ động kết nối và lấy dữ liệu từ hệ thống nguồn, chẳng hạn đọc dữ liệu từ Kafka hoặc gọi API định kỳ.
- Xác định loại và định dạng dữ liệu đầu vào để pipeline xử lý đúng cách.
- Chuyển dữ liệu đã thu thập sang bước Transformation.
Sources chỉ chịu trách nhiệm đưa dữ liệu vào pipeline; việc biến đổi dữ liệu được thực hiện tại Transformation.
2. Transformations
Transformations là thành phần trung gian giữa Sources và Destinations. Thành phần này xác định dữ liệu sẽ được xử lý trước khi chuyển đến đích hay được giữ nguyên như khi thu thập.
Transformation hỗ trợ hai kiểu xử lý:
2.1. Processors
Processors là tập hợp nhiều Processor được sắp xếp thành một chuỗi xử lý. Dữ liệu đầu ra của Processor trước sẽ trở thành dữ liệu đầu vào của Processor tiếp theo.
Vai trò chính của Processors:
- Phân tích và trích xuất thông tin từ dữ liệu thô.
- Chuyển đổi cấu trúc hoặc định dạng dữ liệu.
- Chuẩn hóa tên trường và giá trị theo schema của hệ thống.
- Bổ sung, cập nhật hoặc loại bỏ các trường dữ liệu khi cần thiết.
- Lọc hoặc định tuyến dữ liệu theo điều kiện cấu hình.
- Chuẩn bị dữ liệu phù hợp với yêu cầu của Destinations.
Thứ tự của các Processor có ý nghĩa quan trọng vì kết quả của mỗi bước có thể được sử dụng bởi các bước xử lý tiếp theo.
2.2. Passthrough
Passthrough cho phép dữ liệu đi qua Transformation mà không áp dụng Processor.
Vai trò chính của Passthrough:
- Giữ nguyên nội dung và cấu trúc dữ liệu nhận được từ Sources.
- Chuyển dữ liệu trực tiếp đến Destinations.
- Giảm các bước xử lý không cần thiết khi dữ liệu nguồn đã đáp ứng yêu cầu đầu ra.
- Phù hợp với trường hợp cần lưu trữ hoặc chuyển tiếp dữ liệu thô.
3. Destinations
Destinations là điểm cuối của Data Pipeline, chịu trách nhiệm tiếp nhận dữ liệu sau bước Transformation.
Vai trò chính của Destinations:
- Khởi tạo đích dữ liệu từ các Connector template có sẵn trên hệ thống. Mỗi template cung cấp các trường cấu hình và phương thức xác thực phù hợp với từng loại hệ thống đích.
- Thiết lập kết nối đến hệ thống đích bằng địa chỉ, thông tin xác thực và các tham số cấu hình tương ứng.
- Nhận dữ liệu đã qua chuỗi Processors hoặc dữ liệu nguyên bản từ Passthrough.
- Ghi và lưu trữ dữ liệu vào hệ thống đích đã được cấu hình.
- Đảm bảo dữ liệu được chuyển đến đúng nơi phục vụ nhu cầu tìm kiếm, phân tích hoặc lưu trữ.
- Tách biệt nơi thu thập dữ liệu với nơi dữ liệu được sử dụng, giúp pipeline linh hoạt hơn khi thay đổi nguồn hoặc đích.
Tóm lại, Sources đưa dữ liệu vào pipeline, Transformation quyết định cách dữ liệu được xử lý, còn Destinations tiếp nhận kết quả cuối cùng.