Giải pháp dữ liệu và phân tích

Dữ liệu nằm ở một chỗ, câu hỏi kinh doanh trả lời được trong ngày

HiTechCloud dựng nền tảng thu thập, lưu trữ và truy vấn dữ liệu cho doanh nghiệp: dữ liệu thô đổ về một kho chung trên hạ tầng đặt tại Việt Nam, có đường nạp rõ ràng, có mô tả nguồn gốc, và có phân quyền tới từng nhóm dữ liệu.

Phạm vi
Kiến trúc · Đường nạp · Lưu trữ · Truy vấn
Vị trí dữ liệu
Trung tâm dữ liệu tại Việt Nam
Thành phần
Cloud Storage · Kafka · OpenSearch · DBaaS
Kiểm soát
Phân quyền theo nhóm dữ liệu, ghi nhật ký truy cập
Tổng quan

Doanh nghiệp hiếm khi thiếu dữ liệu, thứ thiếu là đường đi của dữ liệu

Trong phần lớn doanh nghiệp, dữ liệu đã có đủ: đơn hàng nằm trong hệ thống bán hàng, giao dịch nằm trong phần mềm kế toán, hành vi người dùng nằm trong nhật ký của website và ứng dụng, số liệu sản xuất nằm trong tệp bảng tính của từng bộ phận. Câu hỏi khó không phải là dữ liệu có hay không, mà là mất bao lâu để ghép chúng lại và trả lời một câu hỏi cụ thể.

Data Lake là cách trả lời: dữ liệu thô từ mọi nguồn được đổ về một kho lưu trữ chung, giữ nguyên dạng ban đầu, kèm mô tả nguồn gốc và thời điểm nạp. Từ kho đó, mỗi nhóm nghiệp vụ lấy ra phần mình cần theo cách của mình mà không phải xin dữ liệu từ nhau, và không phải chờ bộ phận công nghệ viết một báo cáo mới cho từng câu hỏi.

HiTechCloud dựng nền tảng này bằng các dịch vụ đang vận hành: Cloud Object StoragevStorage làm lớp lưu trữ, Kafka làm đường nạp dữ liệu theo dòng, OpenSearch cho tìm kiếm và phân tích nhật ký, PostgreSQL hoặc MySQL cho lớp dữ liệu đã chuẩn hoá, và AI Platform khi doanh nghiệp muốn đi tiếp sang huấn luyện mô hình. Toàn bộ đặt trên hạ tầng ở Việt Nam.

Vấn đề thường gặp

Vì sao báo cáo luôn tới muộn

Mỗi bộ phận một con số

Cùng một chỉ tiêu nhưng bán hàng, kế toán và vận hành ra ba con số khác nhau, vì mỗi bên lấy dữ liệu từ một nguồn và cắt theo một cách.

Báo cáo phải chờ người viết

Mỗi câu hỏi mới lại thành một yêu cầu gửi sang bộ phận công nghệ, xếp hàng chờ vài ngày tới vài tuần, và đến lúc có kết quả thì câu hỏi đã cũ.

Truy vấn nặng làm chậm hệ thống chạy thật

Báo cáo chạy thẳng trên cơ sở dữ liệu của hệ thống nghiệp vụ khiến chính hệ thống đó chậm lại đúng vào cuối kỳ.

Không ai biết dữ liệu từ đâu ra

Bảng tổng hợp được xây chồng lên nhau qua nhiều năm, người viết ban đầu đã nghỉ, và không còn tài liệu nào giải thích cách tính.

Phạm vi

Nền tảng dữ liệu gồm những lớp nào

Đường nạp dữ liệu

Nạp theo lô cho dữ liệu nghiệp vụ chạy hàng đêm và nạp theo dòng qua Kafka cho dữ liệu sinh liên tục như nhật ký ứng dụng hay tín hiệu thiết bị.

Kho lưu trữ dữ liệu thô

Cloud Object Storage làm lớp lưu trữ chính, chia vùng theo nguồn và theo ngày, có phân tầng để dữ liệu cũ chuyển sang mức chi phí thấp hơn.

Lớp dữ liệu đã chuẩn hoá

Dựng các bảng đã làm sạch và thống nhất định nghĩa trên DBaaS PostgreSQL hoặc MySQL, để mọi báo cáo cùng lấy từ một nguồn duy nhất.

Tìm kiếm và phân tích nhật ký

OpenSearch cho nhu cầu tìm kiếm toàn văn, phân tích nhật ký hệ thống và dựng bảng theo dõi theo thời gian gần thực.

Xử lý tính toán

Cụm máy chủ hoặc Kubernetes chạy các tác vụ biến đổi dữ liệu theo lịch, tách hẳn khỏi hệ thống nghiệp vụ để không tranh tài nguyên.

Phân quyền và nhật ký truy cập

Chia dữ liệu theo mức nhạy cảm, cấp quyền tới từng nhóm, ghi lại ai đã đọc vùng dữ liệu nào — điều kiện bắt buộc khi trong kho có dữ liệu cá nhân.

Bản thiết kế kiến trúc hệ thống
Nguyên tắc thiết kế

Bắt đầu từ câu hỏi, không bắt đầu từ công nghệ

Một nền tảng dữ liệu dựng theo danh sách công nghệ thời thượng thường kết thúc bằng một kho dữ liệu không ai dùng. Cách làm ngược lại là chọn trước vài câu hỏi kinh doanh cụ thể và dựng đủ hạ tầng để trả lời chúng.

  • Chọn ba tới năm câu hỏi mà lãnh đạo thật sự hỏi hàng tuần, viết ra bằng chữ.
  • Xác định đúng những nguồn dữ liệu cần cho các câu hỏi đó, tạm bỏ qua phần còn lại.
  • Dựng đường nạp và lớp lưu trữ cho các nguồn đó trước, có kết quả rồi mới mở rộng.
  • Mỗi chỉ tiêu có một định nghĩa duy nhất, ghi lại thành tài liệu trước khi lập trình.
Quy trình

Cách một nền tảng dữ liệu được dựng

  1. 01

    Khảo sát nguồn dữ liệu

    Liệt kê hệ thống đang có, dạng dữ liệu, khối lượng phát sinh mỗi ngày và cách lấy dữ liệu ra khỏi từng hệ thống.

  2. 02

    Thiết kế kiến trúc

    Chốt cách chia vùng lưu trữ, đường nạp theo lô hay theo dòng, lớp dữ liệu chuẩn hoá và chính sách phân quyền.

  3. 03

    Dựng nền tảng

    Triển khai lưu trữ, hàng đợi, cơ sở dữ liệu và cụm xử lý; dựng đường nạp cho nhóm nguồn đầu tiên.

  4. 04

    Đối chiếu số liệu

    So kết quả trên nền tảng mới với số liệu mà bộ phận nghiệp vụ đang dùng, cho tới khi hai bên khớp và giải thích được mọi chênh lệch.

  5. 05

    Mở rộng và bàn giao

    Nạp tiếp các nguồn còn lại theo đợt, bàn giao tài liệu kiến trúc và quy trình vận hành cho đội dữ liệu của doanh nghiệp.

Khách hàng

Giải pháp này phù hợp với ai

Doanh nghiệp bán lẻ và thương mại điện tử

  • Dữ liệu đơn hàng, kho và hành vi khách hàng nằm ở ba hệ thống khác nhau.
  • Cần biết kết quả một chương trình khuyến mại ngay trong tuần, không phải sau tháng.
  • Nhật ký website tăng nhanh, hệ thống báo cáo hiện tại không nạp nổi.

Doanh nghiệp sản xuất và vận hành thiết bị

  • Thiết bị và dây chuyền sinh dữ liệu liên tục nhưng chỉ được xem tại chỗ.
  • Dữ liệu sản xuất và dữ liệu kinh doanh chưa bao giờ ghép được với nhau.
  • Cần giữ lịch sử vận hành nhiều năm để so sánh theo mùa vụ.

Doanh nghiệp dịch vụ số và nền tảng

  • Có lượng nhật ký ứng dụng lớn cần tìm kiếm và phân tích nhanh.
  • Muốn tách hẳn tải phân tích khỏi cơ sở dữ liệu đang phục vụ người dùng.
  • Chuẩn bị bước sang huấn luyện mô hình và cần dữ liệu được tổ chức lại trước.
Hỏi đáp

Câu hỏi thường gặp

Data Lake khác gì kho dữ liệu tổng hợp mà doanh nghiệp đang có?

Kho dữ liệu tổng hợp truyền thống yêu cầu định nghĩa cấu trúc trước khi nạp, nên chỉ chứa những gì đã được nghĩ tới từ đầu. Data Lake giữ dữ liệu thô ở dạng ban đầu và để việc định nghĩa cấu trúc diễn ra lúc đọc. Trên thực tế phần lớn doanh nghiệp dùng cả hai: kho thô làm nền, và bên trên là lớp dữ liệu đã chuẩn hoá phục vụ báo cáo.

Cần bao nhiêu dung lượng để bắt đầu?

Con số này chỉ có nghĩa sau khi đo lượng dữ liệu phát sinh mỗi ngày từ các nguồn đã chọn. Cách làm thông thường là bắt đầu ở mức đủ cho vài tháng dữ liệu, vì lưu trữ dạng đối tượng mở rộng được mà không phải dừng hệ thống.

Dữ liệu có phải rời khỏi Việt Nam không?

Không. Toàn bộ lớp lưu trữ, xử lý và truy vấn nằm trên hạ tầng đặt tại trung tâm dữ liệu ở Việt Nam. Nếu doanh nghiệp muốn kết nối thêm công cụ phân tích đặt ở nước ngoài thì đó là quyết định riêng và cần được rà soát về mặt pháp lý trước.

Trong kho có dữ liệu cá nhân thì phải làm gì thêm?

Phải tách vùng lưu, thu hẹp quyền truy cập, ghi nhật ký đọc và đặt thời hạn lưu cho từng nhóm dữ liệu. Cần lưu ý dữ liệu theo dõi hành vi trên không gian mạng được xếp vào nhóm dữ liệu cá nhân nhạy cảm theo Nghị định 356/2025/NĐ-CP, nên nhật ký website và ứng dụng chịu ràng buộc chặt hơn dữ liệu thông thường. HiTechCloud cung cấp phần hạ tầng và công cụ kỹ thuật; phần xác định nghĩa vụ pháp lý cụ thể thuộc về doanh nghiệp và bộ phận pháp chế.

Doanh nghiệp chưa có đội dữ liệu thì triển khai được không?

Được, nhưng nên bắt đầu hẹp. HiTechCloud dựng nền tảng và đường nạp cho nhóm nguồn đầu tiên, kèm tài liệu vận hành, để một hoặc hai người trong bộ phận công nghệ tiếp quản được. Việc mở rộng sang nhiều nguồn hơn chỉ nên làm khi doanh nghiệp đã có người chịu trách nhiệm thường trực cho dữ liệu.

Chi phí tính thế nào?

Tách làm hai phần: tài nguyên hạ tầng tính theo tháng theo dung lượng lưu trữ và mức tính toán thực dùng, và công thiết kế cùng công dựng đường nạp tính theo phạm vi. Báo giá lập sau bước khảo sát nguồn dữ liệu. Giá chưa bao gồm VAT.

Bắt đầu từ ba câu hỏi kinh doanh

Liên hệ để đội ngũ HiTechCloud cùng doanh nghiệp chọn vài câu hỏi cụ thể, rà lại các nguồn dữ liệu cần có và đề xuất kiến trúc đủ để trả lời chúng.