MISA tự chủ hạ tầng trí tuệ nhân tạo với hệ thống máy chủ NVIDIA DGX H200
Chuyển từ API LLM bên thứ ba qua tự chủ hạ tầng trí tuệ nhân tạo, MISA đảm bảo an toàn tuyệt đối dữ liệu nhạy cảm của gần nửa triệu khách hàng.
- Công ty MISA đã chuyển đổi từ việc dùng API của bên thứ ba qua 8 hệ thống máy chủ nội bộ NVIDIA DGX H200 nhằm tự chủ các mô hình ngôn ngữ lớn (LLM).
- NVIDIA DGX H200 hỗ trợ hơn 50 AI agent, xử lý khoảng 2.5 triệu lượt tính năng và 1.1 triệu yêu cầu LLM mỗi ngày cho 450,000 doanh nghiệp.
- Giải pháp phần mềm NVIDIA AI Enterprise và kỹ thuật lượng tử hóa FP8 giúp tăng thông lượng xử lý từ 1200 lên 4500 TPS.
- Quá trình tự động hóa giúp giảm 4 lần thời gian tinh chỉnh mô hình và tiết kiệm trực tiếp 200,000 USD chi phí vận hành hàng tháng.
Nội dung bài viết
Tự chủ phần cứng và giải pháp tối ưu hóa
Công ty cổ phần MISA - đơn vị cung cấp phần mềm dạng dịch vụ (SaaS) lâu đời tại Việt Nam với lượng khách hàng hơn 450,000 tổ chức và 3.5 triệu người dùng cá nhân - vừa có bước chuyển dịch lớn về hạ tầng công nghệ. Không còn phụ thuộc vào các giao diện lập trình ứng dụng (API) của những mô hình ngôn ngữ lớn (LLM) nước ngoài, MISA quyết định xây dựng hệ thống máy chủ nội bộ. Hướng đi này nhằm tự chủ hoàn toàn các mô hình trí tuệ nhân tạo (AI) chuyên biệt như MISA AI 1.0 hay MISA AI 2.0. Xu thế "AI có chủ quyền" đang diễn ra trên toàn cầu, các quốc gia và tập đoàn lớn nỗ lực giữ quyền kiểm soát tuyệt đối đối với dữ liệu nhạy cảm của khách hàng, hạn chế tối đa độ trễ trong các luồng công việc phức tạp thuộc khu vực công và doanh nghiệp tư nhân.
Hệ thống hạ tầng của MISA được xây dựng dựa trên cụm 8 máy chủ NVIDIA DGX H200, cung cấp sức mạnh tính toán song song từ 64 GPU H200 và kết nối bằng mạng lượng tử InfiniBand. Kiến trúc Hopper trên dòng card H200 mang lại băng thông bộ nhớ lên đến 4.8 TB/s cùng dung lượng 141 GB HBM3e mỗi nhân GPU - nền tảng phần cứng mạnh mẽ nhất hiện nay để huấn luyện các mạng neural khổng lồ. Nhờ dàn máy chủ có cấu hình phần cứng cực mạnh, MISA có khả năng tự huấn luyện và tinh chỉnh các mô hình ngôn ngữ tiếng Việt với quy mô tham số từ 8 tỷ đến 235 tỷ. Bên cạnh đó, các tác vụ nhẹ hơn như định tuyến LLM hay định danh điện tử (eKYC) được chia sẻ cho hệ thống card đồ họa NVIDIA A40.
Về phần mềm, MISA khai thác bộ công cụ NVIDIA AI Enterprise để tối ưu hóa hiệu quả luồng công việc. Quá trình tinh chỉnh mô hình theo các thuật ngữ đặc thù của tiếng Việt và hành chính địa phương được giao cho nền tảng NVIDIA NeMo xử lý, trong khi giai đoạn triển khai thực tế dựa vào NVIDIA Dynamo và NVIDIA NIM. Áp dụng kỹ thuật lượng tử hóa dữ liệu ở định dạng FP8, hệ thống có mức tăng thông lượng xử lý từ 1200 truy vấn mỗi giây (TPS) lên mức 4500 TPS cho mỗi mô hình. Nền tảng quản lý NVIDIA Run:ai cũng được tích hợp để ảo hóa và phân mảnh tài nguyên GPU, cho phép chạy đồng thời 10 đến 20 thử nghiệm mỗi tuần - bước tiến lớn so với chỉ 1 hoặc 2 thử nghiệm đơn lẻ trước đây.
Hệ thống hiện đang duy trì hoạt động ổn định cho hơn 50 AI agent và xử lý khoảng 2.5 triệu lượt sử dụng tính năng mỗi ngày. Thời gian cần thiết để tinh chỉnh các mô hình đã được rút ngắn đi 4 lần, trực tiếp giúp MISA tiết kiệm ngân sách tới 200,000 USD mỗi tháng. Việc triển khai thành công hạ tầng có tính sẵn sàng cao ở quy mô lớn như vậy vừa giúp tối ưu hóa hệ thống máy chủ nội bộ, vừa đáp ứng được hơn 1.1 triệu yêu cầu LLM mỗi ngày từ người dùng cuối.
Tác động với hiệu quả doanh nghiệp
Trong ngành tài chính kế toán, hệ thống AI đảm nhận toàn bộ việc xác thực hóa đơn và nhập liệu, giúp xuất báo cáo trong vài phút thay vì ngốn tới 80% thời gian làm việc thủ công của các nhân viên kế toán như trước. Ở mảng nhân sự, quy trình sàng lọc hàng ngàn hồ sơ ứng viên được thực hiện hoàn toàn bằng máy móc, giảm 90% thời gian chờ đợi. Đối với các doanh nghiệp quy mô nhỏ như Noomfood, AI agent bán hàng giúp tăng tốc độ phản hồi khách hàng lên gấp 6 lần thông qua khả năng trực tổng đài 24/7, tóm tắt cuộc gọi và tự động đồng bộ hóa đơn hàng. Ngoài ra, quản trị cấp cao cũng có thể truy xuất dữ liệu kinh doanh đa chiều theo thời gian thực chỉ bằng các câu lệnh ngôn ngữ tự nhiên đơn giản.
Định hướng dài hạn của MISA là phát triển hệ sinh thái AI agent toàn diện, vừa phục vụ nội bộ vừa mở rộng cho các đối tác bên ngoài. Kho lưu trữ hiện tại cung cấp hơn 500 mẫu AI agent có thể tùy biến sâu cho từng ngành nghề đặc thù, từ bán lẻ, dịch vụ cho đến tư vấn khách hàng doanh nghiệp. Lộ trình tiếp theo sẽ không chỉ dừng lại ở văn bản mà còn mở rộng năng lực xử lý sang các định dạng hình ảnh, giọng nói và công nghệ 3D, với tham vọng tạo ra nền tảng AI bảo mật và hiệu quả cao ở cấp độ quốc gia.
Sức mạnh của 64 nhân GPU kiến trúc Hopper đi kèm chuẩn RAM HBM3e siêu tốc (dung lượng 141 GB và băng thông 4.8 TB/s mỗi card) chính là chìa khóa giải quyết bài toán nghẽn cổ chai khi huấn luyện các mô hình ngôn ngữ lớn nội bộ. Đây là case study rất đáng tham khảo cho thấy hạ tầng enterprise đang dần được nội địa hóa thay vì phụ thuộc hoàn toàn vào cloud quốc tế.
