"Tự chạy AI on-premise để dữ liệu không rời tổ chức" là hướng đi ngày càng được doanh nghiệp Việt cân nhắc. Nhưng trước khi mua phần cứng, câu hỏi đầu tiên phải là: tốn bao nhiêu? Bài này bóc tách ba khoản chi phí thật của việc tự vận hành một mô hình ngôn ngữ lớn (LLM): VRAM (mô hình cần bao nhiêu bộ nhớ GPU), tiền điện (GPU chạy 24/7 tốn bao nhiêu theo giá điện chính thức tại Việt Nam), và phần cứng (GPU hay máy Apple Silicon như Mac Studio) — rồi so sánh với chi phí gọi cloud API cùng một mô hình. Mọi con số đều dẫn nguồn công khai, tra cứu ngày 18/07/2026; phần Mac Studio / Mac mini cập nhật ngày 24/09/2026; cấu hình và giá các gói AI nội bộ cập nhật ngày 01/10/2026.
Tóm tắt nhanh
- VRAM cần bao nhiêu: ước tính nhanh bằng số tham số × số byte/tham số. Mô hình 70–73 tỷ tham số cần ~36 GB VRAM ở lượng tử hoá INT4, ~145 GB ở FP16 (chưa tính overhead).
- Tiền điện GPU: tính theo giá bán lẻ điện bình quân VN 2.204,0655 đ/kWh (chưa VAT, từ 10/5/2025 — Bộ Công Thương). Một GPU H100 (TDP 700W) chạy 24/7 tốn ~504 kWh ≈ 1,11 triệu đ/tháng tiền điện — chỉ riêng GPU.
- Phần cứng là khoản lớn nhất — vốn mua máy thường vượt xa tiền điện; đây là biến quyết định điểm hoà vốn. Giá GPU trung tâm dữ liệu biến động theo thị trường; còn Mac Studio có giá công khai: từ 111.150.000₫ (gói AI Box, M5 Max 64GB) đến 307.800.000₫ (gói AI Enterprise, M5 Ultra 256GB), đã gồm VAT.
- Điện của Mac Studio: theo Apple, mức tiêu thụ tối đa đo được của Mac Studio M5 Ultra là 385W cho cả máy. Apple chưa công bố số đo cho bản M5 Max 18 CPU/40 GPU mà gói AI Box và AI Pro dùng, nên bài lấy 385W làm trần cho cả ba gói — tức tối đa ~0,61 triệu đ/tháng nếu chạy liên tục ở mức tối đa.
- So với cloud API: cùng mô hình Qwen2.5-72B, giá cloud tham chiếu ~$0,475 vào / $0,495 ra mỗi 1 triệu token (Artificial Analysis). Ở khối lượng thấp–vừa, thuê API vẫn rẻ hơn tự chạy vì không tốn vốn phần cứng.
- Khi nào tự chạy đáng: khối lượng dùng cao & liên tục, hoặc khi bắt buộc giữ dữ liệu tại chỗ (tuân thủ, chủ quyền dữ liệu) — chứ không phải mặc định "tự chạy luôn rẻ hơn".
Số liệu chính (có nguồn)
- Giá bán lẻ điện bình quân VN: 2.204,0655 đ/kWh (chưa VAT), áp dụng từ 10/5/2025 — Bộ Công Thương / EVN.
- TDP GPU (chính hãng NVIDIA): RTX 4090 = 450W; A100 = 300W (PCIe)/400W (SXM); H100 = tối đa 700W (SXM).
- Số tham số (HuggingFace, model card): Qwen2.5-7B = 7,61 tỷ; Qwen2.5-32B = 32,5 tỷ; Llama 3.3 70B = 70,6 tỷ; Qwen2.5-72B = 72,7 tỷ.
- Giá cloud API cùng mô hình (Qwen2.5-72B, trung vị nhà cung cấp — Artificial Analysis): $0,475 đầu vào / $0,495 đầu ra mỗi 1 triệu token.
- Tỷ giá tham chiếu để quy đổi: ~26.440 đ/USD (Vietcombank bán ra, 17/07/2026).
- Công suất Mac Studio (Apple): tối đa đo được ~200W (M5 Max 18 CPU/32 GPU) và ~385W (M5 Ultra 36 CPU/80 GPU); định mức nguồn liên tục tối đa 480W. Mac mini: định mức nguồn liên tục tối đa 155W.
- Giá máy 3 gói AI nội bộ Namtech (cập nhật 01/10/2026; giá bán do Công ty Cổ phần Trạm Năng Lượng Số bán và xuất hoá đơn, đã gồm VAT): AI Box — M5 Max 64GB 111.150.000₫ · AI Pro — M5 Max 128GB 161.310.000₫ · AI Enterprise — M5 Ultra 256GB 307.800.000₫.
Mô hình cần bao nhiêu VRAM?
Một mô hình cần bộ nhớ GPU (VRAM) tối thiểu bằng số tham số nhân với số byte lưu mỗi tham số. Ở độ chính xác FP16/BF16, mỗi tham số chiếm 2 byte; lượng tử hoá xuống INT8 còn 1 byte, INT4 còn 0,5 byte. Vì vậy một mô hình 72,7 tỷ tham số (Qwen2.5-72B, theo model card HuggingFace) cần ~145 GB VRAM ở FP16, nhưng chỉ ~36 GB ở INT4 — đủ vừa một GPU 80 GB. Đây là lý do lượng tử hoá (quantization) gần như bắt buộc khi tự host.
Lưu ý quan trọng: con số trong bảng dưới là trọng số thô (weights only). Khi chạy thực tế, phải cộng thêm khoảng 20–30% cho KV-cache, activations và overhead của runtime — nên hãy xem đây là sàn tối thiểu, không phải mức cấu hình khuyến nghị. (GB ở đây tính theo tỷ byte để dễ đối chiếu dung lượng GPU.)
| Mô hình mở | Số tham số | VRAM FP16 (2 byte) | VRAM INT4 (0,5 byte) | GPU gợi ý (INT4, đã tính overhead) | Mac Studio tương ứng (ước lượng) |
|---|---|---|---|---|---|
| Qwen2.5-7B | 7,61 tỷ | ~15,2 GB | ~3,8 GB | 1× RTX 4090 (24 GB) — dư sức | AI Box (64GB) — dư sức |
| Qwen2.5-32B | 32,5 tỷ | ~65 GB | ~16,3 GB | 1× RTX 4090 (24 GB) vừa đủ | AI Box (64GB) — dư sức |
| Llama 3.3 70B | 70,6 tỷ | ~141 GB | ~35,3 GB | 1× A100/H100 80 GB, hoặc 2× RTX 4090 | AI Box (64GB) |
| Qwen2.5-72B | 72,7 tỷ | ~145 GB | ~36,4 GB | 1× A100/H100 80 GB, hoặc 2× RTX 4090 | AI Box (64GB) |
Bài học rút ra: chọn cỡ mô hình trước, GPU theo sau. Một mô hình 7–32 tỷ tham số lượng tử hoá có thể chạy trên một card tiêu dùng 24 GB; nhưng nhóm 70 tỷ trở lên đã cần GPU trung tâm dữ liệu 80 GB hoặc ghép nhiều card — bước nhảy chi phí rất lớn.
Máy Apple Silicon giải bài toán này theo cách khác: bộ nhớ hợp nhất — CPU và GPU dùng chung một khối RAM. macOS mặc định cho GPU dùng khoảng 75% bộ nhớ đó, nên theo ước lượng của Namtech, một Mac Studio 64GB (máy của gói AI Box) dành được ~48 GB cho mô hình — đủ nạp nhóm 70–72 tỷ tham số ở INT4 trong một máy, không phải ghép card. Đây là ước lượng từ dung lượng bộ nhớ, không phải số đo tốc độ.
Tiền điện: GPU chạy 24/7 tốn bao nhiêu?
Tiền điện một GPU chạy liên tục cả tháng tính bằng công thức TDP (kW) × 720 giờ × giá điện. Với giá bán lẻ điện bình quân tại Việt Nam là 2.204,0655 đ/kWh (chưa gồm VAT, áp dụng từ 10/5/2025 theo Bộ Công Thương), một GPU H100 công suất 700W chạy 24/7 tiêu thụ ~504 kWh và tốn khoảng 1,11 triệu đồng/tháng — và đó mới chỉ là điện của riêng GPU.
Chúng tôi dùng giá bình quân làm mốc minh bạch, dễ kiểm chứng. Trên thực tế, hoá đơn của doanh nghiệp còn phụ thuộc cấp điện áp và khung giờ (thấp/bình thường/cao điểm) theo biểu giá tại Quyết định 1279/QĐ-BCT, cộng VAT, và — quan trọng — điện tổng của cả máy chủ (CPU, RAM, quạt) và làm mát phòng máy thường gấp 1,5–2 lần điện GPU thuần. Nói cách khác, hãy nhân đôi các con số dưới đây để ước lượng hoá đơn thực tế.
| GPU | VRAM | TDP (công suất) | Điện/tháng (24/7) | Tiền điện/tháng* |
|---|---|---|---|---|
| NVIDIA RTX 4090 | 24 GB | 450W | 324 kWh | ~714.000 đ |
| NVIDIA A100 (PCIe) | 40/80 GB | 300W | 216 kWh | ~476.000 đ |
| NVIDIA A100 (SXM) | 80 GB | 400W | 288 kWh | ~635.000 đ |
| NVIDIA H100 (SXM) | 80 GB | 700W | 504 kWh | ~1.111.000 đ |
*Tiền điện của riêng GPU, theo giá điện bình quân chưa VAT. Hoá đơn thực tế cao hơn do có CPU/RAM/làm mát (thường ×1,5–2), VAT, và biểu giá theo cấp điện áp/khung giờ.
Mac Studio và Mac mini tốn bao nhiêu điện?
Cùng công thức, nhưng với máy Apple ta dùng số Apple công bố cho cả máy (CPU, GPU, bộ nhớ, SSD) chứ không chỉ riêng phần GPU như Bảng 2. Theo Apple, mức tiêu thụ tối đa đo được của Mac Studio khoảng 200W với bản M5 Max 18 CPU/32 GPU và 385W với bản M5 Ultra 36 CPU/80 GPU (Apple chưa công bố số đo cho các cấu hình khác); định mức nguồn liên tục tối đa của Mac Studio là 480W và của Mac mini là 155W (trang thông số Apple).
| Máy | Công suất dùng để tính | Điện/tháng (24/7) | Tiền điện/tháng* |
|---|---|---|---|
| Mac mini (M6 / M5 Pro) | 155W — định mức nguồn tối đa | 111,6 kWh | ~246.000 đ |
| Mac Studio M5 Max 18 CPU/32 GPU (tham chiếu, không thuộc gói nào) | ~200W — tối đa Apple đo được | 144 kWh | ~317.000 đ |
| Mac Studio M5 Max 18 CPU/40 GPU (gói AI Box 64GB, AI Pro 128GB) | 385W — trần giả định (Apple chưa công bố số đo cho bản này) | 277,2 kWh | ~611.000 đ |
| Mac Studio M5 Ultra (gói AI Enterprise 256GB) | ~385W — tối đa Apple đo được (bản 36 CPU/80 GPU) | 277,2 kWh | ~611.000 đ |
*Tính cho cả máy ở mức tối đa, giá điện bình quân chưa VAT — máy không phải lúc nào cũng chạy hết công suất, nên đây là mức trần. Apple đo mức 385W trên bản M5 Ultra 36 CPU/80 GPU; gói AI Enterprise dùng bản 30 CPU/64 GPU nên chúng tôi lấy 385W làm trần. Với bản M5 Max 18 CPU/40 GPU của gói AI Box và AI Pro, Apple chỉ công bố số đo cho bản 18 CPU/32 GPU, nên bài cũng lấy 385W làm trần thận trọng — mức thật có thể thấp hơn. Hoá đơn thực tế vẫn phụ thuộc VAT và biểu giá theo cấp điện áp/khung giờ.
So sánh cho công bằng: Bảng 2 là điện của riêng GPU, còn Bảng 2b là cả máy. Dù vậy, ngay ở trần 385W mà bài dùng cho các gói, cả một máy Mac Studio chỉ ngang tầm điện của riêng một GPU A100 và thấp hơn riêng RTX 4090 hay H100 trong Bảng 2. Và vì là máy để bàn (nhiệt độ hoạt động 10–35°C theo Apple) nên không bắt buộc phòng máy riêng như rack GPU.
Điểm bất ngờ với nhiều người: tiền điện GPU thường KHÔNG phải khoản lớn nhất. Một GPU trung tâm dữ liệu tốn 0,5–1,1 triệu đồng điện/tháng — đáng kể, nhưng nhỏ so với vốn mua chính chiếc GPU đó. Đó là lý do bài toán TCO không thể bỏ qua phần cứng.
Ba thành phần của TCO on-premise
Tổng chi phí sở hữu (TCO) khi tự chạy LLM gồm ba khoản, và khoản lớn nhất là vốn đầu tư phần cứng — thường vượt xa tiền điện và vận hành cộng lại. Bảng dưới xếp ba khoản theo mức độ và tính biến động, để doanh nghiệp biết đâu là biến cần chốt trước khi quyết.
| Thành phần | Gồm những gì | Mức độ & biến động |
|---|---|---|
| 1. Vốn phần cứng (CAPEX) | GPU, máy chủ, mạng, lưu trữ; khấu hao theo vòng đời | Lớn nhất — quyết định điểm hoà vốn. GPU trung tâm dữ liệu biến động mạnh theo thị trường, phải lấy báo giá thực tế; Mac Studio có giá công khai (xem Bảng 5). |
| 2. Tiền điện (OPEX) | Điện GPU + điện phần còn lại của máy + làm mát | Trung bình. Riêng GPU ~0,5–1,1 triệu đ/tháng/GPU; nhân ~1,5–2 cho tổng hệ thống. Mac Studio (các gói): tối đa ~0,61 triệu đ/tháng cho cả máy ở trần 385W (Bảng 2b). |
| 3. Vận hành (OPEX) | Nhân sự MLOps, cập nhật mô hình, giám sát, bảo trì, dự phòng | Ổn định nhưng dễ bị bỏ quên; với tổ chức nhỏ có thể là khoản "đắt" nhất vì thiếu người. |
Tự chạy so với thuê cloud API
Ở khối lượng dùng thấp đến vừa, thuê cloud API cùng một mô hình thường rẻ hơn tự chạy, vì bạn không phải bỏ vốn phần cứng. Lấy chính Qwen2.5-72B làm ví dụ: giá cloud tham chiếu (trung vị các nhà cung cấp, theo Artificial Analysis) là $0,475 cho 1 triệu token đầu vào và $0,495 cho 1 triệu token đầu ra. Quy đổi theo tỷ giá ~26.440 đ/USD (Vietcombank, 17/07/2026), ta có:
| Khối lượng/tháng | Chi phí cloud API | Điện tự chạy (GPU 80 GB, chưa gồm CAPEX) |
|---|---|---|
| 50M token vào + 50M ra | $48,5 ≈ 1,28 triệu đ | ~0,64–1,11 triệu đ (A100/H100) + vốn GPU |
| 200M token vào + 100M ra | $144,5 ≈ 3,82 triệu đ | ~0,64–1,11 triệu đ (A100/H100) + vốn GPU |
Đọc bảng cho đúng: tiền điện tự chạy gần như cố định theo giờ vận hành, còn chi phí cloud tăng theo lượng token. Vì thế cloud rẻ hơn khi dùng ít; đến một ngưỡng khối lượng đủ cao và liên tục, phần điện + khấu hao phần cứng của tự chạy mới rẻ hơn tính trên mỗi token. Nhưng con số quyết định là vốn phần cứng. Giá GPU trung tâm dữ liệu biến động mạnh nên bài này không gán giá; doanh nghiệp phải lấy báo giá thực tế rồi chia khấu hao.
Với Mac Studio thì có giá công khai để làm phép chia. Máy gói AI Box (Mac Studio M5 Max 64GB, đủ nạp Qwen2.5-72B ở INT4 theo ước lượng ở Bảng 1) giá 111.150.000₫ đã gồm VAT. Nếu giả định khấu hao 36 tháng, mỗi tháng ~3,09 triệu đ, cộng điện tối đa ~0,61 triệu đ (trần 385W, Bảng 2b) — tổng ~3,70 triệu đ/tháng, xấp xỉ chi phí API ở mức 200M token vào + 100M ra (3,82 triệu đ). Phép tính chỉ gồm phần cứng và điện, chưa gồm phí phần mềm, triển khai và vận hành. Đây chỉ là phép chia minh hoạ: bài chưa kiểm chứng một máy có xử lý kịp khối lượng đó hay không, vì tốc độ phụ thuộc mô hình, độ dài prompt và số người dùng đồng thời — cần đo trên tải thật trước khi kết luận.
Góc nhìn cho doanh nghiệp Việt
Với đa số doanh nghiệp Việt, lựa chọn hợp lý không phải "tất cả tự chạy" hay "tất cả cloud", mà là phân loại theo dữ liệu và khối lượng. Với phần tự chạy, Namtech triển khai trên Apple Silicon (Mac Studio), nối tiếp lộ trình tự xây AI nội bộ và chủ quyền dữ liệu AI. Lý do: bộ nhớ hợp nhất lớn trong một máy, giá công khai, điện thấp và đặt được ngay tại văn phòng.
Chọn cấu hình theo nhu cầu
| Gói | Máy | Giá phần cứng | Bộ nhớ cho mô hình* | Cỡ mô hình tối đa (4-bit)* | Điện tối đa | Phù hợp |
|---|---|---|---|---|---|---|
| AI Box | Mac Studio M5 Max 18CPU 40GPU 64GB 512GB | 111.150.000₫ | ~48 GB | ~76 tỷ tham số | ≤ 385W (trần giả định) | Nhóm nhỏ, một phòng ban |
| AI Pro | Mac Studio M5 Max 18CPU 40GPU 128GB 512GB | 161.310.000₫ | ~96 GB | ~153 tỷ tham số | ≤ 385W (trần giả định) | Nhiều phòng ban, chạy song song hai mô hình, RAG nâng cao, SSO |
| AI Enterprise | Mac Studio M5 Ultra 30CPU 64GPU 256GB 1TB | 307.800.000₫ | ~192 GB | ~307 tỷ tham số | ≤ ~385W | Toàn doanh nghiệp, mô hình lớn, RAG + tích hợp ERP |
*Ước lượng của Namtech để tư vấn chọn máy, không phải số đo benchmark: bộ nhớ dùng được ≈ RAM × 0,75 (phần macOS mặc định cho GPU dùng); mô hình lượng tử 4-bit ≈ 0,5 byte/tham số, chừa 20% cho ngữ cảnh. Giá chỉ gồm phần cứng; phí phần mềm và vận hành của từng gói xem ở trang gói dịch vụ. Công suất: 385W là mức tối đa Apple đo trên M5 Ultra; với hai gói M5 Max đây là trần giả định vì Apple chưa công bố số đo cho bản 18 CPU/40 GPU (xem Bảng 2b).
Phần mềm chạy mô hình là các công cụ phổ biến trên Mac: MLX, Ollama hoặc LM Studio; mô hình mở Namtech dùng là Qwen, Gemma (Apache 2.0) và GLM (MIT) — mô hình cụ thể của từng gói ở mục mô hình AI trên trang chủ; với mô hình khác, chọn cỡ theo Bảng 1 rồi đối chiếu cột "Cỡ mô hình tối đa" ở trên. Xem chi tiết từng máy tại trang Mac Studio, hoặc so sánh ba cấu hình cạnh nhau.
Nếu chỉ cần thử nghiệm hoặc dùng cá nhân, Mac mini rẻ hơn: bản M6 32GB giá 41.040.000₫ (ước lượng mô hình tới ~38 tỷ tham số) và bản M5 Pro 64GB giá 86.070.000₫ (~76 tỷ). Đổi lại, băng thông bộ nhớ thấp hơn (170 GB/s và 307 GB/s, so với 460–614 GB/s của M5 Max theo Apple) — mà băng thông là yếu tố chính quyết định tốc độ sinh chữ — nên sẽ chậm hơn Mac Studio cùng dung lượng. Đặt các máy cạnh nhau tại trang so sánh Mac.
Khi nào vẫn nên dùng GPU?
Mac Studio không thắng mọi bài toán. GPU NVIDIA vẫn là lựa chọn đúng khi:
- Nhiều người dùng đồng thời hoặc xử lý hàng loạt: GPU trung tâm dữ liệu cùng phần mềm phục vụ chuyên dụng (như vLLM) gom nhiều yêu cầu chạy cùng lúc hiệu quả hơn một máy để bàn.
- Prompt rất dài, RAG trên kho tài liệu lớn: bước đọc prompt phụ thuộc sức tính toán thô, nơi GPU mạnh hơn; lợi thế của Mac nằm ở dung lượng bộ nhớ lớn trong một máy, không phải tốc độ xử lý prompt dài.
- Huấn luyện / fine-tune mô hình, hoặc phần mềm chỉ chạy trên CUDA của NVIDIA.
- Đã có sẵn phòng máy, rack và đội vận hành GPU — khi đó chi phí biên để thêm GPU thấp hơn.
Nguyên tắc chọn không đổi, dù là GPU hay Mac:
- Bắt đầu bằng một máy, chọn theo cỡ mô hình: mô hình lượng tử hoá tới ~76 tỷ tham số (gồm nhóm 70–72 tỷ) → AI Box; cần chạy song song hai mô hình hoặc mô hình tới ~153 tỷ → AI Pro; mô hình lớn hơn hoặc cả doanh nghiệp → AI Enterprise (một máy M5 Ultra 256GB). Các mức này là ước lượng theo dung lượng bộ nhớ.
- Dữ liệu nhạy cảm → tự chạy; tác vụ thường → cân nhắc API: nếu bài toán bắt buộc giữ dữ liệu tại chỗ (tuân thủ Luật Bảo vệ dữ liệu cá nhân 91/2025/QH15, hợp đồng khách hàng), tự chạy là điều kiện — chi phí là cái giá của chủ quyền, không phải để tiết kiệm.
- Tính TCO bằng số thật của bạn: lấy khối lượng token thực tế + giá phần cứng thực tế + hoá đơn điện thực tế, rồi mới so cloud vs tự chạy. Đừng quyết dựa trên cảm tính "on-premise chắc rẻ hơn".
Tự chạy LLM on-premise không mặc định rẻ hơn cloud — nó rẻ hơn khi khối lượng dùng đủ lớn và liên tục, và luôn đáng khi dữ liệu buộc phải ở lại trong tổ chức.
Câu hỏi thường gặp
Làm sao ước tính nhanh VRAM một mô hình cần?
Lấy số tham số × số byte mỗi tham số: FP16 = 2 byte, INT8 = 1 byte, INT4 = 0,5 byte. Ví dụ mô hình 72,7 tỷ tham số cần ~145 GB ở FP16 và ~36 GB ở INT4 (trọng số thô). Khi chạy thực tế cộng thêm 20–30% cho KV-cache và activations.
Tiền điện chạy một GPU 24/7 ở Việt Nam là bao nhiêu?
Tính bằng TDP(kW) × 720 giờ × giá điện. Với giá bình quân 2.204,0655 đ/kWh (chưa VAT, từ 10/5/2025 theo Bộ Công Thương): RTX 4090 (450W) ~714.000 đ/tháng; A100 SXM (400W) ~635.000 đ; H100 SXM (700W) ~1,11 triệu đ — đây là điện của riêng GPU, hoá đơn thực tế cao hơn do làm mát, VAT và biểu giá theo cấp điện áp/khung giờ.
Mac Studio chạy 24/7 tốn bao nhiêu tiền điện?
Theo Apple, Mac Studio M5 Ultra tiêu thụ tối đa 385W cho cả máy; Apple chưa công bố số đo cho bản M5 Max 18 CPU/40 GPU của gói AI Box và AI Pro, nên bài lấy 385W làm trần cho cả ba gói. Với giá bình quân 2.204,0655 đ/kWh (chưa VAT), chạy liên tục ở mức 385W tốn khoảng 611.000 đ/tháng. Đây là mức trần; hoá đơn thực tế còn phụ thuộc VAT và biểu giá theo khung giờ.
Tự chạy on-premise có rẻ hơn thuê cloud API không?
Không mặc định. Ở khối lượng thấp–vừa, cloud API thường rẻ hơn vì không cần bỏ vốn phần cứng. Tự chạy rẻ hơn tính trên mỗi token chỉ khi khối lượng dùng cao và liên tục đủ để khấu hao GPU. Ngoài ra, tự chạy còn có giá trị không quy ra tiền: giữ dữ liệu tại chỗ.
Khoản chi phí lớn nhất khi tự chạy LLM là gì?
Thường là vốn đầu tư phần cứng — vượt xa tiền điện và vận hành. Giá GPU trung tâm dữ liệu biến động mạnh nên cần báo giá thực tế; Mac Studio có giá công khai: 111.150.000₫ (gói AI Box) đến 307.800.000₫ (gói AI Enterprise), đã gồm VAT. Chia khấu hao theo vòng đời để tính TCO chính xác.
Doanh nghiệp nhỏ nên bắt đầu thế nào?
Bắt đầu với một máy gói AI Box (Mac Studio M5 Max 64GB, 111.150.000₫ đã gồm VAT), chạy mô hình mở lượng tử hoá như Qwen3.6-35B-A3B hoặc Gemma 4 26B-A4B qua MLX, Ollama hoặc LM Studio (ước lượng tối đa ~76 tỷ tham số ở 4-bit). Dùng nó cho các tác vụ nội bộ, đo khối lượng token thực tế, rồi mới quyết nâng lên AI Pro, AI Enterprise hay chuyển một phần sang cloud dựa trên số liệu thật.
Khi nào nên chọn GPU thay vì Mac Studio?
Khi có nhiều người dùng đồng thời hoặc xử lý hàng loạt, khi prompt rất dài trên kho tài liệu lớn (bước đọc prompt cần sức tính toán thô, nơi GPU mạnh hơn), khi cần huấn luyện hay fine-tune, phần mềm chỉ chạy CUDA, hoặc khi đã có sẵn phòng máy và đội vận hành GPU. Mac Studio mạnh ở bộ nhớ lớn trong một máy, giá công khai và điện thấp.
Tính TCO AI on-premise cho đúng bài toán của bạn
Namtech giúp doanh nghiệp chọn cỡ mô hình, chọn gói Mac Studio (AI Box, AI Pro hoặc AI Enterprise) và ước tính TCO thực tế (bộ nhớ, điện, phần cứng, vận hành) — cùng phương án lai giữa on-premise và cloud để tối ưu chi phí lẫn chủ quyền dữ liệu.
Đặt lịch tư vấn miễn phíLưu ý: Bài viết tổng hợp từ nguồn công khai tại 18/07/2026; phần Mac Studio / Mac mini cập nhật 24/09/2026; cấu hình, giá và mô hình các gói cập nhật 01/10/2026. Số VRAM là ước tính theo công thức tham số × byte (trọng số thô, chưa gồm overhead 20–30%); cỡ mô hình chạy được trên Mac là ước lượng theo dung lượng bộ nhớ, không phải benchmark; tiền điện là kết quả tính toán từ công suất chính hãng (NVIDIA, Apple) và giá điện bình quân chính thức, chưa gồm VAT; giá máy Mac là giá bán do Trạm Năng Lượng Số bán và xuất hoá đơn, đã gồm VAT tại 24/09/2026 và thay đổi theo giá niêm yết của Apple; giá cloud API và tỷ giá có thể thay đổi. Thông tin tham khảo, không phải tư vấn kỹ thuật, đầu tư hay pháp lý.
- Bộ Công Thương — Điều chỉnh giá bán lẻ điện bình quân từ 10/5/2025 (2.204,0655 đ/kWh, QĐ 1279/QĐ-BCT)
- NVIDIA — GeForce RTX 4090 (Total Graphics Power 450W)
- NVIDIA — A100 Tensor Core GPU (Max TDP 300W PCIe / 400W SXM)
- NVIDIA — H100 Tensor Core GPU (Max TDP up to 700W SXM)
- Apple — Mac Studio power consumption and thermal output (M5 Max 18 CPU/32 GPU tối đa ~200W, M5 Ultra 36 CPU/80 GPU tối đa ~385W)
- Apple VN — Thông số Mac Studio (định mức nguồn liên tục tối đa 480W, băng thông bộ nhớ)
- Apple VN — Thông số Mac mini (định mức nguồn liên tục tối đa 155W)
- Apple VN — Giá niêm yết Mac Studio (cơ sở tính giá bán)
- HuggingFace — Qwen2.5-72B-Instruct (72,7 tỷ tham số)
- HuggingFace — Qwen2.5-32B-Instruct (32,5 tỷ tham số)
- HuggingFace — Qwen2.5-7B-Instruct (7,61 tỷ tham số)
- HuggingFace — Llama-3.3-70B-Instruct (70,6 tỷ tham số)
- Artificial Analysis — Qwen2.5-72B pricing ($0,475 vào / $0,495 ra mỗi 1M token)
- VTC News — Tỷ giá USD/VND 17/7/2026 (Vietcombank bán ra ~26.440 đ)