AI Agent 實戰 Bloss0m Note 078 Moonshot AI 於 2026 年 7 月開源旗艦級 2.8T MoE 模型 Kimi-K3 後,社群隨即展開了各種拓撲的推論實證。在常見的 H200、B300 等資料中心 GPU 方案外,AI 開發者 Ning 展示了一個極具話題性的成果:成功使用 80 張 NVIDIA GeForce RTX 5090 消費級顯示卡,將完整的 Kimi-K3 跑了起來。
這套系統完全沒有使用 HBM、NVLink 或 InfiniBand,而是僅靠 GDDR7 顯存與 25GbE 乙太網路。在第一天未做深度軟體調校的情況下,單一串流(Single Stream)推論速度即達到約 20 tokens/s。
這項實證展現了消費級 Blackwell GPU 在分散式推論領域的彈性,但也引發了一個關鍵工程疑問:消費級顯卡拼湊出的部署方案,真的代表低成本與大眾化嗎?
一、80 張 RTX 5090 實測硬體拓撲
該成功案例並非將 80 張顯示卡插在同一台主機上,而是透過 10 個硬體節點組成的分散式推論叢集:
| 項目 | 實測硬體配置 | 備註說明 |
|---|---|---|
| 目標模型 | Kimi-K3 完整版 | 總參數 2.8T,每 Token 啟用 104B |
| GPU 配置 | RTX 5090 × 80 | 單卡 32GB GDDR7 顯存 |
| 總顯存容量 | 2,560 GB (2.56 TB) | 提供模型與動態 Context 運作空間 |
| 叢集拓撲 | 10 台伺服器節點 | 每節點搭載 8 張 RTX 5090 |
| 節點間網路 | 25GbE Ethernet | 未使用 NVLink 與 InfiniBand |
| 實測推論速度 | ~20 tokens/s | 第一天初始部署、尚未進行 Topology 最佳化 |
Kimi-K3 官方下載權重由 96 個 safetensors 檔案組成,總容量約為 1.56TB。雖然在推論時每 Token 僅啟用約 104B 參數,但根據 vLLM 部署架構 與 SGLang 拓撲指南,所有的 2.8T 權重與動態 Runtime 空間都必須完整保留於顯存中。
80 張 RTX 5090 提供 2.56 TB 顯存,扣除 1.56TB 模型權重與 vLLM 最低顯存需求 (約 1.68TB) 後,依然保有足夠的 KV Cache 與系統餘裕。
二、為什麼是 80 張,而不是理論上的 44 張?
在工程討論中,常有人問:「如果只算模型權重,44 張 32GB 顯示卡不就能裝下了嗎?」
理論純數學計算 vs. 實際檔案大小
若以理想化的 4-bit (MXFP4) 量化下限估算:
然而,「數學上能塞進去」與「系統能跑起來」有顯著差距:
- 非全層 4-bit 量化:官方權重並非所有張量皆採用純 4-bit。注意力層 (Attention)、共享專家 (Shared Experts)、Dense 層與部分關鍵元件仍維持較高精度,使下載檔案實際達 1.56TB。
- Runtime 必要開銷:顯卡還必須預留空間給 CUDA runtime、CUDA Graph、MoE 通訊 Buffer、KDA Recurrent State、MLA KV Cache,以及圖片編碼的中間張量。
GPU 數量與執行能力對照
| RTX 5090 數量 | 總顯存容量 | 實際執行可行性與限制 |
|---|---|---|
| 44 張 | 1.408 TB | 連官方權重檔案都無法完整塞下 |
| 49 張 | 1.568 TB | 約等於權重檔案大小,完全無 Runtime 與推論空間 |
| 53 張 | 1.696 TB | 接近推論框架最低 VRAM 門檻,極度容易 OOM |
| 64 張 | 2.048 TB | 理論上具備研究價值,但拓撲與推論穩定度需巨量調校 |
| 80 張 | 2.560 TB | 已有實測成功案例,具備實務可用性與 Context 餘裕 |
三、80 張 RTX 5090 的落地總帳本 (以 2026 年台灣市場為例)
要部署這套系統,硬體開支絕非只有「顯卡單價 × 80」。
1. 顯卡採購成本
RTX 5090 在台灣上市時官方建議售價為 NT$71,990 起。然而截至 2026 年 7 月,市場現貨與各品牌報價大幅波動:
- 一般通路現貨價:約 NT$109,900 / 張 80 張約 NT$879 萬元
- 高階水冷與品牌報價:約 NT$159,990 ~ NT$179,990 / 張 80 張約 NT$1,280萬 ~ NT$1,440 萬元
2. 10 台八卡伺服器主機成本
普通消費級 CPU 與主機板無法提供足夠的 PCIe Lanes 讓 8 張 RTX 5090 同時發揮效能。必須使用搭載 AMD EPYC 或 Intel Xeon 處理器的伺服器平台,配置大容量 DDR5 ECC 記憶體、多顆 NVMe SSD、高功率電源與專用機箱。
扣除 GPU 後,單台八卡節點的伺服器基礎硬體成本約為 NT$37萬 至 NT$87萬元。十台節點合計約 NT$400萬 至 NT$700 萬元。
3. 25GbE 網路與基礎設施開支
雖然未採購昂貴的 InfiniBand,但 10 個節點跨機通訊仍需高規格 25GbE/100GbE 交換器、光纖與 DAC 線材,加上機櫃、PDU 與電力冷卻改造:
- 25GbE 網路與交換器:約 NT$50萬 ~ NT$150 萬元
- 機櫃、PDU 與佈線:約 NT$30萬 ~ NT$100 萬元
- 電力與冷卻初步改造:約 NT$50萬 ~ NT$200 萬元
硬體與建置總預算
| 項目 | 低估預算情境 | 台灣當前高價市場情境 |
|---|---|---|
| RTX 5090 × 80 | NT$879 萬元 | NT$1,280萬 ~ NT$1,440 萬元 |
| 10 台八卡節點其餘硬體 | NT$400 萬元 | NT$700 萬元 |
| 25GbE 網路系統 | NT$50 萬元 | NT$150 萬元 |
| 機櫃與 PDU 佈線 | NT$30 萬元 | NT$100 萬元 |
| 電力與冷卻改造 | NT$50 萬元 | NT$200 萬元 |
| 整體硬體總計 | 約 NT$1,409 萬元 | 約 NT$2,230萬 ~ NT$2,590 萬元 |
合理落地的專案預算應規劃在 NT$1,500萬 至 NT$2,300 萬元 之間。
四、電力需求與電費試算:住宅電力為何無法承載?
RTX 5090 官方單卡功耗 (TGP) 為 575W,80 張 GPU 本體功耗即高達:
加計 10 台伺服器的 CPU、ECC RAM、NVMe 儲存、風扇散熱與電源轉換損耗,整組系統的 IT 總功耗落在 51kW 至 56kW。
台灣一般住宅單相 220V/100A 的最大供電極限僅為:
這意味著住宅電力連 GPU 本體都無法帶動。部署此系統必須具備工業級三相電、高壓專供迴路與機房專用空調。
每月電費估算 (平均負載率 70%、PUE 1.4、每度電 NT$3.5 ~ NT$5.5)
- 月用電量:
- 每月電費:約 NT$13萬 至 NT$22 萬元(全天接近滿載時可達 NT$18萬 至 NT$31 萬元)。
五、80 張 RTX 5090 vs. 8 張 NVIDIA B300 比較
將 80 張消費級 GPU 與 1 台企業級 8× B300 伺服器進行對比:
| 評估維度 | 80 × RTX 5090 (消費級拼裝) | 8 × NVIDIA B300 (企業級單節點) |
|---|---|---|
| GPU 數量與節點數 | 80 張 GPU / 10 個節點 | 8 張 GPU / 1 個節點 |
| 總顯存與類型 | 2.56 TB GDDR7 | 約 2.30 TB HBM3e |
| 跨卡通訊 | 無 NVLink,依賴 25GbE 乙太網 | 具備高頻寬 NVLink / NVSwitch |
| 功耗與維運 | IT 功耗約 50kW+,10 台機器維運 | 整機功耗約 14.5kW,單機維運 |
| 已展示推論速度 | 約 20 tok/s (未最佳化) | 官方原生拓撲支援,高併發吞吐 |
| 採購與保固 | 消費通路散裝採購,無資料中心 RAS | OEM 企業詢價,具備完整企業保固 |
| 工程定位 | 高難度分散式推論驗證案例 | 正式生產環境標準拓撲 |
有關企業級 GPU 部署與伺服器 TCO 的詳細分析,可參考我們的專題文章:
- 了解資料中心級 Kimi-K3 部署成本:Kimi-K3 企業私有化部署成本全解析
- 企業 AI 代理人架構設計:AI Agent 完整架構指南
- 企業檢索系統設計:企業級 RAG 架構實務
六、不同規模的 RTX 5090 方案總表
| 方案 | 預估硬體成本 | 能否執行完整 Kimi-K3 | 實務定位與實用程度 |
|---|---|---|---|
| 1× RTX 5090 | NT$11萬 ~ NT$18萬 | 否 | 建議直接呼叫雲端 API |
| 4× RTX 5090 | NT$44萬 ~ NT$72萬 | 否 | 僅適合執行較小規模模型 |
| 53× RTX 5090 | 顯卡 NT$583萬 ~ NT$954萬 | 理論最低邊緣 | 尚無成功標準案例,極易 OOM |
| 64× RTX 5090 | 顯卡 NT$703萬 ~ NT$1,152萬 | 理論可研究 | 需大量調校並犧牲 Context 與 Concurrency |
| 80× RTX 5090 完整叢集 | 硬體總計 NT$1,500萬 ~ NT$2,300萬 | 是 (已有實測案例) | 約 20 tok/s 起步,具備研究與測試實用性 |
| 8× B300 企業伺服器 | 企業專案詢價 | 是 (官方推薦) | 正式生產環境標準配置 |
七、結論與啟示
80 張 RTX 5090 成功執行 Kimi-K3,證明了大型 MoE 模型不一定只能完全依賴昂貴的 HBM 與 InfiniBand。這展現了軟體工程與分散式通訊策略在消費級 Blackwell 平台上的巨大潛力。
然而從商業與營運角度來看,這套系統的真實結論是: 「只要擁有 80 張 RTX 5090、十台伺服器主機、50kW 專用電力與 25GbE 網路,加上一群願意把睡眠交給 NCCL 調校的工程師,消費級顯示卡也能創造奇蹟。」
對於一般的個人玩家與多數企業團隊而言,最便宜且速度最快體驗 Kimi-K3 的設備,依然是——你的瀏覽器。