← 部落格

工程筆記

80 張 RTX 5090 真的跑起 Kimi-K3:消費級顯卡推論 2.8T MoE 的硬體帳本與工程代價

80 張 RTX 5090 真的跑起 Kimi-K3:消費級顯卡推論 2.8T MoE 的硬體帳本與工程代價 AI Agent 實戰 Bloss0m Note 078

Moonshot AI 於 2026 年 7 月開源旗艦級 2.8T MoE 模型 Kimi-K3 後,社群隨即展開了各種拓撲的推論實證。在常見的 H200、B300 等資料中心 GPU 方案外,AI 開發者 Ning 展示了一個極具話題性的成果:成功使用 80 張 NVIDIA GeForce RTX 5090 消費級顯示卡,將完整的 Kimi-K3 跑了起來

這套系統完全沒有使用 HBM、NVLink 或 InfiniBand,而是僅靠 GDDR7 顯存與 25GbE 乙太網路。在第一天未做深度軟體調校的情況下,單一串流(Single Stream)推論速度即達到約 20 tokens/s。

這項實證展現了消費級 Blackwell GPU 在分散式推論領域的彈性,但也引發了一個關鍵工程疑問:消費級顯卡拼湊出的部署方案,真的代表低成本與大眾化嗎?

一、80 張 RTX 5090 實測硬體拓撲

該成功案例並非將 80 張顯示卡插在同一台主機上,而是透過 10 個硬體節點組成的分散式推論叢集:

項目實測硬體配置備註說明
目標模型Kimi-K3 完整版總參數 2.8T,每 Token 啟用 104B
GPU 配置RTX 5090 × 80單卡 32GB GDDR7 顯存
總顯存容量2,560 GB (2.56 TB)提供模型與動態 Context 運作空間
叢集拓撲10 台伺服器節點每節點搭載 8 張 RTX 5090
節點間網路25GbE Ethernet未使用 NVLink 與 InfiniBand
實測推論速度~20 tokens/s第一天初始部署、尚未進行 Topology 最佳化

Kimi-K3 官方下載權重由 96 個 safetensors 檔案組成,總容量約為 1.56TB。雖然在推論時每 Token 僅啟用約 104B 參數,但根據 vLLM 部署架構SGLang 拓撲指南,所有的 2.8T 權重與動態 Runtime 空間都必須完整保留於顯存中。

80 張 RTX 5090 提供 2.56 TB 顯存,扣除 1.56TB 模型權重與 vLLM 最低顯存需求 (約 1.68TB) 後,依然保有足夠的 KV Cache 與系統餘裕。

二、為什麼是 80 張,而不是理論上的 44 張?

在工程討論中,常有人問:「如果只算模型權重,44 張 32GB 顯示卡不就能裝下了嗎?」

理論純數學計算 vs. 實際檔案大小

若以理想化的 4-bit (MXFP4) 量化下限估算:

2.8 Trillion Parameters×4 bits1.4 TB2.8 \text{ Trillion Parameters} \times 4 \text{ bits} \approx 1.4 \text{ TB}

1,400 GB÷32 GB43.7544 RTX 5090 GPUs1,400\ \mathrm{GB} \div 32\ \mathrm{GB} \approx 43.75 \rightarrow 44\ \mathrm{RTX\ 5090\ GPUs}

然而,「數學上能塞進去」與「系統能跑起來」有顯著差距:

  1. 非全層 4-bit 量化:官方權重並非所有張量皆採用純 4-bit。注意力層 (Attention)、共享專家 (Shared Experts)、Dense 層與部分關鍵元件仍維持較高精度,使下載檔案實際達 1.56TB
  2. Runtime 必要開銷:顯卡還必須預留空間給 CUDA runtime、CUDA Graph、MoE 通訊 Buffer、KDA Recurrent State、MLA KV Cache,以及圖片編碼的中間張量。

GPU 數量與執行能力對照

RTX 5090 數量總顯存容量實際執行可行性與限制
44 張1.408 TB連官方權重檔案都無法完整塞下
49 張1.568 TB約等於權重檔案大小,完全無 Runtime 與推論空間
53 張1.696 TB接近推論框架最低 VRAM 門檻,極度容易 OOM
64 張2.048 TB理論上具備研究價值,但拓撲與推論穩定度需巨量調校
80 張2.560 TB已有實測成功案例,具備實務可用性與 Context 餘裕

三、80 張 RTX 5090 的落地總帳本 (以 2026 年台灣市場為例)

要部署這套系統,硬體開支絕非只有「顯卡單價 × 80」。

1. 顯卡採購成本

RTX 5090 在台灣上市時官方建議售價為 NT$71,990 起。然而截至 2026 年 7 月,市場現貨與各品牌報價大幅波動:

  • 一般通路現貨價:約 NT$109,900 / 張 \rightarrow 80 張約 NT$879 萬元
  • 高階水冷與品牌報價:約 NT$159,990 ~ NT$179,990 / 張 \rightarrow 80 張約 NT$1,280萬 ~ NT$1,440 萬元

2. 10 台八卡伺服器主機成本

普通消費級 CPU 與主機板無法提供足夠的 PCIe Lanes 讓 8 張 RTX 5090 同時發揮效能。必須使用搭載 AMD EPYC 或 Intel Xeon 處理器的伺服器平台,配置大容量 DDR5 ECC 記憶體、多顆 NVMe SSD、高功率電源與專用機箱。

扣除 GPU 後,單台八卡節點的伺服器基礎硬體成本約為 NT$37萬 至 NT$87萬元。十台節點合計約 NT$400萬 至 NT$700 萬元

3. 25GbE 網路與基礎設施開支

雖然未採購昂貴的 InfiniBand,但 10 個節點跨機通訊仍需高規格 25GbE/100GbE 交換器、光纖與 DAC 線材,加上機櫃、PDU 與電力冷卻改造:

  • 25GbE 網路與交換器:約 NT$50萬 ~ NT$150 萬元
  • 機櫃、PDU 與佈線:約 NT$30萬 ~ NT$100 萬元
  • 電力與冷卻初步改造:約 NT$50萬 ~ NT$200 萬元

硬體與建置總預算

項目低估預算情境台灣當前高價市場情境
RTX 5090 × 80NT$879 萬元NT$1,280萬 ~ NT$1,440 萬元
10 台八卡節點其餘硬體NT$400 萬元NT$700 萬元
25GbE 網路系統NT$50 萬元NT$150 萬元
機櫃與 PDU 佈線NT$30 萬元NT$100 萬元
電力與冷卻改造NT$50 萬元NT$200 萬元
整體硬體總計約 NT$1,409 萬元約 NT$2,230萬 ~ NT$2,590 萬元

合理落地的專案預算應規劃在 NT$1,500萬 至 NT$2,300 萬元 之間。

四、電力需求與電費試算:住宅電力為何無法承載?

RTX 5090 官方單卡功耗 (TGP) 為 575W,80 張 GPU 本體功耗即高達:

575W×80=46,000W=46 kW575\text{W} \times 80 = 46,000\text{W} = 46\text{ kW}

加計 10 台伺服器的 CPU、ECC RAM、NVMe 儲存、風扇散熱與電源轉換損耗,整組系統的 IT 總功耗落在 51kW 至 56kW

台灣一般住宅單相 220V/100A 的最大供電極限僅為:

220V×100A=22 kW220\text{V} \times 100\text{A} = 22\text{ kW}

這意味著住宅電力連 GPU 本體都無法帶動。部署此系統必須具備工業級三相電、高壓專供迴路與機房專用空調。

每月電費估算 (平均負載率 70%、PUE 1.4、每度電 NT$3.5 ~ NT$5.5)

  • 月用電量51kW56kW×0.7×1.4×720hr35,98639,514 kWh51\text{kW} \sim 56\text{kW} \times 0.7 \times 1.4 \times 720\text{hr} \approx 35,986 \sim 39,514\text{ kWh}
  • 每月電費:約 NT$13萬 至 NT$22 萬元(全天接近滿載時可達 NT$18萬 至 NT$31 萬元)。

五、80 張 RTX 5090 vs. 8 張 NVIDIA B300 比較

將 80 張消費級 GPU 與 1 台企業級 8× B300 伺服器進行對比:

評估維度80 × RTX 5090 (消費級拼裝)8 × NVIDIA B300 (企業級單節點)
GPU 數量與節點數80 張 GPU / 10 個節點8 張 GPU / 1 個節點
總顯存與類型2.56 TB GDDR7約 2.30 TB HBM3e
跨卡通訊無 NVLink,依賴 25GbE 乙太網具備高頻寬 NVLink / NVSwitch
功耗與維運IT 功耗約 50kW+,10 台機器維運整機功耗約 14.5kW,單機維運
已展示推論速度約 20 tok/s (未最佳化)官方原生拓撲支援,高併發吞吐
採購與保固消費通路散裝採購,無資料中心 RASOEM 企業詢價,具備完整企業保固
工程定位高難度分散式推論驗證案例正式生產環境標準拓撲

有關企業級 GPU 部署與伺服器 TCO 的詳細分析,可參考我們的專題文章:

六、不同規模的 RTX 5090 方案總表

方案預估硬體成本能否執行完整 Kimi-K3實務定位與實用程度
1× RTX 5090NT$11萬 ~ NT$18萬建議直接呼叫雲端 API
4× RTX 5090NT$44萬 ~ NT$72萬僅適合執行較小規模模型
53× RTX 5090顯卡 NT$583萬 ~ NT$954萬理論最低邊緣尚無成功標準案例,極易 OOM
64× RTX 5090顯卡 NT$703萬 ~ NT$1,152萬理論可研究需大量調校並犧牲 Context 與 Concurrency
80× RTX 5090 完整叢集硬體總計 NT$1,500萬 ~ NT$2,300萬是 (已有實測案例)約 20 tok/s 起步,具備研究與測試實用性
8× B300 企業伺服器企業專案詢價是 (官方推薦)正式生產環境標準配置

七、結論與啟示

80 張 RTX 5090 成功執行 Kimi-K3,證明了大型 MoE 模型不一定只能完全依賴昂貴的 HBM 與 InfiniBand。這展現了軟體工程與分散式通訊策略在消費級 Blackwell 平台上的巨大潛力。

然而從商業與營運角度來看,這套系統的真實結論是: 「只要擁有 80 張 RTX 5090、十台伺服器主機、50kW 專用電力與 25GbE 網路,加上一群願意把睡眠交給 NCCL 調校的工程師,消費級顯示卡也能創造奇蹟。」

對於一般的個人玩家與多數企業團隊而言,最便宜且速度最快體驗 Kimi-K3 的設備,依然是——你的瀏覽器

歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。

演講與聯絡