Mark Ku's Blog
Podcast 對話本文 AI 對話朗讀版

本節目由 AI 撰稿並以合成語音播出,主持人為虛擬角色。

開場白

本期聲量冠軍是 Ternary-Bonsai-2-27B-gguf,官方標榜筆電就能跑 27B、檔案不到 8GB,一週下載 40.5 萬次。同集還有手機級 MiniCPM5-2B,跟 Mac mini 24GB 能跑 35B 的 LoRA:Edge0-35B-A3B-preview。三顆模型各自的硬體門檻跟隱藏但書,等一下一次講給你聽。

本期精選

1. Ternary-Bonsai-2-27B-gguf:把 27B 塞進不到 8GB 的三元量化版

  • 這是什麼:這是 prism-ml 針對 Qwen3.8-27B 系列做的三元(ternary)量化 GGUF 版本,27B 參數、Apache-2.0 授權,主打把原本 53.8GB 的 F16 版本大幅瘦身。官方 model card 自述是「5.9 GB language model (down from 54 GB FP16)」。
  • 能用在哪些場景
    • 接案工程師手上有客戶的機敏合約或內部文件,不能丟雲端 API,這時候用一台有獨顯的筆電離線跑 27B 級模型做摘要與問答,官方 model card 把用途明講為「privacy-sensitive and offline settings」與「laptop-local 27B agents」。
    • 團隊只有一張消費級顯卡,卻想自架內部問答服務。PQ2_0 檔案只有 7.21GB,官方定位是「single-GPU and commodity-GPU serving」,不用為了跑 27B 去租 A100。
    • 用 Mac 開發的工程師想要一個支援 thinking/reasoning 模式的本機 coding 助手,官方吞吐表列出 Apple M5 Pro 解碼 28.1 tok/s、M5 Max 47.0 tok/s(皆為 PQ2_0),屬於還能互動的速度區間。
  • 跑得動嗎:官方 model card 列出三個檔案:PTQ1_0(dense trits)5.95GB、PQ2_0(2-bit slots)7.21GB,對照 F16 參考版 53.8GB,另有選配的 vision tower(Q8_0)0.63GB。吞吐部分 card 還列出 RTX 5090 129.9 tok/s、H100 SXM 113.9 tok/s(同樣是 PQ2_0 解碼)。要注意的是官方沒有標示最低 RAM/VRAM 下限,這塊沒有數字就不好幫忙猜。
  • 本期聲量:HF 熱度 881(40.56 萬次下載、926 個讚),同家族目前另有 2 個量化/重打包版本。
  • 跟同類比:作者自己的對照表把它放進同一個 Qwen3.8-27B 量化家族比較:14 項 benchmark 平均 84.78,贏過傳統 IQ2_XXS 的 72.59,只小輸給體積大三倍的 UD-Q4_K_XL(85.18),card 的說法是「far above the conventional IQ2_XXS build at less than two-thirds of its footprint」。不過第三方 MindStudio 的試用心得提到,它在視覺與創意任務表現不錯,但修 bug 跟基本 UI 程式碼生成不太穩定,成績看任務而定。
  • 怎麼取得:README 給的指令是 hf download prism-ml/Ternary-Bonsai-2-27B-gguf Ternary-Bonsai-2-27B-PQ2_0.gguf --local-dir .,再用 llama-cli -m ... -ngl 99 -fa on -c 32768 啟動,或用 ollama run hf.co/prism-ml/Ternary-Bonsai-2-27B-gguf:F16。但重要前提是 README 明寫「Stock llama.cpp will not run these files」,要跑起來得先換成 PrismML 自己的 llama.cpp fork,這個坑要先知道再動手裝。
  • 連結huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf

2. MiniCPM5-2B:小到能塞進手機的地端 agent 底座

  • 這是什麼:OpenBMB 出的 2B 參數模型,Apache-2.0 授權,官方同時備好 GGUF/MLX/GPTQ/LiteRT 四種格式,明確瞄準裝置端與資源受限場景。
  • 能用在哪些場景
    • App 開發者想在 Android/iOS 端內建離線助理,不想每個使用者都燒 API 費用。官方直接提供 .litertlm 版本,model card 標示 LiteRT-LM 支援「Android / iOS / desktop / IoT, CPU + GPU」。
    • 想自架一個常駐 agent 幫忙整理 log 或呼叫內部 API。官方把用途寫成「local assistants, coding agents, tool-use workflows」,並標示 BFCL v4 工具呼叫得分 66.6。
    • 需要在單機上處理長文件(法規、會議逐字稿)但沒有顯卡預算。官方標示原生 131,072 token 長上下文,可用 GPTQ 4bit 版在低階硬體上跑。
  • 跑得動嗎:官方沒有標示具體 RAM/VRAM 門檻,model card 也沒有任何 tokens/s 數據。有標示的是格式選項:官方量化倉庫包含 MiniCPM5-2B-GGUF(llama.cpp/Ollama/LM Studio)、MiniCPM5-2B-MLX(Apple Silicon)、MiniCPM5-2B-GPTQ(4bit),card 對硬體的描述僅止於定位語「on-device, local deployment, and resource-constrained scenarios」。這裡只能從 2B 參數量跟四種格式反推它應該跑得動輕量裝置,實際多快官方沒給,這段算推估不算保證。
  • 本期聲量:HF 熱度 338(35.72 萬次下載、1.6 千個讚),同家族目前另有 2 個量化/重打包版本。
  • 跟同類比:OpenBMB 官方的比較表主張它 34 項平均 53.9,贏過 LFM2.5-2.6B(33.2)、Qwen3.5-2B(28.0)、Gemma-4-E2B-it(24.6),甚至壓過 4B 級的 Qwen3.5-4B(51.1),card 的措辭是「remains competitive with 4B-class models overall」。第三方評測站 eesel AI 與 buildfastwithai 則提醒這是 OpenBMB 自選比較集內的成績,benchmark 領先不等於生產環境可靠,建議拿自己的任務先試。
  • 怎麼取得:README 的 transformers 範例是 AutoModelForCausalLM.from_pretrained("openbmb/MiniCPM5-2B", torch_dtype="auto", device_map="auto"),要開服務則官方給 vllm serve openbmb/MiniCPM5-2B --port 8000,走 llama.cpp 則是 llama-server -m MiniCPM5-2B-F16.gguf -a MiniCPM5-2B --port 8080
  • 連結huggingface.co/openbmb/MiniCPM5-2B

3. Edge0-35B-A3B-preview:拿 LoRA adapter 在 Mac mini 上跑 35B

  • 這是什麼:Edge0 團隊發的 LoRA/adapter 版本,基底是 35B 的 MoE 模型 Qwen3.6-35B-A3B,用 int4 量化搭配 LoRA 與 prerouter adapter,Apache-2.0 授權,官方明講後端是 MLX、目前鎖定 Apple Silicon。
  • 能用在哪些場景
    • 用 Apple Silicon 開發的工程師想在本機跑 35B 級模型做多語問答。官方標示峰值活躍記憶體只要 2.9 GiB,並列出 Mac mini M4 Pro(24GB)解碼 14.9 至 17.7 tok/s 的實測表。
    • 想同時服務多種任務又不想每次都重新量化。card 把用途寫成「batch serving via LoRA adapters without re-quantization」,適合要掛多組 adapter 的自架服務。
    • VRAM 吃緊但硬碟夠大的邊緣部署情境。card 的定位語是「edge / on-device inference where GPU VRAM is scarce and storage is fast」,官方標示模型總容量 19.6GB。
  • 跑得動嗎:官方標示得相當完整:峰值活躍記憶體 2.9 GiB(短上下文)、總儲存 19.6GB,採 4-bit(int4)搭配 LoRA 與 prerouter adapter,後端是 MLX,card 直接寫「currently targets Apple Silicon」,並警告「Long contexts grow the KV cache; use shorter contexts to keep peak memory at 3 GiB」。速度方面官方列出 Mac mini M4 Pro 24GB 解碼 14.9 至 17.7 tok/s、prefill 冷/熱啟動 113/140 tok/s。
  • 本期聲量:HF 熱度 250(5.25 萬次下載、3.4 千個讚)。
  • 跟同類比:值得點出的是作者只跟自己的 fp16 基底 Qwen3.6-35B-A3B 比,沒有跟其他邊緣推論方案對照:官方表格顯示 int4 版平均 79.2 分,對上 fp16 的 83.2 分,作者自述平均退化 3.9 分。另外 card 自己標明這是「early preview release」,且直言 agent 能力「currently weak」,不適合長程自主任務,這個限制是作者本人寫的,介紹時得一起帶到。
  • 怎麼取得:README 要求先裝官方框架 pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]',再 huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir ./Edge0-35b-a3b-preview,然後 edge0 chat --name edge0-35b 對話,或 edge0 serve --port 8085 開 OpenAI 相容 API;card 另有提供 mlx_lm 的 load("Edge0/Edge0-35B-A3B-preview") 走法。
  • 連結huggingface.co/Edge0/Edge0-35B-A3B-preview

結尾段落

這三顆選題有個共同點,都在想辦法把大模型塞進小記憶體:Ternary-Bonsai 靠三元量化把 27B 壓到 8GB 內,MiniCPM5-2B 直接瞄準手機格式,Edge0 則是拿 LoRA 在 Mac mini 上推 35B。如果你手上剛好有一台有獨顯的筆電、又要處理不能上雲的文件,Ternary-Bonsai-2-27B-gguf 大概是本期最值得先點進 model card 把門檻看清楚的一個。下週三再來看看又有哪些地端模型冒出頭。

作者

Mark Ku

擁有 10+ 年經驗的資深軟體工程師,現為 AI 應用 Builder,專注於大型平台架構與簡化複雜系統設計,從電商系統到訂閱與收費平台,結合 AI Agent、AI 整合與自動化開發,打造高效率且可持續演進的產品技術基礎。閱讀更多

覺得這篇有幫助?

作者做的免費工具、每日 Podcast 與電子報,都在這裡。

Mark Ku · 本文採用 CC BY 4.0 授權,轉載請註明作者並附上原文連結。

留言

訂閱電子報

訂閱後即時收到新文章通知,不錯過任何技術分享。

提交即表示同意接收電子報,隨時可

熱門文章

View all
Mark Ku
··665

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案
Mark Ku
··568

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南
Mark Ku
··330

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略
Mark Ku
··241

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調
Mark Ku
··235

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1
Mark Ku
··223

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取
🧪 27B 壓到 8GB:Ternary-Bonsai-2-27B 下載 40 萬次|地端 AI 實驗室 - Mark Ku's Blog