<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0"
     xmlns:atom="http://www.w3.org/2005/Atom"
     xmlns:content="http://purl.org/rss/modules/content/"
     xmlns:itunes="http://www.itunes.com/dtds/podcast-1.0.dtd"
     xmlns:podcast="https://podcastindex.org/namespace/1.0">
  <channel>
    <title>地端 AI 實驗室</title>
    <link>https://blog.markkulab.net</link>
    <description>每週三、五精選 1~3 個可以下載到自己機器上跑的開源模型與 LoRA，用輕鬆對話帶你掌握它能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪。本節目為情報策展，功能與硬體規格一律引述官方 model card，未經我方實測

本節目由 AI 撰稿並以合成語音播出，主持人為虛擬角色。</description>
    <language>zh-TW</language>
    <copyright>&#xA9; 2026 Mark Ku. All rights reserved.</copyright>
    <lastBuildDate>Sat, 19 Sep 2026 03:39:39 GMT</lastBuildDate>
    <atom:link href="https://blog.markkulab.net/local-ai-lab/feed.xml" rel="self" type="application/rss+xml"/>
    <managingEditor>a4756830@gmail.com (Mark Ku)</managingEditor>

    <itunes:author>Mark Ku</itunes:author>
    <itunes:subtitle>每週三、五，挑你自己機器跑得動的開源模型</itunes:subtitle>
    <itunes:summary>每週三、五精選 1~3 個可以下載到自己機器上跑的開源模型與 LoRA，用輕鬆對話帶你掌握它能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪。本節目為情報策展，功能與硬體規格一律引述官方 model card，未經我方實測

本節目由 AI 撰稿並以合成語音播出，主持人為虛擬角色。</itunes:summary>
    <itunes:type>episodic</itunes:type>
    <itunes:owner>
      <itunes:name>Mark Ku</itunes:name>
      <itunes:email>a4756830@gmail.com</itunes:email>
    </itunes:owner>
    <itunes:image href="https://blog.markkulab.net/local-ai-lab-logo.jpg"/>
    <itunes:category text="Technology"><itunes:category text="Software How-To"/></itunes:category>
    <itunes:explicit>false</itunes:explicit>
    <itunes:keywords>地端模型,開源模型,LoRA,self-hosted,本地部署,LLM,Hugging Face,量化,GGUF,微調,Podcast,Mark Ku</itunes:keywords>
    <podcast:guid>b490d9b9-393b-40c7-b39e-c211e128708c</podcast:guid>
    <podcast:locked>no</podcast:locked>
    <podcast:funding url=""></podcast:funding>

    <image>
      <url>https://blog.markkulab.net/local-ai-lab-logo.jpg</url>
      <title>地端 AI 實驗室</title>
      <link>https://blog.markkulab.net</link>
    </image>

    <item>
      <title>🧪 27B 壓到 8GB：Ternary-Bonsai-2-27B 下載 40 萬次｜地端 AI 實驗室</title>
      <link>https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-09-19</link>
      <guid isPermaLink="true">https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-09-19</guid>
      <description>本期聲量冠軍是 Ternary-Bonsai-2-27B-gguf，官方標榜筆電就能跑 27B、檔案不到 8GB，一週下載 40.5 萬次。同集還有手機級 MiniCPM5-2B，跟 Mac mini 24GB 能跑 35B 的 LoRA：Edge0-35B-A3B-preview。三顆模型各自的硬體門檻跟隱藏但書，等一下一次講給你聽。

本節目由 AI 撰稿並以合成語音播出，主持人為虛擬角色。</description>
      <content:encoded><![CDATA[<h2 id="開場白">開場白</h2>
<p>本期聲量冠軍是 Ternary-Bonsai-2-27B-gguf，官方標榜筆電就能跑 27B、檔案不到 8GB，一週下載 40.5 萬次。同集還有手機級 MiniCPM5-2B，跟 Mac mini 24GB 能跑 35B 的 LoRA：Edge0-35B-A3B-preview。三顆模型各自的硬體門檻跟隱藏但書，等一下一次講給你聽。</p>
<h2 id="本期精選">本期精選</h2>
<h3 id="1-ternary-bonsai-2-27b-gguf把-27b-塞進不到-8gb-的三元量化版">1. Ternary-Bonsai-2-27B-gguf：把 27B 塞進不到 8GB 的三元量化版</h3>
<ul>
<li><strong>這是什麼</strong>：這是 prism-ml 針對 Qwen3.8-27B 系列做的三元（ternary）量化 GGUF 版本，27B 參數、Apache-2.0 授權，主打把原本 53.8GB 的 F16 版本大幅瘦身。官方 model card 自述是「<sub>5.9 GB language model (down from </sub>54 GB FP16)」。</li>
<li><strong>能用在哪些場景</strong>：
<ul>
<li>接案工程師手上有客戶的機敏合約或內部文件，不能丟雲端 API，這時候用一台有獨顯的筆電離線跑 27B 級模型做摘要與問答，官方 model card 把用途明講為「privacy-sensitive and offline settings」與「laptop-local 27B agents」。</li>
<li>團隊只有一張消費級顯卡，卻想自架內部問答服務。PQ2_0 檔案只有 7.21GB，官方定位是「single-GPU and commodity-GPU serving」，不用為了跑 27B 去租 A100。</li>
<li>用 Mac 開發的工程師想要一個支援 thinking／reasoning 模式的本機 coding 助手，官方吞吐表列出 Apple M5 Pro 解碼 28.1 tok/s、M5 Max 47.0 tok/s（皆為 PQ2_0），屬於還能互動的速度區間。</li>
</ul>
</li>
<li><strong>跑得動嗎</strong>：官方 model card 列出三個檔案：PTQ1_0（dense trits）5.95GB、PQ2_0（2-bit slots）7.21GB，對照 F16 參考版 53.8GB，另有選配的 vision tower（Q8_0）0.63GB。吞吐部分 card 還列出 RTX 5090 129.9 tok/s、H100 SXM 113.9 tok/s（同樣是 PQ2_0 解碼）。要注意的是官方沒有標示最低 RAM／VRAM 下限，這塊沒有數字就不好幫忙猜。</li>
<li><strong>本期聲量</strong>：HF 熱度 881（40.56 萬次下載、926 個讚），同家族目前另有 2 個量化／重打包版本。</li>
<li><strong>跟同類比</strong>：作者自己的對照表把它放進同一個 Qwen3.8-27B 量化家族比較：14 項 benchmark 平均 84.78，贏過傳統 IQ2_XXS 的 72.59，只小輸給體積大三倍的 UD-Q4_K_XL（85.18），card 的說法是「far above the conventional IQ2_XXS build at less than two-thirds of its footprint」。不過第三方 MindStudio 的試用心得提到，它在視覺與創意任務表現不錯，但修 bug 跟基本 UI 程式碼生成不太穩定，成績看任務而定。</li>
<li><strong>怎麼取得</strong>：README 給的指令是 <code>hf download prism-ml/Ternary-Bonsai-2-27B-gguf Ternary-Bonsai-2-27B-PQ2_0.gguf --local-dir .</code>，再用 <code>llama-cli -m ... -ngl 99 -fa on -c 32768</code> 啟動，或用 <code>ollama run hf.co/prism-ml/Ternary-Bonsai-2-27B-gguf:F16</code>。但重要前提是 README 明寫「Stock llama.cpp will not run these files」，要跑起來得先換成 PrismML 自己的 llama.cpp fork，這個坑要先知道再動手裝。</li>
<li><strong>連結</strong>：<a target="_blank" rel="noopener noreferrer" href="https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf">huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf</a></li>
</ul>
<h3 id="2-minicpm5-2b小到能塞進手機的地端-agent-底座">2. MiniCPM5-2B：小到能塞進手機的地端 agent 底座</h3>
<ul>
<li><strong>這是什麼</strong>：OpenBMB 出的 2B 參數模型，Apache-2.0 授權，官方同時備好 GGUF／MLX／GPTQ／LiteRT 四種格式，明確瞄準裝置端與資源受限場景。</li>
<li><strong>能用在哪些場景</strong>：
<ul>
<li>App 開發者想在 Android／iOS 端內建離線助理，不想每個使用者都燒 API 費用。官方直接提供 <code>.litertlm</code> 版本，model card 標示 LiteRT-LM 支援「Android / iOS / desktop / IoT, CPU + GPU」。</li>
<li>想自架一個常駐 agent 幫忙整理 log 或呼叫內部 API。官方把用途寫成「local assistants, coding agents, tool-use workflows」，並標示 BFCL v4 工具呼叫得分 66.6。</li>
<li>需要在單機上處理長文件（法規、會議逐字稿）但沒有顯卡預算。官方標示原生 131,072 token 長上下文，可用 GPTQ 4bit 版在低階硬體上跑。</li>
</ul>
</li>
<li><strong>跑得動嗎</strong>：官方沒有標示具體 RAM／VRAM 門檻，model card 也沒有任何 tokens/s 數據。有標示的是格式選項：官方量化倉庫包含 MiniCPM5-2B-GGUF（llama.cpp／Ollama／LM Studio）、MiniCPM5-2B-MLX（Apple Silicon）、MiniCPM5-2B-GPTQ（4bit），card 對硬體的描述僅止於定位語「on-device, local deployment, and resource-constrained scenarios」。這裡只能從 2B 參數量跟四種格式反推它應該跑得動輕量裝置，實際多快官方沒給，這段算推估不算保證。</li>
<li><strong>本期聲量</strong>：HF 熱度 338（35.72 萬次下載、1.6 千個讚），同家族目前另有 2 個量化／重打包版本。</li>
<li><strong>跟同類比</strong>：OpenBMB 官方的比較表主張它 34 項平均 53.9，贏過 LFM2.5-2.6B（33.2）、Qwen3.5-2B（28.0）、Gemma-4-E2B-it（24.6），甚至壓過 4B 級的 Qwen3.5-4B（51.1），card 的措辭是「remains competitive with 4B-class models overall」。第三方評測站 eesel AI 與 buildfastwithai 則提醒這是 OpenBMB 自選比較集內的成績，benchmark 領先不等於生產環境可靠，建議拿自己的任務先試。</li>
<li><strong>怎麼取得</strong>：README 的 transformers 範例是 <code>AutoModelForCausalLM.from_pretrained("openbmb/MiniCPM5-2B", torch_dtype="auto", device_map="auto")</code>，要開服務則官方給 <code>vllm serve openbmb/MiniCPM5-2B --port 8000</code>，走 llama.cpp 則是 <code>llama-server -m MiniCPM5-2B-F16.gguf -a MiniCPM5-2B --port 8080</code>。</li>
<li><strong>連結</strong>：<a target="_blank" rel="noopener noreferrer" href="https://huggingface.co/openbmb/MiniCPM5-2B">huggingface.co/openbmb/MiniCPM5-2B</a></li>
</ul>
<h3 id="3-edge0-35b-a3b-preview拿-lora-adapter-在-mac-mini-上跑-35b">3. Edge0-35B-A3B-preview：拿 LoRA adapter 在 Mac mini 上跑 35B</h3>
<ul>
<li><strong>這是什麼</strong>：Edge0 團隊發的 LoRA／adapter 版本，基底是 35B 的 MoE 模型 Qwen3.6-35B-A3B，用 int4 量化搭配 LoRA 與 prerouter adapter，Apache-2.0 授權，官方明講後端是 MLX、目前鎖定 Apple Silicon。</li>
<li><strong>能用在哪些場景</strong>：
<ul>
<li>用 Apple Silicon 開發的工程師想在本機跑 35B 級模型做多語問答。官方標示峰值活躍記憶體只要 2.9 GiB，並列出 Mac mini M4 Pro（24GB）解碼 14.9 至 17.7 tok/s 的實測表。</li>
<li>想同時服務多種任務又不想每次都重新量化。card 把用途寫成「batch serving via LoRA adapters without re-quantization」，適合要掛多組 adapter 的自架服務。</li>
<li>VRAM 吃緊但硬碟夠大的邊緣部署情境。card 的定位語是「edge / on-device inference where GPU VRAM is scarce and storage is fast」,官方標示模型總容量 19.6GB。</li>
</ul>
</li>
<li><strong>跑得動嗎</strong>：官方標示得相當完整：峰值活躍記憶體 2.9 GiB（短上下文）、總儲存 19.6GB，採 4-bit（int4）搭配 LoRA 與 prerouter adapter，後端是 MLX，card 直接寫「currently targets Apple Silicon」，並警告「Long contexts grow the KV cache; use shorter contexts to keep peak memory at 3 GiB」。速度方面官方列出 Mac mini M4 Pro 24GB 解碼 14.9 至 17.7 tok/s、prefill 冷／熱啟動 113／140 tok/s。</li>
<li><strong>本期聲量</strong>：HF 熱度 250（5.25 萬次下載、3.4 千個讚）。</li>
<li><strong>跟同類比</strong>：值得點出的是作者只跟自己的 fp16 基底 Qwen3.6-35B-A3B 比，沒有跟其他邊緣推論方案對照：官方表格顯示 int4 版平均 79.2 分，對上 fp16 的 83.2 分，作者自述平均退化 3.9 分。另外 card 自己標明這是「early preview release」,且直言 agent 能力「currently weak」,不適合長程自主任務，這個限制是作者本人寫的，介紹時得一起帶到。</li>
<li><strong>怎麼取得</strong>：README 要求先裝官方框架 <code>pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]'</code>，再 <code>huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir ./Edge0-35b-a3b-preview</code>，然後 <code>edge0 chat --name edge0-35b</code> 對話，或 <code>edge0 serve --port 8085</code> 開 OpenAI 相容 API；card 另有提供 mlx_lm 的 <code>load("Edge0/Edge0-35B-A3B-preview")</code> 走法。</li>
<li><strong>連結</strong>：<a target="_blank" rel="noopener noreferrer" href="https://huggingface.co/Edge0/Edge0-35B-A3B-preview">huggingface.co/Edge0/Edge0-35B-A3B-preview</a></li>
</ul>
<h2 id="結尾段落">結尾段落</h2>
<p>這三顆選題有個共同點，都在想辦法把大模型塞進小記憶體:Ternary-Bonsai 靠三元量化把 27B 壓到 8GB 內,MiniCPM5-2B 直接瞄準手機格式,Edge0 則是拿 LoRA 在 Mac mini 上推 35B。如果你手上剛好有一台有獨顯的筆電、又要處理不能上雲的文件,Ternary-Bonsai-2-27B-gguf 大概是本期最值得先點進 model card 把門檻看清楚的一個。下週三再來看看又有哪些地端模型冒出頭。</p>
<p><small>本節目由 AI 撰稿並以合成語音播出，主持人為虛擬角色。</small></p>]]></content:encoded>
      <pubDate>Sat, 19 Sep 2026 02:00:00 GMT</pubDate>
      <author>a4756830@gmail.com (Mark Ku)</author>
      <category>地端 AI 實驗室</category>
      <enclosure url="https://blog.markkulab.net/api/download-podcast?episode=local-ai-lab-2026-09-19&amp;dir=markku/local-ai-lab&amp;file=dialogue.mp3&amp;v=5311340" type="audio/mpeg" length="5311340"/>
      <itunes:title>🧪 27B 壓到 8GB：Ternary-Bonsai-2-27B 下載 40 萬次｜地端 AI 實驗室</itunes:title>
      <itunes:subtitle>本期聲量冠軍是 Ternary-Bonsai-2-27B-gguf，官方標榜筆電就能跑 27B、檔案不到 8GB，一週下載 40.5 萬次。同集還有手機級 MiniCPM5-2B，跟 Mac mini</itunes:subtitle>
      <itunes:summary>本期聲量冠軍是 Ternary-Bonsai-2-27B-gguf，官方標榜筆電就能跑 27B、檔案不到 8GB，一週下載 40.5 萬次。同集還有手機級 MiniCPM5-2B，跟 Mac mini 24GB 能跑 35B 的 LoRA：Edge0-35B-A3B-preview。三顆模型各自的硬體門檻跟隱藏但書，等一下一次講給你聽。

本節目由 AI 撰稿並以合成語音播出，主持人為虛擬角色。</itunes:summary>
      <itunes:author>Mark Ku</itunes:author>
      <itunes:duration>00:07:49</itunes:duration>
      <itunes:episode>1</itunes:episode>
      <itunes:episodeType>full</itunes:episodeType>
      <itunes:explicit>false</itunes:explicit>
      <itunes:image href="https://blog.markkulab.net/content/markku/local-ai-lab/local-ai-lab-2026-09-19/images/cover.webp"/>
    </item>
  </channel>
</rss>