---
title: "🧪 小米旗艦要8張顯卡，這顆MiMo-V2.6-Distill-Qwen-9B一行指令就能跑｜地端 AI 實驗室"
description: "這週 Hugging Face 熱度榜被小米 MiMo V2.6 家族整個洗版，官方旗艦範例指令要 8 張顯卡起跳，但家族裡的 MiMo-V2.6-Distill-Qwen-9B 卻是唯一一般顯卡有機會跑起來的版本，MIT 授權，還有 llama.cpp 官方團隊親自出的 GGUF。"
canonical_url: "https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-09-28"
author: "Mark Ku"
author_url: "https://blog.markkulab.net/author/mark-ku"
site: "Mark Ku's Blog"
date_published: "2026-09-28T02:00:00.000Z"
category: "地端 AI 實驗室"
tags: ["local-ai", "podcast", "地端模型", "lora", "開源模型", "MiMo-V2.6-Distill-Qwen-9B", "TeleOCR", "GLiNER2.5-Decide", "llama.cpp", "GGUF", "OCR"]
language: "zh-TW"
license: "CC BY 4.0"
license_url: "https://creativecommons.org/licenses/by/4.0/"
attribution: "轉載或引用請註明作者並附上原文連結"
---

# 🧪 小米旗艦要8張顯卡，這顆MiMo-V2.6-Distill-Qwen-9B一行指令就能跑｜地端 AI 實驗室

> **TL;DR** — 小米 MiMo-V2.6-Distill-Qwen-9B 是 9B 蒸餾模型，MIT 授權，llama.cpp 官方 GGUF 量化最小 3.54GB、Q8_0 版 9.53GB，一行指令 ollama run hf.co/ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0 即可在消費級顯卡跑起來。

## 開場白
這週 Hugging Face 熱度榜被小米 MiMo V2.6 家族整個洗版，官方旗艦範例指令要 8 張顯卡起跳，但家族裡的 MiMo-V2.6-Distill-Qwen-9B 卻是唯一一般顯卡有機會跑起來的版本，MIT 授權，還有 llama.cpp 官方團隊親自出的 GGUF。這集另外挑了兩顆同樣能落地的模型：1.2B 就能把發票掃描轉成結構化表格的 TeleOCR，還有純 CPU 就能跑、加新分類不用重新訓練的 GLiNER2.5-Decide，等一下告訴你這三顆各自適合塞進哪種工作流。

## 本期精選

### 1. MiMo-V2.6-Distill-Qwen-9B：小米旗艦洗版週，唯一消費級顯卡跑得動的版本
- **這是什麼**: 小米 MiMo V2.6 家族的 9B 蒸餾版語言模型，以 Qwen3.5-9B 為基底蒸餾而成，MIT 授權，官方定位在 coding、visual coding 與 cybersecurity 三大應用方向。
- **能用在哪些場景**:
  - 個人開發者想要一個完全離線的 coding agent 改自己的私有 repo，程式碼不用送上任何雲端。官方 model card 把 coding 列為四大訓練領域之首，Code 資料佔比 29.9%。
  - ggml-org 出的 GGUF 版本附了 mmproj 視覺投影檔，可以直接丟截圖請它照畫面刻版型、抓 UI 問題，官方把這類任務稱為 visual coding，訓練資料裡 Visual 佔 27.4%。
  - 資安或維運團隊想在內網做終端機操作與弱點分析的半自動化演練，官方列 cybersecurity 為四大訓練領域之一（Cyber 佔 14.2%），並自評 Terminal Bench 拿到 37.1 分。
- **跑得動嗎**: 官方 model card 沒有標示 VRAM 需求，只寫可以在 llama.cpp、Ollama、LM Studio 等相容工具上瀏覽量化版本使用，列出 53 個量化選項。實際數字要看第三方量化頁面：ggml-org 的 Q8_0 版本是 9.53 GB（頁面註明含 Q8_0 mmproj 視覺編碼器），bartowski 版本則有 Q4_K_M 5.84 GB、Q5_K_M 6.88 GB、Q6_K 7.79 GB、Q8_0 9.55 GB，最小的 IQ2_M 只要 3.54 GB。bartowski 頁面給的選型原則是挑選檔案大小比你 GPU 總 VRAM 小 1 到 2 GB 的量化版本。
- **本期聲量**: HF 熱度 516，8.8k 次下載，527 個讚。
- **跟同類比**: 官方 model card 只拿自己跟基底 Qwen3.5-9B 比，宣稱 SWE Verified 61.1、SWE Pro 44.6、AutomationBench 30.3、Terminal Bench 37.1 全面領先，這些都是作者自評數字。真正的分水嶺其實是能不能自架，同期旗艦 MiMo-V2.6-Pro-RL 的 model card 自己寫是 Sparse MoE 架構、1.02T 總參數／42B 啟動，範例指令是 8 張卡的 tensor-parallel-size，一般人只能看熱鬧。
- **怎麼取得**: ggml-org 的 GGUF 頁面給的是一行指令 `ollama run hf.co/ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0`，或用 llama.cpp 的 `llama serve -hf ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0`。想自架 API 的話，官方 model card 給的指令是 `sglang serve --model-path XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B --reasoning-parser mimo`，另外也支援 vLLM 與 Docker。
- **連結**: [XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B](https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B)

### 2. TeleOCR：1.2B 就把發票、合約、講義轉成結構化文字
- **這是什麼**: XingChen-AGI 出品的文件解析模型，約 1.2B 參數，BF16，apache-2.0 授權，同一個框架處理文字擷取、表格解析與版面／閱讀順序還原。
- **能用在哪些場景**:
  - 行政或會計把手機拍的發票、收據、報價單批次轉成結構化表格，model card 說表格會以 OTSL 格式輸出，另外附工具能轉成 HTML table，可以直接匯入試算表或資料庫。
  - 團隊想把累積多年的 PDF 規格書、合約掃描檔轉成 markdown 灌進 RAG 知識庫，官方強調它是統一框架，同時處理文字、表格與版面還原，不用再拼好幾個工具。
  - 老師或研究生要把含數學式的講義、論文 PDF 轉成可編輯文字，model card 寫公式會輸出成 LaTeX 並用 $$..$$ 包住，不用再手動重打公式。
- **跑得動嗎**: 官方 model card 沒有標示 VRAM 或硬體門檻，只列出約 1.2B 參數與 BF16 張量型別。量化是社群路線，card 上原文致謝「Thanks to Nandraj for the GGUF conversion and llama.cpp support!」，官方另外提供 vLLM、SGLang、Docker 三種部署方式。以 1.2B 這個量級推估，量化後應該塞得進消費級顯卡，但這只是從參數量推得的判斷，官方沒有給實際數字。
- **本期聲量**: HF 熱度 526，27.8k 次下載，627 個讚。
- **跟同類比**: 作者在 model card 與論文（arXiv 2608.12898）裡說在 OmniDocBench v1.6 上贏過 pipeline 派的 MinerU 2.5 Pro、PaddleOCR-VL 1.6、GLM-OCR，以及端到端的 OvisOCR2，官方列出的分數是 Overall 96.87、Table TEDS 97.05，這些都是作者自評數字。有兩點要據實講：model card 只掛 Chinese 與 English 語言標籤，沒特別交代繁體中文支援到什麼程度；頁面也提到「We have renamed NaviDC-OCR to TeleOCR」，同名權重在 Hugging Face 上另有 StarDoc-AI 的版本，不宜斷言哪一邊是唯一官方來源。
- **怎麼取得**: model card 給的是 `pip install transformers torch pillow`，再用 `AutoProcessor.from_pretrained(..., trust_remote_code=True)` 搭配 `AutoModel.from_pretrained(..., trust_remote_code=True, torch_dtype=torch.bfloat16).cuda().eval()` 載入。想走純本機輕量路線，可以用 card 上連結的社群 GGUF 版本配 llama.cpp、LM Studio 或 Ollama。
- **連結**: [XingChen-AGI/TeleOCR](https://huggingface.co/XingChen-AGI/TeleOCR)

### 3. GLiNER2.5-Decide：340M、純 CPU 就能跑的決策分類器
- **這是什麼**: fastino 出的小型分類模型，DeBERTa-v3-large 編碼器，340M 參數，apache-2.0 授權，一次 forward pass 同時判斷多個分類欄位，標籤在呼叫當下才傳入，不用重新訓練。
- **能用在哪些場景**:
  - 客服工單進來時一次判斷意圖、優先級與需不需要轉真人，model card 的範例就是飯店客訴，一次回傳 intent、priority、needs_human 與多標籤的 topics。
  - 當 LLM router 的前置分類器，先用 CPU 判斷這則請求該送哪個模型、走哪條流程，把昂貴的大模型呼叫留給真正需要的案子。
  - 內容或日誌的多標籤打標，因為 label set 是呼叫當下才傳入的 dict，臨時要加一個分類欄位只要改設定，不用換權重。
- **跑得動嗎**: model card 原文寫「Runs on: CPU or GPU, through gliner2」，明確支援純 CPU 執行。編碼器是 DeBERTa-v3-large、340M 參數（頁面 model size 欄位標的是 0.5B）。實際磁碟大小、延遲與吞吐量官方沒有標示，頁面完全沒有速度數字。
- **本期聲量**: HF 熱度 210，19.8k 次下載，212 個讚。
- **跟同類比**: model card 的對照表拿它跟自家 GLiNER2.5-Decide-1B（59.6%）與 JevK5（57.6%）比，這顆 340M 版以 60.2% 平均正確率勝出，測試集是 fastino/fast-decisions，17 個領域各 300 題。作者也主動劃線：「This release is not a general-purpose model. It does not reason, explain, or answer open questions」。對台灣團隊最關鍵的限制是這顆只吃英文，頁面原文寫「The suite is English. Use GLiNER2.5-multi-Decide when the input is multilingual」，中文工單要改用 287M 的多語版。
- **怎麼取得**: `pip install gliner2`，接著 `from gliner2 import AutoExtractor`、`model = AutoExtractor.from_pretrained('fastino/GLiNER2.5-Decide')`，再呼叫 `model.classify_text(text, label_dict)`，label_dict 裡可以同時放多個決策欄位，並針對個別欄位設定 multi_label 與 cls_threshold。
- **連結**: [fastino/GLiNER2.5-Decide](https://huggingface.co/fastino/GLiNER2.5-Decide)

## 結尾段落
這期三顆模型剛好對應三種不同的地端需求：MiMo-V2.6-Distill-Qwen-9B 是唯一擠得進消費級顯卡的小米旗艦血統，TeleOCR 用 1.2B 把文件轉結構化這件事做到能打贏大模型的分數，GLiNER2.5-Decide 則證明分類任務有時候連 GPU 都不用。想先動手裝一個的話，GLiNER2.5-Decide 門檻最低，CPU 就能跑；想省顯卡又要做 coding agent，MiMo-V2.6-Distill-Qwen-9B 值得排進待辦清單。我們下集再見。

---

## 關於本文與作者

本文出自 [Mark Ku's Blog](https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-09-28)

授權條款： [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) — 轉載或引用請註明作者並附上原文連結

### 關於作者

**[Mark Ku](https://blog.markkulab.net/author/mark-ku)** — 軟體工程師

- 10 年以上軟體工程師
- 做過北美電商與 AI SaaS 訂閱收費系統

### 作者開發的免費工具

以下工具皆可免費使用：

- [免費 PDF 簽名工具](https://blog.markkulab.net/tools/pdf-sign): 線上 PDF 簽名工具，瀏覽器內完成手繪、打字、上傳簽名，可拖曳放置、縮放、下載。所有處理都在你的裝置完成，檔案不會上傳。
- [VS Code Refactory](https://blog.markkulab.net/tools/refactory): Refactory 是一款 VS Code 重構擴充套件：34 個重構動作、37 條 code smell 檢查、Code Health 儀表板、18 種語言、534 支測試。懂你的專案慣例：介面放哪、DI 註冊寫在哪、'use client' 該不該加；還會用 git 修改頻率 × 複雜度排出「該先修哪個檔案」，並一鍵把壞味道交給你自己電腦上的 Claude Code 修。免費使用，原始碼不離開你的機器。
- [DB-Kit 資料庫管理工具](https://blog.markkulab.net/tools/db-kit): DB-Kit 是一個用 Tauri + Rust + React 打造的輕量跨平台資料庫管理工具，用單一一致的介面同時管理 MySQL、MariaDB、PostgreSQL、SQL Server、Oracle、SQLite、MongoDB、Redis、Kafka、Elasticsearch 與 RabbitMQ 十一種資料來源：連線密碼以 OS keychain 加密、SSH Tunnel、完整 CRUD、視覺化查詢建構器、多結果集同時顯示、跨連線資料傳輸、結構與資料比對（同步 SQL、結構快照）、Excel / CSV 匯入匯出、執行計畫視覺化、ER 圖、排程備份、SQL 壓力測試（p50～p99 延遲百分位）、15 條規則的 SQL 審查、執行前 AI 審查並逐句備份的「審查並執行」（自動產生回滾腳本）、Kafka 訊息瀏覽與監控告警；繁中 / 英文雙語介面，內建 AI 助手（本機 CLI 或 Anthropic / OpenAI 相容 API，自然語言生成 SQL、AI 審查與調校建議）與命令列工具 dbk。免費開源（MIT），提供 Windows / macOS / Linux 安裝檔。
- [VS Code Super Mermaid](https://blog.markkulab.net/tools/super-mermaid): Super Mermaid 是一款 VS Code 擴充套件：開箱即用的漂亮 Mermaid 圖表，自動上色、即時預覽、滑鼠平移縮放、PNG / SVG 高解析匯出，內建 21 種範本與多種主題。免費開源（MIT）。
- [React Super Mermaid](https://blog.markkulab.net/tools/react-super-mermaid): react-super-mermaid 是一個開源 React 元件庫：一行 <MermaidViewer> 即可渲染漂亮的 Mermaid 圖表，內建 colorful / sketch 主題、平移縮放、圖內搜尋、SVG / PNG 高解析匯出。輕量、SSR 安全、完整 TypeScript 型別。免費開源（MIT）。
- [Jira / Confluence Super Mermaid](https://blog.markkulab.net/tools/jira-super-mermaid): Atlassian Forge app：在 Jira issue 與 Confluence 內文直接寫 Mermaid 語法，畫流程圖、時序圖、狀態機與甘特圖。11 種圖表、SVG / PNG 匯出、明暗主題、完整中日韓文字支援。取得 Runs on Atlassian 資格：圖表存在你自己的站台，app 不呼叫任何第三方服務。免費，即將上架 Atlassian Marketplace。
- [Mermaid 線上預覽](https://blog.markkulab.net/tools/mermaid-preview): 在瀏覽器裡寫 Mermaid、即時看圖，整張圖表壓進網址就能分享。免註冊、不上傳伺服器，相容 mermaid.live 的分享連結。
- [React Intl Phone Number](https://blog.markkulab.net/tools/react-intl-phone-number): react-intl-phone-number 是一個開源 React 元件：framework-agnostic、不依賴 antd，提供 E.164 進出、可搜尋國旗 / 國碼下拉、可配置驗證等級（strict / mobile-strict / loose）、可主題化 CSS 與 i18n，電話邏輯由 google-libphonenumber 驅動。輕量、完整 TypeScript 型別。免費開源（MIT）。
- [Uptime Kuma Cluster](https://blog.markkulab.net/tools/uptime-kuma-cluster): 把單機版 Uptime Kuma 改造成高可用叢集：OpenResty + Lua 智慧負載平衡、MariaDB 共享狀態、健康檢查與自動 Failover，附叢集管理 REST API，一行 Docker Compose 啟動。免費開源（MIT）。
- [AI Podcast Cut 音檔剪輯](https://blog.markkulab.net/tools/ai-podcast-cut): 丟進一段錄音，AI 幫你剪掉「嗯、呃、那個」與講到一半重講的片段，平衡逐段音量，並派第二個 agent 覆核每一刀。辨識與去人聲都在你自己的電腦上跑，不上傳、不需要金鑰。剪點會貼齊字邊界與零交越、每一刀都有漸弱漸強，句尾還留得住呼吸感。Windows / macOS / Linux 桌面應用，MIT 開源，Windows 安裝檔內建 ffmpeg。
- [open-pos 開源餐飲 POS](https://blog.markkulab.net/tools/open-pos): 一台電腦加一台出單機就能開店。資料存在自己的硬碟裡、沒有月租、沒有綁約，MIT 全開源。金額用整數元依營業稅法拆算稅額，銷售額加稅額恆等於總額；出單走網路型 ESC/POS（TCP 9100），不必裝廠商驅動。Tauri + Rust + SQLite 桌面應用，v1.0 開發中。

### 每日 Podcast

- [Mark's Tech Insights 每日 AI 新鮮事](https://blog.markkulab.net/category/tech-news): 每日精選 AI 與科技趨勢，透過語音摘要快速掌握最新技術動態，涵蓋 AI 應用、軟體架構、DevOps 與工程實戰。 — RSS: https://blog.markkulab.net/feed.xml
- [AI股市蝦聊](https://blog.markkulab.net/category/ai-stock-chat): 每個交易日用 AI 分析台股盤勢，以雙人對話聊當天的盤中觀察與隔日預測。 — RSS: https://blog.markkulab.net/ai-stock-chat/feed.xml
- [開源好物週報](https://blog.markkulab.net/category/open-source-weekly): 每週從 Hacker News、GitHub、Reddit 聲量雷達精選免費開源工具，以雙人對話聊解決什麼痛點與怎麼快速上手。 — RSS: https://blog.markkulab.net/open-source-weekly/feed.xml
- [AI 運動週報](https://blog.markkulab.net/category/sports-weekly): 每週一、三、六以雙人對話聊 NBA、MLB 與國際體壇大事，台灣球迷視角，輕鬆有梗不酸人。 — RSS: https://blog.markkulab.net/sports-weekly/feed.xml
- [AI 國際新聞快報](https://blog.markkulab.net/category/world-news): 每天早上以雙人對話把過去一天的國際大事講白：政治外交、全球經濟、衝突與安全、災害與氣候，台灣視角、中立客觀、每則附出處。 — RSS: https://blog.markkulab.net/world-news/feed.xml
- [地端 AI 實驗室](https://blog.markkulab.net/category/local-ai-lab): 每週三、五精選可以下載到自己機器上跑的開源模型與 LoRA，用雙人對話講清楚能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪，規格一律引述官方 model card。 — RSS: https://blog.markkulab.net/local-ai-lab/feed.xml

### 站長優惠

- [Saily eSIM](https://blog.markkulab.net/saily): 出國旅遊上網 eSIM・NordVPN 團隊出品，優惠碼：KUKU
- [NordVPN](https://blog.markkulab.net/nordvpn): 全球最多人用的 VPN・獨立稽核無日誌
- [PremLogin](https://blog.markkulab.net/premlogin): 訂閱合租平台・串流與 AI 訂閱席位分攤，優惠碼：markku666

### 電子報

[訂閱電子報](https://blog.markkulab.net/subscribe) — 第一時間收到新文章通知，無垃圾信、隨時可取消訂閱。
