跳至主要內容
Mark Ku's Blog

開場白

這週 Hugging Face 熱度榜被小米 MiMo V2.6 家族整個洗版,官方旗艦範例指令要 8 張顯卡起跳,但家族裡的 MiMo-V2.6-Distill-Qwen-9B 卻是唯一一般顯卡有機會跑起來的版本,MIT 授權,還有 llama.cpp 官方團隊親自出的 GGUF。這集另外挑了兩顆同樣能落地的模型:1.2B 就能把發票掃描轉成結構化表格的 TeleOCR,還有純 CPU 就能跑、加新分類不用重新訓練的 GLiNER2.5-Decide,等一下告訴你這三顆各自適合塞進哪種工作流。

本期精選

1. MiMo-V2.6-Distill-Qwen-9B:小米旗艦洗版週,唯一消費級顯卡跑得動的版本

  • 這是什麼: 小米 MiMo V2.6 家族的 9B 蒸餾版語言模型,以 Qwen3.5-9B 為基底蒸餾而成,MIT 授權,官方定位在 coding、visual coding 與 cybersecurity 三大應用方向。
  • 能用在哪些場景:
    • 個人開發者想要一個完全離線的 coding agent 改自己的私有 repo,程式碼不用送上任何雲端。官方 model card 把 coding 列為四大訓練領域之首,Code 資料佔比 29.9%。
    • ggml-org 出的 GGUF 版本附了 mmproj 視覺投影檔,可以直接丟截圖請它照畫面刻版型、抓 UI 問題,官方把這類任務稱為 visual coding,訓練資料裡 Visual 佔 27.4%。
    • 資安或維運團隊想在內網做終端機操作與弱點分析的半自動化演練,官方列 cybersecurity 為四大訓練領域之一(Cyber 佔 14.2%),並自評 Terminal Bench 拿到 37.1 分。
  • 跑得動嗎: 官方 model card 沒有標示 VRAM 需求,只寫可以在 llama.cpp、Ollama、LM Studio 等相容工具上瀏覽量化版本使用,列出 53 個量化選項。實際數字要看第三方量化頁面:ggml-org 的 Q8_0 版本是 9.53 GB(頁面註明含 Q8_0 mmproj 視覺編碼器),bartowski 版本則有 Q4_K_M 5.84 GB、Q5_K_M 6.88 GB、Q6_K 7.79 GB、Q8_0 9.55 GB,最小的 IQ2_M 只要 3.54 GB。bartowski 頁面給的選型原則是挑選檔案大小比你 GPU 總 VRAM 小 1 到 2 GB 的量化版本。
  • 本期聲量: HF 熱度 516,8.8k 次下載,527 個讚。
  • 跟同類比: 官方 model card 只拿自己跟基底 Qwen3.5-9B 比,宣稱 SWE Verified 61.1、SWE Pro 44.6、AutomationBench 30.3、Terminal Bench 37.1 全面領先,這些都是作者自評數字。真正的分水嶺其實是能不能自架,同期旗艦 MiMo-V2.6-Pro-RL 的 model card 自己寫是 Sparse MoE 架構、1.02T 總參數/42B 啟動,範例指令是 8 張卡的 tensor-parallel-size,一般人只能看熱鬧。
  • 怎麼取得: ggml-org 的 GGUF 頁面給的是一行指令 ollama run hf.co/ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0,或用 llama.cpp 的 llama serve -hf ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0。想自架 API 的話,官方 model card 給的指令是 sglang serve --model-path XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B --reasoning-parser mimo,另外也支援 vLLM 與 Docker。
  • 連結: XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B

2. TeleOCR:1.2B 就把發票、合約、講義轉成結構化文字

  • 這是什麼: XingChen-AGI 出品的文件解析模型,約 1.2B 參數,BF16,apache-2.0 授權,同一個框架處理文字擷取、表格解析與版面/閱讀順序還原。
  • 能用在哪些場景:
    • 行政或會計把手機拍的發票、收據、報價單批次轉成結構化表格,model card 說表格會以 OTSL 格式輸出,另外附工具能轉成 HTML table,可以直接匯入試算表或資料庫。
    • 團隊想把累積多年的 PDF 規格書、合約掃描檔轉成 markdown 灌進 RAG 知識庫,官方強調它是統一框架,同時處理文字、表格與版面還原,不用再拼好幾個工具。
    • 老師或研究生要把含數學式的講義、論文 PDF 轉成可編輯文字,model card 寫公式會輸出成 LaTeX 並用 .... 包住,不用再手動重打公式。
  • 跑得動嗎: 官方 model card 沒有標示 VRAM 或硬體門檻,只列出約 1.2B 參數與 BF16 張量型別。量化是社群路線,card 上原文致謝「Thanks to Nandraj for the GGUF conversion and llama.cpp support!」,官方另外提供 vLLM、SGLang、Docker 三種部署方式。以 1.2B 這個量級推估,量化後應該塞得進消費級顯卡,但這只是從參數量推得的判斷,官方沒有給實際數字。
  • 本期聲量: HF 熱度 526,27.8k 次下載,627 個讚。
  • 跟同類比: 作者在 model card 與論文(arXiv 2608.12898)裡說在 OmniDocBench v1.6 上贏過 pipeline 派的 MinerU 2.5 Pro、PaddleOCR-VL 1.6、GLM-OCR,以及端到端的 OvisOCR2,官方列出的分數是 Overall 96.87、Table TEDS 97.05,這些都是作者自評數字。有兩點要據實講:model card 只掛 Chinese 與 English 語言標籤,沒特別交代繁體中文支援到什麼程度;頁面也提到「We have renamed NaviDC-OCR to TeleOCR」,同名權重在 Hugging Face 上另有 StarDoc-AI 的版本,不宜斷言哪一邊是唯一官方來源。
  • 怎麼取得: model card 給的是 pip install transformers torch pillow,再用 AutoProcessor.from_pretrained(..., trust_remote_code=True) 搭配 AutoModel.from_pretrained(..., trust_remote_code=True, torch_dtype=torch.bfloat16).cuda().eval() 載入。想走純本機輕量路線,可以用 card 上連結的社群 GGUF 版本配 llama.cpp、LM Studio 或 Ollama。
  • 連結: XingChen-AGI/TeleOCR

3. GLiNER2.5-Decide:340M、純 CPU 就能跑的決策分類器

  • 這是什麼: fastino 出的小型分類模型,DeBERTa-v3-large 編碼器,340M 參數,apache-2.0 授權,一次 forward pass 同時判斷多個分類欄位,標籤在呼叫當下才傳入,不用重新訓練。
  • 能用在哪些場景:
    • 客服工單進來時一次判斷意圖、優先級與需不需要轉真人,model card 的範例就是飯店客訴,一次回傳 intent、priority、needs_human 與多標籤的 topics。
    • 當 LLM router 的前置分類器,先用 CPU 判斷這則請求該送哪個模型、走哪條流程,把昂貴的大模型呼叫留給真正需要的案子。
    • 內容或日誌的多標籤打標,因為 label set 是呼叫當下才傳入的 dict,臨時要加一個分類欄位只要改設定,不用換權重。
  • 跑得動嗎: model card 原文寫「Runs on: CPU or GPU, through gliner2」,明確支援純 CPU 執行。編碼器是 DeBERTa-v3-large、340M 參數(頁面 model size 欄位標的是 0.5B)。實際磁碟大小、延遲與吞吐量官方沒有標示,頁面完全沒有速度數字。
  • 本期聲量: HF 熱度 210,19.8k 次下載,212 個讚。
  • 跟同類比: model card 的對照表拿它跟自家 GLiNER2.5-Decide-1B(59.6%)與 JevK5(57.6%)比,這顆 340M 版以 60.2% 平均正確率勝出,測試集是 fastino/fast-decisions,17 個領域各 300 題。作者也主動劃線:「This release is not a general-purpose model. It does not reason, explain, or answer open questions」。對台灣團隊最關鍵的限制是這顆只吃英文,頁面原文寫「The suite is English. Use GLiNER2.5-multi-Decide when the input is multilingual」,中文工單要改用 287M 的多語版。
  • 怎麼取得: pip install gliner2,接著 from gliner2 import AutoExtractor、model = AutoExtractor.from_pretrained('fastino/GLiNER2.5-Decide'),再呼叫 model.classify_text(text, label_dict),label_dict 裡可以同時放多個決策欄位,並針對個別欄位設定 multi_label 與 cls_threshold。
  • 連結: fastino/GLiNER2.5-Decide

結尾段落

這期三顆模型剛好對應三種不同的地端需求:MiMo-V2.6-Distill-Qwen-9B 是唯一擠得進消費級顯卡的小米旗艦血統,TeleOCR 用 1.2B 把文件轉結構化這件事做到能打贏大模型的分數,GLiNER2.5-Decide 則證明分類任務有時候連 GPU 都不用。想先動手裝一個的話,GLiNER2.5-Decide 門檻最低,CPU 就能跑;想省顯卡又要做 coding agent,MiMo-V2.6-Distill-Qwen-9B 值得排進待辦清單。我們下集再見。

作者

Mark Ku

10 年以上的軟體工程師,做過北美電商與 AI SaaS 訂閱收費系統。現在經營貳陸資訊有限公司(www.226network.com),幫小公司做系統、網站、LINE BOT 與 AI 自動化,也在這裡分享開發筆記與開源工具。閱讀更多

覺得這篇有幫助?

作者做的免費工具、每日 Podcast 與電子報,都在這裡。

Mark Ku · 本文採用 CC BY 4.0 授權,轉載請註明作者並附上原文連結。

留言

訂閱電子報

訂閱後即時收到新文章通知,不錯過任何技術分享。

提交即表示同意接收電子報,隨時可。

熱門文章

View all
Mark Ku
··637

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案
Mark Ku
··477

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南
Mark Ku
··302

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略
Mark Ku
··227

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1
Mark Ku
··226

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取
Mark Ku
··216

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調