開場白
這週 Hugging Face 熱度榜被小米 MiMo V2.6 家族整個洗版,官方旗艦範例指令要 8 張顯卡起跳,但家族裡的 MiMo-V2.6-Distill-Qwen-9B 卻是唯一一般顯卡有機會跑起來的版本,MIT 授權,還有 llama.cpp 官方團隊親自出的 GGUF。這集另外挑了兩顆同樣能落地的模型:1.2B 就能把發票掃描轉成結構化表格的 TeleOCR,還有純 CPU 就能跑、加新分類不用重新訓練的 GLiNER2.5-Decide,等一下告訴你這三顆各自適合塞進哪種工作流。
本期精選
1. MiMo-V2.6-Distill-Qwen-9B:小米旗艦洗版週,唯一消費級顯卡跑得動的版本
- 這是什麼: 小米 MiMo V2.6 家族的 9B 蒸餾版語言模型,以 Qwen3.5-9B 為基底蒸餾而成,MIT 授權,官方定位在 coding、visual coding 與 cybersecurity 三大應用方向。
- 能用在哪些場景:
- 個人開發者想要一個完全離線的 coding agent 改自己的私有 repo,程式碼不用送上任何雲端。官方 model card 把 coding 列為四大訓練領域之首,Code 資料佔比 29.9%。
- ggml-org 出的 GGUF 版本附了 mmproj 視覺投影檔,可以直接丟截圖請它照畫面刻版型、抓 UI 問題,官方把這類任務稱為 visual coding,訓練資料裡 Visual 佔 27.4%。
- 資安或維運團隊想在內網做終端機操作與弱點分析的半自動化演練,官方列 cybersecurity 為四大訓練領域之一(Cyber 佔 14.2%),並自評 Terminal Bench 拿到 37.1 分。
- 跑得動嗎: 官方 model card 沒有標示 VRAM 需求,只寫可以在 llama.cpp、Ollama、LM Studio 等相容工具上瀏覽量化版本使用,列出 53 個量化選項。實際數字要看第三方量化頁面:ggml-org 的 Q8_0 版本是 9.53 GB(頁面註明含 Q8_0 mmproj 視覺編碼器),bartowski 版本則有 Q4_K_M 5.84 GB、Q5_K_M 6.88 GB、Q6_K 7.79 GB、Q8_0 9.55 GB,最小的 IQ2_M 只要 3.54 GB。bartowski 頁面給的選型原則是挑選檔案大小比你 GPU 總 VRAM 小 1 到 2 GB 的量化版本。
- 本期聲量: HF 熱度 516,8.8k 次下載,527 個讚。
- 跟同類比: 官方 model card 只拿自己跟基底 Qwen3.5-9B 比,宣稱 SWE Verified 61.1、SWE Pro 44.6、AutomationBench 30.3、Terminal Bench 37.1 全面領先,這些都是作者自評數字。真正的分水嶺其實是能不能自架,同期旗艦 MiMo-V2.6-Pro-RL 的 model card 自己寫是 Sparse MoE 架構、1.02T 總參數/42B 啟動,範例指令是 8 張卡的 tensor-parallel-size,一般人只能看熱鬧。
- 怎麼取得: ggml-org 的 GGUF 頁面給的是一行指令
ollama run hf.co/ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0,或用 llama.cpp 的llama serve -hf ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF:Q8_0。想自架 API 的話,官方 model card 給的指令是sglang serve --model-path XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B --reasoning-parser mimo,另外也支援 vLLM 與 Docker。 - 連結: XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B
2. TeleOCR:1.2B 就把發票、合約、講義轉成結構化文字
- 這是什麼: XingChen-AGI 出品的文件解析模型,約 1.2B 參數,BF16,apache-2.0 授權,同一個框架處理文字擷取、表格解析與版面/閱讀順序還原。
- 能用在哪些場景:
- 行政或會計把手機拍的發票、收據、報價單批次轉成結構化表格,model card 說表格會以 OTSL 格式輸出,另外附工具能轉成 HTML table,可以直接匯入試算表或資料庫。
- 團隊想把累積多年的 PDF 規格書、合約掃描檔轉成 markdown 灌進 RAG 知識庫,官方強調它是統一框架,同時處理文字、表格與版面還原,不用再拼好幾個工具。
- 老師或研究生要把含數學式的講義、論文 PDF 轉成可編輯文字,model card 寫公式會輸出成 LaTeX 並用 包住,不用再手動重打公式。
- 跑得動嗎: 官方 model card 沒有標示 VRAM 或硬體門檻,只列出約 1.2B 參數與 BF16 張量型別。量化是社群路線,card 上原文致謝「Thanks to Nandraj for the GGUF conversion and llama.cpp support!」,官方另外提供 vLLM、SGLang、Docker 三種部署方式。以 1.2B 這個量級推估,量化後應該塞得進消費級顯卡,但這只是從參數量推得的判斷,官方沒有給實際數字。
- 本期聲量: HF 熱度 526,27.8k 次下載,627 個讚。
- 跟同類比: 作者在 model card 與論文(arXiv 2608.12898)裡說在 OmniDocBench v1.6 上贏過 pipeline 派的 MinerU 2.5 Pro、PaddleOCR-VL 1.6、GLM-OCR,以及端到端的 OvisOCR2,官方列出的分數是 Overall 96.87、Table TEDS 97.05,這些都是作者自評數字。有兩點要據實講:model card 只掛 Chinese 與 English 語言標籤,沒特別交代繁體中文支援到什麼程度;頁面也提到「We have renamed NaviDC-OCR to TeleOCR」,同名權重在 Hugging Face 上另有 StarDoc-AI 的版本,不宜斷言哪一邊是唯一官方來源。
- 怎麼取得: model card 給的是
pip install transformers torch pillow,再用AutoProcessor.from_pretrained(..., trust_remote_code=True)搭配AutoModel.from_pretrained(..., trust_remote_code=True, torch_dtype=torch.bfloat16).cuda().eval()載入。想走純本機輕量路線,可以用 card 上連結的社群 GGUF 版本配 llama.cpp、LM Studio 或 Ollama。 - 連結: XingChen-AGI/TeleOCR
3. GLiNER2.5-Decide:340M、純 CPU 就能跑的決策分類器
- 這是什麼: fastino 出的小型分類模型,DeBERTa-v3-large 編碼器,340M 參數,apache-2.0 授權,一次 forward pass 同時判斷多個分類欄位,標籤在呼叫當下才傳入,不用重新訓練。
- 能用在哪些場景:
- 客服工單進來時一次判斷意圖、優先級與需不需要轉真人,model card 的範例就是飯店客訴,一次回傳 intent、priority、needs_human 與多標籤的 topics。
- 當 LLM router 的前置分類器,先用 CPU 判斷這則請求該送哪個模型、走哪條流程,把昂貴的大模型呼叫留給真正需要的案子。
- 內容或日誌的多標籤打標,因為 label set 是呼叫當下才傳入的 dict,臨時要加一個分類欄位只要改設定,不用換權重。
- 跑得動嗎: model card 原文寫「Runs on: CPU or GPU, through gliner2」,明確支援純 CPU 執行。編碼器是 DeBERTa-v3-large、340M 參數(頁面 model size 欄位標的是 0.5B)。實際磁碟大小、延遲與吞吐量官方沒有標示,頁面完全沒有速度數字。
- 本期聲量: HF 熱度 210,19.8k 次下載,212 個讚。
- 跟同類比: model card 的對照表拿它跟自家 GLiNER2.5-Decide-1B(59.6%)與 JevK5(57.6%)比,這顆 340M 版以 60.2% 平均正確率勝出,測試集是 fastino/fast-decisions,17 個領域各 300 題。作者也主動劃線:「This release is not a general-purpose model. It does not reason, explain, or answer open questions」。對台灣團隊最關鍵的限制是這顆只吃英文,頁面原文寫「The suite is English. Use GLiNER2.5-multi-Decide when the input is multilingual」,中文工單要改用 287M 的多語版。
- 怎麼取得:
pip install gliner2,接著from gliner2 import AutoExtractor、model = AutoExtractor.from_pretrained('fastino/GLiNER2.5-Decide'),再呼叫model.classify_text(text, label_dict),label_dict 裡可以同時放多個決策欄位,並針對個別欄位設定 multi_label 與 cls_threshold。 - 連結: fastino/GLiNER2.5-Decide
結尾段落
這期三顆模型剛好對應三種不同的地端需求:MiMo-V2.6-Distill-Qwen-9B 是唯一擠得進消費級顯卡的小米旗艦血統,TeleOCR 用 1.2B 把文件轉結構化這件事做到能打贏大模型的分數,GLiNER2.5-Decide 則證明分類任務有時候連 GPU 都不用。想先動手裝一個的話,GLiNER2.5-Decide 門檻最低,CPU 就能跑;想省顯卡又要做 coding agent,MiMo-V2.6-Distill-Qwen-9B 值得排進待辦清單。我們下集再見。



























留言