開場白
本週 Hugging Face 熱度冠軍很反直覺:不是哪個新旗艦模型,而是一顆 0 次下載、卻拿下熱度 1530 的迷你分類器 convaiinnovations/laya,葫蘆裡賣什麼藥等一下告訴你。同一週還有下載破 700 萬次的視覺語言模型 Qwen3.8-27B,以及一個不生成文字、專門幫你打分的 LoRA:bespokelabs/Bespoke-Nimble-9B。三個要不要載回自己機器,看完就有答案。
本期精選
1. convaiinnovations/laya:不生成文字的判斷器,拿來做客服分派、guardrails、發票判讀
- 這是什麼:laya 不是聊天模型,是把 state(一段文字或欄位)配上結構化問題丟進去、一次 forward 就回傳答案的路由型分類器。有兩個版本:英文版 laya(421M,ModernBERT-large 骨幹,512 token 脈絡)與多語版 laya-multilingual(322M,mmBERT-base,官方 card 寫支援「100+ languages」,1024 token 可擴到 8k)。授權 Apache-2.0,格式 safetensors。
- 能用在哪些場景:
- 客服工單自動分派:官方 card 的示範是把一封 email 的 from、subject、body 當 state 丟進去,配一個 choice 型問題「Which department should handle this request?」,一次呼叫就回傳部門與信心值。card 把這個場景寫作「email triage」與「customer service」。
- 自架 LLM 服務的前置攔截器:card 把「guardrails」「moderation」列進用途,可以用 boolean 型問題(card 範例是「Does the user threaten to cancel?」)在把請求送去昂貴大模型之前先擋一輪,省下呼叫成本。
- 內部後台的結構化判讀:card 另外列出「invoice processing」「security incidents」「agent-trace observability」,適合把發票欄位、資安告警等級這類判斷留在地端,資料不出公司。
- 跑得動嗎:官方 model card 在 Tesla T4 上量的延遲,單題是 32.8ms(多語版)到 39.5ms(英文版),批次 103~332 questions/sec;CPU 部署官方寫的是 193~464ms(需 preload)。card 沒有標示 VRAM 需求,但以 322M~421M 的體積來看,CPU 就能跑並不意外。
- 本期聲量:HF 熱度 1530,本期第一名,下載數 0,讚數 1.6k。
- 跟同類比:card 自己挑的對照組是 TypeSafe Jev,作者宣稱延遲快 7.8 倍、校準好 3 倍(0.081 對 0.246 post-temperature),成本則是 0.042/1M tokens;但同一份 card 也承認 Jev 在超過 20 個選項的高基數標籤上比較強。以上都是作者自己提出的數字。
- 怎麼取得:官方 card 給的是
pip install laya,接著from laya import Router→router = Router(preload=True)→router.predict(state, questions),權重會在呼叫時自動從 Hugging Face 拉下來,問題型別 card 列了 choice、score(序數)與 boolean 三種。 - 連結:huggingface.co/convaiinnovations/laya
2. Qwen/Qwen3.8-27B:本期唯一塞得進單張消費級顯卡的視覺語言旗艦
- 這是什麼:27B 的 dense 視覺語言模型,能理解圖片與影片,Apache-2.0 授權,safetensors 格式。本期一票 300B 起跳的大模型裡,它是少數一般開發者真的載得下來、量化後塞得進單張消費級顯卡的通用旗艦。
- 能用在哪些場景:
- 地端的截圖/畫面問答助手:card 描述它是「native vision-language model that understands images and videos」,可以把操作截圖或錄影丟給它問「這個設定畫面哪裡不對」,不必把公司內部畫面上傳雲端服務。
- 整包程式碼的長脈絡審查:card 標示脈絡長度「262,144,可擴到 1,000,000 tokens」,能把一份 API 規格或模組關鍵檔案一次貼進去做重構建議;card 自列的程式能力數字有 SWE-bench Pro 61.7、LiveCodeBench 90.3、Terminal Bench 73.0。
- 自架 GUI/瀏覽器自動化代理的大腦:card 列出的 agentic 成績包含 OSWorld 84.3(電腦操作)、WebArena 64.8(瀏覽器)、AndroidWorld 81.9(手機),適合想在自己機器上跑操作型 agent、不想付 API 費用的人。
- 跑得動嗎:官方 model card 未標示 VRAM 需求,只給了「Browse Quantizations」入口,寫明可用於 llama.cpp、Ollama、LM Studio 或任何相容應用,目前掛著 1,194 個量化版本。實際門檻來自第三方安裝指南(Yotta Labs、The Autodidacts、codersera 等):Q4_K_M 約 17~20GB,可塞進 24GB 的 RTX 4090/3090;16GB 顯卡要降到 Q3,約 13.4GB。這些是第三方數字,不是官方標示。
- 本期聲量:HF 熱度 595,下載量 720 萬次、讚數 1.59 萬,兩項都是本期壓倒性第一,同家族的量化/重打包版本另有 13 個。
- 跟同類比:官方 card 把它拿去對比 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B 與 Opus4.6 Max,宣稱在 coding 與 agentic 任務上具競爭力。就地端可行性而言,本期另外兩個同樣熱門的多模態模型體型差很多:DeepSeek-V4.1-Flash 的 card 寫「552B backbone parameters」,GLM-5.3-Flash 的 card 寫「320B total parameters、18B active parameters」,都不是消費級機器扛得起的規模。
- 怎麼取得:官方 card 給的是
vllm serve "Qwen/Qwen3.8-27B",或用 transformers 的AutoProcessor搭AutoModelForMultimodalLM.from_pretrained(..., device_map="auto");想在小顯卡上跑,就照 card 的「Browse Quantizations」連結挑 GGUF 版本丟進 Ollama 或 LM Studio。 - 連結:huggingface.co/Qwen/Qwen3.8-27B
3. bespokelabs/Bespoke-Nimble-9B:不生成文字的判斷型 LoRA,把 LLM-as-judge 搬回自己機器
- 這是什麼:本期唯一的 LoRA/adapter,約 165 MiB,掛在 Qwen3.5-9B 底模上,把「判斷與評分」做成不生成文字的打分器,授權 Apache-2.0,格式 safetensors。
- 能用在哪些場景:
- RAG 回答的 grounding 檢查:官方 card 的 quickstart 範例是傳入一段退貨條款當 context,配 boolean schema 問「Is this item eligible?」,判斷答案有沒有真的被文件支撐,而不是模型自己掰的。
- 用 rubric 分數批改自家模型輸出:card 說明 rubric 欄位可用整數字串 enum(如
["0", "1", "2"])搭配score_fields,並支援 probability-weighted expected scores,適合團隊把上千筆生成結果排序、挑出最差的來修。 - 需要格式穩定的大量分類:card 寫它「scores the allowed answer tokens directly」,流程不產生推理或自由格式答案,不會像 prompt 一個大模型當 judge 那樣偶爾吐出解析不了的 JSON。
- 跑得動嗎:官方 card 對硬體只寫一句「Use a CUDA GPU with BF16 support」,原始訓練跑在 PyTorch 2.8.0 加 CUDA 12.8,沒有標示 VRAM 數字。可確定的是 adapter 本身約 165 MiB,但實際使用還要另外載入 Qwen3.5-9B 底模;Mac 或純 CPU 能不能跑,官方沒有寫。
- 本期聲量:HF 熱度 139,下載量 1.1k,讚數 141。
- 跟同類比:要講清楚的是,官方 card 沒有列任何 benchmark,也沒有跟其他模型或做法做比較,訓練資料與方法同樣未說明。唯一能引述的差異來自 card 自述的機制:直接對允許的答案 token 打分、流程中不產生推理內容,這跟一般「prompt 一個大模型當 judge、再解析它吐出來的 JSON」的路線不同。
- 怎麼取得:官方 card 給兩條路,peft 路線是
AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-9B")後接PeftModel.from_pretrained(base_model, "bespokelabs/Bespoke-Nimble-9B");另一條是 repo 附的封裝NimbleModel("nimble-model").score(context=..., schema=...),schema 支援 boolean、enum 與 rubric 分數欄位。 - 連結:huggingface.co/bespokelabs/Bespoke-Nimble-9B
結尾段落
這期最有意思的共同點是「判斷型」模型正在冒頭:laya 跟 Bespoke-Nimble-9B 都不生成文字,只負責路由、打分、擋請求,這種形狀特別適合地端,因為不需要長脈絡也不需要昂貴推論。至於本期唯一「一般機器真的扛得住」的多模態旗艦,就是下載破 700 萬次的 Qwen3.8-27B。下集再帶你挖新的地端模型。




























留言