開場白
這期 Hugging Face 熱度冠軍 Contrastive-LM/CLM-v0.1-8B 不生成文字,靠打分數就讓延遲最多砍 9 倍。同場還有專攻路由審核的 LoRA interfaze-ai/lev,跟免顯卡也能跑的小模型 SupersonicLabs/Julia-1。它憑什麼撐住 52 種語言分類,等一下告訴你。
本期精選
1. Contrastive-LM/CLM-v0.1-8B:不寫字、只對候選打分的排序器
- 這是什麼:CLM-v0.1-8B 不是用來生成文字的模型,官方說明是把兩個投影頭疊在凍結的 Qwen3-8B 上,專門對「候選項」打分數,用在重排序、動作選擇、驗證這類任務。8B 參數,Apache-2.0 授權,可自由商用。
- 能用在哪些場景:
- 自架 RAG 的後端工程師:向量檢索一次撈回上百段候選片段,塞進大模型前可以先用 CLM 重排序、只留前幾段;官方 README 強調 state 與 action 是分開編碼的,action 的 embedding「their embeddings are cached and reused independently」,同一批文件片段重複查詢時不用重算。
- 在本機跑 tool-calling agent 的人:每一步要從十幾個工具裡挑一個,可以改成把候選動作丟給 CLM 打機率分數,不用再叫 LLM 生一段 JSON 出來解析;官方 model card 寫零樣本情況下「on par with Jev on computer-use, gaming and tool-calling tasks, with up to 9× lower latency」。
- 做 coding agent 的人:拿它當驗證器,同一個問題產生多個修補方案後用來挑一個;官方標示微調成 verifier 後「SOTA on DeepSWE (81.6%) and Terminal-Bench 2.1 (87.6%), 4–6× faster than Jev」。
- 跑得動嗎:官方未標示 VRAM 數字。GitHub README 提到要另外起一個 encoder:
vllm serve Qwen/Qwen3-8B --runner pooling --max-model-len 2048,並寫「States longer than 2048 tokens are truncated. For longer states, raise both limits together...(needs more GPU memory)」;另外有 vector cache 會預留 GPU 記憶體保留 state/action embedding,官方稱重訪同一個 state 時「2.8x faster」。量化版本官方未標示,CPU 模式雖然有--device cpu旗標,但官方沒給任何效能說明。 - 本期聲量:HF 熱度 543(2.4k 次下載、552 個讚),本期選題第一名。
- 跟同類比:跟同類的 Jev 相比,官方 model card 自己的說法是賣點不是準確率而是延遲:零樣本表現與 Jev 相當,延遲最多低 9 倍,約 1k 候選時「13× faster than Jev」。架構上是把兩個投影頭疊在凍結的 Qwen3-8B 上,不是重新訓練一個大模型。以上皆為作者自述,尚未見第三方獨立複測。
- 怎麼取得:README 寫的是
pip install contrastive-lm,先用 vLLM 把 Qwen3-8B 以 pooling 模式起在 8090 埠當編碼器,再執行clm-serve,就會在 http://localhost:8700/ 開一個 API 供 rank、查詢使用。 - 連結:Contrastive-LM/CLM-v0.1-8B
2. interfaze-ai/lev:200 MB 的 LoRA,接手路由與審核判斷
- 這是什麼:lev 是掛在 Qwen3.5-4B 上的 LoRA/adapter,主檔約 200 MB,做的是路由、審核、意圖偵測這類「從候選裡選一個」的判斷任務,不是生成長文。授權 Apache-2.0。
- 能用在哪些場景:
- SaaS 後端做意圖路由:使用者訊息進來要決定丟給哪一條處理管線,用它一次前向傳播就能拿到各選項機率,不必等大模型吐完一段文字再解析;官方 model card 列的用途就包含「routing, moderation, intent detection, triage, grading」。
- UGC 平台的留言審核:每天大量留言要先過一層機器判斷再送人工,官方說明它回傳的是校準過的機率(calibrated probabilities)而不是生成的解釋,方便直接設閾值分流。
- 檢查另一個大模型的輸出:把 LLM 產生的答案配上「有沒有回答到問題」這類是非題丟進去驗;官方把「checking LLM output」明列為設計用途,並標示在 FEVER 這類主張驗證任務上得分 0.872。
- 跑得動嗎:官方 model card 寫「for real-time use, a CUDA GPU」,並標示底模下載量約 8 GB、adapter 本身約 200 MB。量化選項官方未標示。
- 本期聲量:HF 熱度 94(480 次下載、98 個讚),本期唯一的 LoRA/adapter 候選。
- 跟同類比:難得的是作者自己在卡片上就認輸,標示自身在 13 個 S1Bench 子集上的 macro accuracy 是 0.689,對照 Jev 的 0.761。它賣的不是最高分,而是用 200 MB adapter 去逼近體積大得多的專用模型(同期候選 Jev-Omni 是 12B,官方標示 FP32 權重約 50 GB)。分數皆為作者自述。
- 怎麼取得:README 給的是標準 PEFT 兩行:
AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-4B")之後接PeftModel.from_pretrained(base_model, "interfaze-ai/lev");官方另外提供自家套件寫法lev.load("interfaze-ai/lev")。授權 Apache-2.0,權重可直接下載,無需申請。 - 連結:interfaze-ai/lev
3. SupersonicLabs/Julia-1:144.3M 參數、CPU 就能跑的多語系分類器
- 這是什麼:Julia-1 底層是多語系的 mmBERT-small,144.3M 參數,做的是狀態/問題/選項式的分類判斷。官方標示 FP32 權重只佔 550.5 MiB,授權 Apache 2.0。
- 能用在哪些場景:
- 沒有獨顯的開發者:手上只有便宜 VPS 或沒有獨顯,可以把客服工單、表單自動分類直接跑在 CPU 上;官方寫「CPU inference works with the standard PyTorch installation; no native router build is needed」,不需要為了一個分類器去租 GPU。
- 多語系產品的意圖分類:官方標示在 MASSIVE 基準的「all 52 locales」上 macro accuracy 71.50%,並列出 en-US 86.75%、pt-PT 86.25% 等單語結果,適合一套模型同時吃多國語言的客服或 App 後端。
- 內部工具的布林閘門:官方列出
noul模式專做布林判斷、choice模式支援 2 到 20 個選項,可以拿來判斷「這封信要不要升級處理」這種每天跑幾萬次、用大模型太貴的小決策。
- 跑得動嗎:官方 model card 標示「The FP32 weights occupy 550.5 MiB; allow additional memory for the tokenizer and activations.」CPU 推論用標準 PyTorch 安裝即可;要用 CUDA 則需要 BF16-capable 的 GPU。輸入上限官方寫的是 8,192 token 的 state/question/options 合計長度。
- 本期聲量:HF 熱度 297(2.2k 次下載、305 個讚)。
- 跟同類比:同期高聲量的決策型模型多半 8B 到 12B 起跳(像本期的 CLM-8B、Jev-Omni 12B),Julia-1 的 144.3M 差了一到兩個數量級。代價作者自己也寫明了:它「cannot reliably supply missing facts, solve algebraic equations, or carry a long chain of calculations」,而且「is not a drop-in Transformers text-classification pipeline」,得照它自己的 API 接。皆為官方卡片上的自述。
- 怎麼取得:官方說明是下載 repo 後
python -m pip install -e ./Julia-1,再用load_model("Julia-1", device="cpu", max_length=8192)載入;model card 特別提醒「Download the actual weights, not a Git LFS pointer」。授權 Apache 2.0,無需申請。 - 連結:SupersonicLabs/Julia-1
結尾段落
這三個模型有個共同點:都不是拿來聊天的通用生成模型,而是幫系統做選擇、打分數、分類這種高頻小判斷,省下每次都要叫大模型出馬的成本。如果只能先挑一個動手,CLM-v0.1-8B 的 RAG 重排序場景,大概是台灣工程師最快能接上的一塊拼圖。下集見。



























留言