---
title: "🧪 CLM-v0.1-8B 不生成文字只打分數，延遲最多砍 9 倍｜地端 AI 實驗室"
description: "這期 Hugging Face 熱度冠軍 Contrastive-LM/CLM-v0.1-8B 不生成文字，靠打分數就讓延遲最多砍 9 倍。同場還有專攻路由審核的 LoRA interfaze-ai/lev，跟免顯卡也能跑的小模型 SupersonicLabs/Julia-1。它憑什麼撐住 52 種語言分類，等一下告訴你。"
canonical_url: "https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-09-30"
author: "Mark Ku"
author_url: "https://blog.markkulab.net/author/mark-ku"
site: "Mark Ku's Blog"
date_published: "2026-09-30T02:00:00.000Z"
category: "地端 AI 實驗室"
tags: ["local-ai", "podcast", "地端模型", "lora", "開源模型", "Contrastive-LM", "CLM-v0.1-8B", "interfaze-ai", "lev", "LoRA", "SupersonicLabs"]
language: "zh-TW"
license: "CC BY 4.0"
license_url: "https://creativecommons.org/licenses/by/4.0/"
attribution: "轉載或引用請註明作者並附上原文連結"
---

# 🧪 CLM-v0.1-8B 不生成文字只打分數，延遲最多砍 9 倍｜地端 AI 實驗室

> **TL;DR** — CLM-v0.1-8B 是凍結 Qwen3-8B 加兩個投影頭的排序器，不生成文字只對候選項打分數，在重排序、工具選擇、驗證任務上延遲最多低 9 倍。interfaze-ai/lev 是 200 MB LoRA，掛在 Qwen3.5-4B 上做路由審核判斷，macro accuracy 0.689。SupersonicLabs/Julia-1 則是 144.

## 開場白

這期 Hugging Face 熱度冠軍 Contrastive-LM/CLM-v0.1-8B 不生成文字，靠打分數就讓延遲最多砍 9 倍。同場還有專攻路由審核的 LoRA interfaze-ai/lev，跟免顯卡也能跑的小模型 SupersonicLabs/Julia-1。它憑什麼撐住 52 種語言分類，等一下告訴你。

## 本期精選

### 1. Contrastive-LM/CLM-v0.1-8B：不寫字、只對候選打分的排序器

- **這是什麼**：CLM-v0.1-8B 不是用來生成文字的模型，官方說明是把兩個投影頭疊在凍結的 Qwen3-8B 上，專門對「候選項」打分數，用在重排序、動作選擇、驗證這類任務。8B 參數，Apache-2.0 授權，可自由商用。
- **能用在哪些場景**：
  - 自架 RAG 的後端工程師：向量檢索一次撈回上百段候選片段，塞進大模型前可以先用 CLM 重排序、只留前幾段；官方 README 強調 state 與 action 是分開編碼的，action 的 embedding「their embeddings are cached and reused independently」，同一批文件片段重複查詢時不用重算。
  - 在本機跑 tool-calling agent 的人：每一步要從十幾個工具裡挑一個，可以改成把候選動作丟給 CLM 打機率分數，不用再叫 LLM 生一段 JSON 出來解析；官方 model card 寫零樣本情況下「on par with Jev on computer-use, gaming and tool-calling tasks, with up to 9× lower latency」。
  - 做 coding agent 的人：拿它當驗證器，同一個問題產生多個修補方案後用來挑一個；官方標示微調成 verifier 後「SOTA on DeepSWE (81.6%) and Terminal-Bench 2.1 (87.6%), 4–6× faster than Jev」。
- **跑得動嗎**：官方未標示 VRAM 數字。GitHub README 提到要另外起一個 encoder：`vllm serve Qwen/Qwen3-8B --runner pooling --max-model-len 2048`，並寫「States longer than 2048 tokens are truncated. For longer states, raise both limits together...(needs more GPU memory)」；另外有 vector cache 會預留 GPU 記憶體保留 state／action embedding，官方稱重訪同一個 state 時「2.8x faster」。量化版本官方未標示，CPU 模式雖然有 `--device cpu` 旗標，但官方沒給任何效能說明。
- **本期聲量**：HF 熱度 543（2.4k 次下載、552 個讚），本期選題第一名。
- **跟同類比**：跟同類的 Jev 相比，官方 model card 自己的說法是賣點不是準確率而是延遲：零樣本表現與 Jev 相當，延遲最多低 9 倍，約 1k 候選時「13× faster than Jev」。架構上是把兩個投影頭疊在凍結的 Qwen3-8B 上，不是重新訓練一個大模型。以上皆為作者自述，尚未見第三方獨立複測。
- **怎麼取得**：README 寫的是 `pip install contrastive-lm`，先用 vLLM 把 Qwen3-8B 以 pooling 模式起在 8090 埠當編碼器，再執行 `clm-serve`，就會在 http://localhost:8700/ 開一個 API 供 rank、查詢使用。
- **連結**：[Contrastive-LM/CLM-v0.1-8B](https://huggingface.co/Contrastive-LM/CLM-v0.1-8B)

### 2. interfaze-ai/lev：200 MB 的 LoRA，接手路由與審核判斷

- **這是什麼**：lev 是掛在 Qwen3.5-4B 上的 LoRA／adapter，主檔約 200 MB，做的是路由、審核、意圖偵測這類「從候選裡選一個」的判斷任務，不是生成長文。授權 Apache-2.0。
- **能用在哪些場景**：
  - SaaS 後端做意圖路由：使用者訊息進來要決定丟給哪一條處理管線，用它一次前向傳播就能拿到各選項機率，不必等大模型吐完一段文字再解析；官方 model card 列的用途就包含「routing, moderation, intent detection, triage, grading」。
  - UGC 平台的留言審核：每天大量留言要先過一層機器判斷再送人工，官方說明它回傳的是校準過的機率（calibrated probabilities）而不是生成的解釋，方便直接設閾值分流。
  - 檢查另一個大模型的輸出：把 LLM 產生的答案配上「有沒有回答到問題」這類是非題丟進去驗；官方把「checking LLM output」明列為設計用途，並標示在 FEVER 這類主張驗證任務上得分 0.872。
- **跑得動嗎**：官方 model card 寫「for real-time use, a CUDA GPU」，並標示底模下載量約 8 GB、adapter 本身約 200 MB。量化選項官方未標示。
- **本期聲量**：HF 熱度 94（480 次下載、98 個讚），本期唯一的 LoRA／adapter 候選。
- **跟同類比**：難得的是作者自己在卡片上就認輸，標示自身在 13 個 S1Bench 子集上的 macro accuracy 是 0.689，對照 Jev 的 0.761。它賣的不是最高分，而是用 200 MB adapter 去逼近體積大得多的專用模型（同期候選 Jev-Omni 是 12B，官方標示 FP32 權重約 50 GB）。分數皆為作者自述。
- **怎麼取得**：README 給的是標準 PEFT 兩行：`AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-4B")` 之後接 `PeftModel.from_pretrained(base_model, "interfaze-ai/lev")`；官方另外提供自家套件寫法 `lev.load("interfaze-ai/lev")`。授權 Apache-2.0，權重可直接下載，無需申請。
- **連結**：[interfaze-ai/lev](https://huggingface.co/interfaze-ai/lev)

### 3. SupersonicLabs/Julia-1：144.3M 參數、CPU 就能跑的多語系分類器

- **這是什麼**：Julia-1 底層是多語系的 mmBERT-small，144.3M 參數，做的是狀態／問題／選項式的分類判斷。官方標示 FP32 權重只佔 550.5 MiB，授權 Apache 2.0。
- **能用在哪些場景**：
  - 沒有獨顯的開發者：手上只有便宜 VPS 或沒有獨顯，可以把客服工單、表單自動分類直接跑在 CPU 上；官方寫「CPU inference works with the standard PyTorch installation; no native router build is needed」，不需要為了一個分類器去租 GPU。
  - 多語系產品的意圖分類：官方標示在 MASSIVE 基準的「all 52 locales」上 macro accuracy 71.50%，並列出 en-US 86.75%、pt-PT 86.25% 等單語結果，適合一套模型同時吃多國語言的客服或 App 後端。
  - 內部工具的布林閘門：官方列出 `noul` 模式專做布林判斷、`choice` 模式支援 2 到 20 個選項，可以拿來判斷「這封信要不要升級處理」這種每天跑幾萬次、用大模型太貴的小決策。
- **跑得動嗎**：官方 model card 標示「The FP32 weights occupy 550.5 MiB; allow additional memory for the tokenizer and activations.」CPU 推論用標準 PyTorch 安裝即可；要用 CUDA 則需要 BF16-capable 的 GPU。輸入上限官方寫的是 8,192 token 的 state／question／options 合計長度。
- **本期聲量**：HF 熱度 297（2.2k 次下載、305 個讚）。
- **跟同類比**：同期高聲量的決策型模型多半 8B 到 12B 起跳（像本期的 CLM-8B、Jev-Omni 12B），Julia-1 的 144.3M 差了一到兩個數量級。代價作者自己也寫明了：它「cannot reliably supply missing facts, solve algebraic equations, or carry a long chain of calculations」，而且「is not a drop-in Transformers text-classification pipeline」，得照它自己的 API 接。皆為官方卡片上的自述。
- **怎麼取得**：官方說明是下載 repo 後 `python -m pip install -e ./Julia-1`，再用 `load_model("Julia-1", device="cpu", max_length=8192)` 載入；model card 特別提醒「Download the actual weights, not a Git LFS pointer」。授權 Apache 2.0，無需申請。
- **連結**：[SupersonicLabs/Julia-1](https://huggingface.co/SupersonicLabs/Julia-1)

## 結尾段落

這三個模型有個共同點：都不是拿來聊天的通用生成模型，而是幫系統做選擇、打分數、分類這種高頻小判斷，省下每次都要叫大模型出馬的成本。如果只能先挑一個動手，CLM-v0.1-8B 的 RAG 重排序場景，大概是台灣工程師最快能接上的一塊拼圖。下集見。

---

## 關於本文與作者

本文出自 [Mark Ku's Blog](https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-09-30)

授權條款： [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) — 轉載或引用請註明作者並附上原文連結

### 關於作者

**[Mark Ku](https://blog.markkulab.net/author/mark-ku)** — 軟體工程師

- 10 年以上軟體工程師
- 做過北美電商與 AI SaaS 訂閱收費系統

### 作者開發的免費工具

以下工具皆可免費使用：

- [免費 PDF 簽名工具](https://blog.markkulab.net/tools/pdf-sign): 線上 PDF 簽名工具，瀏覽器內完成手繪、打字、上傳簽名，可拖曳放置、縮放、下載。所有處理都在你的裝置完成，檔案不會上傳。
- [VS Code Refactory](https://blog.markkulab.net/tools/refactory): Refactory 是一款 VS Code 重構擴充套件：34 個重構動作、37 條 code smell 檢查、Code Health 儀表板、18 種語言、534 支測試。懂你的專案慣例：介面放哪、DI 註冊寫在哪、'use client' 該不該加；還會用 git 修改頻率 × 複雜度排出「該先修哪個檔案」，並一鍵把壞味道交給你自己電腦上的 Claude Code 修。免費使用，原始碼不離開你的機器。
- [DB-Kit 資料庫管理工具](https://blog.markkulab.net/tools/db-kit): DB-Kit 是一個用 Tauri + Rust + React 打造的輕量跨平台資料庫管理工具，用單一一致的介面同時管理 MySQL、MariaDB、PostgreSQL、SQL Server、Oracle、SQLite、MongoDB、Redis、Kafka、Elasticsearch 與 RabbitMQ 十一種資料來源：連線密碼以 OS keychain 加密、SSH Tunnel、完整 CRUD、視覺化查詢建構器、多結果集同時顯示、跨連線資料傳輸、結構與資料比對（同步 SQL、結構快照）、Excel / CSV 匯入匯出、執行計畫視覺化、ER 圖、排程備份、SQL 壓力測試（p50～p99 延遲百分位）、15 條規則的 SQL 審查、執行前 AI 審查並逐句備份的「審查並執行」（自動產生回滾腳本）、Kafka 訊息瀏覽與監控告警；繁中 / 英文雙語介面，內建 AI 助手（本機 CLI 或 Anthropic / OpenAI 相容 API，自然語言生成 SQL、AI 審查與調校建議）與命令列工具 dbk。免費開源（MIT），提供 Windows / macOS / Linux 安裝檔。
- [VS Code Super Mermaid](https://blog.markkulab.net/tools/super-mermaid): Super Mermaid 是一款 VS Code 擴充套件：開箱即用的漂亮 Mermaid 圖表，自動上色、即時預覽、滑鼠平移縮放、PNG / SVG 高解析匯出，內建 21 種範本與多種主題。免費開源（MIT）。
- [React Super Mermaid](https://blog.markkulab.net/tools/react-super-mermaid): react-super-mermaid 是一個開源 React 元件庫：一行 <MermaidViewer> 即可渲染漂亮的 Mermaid 圖表，內建 colorful / sketch 主題、平移縮放、圖內搜尋、SVG / PNG 高解析匯出。輕量、SSR 安全、完整 TypeScript 型別。免費開源（MIT）。
- [Jira / Confluence Super Mermaid](https://blog.markkulab.net/tools/jira-super-mermaid): Atlassian Forge app：在 Jira issue 與 Confluence 內文直接寫 Mermaid 語法，畫流程圖、時序圖、狀態機與甘特圖。11 種圖表、SVG / PNG 匯出、明暗主題、完整中日韓文字支援。取得 Runs on Atlassian 資格：圖表存在你自己的站台，app 不呼叫任何第三方服務。免費，即將上架 Atlassian Marketplace。
- [Mermaid 線上預覽](https://blog.markkulab.net/tools/mermaid-preview): 在瀏覽器裡寫 Mermaid、即時看圖，整張圖表壓進網址就能分享。免註冊、不上傳伺服器，相容 mermaid.live 的分享連結。
- [React Intl Phone Number](https://blog.markkulab.net/tools/react-intl-phone-number): react-intl-phone-number 是一個開源 React 元件：framework-agnostic、不依賴 antd，提供 E.164 進出、可搜尋國旗 / 國碼下拉、可配置驗證等級（strict / mobile-strict / loose）、可主題化 CSS 與 i18n，電話邏輯由 google-libphonenumber 驅動。輕量、完整 TypeScript 型別。免費開源（MIT）。
- [Uptime Kuma Cluster](https://blog.markkulab.net/tools/uptime-kuma-cluster): 把單機版 Uptime Kuma 改造成高可用叢集：OpenResty + Lua 智慧負載平衡、MariaDB 共享狀態、健康檢查與自動 Failover，附叢集管理 REST API，一行 Docker Compose 啟動。免費開源（MIT）。
- [AI Podcast Cut 音檔剪輯](https://blog.markkulab.net/tools/ai-podcast-cut): 丟進一段錄音，AI 幫你剪掉「嗯、呃、那個」與講到一半重講的片段，平衡逐段音量，並派第二個 agent 覆核每一刀。辨識與去人聲都在你自己的電腦上跑，不上傳、不需要金鑰。剪點會貼齊字邊界與零交越、每一刀都有漸弱漸強，句尾還留得住呼吸感。Windows / macOS / Linux 桌面應用，MIT 開源，Windows 安裝檔內建 ffmpeg。
- [open-pos 開源餐飲 POS](https://blog.markkulab.net/tools/open-pos): 一台電腦加一台出單機就能開店。資料存在自己的硬碟裡、沒有月租、沒有綁約，MIT 全開源。金額用整數元依營業稅法拆算稅額，銷售額加稅額恆等於總額；出單走網路型 ESC/POS（TCP 9100），不必裝廠商驅動。Tauri + Rust + SQLite 桌面應用，v1.0 開發中。

### 每日 Podcast

- [Mark's Tech Insights 每日 AI 新鮮事](https://blog.markkulab.net/category/tech-news): 每日精選 AI 與科技趨勢，透過語音摘要快速掌握最新技術動態，涵蓋 AI 應用、軟體架構、DevOps 與工程實戰。 — RSS: https://blog.markkulab.net/feed.xml
- [AI股市蝦聊](https://blog.markkulab.net/category/ai-stock-chat): 每個交易日用 AI 分析台股盤勢，以雙人對話聊當天的盤中觀察與隔日預測。 — RSS: https://blog.markkulab.net/ai-stock-chat/feed.xml
- [開源好物週報](https://blog.markkulab.net/category/open-source-weekly): 每週從 Hacker News、GitHub、Reddit 聲量雷達精選免費開源工具，以雙人對話聊解決什麼痛點與怎麼快速上手。 — RSS: https://blog.markkulab.net/open-source-weekly/feed.xml
- [AI 運動週報](https://blog.markkulab.net/category/sports-weekly): 每週一、三、六以雙人對話聊 NBA、MLB 與國際體壇大事，台灣球迷視角，輕鬆有梗不酸人。 — RSS: https://blog.markkulab.net/sports-weekly/feed.xml
- [AI 國際新聞快報](https://blog.markkulab.net/category/world-news): 每天早上以雙人對話把過去一天的國際大事講白：政治外交、全球經濟、衝突與安全、災害與氣候，台灣視角、中立客觀、每則附出處。 — RSS: https://blog.markkulab.net/world-news/feed.xml
- [地端 AI 實驗室](https://blog.markkulab.net/category/local-ai-lab): 每週三、五精選可以下載到自己機器上跑的開源模型與 LoRA，用雙人對話講清楚能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪，規格一律引述官方 model card。 — RSS: https://blog.markkulab.net/local-ai-lab/feed.xml

### 站長優惠

- [Saily eSIM](https://blog.markkulab.net/saily): 出國旅遊上網 eSIM・NordVPN 團隊出品，優惠碼：KUKU
- [NordVPN](https://blog.markkulab.net/nordvpn): 全球最多人用的 VPN・獨立稽核無日誌
- [PremLogin](https://blog.markkulab.net/premlogin): 訂閱合租平台・串流與 AI 訂閱席位分攤，優惠碼：markku666

### 電子報

[訂閱電子報](https://blog.markkulab.net/subscribe) — 第一時間收到新文章通知，無垃圾信、隨時可取消訂閱。
