開場白
這集下載數最驚人的不是聊天模型,是一顆已經破 90 萬次下載的決策 LoRA:GEV-26B-Decide,讓 agent 自己判斷要不要多想一下,開了推理之後差多少等一下告訴你。另外還有能在 CPU 上跑的語音辨識 moondream/parakeet-redux,跟記憶體只要 1.6 GB 的超輕量決策模型 Phocinae-Largha-150M-v1。
本集工商:PremLogin 雙十國慶限時優惠
- 活動期間:2026/10/10 至 10/18
- 內容:指定年費方案買 12 個月送 1 個月,共可使用 13 個月
- 指定產品:Netflix、YouTube、Disney+、HBO Max、Amazon Prime、Spotify、Tidal、Canva Pro、Office 365、Duolingo,以及 ChatGPT、Grok、Perplexity 的指定方案
- 不適用:ChatGPT、Grok、Perplexity 的獨立帳號及代儲值方案,Claude 代儲值方案
- 新客首單優惠碼:
markku666(九五折,能否與活動併用以結帳頁為準) - 活動連結:https://premlogin.com/zh-TW/?aff=hrQOPI0r(推廣連結)
- 完整介紹與風險說明:https://blog.markkulab.net/premlogin
PremLogin 是第三方訂閱合租平台,賣的是共享席位,不是官方授權經銷,下單前請先看清楚使用規則。
本期精選
1. moondream/parakeet-redux:178 MB、沒顯卡也能跑的語音辨識模型
- 這是什麼:一款語音辨識(ASR)模型,官方 model card 標示是把 parakeet-tdt-0.6b-v3 轉成 1.58-bit 三值權重(只有 −1、0、+1 三種值)的版本,參數量標示為 0.1B,權重檔案只有 178 MB,授權是 CC-BY-4.0。
- 能用在哪些場景:
- 手上積了一堆英文 conference talk 或線上課程影片,想在沒有獨立顯卡的 NAS、舊筆電上批次跑出字幕檔。model card 說支援 segment 或 word level 時間戳,正好拿來產字幕軸。
- 做語音筆記或錄音 App 的工程師想把轉錄做成離線功能,不把使用者錄音送上雲端 API。178 MB 的體積加上 Photon runtime(官方寫的是「AVX-512 VNNI on x86, NEON on ARM, Metal on Apple GPUs」),可以直接包進桌面或行動端程式。
- 要處理數小時長的訪談或會議錄音。model card 提到內建 voice-activity detection 負責長音檔切段,並列出長音檔(TED-LIUM)WER 2.51。
- 要先說清楚:官方列出的 25 種支援語言裡沒有中文,所以它是處理英文與歐語素材的工具,不是中文轉錄方案。
- 跑得動嗎:官方 model card 的範例程式用的是
device="cpu",走 Photon runtime;VRAM 需求官方沒有標示,但從 178 MB 的三值權重與 0.1B 參數量來看,門檻應該是這期最低的一個。 - 本期聲量:HF 熱度 88,14.1k 次下載、265 個讚。
- 跟同類比:跟自己的原版 parakeet-tdt-0.6b-v3 相比,model card 寫的是在 FLEURS 與長音檔上勝過原版,英文「stays within 0.3 WER of the original」,但吵雜環境較差(9.04 對 6.72)。跟 Whisper 的比較,model card 沒有提供。
- 怎麼取得:README 的範例是先
import moondream as md,再用with md.photon("moondream/parakeet-redux", device="cpu") as speech載入,接著呼叫speech.transcribe(audio="speech.wav")取回result["text"]。 - 連結:huggingface.co/moondream/parakeet-redux
2. autotrust/GEV-26B-Decide:讓 agent 自己判斷要不要多想一下的決策 LoRA
- 這是什麼:這不是別人權重的重打包,是作者自己在 Gemma-4-26B-A4B-it 上訓練的 LoRA adapter 加決策頭,專門做結構化決策任務,支援 yes/no、2 到 256 個選項、以及 0 到 5 的評分任務,官方寫的授權是 apache-2.0(但只限 adapter、head 與 calibration 檔,底模仍受 Gemma 4 條款約束)。
- 能用在哪些場景:
- 寫 agent 的開發者想讓系統自己判斷「這題我要不要多想一下」。model card 說它有 adaptive thinking,只在不確定時才開推理,並列出開了之後 GPQA Diamond 從 42.9% 升到 78.6%、CRUXEval 從 67.5% 升到 90.7%,而純 System 1 處理一筆決策約 45 ms。
- 做 computer-use 或 GUI 自動化的人要挑一顆負責「下一步點哪裡」的模型。model card 的比較表寫 computer-use 成功率與 JEV-27B-VL 同為 95%,但每次點擊 85 ms 對 260 ms,快了不少。
- 需要同一套權重同時吃文字與截圖做判斷的團隊。model card 寫的是「One set of weights, one vLLM engine, for text and images」。
- 跑得動嗎:官方沒有標示明確的 VRAM 門檻,model card 只說測試用一張 B200。可查到的規格是底模「on Gemma-4-26B-A4B-it(26 B parameters, ≈ 4 B active per token)」的 MoE 架構,決策頭是獨立的 24-slot fp32 head。要跑起來,card 另外註明 vLLM 要有 Gemma-4 支援,還要針對 tied lm_head 做 LoRA 的 patch。
- 本期聲量:HF 熱度 1777,909.8k 次下載、2.1k 個讚,是本期聲量最高的一個;同家族另外有 2 個量化/重打包版本。
- 跟同類比:model card 自己點名 JEV-27B-VL 做比較,computer-use 任務兩邊成功率都是 95%,但它每次點擊快了不少;不過換到機械手臂 pick-and-place 任務就反過來,成功率 40% 對 75% 落後。
- 怎麼取得:README 給的是兩行,
hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide,接著bash GEV-26B-Decide/serve.sh把 vLLM 起在:8000;card 也提供 transformers 加 peft 的 System 1 推論程式碼當替代路徑。 - 連結:huggingface.co/autotrust/GEV-26B-Decide
3. Phocinae/Phocinae-Largha-150M-v1:144M 參數的輕量決策模型,連 CPU 都扛得住
- 這是什麼:一款只有 144.3M 參數、權重 288.6 MB 的小模型,授權 Apache-2.0,底層 encoder 用的是 mmBERT-small(MIT 授權),專門做 typed decisions(approval gate、分流這類任務)。
- 能用在哪些場景:
- 寫 AI agent 的工程師想在每次 tool call 前加一道 approval gate。model card 說它「one forward pass per decision」,會回傳帶信心分數的答案,官方量到的是 fp16 在 RTX 5090 上每筆決策 21.0 ms,而對照的雲端 API 是 1.5 秒以上。
- 客服或工單系統要做 document triage 與自動分流。model card 寫明用途就是 approval gates、tool routing、escalation 與 document triage,支援 yes/no、2 到 10 個選項與評分任務;中文方面 card 列出 typed-decisions 中文分數 0.848(card 也註明測試題是機器翻譯的,要留意這個前提)。
- 預算有限、手上只有小型 VPS 或純 CPU 機器的團隊。card 標示推論峰值 VRAM 只要 1.6 GB,連 CPU 單執行緒都能跑,只是每筆要 1.64 秒。
- 跑得動嗎:官方標示 1.6 GB inference peak VRAM,GPU fp16 情況下是 21.0 ms(RTX 5090),CPU 單執行緒則是 1.64 秒一筆;這期三顆裡門檻最低的其中一個。
- 本期聲量:HF 熱度 107,89 次下載、117 個讚。
- 跟同類比:card 自己列的 typed-decisions zero-shot 對照是 Laya 0.766、JEV 0.727、meraGPT 0.768,而它的專用版本拿到 0.906,不過 card 有註明這個數字是 fitted on the training split,不是 zero-shot 的結果。值得一提的是,同一張 card 也主動揭露自己在 JevBench public-231 只拿到 0.5455(126/231),低於 58.4% 的過關門檻,算是誠實標示自己沒過的 benchmark。
- 怎麼取得:README 的流程是
hf download Phocinae/Phocinae-Largha-150M-v1 --local-dir ./largha取權重,再pip install phocinae-server、用PHOC_MODEL_DIR=./largha python -m phocinae.main起服務;也可以直接用 Python API 的Engine("./largha", device="auto")呼叫eng.run(state, questions)。 - 連結:huggingface.co/Phocinae/Phocinae-Largha-150M-v1
結尾段落
這三顆剛好對到 agent 開發的不同痛點:GEV-26B-Decide 用大參數換高精度判斷,Phocinae-Largha-150M-v1 用極低門檻換便宜的 approval gate,moondream/parakeet-redux 則是讓離線語音轉錄不用再求雲端 API。如果你手上沒有顯卡又想先試一顆,Phocinae-Largha-150M-v1 大概是門檻最低的起點。下集再跟大家聊聊地端又挖到什麼寶。



























留言