Mark Ku's Blog

站長的公司

Vibe Coding 架構規劃與陪跑

團隊已經用 AI 做出小工具,卻怕壞了沒人修、需求一變就不敢改?226 Network 幫你把程式放進 Git、密碼另外保管、排程搬上固定主機,再補上交接文件與測試。

開場白

這集下載數最驚人的不是聊天模型,是一顆已經破 90 萬次下載的決策 LoRA:GEV-26B-Decide,讓 agent 自己判斷要不要多想一下,開了推理之後差多少等一下告訴你。另外還有能在 CPU 上跑的語音辨識 moondream/parakeet-redux,跟記憶體只要 1.6 GB 的超輕量決策模型 Phocinae-Largha-150M-v1。

本集工商:PremLogin 雙十國慶限時優惠

  • 活動期間:2026/10/10 至 10/18
  • 內容:指定年費方案買 12 個月送 1 個月,共可使用 13 個月
  • 指定產品:Netflix、YouTube、Disney+、HBO Max、Amazon Prime、Spotify、Tidal、Canva Pro、Office 365、Duolingo,以及 ChatGPT、Grok、Perplexity 的指定方案
  • 不適用:ChatGPT、Grok、Perplexity 的獨立帳號及代儲值方案,Claude 代儲值方案
  • 新客首單優惠碼:markku666(九五折,能否與活動併用以結帳頁為準)
  • 活動連結:https://premlogin.com/zh-TW/?aff=hrQOPI0r(推廣連結)
  • 完整介紹與風險說明:https://blog.markkulab.net/premlogin

PremLogin 是第三方訂閱合租平台,賣的是共享席位,不是官方授權經銷,下單前請先看清楚使用規則。

本期精選

1. moondream/parakeet-redux:178 MB、沒顯卡也能跑的語音辨識模型

  • 這是什麼:一款語音辨識(ASR)模型,官方 model card 標示是把 parakeet-tdt-0.6b-v3 轉成 1.58-bit 三值權重(只有 −1、0、+1 三種值)的版本,參數量標示為 0.1B,權重檔案只有 178 MB,授權是 CC-BY-4.0。
  • 能用在哪些場景:
    • 手上積了一堆英文 conference talk 或線上課程影片,想在沒有獨立顯卡的 NAS、舊筆電上批次跑出字幕檔。model card 說支援 segment 或 word level 時間戳,正好拿來產字幕軸。
    • 做語音筆記或錄音 App 的工程師想把轉錄做成離線功能,不把使用者錄音送上雲端 API。178 MB 的體積加上 Photon runtime(官方寫的是「AVX-512 VNNI on x86, NEON on ARM, Metal on Apple GPUs」),可以直接包進桌面或行動端程式。
    • 要處理數小時長的訪談或會議錄音。model card 提到內建 voice-activity detection 負責長音檔切段,並列出長音檔(TED-LIUM)WER 2.51。
    • 要先說清楚:官方列出的 25 種支援語言裡沒有中文,所以它是處理英文與歐語素材的工具,不是中文轉錄方案。
  • 跑得動嗎:官方 model card 的範例程式用的是 device="cpu",走 Photon runtime;VRAM 需求官方沒有標示,但從 178 MB 的三值權重與 0.1B 參數量來看,門檻應該是這期最低的一個。
  • 本期聲量:HF 熱度 88,14.1k 次下載、265 個讚。
  • 跟同類比:跟自己的原版 parakeet-tdt-0.6b-v3 相比,model card 寫的是在 FLEURS 與長音檔上勝過原版,英文「stays within 0.3 WER of the original」,但吵雜環境較差(9.04 對 6.72)。跟 Whisper 的比較,model card 沒有提供。
  • 怎麼取得:README 的範例是先 import moondream as md,再用 with md.photon("moondream/parakeet-redux", device="cpu") as speech 載入,接著呼叫 speech.transcribe(audio="speech.wav") 取回 result["text"]。
  • 連結:huggingface.co/moondream/parakeet-redux

2. autotrust/GEV-26B-Decide:讓 agent 自己判斷要不要多想一下的決策 LoRA

  • 這是什麼:這不是別人權重的重打包,是作者自己在 Gemma-4-26B-A4B-it 上訓練的 LoRA adapter 加決策頭,專門做結構化決策任務,支援 yes/no、2 到 256 個選項、以及 0 到 5 的評分任務,官方寫的授權是 apache-2.0(但只限 adapter、head 與 calibration 檔,底模仍受 Gemma 4 條款約束)。
  • 能用在哪些場景:
    • 寫 agent 的開發者想讓系統自己判斷「這題我要不要多想一下」。model card 說它有 adaptive thinking,只在不確定時才開推理,並列出開了之後 GPQA Diamond 從 42.9% 升到 78.6%、CRUXEval 從 67.5% 升到 90.7%,而純 System 1 處理一筆決策約 45 ms。
    • 做 computer-use 或 GUI 自動化的人要挑一顆負責「下一步點哪裡」的模型。model card 的比較表寫 computer-use 成功率與 JEV-27B-VL 同為 95%,但每次點擊 85 ms 對 260 ms,快了不少。
    • 需要同一套權重同時吃文字與截圖做判斷的團隊。model card 寫的是「One set of weights, one vLLM engine, for text and images」。
  • 跑得動嗎:官方沒有標示明確的 VRAM 門檻,model card 只說測試用一張 B200。可查到的規格是底模「on Gemma-4-26B-A4B-it(26 B parameters, ≈ 4 B active per token)」的 MoE 架構,決策頭是獨立的 24-slot fp32 head。要跑起來,card 另外註明 vLLM 要有 Gemma-4 支援,還要針對 tied lm_head 做 LoRA 的 patch。
  • 本期聲量:HF 熱度 1777,909.8k 次下載、2.1k 個讚,是本期聲量最高的一個;同家族另外有 2 個量化/重打包版本。
  • 跟同類比:model card 自己點名 JEV-27B-VL 做比較,computer-use 任務兩邊成功率都是 95%,但它每次點擊快了不少;不過換到機械手臂 pick-and-place 任務就反過來,成功率 40% 對 75% 落後。
  • 怎麼取得:README 給的是兩行,hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide,接著 bash GEV-26B-Decide/serve.sh 把 vLLM 起在 :8000;card 也提供 transformers 加 peft 的 System 1 推論程式碼當替代路徑。
  • 連結:huggingface.co/autotrust/GEV-26B-Decide

3. Phocinae/Phocinae-Largha-150M-v1:144M 參數的輕量決策模型,連 CPU 都扛得住

  • 這是什麼:一款只有 144.3M 參數、權重 288.6 MB 的小模型,授權 Apache-2.0,底層 encoder 用的是 mmBERT-small(MIT 授權),專門做 typed decisions(approval gate、分流這類任務)。
  • 能用在哪些場景:
    • 寫 AI agent 的工程師想在每次 tool call 前加一道 approval gate。model card 說它「one forward pass per decision」,會回傳帶信心分數的答案,官方量到的是 fp16 在 RTX 5090 上每筆決策 21.0 ms,而對照的雲端 API 是 1.5 秒以上。
    • 客服或工單系統要做 document triage 與自動分流。model card 寫明用途就是 approval gates、tool routing、escalation 與 document triage,支援 yes/no、2 到 10 個選項與評分任務;中文方面 card 列出 typed-decisions 中文分數 0.848(card 也註明測試題是機器翻譯的,要留意這個前提)。
    • 預算有限、手上只有小型 VPS 或純 CPU 機器的團隊。card 標示推論峰值 VRAM 只要 1.6 GB,連 CPU 單執行緒都能跑,只是每筆要 1.64 秒。
  • 跑得動嗎:官方標示 1.6 GB inference peak VRAM,GPU fp16 情況下是 21.0 ms(RTX 5090),CPU 單執行緒則是 1.64 秒一筆;這期三顆裡門檻最低的其中一個。
  • 本期聲量:HF 熱度 107,89 次下載、117 個讚。
  • 跟同類比:card 自己列的 typed-decisions zero-shot 對照是 Laya 0.766、JEV 0.727、meraGPT 0.768,而它的專用版本拿到 0.906,不過 card 有註明這個數字是 fitted on the training split,不是 zero-shot 的結果。值得一提的是,同一張 card 也主動揭露自己在 JevBench public-231 只拿到 0.5455(126/231),低於 58.4% 的過關門檻,算是誠實標示自己沒過的 benchmark。
  • 怎麼取得:README 的流程是 hf download Phocinae/Phocinae-Largha-150M-v1 --local-dir ./largha 取權重,再 pip install phocinae-server、用 PHOC_MODEL_DIR=./largha python -m phocinae.main 起服務;也可以直接用 Python API 的 Engine("./largha", device="auto") 呼叫 eng.run(state, questions)。
  • 連結:huggingface.co/Phocinae/Phocinae-Largha-150M-v1

結尾段落

這三顆剛好對到 agent 開發的不同痛點:GEV-26B-Decide 用大參數換高精度判斷,Phocinae-Largha-150M-v1 用極低門檻換便宜的 approval gate,moondream/parakeet-redux 則是讓離線語音轉錄不用再求雲端 API。如果你手上沒有顯卡又想先試一顆,Phocinae-Largha-150M-v1 大概是門檻最低的起點。下集再跟大家聊聊地端又挖到什麼寶。

作者

Mark Ku

10 年以上的軟體工程師,做過北美電商與 AI SaaS 訂閱收費系統。閱讀更多

覺得這篇有幫助?

作者做的免費工具、每日 Podcast 與電子報,都在這裡。

Mark Ku · 本文採用 CC BY 4.0 授權,轉載請註明作者並附上原文連結。

留言

訂閱電子報

訂閱後即時收到新文章通知,不錯過任何技術分享。

提交即表示同意接收電子報,隨時可。

熱門文章

View all
Mark Ku
··637

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案
Mark Ku
··472

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南
Mark Ku
··268

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略
Mark Ku
··215

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1
Mark Ku
··210

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調
Mark Ku
··209

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取