---
title: "🧪 這集下載數最驚人的不是聊天模型，是一顆決策 LoRA：GEV-26B-Decide 怎麼讓 agent 自己決定要不要多想｜地端 AI 實驗室"
description: "這集下載數最驚人的不是聊天模型，是一顆已經破 90 萬次下載的決策 LoRA：GEV-26B-Decide，讓 agent 自己判斷要不要多想一下，開了推理之後差多少等一下告訴你。另外還有能在 CPU 上跑的語音辨識 moondream/parakeet-redux，跟記憶體只要 1.6 GB 的超輕量決策模型 Phocinae-Largha-150M-v1。"
canonical_url: "https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-10-09"
author: "Mark Ku"
author_url: "https://blog.markkulab.net/author/mark-ku"
site: "Mark Ku's Blog"
date_published: "2026-10-09T02:00:00.000Z"
category: "地端 AI 實驗室"
tags: ["local-ai", "podcast", "地端模型", "lora", "開源模型", "moondream", "parakeet-redux", "GEV-26B-Decide", "Phocinae-Largha-150M-v1", "LoRA", "語音辨識"]
language: "zh-TW"
license: "CC BY 4.0"
license_url: "https://creativecommons.org/licenses/by/4.0/"
attribution: "轉載或引用請註明作者並附上原文連結"
---

# 🧪 這集下載數最驚人的不是聊天模型，是一顆決策 LoRA：GEV-26B-Decide 怎麼讓 agent 自己決定要不要多想｜地端 AI 實驗室

> **TL;DR** — GEV-26B-Decide 是破 90 萬下載的決策 LoRA，讓 agent 自動判斷是否需要延伸推理，在 GPQA Diamond 從 42.9% 升至 78.6%；moondream/parakeet-redux 是 178 MB 的離線語音辨識模型，可在 CPU 上轉錄英文音檔；Phocinae-Largha-150M-v1 只需 1.

## 開場白

這集下載數最驚人的不是聊天模型，是一顆已經破 90 萬次下載的決策 LoRA：GEV-26B-Decide，讓 agent 自己判斷要不要多想一下，開了推理之後差多少等一下告訴你。另外還有能在 CPU 上跑的語音辨識 moondream/parakeet-redux，跟記憶體只要 1.6 GB 的超輕量決策模型 Phocinae-Largha-150M-v1。

## 本集工商：PremLogin 雙十國慶限時優惠
- **活動期間**：2026/10/10 至 10/18
- **內容**：指定年費方案買 12 個月送 1 個月，共可使用 13 個月
- **指定產品**：Netflix、YouTube、Disney+、HBO Max、Amazon Prime、Spotify、Tidal、Canva Pro、Office 365、Duolingo，以及 ChatGPT、Grok、Perplexity 的指定方案
- **不適用**：ChatGPT、Grok、Perplexity 的獨立帳號及代儲值方案，Claude 代儲值方案
- **新客首單優惠碼**：`markku666`（九五折，能否與活動併用以結帳頁為準）
- **活動連結**：<https://premlogin.com/zh-TW/?aff=hrQOPI0r>（推廣連結）
- **完整介紹與風險說明**：<https://blog.markkulab.net/premlogin>

PremLogin 是第三方訂閱合租平台，賣的是共享席位，不是官方授權經銷，下單前請先看清楚使用規則。

## 本期精選

### 1. moondream/parakeet-redux：178 MB、沒顯卡也能跑的語音辨識模型

- **這是什麼**：一款語音辨識（ASR）模型，官方 model card 標示是把 parakeet-tdt-0.6b-v3 轉成 1.58-bit 三值權重（只有 −1、0、+1 三種值）的版本，參數量標示為 0.1B，權重檔案只有 178 MB，授權是 CC-BY-4.0。
- **能用在哪些場景**：
  - 手上積了一堆英文 conference talk 或線上課程影片，想在沒有獨立顯卡的 NAS、舊筆電上批次跑出字幕檔。model card 說支援 segment 或 word level 時間戳，正好拿來產字幕軸。
  - 做語音筆記或錄音 App 的工程師想把轉錄做成離線功能，不把使用者錄音送上雲端 API。178 MB 的體積加上 Photon runtime（官方寫的是「AVX-512 VNNI on x86, NEON on ARM, Metal on Apple GPUs」），可以直接包進桌面或行動端程式。
  - 要處理數小時長的訪談或會議錄音。model card 提到內建 voice-activity detection 負責長音檔切段，並列出長音檔（TED-LIUM）WER 2.51。
  - 要先說清楚：官方列出的 25 種支援語言裡沒有中文，所以它是處理英文與歐語素材的工具，不是中文轉錄方案。
- **跑得動嗎**：官方 model card 的範例程式用的是 `device="cpu"`，走 Photon runtime；VRAM 需求官方沒有標示，但從 178 MB 的三值權重與 0.1B 參數量來看，門檻應該是這期最低的一個。
- **本期聲量**：HF 熱度 88，14.1k 次下載、265 個讚。
- **跟同類比**：跟自己的原版 parakeet-tdt-0.6b-v3 相比，model card 寫的是在 FLEURS 與長音檔上勝過原版，英文「stays within 0.3 WER of the original」，但吵雜環境較差（9.04 對 6.72）。跟 Whisper 的比較，model card 沒有提供。
- **怎麼取得**：README 的範例是先 `import moondream as md`，再用 `with md.photon("moondream/parakeet-redux", device="cpu") as speech` 載入，接著呼叫 `speech.transcribe(audio="speech.wav")` 取回 `result["text"]`。
- **連結**：[huggingface.co/moondream/parakeet-redux](https://huggingface.co/moondream/parakeet-redux)

### 2. autotrust/GEV-26B-Decide：讓 agent 自己判斷要不要多想一下的決策 LoRA

- **這是什麼**：這不是別人權重的重打包，是作者自己在 Gemma-4-26B-A4B-it 上訓練的 LoRA adapter 加決策頭，專門做結構化決策任務，支援 yes/no、2 到 256 個選項、以及 0 到 5 的評分任務，官方寫的授權是 apache-2.0（但只限 adapter、head 與 calibration 檔，底模仍受 Gemma 4 條款約束）。
- **能用在哪些場景**：
  - 寫 agent 的開發者想讓系統自己判斷「這題我要不要多想一下」。model card 說它有 adaptive thinking，只在不確定時才開推理，並列出開了之後 GPQA Diamond 從 42.9% 升到 78.6%、CRUXEval 從 67.5% 升到 90.7%，而純 System 1 處理一筆決策約 45 ms。
  - 做 computer-use 或 GUI 自動化的人要挑一顆負責「下一步點哪裡」的模型。model card 的比較表寫 computer-use 成功率與 JEV-27B-VL 同為 95%，但每次點擊 85 ms 對 260 ms，快了不少。
  - 需要同一套權重同時吃文字與截圖做判斷的團隊。model card 寫的是「One set of weights, one vLLM engine, for text and images」。
- **跑得動嗎**：官方沒有標示明確的 VRAM 門檻，model card 只說測試用一張 B200。可查到的規格是底模「on Gemma-4-26B-A4B-it（26 B parameters, ≈ 4 B active per token）」的 MoE 架構，決策頭是獨立的 24-slot fp32 head。要跑起來，card 另外註明 vLLM 要有 Gemma-4 支援，還要針對 tied lm_head 做 LoRA 的 patch。
- **本期聲量**：HF 熱度 1777，909.8k 次下載、2.1k 個讚，是本期聲量最高的一個；同家族另外有 2 個量化／重打包版本。
- **跟同類比**：model card 自己點名 JEV-27B-VL 做比較，computer-use 任務兩邊成功率都是 95%，但它每次點擊快了不少；不過換到機械手臂 pick-and-place 任務就反過來，成功率 40% 對 75% 落後。
- **怎麼取得**：README 給的是兩行，`hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide`，接著 `bash GEV-26B-Decide/serve.sh` 把 vLLM 起在 `:8000`；card 也提供 transformers 加 peft 的 System 1 推論程式碼當替代路徑。
- **連結**：[huggingface.co/autotrust/GEV-26B-Decide](https://huggingface.co/autotrust/GEV-26B-Decide)

### 3. Phocinae/Phocinae-Largha-150M-v1：144M 參數的輕量決策模型，連 CPU 都扛得住

- **這是什麼**：一款只有 144.3M 參數、權重 288.6 MB 的小模型，授權 Apache-2.0，底層 encoder 用的是 mmBERT-small（MIT 授權），專門做 typed decisions（approval gate、分流這類任務）。
- **能用在哪些場景**：
  - 寫 AI agent 的工程師想在每次 tool call 前加一道 approval gate。model card 說它「one forward pass per decision」，會回傳帶信心分數的答案，官方量到的是 fp16 在 RTX 5090 上每筆決策 21.0 ms，而對照的雲端 API 是 1.5 秒以上。
  - 客服或工單系統要做 document triage 與自動分流。model card 寫明用途就是 approval gates、tool routing、escalation 與 document triage，支援 yes/no、2 到 10 個選項與評分任務；中文方面 card 列出 typed-decisions 中文分數 0.848（card 也註明測試題是機器翻譯的，要留意這個前提）。
  - 預算有限、手上只有小型 VPS 或純 CPU 機器的團隊。card 標示推論峰值 VRAM 只要 1.6 GB，連 CPU 單執行緒都能跑，只是每筆要 1.64 秒。
- **跑得動嗎**：官方標示 1.6 GB inference peak VRAM，GPU fp16 情況下是 21.0 ms（RTX 5090），CPU 單執行緒則是 1.64 秒一筆；這期三顆裡門檻最低的其中一個。
- **本期聲量**：HF 熱度 107，89 次下載、117 個讚。
- **跟同類比**：card 自己列的 typed-decisions zero-shot 對照是 Laya 0.766、JEV 0.727、meraGPT 0.768，而它的專用版本拿到 0.906，不過 card 有註明這個數字是 fitted on the training split，不是 zero-shot 的結果。值得一提的是，同一張 card 也主動揭露自己在 JevBench public-231 只拿到 0.5455（126/231），低於 58.4% 的過關門檻，算是誠實標示自己沒過的 benchmark。
- **怎麼取得**：README 的流程是 `hf download Phocinae/Phocinae-Largha-150M-v1 --local-dir ./largha` 取權重，再 `pip install phocinae-server`、用 `PHOC_MODEL_DIR=./largha python -m phocinae.main` 起服務；也可以直接用 Python API 的 `Engine("./largha", device="auto")` 呼叫 `eng.run(state, questions)`。
- **連結**：[huggingface.co/Phocinae/Phocinae-Largha-150M-v1](https://huggingface.co/Phocinae/Phocinae-Largha-150M-v1)

## 結尾段落

這三顆剛好對到 agent 開發的不同痛點：GEV-26B-Decide 用大參數換高精度判斷，Phocinae-Largha-150M-v1 用極低門檻換便宜的 approval gate，moondream/parakeet-redux 則是讓離線語音轉錄不用再求雲端 API。如果你手上沒有顯卡又想先試一顆，Phocinae-Largha-150M-v1 大概是門檻最低的起點。下集再跟大家聊聊地端又挖到什麼寶。

---

## 關於本文與作者

本文出自 [Mark Ku's Blog](https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-10-09)

授權條款： [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) — 轉載或引用請註明作者並附上原文連結

### 關於作者

**[Mark Ku](https://blog.markkulab.net/author/mark-ku)** — 軟體工程師

- 10 年以上軟體工程師
- 做過北美電商與 AI SaaS 訂閱收費系統

### 作者開發的免費工具

以下工具皆可免費使用：

- [免費 PDF 簽名工具](https://blog.markkulab.net/tools/pdf-sign): 線上 PDF 簽名工具，瀏覽器內完成手繪、打字、上傳簽名，可拖曳放置、縮放、下載。所有處理都在你的裝置完成，檔案不會上傳。
- [VS Code Refactory](https://blog.markkulab.net/tools/refactory): Refactory 是一款 VS Code 重構擴充套件：34 個重構動作、37 條 code smell 檢查、Code Health 儀表板、18 種語言、534 支測試。懂你的專案慣例：介面放哪、DI 註冊寫在哪、'use client' 該不該加；還會用 git 修改頻率 × 複雜度排出「該先修哪個檔案」，並一鍵把壞味道交給你自己電腦上的 Claude Code 修。免費使用，原始碼不離開你的機器。
- [DB-Kit 資料庫管理工具](https://blog.markkulab.net/tools/db-kit): DB-Kit 是一個用 Tauri + Rust + React 打造的輕量跨平台資料庫管理工具，用單一一致的介面同時管理 MySQL、MariaDB、PostgreSQL、SQL Server、Oracle、SQLite、MongoDB、Redis、Kafka、Elasticsearch 與 RabbitMQ 十一種資料來源：連線密碼以 OS keychain 加密、SSH Tunnel、完整 CRUD、視覺化查詢建構器、多結果集同時顯示、跨連線資料傳輸、結構與資料比對（同步 SQL、結構快照）、Excel / CSV 匯入匯出、執行計畫視覺化、ER 圖、排程備份、SQL 壓力測試（p50～p99 延遲百分位）、15 條規則的 SQL 審查、執行前 AI 審查並逐句備份的「審查並執行」（自動產生回滾腳本）、Kafka 訊息瀏覽與監控告警、SSH 終端機與 SFTP / FTP、Docker / Kubernetes、遠端桌面（RDP / VNC / RustDesk）、檔案 / 資料夾比對、預存程序整合測試；六種介面語言，內建 AI 助手（本機 CLI 或 Anthropic / OpenAI 相容 API，自然語言生成 SQL、AI 審查與調校建議）與命令列工具 dbk。免費開源（MIT），提供 Windows / macOS / Linux 安裝檔。
- [VS Code Super Mermaid](https://blog.markkulab.net/tools/super-mermaid): Super Mermaid 是一款 VS Code 擴充套件：開箱即用的漂亮 Mermaid 圖表，自動上色、即時預覽、滑鼠平移縮放、PNG / SVG 高解析匯出，內建 21 種範本與多種主題。免費開源（MIT）。
- [React Super Mermaid](https://blog.markkulab.net/tools/react-super-mermaid): react-super-mermaid 是一個開源 React 元件庫：一行 <MermaidViewer> 即可渲染漂亮的 Mermaid 圖表，內建 colorful / sketch 主題、平移縮放、圖內搜尋、SVG / PNG 高解析匯出。輕量、SSR 安全、完整 TypeScript 型別。免費開源（MIT）。
- [Jira / Confluence Super Mermaid](https://blog.markkulab.net/tools/jira-super-mermaid): Atlassian Forge app：在 Jira issue 與 Confluence 內文直接寫 Mermaid 語法，畫流程圖、時序圖、狀態機與甘特圖。11 種圖表、SVG / PNG 匯出、明暗主題、完整中日韓文字支援。取得 Runs on Atlassian 資格：圖表存在你自己的站台，app 不呼叫任何第三方服務。免費，即將上架 Atlassian Marketplace。
- [Mermaid 線上預覽](https://blog.markkulab.net/tools/mermaid-preview): 在瀏覽器裡寫 Mermaid、即時看圖，整張圖表壓進網址就能分享。免註冊、不上傳伺服器，相容 mermaid.live 的分享連結。
- [React Intl Phone Number](https://blog.markkulab.net/tools/react-intl-phone-number): react-intl-phone-number 是一個開源 React 元件：framework-agnostic、不依賴 antd，提供 E.164 進出、可搜尋國旗 / 國碼下拉、可配置驗證等級（strict / mobile-strict / loose）、可主題化 CSS 與 i18n，電話邏輯由 google-libphonenumber 驅動。輕量、完整 TypeScript 型別。免費開源（MIT）。
- [Uptime Kuma Cluster](https://blog.markkulab.net/tools/uptime-kuma-cluster): 把單機版 Uptime Kuma 改造成高可用叢集：OpenResty + Lua 智慧負載平衡、MariaDB 共享狀態、健康檢查與自動 Failover，附監控與叢集管理 RESTful API，一行 Docker Compose 啟動。免費開源（MIT）。
- [AI Podcast Cut 音檔剪輯](https://blog.markkulab.net/tools/ai-podcast-cut): 丟進一段錄音，AI 幫你剪掉「嗯、呃、那個」與講到一半重講的片段，平衡逐段音量，並派第二個 agent 覆核每一刀。辨識與去人聲都在你自己的電腦上跑，不上傳、不需要金鑰。剪點會貼齊字邊界與零交越、每一刀都有漸弱漸強，句尾還留得住呼吸感。Windows / macOS / Linux 桌面應用，MIT 開源，Windows 安裝檔內建 ffmpeg。
- [AI Video Cut 影片剪輯](https://blog.markkulab.net/tools/ai-video-cut): 在影片裡選一個東西：打字（人臉、車牌、手機螢幕、logo）、手動點選或拖框，或交給 Claude Code / Codex 挑。AI Video Cut 會逐幀追蹤它，再幫你打馬賽克或模糊、調色、加跟著走的貼紙與文字、把螢幕或海報換成你的圖片或影片，甚至用其他幀拍到的背景把它移除。另有序列剪輯、本機字幕與 AI 助手。免費開源（MIT）的 Windows 桌面應用（macOS / Linux 實驗中），本機運行，影片不上傳。
- [open-pos 開源餐飲 POS](https://blog.markkulab.net/tools/open-pos): 一台電腦加一台出單機就能開店。資料存在自己的硬碟裡、沒有月租、沒有綁約，MIT 全開源。金額用整數元依營業稅法拆算稅額，銷售額加稅額恆等於總額；出單走網路型 ESC/POS（TCP 9100），不必裝廠商驅動。Tauri + Rust + SQLite 桌面應用，v1.0 開發中。
- [.NET 電商 API 架構範本](https://blog.markkulab.net/tools/dotnet-ecommerce-api): 以 .NET 10 打造的電商平台後端 API 架構範本：Controller → Service → Repository 分層、Autofac 依命名慣例自動註冊、SqlSugar 支援 MySQL / MariaDB 與 SQL Server、Redis 快取與訊息佇列、Hangfire 排程、JWT 認證，內建可擴充的金流 Provider 模組（綠界 ECPay、藍新 Newebpay）。Apache 2.0 開源。
- [Open Token Monitor 團隊 AI 用量監控](https://blog.markkulab.net/tools/open-token-monitor): 把每位員工電腦上 AI coding 工具的 token 用量與等值成本集中到公司自架的 hub：PostgreSQL、組織名單、依公司與部門比較的 dashboard、報表 API。員工端有 Electron 與 Rust/Tauri 兩種，每 30 分鐘自動上傳。MIT 開源，Docker 一行起。

### 每日 Podcast

- [Mark's Tech Insights 每日 AI 新鮮事](https://blog.markkulab.net/category/tech-news): 每日精選 AI 與科技趨勢，透過語音摘要快速掌握最新技術動態，涵蓋 AI 應用、軟體架構、DevOps 與工程實戰。 — RSS: https://blog.markkulab.net/feed.xml
- [AI股市蝦聊](https://blog.markkulab.net/category/ai-stock-chat): 每個交易日用 AI 分析台股盤勢，以雙人對話聊當天的盤中觀察與隔日預測。 — RSS: https://blog.markkulab.net/ai-stock-chat/feed.xml
- [開源好物週報](https://blog.markkulab.net/category/open-source-weekly): 每週從 Hacker News、GitHub、Reddit 聲量雷達精選免費開源工具，以雙人對話聊解決什麼痛點與怎麼快速上手。 — RSS: https://blog.markkulab.net/open-source-weekly/feed.xml
- [AI 運動週報](https://blog.markkulab.net/category/sports-weekly): 每週一、三、六以雙人對話聊 NBA、MLB 與國際體壇大事，台灣球迷視角，輕鬆有梗不酸人。 — RSS: https://blog.markkulab.net/sports-weekly/feed.xml
- [AI 國際新聞快報](https://blog.markkulab.net/category/world-news): 每天早上以雙人對話把過去一天的國際大事講白：政治外交、全球經濟、衝突與安全、災害與氣候，台灣視角、中立客觀、每則附出處。 — RSS: https://blog.markkulab.net/world-news/feed.xml
- [地端 AI 實驗室](https://blog.markkulab.net/category/local-ai-lab): 每週三、五精選可以下載到自己機器上跑的開源模型與 LoRA，用雙人對話講清楚能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪，規格一律引述官方 model card。 — RSS: https://blog.markkulab.net/local-ai-lab/feed.xml

### 站長優惠

- [Saily eSIM](https://blog.markkulab.net/saily): 出國旅遊上網 eSIM・NordVPN 團隊出品，優惠碼：KUKU
- [NordVPN](https://blog.markkulab.net/nordvpn): 全球最多人用的 VPN・獨立稽核無日誌
- [PremLogin](https://blog.markkulab.net/premlogin): 訂閱合租平台・串流與 AI 訂閱席位分攤，優惠碼：markku666

### 電子報

[訂閱電子報](https://blog.markkulab.net/subscribe) — 第一時間收到新文章通知，無垃圾信、隨時可取消訂閱。
