---
title: "🧪 164 MB、174 倍實時：Phonon-2 讓語音轉文字不必再課雲端稅｜地端 AI 實驗室"
description: "Phonon-2 官方宣稱是 900 MB 以下最準的英文語音辨識模型，下載只要 164 MB，官方標示在 M5 MacBook Air 上能跑到 174 倍實時。這集也會看 Cloudflare 自己 post-train 的 9B 模型 clef-flash，以及能自己練 LoRA 的繪圖模型 Nanosaur2-670M，等一下告訴你誰最好上手。"
canonical_url: "https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-10-02"
author: "Mark Ku"
author_url: "https://blog.markkulab.net/author/mark-ku"
site: "Mark Ku's Blog"
date_published: "2026-10-02T02:00:00.000Z"
category: "地端 AI 實驗室"
tags: ["local-ai", "podcast", "地端模型", "lora", "開源模型", "Cloudflare", "clefflash", "Phonon2", "語音辨識", "Nanosaur2", "LoRA訓練"]
language: "zh-TW"
license: "CC BY 4.0"
license_url: "https://creativecommons.org/licenses/by/4.0/"
attribution: "轉載或引用請註明作者並附上原文連結"
---

# 🧪 164 MB、174 倍實時：Phonon-2 讓語音轉文字不必再課雲端稅｜地端 AI 實驗室

> **TL;DR** — Phonon-2 是 164 MB 的英文語音辨識模型，官方宣稱 900 MB 以下最準，在 M5 MacBook Air 上達 174 倍實時。Cloudflare 的 clef-flash 是 9B 基底的分類模型，直接輸出各選項機率省去文字解析，有 20 個量化版本相容 Ollama 與 LM Studio。

## 開場白
Phonon-2 官方宣稱是 900 MB 以下最準的英文語音辨識模型，下載只要 164 MB，官方標示在 M5 MacBook Air 上能跑到 174 倍實時。這集也會看 Cloudflare 自己 post-train 的 9B 模型 clef-flash，以及能自己練 LoRA 的繪圖模型 Nanosaur2-670M，等一下告訴你誰最好上手。

## 本期精選

### 1. Cloudflare/clef-flash：回答機率而不是自由文字，省掉你解析 LLM 回覆的那層 regex
- **這是什麼**：Cloudflare 自己 post-train 的 9B 模型，基底是 Qwen/Qwen3.5-9B，apache-2.0 授權。它的特色不是生成自由文字，而是直接輸出每個選項的機率，card 把工單分流、發票判讀、資安事件分類都列為 intended use。
- **能用在哪些場景**：
  - 後端工程師把進來的客服工單丟一組 typed questions 進去，問它屬於哪個產品線、嚴重度多高、該派給誰，拿到的是每個選項的機率，不用再寫 regex 解析 LLM 回覆、也不用設重試邏輯。
  - 做發票與報帳系統的團隊拿它讀使用者上傳的發票圖檔並判定下一步動作，card 明確把 invoice processing 列為 intended use，輸入支援 text、JSON、影像與影片。
  - 自架監控的人把資安事件分類交給它，card 列出 security incident classification，搭配量化版本在內網用 Ollama 跑，log 不用送出公司網段。
- **跑得動嗎**：官方 model card 只寫測試環境是「a single H200」搭 PyTorch 2.11 與 Transformers 5.10.2，沒有標示消費級 VRAM 門檻。不過 card 另外列出 20 個量化版本，相容 llama.cpp、Ollama 與 LM Studio，是這幾個候選裡最有機會直接在自己機器上跑起來的。
- **本期聲量**：HF 熱度 234，1.3k 次下載，235 個讚。
- **跟同類比**：同家族的 Cloudflare/clef 是 27B，backbone 為 Qwen3.8-27B；clef-flash 的 card 自己寫明是從 Qwen/Qwen3.5-9B post-train 來的。官方數字是 median latency 38.8ms 對 clef 的 209.3ms，但 GSM8K 67.3% 低於 clef 的 80.8%，官方把它定位成「拿推論能力換速度」的取捨版本。
- **怎麼取得**：card 給的流程是先 `snapshot_download("Cloudflare/clef-flash")`，再 `sys.path.insert(0, path)` 並 `from joint_schema_model import load_release_model` 取得 model 與 processor（`device="cuda"`）；想走 Ollama 或 LM Studio 則改用 card 列出的量化版本。
- **連結**：[huggingface.co/Cloudflare/clef-flash](https://huggingface.co/Cloudflare/clef-flash)

### 2. FermionResearch/Phonon-2：164 MB 的語音轉文字模型，官方自稱 900 MB 以下最準
- **這是什麼**：基底是 NVIDIA 的 parakeet-tdt-0.6b-v3，官方把它重新壓縮成一個 164 MB 的英文語音辨識模型，cc-by-4.0 授權，card 自稱是「the most accurate open speech recognition model for English under 900 MB」。
- **能用在哪些場景**：
  - 做內容的人把錄好的英文 podcast 或會議錄音在自己筆電上轉成逐字稿，官方標示在 M5 MacBook Air 上可達 174 倍實時，不必再付雲端 ASR API 的費用。
  - 需要處理敏感錄音的團隊，像是法務、醫療、HR 面談，把 ASR 放進內網，card 列出 Apple silicon、Linux x86-64 與 Arm、Windows CPU，以及走 Docker 的 GPU 版本，整條流程可以在自己機器上閉環。
  - 自架字幕流程的開發者把它接成批次服務消化整個影片庫，官方給的數字是 H100 在 batch 128 下 6,680 倍實時。
- **跑得動嗎**：card 標示下載 164 MB，encoder「holds each weight at one of five learned levels in about 2.1 bits」；平台支援 Apple silicon、Linux（x86-64 與 Arm）、Windows CPU，GPU 走 Docker。具體 RAM 與 VRAM 數字官方沒有寫。
- **本期聲量**：HF 熱度 144，2.1k 次下載，147 個讚。
- **跟同類比**：它的基底是 NVIDIA 的 parakeet-tdt-0.6b-v3，作者在 card 裡聲稱 7 個英文資料集平均 WER 5.21%，達到 2.5GB teacher 模型準確度的 100.8%，體積卻小了 15 倍。要特別提醒的是 card 的訴求只限英文，中文辨識官方並沒有宣稱。
- **怎麼取得**：README 寫的是 `pip install fermion-research`，再 `pip install mlx mlx-lm mlx-audio soundfile scipy zstandard`，然後 `phonon transcribe recording.wav`（或 `fermion transcribe phonon-2 recording.wav`）；card 另外附了 Docker 的 CPU 與 GPU 版本。
- **連結**：[huggingface.co/FermionResearch/Phonon-2](https://huggingface.co/FermionResearch/Phonon-2)

### 3. well9472/Nanosaur2-670M：670M 的繪圖模型，repo 直接附上 train_lora.py
- **這是什麼**：一個 670M 的 diffusion transformer 繪圖模型，MIT 授權。作者在 card 裡把架構寫得很細，像是 adaLN-single、2D RoPE、SwiGLU、QK-norm、SPRINT sparse middle blocks、x-prediction，text encoder 用凍結的 Gemma-3-270M 倒數第二層，VAE 則是 129M 的 semantic DINOv2 VAE。
- **能用在哪些場景**：
  - 想練 LoRA 但手上沒有大卡的人拿它當練習場，card 給的訓練指令是 `uv run python custom_nodes/nanosaur2_support/train_lora.py /path/to/images`，直接指向自己的圖片資料夾。
  - 已經在用 ComfyUI 的人把它當輕量節點掛進現有流程，card 的安裝方式就是把 custom nodes 與模型檔複製進 ComfyUI 對應目錄。
  - 想搞懂 diffusion 架構的工程師把它當教材讀，官方標示 base 訓練只花了 11 個 H100-days，架構拆解得比一般 model card 細很多。
- **跑得動嗎**：官方沒有標示推論端的 RAM 與 VRAM 門檻，card 只給了訓練端數字，VAE 在 1xH100 上跑 12 小時、base 訓練 11 個 H100-days。這裡做個推估：670M 相對於動輒數十億參數的繪圖模型算是小很多，理論上對消費級顯卡會更友善，但這只是從參數量推敲，不是官方給的硬體數字。
- **本期聲量**：HF 熱度 82，0 次下載，90 個讚。
- **跟同類比**：作者自己在 card 裡先打了預防針：「Do not expect this to compete with fully trained models like Anima in character knowledge or fine detail. The purpose to see what is possible with minimal compute.」對照本期另一個開源繪圖候選 inclusionAI/Ming-Image-0.1-Design，其 card 標示驗證環境需要一張 80 GiB VRAM 的 CUDA GPU，Nanosaur2 的門檻明顯低得多。
- **怎麼取得**：依 card 說明把 custom nodes 與模型檔複製到 ComfyUI 對應目錄後使用；要訓練 LoRA 則用 card 提供的 `uv run python custom_nodes/nanosaur2_support/train_lora.py /path/to/images`。
- **連結**：[huggingface.co/well9472/Nanosaur2-670M](https://huggingface.co/well9472/Nanosaur2-670M)

## 結尾段落
這期三個模型剛好是三種不同切角：clef-flash 把 LLM 輸出收斂成機率、省掉解析層；Phonon-2 把語音辨識壓到 164 MB 塞進筆電；Nanosaur2-670M 則是小到能讓你自己動手練 LoRA。如果只能先挑一個試試看，clef-flash 的 20 個量化版本應該是門檻最低的起點。下集再見。

---

## 關於本文與作者

本文出自 [Mark Ku's Blog](https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-10-02)

授權條款： [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) — 轉載或引用請註明作者並附上原文連結

### 關於作者

**[Mark Ku](https://blog.markkulab.net/author/mark-ku)** — 軟體工程師

- 10 年以上軟體工程師
- 做過北美電商與 AI SaaS 訂閱收費系統

### 作者開發的免費工具

以下工具皆可免費使用：

- [免費 PDF 簽名工具](https://blog.markkulab.net/tools/pdf-sign): 線上 PDF 簽名工具，瀏覽器內完成手繪、打字、上傳簽名，可拖曳放置、縮放、下載。所有處理都在你的裝置完成，檔案不會上傳。
- [VS Code Refactory](https://blog.markkulab.net/tools/refactory): Refactory 是一款 VS Code 重構擴充套件：34 個重構動作、37 條 code smell 檢查、Code Health 儀表板、18 種語言、534 支測試。懂你的專案慣例：介面放哪、DI 註冊寫在哪、'use client' 該不該加；還會用 git 修改頻率 × 複雜度排出「該先修哪個檔案」，並一鍵把壞味道交給你自己電腦上的 Claude Code 修。免費使用，原始碼不離開你的機器。
- [DB-Kit 資料庫管理工具](https://blog.markkulab.net/tools/db-kit): DB-Kit 是一個用 Tauri + Rust + React 打造的輕量跨平台資料庫管理工具，用單一一致的介面同時管理 MySQL、MariaDB、PostgreSQL、SQL Server、Oracle、SQLite、MongoDB、Redis、Kafka、Elasticsearch 與 RabbitMQ 十一種資料來源：連線密碼以 OS keychain 加密、SSH Tunnel、完整 CRUD、視覺化查詢建構器、多結果集同時顯示、跨連線資料傳輸、結構與資料比對（同步 SQL、結構快照）、Excel / CSV 匯入匯出、執行計畫視覺化、ER 圖、排程備份、SQL 壓力測試（p50～p99 延遲百分位）、15 條規則的 SQL 審查、執行前 AI 審查並逐句備份的「審查並執行」（自動產生回滾腳本）、Kafka 訊息瀏覽與監控告警；繁中 / 英文雙語介面，內建 AI 助手（本機 CLI 或 Anthropic / OpenAI 相容 API，自然語言生成 SQL、AI 審查與調校建議）與命令列工具 dbk。免費開源（MIT），提供 Windows / macOS / Linux 安裝檔。
- [VS Code Super Mermaid](https://blog.markkulab.net/tools/super-mermaid): Super Mermaid 是一款 VS Code 擴充套件：開箱即用的漂亮 Mermaid 圖表，自動上色、即時預覽、滑鼠平移縮放、PNG / SVG 高解析匯出，內建 21 種範本與多種主題。免費開源（MIT）。
- [React Super Mermaid](https://blog.markkulab.net/tools/react-super-mermaid): react-super-mermaid 是一個開源 React 元件庫：一行 <MermaidViewer> 即可渲染漂亮的 Mermaid 圖表，內建 colorful / sketch 主題、平移縮放、圖內搜尋、SVG / PNG 高解析匯出。輕量、SSR 安全、完整 TypeScript 型別。免費開源（MIT）。
- [Jira / Confluence Super Mermaid](https://blog.markkulab.net/tools/jira-super-mermaid): Atlassian Forge app：在 Jira issue 與 Confluence 內文直接寫 Mermaid 語法，畫流程圖、時序圖、狀態機與甘特圖。11 種圖表、SVG / PNG 匯出、明暗主題、完整中日韓文字支援。取得 Runs on Atlassian 資格：圖表存在你自己的站台，app 不呼叫任何第三方服務。免費，即將上架 Atlassian Marketplace。
- [Mermaid 線上預覽](https://blog.markkulab.net/tools/mermaid-preview): 在瀏覽器裡寫 Mermaid、即時看圖，整張圖表壓進網址就能分享。免註冊、不上傳伺服器，相容 mermaid.live 的分享連結。
- [React Intl Phone Number](https://blog.markkulab.net/tools/react-intl-phone-number): react-intl-phone-number 是一個開源 React 元件：framework-agnostic、不依賴 antd，提供 E.164 進出、可搜尋國旗 / 國碼下拉、可配置驗證等級（strict / mobile-strict / loose）、可主題化 CSS 與 i18n，電話邏輯由 google-libphonenumber 驅動。輕量、完整 TypeScript 型別。免費開源（MIT）。
- [Uptime Kuma Cluster](https://blog.markkulab.net/tools/uptime-kuma-cluster): 把單機版 Uptime Kuma 改造成高可用叢集：OpenResty + Lua 智慧負載平衡、MariaDB 共享狀態、健康檢查與自動 Failover，附叢集管理 REST API，一行 Docker Compose 啟動。免費開源（MIT）。
- [AI Podcast Cut 音檔剪輯](https://blog.markkulab.net/tools/ai-podcast-cut): 丟進一段錄音，AI 幫你剪掉「嗯、呃、那個」與講到一半重講的片段，平衡逐段音量，並派第二個 agent 覆核每一刀。辨識與去人聲都在你自己的電腦上跑，不上傳、不需要金鑰。剪點會貼齊字邊界與零交越、每一刀都有漸弱漸強，句尾還留得住呼吸感。Windows / macOS / Linux 桌面應用，MIT 開源，Windows 安裝檔內建 ffmpeg。
- [open-pos 開源餐飲 POS](https://blog.markkulab.net/tools/open-pos): 一台電腦加一台出單機就能開店。資料存在自己的硬碟裡、沒有月租、沒有綁約，MIT 全開源。金額用整數元依營業稅法拆算稅額，銷售額加稅額恆等於總額；出單走網路型 ESC/POS（TCP 9100），不必裝廠商驅動。Tauri + Rust + SQLite 桌面應用，v1.0 開發中。

### 每日 Podcast

- [Mark's Tech Insights 每日 AI 新鮮事](https://blog.markkulab.net/category/tech-news): 每日精選 AI 與科技趨勢，透過語音摘要快速掌握最新技術動態，涵蓋 AI 應用、軟體架構、DevOps 與工程實戰。 — RSS: https://blog.markkulab.net/feed.xml
- [AI股市蝦聊](https://blog.markkulab.net/category/ai-stock-chat): 每個交易日用 AI 分析台股盤勢，以雙人對話聊當天的盤中觀察與隔日預測。 — RSS: https://blog.markkulab.net/ai-stock-chat/feed.xml
- [開源好物週報](https://blog.markkulab.net/category/open-source-weekly): 每週從 Hacker News、GitHub、Reddit 聲量雷達精選免費開源工具，以雙人對話聊解決什麼痛點與怎麼快速上手。 — RSS: https://blog.markkulab.net/open-source-weekly/feed.xml
- [AI 運動週報](https://blog.markkulab.net/category/sports-weekly): 每週一、三、六以雙人對話聊 NBA、MLB 與國際體壇大事，台灣球迷視角，輕鬆有梗不酸人。 — RSS: https://blog.markkulab.net/sports-weekly/feed.xml
- [AI 國際新聞快報](https://blog.markkulab.net/category/world-news): 每天早上以雙人對話把過去一天的國際大事講白：政治外交、全球經濟、衝突與安全、災害與氣候，台灣視角、中立客觀、每則附出處。 — RSS: https://blog.markkulab.net/world-news/feed.xml
- [地端 AI 實驗室](https://blog.markkulab.net/category/local-ai-lab): 每週三、五精選可以下載到自己機器上跑的開源模型與 LoRA，用雙人對話講清楚能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪，規格一律引述官方 model card。 — RSS: https://blog.markkulab.net/local-ai-lab/feed.xml

### 站長優惠

- [Saily eSIM](https://blog.markkulab.net/saily): 出國旅遊上網 eSIM・NordVPN 團隊出品，優惠碼：KUKU
- [NordVPN](https://blog.markkulab.net/nordvpn): 全球最多人用的 VPN・獨立稽核無日誌
- [PremLogin](https://blog.markkulab.net/premlogin): 訂閱合租平台・串流與 AI 訂閱席位分攤，優惠碼：markku666

### 電子報

[訂閱電子報](https://blog.markkulab.net/subscribe) — 第一時間收到新文章通知，無垃圾信、隨時可取消訂閱。
