開場白
Phonon-2 官方宣稱是 900 MB 以下最準的英文語音辨識模型,下載只要 164 MB,官方標示在 M5 MacBook Air 上能跑到 174 倍實時。這集也會看 Cloudflare 自己 post-train 的 9B 模型 clef-flash,以及能自己練 LoRA 的繪圖模型 Nanosaur2-670M,等一下告訴你誰最好上手。
本期精選
1. Cloudflare/clef-flash:回答機率而不是自由文字,省掉你解析 LLM 回覆的那層 regex
- 這是什麼:Cloudflare 自己 post-train 的 9B 模型,基底是 Qwen/Qwen3.5-9B,apache-2.0 授權。它的特色不是生成自由文字,而是直接輸出每個選項的機率,card 把工單分流、發票判讀、資安事件分類都列為 intended use。
- 能用在哪些場景:
- 後端工程師把進來的客服工單丟一組 typed questions 進去,問它屬於哪個產品線、嚴重度多高、該派給誰,拿到的是每個選項的機率,不用再寫 regex 解析 LLM 回覆、也不用設重試邏輯。
- 做發票與報帳系統的團隊拿它讀使用者上傳的發票圖檔並判定下一步動作,card 明確把 invoice processing 列為 intended use,輸入支援 text、JSON、影像與影片。
- 自架監控的人把資安事件分類交給它,card 列出 security incident classification,搭配量化版本在內網用 Ollama 跑,log 不用送出公司網段。
- 跑得動嗎:官方 model card 只寫測試環境是「a single H200」搭 PyTorch 2.11 與 Transformers 5.10.2,沒有標示消費級 VRAM 門檻。不過 card 另外列出 20 個量化版本,相容 llama.cpp、Ollama 與 LM Studio,是這幾個候選裡最有機會直接在自己機器上跑起來的。
- 本期聲量:HF 熱度 234,1.3k 次下載,235 個讚。
- 跟同類比:同家族的 Cloudflare/clef 是 27B,backbone 為 Qwen3.8-27B;clef-flash 的 card 自己寫明是從 Qwen/Qwen3.5-9B post-train 來的。官方數字是 median latency 38.8ms 對 clef 的 209.3ms,但 GSM8K 67.3% 低於 clef 的 80.8%,官方把它定位成「拿推論能力換速度」的取捨版本。
- 怎麼取得:card 給的流程是先
snapshot_download("Cloudflare/clef-flash"),再sys.path.insert(0, path)並from joint_schema_model import load_release_model取得 model 與 processor(device="cuda");想走 Ollama 或 LM Studio 則改用 card 列出的量化版本。 - 連結:huggingface.co/Cloudflare/clef-flash
2. FermionResearch/Phonon-2:164 MB 的語音轉文字模型,官方自稱 900 MB 以下最準
- 這是什麼:基底是 NVIDIA 的 parakeet-tdt-0.6b-v3,官方把它重新壓縮成一個 164 MB 的英文語音辨識模型,cc-by-4.0 授權,card 自稱是「the most accurate open speech recognition model for English under 900 MB」。
- 能用在哪些場景:
- 做內容的人把錄好的英文 podcast 或會議錄音在自己筆電上轉成逐字稿,官方標示在 M5 MacBook Air 上可達 174 倍實時,不必再付雲端 ASR API 的費用。
- 需要處理敏感錄音的團隊,像是法務、醫療、HR 面談,把 ASR 放進內網,card 列出 Apple silicon、Linux x86-64 與 Arm、Windows CPU,以及走 Docker 的 GPU 版本,整條流程可以在自己機器上閉環。
- 自架字幕流程的開發者把它接成批次服務消化整個影片庫,官方給的數字是 H100 在 batch 128 下 6,680 倍實時。
- 跑得動嗎:card 標示下載 164 MB,encoder「holds each weight at one of five learned levels in about 2.1 bits」;平台支援 Apple silicon、Linux(x86-64 與 Arm)、Windows CPU,GPU 走 Docker。具體 RAM 與 VRAM 數字官方沒有寫。
- 本期聲量:HF 熱度 144,2.1k 次下載,147 個讚。
- 跟同類比:它的基底是 NVIDIA 的 parakeet-tdt-0.6b-v3,作者在 card 裡聲稱 7 個英文資料集平均 WER 5.21%,達到 2.5GB teacher 模型準確度的 100.8%,體積卻小了 15 倍。要特別提醒的是 card 的訴求只限英文,中文辨識官方並沒有宣稱。
- 怎麼取得:README 寫的是
pip install fermion-research,再pip install mlx mlx-lm mlx-audio soundfile scipy zstandard,然後phonon transcribe recording.wav(或fermion transcribe phonon-2 recording.wav);card 另外附了 Docker 的 CPU 與 GPU 版本。 - 連結:huggingface.co/FermionResearch/Phonon-2
3. well9472/Nanosaur2-670M:670M 的繪圖模型,repo 直接附上 train_lora.py
- 這是什麼:一個 670M 的 diffusion transformer 繪圖模型,MIT 授權。作者在 card 裡把架構寫得很細,像是 adaLN-single、2D RoPE、SwiGLU、QK-norm、SPRINT sparse middle blocks、x-prediction,text encoder 用凍結的 Gemma-3-270M 倒數第二層,VAE 則是 129M 的 semantic DINOv2 VAE。
- 能用在哪些場景:
- 想練 LoRA 但手上沒有大卡的人拿它當練習場,card 給的訓練指令是
uv run python custom_nodes/nanosaur2_support/train_lora.py /path/to/images,直接指向自己的圖片資料夾。 - 已經在用 ComfyUI 的人把它當輕量節點掛進現有流程,card 的安裝方式就是把 custom nodes 與模型檔複製進 ComfyUI 對應目錄。
- 想搞懂 diffusion 架構的工程師把它當教材讀,官方標示 base 訓練只花了 11 個 H100-days,架構拆解得比一般 model card 細很多。
- 想練 LoRA 但手上沒有大卡的人拿它當練習場,card 給的訓練指令是
- 跑得動嗎:官方沒有標示推論端的 RAM 與 VRAM 門檻,card 只給了訓練端數字,VAE 在 1xH100 上跑 12 小時、base 訓練 11 個 H100-days。這裡做個推估:670M 相對於動輒數十億參數的繪圖模型算是小很多,理論上對消費級顯卡會更友善,但這只是從參數量推敲,不是官方給的硬體數字。
- 本期聲量:HF 熱度 82,0 次下載,90 個讚。
- 跟同類比:作者自己在 card 裡先打了預防針:「Do not expect this to compete with fully trained models like Anima in character knowledge or fine detail. The purpose to see what is possible with minimal compute.」對照本期另一個開源繪圖候選 inclusionAI/Ming-Image-0.1-Design,其 card 標示驗證環境需要一張 80 GiB VRAM 的 CUDA GPU,Nanosaur2 的門檻明顯低得多。
- 怎麼取得:依 card 說明把 custom nodes 與模型檔複製到 ComfyUI 對應目錄後使用;要訓練 LoRA 則用 card 提供的
uv run python custom_nodes/nanosaur2_support/train_lora.py /path/to/images。 - 連結:huggingface.co/well9472/Nanosaur2-670M
結尾段落
這期三個模型剛好是三種不同切角:clef-flash 把 LLM 輸出收斂成機率、省掉解析層;Phonon-2 把語音辨識壓到 164 MB 塞進筆電;Nanosaur2-670M 則是小到能讓你自己動手練 LoRA。如果只能先挑一個試試看,clef-flash 的 20 個量化版本應該是門檻最低的起點。下集再見。



























留言