開場白
這週地端模型雷達上最熱門的一顆不是新模型,而是把 177B 等級 MoE 壓成 IQ3 量化的 Qwen3.8-Flash-Next-GSQ-RCO-GGUF,220 萬次下載、617 個讚,作者甚至說 IQ3_S 打平原始 BF16 模型的分數。另一顆主角是 Microsoft 的 FrogNano-4B-2609,9.3 GB 就跑出 SWE-bench 61.5%,但它是不是裝了就能用,等一下告訴你。
本期精選
1. Qwen3.8-Flash-Next-GSQ-RCO-GGUF:177B MoE 壓進 IQ3,分數打平原廠
-
這是什麼:IST Austria DASLab 用自家方法做出來的 GGUF 量化版本,底層是 177B 等級的 MoE 模型。GSQ(Gumbel-Softmax Quantization)跟 RCO(Riemannian Constrained Optimization)各有一篇 arXiv 論文(2604.18556、2605.00649),不是社群隨手轉出來的量化包。提供 Q2_0、IQ2_XS、IQ3_XXS、IQ3_S 四檔,授權 Apache-2.0,承襲 base model。
-
能用在哪些場景:
- 公司程式碼與客戶資料不能送出去的團隊,想在自家開發機跑一顆 177B 等級的模型做推理與程式輔助:README 說明加上
-lm mmap --lazy-mode on,可以把 28.8 GB 的 n-gram 查表留在硬碟記憶體映射,不佔用常駐記憶體。 - 要在預算與品質之間做取捨的工程師:卡上直接列出四檔對 BF16 base(task average 93.12)的回復率對照表,IQ3_XXS 是 92.57、IQ3_S 是 93.26,作者稱 IQ3_S「matches or exceeds the base model on every task」,可以照自己的 VRAM 預算挑檔,不用自己重跑評測。
- 已經習慣 Ollama 或 LM Studio 的人:README 給的是
ollama run hf.co/<repo>,LM Studio 則在檔案清單裡挑GSQ-RCO-*build,不必改動既有流程。
- 公司程式碼與客戶資料不能送出去的團隊,想在自家開發機跑一顆 177B 等級的模型做推理與程式輔助:README 說明加上
-
跑得動嗎:README 下載表標示 Shard 1(權重)Q2_0 37.6 GB、IQ2_XS 39.2 GB、IQ3_XXS 47.0 GB、IQ3_S 54.8 GB,Shard 2(n-gram 查表)28.8 GB 可用記憶體映射留在磁碟。消費級單卡具體能不能跑,官方卡上沒有自己背書:llm-bench.io 網站寫在消費級 GPU 上最高約 36.4 tok/s,另有第三方提到透過 Strata Engine 可從 8 GB VRAM 起跑。這兩個數字都是外部獨立測試站台與第三方工具自己的說法,不是 Qwen3.8-Flash-Next-GSQ-RCO-GGUF 官方驗證過的數字,測試方法、硬體配置是否跟你的機器相同都查不到公開細節,拿來當參考就好,別當成保證。Mac 支援度官方也沒有標示。
-
本期聲量:HF 熱度 234(220 萬次下載、617 個讚),本期所有候選裡下載數最高的一顆。
-
跟同類比:作者主張 GSQ 是「closing most of the gap between scalar and vector quantization at 2 to 3 bits」,卻仍能存成標準 GGUF scalar 格式;RCO 則負責在總容量預算下逐 tensor 分派量化型別。要分清楚代表性的是,Hugging Face 討論區有一位使用者留言「效能不如官方版,但作為 IQ3 量化很優秀」,這只是單一使用者的個人體感、樣本數是 1,不是跑分數據,跟卡上那組有完整評測流程支撐的回復率數字不能放在同一個量級看待。
-
怎麼取得:
hf download <repo> --include "IQ3_XXS/*" --local-dir .,接著llama-cli -m IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf -lm mmap --lazy-mode on -ngl 99 -p "...";也支援ollama run hf.co/<repo>與 LM Studio 直接搜尋 repo 名稱。 -
連結:Hugging Face
2. FrogNano-4B-2609:4B 就能跑 agent,但不是開箱即用
-
這是什麼:Microsoft 釋出的 46.6 億參數模型,32 層 dense,混合 Gated DeltaNet 與 gated-attention 架構,評測設定下約 131K 上下文,授權 MIT,格式 safetensors。技術報告掛在 arXiv 2609.07925,GitHub repo 是 microsoft/FrogNano。
-
能用在哪些場景:
- 個人開發者想要不連外的本地 coding agent:model card 說明是「given an authorized repository snapshot and an English natural-language issue」,模型產生文字與結構化的 Leaf tool call,由 harness 執行,形成反覆翻檔案、搜尋、改碼、跑測試的循環。
- 程式碼不能外送的企業團隊,想先讓本地模型跑一輪再由人審:卡上列的適用範圍是「bug diagnosis and repair、scoped feature implementation、regression fixing、test-driven code maintenance」,並明確定位在 human-supervised development。
- 想研究小模型怎麼練成 agent 的人:技術報告走純 RL 加合成任務、不做 frontier 模型蒸餾的路線,社群貼文整理為約 1,500 個合成任務、5 輪迭代,方法本身可以照著復現。
-
跑得動嗎:官方 model card 寫 BF16 檢查點「requires about 9.3 GB for model weights alone, with additional memory needed for runtime state」。但卡上同時註明確切的最低 GPU 型號與 VRAM 配置「still to be validated before release」,官方目前也沒有提供量化版本。社群已有第三方轉換(roman220220/FrogNano-4B-2609-gptq-mlx-jang),但那不是官方產物,穩定性與正確性都未經 Microsoft 驗證。
-
本期聲量:HF 熱度 105(581 次下載、107 個讚)。
-
跟同類比:跟同樣走 agent 路線但動輒 27B 起跳的候選(例如本期雷達上的 BAAI/AREX-2、autotrust/JEV-27B-VL)相比,FrogNano 只有 4B。官方卡自己給的對照是同一套流程下 base model 39.4% 對上訓練後 61.5%。至於拿 4B 去對比 GPT-5 mini、Grok 4、Opus 4.1 這類大得多的系統,是 daily.dev 整理與 X 上研究者(Rohan Paul、Minseon Kim)貼文的說法,不是 Microsoft 官方表述。
-
怎麼取得:GitHub(microsoft/FrogNano,MIT)指令是
uv venv --python 3.12、uv pip install -e .,評測用frognano-eval run --config frognano/configs/eval/swebench-verified.yaml。這裡有個要先知道的落差:repo 本身不附 vLLM 或本地服務指令,預期你透過FROGNANO_MODEL_BASE_URL自己架一個 OpenAI 相容端點,並在 Kubernetes sandbox 內執行任務。換句話說,9.3 GB 只是模型權重本身的顯示記憶體門檻,真的要把它變成「丟一個 issue、它自己改完」的 agent,還得自己兜 harness、agent loop 跟執行沙箱;沒有 K8s 環境、只想雙擊就跑的個人開發者,這段距離要先有心理準備,跟「不連外本地 agent」聽起來的輕鬆程度中間還有一段工程要補。 -
連結:Hugging Face
結尾段落
這兩顆剛好是兩種取捨:Qwen3.8-Flash-Next-GSQ-RCO-GGUF 用量化把 177B 等級的模型搬到你我架得起來的規模,權重大小跟取得方式都很明確;FrogNano-4B-2609 的顯示記憶體門檻看起來低很多,但想把它接成真正能動手改程式碼的 agent,還得自己補 harness 跟沙箱,這兩件事不能劃等號。如果只是想先試試量化模型的手感,GGUF 那顆現在就能用 Ollama 跑起來;如果對 agent 訓練方法本身更有興趣,FrogNano 的技術報告值得先讀完再評估要不要動工。下週五再來看看地端模型雷達上又冒出什麼新東西。



























留言