---
title: "🧪 177B 模型瘦身術：GSQ-RCO 量化版 220 萬次下載打平原廠｜地端 AI 實驗室"
description: "這週地端模型雷達上最熱門的一顆不是新模型，而是把 177B 等級 MoE 壓成 IQ3 量化的 Qwen3.8-Flash-Next-GSQ-RCO-GGUF，220 萬次下載、617 個讚，作者甚至說 IQ3_S 打平原始 BF16 模型的分數。"
canonical_url: "https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-10-05"
author: "Mark Ku"
author_url: "https://blog.markkulab.net/author/mark-ku"
site: "Mark Ku's Blog"
date_published: "2026-10-05T02:00:00.000Z"
category: "地端 AI 實驗室"
tags: ["local-ai", "podcast", "地端模型", "lora", "開源模型", "QwenFlashNext", "GSQRCO", "FrogNano", "GGUF", "量化模型", "SWEbench"]
language: "zh-TW"
license: "CC BY 4.0"
license_url: "https://creativecommons.org/licenses/by/4.0/"
attribution: "轉載或引用請註明作者並附上原文連結"
---

# 🧪 177B 模型瘦身術：GSQ-RCO 量化版 220 萬次下載打平原廠｜地端 AI 實驗室

> **TL;DR** — Qwen3.8-Flash-Next-GSQ-RCO-GGUF 用 GSQ 與 RCO 量化演算法把 177B MoE 模型壓成 IQ3，IQ3_S 版本的 93.26% 回復率達到原廠 BF16 水準，可用 Ollama 或 llama-cli 在消費級硬體上推理；Microsoft 的 FrogNano-4B-2609 雖然只需 9.

## 開場白

這週地端模型雷達上最熱門的一顆不是新模型，而是把 177B 等級 MoE 壓成 IQ3 量化的 Qwen3.8-Flash-Next-GSQ-RCO-GGUF，220 萬次下載、617 個讚，作者甚至說 IQ3_S 打平原始 BF16 模型的分數。另一顆主角是 Microsoft 的 FrogNano-4B-2609，9.3 GB 就跑出 SWE-bench 61.5%，但它是不是裝了就能用，等一下告訴你。

## 本期精選

### 1. Qwen3.8-Flash-Next-GSQ-RCO-GGUF：177B MoE 壓進 IQ3，分數打平原廠

- **這是什麼**：IST Austria DASLab 用自家方法做出來的 GGUF 量化版本，底層是 177B 等級的 MoE 模型。GSQ（Gumbel-Softmax Quantization）跟 RCO（Riemannian Constrained Optimization）各有一篇 arXiv 論文（2604.18556、2605.00649），不是社群隨手轉出來的量化包。提供 Q2_0、IQ2_XS、IQ3_XXS、IQ3_S 四檔，授權 Apache-2.0，承襲 base model。

- **能用在哪些場景**：
  1. 公司程式碼與客戶資料不能送出去的團隊，想在自家開發機跑一顆 177B 等級的模型做推理與程式輔助：README 說明加上 `-lm mmap --lazy-mode on`，可以把 28.8 GB 的 n-gram 查表留在硬碟記憶體映射，不佔用常駐記憶體。
  2. 要在預算與品質之間做取捨的工程師：卡上直接列出四檔對 BF16 base（task average 93.12）的回復率對照表，IQ3_XXS 是 92.57、IQ3_S 是 93.26，作者稱 IQ3_S「matches or exceeds the base model on every task」，可以照自己的 VRAM 預算挑檔，不用自己重跑評測。
  3. 已經習慣 Ollama 或 LM Studio 的人：README 給的是 `ollama run hf.co/<repo>`，LM Studio 則在檔案清單裡挑 `GSQ-RCO-*` build，不必改動既有流程。

- **跑得動嗎**：README 下載表標示 Shard 1（權重）Q2_0 37.6 GB、IQ2_XS 39.2 GB、IQ3_XXS 47.0 GB、IQ3_S 54.8 GB，Shard 2（n-gram 查表）28.8 GB 可用記憶體映射留在磁碟。消費級單卡具體能不能跑，官方卡上沒有自己背書：llm-bench.io 網站寫在消費級 GPU 上最高約 36.4 tok/s，另有第三方提到透過 Strata Engine 可從 8 GB VRAM 起跑。這兩個數字都是外部獨立測試站台與第三方工具自己的說法，不是 Qwen3.8-Flash-Next-GSQ-RCO-GGUF 官方驗證過的數字，測試方法、硬體配置是否跟你的機器相同都查不到公開細節，拿來當參考就好，別當成保證。Mac 支援度官方也沒有標示。

- **本期聲量**：HF 熱度 234（220 萬次下載、617 個讚），本期所有候選裡下載數最高的一顆。

- **跟同類比**：作者主張 GSQ 是「closing most of the gap between scalar and vector quantization at 2 to 3 bits」，卻仍能存成標準 GGUF scalar 格式；RCO 則負責在總容量預算下逐 tensor 分派量化型別。要分清楚代表性的是，Hugging Face 討論區有一位使用者留言「效能不如官方版，但作為 IQ3 量化很優秀」，這只是單一使用者的個人體感、樣本數是 1，不是跑分數據，跟卡上那組有完整評測流程支撐的回復率數字不能放在同一個量級看待。

- **怎麼取得**：`hf download <repo> --include "IQ3_XXS/*" --local-dir .`，接著 `llama-cli -m IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf -lm mmap --lazy-mode on -ngl 99 -p "..."`；也支援 `ollama run hf.co/<repo>` 與 LM Studio 直接搜尋 repo 名稱。

- **連結**：[Hugging Face](https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF)

### 2. FrogNano-4B-2609：4B 就能跑 agent，但不是開箱即用

- **這是什麼**：Microsoft 釋出的 46.6 億參數模型，32 層 dense，混合 Gated DeltaNet 與 gated-attention 架構，評測設定下約 131K 上下文，授權 MIT，格式 safetensors。技術報告掛在 arXiv 2609.07925，GitHub repo 是 microsoft/FrogNano。

- **能用在哪些場景**：
  1. 個人開發者想要不連外的本地 coding agent：model card 說明是「given an authorized repository snapshot and an English natural-language issue」，模型產生文字與結構化的 Leaf tool call，由 harness 執行，形成反覆翻檔案、搜尋、改碼、跑測試的循環。
  2. 程式碼不能外送的企業團隊，想先讓本地模型跑一輪再由人審：卡上列的適用範圍是「bug diagnosis and repair、scoped feature implementation、regression fixing、test-driven code maintenance」，並明確定位在 human-supervised development。
  3. 想研究小模型怎麼練成 agent 的人：技術報告走純 RL 加合成任務、不做 frontier 模型蒸餾的路線，社群貼文整理為約 1,500 個合成任務、5 輪迭代，方法本身可以照著復現。

- **跑得動嗎**：官方 model card 寫 BF16 檢查點「requires about 9.3 GB for model weights alone, with additional memory needed for runtime state」。但卡上同時註明確切的最低 GPU 型號與 VRAM 配置「still to be validated before release」，官方目前也沒有提供量化版本。社群已有第三方轉換（roman220220/FrogNano-4B-2609-gptq-mlx-jang），但那不是官方產物，穩定性與正確性都未經 Microsoft 驗證。

- **本期聲量**：HF 熱度 105（581 次下載、107 個讚）。

- **跟同類比**：跟同樣走 agent 路線但動輒 27B 起跳的候選（例如本期雷達上的 BAAI/AREX-2、autotrust/JEV-27B-VL）相比，FrogNano 只有 4B。官方卡自己給的對照是同一套流程下 base model 39.4% 對上訓練後 61.5%。至於拿 4B 去對比 GPT-5 mini、Grok 4、Opus 4.1 這類大得多的系統，是 daily.dev 整理與 X 上研究者（Rohan Paul、Minseon Kim）貼文的說法，不是 Microsoft 官方表述。

- **怎麼取得**：GitHub（microsoft/FrogNano，MIT）指令是 `uv venv --python 3.12`、`uv pip install -e .`，評測用 `frognano-eval run --config frognano/configs/eval/swebench-verified.yaml`。這裡有個要先知道的落差：repo 本身不附 vLLM 或本地服務指令，預期你透過 `FROGNANO_MODEL_BASE_URL` 自己架一個 OpenAI 相容端點，並在 Kubernetes sandbox 內執行任務。換句話說，9.3 GB 只是模型權重本身的顯示記憶體門檻，真的要把它變成「丟一個 issue、它自己改完」的 agent，還得自己兜 harness、agent loop 跟執行沙箱；沒有 K8s 環境、只想雙擊就跑的個人開發者，這段距離要先有心理準備，跟「不連外本地 agent」聽起來的輕鬆程度中間還有一段工程要補。

- **連結**：[Hugging Face](https://huggingface.co/microsoft/FrogNano-4B-2609)

## 結尾段落

這兩顆剛好是兩種取捨：Qwen3.8-Flash-Next-GSQ-RCO-GGUF 用量化把 177B 等級的模型搬到你我架得起來的規模，權重大小跟取得方式都很明確；FrogNano-4B-2609 的顯示記憶體門檻看起來低很多，但想把它接成真正能動手改程式碼的 agent，還得自己補 harness 跟沙箱，這兩件事不能劃等號。如果只是想先試試量化模型的手感，GGUF 那顆現在就能用 Ollama 跑起來；如果對 agent 訓練方法本身更有興趣，FrogNano 的技術報告值得先讀完再評估要不要動工。下週五再來看看地端模型雷達上又冒出什麼新東西。

---

## 關於本文與作者

本文出自 [Mark Ku's Blog](https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-10-05)

授權條款： [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) — 轉載或引用請註明作者並附上原文連結

### 關於作者

**[Mark Ku](https://blog.markkulab.net/author/mark-ku)** — 軟體工程師

- 10 年以上軟體工程師
- 做過北美電商與 AI SaaS 訂閱收費系統

### 作者開發的免費工具

以下工具皆可免費使用：

- [免費 PDF 簽名工具](https://blog.markkulab.net/tools/pdf-sign): 線上 PDF 簽名工具，瀏覽器內完成手繪、打字、上傳簽名，可拖曳放置、縮放、下載。所有處理都在你的裝置完成，檔案不會上傳。
- [VS Code Refactory](https://blog.markkulab.net/tools/refactory): Refactory 是一款 VS Code 重構擴充套件：34 個重構動作、37 條 code smell 檢查、Code Health 儀表板、18 種語言、534 支測試。懂你的專案慣例：介面放哪、DI 註冊寫在哪、'use client' 該不該加；還會用 git 修改頻率 × 複雜度排出「該先修哪個檔案」，並一鍵把壞味道交給你自己電腦上的 Claude Code 修。免費使用，原始碼不離開你的機器。
- [DB-Kit 資料庫管理工具](https://blog.markkulab.net/tools/db-kit): DB-Kit 是一個用 Tauri + Rust + React 打造的輕量跨平台資料庫管理工具，用單一一致的介面同時管理 MySQL、MariaDB、PostgreSQL、SQL Server、Oracle、SQLite、MongoDB、Redis、Kafka、Elasticsearch 與 RabbitMQ 十一種資料來源：連線密碼以 OS keychain 加密、SSH Tunnel、完整 CRUD、視覺化查詢建構器、多結果集同時顯示、跨連線資料傳輸、結構與資料比對（同步 SQL、結構快照）、Excel / CSV 匯入匯出、執行計畫視覺化、ER 圖、排程備份、SQL 壓力測試（p50～p99 延遲百分位）、15 條規則的 SQL 審查、執行前 AI 審查並逐句備份的「審查並執行」（自動產生回滾腳本）、Kafka 訊息瀏覽與監控告警、SSH 終端機與 SFTP / FTP、Docker / Kubernetes、遠端桌面（RDP / VNC / RustDesk）、檔案 / 資料夾比對、預存程序整合測試；六種介面語言，內建 AI 助手（本機 CLI 或 Anthropic / OpenAI 相容 API，自然語言生成 SQL、AI 審查與調校建議）與命令列工具 dbk。免費開源（MIT），提供 Windows / macOS / Linux 安裝檔。
- [VS Code Super Mermaid](https://blog.markkulab.net/tools/super-mermaid): Super Mermaid 是一款 VS Code 擴充套件：開箱即用的漂亮 Mermaid 圖表，自動上色、即時預覽、滑鼠平移縮放、PNG / SVG 高解析匯出，內建 21 種範本與多種主題。免費開源（MIT）。
- [React Super Mermaid](https://blog.markkulab.net/tools/react-super-mermaid): react-super-mermaid 是一個開源 React 元件庫：一行 <MermaidViewer> 即可渲染漂亮的 Mermaid 圖表，內建 colorful / sketch 主題、平移縮放、圖內搜尋、SVG / PNG 高解析匯出。輕量、SSR 安全、完整 TypeScript 型別。免費開源（MIT）。
- [Jira / Confluence Super Mermaid](https://blog.markkulab.net/tools/jira-super-mermaid): Atlassian Forge app：在 Jira issue 與 Confluence 內文直接寫 Mermaid 語法，畫流程圖、時序圖、狀態機與甘特圖。11 種圖表、SVG / PNG 匯出、明暗主題、完整中日韓文字支援。取得 Runs on Atlassian 資格：圖表存在你自己的站台，app 不呼叫任何第三方服務。免費，即將上架 Atlassian Marketplace。
- [Mermaid 線上預覽](https://blog.markkulab.net/tools/mermaid-preview): 在瀏覽器裡寫 Mermaid、即時看圖，整張圖表壓進網址就能分享。免註冊、不上傳伺服器，相容 mermaid.live 的分享連結。
- [React Intl Phone Number](https://blog.markkulab.net/tools/react-intl-phone-number): react-intl-phone-number 是一個開源 React 元件：framework-agnostic、不依賴 antd，提供 E.164 進出、可搜尋國旗 / 國碼下拉、可配置驗證等級（strict / mobile-strict / loose）、可主題化 CSS 與 i18n，電話邏輯由 google-libphonenumber 驅動。輕量、完整 TypeScript 型別。免費開源（MIT）。
- [Uptime Kuma Cluster](https://blog.markkulab.net/tools/uptime-kuma-cluster): 把單機版 Uptime Kuma 改造成高可用叢集：OpenResty + Lua 智慧負載平衡、MariaDB 共享狀態、健康檢查與自動 Failover，附叢集管理 REST API，一行 Docker Compose 啟動。免費開源（MIT）。
- [AI Podcast Cut 音檔剪輯](https://blog.markkulab.net/tools/ai-podcast-cut): 丟進一段錄音，AI 幫你剪掉「嗯、呃、那個」與講到一半重講的片段，平衡逐段音量，並派第二個 agent 覆核每一刀。辨識與去人聲都在你自己的電腦上跑，不上傳、不需要金鑰。剪點會貼齊字邊界與零交越、每一刀都有漸弱漸強，句尾還留得住呼吸感。Windows / macOS / Linux 桌面應用，MIT 開源，Windows 安裝檔內建 ffmpeg。
- [AI Video Cut 影片剪輯](https://blog.markkulab.net/tools/ai-video-cut): 在影片裡選一個東西：打字（人臉、車牌、手機螢幕、logo）、手動點選或拖框，或交給 Claude Code / Codex 挑。AI Video Cut 會逐幀追蹤它，再幫你打馬賽克或模糊、調色、加跟著走的貼紙與文字、把螢幕或海報換成你的圖片或影片，甚至用其他幀拍到的背景把它移除。另有序列剪輯、本機字幕與 AI 助手。免費開源（MIT）的 Windows 桌面應用（macOS / Linux 實驗中），本機運行，影片不上傳。
- [open-pos 開源餐飲 POS](https://blog.markkulab.net/tools/open-pos): 一台電腦加一台出單機就能開店。資料存在自己的硬碟裡、沒有月租、沒有綁約，MIT 全開源。金額用整數元依營業稅法拆算稅額，銷售額加稅額恆等於總額；出單走網路型 ESC/POS（TCP 9100），不必裝廠商驅動。Tauri + Rust + SQLite 桌面應用，v1.0 開發中。
- [.NET 電商 API 架構範本](https://blog.markkulab.net/tools/dotnet-ecommerce-api): 以 .NET 10 打造的電商平台後端 API 架構範本：Controller → Service → Repository 分層、Autofac 依命名慣例自動註冊、SqlSugar 支援 MySQL / MariaDB 與 SQL Server、Redis 快取與訊息佇列、Hangfire 排程、JWT 認證，內建可擴充的金流 Provider 模組（綠界 ECPay、藍新 Newebpay）。Apache 2.0 開源。

### 每日 Podcast

- [Mark's Tech Insights 每日 AI 新鮮事](https://blog.markkulab.net/category/tech-news): 每日精選 AI 與科技趨勢，透過語音摘要快速掌握最新技術動態，涵蓋 AI 應用、軟體架構、DevOps 與工程實戰。 — RSS: https://blog.markkulab.net/feed.xml
- [AI股市蝦聊](https://blog.markkulab.net/category/ai-stock-chat): 每個交易日用 AI 分析台股盤勢，以雙人對話聊當天的盤中觀察與隔日預測。 — RSS: https://blog.markkulab.net/ai-stock-chat/feed.xml
- [開源好物週報](https://blog.markkulab.net/category/open-source-weekly): 每週從 Hacker News、GitHub、Reddit 聲量雷達精選免費開源工具，以雙人對話聊解決什麼痛點與怎麼快速上手。 — RSS: https://blog.markkulab.net/open-source-weekly/feed.xml
- [AI 運動週報](https://blog.markkulab.net/category/sports-weekly): 每週一、三、六以雙人對話聊 NBA、MLB 與國際體壇大事，台灣球迷視角，輕鬆有梗不酸人。 — RSS: https://blog.markkulab.net/sports-weekly/feed.xml
- [AI 國際新聞快報](https://blog.markkulab.net/category/world-news): 每天早上以雙人對話把過去一天的國際大事講白：政治外交、全球經濟、衝突與安全、災害與氣候，台灣視角、中立客觀、每則附出處。 — RSS: https://blog.markkulab.net/world-news/feed.xml
- [地端 AI 實驗室](https://blog.markkulab.net/category/local-ai-lab): 每週三、五精選可以下載到自己機器上跑的開源模型與 LoRA，用雙人對話講清楚能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪，規格一律引述官方 model card。 — RSS: https://blog.markkulab.net/local-ai-lab/feed.xml

### 站長優惠

- [Saily eSIM](https://blog.markkulab.net/saily): 出國旅遊上網 eSIM・NordVPN 團隊出品，優惠碼：KUKU
- [NordVPN](https://blog.markkulab.net/nordvpn): 全球最多人用的 VPN・獨立稽核無日誌
- [PremLogin](https://blog.markkulab.net/premlogin): 訂閱合租平台・串流與 AI 訂閱席位分攤，優惠碼：markku666

### 電子報

[訂閱電子報](https://blog.markkulab.net/subscribe) — 第一時間收到新文章通知，無垃圾信、隨時可取消訂閱。
