---
title: "🧪 HF 熱度第一 Xing4.0-29B-A4B：29B 模型只啟用 4B，塞單卡｜地端 AI 實驗室"
description: "本週 HF 熱度榜冠軍是 Xing4.0-29B-A4B，43K 次下載、1.7K 個讚，29B 參數但每個 token 只啟用 4B，官方教學說單卡就塞得下；這集另外帶了原生串流語音辨識 Audio8-ASR-Infinite，跟專門重排把關的 openjev，等一下告訴你三顆模型官方標示的硬體門檻，以及各自能解決哪些場景的問題。"
canonical_url: "https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-09-25"
author: "Mark Ku"
author_url: "https://blog.markkulab.net/author/mark-ku"
site: "Mark Ku's Blog"
date_published: "2026-09-25T02:00:00.000Z"
category: "地端 AI 實驗室"
tags: ["local-ai", "podcast", "地端模型", "lora", "開源模型", "Xing4.0-29B-A4B", "Audio8-ASR-Infinite", "openjev", "MoE", "語音辨識", "RAG"]
language: "zh-TW"
license: "CC BY 4.0"
license_url: "https://creativecommons.org/licenses/by/4.0/"
attribution: "轉載或引用請註明作者並附上原文連結"
---

# 🧪 HF 熱度第一 Xing4.0-29B-A4B：29B 模型只啟用 4B，塞單卡｜地端 AI 實驗室

> **TL;DR** — Xing4.0-29B-A4B 是混合專家架構模型，總參數 29B 但推論時僅啟用 4B，官方教學說單張消費級顯卡可跑，支援 256K 原生上下文且相容 vLLM、SGLang。Audio8-ASR-Infinite 是 4B 串流語音辨識模型，中文轉寫延遲 240-560ms 可調，靠 rolling KV cache 支援不限長度連續運作。

## 開場白

本週 HF 熱度榜冠軍是 Xing4.0-29B-A4B，43K 次下載、1.7K 個讚，29B 參數但每個 token 只啟用 4B，官方教學說單卡就塞得下；這集另外帶了原生串流語音辨識 Audio8-ASR-Infinite，跟專門重排把關的 openjev，等一下告訴你三顆模型官方標示的硬體門檻，以及各自能解決哪些場景的問題。

## 本期精選

### 1. Xing4.0-29B-A4B：29B 總參數，MoE 只啟用 4B，官方自帶 GGUF 教學能塞單卡

- **這是什麼**：XingChen-AGI 出的 Xing4.0-29B-A4B，是一顆 MoE（混合專家）架構的語言模型，總參數 29B，但推論時每個 token 只啟用 4B，走 apache-2.0 授權，safetensors 格式。官方 model card 註明整個訓練跑在 Ascend NPU 加 MindSpore 框架，出品方是中國電信旗下的人工智慧公司。
- **能用在哪些場景**：
  - 接手遺留專案的後端工程師，把整個 repo 連同說明文件一次餵進官方標示的 256K 原生上下文（card 說可延伸到 512K），在自己機器上做跨檔案的修改計畫，公司程式碼完全不用上傳到雲端。
  - 想自架 coding agent 的人，用 llama.cpp 的 llama-server 在本機起一個服務。model card 標示它支援多步驟規劃與 tool calling，官方教學特別註明呼叫工具要加上 --jinja 參數，可以接自己寫的 CLI 或編輯器外掛。
  - 內部工具團隊拿它做 card 上點名的垂直應用：意圖分類、表格理解、合約審查、知識庫問答，在自己的資料上做輕量客製化，不用把敏感文件送出公司。
- **跑得動嗎**：官方 model card 沒有寫明確的 VRAM 數字，只列出跟 vLLM、SGLang、KTransformers 相容。官方的 llama.cpp 教學文件寫得比較具體：權重採 IQ4_NL 混合精度量化後，GGUF 檔案約 18 GB，教學說可以在單張消費級顯卡上跑；另外還給了 2 張 12GB 顯卡搭 Q8_0 KV cache 的餘量數字，65536 tokens 上下文時顯示卡還剩 5.2 GiB，131072 時剩 4.5 GiB，拉到 262144（官方標示的原生上限）時剩 3.1 GiB。GGUF 版本放在官方另開的 XingChen-AGI/Xing4.0-29B-A4B-GGUF 這個 repo。
- **本期聲量**：HF 熱度 1223，43.0K 次下載、1.7K 個讚，是本期三顆裡熱度最高的一顆。
- **跟同類比**：同期熱度更高的兩顆，依各家 model card 自報，deepseek-ai/DeepSeek-V4.1-Flash 標的是 552B backbone（prefill 啟用 8B、decode 啟用 16B），XiaomiMiMo/MiMo-V2.6-Flash-RL 標 309B／15B、部署範例直接寫 --tp 8，兩者都不是單機量級。Xing4.0 是本期唯一「MoE 省算力又只有 29B 權重」同時成立的組合，card 自報 SWE-bench Verified 75.00、Terminal-Bench 2.1 57.50。
- **怎麼取得**：README 的 transformers 範例要記得帶 trust_remote_code=True 和 device_map="auto"；一行起服務是 vllm serve "XingChen-AGI/Xing4.0-29B-A4B"，或 python3 -m sglang.launch_server --model-path "XingChen-AGI/Xing4.0-29B-A4B"。走地端量化就抓官方 GGUF repo，教學說是把 GGUF 放在跟 llama-server 同層的 deploy 目錄，用 -ngl 99 把層 offload 到 GPU。
- **連結**：[XingChen-AGI/Xing4.0-29B-A4B](https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B)

### 2. Audio8-ASR-Infinite：4B 原生串流語音辨識，中文延遲可調，不用上雲

- **這是什麼**：Edge0 出的 Audio8-ASR-Infinite，是一顆 4B 參數的原生串流語音辨識模型，權重檔 model.safetensors 大小 8.17 GB，資料型別 bfloat16，apache-2.0 授權可商用，支援中英雙語。
- **能用在哪些場景**：
  - 做客服或線上會議系統的工程師，要即時字幕但錄音不能上傳第三方：model card 標示轉寫延遲落在 240 到 560 ms 之間，audio clock 可以選 80、120 或 160 ms，能自己在延遲跟正確率之間找平衡點。
  - 要長時間不斷線收音的場景，像直播字幕或值班監聽台：card 說原生上下文只有 30 秒，但靠 rolling KV cache 可以擴到不限長度，作者明講就是為 24/7 連續運作設計的。
  - 手上有一批中文訪談或內部會議錄音要轉成文字稿的內容團隊，用 transformers 的 pipeline 批次跑完，語言參數指定 zh 就好。
- **跑得動嗎**：card 沒有標示 VRAM 下限，只寫了 4B 參數、model.safetensors 8.17 GB、bfloat16。推論程式碼裡用了 .cuda()，代表需要 CUDA GPU；作者建議正式環境用 Docker compose 部署，串流推論則是走 WebSocket 搭配 vLLM。
- **本期聲量**：HF 熱度 426，2.9K 次下載、473 個讚。
- **跟同類比**：作者自己在 card 附的那張表（480 ms 延遲、80 ms frame length 的設定下）把對照組點名為 Voxtral：AISHELL-1 的字錯誤率（CER）是 1.750% 對 Voxtral 的 16.795%，中文差距很明顯；但反過來看 LibriSpeech test.clean 的字錯誤率（WER）是 3.042% 對 Voxtral 的 2.210%，test.other 是 6.808% 對 5.552%，英文反而略遜一截。照作者自己列出的數據，它的賣點是中文辨識跟串流延遲，不是英文的純準確率。
- **怎麼取得**：README 給的最短路徑是 transformers 的 pipeline("automatic-speech-recognition", model="Edge0/Audio8-ASR-Infinite", trust_remote_code=True)；想跑串流解碼另外有 CLI 範例 python -m audio8_asr_infinite.examples.torch_streaming_decode --checkpoint /path/to/checkpoint --audio sample.wav --language zh --transcription-delay-ms 480。
- **連結**：[Edge0/Audio8-ASR-Infinite](https://huggingface.co/Edge0/Audio8-ASR-Infinite)

### 3. openjev：把 Qwen3.5 改造成專門重排與事實把關的 cross-encoder

- **這是什麼**：AlexWortega 的 openjev，是把 Qwen3.5 改造成單一 cross-encoder 判斷模型的專案，checkpoint 從 0.8B 一路到 35B-A3B（MoE）都有，MIT 授權，下載不需要申請權限。
- **能用在哪些場景**：
  - 自架 RAG 的後端工程師，把檢索回來的十幾段候選丟給它重排：作者 README 有 rerank 範例，用 0.8B 的 checkpoint 幾乎不會增加多少延遲。
  - 要替回答做事實把關的人，把模型輸出當 hypothesis、檢索到的原文當 premise，讓它判斷 entailment、contradiction 還是 neutral，挑出沒有依據的句子，不用再叫一顆大模型當 judge。
  - 內容審核或即時互動判定：card 明講用途包含 guard content 和 play games in real time，靠小 checkpoint 就能做到即時回應。
- **跑得動嗎**：官方沒有標示 VRAM 或硬體門檻。card 只列出可選 checkpoint 規模，0.8B、2B、4B 與 35B-A3B（MoE），基底模型寫的是 Qwen3.5-4B。這裡官方沒給硬體數字，能推得的只有：0.8B 到 4B 這幾檔量級遠比一般對話用大模型小，理論上比較容易塞進消費級顯卡，但這是從參數量推估，不是官方寫明的門檻。
- **本期聲量**：HF 熱度 441，0 次下載、566 個讚。
- **跟同類比**：作者把它定位成一顆 cross-encoder 同時做重排、評分與把關，讀入 premise 與 hypothesis 後直接輸出三分類，跟常見的 bi-encoder 向量 reranker 走的是不同路線；成績是作者自報的 MNLI、ANLI，還有自建的 JevBench。
- **怎麼取得**：card 給的載入範例是 AutoTokenizer 和 AutoModelForSequenceClassification.from_pretrained("AlexWortega/openjev", subfolder="qwen3.5-4b-nli-v5")，權重放在各自的 subfolder 底下；作者說 v5 適合輸出分類決策，v2 用在多模態場景，README 另外還有 SGLang 部署、rerank 與 hypothesis 預測的範例。
- **連結**：[AlexWortega/openjev](https://huggingface.co/AlexWortega/openjev)

## 結尾段落

這期三顆模型剛好卡住不同的地端痛點：Xing4.0-29B-A4B 補的是旗艦級 agent 能力也塞得進單卡，Audio8-ASR-Infinite 補的是不能上雲的即時字幕，openjev 補的是自架 RAG 最缺、又最不該拿大模型硬幹的重排與把關。如果只能先挑一顆動手，openjev 的 0.8B checkpoint 門檻最低，最快能接進現有的 RAG pipeline 驗證看看。下集再見。

---

## 關於本文與作者

本文出自 [Mark Ku's Blog](https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-09-25)

授權條款： [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) — 轉載或引用請註明作者並附上原文連結

### 關於作者

**[Mark Ku](https://blog.markkulab.net/author/mark-ku)** — 貳陸資訊有限公司｜軟體工程師

- 10 年以上軟體工程師，現在經營貳陸資訊有限公司
- 做過北美電商與 AI SaaS 訂閱收費系統
- 幫小公司做系統、網站、LINE BOT 與 AI 自動化

### 作者開發的免費工具

以下工具皆可免費使用：

- [免費 PDF 簽名工具](https://blog.markkulab.net/tools/pdf-sign): 線上 PDF 簽名工具，瀏覽器內完成手繪、打字、上傳簽名，可拖曳放置、縮放、下載。所有處理都在你的裝置完成，檔案不會上傳。
- [VS Code Refactory](https://blog.markkulab.net/tools/refactory): Refactory 是一款 VS Code 重構擴充套件：34 個重構動作、37 條 code smell 檢查、Code Health 儀表板、18 種語言、534 支測試。懂你的專案慣例：介面放哪、DI 註冊寫在哪、'use client' 該不該加；還會用 git 修改頻率 × 複雜度排出「該先修哪個檔案」，並一鍵把壞味道交給你自己電腦上的 Claude Code 修。免費使用，原始碼不離開你的機器。
- [DB-Kit 資料庫管理工具](https://blog.markkulab.net/tools/db-kit): DB-Kit 是一個用 Tauri + Rust + React 打造的輕量跨平台資料庫管理工具，用單一一致的介面同時管理 MySQL、MariaDB、PostgreSQL、SQL Server、Oracle、SQLite、MongoDB、Redis、Kafka、Elasticsearch 與 RabbitMQ 十一種資料來源：連線密碼以 OS keychain 加密、SSH Tunnel、完整 CRUD、視覺化查詢建構器、多結果集同時顯示、跨連線資料傳輸、結構與資料比對（同步 SQL、結構快照）、Excel / CSV 匯入匯出、執行計畫視覺化、ER 圖、排程備份、SQL 壓力測試（p50～p99 延遲百分位）、15 條規則的 SQL 審查、執行前 AI 審查並逐句備份的「審查並執行」（自動產生回滾腳本）、Kafka 訊息瀏覽與監控告警；繁中 / 英文雙語介面，內建 AI 助手（本機 CLI 或 Anthropic / OpenAI 相容 API，自然語言生成 SQL、AI 審查與調校建議）與命令列工具 dbk。免費開源（MIT），提供 Windows / macOS / Linux 安裝檔。
- [VS Code Super Mermaid](https://blog.markkulab.net/tools/super-mermaid): Super Mermaid 是一款 VS Code 擴充套件：開箱即用的漂亮 Mermaid 圖表，自動上色、即時預覽、滑鼠平移縮放、PNG / SVG 高解析匯出，內建 21 種範本與多種主題。免費開源（MIT）。
- [React Super Mermaid](https://blog.markkulab.net/tools/react-super-mermaid): react-super-mermaid 是一個開源 React 元件庫：一行 <MermaidViewer> 即可渲染漂亮的 Mermaid 圖表，內建 colorful / sketch 主題、平移縮放、圖內搜尋、SVG / PNG 高解析匯出。輕量、SSR 安全、完整 TypeScript 型別。免費開源（MIT）。
- [Jira / Confluence Super Mermaid](https://blog.markkulab.net/tools/jira-super-mermaid): Atlassian Forge app：在 Jira issue 與 Confluence 內文直接寫 Mermaid 語法，畫流程圖、時序圖、狀態機與甘特圖。11 種圖表、SVG / PNG 匯出、明暗主題、完整中日韓文字支援。取得 Runs on Atlassian 資格：圖表存在你自己的站台，app 不呼叫任何第三方服務。免費，即將上架 Atlassian Marketplace。
- [Mermaid 線上預覽](https://blog.markkulab.net/tools/mermaid-preview): 在瀏覽器裡寫 Mermaid、即時看圖，整張圖表壓進網址就能分享。免註冊、不上傳伺服器，相容 mermaid.live 的分享連結。
- [React Intl Phone Number](https://blog.markkulab.net/tools/react-intl-phone-number): react-intl-phone-number 是一個開源 React 元件：framework-agnostic、不依賴 antd，提供 E.164 進出、可搜尋國旗 / 國碼下拉、可配置驗證等級（strict / mobile-strict / loose）、可主題化 CSS 與 i18n，電話邏輯由 google-libphonenumber 驅動。輕量、完整 TypeScript 型別。免費開源（MIT）。
- [Uptime Kuma Cluster](https://blog.markkulab.net/tools/uptime-kuma-cluster): 把單機版 Uptime Kuma 改造成高可用叢集：OpenResty + Lua 智慧負載平衡、MariaDB 共享狀態、健康檢查與自動 Failover，附叢集管理 REST API，一行 Docker Compose 啟動。免費開源（MIT）。
- [AI Podcast Cut 音檔剪輯](https://blog.markkulab.net/tools/ai-podcast-cut): 丟進一段錄音，AI 幫你剪掉「嗯、呃、那個」與講到一半重講的片段，平衡逐段音量，並派第二個 agent 覆核每一刀。辨識與去人聲都在你自己的電腦上跑，不上傳、不需要金鑰。剪點會貼齊字邊界與零交越、每一刀都有漸弱漸強，句尾還留得住呼吸感。Windows / macOS / Linux 桌面應用，MIT 開源，Windows 安裝檔內建 ffmpeg。
- [open-pos 開源餐飲 POS](https://blog.markkulab.net/tools/open-pos): 一台電腦加一台出單機就能開店。資料存在自己的硬碟裡、沒有月租、沒有綁約，MIT 全開源。金額用整數元依營業稅法拆算稅額，銷售額加稅額恆等於總額；出單走網路型 ESC/POS（TCP 9100），不必裝廠商驅動。Tauri + Rust + SQLite 桌面應用，v1.0 開發中。
- [特教專案](https://blog.markkulab.net/education): 為特殊教育學生製作的學習教材

### 每日 Podcast

- [Mark's Tech Insights 每日 AI 新鮮事](https://blog.markkulab.net/category/tech-news): 每日精選 AI 與科技趨勢，透過語音摘要快速掌握最新技術動態，涵蓋 AI 應用、軟體架構、DevOps 與工程實戰。 — RSS: https://blog.markkulab.net/feed.xml
- [AI股市蝦聊](https://blog.markkulab.net/category/ai-stock-chat): 每個交易日用 AI 分析台股盤勢，以雙人對話聊當天的盤中觀察與隔日預測。 — RSS: https://blog.markkulab.net/ai-stock-chat/feed.xml
- [開源好物週報](https://blog.markkulab.net/category/open-source-weekly): 每週從 Hacker News、GitHub、Reddit 聲量雷達精選免費開源工具，以雙人對話聊解決什麼痛點與怎麼快速上手。 — RSS: https://blog.markkulab.net/open-source-weekly/feed.xml
- [AI 運動週報](https://blog.markkulab.net/category/sports-weekly): 每週一、三、六以雙人對話聊 NBA、MLB 與國際體壇大事，台灣球迷視角，輕鬆有梗不酸人。 — RSS: https://blog.markkulab.net/sports-weekly/feed.xml
- [AI 國際新聞快報](https://blog.markkulab.net/category/world-news): 每天早上以雙人對話把過去一天的國際大事講白：政治外交、全球經濟、衝突與安全、災害與氣候，台灣視角、中立客觀、每則附出處。 — RSS: https://blog.markkulab.net/world-news/feed.xml
- [地端 AI 實驗室](https://blog.markkulab.net/category/local-ai-lab): 每週三、五精選可以下載到自己機器上跑的開源模型與 LoRA，用雙人對話講清楚能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪，規格一律引述官方 model card。 — RSS: https://blog.markkulab.net/local-ai-lab/feed.xml

### 站長優惠

- [Saily eSIM](https://blog.markkulab.net/saily): 出國旅遊上網 eSIM・NordVPN 團隊出品，優惠碼：KUKU
- [NordVPN](https://blog.markkulab.net/nordvpn): 全球最多人用的 VPN・獨立稽核無日誌
- [PremLogin](https://blog.markkulab.net/premlogin): 訂閱合租平台・串流與 AI 訂閱席位分攤，優惠碼：markku666

### 電子報

[訂閱電子報](https://blog.markkulab.net/subscribe) — 第一時間收到新文章通知，無垃圾信、隨時可取消訂閱。
