開場白
本週 HF 熱度榜冠軍是 Xing4.0-29B-A4B,43K 次下載、1.7K 個讚,29B 參數但每個 token 只啟用 4B,官方教學說單卡就塞得下;這集另外帶了原生串流語音辨識 Audio8-ASR-Infinite,跟專門重排把關的 openjev,等一下告訴你三顆模型官方標示的硬體門檻,以及各自能解決哪些場景的問題。
本期精選
1. Xing4.0-29B-A4B:29B 總參數,MoE 只啟用 4B,官方自帶 GGUF 教學能塞單卡
- 這是什麼:XingChen-AGI 出的 Xing4.0-29B-A4B,是一顆 MoE(混合專家)架構的語言模型,總參數 29B,但推論時每個 token 只啟用 4B,走 apache-2.0 授權,safetensors 格式。官方 model card 註明整個訓練跑在 Ascend NPU 加 MindSpore 框架,出品方是中國電信旗下的人工智慧公司。
- 能用在哪些場景:
- 接手遺留專案的後端工程師,把整個 repo 連同說明文件一次餵進官方標示的 256K 原生上下文(card 說可延伸到 512K),在自己機器上做跨檔案的修改計畫,公司程式碼完全不用上傳到雲端。
- 想自架 coding agent 的人,用 llama.cpp 的 llama-server 在本機起一個服務。model card 標示它支援多步驟規劃與 tool calling,官方教學特別註明呼叫工具要加上 --jinja 參數,可以接自己寫的 CLI 或編輯器外掛。
- 內部工具團隊拿它做 card 上點名的垂直應用:意圖分類、表格理解、合約審查、知識庫問答,在自己的資料上做輕量客製化,不用把敏感文件送出公司。
- 跑得動嗎:官方 model card 沒有寫明確的 VRAM 數字,只列出跟 vLLM、SGLang、KTransformers 相容。官方的 llama.cpp 教學文件寫得比較具體:權重採 IQ4_NL 混合精度量化後,GGUF 檔案約 18 GB,教學說可以在單張消費級顯卡上跑;另外還給了 2 張 12GB 顯卡搭 Q8_0 KV cache 的餘量數字,65536 tokens 上下文時顯示卡還剩 5.2 GiB,131072 時剩 4.5 GiB,拉到 262144(官方標示的原生上限)時剩 3.1 GiB。GGUF 版本放在官方另開的 XingChen-AGI/Xing4.0-29B-A4B-GGUF 這個 repo。
- 本期聲量:HF 熱度 1223,43.0K 次下載、1.7K 個讚,是本期三顆裡熱度最高的一顆。
- 跟同類比:同期熱度更高的兩顆,依各家 model card 自報,deepseek-ai/DeepSeek-V4.1-Flash 標的是 552B backbone(prefill 啟用 8B、decode 啟用 16B),XiaomiMiMo/MiMo-V2.6-Flash-RL 標 309B/15B、部署範例直接寫 --tp 8,兩者都不是單機量級。Xing4.0 是本期唯一「MoE 省算力又只有 29B 權重」同時成立的組合,card 自報 SWE-bench Verified 75.00、Terminal-Bench 2.1 57.50。
- 怎麼取得:README 的 transformers 範例要記得帶 trust_remote_code=True 和 device_map="auto";一行起服務是 vllm serve "XingChen-AGI/Xing4.0-29B-A4B",或 python3 -m sglang.launch_server --model-path "XingChen-AGI/Xing4.0-29B-A4B"。走地端量化就抓官方 GGUF repo,教學說是把 GGUF 放在跟 llama-server 同層的 deploy 目錄,用 -ngl 99 把層 offload 到 GPU。
- 連結:XingChen-AGI/Xing4.0-29B-A4B
2. Audio8-ASR-Infinite:4B 原生串流語音辨識,中文延遲可調,不用上雲
- 這是什麼:Edge0 出的 Audio8-ASR-Infinite,是一顆 4B 參數的原生串流語音辨識模型,權重檔 model.safetensors 大小 8.17 GB,資料型別 bfloat16,apache-2.0 授權可商用,支援中英雙語。
- 能用在哪些場景:
- 做客服或線上會議系統的工程師,要即時字幕但錄音不能上傳第三方:model card 標示轉寫延遲落在 240 到 560 ms 之間,audio clock 可以選 80、120 或 160 ms,能自己在延遲跟正確率之間找平衡點。
- 要長時間不斷線收音的場景,像直播字幕或值班監聽台:card 說原生上下文只有 30 秒,但靠 rolling KV cache 可以擴到不限長度,作者明講就是為 24/7 連續運作設計的。
- 手上有一批中文訪談或內部會議錄音要轉成文字稿的內容團隊,用 transformers 的 pipeline 批次跑完,語言參數指定 zh 就好。
- 跑得動嗎:card 沒有標示 VRAM 下限,只寫了 4B 參數、model.safetensors 8.17 GB、bfloat16。推論程式碼裡用了 .cuda(),代表需要 CUDA GPU;作者建議正式環境用 Docker compose 部署,串流推論則是走 WebSocket 搭配 vLLM。
- 本期聲量:HF 熱度 426,2.9K 次下載、473 個讚。
- 跟同類比:作者自己在 card 附的那張表(480 ms 延遲、80 ms frame length 的設定下)把對照組點名為 Voxtral:AISHELL-1 的字錯誤率(CER)是 1.750% 對 Voxtral 的 16.795%,中文差距很明顯;但反過來看 LibriSpeech test.clean 的字錯誤率(WER)是 3.042% 對 Voxtral 的 2.210%,test.other 是 6.808% 對 5.552%,英文反而略遜一截。照作者自己列出的數據,它的賣點是中文辨識跟串流延遲,不是英文的純準確率。
- 怎麼取得:README 給的最短路徑是 transformers 的 pipeline("automatic-speech-recognition", model="Edge0/Audio8-ASR-Infinite", trust_remote_code=True);想跑串流解碼另外有 CLI 範例 python -m audio8_asr_infinite.examples.torch_streaming_decode --checkpoint /path/to/checkpoint --audio sample.wav --language zh --transcription-delay-ms 480。
- 連結:Edge0/Audio8-ASR-Infinite
3. openjev:把 Qwen3.5 改造成專門重排與事實把關的 cross-encoder
- 這是什麼:AlexWortega 的 openjev,是把 Qwen3.5 改造成單一 cross-encoder 判斷模型的專案,checkpoint 從 0.8B 一路到 35B-A3B(MoE)都有,MIT 授權,下載不需要申請權限。
- 能用在哪些場景:
- 自架 RAG 的後端工程師,把檢索回來的十幾段候選丟給它重排:作者 README 有 rerank 範例,用 0.8B 的 checkpoint 幾乎不會增加多少延遲。
- 要替回答做事實把關的人,把模型輸出當 hypothesis、檢索到的原文當 premise,讓它判斷 entailment、contradiction 還是 neutral,挑出沒有依據的句子,不用再叫一顆大模型當 judge。
- 內容審核或即時互動判定:card 明講用途包含 guard content 和 play games in real time,靠小 checkpoint 就能做到即時回應。
- 跑得動嗎:官方沒有標示 VRAM 或硬體門檻。card 只列出可選 checkpoint 規模,0.8B、2B、4B 與 35B-A3B(MoE),基底模型寫的是 Qwen3.5-4B。這裡官方沒給硬體數字,能推得的只有:0.8B 到 4B 這幾檔量級遠比一般對話用大模型小,理論上比較容易塞進消費級顯卡,但這是從參數量推估,不是官方寫明的門檻。
- 本期聲量:HF 熱度 441,0 次下載、566 個讚。
- 跟同類比:作者把它定位成一顆 cross-encoder 同時做重排、評分與把關,讀入 premise 與 hypothesis 後直接輸出三分類,跟常見的 bi-encoder 向量 reranker 走的是不同路線;成績是作者自報的 MNLI、ANLI,還有自建的 JevBench。
- 怎麼取得:card 給的載入範例是 AutoTokenizer 和 AutoModelForSequenceClassification.from_pretrained("AlexWortega/openjev", subfolder="qwen3.5-4b-nli-v5"),權重放在各自的 subfolder 底下;作者說 v5 適合輸出分類決策,v2 用在多模態場景,README 另外還有 SGLang 部署、rerank 與 hypothesis 預測的範例。
- 連結:AlexWortega/openjev
結尾段落
這期三顆模型剛好卡住不同的地端痛點:Xing4.0-29B-A4B 補的是旗艦級 agent 能力也塞得進單卡,Audio8-ASR-Infinite 補的是不能上雲的即時字幕,openjev 補的是自架 RAG 最缺、又最不該拿大模型硬幹的重排與把關。如果只能先挑一顆動手,openjev 的 0.8B checkpoint 門檻最低,最快能接進現有的 RAG pipeline 驗證看看。下集再見。



























留言