開場白
google/embeddinggemma-2 只有 740M,但官方 model card 寫的是它用同一組 768 維向量,同時扛文字、圖片、影片、音訊四種模態,context window 還拉到 8,192 token。這集也會聊到一個被下載 1.5 萬次、專門把 AI 腔文章改到像真人寫的 jialinyyzz/humanizer,以及一個把 27B 壓進單張 16GB 顯卡就能跑的量化實驗 OrcaSAQ-2-Cyber-27B。手機裝得下的向量搜尋引擎到底能拿來幹嘛,等一下告訴你。
本期精選
1. google/embeddinggemma-2:手機也裝得下的多模態向量引擎
- 這是什麼: 這不是聊天模型,是一個 embedding 模型,任務是把文字、圖片、影片、音訊都投影到同一個向量空間裡方便做檢索。740M 參數,Apache-2.0 授權,非 gated,不用申請就能下載。
- 能用在哪些場景:
- 工程師把公司內部文件、會議截圖、錄音檔丟進本機向量庫做私有知識庫問答:官方 model card 標示文字、影像、影片、音訊共用同一個 768 維向量空間,context 8,192 token,所以同一套索引就能跨模態檢索,資料不用離開自己的機器。
- 做離線行動 App 的語意搜尋:Google 開發者部落格標示量化後在 Pixel 11 Pro 只需約 191MB(純文字權重)到 567MB(完整多模態)的 active RAM,搜尋功能可以整個做在裝置上,不用打 API。
- 自架 vector DB 想省儲存的人:官方說明提到用 Matryoshka Representation Learning,可把輸出向量從 768 維動態截斷到 512、256、128 維,官方標示最多 6 倍儲存縮減,索引量大的話直接反映在硬碟與記憶體成本上。
- 跑得動嗎: 官方 model card 只寫「designed to run on consumer hardware such as mobile devices and laptops」,沒有直接給出 VRAM 數字;但精度上有明確要求:「Run inference in bfloat16 or float32. Do not use float16.」,理由是啟動值範圍超出 float16 動態範圍會產生 NaN 或劣化的向量。架構可模組化載入,270M(文字/程式碼)、440M(+視覺)、570M(+音訊)、740M(全多模態)四種組合都投影到同一向量空間。
- 本期聲量: HF 熱度 202(364 次下載、205 個讚)。
- 跟同類比: 跟自家前代 EmbeddingGemma 比,官方說法是 context window 拉大為 4 倍(8,192 token),並從純文字擴張到五種模態共用同一向量空間;官方 model card 列出的 MTEB 成績為多語平均 61.36、程式碼 NDCG@10 78.68、影像 64.64、影片 Hit@1 50.67、音訊 MRR@10 69.54。
- 怎麼取得: README 給兩條路,sentence-transformers 的
SentenceTransformer("google/embeddinggemma-2"),或 transformers 的AutoProcessor搭配AutoModel.from_pretrained();model card 註明部署需遵守 Gemma Prohibited Use Policy。 - 連結: huggingface.co/google/embeddinggemma-2
2. jialinyyzz/humanizer:把 AI 腔改成人話,但數字一個都不准改
- 這是什麼: 基底是 google/gemma-4-12B 的 12B 微調模型,中英雙語,任務非常專一,就是把 AI 寫的草稿改寫成像真人手寫的文字。權重以 GGUF、safetensors、MLX 三種格式提供,授權 Apache 2.0。
- 能用在哪些場景:
- 工程師寫技術文件或週報:先讓大模型打草稿,再用本機 humanizer 把 AI 腔改掉,model card 強調的約束是「Every fact, number, unit, date, name and quotation must survive unchanged」,所以版本號、效能數據、日期不會在改寫中被動到。
- 稿子不能上雲端的場合:內部報告、客戶提案含敏感資訊時,用 GGUF 在自己筆電完全離線跑,README 直接給了
llama-server的啟動指令。 - Mac 使用者想在 Apple Silicon 上用:README 附了
mlx_lm.convert --hf-path jialinyyzz/humanizer的轉檔指令,model card 並標示在 Apple M 系列晶片上峰值記憶體約 6.2GB(2-bit)到 13.7GB(Q8_0)。
- 跑得動嗎: model card 逐檔列出量化版本與記憶體需求,Q8_0(檔案 12.7GB)標「32 GB of memory or more. Recommended.」、Q6_K(10.0GB)標「16 GB of memory」、Q4_K_M(7.6GB)標「About 14 GB of memory」、Q3-QAT(5.6GB)標「12 GB of memory」、IQ2_XS-QAT(3.9GB)標「8 GB of memory, the smallest」。原始 BF16 權重約 24GB。
- 本期聲量: HF 熱度 370(15.1k 次下載、378 個讚)。
- 跟同類比: 作者在 Hugging Face 部落格〈We built an AI humanizer and never let it see a detector〉說明訓練全程沒有把任何 AI 偵測器當成 reward,人類側用未經加工的真人文章,AI 側則讓大模型從該篇人類文章反推出草稿。model card 標示在 Originality.ai 最嚴格設定下有 95% 的改寫被判為人類(前一版為 88%),英文改寫 420 篇中有 376 篇通過事實查核。
- 怎麼取得: README 給 llama.cpp 的
llama-server -m humanizer-12b-Q8_0.gguf -c 8192 -np 1 -ngl 99,也列了vllm serve "jialinyyzz/humanizer"與 transformers 直接載入兩種方式。 - 連結: huggingface.co/jialinyyzz/humanizer
3. orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF:27B 塞進單張 16GB 顯卡
- 這是什麼: 27B 參數的量化模型,血緣是 Qwen/Qwen3.8-27B(經作者自己的 orcarouter/Qwen3.8-27B-Uncensored 再量化),GGUF 格式,Apache-2.0。model card 明寫定位是「local deployment · coding · tool use · reasoning · defensive red teaming · vulnerability research · authorized security testing」,也就是給授權情境下的資安研究與紅隊演練用。
- 能用在哪些場景:
- 做授權滲透測試或紅隊演練的工程師在隔離環境自架助手:本機跑代表目標系統資訊不必送進雲端 API。
- 想在單張 16GB 顯卡上跑 27B 的人:Ollama 一行
ollama run hf.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF就能起,model card 的 llama-cli 範例開到 32K context,可以當離線的寫程式、工具呼叫助手。 - 研究量化極限的人:這包是「BF16 54.7GB 壓到 15.7GB」的實際案例,model card 附了 perplexity、token agreement、KLD 等指標可以對照壓縮後的劣化程度。
- 跑得動嗎: 單一量化檔 15.7GB(原始 BF16 為 54.7GB)。model card 表格標示 llama.cpp 峰值 VRAM 為「14.9 GB」(DFlash2 off)與「18.1 GB」(DFlash2 on),吞吐分別為 20.5 tok/s 與 27.6 tok/s;作者註明測試條件是「Single stream, greedy, measured in the official llama.cpp CUDA container」,但頁面上沒有寫測試所用的顯卡型號。
- 本期聲量: HF 熱度 215(18.1k 次下載、415 個讚)。
- 跟同類比: 跟一般 llama.cpp 常見的 Q4_K_M 這類人人可複現的量化不同,作者把 SAQ-2 描述為「proprietary sensitivity-aware mixed-precision quantization system」,並明講「Detailed quantization methodology, calibration strategy, precision allocation and packing techniques are not currently disclosed」,壓縮率漂亮但方法不公開。作者自己也掛了警語「This model is uncensored.」,模型衍生自 abliterated checkpoint,且「Guardrails, filtering and policy enforcement are the deployer's responsibility.」,部署前務必確認自己的使用情境屬於授權範圍。
- 怎麼取得: README 給 llama.cpp 的
llama-cli -m ./OrcaSAQ-2-27B-Uncensored-GGUF/OrcaSAQ-2-27B-Uncensored.gguf -ngl 99 -c 32768,或 Ollama 的ollama run hf.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF。 - 連結: huggingface.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF
結尾段落
三個選題其實指向同一件事,模型不再只拚參數量,而是拚「怎麼塞進一般人的機器裡」,不管是 740M 的多模態 embedding、12B 的任務型微調,還是 27B 壓到 15.7GB 的量化實驗,省的都是同一塊 VRAM 跟記憶體。如果只能先裝一個來研究,jialinyyzz/humanizer 的量化階梯最完整,8GB 記憶體就能起步。下集再見。



























留言