---
title: "🧪 740M 的 embeddinggemma-2 吃下文字圖片影片音訊，手機也塞得下｜地端 AI 實驗室"
description: "google/embeddinggemma-2 只有 740M，但官方 model card 寫的是它用同一組 768 維向量，同時扛文字、圖片、影片、音訊四種模態，context window 還拉到 8,192 token。"
canonical_url: "https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-10-07"
author: "Mark Ku"
author_url: "https://blog.markkulab.net/author/mark-ku"
site: "Mark Ku's Blog"
date_published: "2026-10-07T02:00:00.000Z"
category: "地端 AI 實驗室"
tags: ["local-ai", "podcast", "地端模型", "lora", "開源模型", "embeddinggemma", "humanizer", "OrcaSAQ2", "RAG", "量化", "GGUF"]
language: "zh-TW"
license: "CC BY 4.0"
license_url: "https://creativecommons.org/licenses/by/4.0/"
attribution: "轉載或引用請註明作者並附上原文連結"
---

# 🧪 740M 的 embeddinggemma-2 吃下文字圖片影片音訊，手機也塞得下｜地端 AI 實驗室

> **TL;DR** — Google 的 embeddinggemma-2 以 740M 參數用單一 768 維向量支援文字、圖片、影片、音訊四種模態，context window 達 8,192 token，量化後手機只需 191，567MB RAM；jialinyyzz/humanizer 是 12B 微調模型，專門把 AI 寫的草稿改成人話，同時保留所有數字、日期、版本號不變，離線跑可避免敏感資訊上雲。orcarouter/OrcaSAQ-2-Cyber-27B 將 27B Qwen 模型量化到 15.7GB，單張 16GB 顯卡即可跑 32K context，適合授權資安測試與本機開發。

## 開場白
google/embeddinggemma-2 只有 740M，但官方 model card 寫的是它用同一組 768 維向量，同時扛文字、圖片、影片、音訊四種模態，context window 還拉到 8,192 token。這集也會聊到一個被下載 1.5 萬次、專門把 AI 腔文章改到像真人寫的 jialinyyzz/humanizer，以及一個把 27B 壓進單張 16GB 顯卡就能跑的量化實驗 OrcaSAQ-2-Cyber-27B。手機裝得下的向量搜尋引擎到底能拿來幹嘛，等一下告訴你。

## 本期精選

### 1. google/embeddinggemma-2：手機也裝得下的多模態向量引擎
- **這是什麼**: 這不是聊天模型，是一個 embedding 模型，任務是把文字、圖片、影片、音訊都投影到同一個向量空間裡方便做檢索。740M 參數，Apache-2.0 授權，非 gated，不用申請就能下載。
- **能用在哪些場景**:
  1. 工程師把公司內部文件、會議截圖、錄音檔丟進本機向量庫做私有知識庫問答：官方 model card 標示文字、影像、影片、音訊共用同一個 768 維向量空間，context 8,192 token，所以同一套索引就能跨模態檢索，資料不用離開自己的機器。
  2. 做離線行動 App 的語意搜尋：Google 開發者部落格標示量化後在 Pixel 11 Pro 只需約 191MB（純文字權重）到 567MB（完整多模態）的 active RAM，搜尋功能可以整個做在裝置上，不用打 API。
  3. 自架 vector DB 想省儲存的人：官方說明提到用 Matryoshka Representation Learning，可把輸出向量從 768 維動態截斷到 512、256、128 維，官方標示最多 6 倍儲存縮減，索引量大的話直接反映在硬碟與記憶體成本上。
- **跑得動嗎**: 官方 model card 只寫「designed to run on consumer hardware such as mobile devices and laptops」，沒有直接給出 VRAM 數字；但精度上有明確要求：「Run inference in bfloat16 or float32. Do not use float16.」，理由是啟動值範圍超出 float16 動態範圍會產生 NaN 或劣化的向量。架構可模組化載入，270M（文字／程式碼）、440M（＋視覺）、570M（＋音訊）、740M（全多模態）四種組合都投影到同一向量空間。
- **本期聲量**: HF 熱度 202（364 次下載、205 個讚）。
- **跟同類比**: 跟自家前代 EmbeddingGemma 比，官方說法是 context window 拉大為 4 倍（8,192 token），並從純文字擴張到五種模態共用同一向量空間；官方 model card 列出的 MTEB 成績為多語平均 61.36、程式碼 NDCG@10 78.68、影像 64.64、影片 Hit@1 50.67、音訊 MRR@10 69.54。
- **怎麼取得**: README 給兩條路，sentence-transformers 的 `SentenceTransformer("google/embeddinggemma-2")`，或 transformers 的 `AutoProcessor` 搭配 `AutoModel.from_pretrained()`；model card 註明部署需遵守 Gemma Prohibited Use Policy。
- **連結**: [huggingface.co/google/embeddinggemma-2](https://huggingface.co/google/embeddinggemma-2)

### 2. jialinyyzz/humanizer：把 AI 腔改成人話，但數字一個都不准改
- **這是什麼**: 基底是 google/gemma-4-12B 的 12B 微調模型，中英雙語，任務非常專一，就是把 AI 寫的草稿改寫成像真人手寫的文字。權重以 GGUF、safetensors、MLX 三種格式提供，授權 Apache 2.0。
- **能用在哪些場景**:
  1. 工程師寫技術文件或週報：先讓大模型打草稿，再用本機 humanizer 把 AI 腔改掉，model card 強調的約束是「Every fact, number, unit, date, name and quotation must survive unchanged」，所以版本號、效能數據、日期不會在改寫中被動到。
  2. 稿子不能上雲端的場合：內部報告、客戶提案含敏感資訊時，用 GGUF 在自己筆電完全離線跑，README 直接給了 `llama-server` 的啟動指令。
  3. Mac 使用者想在 Apple Silicon 上用：README 附了 `mlx_lm.convert --hf-path jialinyyzz/humanizer` 的轉檔指令，model card 並標示在 Apple M 系列晶片上峰值記憶體約 6.2GB（2-bit）到 13.7GB（Q8_0）。
- **跑得動嗎**: model card 逐檔列出量化版本與記憶體需求，Q8_0（檔案 12.7GB）標「32 GB of memory or more. Recommended.」、Q6_K（10.0GB）標「16 GB of memory」、Q4_K_M（7.6GB）標「About 14 GB of memory」、Q3-QAT（5.6GB）標「12 GB of memory」、IQ2_XS-QAT（3.9GB）標「8 GB of memory, the smallest」。原始 BF16 權重約 24GB。
- **本期聲量**: HF 熱度 370（15.1k 次下載、378 個讚）。
- **跟同類比**: 作者在 Hugging Face 部落格〈We built an AI humanizer and never let it see a detector〉說明訓練全程沒有把任何 AI 偵測器當成 reward，人類側用未經加工的真人文章，AI 側則讓大模型從該篇人類文章反推出草稿。model card 標示在 Originality.ai 最嚴格設定下有 95% 的改寫被判為人類（前一版為 88%），英文改寫 420 篇中有 376 篇通過事實查核。
- **怎麼取得**: README 給 llama.cpp 的 `llama-server -m humanizer-12b-Q8_0.gguf -c 8192 -np 1 -ngl 99`，也列了 `vllm serve "jialinyyzz/humanizer"` 與 transformers 直接載入兩種方式。
- **連結**: [huggingface.co/jialinyyzz/humanizer](https://huggingface.co/jialinyyzz/humanizer)

### 3. orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF：27B 塞進單張 16GB 顯卡
- **這是什麼**: 27B 參數的量化模型，血緣是 Qwen/Qwen3.8-27B（經作者自己的 orcarouter/Qwen3.8-27B-Uncensored 再量化），GGUF 格式，Apache-2.0。model card 明寫定位是「local deployment · coding · tool use · reasoning · defensive red teaming · vulnerability research · authorized security testing」，也就是給授權情境下的資安研究與紅隊演練用。
- **能用在哪些場景**:
  1. 做授權滲透測試或紅隊演練的工程師在隔離環境自架助手：本機跑代表目標系統資訊不必送進雲端 API。
  2. 想在單張 16GB 顯卡上跑 27B 的人：Ollama 一行 `ollama run hf.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF` 就能起，model card 的 llama-cli 範例開到 32K context，可以當離線的寫程式、工具呼叫助手。
  3. 研究量化極限的人：這包是「BF16 54.7GB 壓到 15.7GB」的實際案例，model card 附了 perplexity、token agreement、KLD 等指標可以對照壓縮後的劣化程度。
- **跑得動嗎**: 單一量化檔 15.7GB（原始 BF16 為 54.7GB）。model card 表格標示 llama.cpp 峰值 VRAM 為「14.9 GB」（DFlash2 off）與「18.1 GB」（DFlash2 on），吞吐分別為 20.5 tok/s 與 27.6 tok/s；作者註明測試條件是「Single stream, greedy, measured in the official llama.cpp CUDA container」，但頁面上沒有寫測試所用的顯卡型號。
- **本期聲量**: HF 熱度 215（18.1k 次下載、415 個讚）。
- **跟同類比**: 跟一般 llama.cpp 常見的 Q4_K_M 這類人人可複現的量化不同，作者把 SAQ-2 描述為「proprietary sensitivity-aware mixed-precision quantization system」，並明講「Detailed quantization methodology, calibration strategy, precision allocation and packing techniques are not currently disclosed」，壓縮率漂亮但方法不公開。作者自己也掛了警語「This model is uncensored.」，模型衍生自 abliterated checkpoint，且「Guardrails, filtering and policy enforcement are the deployer's responsibility.」，部署前務必確認自己的使用情境屬於授權範圍。
- **怎麼取得**: README 給 llama.cpp 的 `llama-cli -m ./OrcaSAQ-2-27B-Uncensored-GGUF/OrcaSAQ-2-27B-Uncensored.gguf -ngl 99 -c 32768`，或 Ollama 的 `ollama run hf.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF`。
- **連結**: [huggingface.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF](https://huggingface.co/orcarouter/OrcaSAQ-2-Cyber-27B-Uncensored-GGUF)

## 結尾段落
三個選題其實指向同一件事，模型不再只拚參數量，而是拚「怎麼塞進一般人的機器裡」，不管是 740M 的多模態 embedding、12B 的任務型微調，還是 27B 壓到 15.7GB 的量化實驗，省的都是同一塊 VRAM 跟記憶體。如果只能先裝一個來研究，jialinyyzz/humanizer 的量化階梯最完整，8GB 記憶體就能起步。下集再見。

---

## 關於本文與作者

本文出自 [Mark Ku's Blog](https://blog.markkulab.net/local-ai-lab/local-ai-lab-2026-10-07)

授權條款： [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) — 轉載或引用請註明作者並附上原文連結

### 關於作者

**[Mark Ku](https://blog.markkulab.net/author/mark-ku)** — 軟體工程師

- 10 年以上軟體工程師
- 做過北美電商與 AI SaaS 訂閱收費系統

### 作者開發的免費工具

以下工具皆可免費使用：

- [免費 PDF 簽名工具](https://blog.markkulab.net/tools/pdf-sign): 線上 PDF 簽名工具，瀏覽器內完成手繪、打字、上傳簽名，可拖曳放置、縮放、下載。所有處理都在你的裝置完成，檔案不會上傳。
- [VS Code Refactory](https://blog.markkulab.net/tools/refactory): Refactory 是一款 VS Code 重構擴充套件：34 個重構動作、37 條 code smell 檢查、Code Health 儀表板、18 種語言、534 支測試。懂你的專案慣例：介面放哪、DI 註冊寫在哪、'use client' 該不該加；還會用 git 修改頻率 × 複雜度排出「該先修哪個檔案」，並一鍵把壞味道交給你自己電腦上的 Claude Code 修。免費使用，原始碼不離開你的機器。
- [DB-Kit 資料庫管理工具](https://blog.markkulab.net/tools/db-kit): DB-Kit 是一個用 Tauri + Rust + React 打造的輕量跨平台資料庫管理工具，用單一一致的介面同時管理 MySQL、MariaDB、PostgreSQL、SQL Server、Oracle、SQLite、MongoDB、Redis、Kafka、Elasticsearch 與 RabbitMQ 十一種資料來源：連線密碼以 OS keychain 加密、SSH Tunnel、完整 CRUD、視覺化查詢建構器、多結果集同時顯示、跨連線資料傳輸、結構與資料比對（同步 SQL、結構快照）、Excel / CSV 匯入匯出、執行計畫視覺化、ER 圖、排程備份、SQL 壓力測試（p50～p99 延遲百分位）、15 條規則的 SQL 審查、執行前 AI 審查並逐句備份的「審查並執行」（自動產生回滾腳本）、Kafka 訊息瀏覽與監控告警、SSH 終端機與 SFTP / FTP、Docker / Kubernetes、遠端桌面（RDP / VNC / RustDesk）、檔案 / 資料夾比對、預存程序整合測試；六種介面語言，內建 AI 助手（本機 CLI 或 Anthropic / OpenAI 相容 API，自然語言生成 SQL、AI 審查與調校建議）與命令列工具 dbk。免費開源（MIT），提供 Windows / macOS / Linux 安裝檔。
- [VS Code Super Mermaid](https://blog.markkulab.net/tools/super-mermaid): Super Mermaid 是一款 VS Code 擴充套件：開箱即用的漂亮 Mermaid 圖表，自動上色、即時預覽、滑鼠平移縮放、PNG / SVG 高解析匯出，內建 21 種範本與多種主題。免費開源（MIT）。
- [React Super Mermaid](https://blog.markkulab.net/tools/react-super-mermaid): react-super-mermaid 是一個開源 React 元件庫：一行 <MermaidViewer> 即可渲染漂亮的 Mermaid 圖表，內建 colorful / sketch 主題、平移縮放、圖內搜尋、SVG / PNG 高解析匯出。輕量、SSR 安全、完整 TypeScript 型別。免費開源（MIT）。
- [Jira / Confluence Super Mermaid](https://blog.markkulab.net/tools/jira-super-mermaid): Atlassian Forge app：在 Jira issue 與 Confluence 內文直接寫 Mermaid 語法，畫流程圖、時序圖、狀態機與甘特圖。11 種圖表、SVG / PNG 匯出、明暗主題、完整中日韓文字支援。取得 Runs on Atlassian 資格：圖表存在你自己的站台，app 不呼叫任何第三方服務。免費，即將上架 Atlassian Marketplace。
- [Mermaid 線上預覽](https://blog.markkulab.net/tools/mermaid-preview): 在瀏覽器裡寫 Mermaid、即時看圖，整張圖表壓進網址就能分享。免註冊、不上傳伺服器，相容 mermaid.live 的分享連結。
- [React Intl Phone Number](https://blog.markkulab.net/tools/react-intl-phone-number): react-intl-phone-number 是一個開源 React 元件：framework-agnostic、不依賴 antd，提供 E.164 進出、可搜尋國旗 / 國碼下拉、可配置驗證等級（strict / mobile-strict / loose）、可主題化 CSS 與 i18n，電話邏輯由 google-libphonenumber 驅動。輕量、完整 TypeScript 型別。免費開源（MIT）。
- [Uptime Kuma Cluster](https://blog.markkulab.net/tools/uptime-kuma-cluster): 把單機版 Uptime Kuma 改造成高可用叢集：OpenResty + Lua 智慧負載平衡、MariaDB 共享狀態、健康檢查與自動 Failover，附叢集管理 REST API，一行 Docker Compose 啟動。免費開源（MIT）。
- [AI Podcast Cut 音檔剪輯](https://blog.markkulab.net/tools/ai-podcast-cut): 丟進一段錄音，AI 幫你剪掉「嗯、呃、那個」與講到一半重講的片段，平衡逐段音量，並派第二個 agent 覆核每一刀。辨識與去人聲都在你自己的電腦上跑，不上傳、不需要金鑰。剪點會貼齊字邊界與零交越、每一刀都有漸弱漸強，句尾還留得住呼吸感。Windows / macOS / Linux 桌面應用，MIT 開源，Windows 安裝檔內建 ffmpeg。
- [AI Video Cut 影片剪輯](https://blog.markkulab.net/tools/ai-video-cut): 在影片裡選一個東西：打字（人臉、車牌、手機螢幕、logo）、手動點選或拖框，或交給 Claude Code / Codex 挑。AI Video Cut 會逐幀追蹤它，再幫你打馬賽克或模糊、調色、加跟著走的貼紙與文字、把螢幕或海報換成你的圖片或影片，甚至用其他幀拍到的背景把它移除。另有序列剪輯、本機字幕與 AI 助手。免費開源（MIT）的 Windows 桌面應用（macOS / Linux 實驗中），本機運行，影片不上傳。
- [open-pos 開源餐飲 POS](https://blog.markkulab.net/tools/open-pos): 一台電腦加一台出單機就能開店。資料存在自己的硬碟裡、沒有月租、沒有綁約，MIT 全開源。金額用整數元依營業稅法拆算稅額，銷售額加稅額恆等於總額；出單走網路型 ESC/POS（TCP 9100），不必裝廠商驅動。Tauri + Rust + SQLite 桌面應用，v1.0 開發中。
- [.NET 電商 API 架構範本](https://blog.markkulab.net/tools/dotnet-ecommerce-api): 以 .NET 10 打造的電商平台後端 API 架構範本：Controller → Service → Repository 分層、Autofac 依命名慣例自動註冊、SqlSugar 支援 MySQL / MariaDB 與 SQL Server、Redis 快取與訊息佇列、Hangfire 排程、JWT 認證，內建可擴充的金流 Provider 模組（綠界 ECPay、藍新 Newebpay）。Apache 2.0 開源。

### 每日 Podcast

- [Mark's Tech Insights 每日 AI 新鮮事](https://blog.markkulab.net/category/tech-news): 每日精選 AI 與科技趨勢，透過語音摘要快速掌握最新技術動態，涵蓋 AI 應用、軟體架構、DevOps 與工程實戰。 — RSS: https://blog.markkulab.net/feed.xml
- [AI股市蝦聊](https://blog.markkulab.net/category/ai-stock-chat): 每個交易日用 AI 分析台股盤勢，以雙人對話聊當天的盤中觀察與隔日預測。 — RSS: https://blog.markkulab.net/ai-stock-chat/feed.xml
- [開源好物週報](https://blog.markkulab.net/category/open-source-weekly): 每週從 Hacker News、GitHub、Reddit 聲量雷達精選免費開源工具，以雙人對話聊解決什麼痛點與怎麼快速上手。 — RSS: https://blog.markkulab.net/open-source-weekly/feed.xml
- [AI 運動週報](https://blog.markkulab.net/category/sports-weekly): 每週一、三、六以雙人對話聊 NBA、MLB 與國際體壇大事，台灣球迷視角，輕鬆有梗不酸人。 — RSS: https://blog.markkulab.net/sports-weekly/feed.xml
- [AI 國際新聞快報](https://blog.markkulab.net/category/world-news): 每天早上以雙人對話把過去一天的國際大事講白：政治外交、全球經濟、衝突與安全、災害與氣候，台灣視角、中立客觀、每則附出處。 — RSS: https://blog.markkulab.net/world-news/feed.xml
- [地端 AI 實驗室](https://blog.markkulab.net/category/local-ai-lab): 每週三、五精選可以下載到自己機器上跑的開源模型與 LoRA，用雙人對話講清楚能用在哪些場景、你的顯卡跑不跑得動、跟同類差在哪，規格一律引述官方 model card。 — RSS: https://blog.markkulab.net/local-ai-lab/feed.xml

### 站長優惠

- [Saily eSIM](https://blog.markkulab.net/saily): 出國旅遊上網 eSIM・NordVPN 團隊出品，優惠碼：KUKU
- [NordVPN](https://blog.markkulab.net/nordvpn): 全球最多人用的 VPN・獨立稽核無日誌
- [PremLogin](https://blog.markkulab.net/premlogin): 訂閱合租平台・串流與 AI 訂閱席位分攤，優惠碼：markku666

### 電子報

[訂閱電子報](https://blog.markkulab.net/subscribe) — 第一時間收到新文章通知，無垃圾信、隨時可取消訂閱。
