開場白
本週開源社群最受矚目的焦點,是 Firecrawl 團隊推出的 anydoc,它能在毫秒級內將 14 種格式完美轉為 Markdown。除了這款多格式統一解析器,我們還會拆解能在本機搭建 Agent 生態系的 deepseek-harness,以及用純 C 語言在有限記憶體跑完兆級參數模型的極限優化實踐,等一下告訴你。
本週開源好物
1. anydoc:14種格式統一輸出的超高速 Markdown 解析器
- 它是什麼: 解決在開發 RAG(檢索增強生成)、知識庫或文件匯入系統時,被 Word、PPT、PDF 轉 Markdown 折磨的痛點。它將 14 種格式(包含 .docx、.pptx、.xlsx、.odt、.rtf、.epub、.csv、.pdf 等)先解析成同一套統一的文件模型(document model),再由同一個 Markdown 序列化器輸出,確保跨格式的表格、合併儲存格在轉換後維持高度一致。
- 本週聲量: GitHub 17.9k ★(30 天內新專案,實際累積 17,894 顆星),授權為 MIT,主要開發語言為 Rust。
- 亮點功能:
- 極致的處理效能:官方在 Apple M3 Max、16GB RAM 的硬體環境下,使用 100 份真實文件進行基準測試(Benchmark 數據詳見 GitHub 測試說明)。anydoc 的中位數處理時間僅 4.4ms、品質得分 81 分。相比之下,Markitdown 耗時 134.8ms/52分、Pandoc 102.1ms/38分、Docling 513.6ms/51分、Unstructured 572.9ms/63分。anydoc 在速度上快了 20 到 250 倍,且是唯一 14 種格式全數通過測試的工具。
- 多端整合與輕量相依:Rust 核心提供 CLI(npx)、Node(
@firecrawl/anydoc)、Python(firecrawl-anydoc)三種整合方式,甚至提供 WebAssembly 版本(@firecrawl/anydoc-wasm)可直接在瀏覽器前端執行。相較於傳統使用 LibreOffice headless 轉檔,它省去了安裝整包 Office 軟體相依性的麻煩。
- 快速上手:
不用安裝,在終端機輸入一行指令直接試用:
若要導入開發管線,在 Node 專案中安裝後呼叫:npx @firecrawl/anydoc report.docx -o report.mdimport { toMarkdown } from '@firecrawl/anydoc'; const markdown = await toMarkdown('report.docx'); - 跟同類比: 與 Markitdown、Pandoc、Docling、Unstructured 相比,那幾套工具要嘛格式覆蓋率不足(如 Pandoc 僅支援 5/14、Docling 4/14),要嘛速度慢上數十至數百倍。anydoc 同時贏在「格式覆蓋率」與「解析速度」,且無須打包龐大的 Office 運作環境。
- 誠實雷點: 必須注意它的限制,它目前只能處理「文字型 PDF」,如果是掃描檔或需要 OCR(光學字元識別)的圖片,anydoc 無法直接處理,必須另外對接 Firecrawl Parse 等外部服務。
- 適合誰: 適合正在開發 RAG 系統、本地知識庫,需要大量且高效率做文件預處理的後端與 AI 工程師。
- 連結: firecrawl/anydoc
2. deepseek-harness:基於外掛架構的本機優先 Agent 骨架工廠
- 它是什麼: 專為想自組 AI Agent 的工程師設計的開發骨架。它不是開箱即用的 coding 助理,而是一個「Agent 工廠」,讓你可以把模型、工具、工作流當成積木,隨插隨用組裝出想要的 Agent。
- 本週聲量: GitHub 1.8k ★(註:此為本專案發佈初期之獨立星數。整個 DeepSeek 官方主倉庫與生態系在 30 天內狂捲超過 18 萬顆星,本專案為其生態系新成員,並已衍生出桌面端 18.2k★、外掛精選 11.5k★、路由套件 6.6k★ 等多個衛星專案),授權為 MIT,主要語言為 TypeScript。
- 亮點功能:
- 萬物皆外掛的 Cordis 架構:底層架構建構在 Cordis 之上。不論是模型適配器(model adapter)、工具註冊表(tool registry)、對話日誌(session log),甚至連核心的 agent loop 本身都是外掛,全部可以透過設定檔動態抽換。
- 本機優先與原生桌面支援:執行
npx @deepseek-ai/dsh web即可在本機啟動 Web UI(預設為<http://127.0.0.1:3080>),完全 local-first,免去申請雲端服務的繁瑣步驟。此外,官方推出 DSH Desktop,將 Web UI、主機服務與外掛系統打包成 Windows (NSIS) 與 macOS (DMG) 原生安裝檔,內建外掛市集與系統列常駐,同樣採 MIT 授權且完全免費。
- 快速上手:
想快速體驗 Web UI,可直接在終端機輸入:
並在瀏覽器打開npx @deepseek-ai/dsh web127.0.0.1:3080。不習慣終端機的使用者,可以直接到 GitHub 下載 DSH Desktop 安裝檔,開箱即用。 - 跟同類比: 與 Claude Code 或 Codex 這類「拿來就能直接寫程式」的成品 Agent 不同,deepseek-harness 賣的是底層骨架。前者是給你一把調整好的工具,後者則是提供可更換槍管的槍身。
- 誠實雷點: 官方在 README 中用大寫警告:「THERE WILL BE COMPATIBILITY-BREAKING CHANGES」。目前定位是開發者預覽版(Developer Preview),不建議直接當作正式環境的控制面,API 與設定格式隨時可能調整。
- 適合誰: 適合想深入自訂 Agent 工作流、串接自研工具,並偏好本機部署的 AI 應用開發者。
- 連結: deepseek-ai/deepseek-harness
3. kimi-k3-in-c:純 C 語言實現的極限記憶體優化 MoE 模型推論實踐
- 它是什麼: 解決了在消費級硬體上跑不起兆級參數模型的痛點。它是一個純 C99 寫成、不依賴 GPU 也不需要任何框架的專案,硬是把一個 2.78 兆參數的模型塞進 8.24GB 的記憶體內執行,並在文件中把每一步的數學與記憶體算給你聽。
- 本週聲量: GitHub 6.3k ★(30 天內新專案,實際累積 6,267 顆星),授權為 Apache-2.0,主要語言為 C。
- 亮點功能:
- 極致的 MoE 稀疏性與硬碟串流:核心手法是將混合專家模型(MoE)的稀疏性發揮到極致。每個 token 在每層只會啟用 896 個專家中的 16 個(僅 3.7%),剩下的 96.3% 參數完全不載入記憶體,而是保留在硬碟中,透過 LRU 快取即時串流進來。routed experts 經量化後每參數僅佔 0.53 bytes,而 dense 層打包成單一 109GB 的 trunk 檔案,在已知偏移量下使用滑動視窗(sliding window)進行 seek 讀取。
- 硬碟 I/O 的極高要求:由於高達 96.3% 的參數依賴硬碟即時串流,硬碟讀寫速度是絕對瓶頸。強烈建議使用讀取速度至少達 5000 MB/s 的 PCIe Gen4 NVMe SSD,否則載入延遲會極為嚴重,大幅拖慢推論速度。
- 快速上手:
不需下載 1.56TB 的完整權重即可測試編譯與基礎運行:
測試套件自帶測試資料,兩分鐘內即可跑起來。若要進行實際的文字生成,才需要執行專案內的git clone https://github.com/FareedKhan-dev/kimi-k3-in-c cd kimi-k3-in-c make -j make testdownload-model.sh與pack-trunk.sh。 - 跟同類比: 雖然 llama.cpp 同樣做 CPU 推論,但前提是模型(即使量化後)大致上能放得進記憶體或透過 mmap 載入。本專案反其道而行,讓參數量遠超記憶體數百倍的模型也能運作,將瓶頸從記憶體容量轉移至硬碟讀寫速度。
- 誠實雷點: 實用性極低,純屬技術展示與教科書。作者誠實公佈了推論速度:8GB 記憶體筆電需 26.5 秒/token、64GB 桌機需 19.8 秒、128GB 以上工作站需 5.6 秒。此外,執行需要 1.56TB 的 checkpoint 加上 109GB trunk,總計約 1.7TB 的硬碟空間,且目前完全不支援 macOS、Windows 或 WSL。
- 適合誰: 適合想深入研究 MoE 底層推論工程、記憶體優化極限,以及想了解大模型如何與硬體 I/O 互動的資深系統工程師。
- 連結: fareedkhan-dev/kimi-k3-in-c
結尾段落
我是沐妍,本週我們看見了開源界在文件解析速度、Agent 模組化架構以及極端硬體推論上的突破。如果只能挑一個本週立刻在專案中落地的工具,我個人強烈推薦 anydoc,它能幫你的 RAG 流程省下大把的預處理時間。我們下週的開源好物週報再見囉!




























留言