Mark Ku's Blog
Podcast 對話本文 AI 對話朗讀版

開場白

本週開源社群最受矚目的焦點,是 Firecrawl 團隊推出的 anydoc,它能在毫秒級內將 14 種格式完美轉為 Markdown。除了這款多格式統一解析器,我們還會拆解能在本機搭建 Agent 生態系的 deepseek-harness,以及用純 C 語言在有限記憶體跑完兆級參數模型的極限優化實踐,等一下告訴你。


本週開源好物

1. anydoc:14種格式統一輸出的超高速 Markdown 解析器

  • 它是什麼: 解決在開發 RAG(檢索增強生成)、知識庫或文件匯入系統時,被 Word、PPT、PDF 轉 Markdown 折磨的痛點。它將 14 種格式(包含 .docx、.pptx、.xlsx、.odt、.rtf、.epub、.csv、.pdf 等)先解析成同一套統一的文件模型(document model),再由同一個 Markdown 序列化器輸出,確保跨格式的表格、合併儲存格在轉換後維持高度一致。
  • 本週聲量: GitHub 17.9k ★(30 天內新專案,實際累積 17,894 顆星),授權為 MIT,主要開發語言為 Rust。
  • 亮點功能:
    • 極致的處理效能:官方在 Apple M3 Max、16GB RAM 的硬體環境下,使用 100 份真實文件進行基準測試(Benchmark 數據詳見 GitHub 測試說明)。anydoc 的中位數處理時間僅 4.4ms、品質得分 81 分。相比之下,Markitdown 耗時 134.8ms/52分、Pandoc 102.1ms/38分、Docling 513.6ms/51分、Unstructured 572.9ms/63分。anydoc 在速度上快了 20 到 250 倍,且是唯一 14 種格式全數通過測試的工具。
    • 多端整合與輕量相依:Rust 核心提供 CLI(npx)、Node(@firecrawl/anydoc)、Python(firecrawl-anydoc)三種整合方式,甚至提供 WebAssembly 版本(@firecrawl/anydoc-wasm)可直接在瀏覽器前端執行。相較於傳統使用 LibreOffice headless 轉檔,它省去了安裝整包 Office 軟體相依性的麻煩。
  • 快速上手: 不用安裝,在終端機輸入一行指令直接試用:
    npx @firecrawl/anydoc report.docx -o report.md
    
    若要導入開發管線,在 Node 專案中安裝後呼叫:
    import { toMarkdown } from '@firecrawl/anydoc';
    const markdown = await toMarkdown('report.docx');
    
  • 跟同類比: 與 Markitdown、Pandoc、Docling、Unstructured 相比,那幾套工具要嘛格式覆蓋率不足(如 Pandoc 僅支援 5/14、Docling 4/14),要嘛速度慢上數十至數百倍。anydoc 同時贏在「格式覆蓋率」與「解析速度」,且無須打包龐大的 Office 運作環境。
  • 誠實雷點: 必須注意它的限制,它目前只能處理「文字型 PDF」,如果是掃描檔或需要 OCR(光學字元識別)的圖片,anydoc 無法直接處理,必須另外對接 Firecrawl Parse 等外部服務。
  • 適合誰: 適合正在開發 RAG 系統、本地知識庫,需要大量且高效率做文件預處理的後端與 AI 工程師。
  • 連結: firecrawl/anydoc

2. deepseek-harness:基於外掛架構的本機優先 Agent 骨架工廠

  • 它是什麼: 專為想自組 AI Agent 的工程師設計的開發骨架。它不是開箱即用的 coding 助理,而是一個「Agent 工廠」,讓你可以把模型、工具、工作流當成積木,隨插隨用組裝出想要的 Agent。
  • 本週聲量: GitHub 1.8k ★(註:此為本專案發佈初期之獨立星數。整個 DeepSeek 官方主倉庫與生態系在 30 天內狂捲超過 18 萬顆星,本專案為其生態系新成員,並已衍生出桌面端 18.2k★、外掛精選 11.5k★、路由套件 6.6k★ 等多個衛星專案),授權為 MIT,主要語言為 TypeScript。
  • 亮點功能:
    • 萬物皆外掛的 Cordis 架構:底層架構建構在 Cordis 之上。不論是模型適配器(model adapter)、工具註冊表(tool registry)、對話日誌(session log),甚至連核心的 agent loop 本身都是外掛,全部可以透過設定檔動態抽換。
    • 本機優先與原生桌面支援:執行 npx @deepseek-ai/dsh web 即可在本機啟動 Web UI(預設為 <http://127.0.0.1:3080>),完全 local-first,免去申請雲端服務的繁瑣步驟。此外,官方推出 DSH Desktop,將 Web UI、主機服務與外掛系統打包成 Windows (NSIS) 與 macOS (DMG) 原生安裝檔,內建外掛市集與系統列常駐,同樣採 MIT 授權且完全免費。
  • 快速上手: 想快速體驗 Web UI,可直接在終端機輸入:
    npx @deepseek-ai/dsh web
    
    並在瀏覽器打開 127.0.0.1:3080。不習慣終端機的使用者,可以直接到 GitHub 下載 DSH Desktop 安裝檔,開箱即用。
  • 跟同類比: 與 Claude Code 或 Codex 這類「拿來就能直接寫程式」的成品 Agent 不同,deepseek-harness 賣的是底層骨架。前者是給你一把調整好的工具,後者則是提供可更換槍管的槍身。
  • 誠實雷點: 官方在 README 中用大寫警告:「THERE WILL BE COMPATIBILITY-BREAKING CHANGES」。目前定位是開發者預覽版(Developer Preview),不建議直接當作正式環境的控制面,API 與設定格式隨時可能調整。
  • 適合誰: 適合想深入自訂 Agent 工作流、串接自研工具,並偏好本機部署的 AI 應用開發者。
  • 連結: deepseek-ai/deepseek-harness

3. kimi-k3-in-c:純 C 語言實現的極限記憶體優化 MoE 模型推論實踐

  • 它是什麼: 解決了在消費級硬體上跑不起兆級參數模型的痛點。它是一個純 C99 寫成、不依賴 GPU 也不需要任何框架的專案,硬是把一個 2.78 兆參數的模型塞進 8.24GB 的記憶體內執行,並在文件中把每一步的數學與記憶體算給你聽。
  • 本週聲量: GitHub 6.3k ★(30 天內新專案,實際累積 6,267 顆星),授權為 Apache-2.0,主要語言為 C。
  • 亮點功能:
    • 極致的 MoE 稀疏性與硬碟串流:核心手法是將混合專家模型(MoE)的稀疏性發揮到極致。每個 token 在每層只會啟用 896 個專家中的 16 個(僅 3.7%),剩下的 96.3% 參數完全不載入記憶體,而是保留在硬碟中,透過 LRU 快取即時串流進來。routed experts 經量化後每參數僅佔 0.53 bytes,而 dense 層打包成單一 109GB 的 trunk 檔案,在已知偏移量下使用滑動視窗(sliding window)進行 seek 讀取。
    • 硬碟 I/O 的極高要求:由於高達 96.3% 的參數依賴硬碟即時串流,硬碟讀寫速度是絕對瓶頸。強烈建議使用讀取速度至少達 5000 MB/s 的 PCIe Gen4 NVMe SSD,否則載入延遲會極為嚴重,大幅拖慢推論速度。
  • 快速上手: 不需下載 1.56TB 的完整權重即可測試編譯與基礎運行:
    git clone https://github.com/FareedKhan-dev/kimi-k3-in-c
    cd kimi-k3-in-c
    make -j
    make test
    
    測試套件自帶測試資料,兩分鐘內即可跑起來。若要進行實際的文字生成,才需要執行專案內的 download-model.shpack-trunk.sh
  • 跟同類比: 雖然 llama.cpp 同樣做 CPU 推論,但前提是模型(即使量化後)大致上能放得進記憶體或透過 mmap 載入。本專案反其道而行,讓參數量遠超記憶體數百倍的模型也能運作,將瓶頸從記憶體容量轉移至硬碟讀寫速度。
  • 誠實雷點: 實用性極低,純屬技術展示與教科書。作者誠實公佈了推論速度:8GB 記憶體筆電需 26.5 秒/token、64GB 桌機需 19.8 秒、128GB 以上工作站需 5.6 秒。此外,執行需要 1.56TB 的 checkpoint 加上 109GB trunk,總計約 1.7TB 的硬碟空間,且目前完全不支援 macOS、Windows 或 WSL。
  • 適合誰: 適合想深入研究 MoE 底層推論工程、記憶體優化極限,以及想了解大模型如何與硬體 I/O 互動的資深系統工程師。
  • 連結: fareedkhan-dev/kimi-k3-in-c

結尾段落

我是沐妍,本週我們看見了開源界在文件解析速度、Agent 模組化架構以及極端硬體推論上的突破。如果只能挑一個本週立刻在專案中落地的工具,我個人強烈推薦 anydoc,它能幫你的 RAG 流程省下大把的預處理時間。我們下週的開源好物週報再見囉!

作者

Mark Ku

擁有 10+ 年經驗的資深軟體工程師,現為 AI 應用 Builder,專注於大型平台架構與簡化複雜系統設計,從電商系統到訂閱與收費平台,結合 AI Agent、AI 整合與自動化開發,打造高效率且可持續演進的產品技術基礎。閱讀更多

覺得這篇有幫助?

作者做的免費工具、每日 Podcast 與電子報,都在這裡。

Mark Ku · 本文採用 CC BY 4.0 授權,轉載請註明作者並附上原文連結。

留言

訂閱電子報

訂閱後即時收到新文章通知,不錯過任何技術分享。

提交即表示同意接收電子報,隨時可

熱門文章

View all
Mark Ku
··618

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案

Oracle Cloud 永久免費方案 Linux 主機及固定 IP :0 元打造雲端解決方案
Mark Ku
··487

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南

告別 Postman 收費陷阱!開源 Git 原生 API 測試神器 Bruno 實戰指南
Mark Ku
··337

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略

一款免費開源類似於 Notion 類知識庫系統 — Outline Wiki 佈署與備份全攻略
Mark Ku
··260

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調

訓練自己的 AI 語音:硬體門檻、開源模型比較與 LoRA 微調
Mark Ku
··235

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1

打造高效 API 管理平台:從 0 開始部署 Kong Gateway - Part 1
Mark Ku
··212

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取

在 Ubuntu 上設置 Samba 來共享資料夾,讓 Windows 11 用戶可以存取
14種格式秒轉Markdown!anydoc 憑什麼比同類快百倍|開源好物週報 - Mark Ku's Blog