開場白
Mini-AGI 這週在 Hacker News 拿下 276 分,一個人用 8GB VRAM 筆電就訓出會持續學習又不遺忘的語言模型。同場加映 30 天衝上 19k 星、單題 33 毫秒不生成文字的 laya,還有讓 coding agent 開自動駕駛也安心的 Drop。Drop 到底怎麼在作業系統層把權限鎖死,等一下告訴你。
本週開源好物
1. laya:不產生文字的本機判斷模型,一題 33 毫秒
- 它是什麼: laya 是一個跑在本機的小模型,做的不是聊天而是幫你的程式做判斷,像分類、打分、是非題,用單次 forward pass 直接吐出結構化答案,不用像 LLM 那樣生成一堆文字再自己解析。給想在 pipeline 裡塞路由、分類、守門邏輯,又不想連雲端 API 的工程師用。
- 本週聲量: GitHub 19.0k ★,是 30 天內衝出來的新專案,授權 Apache-2.0。
- 亮點功能: 三種 typed decision(choice 分類附信心值、score 1-5 等級、yes/no 校準過的機率);Tesla T4 上單題 32.8-39.5ms,批次跑平均 7.2ms/題;英文版 421M、多語版 322M 支援 100+ 語言,51 種測試語言裡有 45 種達可用水準。
- 快速上手:
pip install laya,用Router(preload=True)自動選 checkpoint,把 state 跟 questions 丟進router.predict()就出答案;Mac 使用者可以改裝姊妹專案 laya-mlx,跑 Apple Silicon 原生 MLX runtime,不需要 PyTorch。 - 跟同類比: 對手是 TypeSafe 的 Jev 付費 API,laya 微調後準確度 0.766 打贏 Jev 的 0.727,延遲 32.8ms 也甩開 Jev 的 236-276ms,但 Jev 主打 zero-shot 免微調,laya 的 base checkpoint 只有 0.362(比隨機基準 0.318 高一點點),得自己準備資料微調才好用,這也是 HN 討論串裡被質疑最多的地方。
- 適合誰: 想在本機做分類、路由、守門,又不想被雲端 API 綁架的後端工程師。
- 連結: https://github.com/NandhaKishorM/laya
2. Drop:讓 coding agent 開自動駕駛也不心虛
- 它是什麼: Drop 是一個沙箱工具,專門解決叫 coding agent 開
--dangerously-skip-permissions自動跑任務會心虛的問題,把權限管控從 agent 自律改成作業系統層強制擋,rootless,不用改你現有的任何工具。 - 本週聲量: Hacker News 175 分,59 則討論,授權 Apache-2.0。
- 亮點功能: 用 Linux namespaces(user、mount、PID、IPC、cgroup、network)隔離,啟動前丟光所有 capabilities,全程 rootless;可選再疊 gVisor 讓程式碰不到 host kernel;當前工作目錄預設可讀寫但
.git唯讀,網路走 pasta 且預設拒連 localhost 上的服務;不用像 Docker/Podman 先做 image,直接沿用你現有的發行版,已經裝好的程式在沙箱裡都還在。 - 快速上手:
sudo apt-get install passt(Fedora 用 dnf、Arch 用 pacman),下載drop執行檔裝進~/.local/bin,進專案目錄跑drop init再drop run就進沙箱了。 - 跟同類比: README 自己拿 Docker/Podman 當對照組,容器要先備 image,Drop 直接借用本機發行版省掉整套 container setup,隔離強度可再用 gVisor 補強;跟「請 agent 自我克制」的權限提示比,差別是這是 OS 層強制,被關的程式完全不用知道 Drop 存在。
- 適合誰: 天天開 agent 自動跑任務、又怕它亂改系統的工程師。
- 連結: https://droprun.sh/
3. Mini-AGI:8GB 筆電上訓一個不會忘記的模型
- 它是什麼: Mini-AGI 是一個人做的 byte-level 持續學習語言模型專案,重點不是重現 Transformer 教材,而是驗證模型可以一直讀新東西又不會忘記舊的,還把 MoE 專家當成硬碟上的普通檔案分頁進 VRAM,才塞得進一張 8GB VRAM 的 RTX 3070 筆電顯卡。
- 本週聲量: Hacker News 276 分,75 則討論;GitHub 665 顆星,授權 MIT。
- 亮點功能: 字彙表只有 256 個 byte 值加 9 個結構標記,不用設定 tokenizer,檔案本身就是訓練資料;halting 機制逐字元評分,簡單的字元提早離場省算力;約 170 個 experts 平常躺硬碟,VRAM 只常駐 32 個,中間夾一層 RAM cache 依需求預測搬運;最反直覺的發現是把共用 trunk(embedding、attention、router、halting head)的學習率設成 experts 的 0.1 倍,遺忘量從 +2.23 nats 降到 +0.0067 nats,保住 99.84% 的進度。
- 快速上手:
git clone後pip install torch numpy pyyaml matplotlib flask,用python3 -m corpora all --limit 5000拉測試語料,python3 train.py read data/train --save --weights-dir weights開訓,python3 serve.py --port 8080開網頁互動介面,門檻是 8GB VRAM GPU 加 Python 3.10+。 - 跟同類比: 跟 nanoGPT 那類在家重現 GPT 的教材專案不同,Mini-AGI 的重點是持續學習不遺忘加 MoE 硬碟分頁,所以它沒有固定 checkpoint 給你下載,是設計成讓你自己一直餵新資料進去讀。
- 適合誰: 想在自家顯卡上玩持續學習、對 MoE 記憶體工程有興趣的工程師。
- 連結: https://github.com/volotat/mini-AGI/
結尾段落
這週三個題目其實都在講同一件事:怎麼把運算留在自己手上的機器裡,不管是 laya 的毫秒級判斷、Drop 的作業系統層隔離,還是 Mini-AGI 的硬碟分頁 MoE。如果只能挑一個馬上動手玩,我會選 Drop,裝起來最快,也最貼近大家現在天天開 agent 跑任務的痛點。下週開源好物週報再見。




























留言