跳至主要內容
Mark Ku's Blog
v0.0.7 早期開發版 · 免費使用

AI Video Cut

AI 影片剪輯桌面工具。在畫面裡選一個東西(打字、手動點選,或交給 AI 挑),它會逐幀一路追著它,接著幫你打碼、換掉、加特效或整個移除。所有運算都在你自己的 GPU 上,影片不上傳,也不會被拿去訓練模型。另附功能相同的 aivc 命令列與內建 MCP server,讓 agent 直接幫你操作。

★ 完全免費 · 本機運行▢ Windows 11 正式支援 · macOS / Linux 實驗中 · 簽章自動更新
AI Video Cut · 主編輯畫面
主編輯畫面:中間是預覽與選到的物件疊色,下方是時間軸與追蹤區段,右側是物件與特效面板
NordVPN
贊助

公共 Wi-Fi、出國連線,交給 NordVPN

一鍵加密全部流量,137 國節點隨你切換。1 帳號 10 台裝置,30 天退款保證。

含聯盟推廣連結

三步:選一個東西、追著它、處理它

每一步都看得到它選了什麼、追到哪裡、改了哪些像素。

🔤

打字找物件

輸入「人臉、車牌、手機螢幕、logo」,列出每個實例的縮圖、分數與出現的幀段,勾選要的幾個就好。有 SAM 3 存取權時用 SAM 3,沒有就自動改用開放授權的 OWLv2 + SAM 2.1,畫面上會告訴你用的是哪一個。

🖱

手動點選

左鍵加點、Alt + 左鍵減點、拖一個框,畫面即時顯示選到的範圍。中途追歪了,到那一幀補一個修正點,只會從那一幀往後重算,前面已經對的部分不動。

🤖

交給 AI 挑

很難用一個詞描述的目標(「左邊那個人手上的杯子」)交給 Claude Code 或 Codex。它透過內建的 MCP server 看幀畫面、給出框或點、檢查疊色結果,不對就自己修正。

🎯

逐幀追蹤

每個物件是一條 ObjectTrack:逐幀遮罩、外接框、重心、方向角與可見區段。特效、替換、AI 助手讀的都是同一份追蹤資料,不會各自重追一次。

🫥

隱私打碼

一鍵找出人臉(可加車牌)、套上馬賽克、跟著動。格子大小依物件大小自動決定,也可以改用模糊,邊緣不會有光暈。

🖼

平面替換

把螢幕、海報、招牌換成你的圖片或影片。每一幀都直接對模板對位,不逐幀接力,誤差不會一路累積;合成時會配合原畫面的光影、動態模糊與手部遮擋。

它還能做的事

追蹤只是積木,移除、重構圖、剪輯、字幕與 AI 助手都接在同一份資料上。

🧽

移除物件

用這支影片其他幀真正拍到的背景補回去,所以逐幀之間完全一致,沒有生成式補繪的閃爍。鏡頭在移動、背景從頭到尾沒露出過的素材會直接擋下並說明原因。

📐

自動重構圖

把橫幅轉成 9:16、4:5 或 1:1,輸入一句「鏡頭跟著 person」,裁切框就會跟著主體走。

✨

疊一串特效

馬賽克、模糊、調色(色相、飽和度、亮度、換色,在線性光空間計算)、描邊、光暈,以及只跟位置、或連縮放旋轉都跟著走的貼紙與文字,順序可調。

📤

追蹤資料匯出

ObjectTrack 可以單獨匯出成 JSON、CSV、PNG 遮罩序列,或 Nuke 角釘、After Effects 關鍵幀,帶到其他合成軟體或你自己的程式。

✂️

序列剪輯

分割、波紋刪除、三點剪輯、滑移與滑內容、J / L cut、移除靜音(套用前先算給你看會剪掉多少)、音量正規化,快捷鍵對照 Premiere / Resolve。剪輯不會讓追蹤或遮罩失效。

💬

本機字幕

用 faster-whisper 在本機辨識,詞級時間碼、六種動態字幕樣式,可匯出 SRT / VTT / ASS 或直接燒進影片。在字幕面板刪掉一句,畫面也跟著剪掉。

🧠

AI 章節、精華與助手

可接本機的 OpenAI 相容服務(LM Studio、Ollama、llama.cpp)、Claude API、Claude Code CLI 或 Codex CLI。一句話(「幫臉打碼」「轉成直幅」)會變成一份計畫,你按了才執行。

🔄

簽章自動更新

啟動後在背景檢查新版本,下載的更新必須通過簽章驗證才會安裝。有工作在跑或專案還沒存時,不會自己關掉重開。

實際畫面

主編輯畫面,加上四個核心功能:找物件、物件與特效、隱私打碼、平面替換。

主編輯畫面:中間是預覽與選到的物件疊色,下方是時間軸與追蹤區段,右側是物件與特效面板
主編輯畫面:中間是預覽與選到的物件疊色,下方是時間軸與追蹤區段,右側是物件與特效面板
打字找物件:輸入「人臉、車牌、手機螢幕」,每個實例列出縮圖、分數與出現的幀段,勾選要追的幾個
打字找物件:輸入「人臉、車牌、手機螢幕」,每個實例列出縮圖、分數與出現的幀段,勾選要追的幾個
物件面板:每個物件一條追蹤,右側疊一串可調順序的特效
物件面板:每個物件一條追蹤,右側疊一串可調順序的特效
隱私打碼:自動找到人臉與車牌並套上馬賽克,前後對照
隱私打碼:自動找到人臉與車牌並套上馬賽克,前後對照
平面替換:把畫面裡的螢幕換成你的圖片或影片,配合原本的光影與遮擋
平面替換:把畫面裡的螢幕換成你的圖片或影片,配合原本的光影與遮擋

開始之前要知道的三件事

說在前面,免得你下載完才發現。

  1. 1

    需要一張 NVIDIA 顯示卡

    Windows 11 x64 搭配 NVIDIA GPU,建議 VRAM 12 GB 以上、驅動 R580 以上(CUDA 13)。沒有 GPU 時不會偷偷改用 CPU(CPU 大約只有 0.2 fps),而是直接告訴你跑不動。macOS 14 以上的 Apple Silicon 與 Linux x86_64 可以裝,但還在實驗階段。

  2. 2

    第一次執行要下載約 6 到 7 GB

    第一次開啟會引導你安裝引擎:下載 uv、建立 Python 3.12 環境、安裝 PyTorch 與相依套件、做環境檢查,再加上模型權重。安裝前會先確認有 15 GB 以上的可用空間,資料目錄可以在設定裡搬到其他磁碟。

  3. 3

    之後可以完全離線

    網路只在安裝引擎、下載模型與檢查更新時需要。影片不上傳、不拿去訓練、不送遙測,重新輸出不限次數。

全部在地端:影片不離開你的電腦

選取、追蹤、特效、替換、移除與字幕都在你自己的 GPU 上跑,不需要任何雲端服務或金鑰。

🔒

影片留在你的硬碟上

不上傳任何影格,也不會拿你的影片去訓練模型。專案檔與追蹤資料都存在本機。

🎯

只改該改的像素

特效與替換只動作用範圍內的像素,其他像素的 yuv420p 位元組原樣寫回。打開差異檢視,作用範圍以外必須是純黑。

🧱

追一次,到處用

同一份 ObjectTrack 給特效、替換、AI 助手與外掛共用。換一個特效不必重新追蹤,剪輯也不會讓追蹤失效。

🔌

agent 也能直接操作

內建 MCP server 只綁 127.0.0.1,每次啟動換一組隨機 token。設定頁有一行指令可以複製,讓你自己的 Claude Code / Codex session 也連進來操作。

用到的模型

模型只在第一次用到時下載,App 的「關於」對話框也列出同一份清單。

SAM 2.1 hiera-small~184 MB · Apache-2.0點/框選取,以及把遮罩沿整個鏡頭前後傳播。預設一定會裝。
OWLv2~600 MB · Apache-2.0開放詞彙的文字找物件,是沒有 SAM 3 存取權時的後備方案,找到的框再交給 SAM 2.1 產生遮罩。
SAM 3(選用)~3.4 GB · SAM License文字直接找出物件並逐幀追蹤,中途才出現的物件也找得到。權重要先在 Hugging Face 申請存取,通過後在設定裡填 HF token。
faster-whisper(選用)~0.5 到 3 GB · MIT字幕用的語音辨識,詞級時間碼。只有要做字幕時才需要,模型從 small 到 large-v3 可以挑。

申請不到 SAM 3 也沒關係:打字找物件會自動改用 OWLv2 + SAM 2.1,畫面上會標示目前用的是哪一個後端。所有模型權重都不隨安裝檔附帶,依各自的授權在第一次用到時下載。

什麼留在這台機器、什麼會離開

留在這台機器

  • 影片解碼、代理檔與輸出編碼(FFmpeg)
  • 物件選取、遮罩傳播與逐幀追蹤(SAM 2.1 / OWLv2 / SAM 3)
  • 特效、平面替換、物件移除與自動重構圖
  • 字幕語音辨識(faster-whisper)
  • 專案檔與 ObjectTrack 追蹤資料

唯一會離開這台機器的

  • AI 助手、章節與精華接 Claude API、Claude Code 或 Codex 時,送出的是你的指令與字幕文字;讓 AI 挑物件時,它也會看你要它看的那幾幀畫面。接本機的 LM Studio / Ollama 時什麼都不出你的電腦
  • 第一次安裝引擎、下載模型與檢查更新時的下載流量

不用雲端 AI 的話,除了安裝與更新之外,整條流程完全不連外。桌面版與 aivc 命令列走同一套引擎與模型,同一支影片在兩邊得到同一份追蹤。

技術棧

介面與殼層在 Tauri / React / Rust,影像的重活在 Python 引擎。

桌面殼層Tauri 2 + Rust
前端React 18 + TypeScript + zustand
影像引擎Python 3.12(PyTorch、OpenCV、Transformers)
分割與偵測SAM 2.1 / OWLv2 / SAM 3(選用)
解碼與編碼FFmpeg(Windows 內建 LGPL 版)
AI本機 LLM / Claude API / Claude Code CLI / Codex CLI + faster-whisper(本機)

下載與安裝

完全免費。目前是早期開發版(0.0.x),Windows 是開發與實測平台;macOS 與 Linux 版會在 CI 上建置並跑測試,但還沒在實機上把整條流程走完。

Windows 11(x64)

x64-setup.exe

安裝到目前使用者底下,不需要系統管理員權限,內建 LGPL 版 FFmpeg。需要 NVIDIA GPU 與 R580 以上的驅動。

macOS 14+(Apple Silicon,實驗性)

aarch64.dmg

走 PyTorch MPS,建議統一記憶體 16 GB 以上,不支援 Intel Mac。App 沒有經過 Apple 公證,第一次開啟要到「隱私權與安全性」按「仍要打開」。需要先 brew install ffmpeg。

Linux x86_64(實驗性)

amd64.deb · AppImage

Ubuntu 22.04、Debian 12 以上或同等。deb 會自動裝 ffmpeg;AppImage 要自己準備 ffmpeg 與 GStreamer 外掛。同樣需要 NVIDIA R580 以上的驅動。

第一次開啟 App 會引導你安裝引擎與模型(約 6 到 7 GB)。App 內建自動更新,下載的更新必須通過簽章驗證才會安裝;一般更新只換引擎套件,不會重抓 PyTorch。

也有 CLI: aivc

App 的每個動作都對應一個 aivc 子命令,加 --json 會以 JSONL 事件輸出,腳本或 AI agent 都驅動得動。

環境檢查

python -m aivc doctor

打字找物件

python -m aivc find clip.mp4 --text "face, license plate" --out found/

給看圖的 AI 一張疊上座標格線的幀

python -m aivc frame clip.mp4 --at 120 --grid --out f.png

用框選取,沿鏡頭傳播

python -m aivc select clip.mp4 --frame 120 --box 412,300,180,160 --coords norm1000 --propagate 0:600 --out sel/

驗收選取結果(多幀拼成一張)

python -m aivc preview-object clip.mp4 --masks sel/obj1/masks.aivm --frames 0,150,300,450 --out sheet.png

套馬賽克並輸出

python -m aivc fx clip.mp4 --masks found/obj1/masks.aivm --effects '[{"type":"mosaic"}]' -o out.mp4

匯出追蹤資料

python -m aivc track-export clip.mp4 --masks found/obj1/masks.aivm --format csv --out face.csv

這裡的 python 指的是引擎 venv 裡的那一支(Windows 在 %LOCALAPPDATA%\net.markkulab.aivideocut\pyenv\Scripts\python.exe)。搭配 Claude Code 時,只用這套 CLI 就能完成「看畫面、選物件、驗收、套特效」,不必開 App。

選一次,一路追到底

打碼、替換、移除這些逐幀的機械活交給它,你留著決定畫面裡什麼該被看見。完全免費,全部在你的電腦上跑,影片不上傳。

NordVPN

站長優惠

寫程式的地方,網路常常不是你的

NordVPN 把你的連線整條加密:咖啡廳與飯店 Wi-Fi 不再是別人的監聽管道,出差時銀行 App、公司後台、台灣的影音服務照樣連得回去。開 App 按一顆鈕就好,NordLynx 協定跑起來日常上網幾乎無感,一個帳號可以同時保護 10 台裝置。30 天退款保證,不合用全額退。

  • 公共 Wi-Fi 全程加密,攔到也只是亂碼
  • 137 國節點,出國連得回台灣服務
  • 1 帳號 10 台裝置,30 天退款保證

含聯盟推廣連結