Mark Ku's Blog
This article hasn't been translated yet — showing the original Chinese version.

前言:剪一集 Podcast,為什麼那麼累?

錄完一集 40 分鐘的 Podcast,真正花時間的不是錄,是剪:整集的「嗯、呃、那個」要一個一個找出來剪掉、講壞的那句要重錄再對回去、背景有冷氣聲要降噪、兩個人各自錄的音軌要對齊、最後還要把音量弄整齊再輸出成平台要的格式。

市面上早就有工具做這些事。GoldWave 這類音訊編輯器有降噪、去爆音、EQ、壓縮、頻譜、批次轉檔;Synchro Arts 的 VocALign 專門做「把一軌在時間上扭到跟另一軌對齊」。它們都很強,但以我們的經驗來看,對第一次剪 Podcast 的人有兩個門檻:功能太多不知道從哪裡按,以及每個功能都是一個滿是旋鈕的對話框。

所以我做了 AI Music Cut:一個免費開源的桌面工具(Tauri 2 + React + Rust),把這些功能抄過來,但介面設計的最高原則是小白也能用。這篇是完整教學,從下載開始,到剪完一集輸出 mp3 為止。

這篇使用的工具 / 前置條件

項目說明
下載GitHub Releases(Windows 安裝檔為主,也有 macOS / Linux 的 build)
版本這篇對應 v0.106,之後的版本介面可能略有不同
ffmpeg內建在安裝檔裡,不用自己裝
網路波形、剪輯、效果、輸出全部在本機做;只有「自動剪贅字」需要語音辨識(可接自架的轉寫伺服器或本機 Whisper)
AI 助手選用。本機有 claude CLI 的話,可以用自然語言下剪輯指令

一個很重要的原則先講在前面:它永遠不會動你的原始檔。所有剪輯都是「決策」(哪裡剪、哪裡加效果),輸出的時候才真的算出新檔案。剪壞了就 Ctrl+Z,或者整個專案丟掉重來,原始錄音一直都在。

兩種模式:簡易與專業

第一次打開是簡易模式。開始畫面先問你「想做什麼」:

開始畫面:剪 Podcast、把雜音去掉、剪音樂、轉檔合併、錄音
開始畫面:剪 Podcast、把雜音去掉、剪音樂、轉檔合併、錄音

點一張卡片、選檔案,進來就是這個畫面:左邊波形,右邊只有幾顆白話的按鈕,最上面永遠是「復原」。

簡易模式:波形加上右邊的八顆按鈕
簡易模式:波形加上右邊的八顆按鈕

右上角可以隨時切到專業模式:側欄、逐字稿、精準修剪、快捷鍵、命令面板(Ctrl+K 打字就搜得到任何功能)全部打開。兩邊是同一套指令、同一份專案,簡易模式只是把東西藏起來,不是另一個閹割版。

💡 專業模式的功能太多找不到?按 Ctrl+K,打「降噪」或「denoise」都會命中。

10 分鐘上手:簡易模式的八顆按鈕

以「剪 Podcast」這張卡為例,整個流程只用面板按鈕和滑鼠右鍵,不需要記任何快捷鍵:

步驟按鈕做什麼
1自動剪掉贅字把錄音送去辨識,找出嗯、呃、重講的片段,逐字稿裡劃線的字就是會被剪掉的;雙擊可以還原
2去雜音量這份錄音「安靜的時候有多吵」,決定要降多少噪、順便切掉 80 Hz 以下的隆隆聲
3音量弄整齊勾起來,輸出時逐段量響度、拉到同一個水位(預設 −16 LUFS,Podcast 平台的標準)
4剪掉選的這段在波形上拖一段,按下去就剪掉
5只留選的這段反過來,只留這一段
6加片頭 / 片尾音樂選一個音樂檔,放開頭或結尾,講話的時候音樂會自動變小聲
7重錄這句講壞的那句選起來,聽一次再錄,新錄的自動塞回去(下面有一整節)
8輸出 mp3存成 mp3,檔名預設在原檔旁邊加 _cut

每一顆會改到聲音的按鈕按完都會跳一句話加一顆「復原」,所以不用先學 Ctrl+Z。

用右鍵剪

在波形上拖出一段,按右鍵,簡易模式的選單是平的八項,沒有子選單:

簡易模式右鍵:播放這段、剪掉、只留這段、去雜音、變大聲、變小聲、淡入淡出、只輸出這一段
簡易模式右鍵:播放這段、剪掉、只留這段、去雜音、變大聲、變小聲、淡入淡出、只輸出這一段

最後一項「只輸出這一段」是很多人問的:選一段、右鍵、直接存成一個獨立的檔(社群短片、精華片段都用這個),專案本身完全不動。

選一段做效果:專業模式的「效果 ▸」與「修復 ▸」

切到專業模式,同樣是在波形上選一段按右鍵,多了兩個子選單:

專業模式右鍵的效果子選單
專業模式右鍵的效果子選單
選單內容
效果 ▸靜音、增益(+6 / +3 / −3 / −6 / −12)、峰值正規化、響度對齊、淡入淡出(線性 / 等功率 / 指數)、反相、等化(三段)、壓縮、回音、殘響、反轉、變調
修復 ▸降噪(這一段)、去爆音、去削波、去嗡聲、DC 偏移修正、把這段當噪音樣本、整集修聲

每一種有參數的效果都是同一種對話框:一句白話說明、最多三個滑桿、幾個預設值、一顆「用建議值」,還有 A/B 試聽:同一段算出「原始」和「處理後」兩份,來回按著聽。

降噪對話框:建議值、預設、A/B 試聽
降噪對話框:建議值、預設、A/B 試聽

幾個值得知道的細節:

  • 建議值是量出來的,不是寫死的。 降噪的建議量看這一段的底噪;峰值正規化看這一段的峰值。太小聲、分析解析度不夠時,對話框會直接說「這段太小聲,分析解析度不夠」,而不是印一個看起來很準的數字。
  • 噪音樣本:選一段 0.3 到 5 秒沒人講話的純底噪,右鍵「把這段當噪音樣本」,之後所有降噪的底噪值都以它為準。選到有人講話的段落會被拒絕,並告訴你原因。
  • 範圍效果在輸出時才套用,即時播放聽不到,所以時間軸上的色塊會標「輸出時套用」;要聽就用對話框的 A/B。以我們實測,一段十幾秒的 A/B 不到一秒就算好,因為它是對原始檔直接切那一段,不用等整集剪完。
  • 兩種效果疊在同一段會自動拆成三塊,鏈內順序固定(先修 DC、再去爆音、再降噪、最後才是 EQ 和空間效果),不管你先加哪一個。

講壞了一句?用「重錄這句」

這是簡易面板的第七顆,也是我自己最常用的功能。流程是零旋鈕的:

在波形上選講壞的那一段
        │
        ▼
按「重錄這句」 ──► 先播一次原句給你聽
        │
        ▼
     3 - 2 - 1 ──► 開始錄(麥克風)
        │
        ▼
講完不出聲 1.5 秒自動停
        │
        ▼
修掉頭尾靜音 ──► 用對齊引擎把新錄的扭回原句的位置
        │
        ▼
原句靜音 + 新錄的疊上去(一次 Ctrl+Z 全部收回)
重錄這句:顯示要重錄的範圍與說明
重錄這句:顯示要重錄的範圍與說明
  • 新錄的會存成 原檔名_take1.wav,對齊後再多一個 _aligned.wav,兩個都加進媒體清單,原始檔還是不動。
  • 新錄的比原句長 30% 以上時不會硬拉伸(那會聽起來像卡通),而是問你「直接放上去(會蓋到下一句)」還是「重錄」。
  • 輸出後的驗收知道原句被靜音了,不會把它報成「漏字」。

⚠️ 錄音走的是 WebView2 的麥克風權限,第一次會跳系統的允許提示。瀏覽器本身的回音消除、降噪、自動增益都會被關掉(那是給視訊會議用的),要降噪請用上面的降噪功能。

頻譜視圖與去嗡聲

專業模式「更多 ▾」裡有「波形 / 頻譜 / 疊合」:

疊合模式:波形壓淡,底下是頻譜圖
疊合模式:波形壓淡,底下是頻譜圖

頻譜是看哪一段就算哪一段(用 ffmpeg 的 showspectrumpic 出一張圖),不會預先算整檔,所以一小時的檔也不會多吃記憶體。捲動時前一張先跟著位移,停下來才要新的。

「去嗡聲」對話框一打開會真的去量這一段的頻譜,在 50 / 60 Hz 與諧波找突出的峰。量到了就自動填「60 Hz、挖 4 個諧波」;量不到會明講「沒有偵測到明顯的電源嗡聲」,不會硬填。

多軌:同步麥克風與 Guide / Dub 對齊

同步麥克風

一人一軌的遠端錄音,每個人各自按下錄音,起點會差幾秒。「工具 → 同步麥克風」勾選各軌(第一軌是基準),它用兩軌都聽得到的講話節奏對齊,列出位移和信心,確認後併成一個 _synced.wav 繼續剪。

錄超過 20 分鐘的軌常常會慢慢漂開(兩台錄音機的時鐘不一樣快)。這時「同時校正時鐘漂移」會自動勾起來,合併前先把其他軌扭到基準軌的時間軸。

Guide / Dub 對齊

這是抄 VocALign 的部分:「工具 → 對齊」,選一軌當 Guide(基準)、一軌當 Dub(要扭的),三種用途一個引擎:

用途什麼時候用預設 Tightness
補錄一句事後補錄的一句要對回原本的位置(Guide 只看選取的原句)60
多麥漂移兩支麥克風錄了一小時、慢慢漂開30
疊錄 / 和聲唱了第二遍要跟第一遍對齊70
對齊對話框:位移、漂移、信心與三車道
對齊對話框:位移、漂移、信心與三車道

分析完會給位移、最大偏差、每小時漂多少秒、信心;三條車道分別是 Guide、Dub、對齊後。Tightness 拉動時即時重算:0 是只做整體位移加線性漂移(等於同步麥克風),100 是貼到每個字。輸出 _aligned.wav 之後會自動每 10 秒比對一次殘差,對不上會說「可能沒對上:先聽第 N 秒那裡」。

以我用一個故意慢 2%、晚 350 毫秒的測試檔實測:分析 0.25 秒,量到每小時漂 −70 秒(真值 −72),輸出後驗收中位偏差 0 毫秒。

轉檔、從影片抽聲軌、合併檔案

開始畫面的「轉檔・合併」卡,或「更多 ▾」裡的「轉檔・抽聲軌」:

轉檔對話框:多檔批次、格式、正規化、直接複製預告
轉檔對話框:多檔批次、格式、正規化、直接複製預告
格式特性
MP3最通用,Podcast 平台都收,可寫章節
M4A (AAC)Apple 生態,同音質比 mp3 小,可寫章節
WAV / AIFF無損,可選 16 / 24 / 32-bit,給後製用
FLAC無損壓縮,約 wav 一半大
OGG / Opus開放格式;Opus 是語音最省空間
  • 幾個檔一起選就是批次;影片(mp4、mkv、mov、webm)丟進來只拿聲音。
  • 能直接複製就不重新編碼:mp4 裡的 aac 轉 m4a 是零損失、幾百毫秒的事。勾了「正規化到 −16 LUFS」才會重新編碼。
  • 章節只有 mp3 和 m4a 寫得進去,輸出到別的格式會跳一句「這個格式寫不進:章節」,不會默默少掉。
  • 「合併檔案」把幾個音檔照順序接成一個,留白或交越都可以,還能把各檔拉到同一響度。

把 AI 助手接上來

本機有 claude CLI 的話,App 內建的 MCP server 讓它直接操作剪輯決策。幾個實際用過的指令:

  • 「把 10 分鐘後的『就是』都剪掉,但句首的留著」
  • 「看看底噪要不要修,順便把整集的口頭禪剪掉」
  • 「用建議值降噪我選的這一段」(對應 apply_effect 工具,任何效果都能套)
  • 「把第二軌對齊到第一軌,信心太低就別輸出」(對應 align_tracks,信心低於 30% 會拒絕渲染)

助手聽不到聲音,所以有一支 get_loudness_profile 讓它「看得到」響度,還有 get_preflight 回答「可以輸出了嗎、還缺什麼」。

它是怎麼做到不動原檔的

簡單講一下運作原理,知道這個會比較安心:

原始錄音(永遠不動)
   │
   ├─ 波形 / 響度分析(本機、一次性、快取)
   │
   ├─ 決策:剪哪裡、哪裡加效果、配樂放哪、哪句重錄
   │       (全部是資料,存在專案檔,可以 undo)
   │
   └─ 輸出時才真的算:
        剪接(Rust 串流)→ 範圍效果 punch-in → 混配樂 → 量響度 → 正規化 + 編碼
  • 剪接是 Rust 逐 frame 串流做的,記憶體只跟交越長度有關,一小時的檔也不會整個讀進來。
  • 範圍效果(降噪、EQ 那些)是在剪好的成品上「挖一段出來給 ffmpeg 濾鏡、再用 10 毫秒交叉混回去」,寫出的 frame 數永遠等於讀進來的,所以字幕、章節、驗收的時間都不會跑掉。
  • 前端從來不送 ffmpeg 的濾鏡字串,只送型別化的數字,Rust 端會夾在安全範圍內。

注意事項 / PS

  • 不做音高:對齊只做時間,不做 VocALign 的 SmartPitch 那種音高修正;變調效果只是整段升降半音,不是自動修音。
  • 疊錄對齊用的是能量包絡:長音裡的路徑可能比較鬆,Tightness 拉低一點會比較自然。分頻特徵是下一步。
  • 自動剪贅字需要語音辨識:要接自架的轉寫伺服器或本機 Whisper,沒有的話其他功能(人工剪、效果、對齊、轉檔)都照常能用。
  • 回音、殘響的尾巴在選取結尾截斷,選取要留一點尾巴給它。
  • Windows 為主:我主要在 Windows 上開發和測試,macOS / Linux 的 build 有,但用得比較少。
  • 開源、MIT 授權,程式碼在 GitHub,工具頁在 blog.markkulab.net/tools/ai-music-cut

結論

這個工具的目標從來不是「功能比市售軟體多」,而是把 GoldWave、VocALign 那些真的有用的東西,包成第一次剪 Podcast 的人也按得下去的樣子:開檔、去雜音、剪一段、重錄這句、輸出,八顆按鈕,做錯了按復原。專業模式留給想要精準修剪、頻譜、對齊、命令面板的人,兩邊是同一套東西。

如果你也在剪 Podcast,歡迎試試看,也歡迎在 GitHub 開 issue 告訴我哪一步卡住了。下一步我想做的是選單列、把聲音體檢的結果一鍵修掉,以及疊錄對齊的分頻特徵。

Author

Mark Ku

擁有 10+ 年經驗的資深軟體工程師,現為 AI 應用 Builder,專注於大型平台架構與簡化複雜系統設計,從電商系統到訂閱與收費平台,結合 AI Agent、AI 整合與自動化開發,打造高效率且可持續演進的產品技術基礎。Read More

Found this useful?

The author's free tools, daily podcasts and newsletter are all here.

Mark Ku · This article is licensed under CC BY 4.0. Credit the author and link back to the original when reusing it.

Comments

Subscribe to Newsletter

Subscribe to get new posts delivered instantly — never miss a tech share.

By submitting, you agree to receive emails. You can anytime.

Popular Posts

View all
Mark Ku
··657

Oracle Cloud Always Free Tier: Linux Host and Static IP for a $0 Cloud Solution

Oracle Cloud Always Free Tier: Linux Host and Static IP for a $0 Cloud Solution
Mark Ku
··532

Say Goodbye to Postman's Fee Trap! A Hands-on Guide to Bruno, the Open-Source Git-Native API Testing Powerhouse.

Say Goodbye to Postman's Fee Trap! A Hands-on Guide to Bruno, the Open-Source Git-Native API Testing Powerhouse.
Mark Ku
··344

A Free, Open-Source, Notion-like Knowledge Base — A Complete Guide to Deploying and Backing Up Outline Wiki

A Free, Open-Source, Notion-like Knowledge Base — A Complete Guide to Deploying and Backing Up Outline Wiki
Mark Ku
··284

Training Your Own AI Voice: Hardware Requirements, Open-Source Model Comparison, and LoRA Fine-Tuning

Training Your Own AI Voice: Hardware Requirements, Open-Source Model Comparison, and LoRA Fine-Tuning
Mark Ku
··226

Building an Efficient API Management Platform: Deploying Kong Gateway from Scratch - Part 1

Building an Efficient API Management Platform: Deploying Kong Gateway from Scratch - Part 1
Mark Ku
··222

Setting Up Samba on Ubuntu to Share Folders with Windows 11

Setting Up Samba on Ubuntu to Share Folders with Windows 11
AI Music Cut 完整教學:免費開源的 AI Podcast 剪音工具,從剪贅字、去雜音到重錄這句 - Mark Ku's Tech Notes