如何使用 AI 自動影片字幕工具?
- 上傳媒體:將 MP4、WebM、MOV 影片或 MP3、WAV 音訊拖放至上傳區。系統會以 Web Audio API 抽取音訊軌;若瀏覽器無法直接解碼,會改以本機 FFmpeg 抽出 WAV。
- 選擇模型與語言:依速度選 Whisper Tiny,或依準確度選 Base;語言可選廣東話、國語或英語。首次使用會下載 WASM/ONNX 模型並顯示進度條。
- 自動生成並編輯:點擊「自動生成字幕」取得帶時間軸的句子,再於列表中修改文字或起迄時間,確認無誤後下載 .SRT/.VTT。
- 燒錄匯出:調整字級、顏色與底框後,按「將字幕燒錄至影片」,以 FFmpeg.wasm 匯出無水印 MP4,方便上傳社群或簡報播放。
為什麼選擇 WebGPU/瀏覽器本地字幕生成?
雲端字幕服務往往要求上傳完整影片,除了流量與等待時間,更牽涉客戶訪談、未公開產品演示或內部培訓內容的外洩風險。把 Whisper 與 FFmpeg 搬進瀏覽器後,語音特徵與畫面像素都只在你的裝置記憶體中流動:沒有第三方 API 帳單、也沒有「每分鐘計費」的隱藏成本。WebAssembly(以及裝置支援時的加速路徑)讓中小型剪輯也能在筆電上完成聽寫;本站亦不設伺服器端片長配額——限制只來自你的硬體與瀏覽器能負荷的檔案大小。對廣告與內容創作者而言,本地字幕代表可重複試錯、可離線級快取模型,並在產出 SRT 後自由接到任何剪輯軟體。若你處理的是敏感商務影片,本地管線幾乎是唯一能同時滿足「自動聽寫」與「資料零出境」的務實方案。
常見問題 (FAQ)
影片會上傳到伺服器嗎?需要 API Key 嗎?
不會上傳,也不需要 API Key。語音辨識使用 @xenova/transformers 的 Whisper 模型在瀏覽器本地執行,字幕燒錄則以 FFmpeg.wasm 在本機完成。
支援廣東話嗎?辨識準不準?
可選擇廣東話/國語/英語。多語系 Whisper tiny/base 對粵語會以中文模式處理,口音與環境噪音會影響準確度;建議生成後在編輯器微調,重要內容可改用 Base 模型。
可以下載什麼格式?燒錄後有浮水印嗎?
可下載 .SRT 與 .VTT。燒錄匯出為無浮水印 MP4;若瀏覽器內建的 FFmpeg 核心不支援硬字幕濾鏡,會改嵌入軟字幕軌道(仍可下載使用)。
有影片長度限制嗎?為什麼第一次很慢?
本站不設伺服器上傳上限;實際可處理長度取決於裝置記憶體與效能。首次需下載 Whisper 與(燒錄時)FFmpeg/字型,完成後瀏覽器可快取,之後會較快。
音訊檔也能用嗎?
可以。支援 MP3/WAV 等音訊,流程同樣是抽取波形 → Whisper 出字幕 → 編輯並下載 SRT/VTT;燒錄壓字僅適用於影片檔。