將音訊轉錄成文字
免費、無需註冊,您的檔案不會離開您的裝置。
將檔案拖放到這裡
選擇檔案沒有任何內容會上傳:一切都在您的瀏覽器中完成
第一次轉錄會下載語音辨識模型,之後瀏覽器會保留該模型:標準精確度約 75 MB,高精確度約 240 MB。影片本身則不會離開您的裝置。
語音備忘錄、WhatsApp 訊息、podcast,或是用手機錄下的會議:拖放檔案後,語音辨識會將其轉成文字,並在每次停頓處換成新段落。錄音會保留在您的裝置上,這對於私人對話或專業訪談來說格外重要。
如何進行轉錄
- 1將您的影片或錄音拖放到框內,或點擊選取檔案。
- 2選擇輸出格式:純文字 (TXT)、SRT 或 VTT 字幕。系統會自動偵測語音所用的語言,您也可以在設定中自行選擇。
- 3第一次使用時,系統會下載一次語音辨識模型,之後就不再需要下載。接下來的處理都在您的裝置上進行:下載文字或字幕檔即可。
關於這些格式
MP3
最通用的音訊格式。採用破壞性壓縮,在 192 kbit/s 時幾乎聽不出差異,可在所有裝置、播放器和軟體上播放。分享音訊時,這是最適合的格式。
M4A
Apple 的音訊格式,iPhone 的語音備忘錄和 iTunes 都採用它。本質上是放在 MP4 容器裡的 AAC 音訊:畫質好、檔案小,但部分播放器和網站不支援。
WAV
錄音室和剪輯軟體使用的無壓縮音訊格式。它能完整保留音質,但一分鐘的音訊大約就要十百萬位元組,是 MP3 的十倍大。
OGG
一種開放的音訊格式,採用 Vorbis 或 Opus 編碼,也是 WhatsApp 和 Telegram 語音訊息所使用的格式。檔案輕巧、音質不錯,但許多播放器、剪輯工具和裝置都無法播放。
TXT
隨處可讀的純文字:錄音內容以段落呈現,不含任何格式。可直接貼到文件、電子郵件、文章或 AI 工具中。
您的檔案留在您身邊
轉換工作在您的瀏覽器中進行,使用您裝置的解碼器。沒有任何檔案被上傳,也不會保留任何副本,除了您本人,沒有人能看到您的照片或影片。您可以在瀏覽器開發人員工具的「網路」分頁中親自確認:沒有任何檔案被傳送出去。
常見問題
支援哪些檔案格式?
MP3、M4A(iPhone 語音備忘錄)、WAV、OGG 與 Opus(WhatsApp 與 Telegram 的語音訊息)、FLAC,以及 MP4、MOV 與 WebM 影片。
不同說話者會被分開標示嗎?
不會,文字會依照對話順序呈現,不會標明是誰在說話。停頓處會標示為新段落,有助於辨識說話者的切換。
這個轉換工具真的免費嗎?
是的,無需註冊、沒有水印,也沒有檔案數量限制。轉換在您的裝置上執行,對我們來說沒有任何成本,因此沒有任何理由向您收費。
我的檔案會被傳送到別處嗎?
不會。檔案會在您的瀏覽器中讀取並轉換,然後直接儲存到您的裝置上,沒有任何伺服器會收到這些檔案。
有檔案大小上限嗎?
限制取決於您裝置的記憶體容量。照片和音訊檔案通常都能順利處理;若是數 GB 的大型影片,使用電腦會比手機更有優勢。
可以在手機上使用嗎?
可以,無論是 iPhone 或 Android,在 Safari、Chrome 或 Firefox 都能使用。處理影片則需要最新版本的瀏覽器,因為它需要提供對應的解碼器。
接下來,運用 AI
AI 旁白:同一段文字,三個引擎來唸
同一段稿子由 ElevenLabs v3、MiniMax Speech 2.8 HD 和 OpenAI TTS HD 三個語音合成引擎唸出來,用耳朵挑你的旁白。不用註冊帳號就能看到完整流程。
開啟工具