音声をテキストに文字起こし
無料、登録不要。ファイルはお使いの端末から外に出ません。
ここにファイルをドロップしてください
ファイルを選択アップロード不要:すべてブラウザ内で処理されます
初回の文字起こし時に音声認識モデルが一度だけダウンロードされ、以降はブラウザに保存されます(標準精度で約75MB、高精度で約240MB)。動画そのものがデバイスの外に送信されることはありません。
ボイスメモやWhatsAppのメッセージ、ポッドキャスト、電話で録音した会議など、ファイルをドロップするだけで、音声認識が無音部分ごとに段落を分けながらテキストに変換します。録音データはお使いの端末上に保存されたままなので、プライベートな会話や仕事の面談記録を扱う際にも安心です。
文字起こしの方法
- 1動画や録音ファイルを枠内にドロップするか、クリックして選択してください。
- 2形式を選びます:通常のテキスト(TXT)、字幕のSRTまたはVTT。話されている言語は自動で検出されますが、設定から手動で選ぶこともできます。
- 3初回のみ、音声認識モデルが一度だけダウンロードされます。それ以降はすべてお使いの端末上で処理されます:テキストまたは字幕をダウンロードしてください。
各形式について
MP3
音声用の汎用フォーマットです。非可逆圧縮ですが、192kbpsであればほとんど劣化を感じません。あらゆる機器やプレーヤー、アプリで再生できるため、音声を共有する際にまず選ぶべき形式です。
M4A
Appleの音声フォーマットで、iPhoneのボイスメモやiTunesで使われています。MP4コンテナに格納されたAAC形式で、小さな容量ながら高音質ですが、一部のプレーヤーやサイトでは対応していません。
WAV
スタジオや編集ソフトで使われる無圧縮の音声フォーマットです。完全な音質を保てますが、1分間の音声でおよそ10メガバイトと、MP3の10倍の容量になります。
OGG
VorbisまたはOpusを使ったオープンな音声フォーマットです。WhatsAppやTelegramの音声メッセージで使われています。軽量で音質も良いのですが、多くのプレーヤーや編集ツール、機器では再生できません。
TXT
どこでも読めるプレーンテキストです。録音内容を段落形式で、装飾なしで出力します。文書やメール、記事、AIツールなどに貼り付けてご利用いただけます。
ファイルはお手元に残ります
変換はお使いの端末のデコーダーを使い、ブラウザ内で行われます。ファイルは送信されず、コピーも保存されず、あなた以外の誰も写真や動画を見ることはできません。ブラウザの開発者ツールの「ネットワーク」タブで確認いただけますが、ファイルがどこかに送信されることはありません。
よくあるご質問
対応しているファイル形式は?
MP3、M4A(iPhoneのボイスメモ)、WAV、OGG、Opus(WhatsAppやTelegramのボイスメッセージ)、FLACに対応しています。また、MP4、MOV、WebMの動画ファイルも使用できます。
話者ごとに区別されますか?
いいえ、テキストは誰が話しているかを示さず、会話の流れに沿って出力されます。無音部分で段落が分かれるため、話者の切り替わりを見分ける手がかりになります。
この変換ツールは本当に無料ですか?
はい、登録も不要で、透かしも入らず、ファイル数の制限もありません。変換処理はお使いの端末上で行われるため私たちにコストが発生せず、料金を請求する理由がないのです。
ファイルはどこかに送信されますか?
いいえ。ファイルはブラウザ内で読み込まれて変換され、そのままお使いの端末に保存されます。サーバーに送られることはありません。
ファイルサイズに上限はありますか?
上限はお使いの端末のメモリに依存します。写真や音声ファイルは問題なく処理できますが、数ギガバイトの動画の場合はパソコンのほうがスマートフォンより快適に処理できます。
スマートフォンでも使えますか?
はい、iPhoneでもAndroidでも、Safari、Chrome、Firefoxでご利用いただけます。動画の変換には最新版のブラウザが必要です。処理に使うデコーダーを提供しているのはブラウザだからです。
次は、AIで
AIナレーション:同じ文章を三つのエンジンで読む
同じ原稿を ElevenLabs v3、MiniMax Speech 2.8 HD、OpenAI TTS HD の三つの音声合成エンジンが読み上げ、ナレーションを耳で選べます。アカウント登録なしで、ワークフロー全体をそのまま見られます。
ツールを開く