動画をテキストに文字起こし
無料、登録不要。ファイルはお使いの端末から外に出ません。
ここにファイルをドロップしてください
ファイルを選択アップロード不要:すべてブラウザ内で処理されます
初回の文字起こし時に音声認識モデルが一度だけダウンロードされ、以降はブラウザに保存されます(標準精度で約75MB、高精度で約240MB)。動画そのものがデバイスの外に送信されることはありません。
インタビューや授業、録画した会議、自分で撮影したYouTube動画など、動画内で話されている内容をすべてテキストとして取得できます。音声認識(OpenAIが公開しているモデルWhisper)はブラウザ内で動作するため、動画が外部サーバーに送られることはなく、テキストは段落形式で出力され、すぐに確認・修正できます。
文字起こしの方法
- 1動画や録音ファイルを枠内にドロップするか、クリックして選択してください。
- 2形式を選びます:通常のテキスト(TXT)、字幕のSRTまたはVTT。話されている言語は自動で検出されますが、設定から手動で選ぶこともできます。
- 3初回のみ、音声認識モデルが一度だけダウンロードされます。それ以降はすべてお使いの端末上で処理されます:テキストまたは字幕をダウンロードしてください。
各形式について
MP4
動画の汎用フォーマットです。H.264の映像とAAC音声の組み合わせなら、あらゆる携帯電話やパソコン、テレビ、SNSで再生できます。どこで再生されるか分からない場合は、まずこの形式を選ぶとよいでしょう。
MOV
Appleの動画フォーマットで、iPhoneやQuickTimeで使われています。中身はMP4(H.264やHEVC)と同じことが多いのですが、Windowsや一部のサイト、多くの編集ツールや共有サービスでは受け付けられません。
WebM
ウェブで使われるオープンな動画フォーマットで、VP9またはAV1の映像とOpus音声を使います。軽量でChrome、Firefox、Edgeで再生できますが、iPhoneや編集ソフト、一部のSNSでは十分に対応していません。
TXT
どこでも読めるプレーンテキストです。録音内容を段落形式で、装飾なしで出力します。文書やメール、記事、AIツールなどに貼り付けてご利用いただけます。
ファイルはお手元に残ります
変換はお使いの端末のデコーダーを使い、ブラウザ内で行われます。ファイルは送信されず、コピーも保存されず、あなた以外の誰も写真や動画を見ることはできません。ブラウザの開発者ツールの「ネットワーク」タブで確認いただけますが、ファイルがどこかに送信されることはありません。
よくあるご質問
対応している言語は?
英語、フランス語、スペイン語、ドイツ語、ポルトガル語、イタリア語、アラビア語、日本語、中国語など、約100言語に対応しています。言語は自動で検出されますが、動画内で複数の言語が混ざっている場合は、設定で主な言語を選んでください。
どのくらい時間がかかりますか?
最近のパソコンであれば、多くの場合動画の長さより短い時間で処理できます。スマートフォンではより時間がかかります。初回はモデルのダウンロード(約75MB)が追加で発生しますが、以降はブラウザに保存されます。固有名詞や専門用語は必ず確認してください。
この変換ツールは本当に無料ですか?
はい、登録も不要で、透かしも入らず、ファイル数の制限もありません。変換処理はお使いの端末上で行われるため私たちにコストが発生せず、料金を請求する理由がないのです。
ファイルはどこかに送信されますか?
いいえ。ファイルはブラウザ内で読み込まれて変換され、そのままお使いの端末に保存されます。サーバーに送られることはありません。
ファイルサイズに上限はありますか?
上限はお使いの端末のメモリに依存します。写真や音声ファイルは問題なく処理できますが、数ギガバイトの動画の場合はパソコンのほうがスマートフォンより快適に処理できます。
スマートフォンでも使えますか?
はい、iPhoneでもAndroidでも、Safari、Chrome、Firefoxでご利用いただけます。動画の変換には最新版のブラウザが必要です。処理に使うデコーダーを提供しているのはブラウザだからです。
次は、AIで
AIで動画を吹き替える、唇の動きも同期
誰かが話している動画に、別の言語の新しい声を当てる。Sync Lipsync 3が新しいテキストに合わせて唇のタイミングを再調整します。同じ映像を英語版とスペイン語版で、撮り直しなしに。ワークフロー全体はアカウントなしでご覧いただけます。
ツールを開く