오디오를 텍스트로 변환하기

무료이고 회원가입도 필요 없으며, 파일이 기기 밖으로 나가는 일도 없습니다.

파일을 여기에 놓아 주세요

파일 선택

아무것도 전송되지 않습니다: 모든 작업은 브라우저에서 처리됩니다

처음 변환할 때 음성 인식 모델을 한 번 다운로드하며, 이후에는 브라우저에 저장됩니다: 표준 정확도는 약 75MB, 높은 정확도는 약 240MB입니다. 동영상 자체는 기기 밖으로 전송되지 않습니다.

음성 메모, WhatsApp 메시지, 팟캐스트, 휴대폰으로 녹음한 회의까지, 파일을 올리면 음성 인식이 정적이 있을 때마다 문단을 나눠 텍스트로 변환해 드립니다. 녹음 파일은 기기에 그대로 남아 있어, 사적인 대화나 업무용 인터뷰에 중요한 부분을 지켜 드립니다.

변환 방법

  1. 1동영상이나 녹음 파일을 영역에 드래그하거나 클릭해서 선택하세요.
  2. 2형식을 선택하세요: 일반 텍스트(TXT), SRT 또는 VTT 자막. 사용된 언어는 자동으로 감지되며, 설정에서 직접 선택할 수도 있습니다.
  3. 3처음 한 번만 음성 인식 모델을 다운로드합니다. 이후부터는 모든 처리가 기기에서 이루어집니다: 텍스트나 자막을 다운로드하세요.

형식 안내

MP3

범용 오디오 포맷입니다. 손실 압축 방식이지만 192kbps에서는 거의 차이를 느낄 수 없고, 모든 기기, 플레이어, 앱에서 재생됩니다. 오디오를 공유할 때 선택하면 가장 무난한 포맷입니다.

M4A

iPhone 음성 메모와 iTunes에서 쓰이는 Apple의 오디오 포맷입니다. MP4 컨테이너 안에 AAC를 담은 형식으로, 용량 대비 음질이 좋지만 일부 플레이어와 웹사이트에서는 지원하지 않습니다.

WAV

스튜디오와 편집 소프트웨어에서 쓰이는 비압축 오디오 포맷입니다. 음질을 완전히 유지하지만, 1분 분량이 약 10메가바이트로 MP3보다 10배 정도 큽니다.

OGG

Vorbis나 Opus를 사용하는 개방형 오디오 포맷입니다. WhatsApp과 Telegram의 음성 메시지에 쓰이는 포맷이기도 합니다. 가볍고 음질도 좋지만, 많은 플레이어, 편집 도구, 기기에서 재생되지 않는 경우가 있습니다.

TXT

어디서나 읽을 수 있는 일반 텍스트입니다: 녹음 내용이 서식 없이 문단 단위로 정리됩니다. 문서, 이메일, 기사나 AI 도구에 그대로 붙여 넣으실 수 있습니다.

파일은 항상 사용자의 손 안에

변환은 사용자 기기의 디코더를 이용해 브라우저 안에서 이루어집니다. 어떤 파일도 전송되지 않고, 사본도 남지 않으며, 사용자 외에는 그 사진이나 동영상을 볼 수 있는 사람이 없습니다. 브라우저 개발자 도구의 네트워크 탭을 열어 보면 직접 확인할 수 있습니다. 파일이 외부로 나가는 흔적이 전혀 없습니다.

자주 묻는 질문

어떤 파일 형식을 지원하나요?

MP3, M4A(iPhone 음성 메모), WAV, OGG, Opus(WhatsApp, Telegram 음성 메시지), FLAC, 그리고 MP4, MOV, WebM 동영상도 지원합니다.

화자별로 구분되나요?

아니요, 텍스트는 누가 말하는지 표시하지 않고 대화 흐름을 그대로 따라갑니다. 정적 구간이 문단을 나누는 기준이 되어 목소리 변화를 파악하는 데 도움이 됩니다.

이 변환기는 정말 무료인가요?

네, 회원가입도 워터마크도 없고 파일 개수 제한도 없습니다. 변환은 사용자의 기기에서 이루어지므로 저희에게 비용이 들지 않고, 따라서 요금을 받을 이유도 없습니다.

제 파일이 어딘가로 전송되나요?

아니요. 파일은 브라우저 안에서 읽히고 변환된 뒤 바로 기기에 저장됩니다. 어떤 서버도 파일을 전달받지 않습니다.

파일 크기에 제한이 있나요?

제한은 기기의 메모리 용량뿐입니다. 사진과 음성 파일은 문제없이 처리되지만, 몇 기가바이트 분량의 동영상이라면 휴대폰보다는 컴퓨터가 더 잘 처리합니다.

휴대폰에서도 작동하나요?

네, iPhone과 Android 모두 가능하며 Safari, Chrome, Firefox에서 사용할 수 있습니다. 동영상의 경우 최신 버전의 브라우저가 필요한데, 이는 변환에 필요한 디코더를 제공하기 때문입니다.

다음으로, AI와 함께

AI 내레이션: 같은 글을 세 엔진이 읽다

같은 대본을 ElevenLabs v3, MiniMax Speech 2.8 HD, OpenAI TTS HD 세 음성 합성 엔진이 읽어, 내레이션을 귀로 고를 수 있습니다. 계정 없이 전체 워크플로를 그대로 볼 수 있습니다.

도구 열기

다른 변환

모든 변환 목록