음성 텍스트
변환
MP3, WAV, M4A, MP4 음성 파일을 무료로 텍스트로 변환하세요. 파일은 브라우저에서만 처리되고 업로드되지 않습니다.
여기에 오디오 파일을 놓으세요
또는 클릭해서 찾아보기 — MP3, WAV, M4A, OGG, WEBM, MP4 · 파일이 기기를 떠나지 않습니다
무료 음성 텍스트 변환: 음성 파일을 브라우저에서 텍스트로
이 무료 음성 텍스트 변환 도구는 녹음, 회의, 인터뷰, 음성 메모를 복사하고 검색할 수 있는 텍스트로 바꿉니다. MP3, WAV, M4A, OGG, WEBM 또는 MP4 파일을 추가하고 언어를 선택하면 Whisper Tiny가 브라우저에서 로컬로 음성을 텍스트로 변환합니다. 일반 온라인 전사 서비스와 달리 음성 파일은 서버로 업로드되지 않습니다.
오디오 추가하기
MP3, WAV, M4A, OGG, WEBM 또는 MP4 파일을 드롭 영역으로 끌어다 놓거나 클릭해서 파일을 선택하세요. 오디오는 페이지로 곧바로 불러오며, 서버로 전송되지 않습니다.
언어를 선택하고 전사하기
음성 언어를 선택하거나 자동 감지로 두고, 텍스트 변환 버튼을 누르세요. Whisper Tiny 모델을 한 번만(약 40MB) 내려받은 뒤, 사용자의 CPU에서 음성을 텍스트로 변환합니다.
전사 텍스트를 복사하거나 다운로드하기
전사 텍스트를 확인하고 클립보드에 복사하거나 .txt 파일로 내려받으세요 — 또는 동영상 자막용으로 타임스탬프가 포함된 .srt / .vtt 자막 파일로도 받을 수 있습니다.
음성을 텍스트로 변환
음성이 담긴 녹음이라면 무엇이든 올리기만 하면 편집 가능한 텍스트를 돌려받습니다. 직접 타이핑할 필요도, 타임라인을 뒤질 필요도, 비싼 전사 서비스도 필요 없습니다.
Whisper AI로 음성 텍스트 변환
인식은 OpenAI의 Whisper Tiny 모델로 이뤄집니다. 진짜 신경망 기반 음성-텍스트 변환 모델이 서버가 아닌 WebAssembly를 통해 로컬에서 실행됩니다.
MP3, WAV, M4A 등 다양한 형식
음성 메모는 보통 M4A, 팟캐스트와 음악은 보통 MP3, 녹음 파일은 흔히 WAV입니다. 이 모두는 물론 OGG, WEBM, MP4 동영상의 오디오 트랙까지 지원합니다.
타임스탬프가 포함된 자막
일반 텍스트뿐 아니라 타임코드가 포함된 SRT, VTT 자막 파일도 내보낼 수 있어 동영상 자막으로 바로 사용할 수 있습니다 — 모두 브라우저에서 생성됩니다.
무료이며 사용 제한 없음
진짜 무료 오디오 텍스트 변환기입니다. 계정도, 크레딧도, 워터마크도, 분당 제한도 없습니다. 원하는 만큼 몇 번이든 전사하세요.
첫 실행 이후에는 오프라인에서도 동작
브라우저가 모델을 캐시하고 나면 전사 자체에는 네트워크가 전혀 필요 없습니다. 비행기 안에서도, 방화벽 뒤에서도 오디오를 계속 텍스트로 바꿀 수 있습니다.
인터뷰와 회의
녹음한 인터뷰, 회의, 강의를 검색 가능한 텍스트로 바꿔 인용하거나 요약하거나 노트에 붙여 넣으세요 — 민감한 대화를 클라우드 서비스로 보내지 않고도요.
음성 메모와 받아쓰기
빠른 음성 메모, 구술한 아이디어, 통화 녹음을 편집 가능한 텍스트로 변환해, 이미 소리 내어 말한 내용을 다시 타이핑할 필요가 없습니다.
자막과 캡션
동영상의 오디오 트랙에서 SRT나 VTT 자막을 생성해 팟캐스트, 튜토리얼, 소셜 클립에 자막을 달고 더 많은 사람이 접근할 수 있게 만드세요.
MP3를 텍스트로
팟캐스트, 음악, 다운로드 파일에 가장 흔히 쓰이는 오디오 형식입니다. 파일을 먼저 변환할 필요 없이 MP3를 바로 텍스트로 바꿀 수 있습니다.
WAV를 텍스트로
대부분의 녹음기와 DAW가 만들어 내는 무압축 형식입니다. WAV는 무손실이라 보통 가장 깨끗하고 정확한 전사 결과를 얻을 수 있습니다.
M4A를 텍스트로
아이폰 음성 메모와 대부분의 휴대폰 녹음 앱이 저장하는 형식입니다. 기기에서 바로 M4A 음성 메모를 전사하세요.
OGG, WEBM, MP4
브라우저와 앱 녹음은 흔히 OGG나 WEBM 형식이며, MP4 동영상에는 오디오 트랙이 포함되어 있습니다. 별도의 변환 단계 없이 모두 디코딩하고 전사할 수 있습니다.
의도적으로 작게 만든 모델
전사는 OpenAI Whisper 제품군에서 가장 작은 모델인 Whisper Tiny로 이뤄집니다. 양자화된 가중치가 약 40MB 정도입니다. 이 작은 크기 덕분에 브라우저 전사가 현실적으로 가능해집니다 — 대형 Whisper 모델이었다면 몇 기가바이트에 달해 방문자의 브라우저로 내려보낼 수 없었을 것입니다. 이 모델은 WebAssembly 위에서 ONNX Runtime Web을 통해 실행되므로, 보통 서버에서 돌아갈 신경망이 사용자의 CPU에서 대신 실행됩니다. Whisper Tiny는 속도와 크기를 얻는 대신 약간의 정확도를 내줍니다. 또렷한 음성은 잘 전사되지만, 강한 억양이나 배경 소음, 겹치는 목소리는 어떤 작은 모델에게도 더 어려운 과제입니다.
설계부터 다국어 지원
Whisper Tiny는 다국어 모델입니다(영어 전용인 tiny.en이 아닙니다). 영어, 중국어, 일본어, 한국어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 러시아어, 아랍어, 힌디어를 비롯해 수십 개 언어의 음성을 인식합니다. 가장 좋은 결과를 얻으려면 선택기에서 음성 언어를 고르거나, Whisper가 자동으로 감지하게 두세요.
업로드도, 서버도 없음
오디오를 실어 보내는 업로드 엔드포인트도 API 호출도 없습니다. 파일은 페이지가 직접 디코딩한 뒤, 같은 브라우저 탭에서 돌아가는 모델로 전달됩니다.
아무것도 저장하지 않음
오디오가 애초에 서버에 닿지 않으니 보관하거나 기록하거나 삭제할 것도 없습니다. 탭을 닫는 순간 녹음과 전사 텍스트의 흔적은 모두 사라집니다.
기밀 녹음에도 안전
인터뷰, 상담 세션, 법률 통화, 비공개 회의를 네트워크로 내보내지 않고도 전사할 수 있습니다. 대부분의 온라인 전사 도구는 이렇게 말할 수 없습니다.
내려받는 것은 모델뿐
네트워크를 오가는 것은 브라우저로 내려받는 모델 파일 하나뿐입니다. 데이터는 사용자를 향해 흘러올 뿐, 결코 밖으로 나가지 않습니다.
대부분의 오디오 텍스트 도구는 파일을 업로드합니다
흔한 온라인 전사 서비스는 녹음을 서버로 전송해 거기서 음성 인식을 돌린 뒤 텍스트를 돌려줍니다. 다시 말해 오디오가 남의 디스크에 남아 그들의 보관 정책을 따르게 됩니다. 이 도구에서는 녹음이 사용자의 기기에 그대로 남습니다.
가입도, 분당 제한도 없음
클라우드 전사 서비스는 1분마다 연산 비용이 들기 때문에 분당 제한, 월간 할당량, 가입 장벽으로 무료 사용을 막습니다. 브라우저 전사는 사용자의 CPU를 쓰므로 요금을 매길 대상 자체가 없습니다.
정확도에 대한 솔직한 설명
작은 모델은 애초에 로컬에서 돌아갈 수 있다는 이점을 얻는 대신 약간의 정확도를 내줍니다. 또렷한 음성에서는 충분히 쓸 만하지만, 시끄러운 오디오나 강한 억양, 겹치는 화자에서는 몇 단어쯤 손봐야 할 수 있습니다. 스튜디오급 정확도가 필요하다면 더 큰 모델을 찾는 편이 나을 수 있습니다.
01오디오를 텍스트로 어떻게 변환하나요?+
이 페이지 상단의 상자에 오디오 파일을 놓고 음성 언어를 선택한 뒤(또는 자동 감지로 두고) 텍스트 변환을 누르세요. 음성 인식 모델이 오디오를 읽고 복사하거나 .txt, .srt, .vtt로 내려받을 수 있는 전사 텍스트를 만들어 줍니다. 계정도 설치도 필요 없습니다.
02이 오디오 텍스트 변환기는 무료인가요?+
네, 완전히 무료이며 사용 제한도 없습니다. 계정도, 크레딧 제도도, 워터마크도, 전사할 수 있는 파일 수나 분량 제한도 없습니다. 전사가 사용자의 컴퓨터에서 돌아가므로 사용자에게 떠넘길 서버 비용이 발생하지 않습니다.
03제 오디오를 서버에 업로드하나요?+
아니요. 이것이 대부분의 온라인 오디오 텍스트 변환기와의 가장 큰 차이입니다. 파일은 페이지가 직접 디코딩하고, 브라우저 탭 안에서 돌아가는 모델이 처리합니다. 오디오가 네트워크를 타고 나가지 않으므로 저희가 저장하거나 들을 것 자체가 없습니다.
04어떤 오디오 형식을 전사할 수 있나요?+
MP3, WAV, M4A, OGG, WEBM, MP4에 AAC와 FLAC까지 지원합니다. 음성 메모, 팟캐스트, 녹음기 출력물, 브라우저 녹음, 동영상의 오디오 트랙까지 대부분 포함됩니다. 최대 200MB까지의 파일을 사용할 수 있습니다.
05어떤 언어를 지원하나요?+
Whisper Tiny는 다국어 모델로 영어, 중국어, 일본어, 한국어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어, 러시아어, 폴란드어, 우크라이나어, 인도네시아어, 베트남어, 태국어, 말레이어, 힌디어, 아랍어, 튀르키예어, 히브리어, 그리스어, 체코어, 스웨덴어, 덴마크어, 핀란드어, 노르웨이어를 비롯한 수십 개 언어의 음성을 인식합니다. 선택기에서 하나를 고르거나 자동 감지로 두세요.
06어떤 음성 인식 모델을 사용하나요?+
OpenAI Whisper 제품군에서 가장 작은 다국어 모델인 Whisper Tiny를 사용합니다. 양자화된 가중치가 약 40MB입니다. WebAssembly 위의 ONNX Runtime Web을 통해 전적으로 브라우저 안에서 실행됩니다. 영어 전용 tiny.en이 아닌 다국어 체크포인트를 사용합니다.
07타임스탬프가 포함된 자막을 받을 수 있나요?+
네. 일반 텍스트 외에도 타임코드가 포함된 .srt나 .vtt 자막 파일로 전사 텍스트를 내려받아 동영상 자막으로 바로 사용할 수 있습니다. 타임스탬프는 모델이 전사하는 과정에서 함께 생성됩니다.
08첫 번째 전사가 나머지보다 느린 이유는 무엇인가요?+
첫 실행에서는 Whisper 모델(약 40MB)을 내려받고 WebAssembly 런타임을 컴파일합니다. 그 이후에는 모델이 브라우저에 캐시되므로, 다음 파일부터는 다운로드 없이 곧바로 전사됩니다.
09정확도는 어느 정도인가요?+
Whisper Tiny는 가장 작은 모델이라 최대 정확도보다 속도와 크기를 우선합니다. 또렷한 1인 발화에서는 충분히 쓸 만하지만, 시끄러운 오디오나 강한 억양, 겹치는 목소리에서는 몇 단어쯤 고쳐야 할 수 있습니다. 자동 감지 대신 정확한 음성 언어를 직접 선택하면 결과가 대체로 더 좋아집니다.
10오프라인에서도 작동하나요?+
첫 실행 이후에는 가능합니다. 브라우저가 모델을 캐시하고 나면 추가적인 네트워크 활동이 전혀 없으므로, 인터넷 연결 없이도 오디오를 계속 텍스트로 변환할 수 있습니다.
오디오는 전적으로 브라우저에서 처리되며 전송되거나 저장되지 않으므로, 이 도구를 사용해도 저희 쪽으로 데이터가 이전되지 않습니다. 따라서 GDPR, HIPAA 또는 사내 기밀 유지 규정의 적용을 받는 녹음에도 적합합니다. 다만 결과로 나온 전사 텍스트를 적절히 취급할 책임은 사용자에게 있습니다.