스피치페커 — 휴대폰 녹음을 텍스트로

✅ 결론부터 적으면, 스피치페커는 휴대폰으로 녹음한 파일을 올리면 텍스트로 받아쓰고, 내가 정한 용어 사전으로 결과를 다듬고, MCP 서버로 자동화까지 이어 주는 도구입니다. 오픈모델 Whisper 계열을 쓰고, 혼자 만들었습니다. 다만 지금은 개발 단계입니다. 인식 엔진을 연결하기 전이라 가입과 업로드를 잠시 닫아 두었고, 그 사정은 글 끝에 그대로 적어 두겠습니다.

1. 왜 직접 만들었나

회의나 통화를 휴대폰으로 녹음하는 일은 흔한데, 그 파일을 텍스트로 옮기는 일은 늘 걸렸습니다. 문제는 두 가지였습니다. 첫째, 휴대폰 녹음 앱이 뱉는 형식이 m4a, amr, 3gp, opus처럼 제각각입니다. 둘째, 회사 이름이나 사람 이름 같은 고유명사가 매번 엉뚱하게 적힙니다. 그래서 처음부터 범위를 좁게 잡았습니다. 파일 기반 음성 인식, 휴대폰 녹음 포맷, 그리고 사용자 용어 사전. 이 세 가지가 이 도구의 범위입니다.

2. 무엇을 하는 도구인가

받아 주는 형식은 wav, mp3, flac, ogg, opus, m4a, 3gp, amr 여덟 가지입니다. mp4 같은 영상 파일은 거부합니다. 형식은 확장자가 아니라 파일 머리의 바이트를 읽어 판별합니다. 서버를 거치는 업로드는 20MB까지이고, 그보다 큰 파일은 별도의 직접 업로드 경로를 씁니다.

결과는 화면에서 바로 보고, SRT 자막이나 JSON으로 내려받을 수 있습니다. 용어 사전은 “잘못 인식되는 단어 → 원하는 표기”를 1:1로 등록하는 기능입니다. 각 항목에 0~10의 우선순위를 주고, 긴 용어가 짧은 용어보다 먼저 잡힙니다. “개발팀에서는”처럼 조사가 붙어도 “개발팀”이 치환됩니다. 몇 개가 바뀌었는지 목록으로 보여 주고, 치환 전 원본도 함께 남깁니다.

⚡ MCP 서버도 있습니다. API 키를 발급받아 Claude Desktop 설정에 넣으면, 음성 URL 받아쓰기·작업 조회·사전 항목 추가·잔액 조회 같은 여섯 가지 도구를 대화창에서 바로 부를 수 있습니다.

3. 어떻게 만들었나

웹은 FastAPI와 Jinja2, HTMX로 한 코드베이스에 넣었습니다. 인식은 오픈모델 Whisper를 쓰되, GPU를 직접 두지 않고 서버리스 GPU에 faster-whisper large-v3를 올려 호출하는 어댑터로 만들었습니다. 용어 사전은 결과를 바꾸는 데서 끝나지 않습니다. 사전의 표기를 Whisper의 initial_prompt에 미리 넣어, 인식 단계에서부터 원하는 철자로 기울게 했습니다. 크레딧은 작업 시작 때 잡아 두고(hold), 끝나면 확정(capture), 실패하면 풀어 주는(release) 구조라 1초 단위로 회계가 맞습니다. 올린 음성 원본은 운영 문서 기준 7일 뒤 자동으로 지웁니다. 첫 커밋은 2026년 5월 17일이었습니다.

4. 어떻게 쓰나 (엔진 연결 후 기준)

  1. 가입합니다. 가입 시 600초 분량의 무료 크레딧이 들어옵니다.
  2. STT 대시보드에서 파일을 고르고, 쓸 사전을 선택한 뒤 “업로드 + STT 시작”을 누릅니다.
  3. 작업 목록에서 상태가 바뀌는 것을 보다가, 완료되면 상세 화면에서 결과와 치환 내역을 확인합니다.
  4. 필요하면 SRT나 JSON으로 내려받습니다.
  5. 자동화가 필요하면 API 키를 발급받아 Claude Desktop의 MCP 설정에 넣습니다. 키는 발급 직후 한 번만 보입니다.

5. 한계와 다음 계획

⚠️ 가장 큰 한계부터 적습니다. 스피치페커는 아직 개발 단계이고, 인식 엔진을 연결하기 전입니다. 업로드·판별·작업 관리·사전 치환·다운로드까지는 만들어 두었지만 지금은 모의 엔진이 붙어 있어 텍스트 자리에 “모의 엔진이 생성한 더미 결과”라는 안내 문장이 돌아옵니다. 서버리스 GPU 연결은 코드가 준비돼 있고 아직 켜지 않았습니다. 그래서 가입과 업로드를 잠시 닫아 두었습니다. 엔진을 연결해 다시 열면 서비스 첫 화면에서 알리겠습니다.

그 밖에 영상 파일은 받지 않고, 전화 녹음(8kHz 협대역, 화자 분리)은 이후 버전의 계획입니다. 결제는 토스페이먼츠 테스트 모드이고, 사업자등록 전이라 실제 과금은 없습니다. 다음 순서는 인식 엔진 연결과 결제 정식 전환입니다.

서비스: https://stt.speech.pe.kr/

댓글 달기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

위로 스크롤