이 블로그는 삽질과 해결의 기록이지만, 그 과정에서 도구도 몇 개 만들어 두었습니다. 그중 중심은 음성입니다. 소개 문구에 적은 「멀티모달(텍스트, 음성·이미지·영상) 엔진과 알고리즘」 가운데 음성 쪽을 직접 만들어 보고 있고, 그 결과물이 아래 첫 두 서비스입니다. 만드는 과정은 각 소개 글에 그대로 남깁니다.
음성을 다루는 서비스
- 스피치페커 — 휴대폰 녹음을 텍스트로 (stt.speech.pe.kr, 개발 단계) — 오픈모델 Whisper 계열을 기반으로 만들고 있는 한국어 받아쓰기(STT) 서비스입니다. m4a·amr·3gp·opus 같은 휴대폰 녹음 파일을 올리면 텍스트로 받아쓰고 SRT·JSON으로 내려받도록 설계했습니다. 잘못 인식되는 단어를 바로잡는 사용자 용어 사전과, Claude Desktop 등에서 직접 부르는 MCP 서버가 붙어 있습니다. 지금은 인식 엔진을 연결하기 전이라 가입과 업로드를 잠시 닫아 두었습니다. 자세한 이야기는 스피치페커 소개 글에 있습니다.
- 목소리 분석 (moksori.speech.pe.kr) — 녹음을 서버로 보내지 않고 브라우저 안에서만 목소리를 분석합니다. 목소리 관상·사투리 잔재율·닮은 캐릭터·따라 말하기 네 가지 테스트가 있습니다. 같은 화면 안에 「일어나」 같은 호출어를 브라우저에서 상시 감지하는 웨이크워드 기능도 만들고 있는데, 신경망(TDNN)을 합성 데이터로 학습해 동작은 하지만 실사용 인식률이 낮아 실제 녹음 학습 데이터를 모으는 단계에서 멈춰 있습니다. 만든 과정은 목소리 분석 제작기에 있습니다.
웹사이트 점검
- SEO 진단 — 주소 하나를 넣으면 메타태그·색인·소셜 공유·구조화 데이터·인증서까지 21개 항목을 점검합니다. 실패 항목은 직접 고칠 수 있는 것과 기술 지원이 필요한 것으로 나누고, 앞의 것은 고치는 방법을 무료로 적어 줍니다. 만든 과정과 한계는 SEO 진단 소개 글에 있습니다.