스피치페커 — 휴대폰 녹음을 텍스트로
휴대폰 녹음 파일(m4a·amr·3gp·opus)을 텍스트로 받아쓰고, 용어 사전으로 다듬고, MCP 서버로 자동화하는 스피치페커를 혼자 만든 과정과 아직 인식 엔진을 연결하기 전인 개발 단계의 한계를 있는 그대로 적었습니다.
로컬 LLM 서빙, 모델 활용, AI 도구 실전 기록
휴대폰 녹음 파일(m4a·amr·3gp·opus)을 텍스트로 받아쓰고, 용어 사전으로 다듬고, MCP 서버로 자동화하는 스피치페커를 혼자 만든 과정과 아직 인식 엔진을 연결하기 전인 개발 단계의 한계를 있는 그대로 적었습니다.
AI 영상 만드는 법을 공정 순서대로 정리했습니다. 기획(Genspark), 비주얼(Higgsfield), 목소리(ElevenLabs), 통합(Fingr), 그리고 MCP로 에이전트에 묶기까지 — 각 단계에서 어떤 도구가 어떤 역할을 맡는지 직접 확인한 내용으로 연결합니다.
사내 GPU 서버에 올린 Qwen2.5-7B의 첫 호출이 12.6초. GPU 경합을 의심했지만 실측 사용률은 0%였다. 메모리 대역폭 나눗셈으로 계산해보니 RTX A6000의 이론 한계치 80%. 로컬 LLM 속도가 정상인지 판단하는 법.
젠스파크, 일레븐랩스, 힉스필드, 핑거 4가지 AI 영상 제작 도구를 역할별로 비교했습니다. 최고의 툴을 찾기보다 목적에 맞게 골라 쓰거나 조합하는 법을 정리했습니다.
Higgsfield를 Claude MCP로 연동해 AI 영상 만드는 법과 유튜브에서 소개된 실전 활용 포맷, 최근 투자 유치 현황, 주의할 점까지 균형 있게 정리했습니다.
GLM-5.3, 미스트랄 Ministral, Tencent Hy-MT2, 딥시크 비전 모델까지 – 일주일 전 ‘검증 대기’였던 오픈소스 LLM 4종의 스펙과 가격을 실제 출처 기반으로 정리했습니다.