Learn.ai.kr
← AI 노트

음성 인식 모델 Whistle, 한국어 미지원과 소형 모델 고르는 법

Cactus가 10월 2일 공개한 16.9MB 음성 인식 모델 Whistle은 한국어를 지원하지 않습니다. 지원 언어, 녹음 길이, 비교 수치의 측정 조건을 점검표로 정리했습니다.

최재현 · 2026.10.06

Cactus Compute는 2026년 10월 2일 공식 블로그에서 음성 인식 모델 Whistle을 공개했습니다. 16.9MB 파일 하나로, GPU 없이 CPU에서 실행되는 모델입니다. 먼저 밝혀 둘 점이 있습니다. Whistle이 지원하는 언어는 영어, 독일어, 프랑스어, 스페인어, 이탈리아어, 네덜란드어, 폴란드어 7개이고 한국어는 없습니다. 강의나 회의 녹음을 외부로 보내지 않고 노트북에서 받아쓰려던 담당자라면 지금 한국어 녹음에는 쓸 수 없다는 뜻이죠. 그래도 이 발표는 살펴볼 만합니다. 소형 음성 인식 모델을 고를 때 무엇을 확인해야 하는지가 발표문 안에 드러나 있기 때문입니다.

1. 16.9MB 파일 하나로 CPU에서 받아쓰기

Cactus 블로그는 Whistle을 휴대폰, 웨어러블, 로봇, 스마트홈, 자동차, 마이크로컨트롤러를 위한 음성 인식 모델이라고 소개했습니다. 다른 프로그램에 의존하지 않고 CPU에서 실행되며, 같은 회사의 Needle 모델과 같은 C++ 엔진에서 불러옵니다. 단어별 타임스탬프와 키워드 가중, 음성 임베딩을 제공하고, Needle과 묶어 말을 곧바로 도구 호출(JSON 형식의 명령)로 바꾸는 예시도 함께 실었습니다.

제공 상태도 확인해 두겠습니다. Hugging Face 모델 카드와 엔진 저장소 모두 Apache-2.0 라이선스로 표시돼 있습니다. 블로그에는 pip install cactus-needle로 설치하는 예시와 브라우저 체험 화면이 있고, 베타 표기는 없습니다. 엔진은 macOS, Linux, Android, iOS, watchOS, Windows on ARM, RISC-V, MIPS, 브라우저, WASI 등 17개 대상용으로 미리 빌드돼 있다고 합니다. 블로그가 예로 든 목록에서 Windows는 Windows on ARM만 보이므로, 사내 노트북이 일반 Windows PC라면 지원 여부를 따로 확인해야 합니다.

2. 한국어와 녹음 길이에서 먼저 걸립니다

블로그가 밝힌 입력 조건은 16kHz 모노 오디오, 한 번에 최대 30초입니다. 다른 샘플링 속도나 마이크 입력을 쓰려면 [mic] 옵션을 추가로 설치해야 한다고 적혀 있습니다. 엔진 저장소 README에는 마이크가 켜져 있는 동안 이어서 받아쓰는 needle.stream 기능이 적혀 있습니다. 하지만 1시간짜리 강의 녹음 파일을 넣는 방법과 그때의 정확도는 블로그와 README 어디에서도 확인하지 못했습니다. 한국어를 추가할 계획도 발표에 적혀 있지 않습니다.

그러니 "작고 빠르다"는 소개만 보고 회의록 도구 후보에 올리지 마세요. 언어와 녹음 길이를 모델 크기보다 먼저 확인해야 합니다.

3. 비교 수치는 누가 어떤 조건에서 쟀는지 보세요

Cactus 블로그에는 Whistle을 Whisper, Moonshine과 비교한 단어 오류율(WER, 받아쓰기에서 틀린 단어의 비율) 표가 있습니다. 모델 카드에 따르면 Whistle의 수치는 회사가 86,174개 발화로 직접 잰 값입니다. 반면 Whisper와 Moonshine의 수치는 각 모델 저자가 논문에 공개한 값이고, Whisper는 영어 전용판(base.en)이 아닌 다국어 체크포인트의 수치입니다. 서로 다른 곳에서 잰 숫자를 한 표에 놓은 셈이죠.

회사도 한계를 적어 두었습니다. 블로그는 Whisper base가 TED-LIUM, AMI, MLS 평균에서 앞선다고 밝혔고, Whisper base의 크기는 145.3MB로 Whistle(16.9MB)의 8배가 넘습니다. 속도 비교도 조건을 함께 봐야 합니다. 측정은 Apple M4 Pro CPU에서 10초 분량 오디오로, 각 모델의 공식 런타임 기본값(Whistle은 beam 5)으로 했습니다. 정밀도는 Whistle이 2비트에서 4비트, Whisper가 CPU 메모리 안의 fp32, Moonshine이 int8로 서로 다릅니다. 독립 기관이 같은 조건으로 다시 잰 결과는 찾지 못했습니다.

Whistle과 Whisper base의 크기, 오류율·속도 수치의 측정 주체와 조건, 입력 조건을 비교한 도식

크기, 측정 주체, 측정 조건, 지원 언어와 입력 길이는 Cactus 블로그와 모델 카드에 적힌 내용입니다. 막대 비교와 "직접 확인해야 함" 문장은 작성자가 구성한 것입니다.

4. 같은 주에 나온 Phonon-2도 영어 전용입니다

Fermion Research는 2026년 9월 29일 영어 음성 인식 모델 Phonon-2를 공개했습니다. NVIDIA Parakeet TDT 0.6B v3에서 파생한 가중치이고, 라이선스는 CC-BY-4.0입니다. 회사는 Open ASR Leaderboard의 영어 세트 7개에서 평균 단어 오류율 5.21%를 냈다고 밝혔는데, 비교 표에는 리더보드 공개값과 회사가 리더보드 코드로 직접 채점한 값이 섞여 있습니다.

이 사례를 함께 든 이유는 패턴이 같기 때문입니다. 일주일 사이에 나온 소형 음성 인식 모델 2개가 모두 한국어를 지원하지 않고, 둘 다 자체 측정값과 다른 곳의 공개값을 한 표에 놓았습니다. 비슷한 발표를 볼 때마다 같은 질문으로 확인하면 됩니다.

5. 소형 음성 인식 모델 점검표

아래 표의 오른쪽 칸은 독자가 채울 곳입니다. 다른 모델이 나와도 같은 줄을 그대로 쓸 수 있습니다.

확인할 조건 Whistle (10월 2일 발표) Phonon-2 (9월 29일 발표) 우리 조직에서 확인할 것
지원 언어 7개 언어, 한국어 없음 영어 한국어 녹음을 지원하는지
녹음 길이 16kHz 모노, 한 번에 최대 30초 (README에 마이크 실시간 받아쓰기 기능 표기) 1시간 분량을 MacBook Air에서 약 20초에 받아쓴다고 회사가 밝힘 1시간 녹음 파일을 어떻게 처리하는지
비교 수치의 측정 주체 Whistle은 자체 측정, 비교 모델은 저자 공개값 리더보드 공개값과 자체 채점이 섞임 같은 조건으로 다시 잰 결과가 있는지
측정 조건 M4 Pro CPU, 10초 오디오, 정밀도 서로 다름 회사 자체 속도 측정 우리 노트북 사양과 비슷한지
실행 환경 CPU, 17개 대상 사전 빌드 Mac(MLX GPU), Linux·Windows CPU, NVIDIA GPU, Docker 사내 PC 운영체제가 목록에 있는지
라이선스 Apache-2.0 CC-BY-4.0 사내 배포와 수정 범위

오른쪽 칸을 채울 수 없는 모델은 도입 후보에서 빼 두세요. 특히 언어와 녹음 길이 줄이 비어 있으면 성능 숫자가 아무리 좋아도 회의록 업무에는 쓸 수 없습니다.

6. 이번 주에 해 볼 첫 단계

받아쓰기가 필요한 녹음 1건을 골라 위 표의 오른쪽 칸을 채워 보세요. 녹음 언어, 길이, 녹음을 처리할 PC의 운영체제, 외부 전송을 막아야 하는 이유까지 적으면 됩니다. 영어로 받아쓸 일이 있다면 Cactus 블로그의 브라우저 체험 화면에서 30초 이하로 말해 보며 결과를 볼 수 있습니다. 체험 화면에는 처음 누를 때 16.9MB 모델을 내려받고 음성은 기기 밖으로 나가지 않는다고 적혀 있습니다. 회사의 설명이고 이 글에서 직접 확인하지는 않았으니, 처음에는 공개해도 되는 내용으로 말해 보세요. 한국어 녹음은 이 표를 들고 한국어를 지원하는 소형 모델이 나왔을 때 같은 줄 순서대로 비교하면 됩니다.

참고한 자료