Views
No views yet
한국어 통화·회의·대화 STT. Apple Silicon 네이티브 MLX 빌드 — Metal GPU 가속, 온디바이스, 무전송. ggml(whisper.cpp, 전 플랫폼) 배포본은 batiai/batisay-ko-turbo. 본 레포 = Mac 네이티브 MLX (q5_0 대비 더 정확·작음·빠름).
| 경로 | 정밀도 | 크기 | 실통화 CER | 권장 |
|---|---|---|---|---|
/ (root) | 4-bit | 463 MB | 15.7% | ⭐ 기본 — 작고 빠르고 q5_0보다 정확 |
fp16/ | fp16 | 1.6 GB | 14.85% | 최고 정확 / 초장문 |
q5_0 (whisper.cpp 배포본) = 실통화 17.1% / 547 MB. → MLX 4-bit가 q5_0보다 정확(15.7<17.1) + 작음(463<547) + 빠름.| 도메인 | CER |
|---|---|
| 일상 대화 | 3.0% |
| 상담 통화 (8kHz, in-domain 벤치) | 5.7% |
| 일반 음성 (깨끗) | 7.0% |
| 일반 음성 (소음) | 8.3% |
| 회의 (다화자) | 8.9% |
⚠️ 5.7%(상담)는 8kHz in-domain 벤치 수치이며, 실사용 장문 통화(~15%)와는 별개입니다. 실통화 수치는 ClovaNote 출력 대비 CER(사람 정답 아님)이라 포맷 간 상대비교 용도입니다(N=5).
pip install mlx-whisper1import mlx_whisper
2# 4-bit (기본, 권장)
3r = mlx_whisper.transcribe(
4 "audio.wav", path_or_hf_repo="batiai/batisay-ko-turbo-mlx", language="ko",
5 condition_on_previous_text=False,
6 temperature=(0.0, 0.2, 0.4, 0.6, 0.8, 1.0),
7 compression_ratio_threshold=2.4, logprob_threshold=-1.0,
8)
9print(r["text"])1hf download batiai/batisay-ko-turbo-mlx --include "fp16/*" --local-dir ./bs-mlx
2# → path_or_hf_repo="./bs-mlx/fp16"권장 디코딩 옵션(환각 억제)은 위 예시 그대로. whisper.cpp/전 플랫폼은 batiai/batisay-ko-turbo 의 ggml q5_0 사용.