로컬에서 도는 한국어 통화·회의 STT. 오디오는 기기 밖으로 나가지 않고, 분당 과금도 없습니다. 212초 통화를 Mac Studio에서 ~5초에 전사 (41× 실시간, whisper.cpp Metal 실측 · 2026-07-31 팀 스모크). ✅ 추천 기본 모델: 이 모델의q5_0— 통화·회의·대화·강의 전 도메인.
1hf download batiai/batisay-ko-turbo ggml-batisay-ko-turbo-q5_0.bin --local-dir .
2whisper-cli -m ggml-batisay-ko-turbo-q5_0.bin -l ko -f audio.wav \
3 --suppress-nst --max-context 0 --output-txtAutoProcessor 는 2026-08-01 호환 핫픽스 반영됨(4.57+).🍎 Mac 사용자: 더 빠른 MLX 버전 있음 →batiai/batisay-ko-turbo-mlx🔓 완전 무료(Apache 2.0) 가 필요하면 →batiai/batisay-ko-base(일반 음성 중심)
| 도메인 | turbo | base | large | 측정셋 |
|---|---|---|---|---|
| 일상 대화 | 3.00% | — | — | 자연 대화 |
| 상담 통화 (8kHz, in-domain) | 5.67% | — | 10.00% | 콜센터 벤치셋 |
| 일반 음성 (깨끗) | 6.99% | 7.77% | 7.41% | KsponSpeech eval_clean |
| 일반 음성 (소음) | 8.33% | 12.28% | 8.49% | KsponSpeech eval_other |
| 회의 (다화자, 16kHz) | 8.90% | — | 9.87% | 다화자 회의 |
측정: GPU(transformers), 도메인당 500발화. 상담 5.67%는 콜센터 in-domain 벤치로, 아래 실사용 장문 통화와는 별개입니다.
| 모델 | 실통화 CER |
|---|---|
| batisay-ko-turbo (MLX) | 14.85% |
| batisay-ko-turbo (ggml q5_0, 배포본) | 17.1% |
| batisay-ko-base | 19.11% |
실제 사용자 통화 5건(2·4·8·12·51분, 약 27,000자 — 그중 51분 1건이 약 72%)의 소표본 측정. 참조 전사가 사람 정답이 아닌 자동 전사 기준이라 절대치보다 버전/포맷 간 상대비교 지표입니다(정식 정답셋 확대 예정). 51분 초장문: base 31.1% / 이전 버전 30.3% → 현재 19.4%.
| 포맷 | 크기 | rtf | 7.8분 통화 | 51분 통화 |
|---|---|---|---|---|
| MLX fp16 | 1.6 GB | 0.017 (~58×) | 8.2초 | 0.9분 |
| ggml q5_0 ⭐ | 548 MB | 0.026 (~38×) | 12.2초 | 1.3분 |
| ggml q4_0 | 453 MB | 0.028 | 13.3초 | 1.4분 |
| ggml q8_0 | 834 MB | 0.036 | 16.7초 | 1.8분 |
rtf = 처리시간 / 오디오길이(작을수록 빠름). q5_0 이 속도·품질·크기 밸런스로 배포 기본값, MLX fp16 이 최고 속도·정확도.
1hf download batiai/batisay-ko-turbo ggml-batisay-ko-turbo-q5_0.bin --local-dir .
2
3# 권장 (전 도메인 기본값)
4./whisper-cli -m ggml-batisay-ko-turbo-q5_0.bin -l ko -f audio.wav \
5 --suppress-nst --max-context 0 --output-txt--suppress-nst --max-context 0은 장문 전사 시 침묵/전환 구간의 반복 환각·디코더 붕괴를 방지합니다 (60분+ 어닝콜에서 재무 수치 recall ~83% 확보). 표준 단문에서 무회귀 검증 → 전 도메인 기본 권장. 실시간 streaming 은whisper.cpp/examples/stream사용.
1import mlx_whisper
2r = mlx_whisper.transcribe("audio.wav", path_or_hf_repo="batiai/batisay-ko-turbo-mlx",
3 language="ko", condition_on_previous_text=False)자세한 옵션·fp16 변형은 MLX 카드 참조.
batisay-ko-base 위에 통화 데이터 다양화 + 상담 과적합 제거로 실사용 장문 통화 정확도를 회복. 멀티도메인은 v1.0 동급 유지.| batisay-ko-base | batisay-ko-turbo (본 모델) | |
|---|---|---|
| 라이선스 | Apache 2.0 (완전 무료, 외부 SaaS OK) | Community v2 (공개·무게이트, 상업 협의) |
| 학습 도메인 | 일반 (KsponSpeech) | 일반 + 회의 + 통화 + 대화 |
| 실사용 통화 | 19.11% | 14.85% |
| 추천 | 무료·외부 SaaS 임베드 | 통화·회의·대화 정확도 우선 (BatiFlow 표준) |
| 포맷 | 크기 | 권장 RAM |
|---|---|---|
| q5_0 ⭐ | 548 MB | 2 GB+ |
| q4_0 (lite) | 453 MB | 1 GB+ |
| q8_0 | 834 MB | 2 GB+ |
| f32 | 1.6 GB | 4 GB+ |