Views
No views yet
/v1/audio/transcriptionsDTYPE, VLLM_KV_CACHE_DTYPE, TIMESTAMPS, LANGUAGE_FORCE, MAX_AUDIO_SECONDS и т. д.| Маршрут | Описание |
|---|---|
/v1/audio/transcriptions | Транскрибация аудио (OpenAI‑совместимый) |
/docs | Swagger UI |
1curl -s -X POST "http://localhost:8080/v1/audio/transcriptions" \
2 -H "Authorization: Bearer dummy" \
3 -H "Content-Type: multipart/form-data" \
4 -F "file=@</path/to/audio.wav>" \
5 -F "model=whisper" \
6 -F "response_format=text"1curl -s -X POST "http://localhost:8080/v1/audio/transcriptions" \
2 -H "Authorization: Bearer dummy" \
3 -H "Content-Type: multipart/form-data" \
4 -F "file=@</path/to/audio.wav>" \
5 -F "model=whisper" \
6 -F "response_format=json"1curl -s -X POST "http://localhost:8080/v1/audio/transcriptions" \
2 -H "Authorization: Bearer dummy" \
3 -H "Content-Type: multipart/form-data" \
4 -F "file=@</path/to/audio.wav>" \
5 -F "model=whisper" \
6 -F "response_format=verbose_json"half), KV cache fp16, backend внимания XFormersfp16/fp8MODEL_ID (обязательно на Hugging Face Inference Endpoints)DTYPE/VLLM_DTYPE: half|float16|fp16 → half, bfloat16|bf16 → bfloat16. Если не указано, авто-детект по CCVLLM_KV_CACHE_DTYPE: fp8|fp16|fp32 (по умолчанию fp16)VLLM_ATTENTION_BACKEND=XFORMERSVLLM_USE_FLASHINFER=0WHISPER_SAMPLING_RATE=16000WHISPER_SEGMENT_DURATION_SEC=30MAX_AUDIO_SECONDS (0 — без ограничения)LANGUAGE_FORCE (например, fa)TIMESTAMPS: auto|none|segmentsghcr.io/temasm/hfie-asr-multilingual-whisper80MODEL_ID = MohammadGholizadeh/whisper-large-v3-persian-common-voice-17
VLLM_ATTENTION_BACKEND = XFORMERS
VLLM_USE_FLASHINFER = 0
DTYPE = half
VLLM_KV_CACHE_DTYPE = fp161docker build \
2 --build-arg SDK_REGISTRY=huggingface \
3 --build-arg SDK_IMAGE=hfendpoints-sdk \
4 --build-arg SDK_VERSION=v0.2.0-patched \
5 -t temasm/hfie-asr-multilingual-whisper:dev .
6docker push temasm/hfie-asr-multilingual-whisper:devIMAGE=ghcr.io/temasm/hfie-asr-multilingual-whisper):1make build
2make pushrunpod/README.md и runpod/Dockerfile.AsyncLLMEngine) с задачей task="transcription". Параметры через AsyncEngineArgs, auto‑dtype и настраиваемый kv_cache_dtype.WhisperHandler в handler.py реализует OpenAI‑совместимый маршрут /v1/audio/transcriptions.librosa.load(..., sr=16000, mono=True), разбиение на фрагменты по WHISPER_SEGMENT_DURATION_SEC секунд, параллельная генерация.multi_modal_data энкодера; декодер получает язык и маркер таймштампа согласно TIMESTAMPS и LANGUAGE_FORCE.<|0.00|>; режимы auto|none|segments управляют <|notimestamps|>/<|0.00|>.DTYPE/VLLM_DTYPE (half|bfloat16), VLLM_KV_CACHE_DTYPE (fp8|fp16|fp32)bfloat16, иначе half)VLLM_ATTENTION_BACKEND=XFORMERS, VLLM_USE_FLASHINFER=0 (особенно для T4)MAX_AUDIO_SECONDS отсекает слишком длинный вход__init__ WhisperHandler, задавайте безопасные значения по умолчаниюlibrosa.load и chunk_audio_with_durationts_token и выбор lang_tagDTYPE=half и VLLM_KV_CACHE_DTYPE=fp16