Views
No views yet
, 。 ?) which cause unnatural pauses in the generated audio.,在 → 在) → punctuation stripped, token replaced, prosody embedding preserved1git lfs install
2git clone https://huggingface.co/Jaylin0418/TASTE2-8B-ZH-SFT
3cd TASTE2-8B-ZH-SFT1pip install torch torchaudio transformers huggingface_hub modelscope \
2 hyperpyyaml omegaconf einx wetext1python generate_audio.py \
2 --model_dir . \
3 --output_dir ./output \
4 --test_files your_audio.wav \
5 --asr_model_dir MediaTek-Research/Breeze-ASR-25 \
6 --stage sft./output/:*_stage_sft_reconstructed.mp3 — generated spoken response*_results.json — ASR transcription + generated text1python generate_audio.py \
2 --model_dir . \
3 --output_dir ./output \
4 --test_files audio1.wav audio2.wav audio3.wav \
5 --asr_model_dir MediaTek-Research/Breeze-ASR-25 \
6 --stage sft| Input (ASR) | Generated Response |
|---|---|
| 中秋節快到了我想帶家人去參加一些活動請問這附近有哪些燈會和烤肉活動呢 | 我了解你想和家人一起享受月亮和天氣你可以先上網查一下附近的燈會和烤肉活動找到幾個選擇後再跟我說 |
TASTE2-8B-ZH-SFT/
├── generate_audio.py # Inference script (run this)
├── taste_speech/ # Model inference package
├── taste2_stagesft.yaml # Model config
├── slm.pt # Fine-tuned SLM (ep20, ~18GB)
├── llm.pt # Stage 1 LM weights
├── flow.pt # Flow matching vocoder
├── hift.pt # HiFT vocoder
├── campplus.onnx # Speaker encoder
├── speech_tokenizer_v2.onnx # Speech tokenizer
├── CosyVoice-BlankEN/ # Text tokenizer
├── distil-whisper/ # Audio feature extractor
└── qwen2-7b/ # SLM backbone weights