CAM++ is a speaker embedding model used for speaker verification (is this the same person?) and speaker diarization (who spoke when?).
1from funasr import AutoModel
2
3# Speaker diarization as part of ASR pipeline
4model = AutoModel(
5 model="funasr/paraformer-zh",
6 hub="hf",
7 vad_model="funasr/fsmn-vad",
8 punc_model="funasr/ct-punc",
9 spk_model="funasr/campplus",
10 device="cuda",
11)
12result = model.generate(input="meeting.wav")
13# Each sentence has a speaker label
14for sentence in result[0]["sentence_info"]:
15 print(f"[Speaker {sentence['spk']}] {sentence['text']}")