Views
No views yet
POST / with inputs (base64 audio) and parameters:1{
2 "inputs": "<base64_audio>",
3 "parameters": {
4 "task": "transcribe",
5 "language": "en",
6 "batch_size": 24,
7 "chunk_length_s": 30,
8 "min_speakers": 2,
9 "max_speakers": 12,
10 "return_embeddings": true,
11 "known_speakers": [
12 {"slug": "bob-ryan", "name": "Bob Ryan", "centroid_b64": "..."}
13 ]
14 }
15}1{
2 "text": "full transcript...",
3 "chunks": [...],
4 "speakers": [...],
5 "speaker_embeddings": {
6 "SPEAKER_00": {"embedding_b64": "...", "embedding_dim": 512, "total_seconds": 45.2, "num_segments": 12}
7 },
8 "speaker_matches": {
9 "SPEAKER_00": {"matched_slug": "bob-ryan", "matched_name": "Bob Ryan", "confidence": "HIGH", "score": 0.72}
10 }
11}ASR_MODEL=openai/whisper-large-v3DIARIZATION_MODEL=pyannote/speaker-diarization-3.1HF_TOKEN=<your_token>ASSISTANT_MODEL=distil-whisper/distil-large-v3 (optional, for speculative decoding)