Views
No views yet
[1, samples] float32[1, frames, 32] float32model.onnx.data)1import { loadSpeechModel } from '@asrjs/speech-recognition';
2
3const model = await loadSpeechModel('facebook/wav2vec2-base-960h', {
4 source: {
5 kind: 'huggingface',
6 repoId: 'ysdede/wav2vec2-base-960h-onnx',
7 modelFilename: 'model.onnx',
8 modelDataFilename: 'model.onnx.data',
9 tokenizerFilename: 'vocab.json',
10 },
11});
12
13// ASR
14const transcript = await model.transcribe(audio);
15
16// Forced alignment (WhisperX-style)
17const logits = await model.session.executor.extractLogits(audio);
18const aligner = createWav2Vec2AlignerFromLogits(logits);
19const alignment = aligner.align({ transcript: 'your transcript' });model.onnx — ONNX model graph (1.8 MB)model.onnx.data — External weight data (360 MB)config.json — Original HuggingFace model configvocab.json — Character vocabulary with CTC blank token