Views
No views yet
| File | Size | Description |
|---|---|---|
encoder_fp16.onnx | 104 MB | Encodes 10s stereo audio (44.1kHz) to latent [1, 256, 108] |
decoder_fp16.onnx | 105 MB | Decodes latent [1, 256, 108] to stereo audio |
1import * as ort from "onnxruntime-web";
2
3const encoder = await ort.InferenceSession.create("encoder_fp16.onnx");
4const decoder = await ort.InferenceSession.create("decoder_fp16.onnx");
5
6// Encode audio to latent
7const input = new ort.Tensor("float32", audioData, [1, 2, 441000]);
8const { latent } = await encoder.run({ audio: input });
9
10// Decode latent to audio
11const { audio } = await decoder.run({ latent });torch.onnx.export (opset 18)onnxconverter-common[1, 2, 441000] float32 — 10 seconds stereo at 44.1kHz[1, 256, 108] float32 — 256-dim latent, 108 temporal frames[1, 256, 108] float32[1, 2, 442368] float32 — stereo audio