Views
No views yet
| File | Shape / Description |
|---|---|
encoder.onnx | mel [1,128,3000] → audio_features [1,A,1024] — fixed 30 s window |
decoder_init.onnx | input_ids, position_ids, audio_features → logits, present_keys, present_values — dynamic seq |
decoder_step.onnx | input_embeds, position_ids, past_keys, past_values → logits, present_keys, present_values — dynamic KV cache |
embed_tokens.bin | Raw row-major [V, H] weight (float32 or float16) |
config.json | hidden_size, vocab_size, embed_tokens_shape, embed_tokens_dtype |
tokenizer.json | HuggingFace fast tokenizer |
torch.export) export with truly dynamic sequence and KV-cache
dimensions. KV cache uses stacked layout [L, B, KVH, S, D] (28 decoder layers).9 (prompt prefix length).1# config.yml
2asr:
3 engine_type: qwen_asr
4 qwen_model_path: models/qwen3-asr-0.6b