Views
No views yet
hidden_states: 384-d acoustic hidden features.ctc_log_probs: 259-way context-phone CTC log probabilities.fused_topology_log_probs: 82-way subphonetic topology log probabilities.phone_log_probs: 41-way phone log probabilities collapsed from the fused topology head.1import torch
2from modeling_ifmdd_acoustic_frontend import IFMDDAcousticFrontend
3
4model = IFMDDAcousticFrontend.from_pretrained(".", variant="20ms")
5wavs = torch.randn(1, 16000) # 16 kHz mono waveform
6out = model.extract(wavs)
7
8print(out["hidden_states"].shape)
9print(out["phone_log_probs"].shape)exp_librispeech100_topology_full_ft_ottc_triphone_pruned_budget256_film_fusedphone_ce_epoch2_step100_keepall_b32_fix1/s2_t1/wavlm_large_None_PhnMonoSSL_ContextFiLMTopology_ctc_alignment_ce/save/CKPT+globalstep000002400_epoch003_topology_PER_8.2609_MDDF1_0.0000_TSE_45.9ms_MAE_22.9ms_ACC20_0.359.ckpteval/best10ms_vs_20ms.csv:phone_tse_ms=40.8143phone_acc_20=40.8857boundary_20_r_value_pct=76.4590