Views
No views yet

GLM-ASR-Nano-2512 can be easily integrated using the transformers library.transformers 5.x as well as inference frameworks such as vLLM and SGLang.
you can check more code in Github.transformers from source:pip install git+https://github.com/huggingface/transformers1from transformers import AutoModelForSeq2SeqLM, AutoProcessor
2
3processor = AutoProcessor.from_pretrained("zai-org/GLM-ASR-Nano-2512")
4model = AutoModelForSeq2SeqLM.from_pretrained("zai-org/GLM-ASR-Nano-2512", dtype="auto", device_map="auto")
5
6inputs = processor.apply_transcription_request("https://huggingface.co/datasets/hf-internal-testing/dummy-audio-samples/resolve/main/bcn_weather.mp3")
7
8inputs = inputs.to(model.device, dtype=model.dtype)
9outputs = model.generate(**inputs, do_sample=False, max_new_tokens=500)
10
11decoded_outputs = processor.batch_decode(outputs[:, inputs.input_ids.shape[1] :], skip_special_tokens=True)
12print(decoded_outputs)1from transformers import GlmAsrForConditionalGeneration, AutoProcessor
2from datasets import load_dataset
3from datasets import Audio
4
5processor = AutoProcessor.from_pretrained("zai-org/GLM-ASR-Nano-2512")
6model = GlmAsrForConditionalGeneration.from_pretrained("zai-org/GLM-ASR-Nano-2512", dtype="auto", device_map="auto")
7
8# loading audio directly from dataset
9ds = load_dataset("hf-internal-testing/librispeech_asr_dummy", "clean", split="validation")
10ds = ds.cast_column("audio", Audio(sampling_rate=processor.feature_extractor.sampling_rate))
11audio_array = ds[0]["audio"]["array"]
12
13inputs = processor.apply_transcription_request(audio_array)
14
15inputs = inputs.to(model.device, dtype=model.dtype)
16outputs = model.generate(**inputs, do_sample=False, max_new_tokens=500)
17
18decoded_outputs = processor.batch_decode(outputs[:, inputs.input_ids.shape[1] :], skip_special_tokens=True)
19print(decoded_outputs)1from transformers import GlmAsrForConditionalGeneration, AutoProcessor
2
3processor = AutoProcessor.from_pretrained("zai-org/GLM-ASR-Nano-2512")
4model = GlmAsrForConditionalGeneration.from_pretrained("zai-org/GLM-ASR-Nano-2512", dtype="auto", device_map="auto")
5
6inputs = processor.apply_transcription_request([
7 "https://huggingface.co/datasets/hf-internal-testing/dummy-audio-samples/resolve/main/bcn_weather.mp3",
8 "https://huggingface.co/datasets/hf-internal-testing/dummy-audio-samples/resolve/main/obama.mp3",
9])
10
11inputs = inputs.to(model.device, dtype=model.dtype)
12outputs = model.generate(**inputs, do_sample=False, max_new_tokens=500)
13
14decoded_outputs = processor.batch_decode(outputs[:, inputs.input_ids.shape[1] :], skip_special_tokens=True)
15print(decoded_outputs)